벤치마크 점수 대신 자연어 기준으로, 국내 통신사 A사 × AIWORKX

AIWORKX  |  고객 사례  |  AI 서비스 Compliance 검증

고객사 국내 대형 통신사 S사
산업 통신, AI 서비스
도입 솔루션 AIWORKX AgentRigor™ (Powered by AxDC™)
프로젝트 기간 2025년 2분기 ~ 4분기
17개 이상 Compliance 평가 자동화 항목
3개 팀 기획, 법무, 서비스가 함께 정의한 기준
내부 표준 자연어 기준 평가 프로세스 정착

벤치마크 점수는 있었습니다. 하지만 그 점수가 왜 나왔는지, 우리 서비스의 요구사항과 무슨 관계가 있는지는 설명할 수 없었습니다. 숫자는 있는데 납득이 없었습니다.

국내 대형 통신사 s사는 금융과 생활 영역의 생활밀착형 AI 서비스를 운영하면서, 그 Compliance 수준을 검증하기 위해 여러 외부 벤치마크를 활용해 왔습니다. 2025년 2분기부터 4분기까지 AIWORKX와 함께, 외부 점수를 가져오는 방식에서 조직 내부가 합의한 자연어 기준이 평가의 근거가 되는 구조로 전환했습니다. 도입 솔루션은 AIWORKX AgentRigor™(Powered by AxDC™)입니다.

그 결과 Compliance 평가 항목 17개 이상이 자동화됐고, 자연어 기준 기반 평가 프로세스가 내부 표준으로 자리 잡았습니다.

이 글에서 다루는 내용:

  • 외부 벤치마크 점수가 내부 기준과 이어지지 않아 생긴 세 가지 문제
  • 항목별 자연어 기준 정의, 채점 기준표, 평가 자동화라는 세 단계 접근
  • 자동화 항목 17개 이상 확대와 내부 표준 정착이라는 결과

CHALLENGE벤치마크 점수가 내부 기준과 이어지지 않았다

A사는 벤치마크에서 나온 점수가 내부 요구사항과 얼마나 연관되는지, 어떤 근거로 산출되는지를 이해관계자에게 명확히 설명하기 어려웠습니다. 문제는 세 갈래였습니다.

외부 벤치마크와 내부 기준의 불일치

서비스 특성과 무관하게 범용 벤치마크를 적용하다 보니, 평가 결과가 실제 서비스 품질을 반영하지 못하는 경우가 빈번했습니다. 기획, 법무, 서비스 팀의 요구사항이 평가 설계에 반영되지 않아 결과 해석에 갈등이 생겼습니다.

근거 없는 점수, 합의 없는 평가

평가 항목별로 어떤 데이터와 기준으로 점수가 산출되는지를 설명할 수 없어, 관계자들이 결과를 신뢰하지 못했습니다. 평가 결과를 바탕으로 개선 방향을 결정하는 과정에서 이견이 반복됐습니다.

조직 안에서 합의를 이끌어낼 기준의 부재

평가 기준 자체가 외부에 있다 보니 내부 구성원이 이를 자기 기준으로 받아들이기 어려웠습니다. 개발팀과 사업팀 사이에 품질에 대한 공통 언어가 없었습니다.

SOLUTION자연어 기준 정의로 내부 구성원이 납득하는 평가 체계 구축

AIWORKX는 Compliance 항목별로 자연어 형식의 기준을 정의하고, 그 기준을 실제 평가에 직접 적용하는 방식을 설계했습니다. 벤치마크 점수를 외부에서 가져오는 것이 아니라, 조직 내부에서 합의한 기준이 평가 결과의 근거가 되도록 구조를 바꾼 것입니다.

Compliance 항목별 자연어 기준 정의

평가 항목마다 ‘어떤 응답이 적합한가’를 자연어로 명시했습니다. 기획, 법무, 서비스 팀이 기준 정의 과정에 참여해 내부 요구사항이 평가 설계에 직접 반영됐습니다. 평가 결과와 내부 기준 사이의 연결고리가 명확해졌습니다.

채점 기준표를 통한 투명한 점수 설명

각 점수 범위를 설명하는 채점 기준표를 도입해, 특정 응답이 왜 해당 점수를 받았는지 항목별로 설명할 수 있게 됐습니다. 평가 결과를 두고 벌어지던 내부 이견이 줄고, 개선 방향에 대한 합의가 더 빠르게 도출됐습니다.

평가 자동화 항목 확장

기존에 수동으로 처리하던 Compliance 평가 항목을 자동화 체계로 전환했습니다. 17개 이상의 항목이 자동화되어 반복 평가 비용이 낮아졌습니다.

RESULTS결과

  • 평가 자동화 항목 17개 이상으로 확대, 수동 평가 비중 감소
  • 자연어 기준 기반 Compliance 평가 프로세스가 내부 표준으로 정착
  • 채점 기준표 도입으로 점수 산출 근거를 항목별로 설명 가능
  • 기획, 법무, 서비스 팀 사이에 품질 공통 언어 확보
  • 평가 결과 기반 서비스 개선 사이클 단축

“기존 벤치마크 방식은 수치를 주지만 납득을 주지 않았습니다. AIWORKX와 함께 자연어 기준을 직접 정의하고 나서야, 평가 결과를 두고 벌어지던 내부 이견이 줄기 시작했습니다. 숫자보다 기준이 먼저라는 것을 배웠습니다.”

AI 서비스 품질 관리 담당자 | 국내 통신사 A사

INSIGHT왜 벤치마크 점수보다 기준이 먼저인가

범용 벤치마크는 서비스가 놓인 맥락을 모릅니다. 같은 응답이라도 금융 상담 서비스와 생활 콘텐츠 서비스에서 요구되는 적합성은 다르고, 그 차이를 결정하는 것은 외부 척도가 아니라 서비스를 운영하는 조직의 요구사항입니다. 기준을 조직 내부에서 자연어로 먼저 합의하면, 점수는 그 기준을 얼마나 충족했는지 보여주는 결과가 됩니다. 순서가 바뀌면 점수는 남고 납득은 사라집니다.

AI 서비스의 Compliance 검증 기준을 직접 설계하고 싶다면, 우선 현재 평가 체계가 내부 기준과 얼마나 이어져 있는지부터 확인해 보세요.

무료 상담 신청하기

AIWORKX(에이아이웍스)는 AI 시대의 품질 인프라 기업입니다. AI 에이전트와 데이터, 소프트웨어의 신뢰성을 제3자 관점에서 검증합니다.