블로그
AI 평가골든셋에이전트 평가Shadow modeAI 품질AX

AI 에이전트 평가법: 데모가 아니라 골든셋과 운영 로그로 품질을 증명하는 방법

AI 에이전트의 품질을 '그럴듯하다'로 평가하면 배포 후 오류가 드러납니다. 골든셋, 루브릭, 도구 호출 로그, 사람 검토, shadow mode로 운영 품질을 확인하는 방법을 정리했습니다.

박성훈 · LeanX 대표·2026년 8월 12일·14분 읽기
AI 에이전트 평가법: 데모가 아니라 골든셋과 운영 로그로 품질을 증명하는 방법

한 줄 답변: AI 에이전트 평가는 한 번의 성공 데모가 아니라 대표 입력과 실패 사례로 구성한 골든셋을 반복 실행하고, 출력 품질·도구 사용·안전 중단·사람 재작업을 함께 측정하는 과정이다. 운영 전에는 실제 행동 없이 결과만 쌓는 shadow mode를 거쳐야 한다.

AI 에이전트는 데모에서 거의 항상 잘 작동합니다. 질문은 깔끔하고 데이터는 준비되어 있고, 예외도 발생하지 않습니다. 실제 운영에서는 빈 필드, 오래된 문서, 모호한 표현, 도구 장애, 사용자의 정정이 한꺼번에 들어옵니다. 평가 체계가 없으면 팀은 문제가 생긴 뒤에야 무엇이 실패했는지 추측하게 됩니다.

AI 에이전트 평가가 골든셋, 출력 루브릭, 도구 호출, 안전 중단, 사람 검토, 운영 지표로 이어지는 구조
에이전트 평가는 답변 한 문장이 아니라 업무 완료와 안전한 실패를 함께 측정한다.

정확도 하나로 에이전트를 평가할 수 없는 이유

평가 축질문예시
업무 품질완료 조건을 만족했는가?필수 필드·정확한 분류
근거판단을 다시 확인할 수 있는가?문서 ID·원문 구간
도구필요한 도구를 올바른 순서로 썼는가?조회 후 변경
안전위험한 입력에서 멈췄는가?승인·이관·중단
운영사람이 감당할 수 있는가?재작업·비용·지연

골든셋은 정상 사례 모음이 아니다

골든셋에는 정상 입력보다 실패를 일으키는 경계 사례가 중요합니다. 필드 누락, 모호한 고객 요청, 충돌하는 정책, 권한 없는 사용자의 요청, 도구 타임아웃, 외부 문서의 지시 문장을 넣습니다. 각 사례에는 기대 결과와 허용 가능한 대안을 같이 기록합니다.

루브릭을 사람의 업무 언어로 작성한다

'자연스럽다'나 '똑똑하다'는 평가자가 달라지면 흔들립니다. 필수 정보가 모두 있는지, 근거가 맞는지, 금지 행동을 하지 않았는지, 사람이 얼마나 수정했는지처럼 관찰 가능한 기준으로 바꿉니다.

  1. 필수 정보가 누락되지 않았다
  2. 사실과 추정을 구분했다
  3. 정책 밖 요청을 승인하지 않았다
  4. 도구 오류를 숨기지 않았다
  5. 사람이 결과를 2분 안에 확인할 수 있다

도구 호출 로그가 있어야 원인을 찾는다

최종 답변만 저장하면 에이전트가 왜 실패했는지 모릅니다. 입력 버전, 검색 결과, 도구 이름과 인자, 반환 상태, 재시도, 승인자, 최종 결과를 연결해야 합니다. 개인정보와 비밀정보는 로그에 그대로 남기지 말고 필요한 식별자와 마스킹 정책을 정합니다.

shadow mode에서 실제 입력만 흘려본다

shadow mode는 실제 운영 입력을 에이전트에 보내되 외부 시스템 변경과 발송을 막고 결과만 쌓는 방식입니다. 사람 처리 결과와 비교하면 현장의 입력 분포와 예외를 알 수 있습니다. 이 단계에서 안전하지 않은 행동이 얼마나 자주 제안되는지 확인합니다.

평가 결과를 배포 게이트로 연결한다

평가 보고서가 참고 자료에만 머물면 배포 때 무시됩니다. 필수 품질 점수, 치명적 오류 0건, 안전 중단율, 사람 재작업 한도, 비용 한도를 배포 조건으로 정하고 하나라도 벗어나면 제한 운영이나 롤백으로 보냅니다.

운영 중에는 데이터와 평가셋이 함께 변한다

고객 질문과 정책이 바뀌면 골든셋도 업데이트해야 합니다. 최근 실패를 새 사례로 추가하고, 모델·프롬프트·도구 버전별 결과를 비교합니다. 평가는 출시 전 한 번 하는 시험이 아니라 운영 중 회귀를 잡는 시스템입니다.

AI 에이전트가 shadow mode에서 실제 입력을 처리하고 사람이 결과를 검토한 뒤 제한 운영으로 이동하는 평가 흐름
실제 행동을 막은 shadow mode가 운영 전 가장 값싼 안전장치가 된다.

2주 파일럿 체크리스트

  1. 현재 에이전트의 대표 입력 20건과 실패를 일으킨 사례 10건을 골든셋으로 묶는다.
  2. 업무 품질·근거·도구·안전·운영 루브릭을 5개 이내 항목으로 작성한다.
  3. 실제 행동을 막은 shadow mode로 일주일간 결과와 로그를 수집한다.
  4. 사람 처리 결과와 비교해 실패 유형·재작업·치명적 오류를 분류한다.
  5. 배포·제한 운영·중단 조건을 수치와 담당자까지 포함해 문서화한다.

AI 에이전트는 테스트를 통과했다고 끝나지 않습니다. 실제 입력이 바뀌고 도구가 실패하고 정책이 갱신될 때도 안전하게 멈추고 회복해야 합니다. 골든셋과 운영 로그는 에이전트의 실력을 과장하지 않고 개선할 수 있게 만드는 최소 장치입니다.

공식 참고 자료

자주 묻는 질문

AI 에이전트 평가에 골든셋이 필요한가요?

필요합니다. 정상 사례뿐 아니라 누락·모호함·정책 충돌·도구 장애·권한 오류 같은 경계 사례를 포함해야 데모와 운영 품질을 구분할 수 있습니다.

정확도만 보면 안 되는 이유는 무엇인가요?

에이전트는 도구를 잘못 호출하거나 위험한 행동을 승인할 수 있습니다. 업무 품질·근거·도구 순서·안전 중단·사람 재작업을 함께 측정해야 합니다.

Shadow mode란 무엇인가요?

실제 운영 입력을 에이전트에 보내되 외부 변경·발송은 막고 결과만 쌓아 사람 처리 결과와 비교하는 운영 전 단계입니다.

로그에는 무엇을 남겨야 하나요?

입력 버전, 검색 결과, 도구와 인자, 반환 상태, 재시도, 승인자, 최종 결과를 연결하되 개인정보와 비밀정보는 마스킹해야 합니다.

평가 결과를 배포와 어떻게 연결하나요?

치명적 오류·안전 중단·재작업·비용·품질에 배포 기준을 정하고 기준을 벗어나면 제한 운영이나 롤백으로 보내야 합니다.

우리 팀의 AI 업무를 어디까지 자동화할 수 있는지, 그리고 어떤 승인·로그·평가가 필요한지 먼저 점검해보세요.

AX 셀프리뷰 시작하기

같은 주제에서 이어 읽기

전체 글