AI 에이전트 출시 전 평가법: 대표 사례 20개로 검수하는 체크리스트
데모가 잘 되는 것과 업무에서 안정적으로 쓰는 것은 다릅니다. 실제 입력·예외·금지 행동을 담은 대표 사례를 모아, 배포 전 결과와 중단 동작을 함께 확인하는 평가집 양식을 정리했습니다.

AI 에이전트는 같은 요청에도 입력 문서, 도구 상태, 권한, 표현 방식에 따라 다른 결과를 낼 수 있습니다. 발표용으로 잘 고른 한 사례가 통과했다고 해서 실제 업무의 준비가 끝난 것은 아닙니다. 현장의 문제는 빈칸이 있는 파일, 중복된 고객 정보, 읽을 수 없는 첨부, 사람에게 물어야 하는 예외에서 시작됩니다.
Google Cloud의 2026년 생산 환경 AI 에이전트 가이드는 에이전트가 추론·행동·적응하기 때문에 전통적인 소프트웨어와 다른 테스트, 메모리, 오케스트레이션, 보안 접근이 필요하다고 설명합니다. 이 글의 20개 사례는 특정 서비스의 기능 보증이 아니라, 작은 팀이 배포 전 확인할 수 있는 실무 양식입니다.
대표 사례는 ‘좋은 입력’만 모으는 표가 아닙니다
정상 사례는 결과 형식이 맞는지 확인하게 합니다. 예외 사례는 AI가 모르는 것을 어떻게 표시하고 누구에게 넘기는지 확인하게 합니다. 금지 행동 사례는 권한 밖 행동을 시도하지 않는지 확인하게 합니다. 세 종류가 함께 있어야 실제 업무에서의 신뢰를 판단할 수 있습니다.
처음에는 업무 담당자가 최근 처리한 사례에서 익명화 가능한 것만 골라도 됩니다. 개인 정보와 계약 내용은 그대로 복사하지 말고, 결과 판단에 필요한 구조만 남기세요. 아직 자동화 후보가 선명하지 않다면 AX 자가진단으로 반복 업무와 예외를 먼저 관찰하는 편이 좋습니다.
20개 사례를 나누는 방법
| 사례 유형 | 권장 개수 | 확인할 것 |
|---|---|---|
| 정상 입력 | 10개 | 기대 형식, 근거, 누락 없는 결과 |
| 자주 생기는 예외 | 6개 | 모호함 표시, 사람에게 넘기는 경로 |
| 형식·접근 문제 | 2개 | 읽을 수 없음, 권한 부족, 중복 입력 처리 |
| 금지 행동 | 2개 | 외부 발송·변경·민감정보 노출을 하지 않는지 |
20개는 출발점일 뿐입니다. 고객지원이라면 환불 요청, 기술 오류, 일반 문의가 서로 다른 결과로 가는지 봐야 합니다. 회의 요약이라면 결정 사항이 없는 회의, 상충되는 담당자, 기한이 빠진 메모가 빠지면 안 됩니다. 대표 사례는 업무 담당자의 실제 기억에서 시작해야 합니다.
각 사례에 적을 여섯 칸
결과를 ‘좋음/나쁨’으로만 판정하지 말고, 왜 통과했는지 설명할 수 있게 적으세요. 기대 문장을 완전히 고정하면 표현만 맞추는 평가가 될 수 있으니, 반드시 있어야 할 정보와 해서는 안 될 행동을 구분해 둡니다.
사례 이름과 유형: 익명화한 입력: 기대 결과에 반드시 있어야 할 정보: 허용되는 표현 차이: 절대 하면 안 되는 행동: 사람 검수자의 통과/수정/중단 판정과 이유:
검수자는 결과가 맞는지뿐 아니라 원문을 다시 찾기 쉬운지도 봐야 합니다. 어떤 근거로 요약했는지 링크나 문단 위치를 남기지 못한다면, 사람은 매번 전체 자료를 다시 읽어야 합니다. 이 경우에는 모델을 바꾸기 전에 결과 형식에 ‘근거’ 열을 추가하는 수정이 더 직접적일 수 있습니다.
출시 전에는 중단 동작을 시험하세요
좋은 에이전트는 모든 일을 끝내는 에이전트가 아닙니다. 자료가 부족하거나, 지시가 충돌하거나, 권한이 없을 때 결과를 지어내지 않고 ‘확인 필요’로 넘길 수 있어야 합니다. 이 동작은 실패 화면이 아니라 업무 책임을 지키는 기능입니다.
특히 고객 발송, 일정 변경, 금액, 접근 권한에 영향을 주는 일은 외부 실행 없이 초안과 승인 단계부터 테스트하세요. 누가 승인하는지, 실행 로그는 어디에 남는지, 잘못된 결과를 어떻게 되돌리는지까지 사례에 포함합니다. 이런 기준을 서비스·업무 흐름과 함께 정리하려면 AX 컨설팅처럼 실제 운영 조건을 먼저 확인하는 접근이 필요합니다.
평가 결과로 다음 결정을 하세요
- 같은 수정이 반복되면 입력 규칙이나 결과 형식을 고칩니다.
- 예외가 늘어나면 업무 범위를 더 작게 자르거나 사람 검토를 앞에 둡니다.
- 정상·예외·중단 모두 기준을 만족하면 같은 범위에서 사례 수를 늘립니다.
- 새 도구나 모델로 바꿀 때는 같은 대표 사례로 다시 비교합니다.
평가집은 점수를 만들어 배포를 밀어붙이는 자료가 아닙니다. 팀이 어떤 결과를 믿고, 어떤 경우에는 멈추기로 했는지 합의한 기록입니다. 실제 운영에서 새 예외가 발견되면 대표 사례에 추가해 다음 배포의 기준으로 만드세요.
자주 묻는 질문
20개보다 적은 사례로 시작해도 되나요? 가능합니다. 다만 정상 사례만 있으면 안 됩니다. 최소한 모호한 입력과 권한 밖 요청을 포함해 중단 동작을 확인하세요.
평가를 자동화해야 하나요? 처음에는 담당자가 결과를 읽고 이유를 기록하는 수동 평가가 더 유용할 수 있습니다. 기준이 안정된 뒤 반복 평가를 자동화하세요.
출처: Google Cloud, A developer's guide to production-ready AI agents를 2026년 9월 20일 확인했습니다. 대표 사례 비율과 체크리스트는 LeanX의 제안입니다.
자주 묻는 질문
대표 사례는 몇 개부터 시작하면 되나요?
작은 파일럿은 10~20개면 시작할 수 있습니다. 정상 입력만 모으지 말고 누락, 형식 오류, 권한 부족, 사람이 개입해야 하는 예외도 넣으세요.
평가 결과가 좋으면 바로 자동화해도 되나요?
아닙니다. 결과 정확성 외에 검수 시간, 중단 동작, 로그, 권한 범위, 되돌리기 방법을 확인해야 합니다. 처음에는 외부 행동 없이 초안 단계로 운영하는 편이 안전합니다.
평가집은 한 번 만들면 끝인가요?
아닙니다. 실제 운영에서 새 예외가 발견되면 사례와 기대 결과를 추가해야 합니다. 업무 규칙이 바뀌면 평가 기준도 함께 갱신하세요.
우리 팀의 첫 AI 파일럿에서 확인할 사례와 검수자를 정리해 보세요.
AX 컨설팅 신청