블로그
AI 판단 리허설AI 의사결정AI 위임 기준Human-in-the-loopAX 실행

AI의 답을 먼저 보여주지 마세요: 팀의 판단 기준을 찾는 리허설

AI 추천을 보기 전에 사람의 독립 판단을 기록하고, 불일치를 사실·기준·권한으로 나눠 AI 처리·사람 확인·AI 중단의 위임 기준표로 바꾸는 방법을 설명합니다.

LeanX 편집팀·2026년 10월 10일·수정 2026년 10월 10일·11분 읽기·4
AI의 답을 먼저 보여주지 마세요: 팀의 판단 기준을 찾는 리허설

AI 판단 리허설은 AI 답을 가린 상태에서 사람이 먼저 선택한 뒤, 두 판단의 불일치와 뒤집힘 조건을 기록해 AI 처리·사람 확인·AI 중단 경계를 만드는 실험입니다. 흩어진 사내 데이터는 이 경계를 검토하는 증거로 사용합니다.

가상의 B2B 영업팀이 할인 요청 한 건을 검토한다고 해보겠습니다. 할인율은 2.5%, 결제 조건은 정확히 60일입니다. 영업 정책에는 60일 이하이면 재무 확인 없이 진행 가능이라고 적혀 있지만, 재무 체크리스트에는 60일 이상이면 재무 확인 필요라고 적혀 있습니다.

AI가 먼저 자료 충돌로 판단 보류라고 답한 뒤 담당자에게 동의를 묻는다면 어떨까요? 담당자가 승인해도 원래 같은 판단을 했는지, AI의 답을 보고 맞춘 것인지 구분하기 어렵습니다. 일치했다는 기록은 남지만 팀의 기준은 선명해지지 않습니다.

이번에는 AI 답을 숨깁니다. 담당자는 먼저 재무 책임자 확인을 선택하고 “공식 우선순위는 모르지만, 경계값에서는 재무 확인으로 넘겨 왔다”고 이유를 남깁니다. 그다음 AI가 같은 자료 충돌로 판단 보류와 근거 문장 두 개를 공개합니다. 선택은 달랐지만 이 차이에서 두 가지를 발견할 수 있습니다.

  • 담당자는 공식 문서에 없는 실무 습관을 적용하고 있었다.
  • AI가 멈춰야 할 조건은 60일 자체가 아니라 유효한 승인 문서의 충돌이었다.

사람과 AI의 불일치는 실패가 아니라 질문할 지점입니다. 목표는 AI가 사람과 같은 답을 내게 만드는 것이 아니라, 어떤 사실과 기준이 선택을 바꾸는지 확인하고 이를 검토 가능한 위임 경계로 만드는 데 있습니다.

이 글의 할인 요청은 LeanX가 설명을 위해 만든 합성 사례입니다. 특정 고객사의 구축 결과나 성과가 아닙니다.

1. AI 답을 보여주는 순서도 실험 변수입니다

AI의 답은 정보를 하나 더 주는 데서 끝나지 않습니다. 사람이 문제를 바라보는 틀과 먼저 확인할 단서에도 영향을 줄 수 있습니다. 그래서 AI를 업무에 넣을 때는 모델만 평가할 것이 아니라 누가 먼저 판단하고, 언제 서로의 답을 공개하는지도 설계해야 합니다.

2026년 예비 교사 240명을 대상으로 한 무작위 시나리오 실험에서는 AI 추천을 보기 전에 독립 판단을 기록한 집단이, 추천을 먼저 본 집단보다 잘못된 AI 조언에 덜 끌렸습니다. 데이터 품질 제외 후 218명이 주 분석에 포함됐고, 올바른 추천에서는 두 집단의 차이가 통계적으로 유의하지 않았습니다. 다만 중국 한 대학의 통제된 교육 시나리오 결과이므로 B2B 업무에 그대로 일반화할 수는 없습니다. 두 조건은 공개 순서뿐 아니라 사전 응답과 중립 검토 단계도 달랐으므로 순서만의 효과로 분리해 해석할 수도 없습니다. 연구진도 실제 교실 의사결정으로의 전이를 입증하지 않았다고 밝혔습니다. Frontiers in Psychology 연구

2022년 실제 자연보전 데이터를 사용한 선택적 예측 연구에서도 메시지 방식이 사람의 판단 정확도에 영향을 줬습니다. AI가 사람에게 판단을 넘겼다는 사실은 알리되 AI의 예측값은 보여주지 않았을 때 사람의 성과가 유의하게 좋아졌습니다. 이 연구 역시 자연보전 분류 과제에 관한 것이며 일반적인 기업 의사결정을 검증한 것은 아닙니다. AAAI 연구

두 연구가 “항상 사람이 먼저 답해야 한다”는 보편 법칙을 증명한 것은 아닙니다. 사람이 자신의 첫 답에 고착될 가능성도 있습니다. 실무에서 가져올 결론은 더 좁습니다. 추천 공개 순서를 고정값으로 두지 말고, 독립 판단이 실제 업무에서 잘못된 의존을 줄이는지 시험해야 한다는 것입니다.

2. 일치율보다 ‘무엇이 답을 뒤집었는가’를 봅니다

사람과 AI가 같은 선택을 했다고 둘 다 옳은 것은 아닙니다. 같은 오래된 문서를 봤거나, 같은 중요한 정보를 놓쳤을 수 있습니다. 반대로 답이 다르다고 AI가 실패한 것도 아닙니다. 불일치를 다음 세 층으로 나누면 조사할 대상이 선명해집니다.

불일치 층확인할 질문할인 요청 사례
사실서로 다른 자료·버전·값을 봤는가?영업 정책과 재무 체크리스트가 동시에 유효한가?
기준같은 사실의 우선순위를 다르게 뒀는가?정확히 60일일 때 어느 문서를 우선하는가?
권한누가 최종 선택할 수 있는가?재무 확인을 생략할 권한이 영업 담당자에게 있는가?

여기에 한 가지 질문을 더합니다.

어떤 최소 조건이 달랐다면 반대 선택을 했을까요?

이를 뒤집힘 조건이라고 부를 수 있습니다. 결제 조건이 59일이었다면 표준 처리했을지, 두 문서의 소유자가 우선순위를 확정했다면 AI도 판단할 수 있을지 묻는 방식입니다. “이 담당자는 보수적이다”라는 성격 설명보다 다음 사례에서 시험하기 쉽습니다.

분산된 메일, CRM, 정책 문서와 회의록은 이 질문에 답할 증거입니다. 데이터 자체가 곧 암묵지는 아닙니다. 어느 상황에서 어떤 단서를 우선했고 무엇 때문에 결론을 바꿨는지 담당자와 승인 책임자가 확인해야 잠정 기준이 됩니다.

3. 한 건의 판단을 네 단계로 리허설합니다

첫 실험에는 회사 데이터를 전부 연결할 필요가 없습니다. 반복되지만 외부 실행 전 사람이 막을 수 있는 결정 하나를 고르고, 다음 순서로 리허설합니다.

1) 결정의 범위를 잠급니다

할인 요청 한 건을 표준 처리 / 책임자 확인 / 보류 중 하나로 분류한다처럼 입력, 선택지와 책임자를 정합니다. “좋은 고객을 골라줘”처럼 범위가 열린 질문은 기준의 좋고 나쁨을 판정하기 어렵습니다.

2) 사람의 첫 판단을 먼저 고정합니다

담당자는 승인된 자료의 동일한 스냅샷을 보고 선택, 이유, 확신도와 뒤집힘 조건을 남깁니다. AI 결과는 아직 보여주지 않습니다. 첫 선택은 비교가 끝날 때까지 수정하지 않습니다.

3) AI의 판단과 근거를 함께 공개합니다

AI는 결론만 보여주지 않습니다. 사용한 원문, 적용한 기준, 고려하지 못한 정보, 멈춤 여부와 다음 확인 담당자를 함께 제시합니다. 그래야 차이가 사실·기준·권한 중 어디서 생겼는지 추적할 수 있습니다.

4) 불일치를 기준 변경안으로 남깁니다

사람의 수정이 곧바로 새 규칙이 되지는 않습니다. 담당자가 후보 기준을 확인하고 승인 책임자가 적용 범위와 예외를 검토해야, 다음 사례에서 시험할 잠정 기준 v2가 됩니다. 기존 기준은 덮어쓰지 않고 변경 전후와 승인자를 남깁니다.

최소 기록 단위는 다음 정도면 충분합니다.

사례 ID / 자료 버전 / 사람의 첫 선택·이유 / AI 선택·근거 / 불일치 층 / 뒤집힘 조건 / 최종 책임자 선택 / 기준 버전

이 기록이 쌓이면 “누구처럼 생각하는 AI”가 아니라 어떤 업무를 어떤 조건에서 위임할 수 있는지를 검증할 수 있습니다.

4. 발견한 기준을 세 구역의 위임표로 바꿉니다

판단 리허설의 첫 산출물은 거대한 지식 그래프가 아니라 한 장의 AI 위임 기준표입니다.

구역합성 할인 요청의 예시
AI가 샌드박스에서 처리 가능필수 정보가 있고, 승인 자료가 충돌하지 않으며, 표준 할인·결제 범위 안에 있음
사람이 확인임계값을 넘는 할인, 긴 결제 조건, 맞춤 사양처럼 지정 책임자의 승인이 필요함
AI가 멈춤필수 정보 누락, 승인 자료 충돌, 만료·미승인 자료뿐이거나 제품 안전선 밖의 결정임

업무 담당자는 기준 후보를 제안할 수 있지만 모든 경계를 바꿀 수 있어서는 안 됩니다. 자료 권한, 개인정보 사용 제한과 고위험 의사결정 금지 같은 제품 안전선은 별도 소유자가 관리해야 합니다.

채용·해고·인사평가, 신용·보험, 의료, 법률상 권리, 교육 기회나 공공 혜택처럼 사람에게 중대한 영향을 주는 결정은 이 간단한 공개 리허설의 대상이 아닙니다. 처음에는 실제 발송·승인·결제 없이 되돌릴 수 있는 운영 판단부터 시작하는 편이 적절합니다.

5. 평가할 것은 동의가 아니라 ‘적절한 의존’입니다

AI 지원의 효과가 모든 사람에게 같지도 않습니다. 5,172명의 고객지원 상담원을 다룬 현장 연구에서 생성형 AI 지원은 시간당 해결 건수를 평균 15% 높였지만, 효과는 저경력·저숙련 상담원에게 더 컸습니다. 최고 숙련층에서는 속도가 조금 빨라진 반면 대화 품질이 소폭 낮아졌습니다. 한 회사의 고객지원 업무에서 관찰한 결과이므로 다른 판단 업무에 그대로 적용할 수는 없습니다. QJE 연구

따라서 사람과 AI의 일치율만 높이는 것은 좋은 목표가 아닙니다. 정답이나 책임자 판정이 있는 평가 사례에서 다음을 함께 봐야 합니다.

  • AI 결론의 근거가 승인된 원문에 실제로 있는가?
  • 정보 부족·자료 충돌·범위 밖 상황에서 올바르게 멈췄는가?
  • 사람은 타당한 추천을 받아들이고 잘못된 추천은 거절했는가?
  • 불일치가 검토 가능한 기준 변경안으로 이어졌는가?
  • 새 버전이 이전 평가 사례를 망가뜨리지 않았는가?

수정은 기존 기준을 자동으로 덮어쓰지 않습니다. 같은 평가 사례로 이전 버전과 변경안을 다시 실행하고, 책임자가 차이를 승인해야 새 버전이 됩니다. 피곤한 날의 선택과 일회성 예외까지 자동 학습시키지 않기 위한 최소 장치입니다.

6. 이번 주에는 판단 하나만 가져오세요

시작하기 좋은 업무에는 네 가지 조건이 있습니다.

  • 같은 종류의 선택이 반복된다.
  • 최종 결과를 판정할 책임자가 있다.
  • 정상·예외·보류 사례를 구분할 수 있다.
  • 잘못 판단해도 외부 실행 전에 사람이 멈출 수 있다.

이번 주에 두 번 이상 반복된 판단 하나를 고르고, 무엇을 선택했는지보다 무엇 때문에 선택이 바뀌었는지부터 적어보세요. 과거 사례 두세 건과 처음 보는 새 사례 한 건만으로도 첫 리허설을 시작할 수 있습니다. 다만 이 정도 사례로 정확도나 조직 전체의 규칙을 주장해서는 안 됩니다.

LeanX AI 판단 리허설에서는 합성 할인 요청의 근거를 읽고, AI 결과를 보기 전에 직접 판단한 뒤, 기준표를 따른 예시와 비교할 수 있습니다. 실제 회사 데이터를 받거나 모델을 호출하지 않으며, 외부 승인이나 견적 발송도 실행하지 않습니다. 한 번의 체험 결과는 AI 정확도나 현장 성과가 아닙니다.

실제 업무의 자료·권한·위임 경계와 평가 세트를 함께 설계하려면 AX 업무 판단 파일럿 상담에 반복 판단 하나를 남겨 주세요.

참고 자료

자주 묻는 질문

사내 RAG나 지식검색과 무엇이 다른가요?

RAG는 질문과 관련된 자료를 찾는 데 도움을 줍니다. 판단 리허설은 같은 자료를 두고도 어떤 단서가 선택을 뒤집는지, 어느 조건에서 AI가 사람에게 넘기거나 멈춰야 하는지를 시험합니다.

항상 사람이 AI보다 먼저 판단해야 하나요?

아닙니다. 사람의 첫 판단도 고착을 만들 수 있고, 업무에 따라 AI의 빠른 선별이 더 유용할 수 있습니다. 독립 판단 우선은 정답이 아니라 검증할 인터페이스 가설입니다. 같은 평가 사례로 추천 우선 방식과 비교해 적절한 의존, 보류와 수정 결과를 확인해야 합니다.

사람과 AI가 다르면 누구의 판단을 따르나요?

자동으로 어느 한쪽이 맞다고 정하지 않습니다. 사실·기준·권한의 차이를 확인하고 지정된 책임자가 최종 선택합니다. 필요한 자료나 권한이 없으면 둘 다 판단을 보류합니다.

실제 데이터로 시작할 때 무엇을 주의해야 하나요?

전체 메일함이나 드라이브를 한꺼번에 연결하지 마세요. 결정 한 건에 필요한 승인 자료와 사례만 최소 권한으로 복사하고, 개인정보·영업비밀을 제거하거나 접근을 제한해야 합니다. 보존 기간, 삭제 방식, 외부 모델 전송 여부와 실행 권한을 먼저 정한 뒤 샌드박스에서 검증해야 합니다.

반복되는 업무 판단 하나를 골라 사람의 독립 판단과 AI 기준표를 비교해보세요.

AI 판단 리허설 시작하기

같은 주제에서 이어 읽기

전체 글