블로그
AI 모델모델 라우팅AI 비용AI 에이전트AX업무 자동화

AI 모델 선택표 만드는 법: 최고 성능보다 업무 적합도를 먼저 보세요

모든 업무에 가장 비싼 모델을 쓰거나 가장 싼 모델로 통일하면 품질과 비용이 함께 흔들립니다. 복잡도·속도·비용·도구 사용·멀티모달·데이터 경계를 기준으로 업무별 모델 라우팅 표를 만드는 방법을 정리했습니다.

박성훈 · LeanX 대표·2026년 8월 11일·16분 읽기
AI 모델 선택표 만드는 법: 최고 성능보다 업무 적합도를 먼저 보세요

한 줄 답변: AI 모델은 순위를 매겨 하나를 고르는 것이 아니라 업무별로 라우팅해야 한다. 단순 분류·추출은 빠르고 저렴한 모델, 예외가 많은 판단은 고성능 모델, 코드·이미지·음성처럼 특화 기능이 필요한 작업은 전문 모델로 보내고, 모든 경로에 동일한 평가셋과 비용 상한을 적용한다.

새 모델이 나올 때마다 팀 채팅에는 같은 질문이 올라온다. 이번 모델이 최고인가요? 우리도 바꿔야 하나요? 하지만 업무에서 중요한 것은 모델의 전체 순위가 아니다. 고객 문의 분류, 계약서에서 날짜 추출, 복잡한 리서치, 코드 수정은 서로 다른 실패 비용과 속도 요구를 가진다.

따라서 모델 선택은 구매 결정이 아니라 업무 라우팅 설계에 가깝다. 어떤 입력을 어떤 모델로 보내고, 결과가 기준을 통과하지 못하면 어디로 재시도하며, 사람에게 언제 넘길지 정하면 모델 교체에도 덜 흔들린다.

이 글의 FLAGSHIP·WORKHORSE·LIGHT·SPECIALIZED는 특정 벤더의 공식 등급표가 아니다. LeanX가 업무 라우팅을 설명하기 위해 붙인 실무 라벨이다. 벤더 간 성능 순위나 고정된 지연시간을 뜻하지 않으며, 각 라벨의 후보는 같은 평가셋에서 품질·비용·지연·도구 성공률을 다시 측정해야 한다.

단순 처리, 일반 업무, 복잡한 판단, 특화 작업이 서로 다른 AI 모델 라인으로 라우팅되는 구조
모델을 하나로 통일하기보다 업무 난이도와 실패 비용에 따라 경로를 나눈다.

모델 등급표보다 먼저 업무를 분해한다

모델을 고르기 전에 업무를 작은 단위로 쪼갠다. 한 업무 안에도 입력 정리, 분류, 검색, 초안, 검수, 외부 실행이 섞여 있기 때문이다. 각 단계가 같은 모델을 필요로 하지 않는다.

업무 단계주요 요구우선 모델 특성사람 개입
분류·라우팅규칙이 비교적 명확하고 처리량이 많다빠른 응답·낮은 비용·안정적인 JSON낮은 확신도만 검수
문서 추출정해진 필드와 근거 위치가 필요하다구조화 출력·긴 문맥·문서 입력필수 필드 누락 검수
복잡한 판단예외·상충 조건·다단계 추론이 있다추론 품질·도구 사용·긴 작업 유지결정 전 승인
코드·멀티모달특정 입력 형식과 검증 도구가 필요하다코드 수정·이미지·음성 등 전문 기능테스트·리뷰·원본 보존

모델 선택 기준 6가지

1. 성공 조건

자연스러운 답변이 성공인지, 필수 필드를 빠짐없이 채우는 것이 성공인지, 실제 티켓을 생성해야 완료인지 먼저 정한다. 성공 조건이 달라지면 적합한 모델도 달라진다.

2. 실패 비용

분류를 한 번 틀리는 것과 고객에게 잘못된 청구 안내를 보내는 것은 다르다. 실패 비용이 큰 단계는 고성능 모델이나 사람 승인을 붙이고, 낮은 위험의 반복 단계는 가벼운 모델로 보낸다.

3. 지연시간과 처리량

실시간 상담과 야간 배치의 기준은 다르다. 평균 응답시간만 보지 말고 피크 시간의 대기, 재시도, 사람 검수까지 포함한 전체 리드타임을 기록한다.

4. 입력과 출력의 형태

텍스트만 처리하는 업무인지, PDF·이미지·음성·코드를 함께 다루는지 확인한다. 구조화 출력이 필요한 단계는 파싱 실패와 재시도까지 평가해야 한다.

5. 도구 사용과 상태 유지

모델이 답변만 만들면 되는지, 검색·파일·코드 실행·내부 시스템을 순서대로 호출해야 하는지 구분한다. 도구 호출 실패와 중단 이유가 기록되지 않으면 모델 성능 비교가 아니라 데모 비교가 된다.

6. 데이터 경계와 변경 주기

업무 데이터가 외부 API로 나가도 되는지, 조직이 직접 보관해야 하는지, 모델이 바뀌었을 때 재평가할 수 있는지 확인한다. 실행 위치와 모델 선택은 데이터 정책과 함께 결정해야 한다.

AI 모델 라우팅 점수표에서 품질, 비용, 속도, 도구 성공률, 안전한 중단을 함께 비교하는 구조
모델의 전체 순위보다 업무별 성공·비용·속도·도구·안전 지표를 함께 비교한다.

업무 라우터를 설계하는 5단계

  1. 대표 입력 고정: 정상 20건과 예외 10건을 저장하고 버전을 붙인다.
  2. 기본 경로 선택: 처리량이 높은 업무는 비용과 속도를 우선한 모델로 보낸다.
  3. 난이도 신호 정의: 긴 문서, 낮은 확신도, 상충된 출처, 필수 필드 누락을 재라우팅 조건으로 정한다.
  4. 재시도와 사람 게이트: 같은 모델을 무한 재실행하지 말고 다른 모델이나 사람에게 넘긴다.
  5. 비용·품질 로그: 모델 버전, 입력량, 지연, 성공 여부, 수정량, 비용을 함께 기록한다.

라우터의 핵심은 모델을 똑똑하게 바꾸는 것이 아니라, 실패를 숨기지 않고 다음 경로로 넘기는 것이다. 예를 들어 문서 추출에서 필수 필드가 비어 있으면 고성능 모델로 재시도하고, 그래도 근거가 없으면 사람이 확인하도록 상태를 바꾼다.

2주 모델 라우팅 파일럿

기간검증 내용측정 지표
1~2일업무를 단계별로 나누고 성공·실패 조건을 정한다필수 조건·예외 유형·승인자
3~4일가벼운 경로와 고성능 경로의 baseline을 만든다정확도·근거 완성도·응답시간
5~7일확신도·필드 누락·도구 실패를 재라우팅한다재시도율·사람 에스컬레이션율
8~10일실제 업무 샘플로 비용과 재작업을 비교한다건당 비용·수정시간·완료 리드타임

모델 교체 전 체크리스트

  • 새 모델의 공식 문서에서 필요한 입력·출력·도구 기능을 확인했는가?
  • 현재 모델과 새 모델을 같은 평가셋으로 비교했는가?
  • 정확도뿐 아니라 근거 누락·도구 실패·사람 수정량을 기록했는가?
  • 비용과 처리량의 상한을 정했는가?
  • 모델 장애나 정책 변경 때 이전 경로로 돌아갈 수 있는가?
  • 외부 발송·결제·삭제 등 고위험 행동에 사람 승인이 남아 있는가?
  • 모델 버전과 프롬프트 버전을 로그에 남기는가?

LeanX는 모델 이름을 추천하는 데서 끝내지 않고, 팀의 업무를 라우팅 가능한 단계로 분해하고 평가셋과 운영 지표를 붙입니다. 우리 팀의 AI 모델 선택표를 파일럿으로 만들어보세요.

공식 참고자료

자주 묻는 질문

AI 모델은 하나로 통일하는 것이 좋나요?

대부분의 팀에는 업무별 라우팅이 더 현실적입니다. 단순 반복은 빠르고 저렴한 경로로, 복잡한 판단과 고위험 작업은 고성능 모델과 사람 승인을 붙이는 방식입니다.

가장 성능이 좋은 모델을 쓰면 문제가 해결되나요?

아닙니다. 품질이 좋아도 비용·지연·도구 실패·데이터 경계가 업무 조건과 맞지 않을 수 있습니다. 대표 입력에서 전체 완료 조건과 재작업을 함께 평가해야 합니다.

모델 라우팅은 어떤 신호로 결정하나요?

입력 길이, 문서 종류, 낮은 확신도, 필수 필드 누락, 상충된 출처, 도구 호출 실패, 고위험 행동 여부를 신호로 사용할 수 있습니다.

모델을 바꿀 때 무엇을 비교해야 하나요?

같은 평가셋에서 성공률, 근거 완성도, 응답시간, 재시도율, 사람 수정량, 건당 비용, 안전한 중단율을 비교해야 합니다.

저렴한 모델로 자동화하면 품질이 떨어지지 않나요?

업무를 잘게 나누고 실패 신호가 있을 때 고성능 경로 또는 사람에게 넘기면 비용과 품질을 함께 관리할 수 있습니다. 저렴한 모델로 모든 단계를 처리하는 방식은 피해야 합니다.

우리 업무에 맞는 AI 모델 라우팅 표를 만들어보세요

AI 모델 운영 진단하기

같은 주제에서 이어 읽기

전체 글