블로그
AI 전환워크플로AI 에이전트파일럿 평가업무 자동화

AI 전환의 투자 순서: 자동화할 업무와 에이전트에 맡길 업무

AI 전환의 업무 우선순위와 워크플로·에이전트 선택 기준을 설명합니다. Anthropic·METR 원문, 의사결정 도식 2종, 가상 시간 계산, 파일럿 평가와 운영 인수인계를 확인하세요.

LeanX 편집팀·2026년 10월 7일·수정 2026년 10월 7일·12분 읽기·4
AI 전환의 투자 순서: 자동화할 업무와 에이전트에 맡길 업무

기업의 AI 전환은 이제 도구를 도입하는 단계에서 업무를 재설계하는 단계로 넘어가고 있다. 하지만 예산을 어디부터 배분할지 결정하는 회의에서는 여전히 제품 기능 비교와 데모가 논의를 이끄는 경우가 있다. 실제 검토해야 할 것은 현업에서 반복되는 업무의 구조, 결과를 판정할 기준, 그리고 그 결과를 운영할 책임이다.

월말 자료 취합과 신규 시장 조사에 같은 방식의 시스템을 적용할 필요는 없다. 전자는 정해진 자료와 규칙을 정확하게 처리하는 능력이 중요하고, 후자는 조사 과정에서 생기는 질문에 따라 다음 행동을 바꾸는 능력이 중요하다. 두 업무를 구분하면 필요한 자율성, 연결할 자료, 검수 방법, 운영 비용을 구체화할 수 있다.

AI 전환의 우선순위는 업무 수요, 결과 판정 가능성, 데이터 준비도, 운영 책임을 함께 검토해 정한다. 절차가 명확한 업무는 정해진 흐름부터 시험하고, 탐색과 판단이 필요한 업무에는 검증 가능한 범위에서 에이전트의 자율성을 부여한다.

이 글은 Anthropic의 에이전트 설계 글과 METR의 생산성 연구를 참고해 작성했다. 업무 선정 기준, 매트릭스, 파일럿 운영안, 계산 예시는 LeanX의 편집 제안이다. 특정 기업의 실제 성과를 소개하거나 효과를 보장하는 자료가 아니다.

AI 전환의 투자 순서를 업무 선정, 제한된 파일럿, 품질과 비용 비교, 확대·수정·중단으로 보여주는 흐름도
LeanX 제안: 업무 선정부터 확대·수정·중단까지의 의사결정 흐름. 실제 성과 수치 아님.

1. 먼저 구분할 것: 정해진 업무 흐름과 자율적인 탐색

Anthropic의 Building effective agents는 미리 정의한 경로로 모델과 도구를 연결하는 워크플로와, 모델이 수행 과정과 도구 사용을 동적으로 결정하는 에이전트를 구분한다. 또한 필요한 만큼만 복잡도를 높이고, 추가 비용과 처리 지연이 결과 개선에 합당한지 살펴보라고 권한다. 2024년 12월 19일 발표한 글이며, 현재 페이지는 도구 환경이 달라졌음을 별도로 안내한다.

이 구분을 업무 선정에 적용해보자. 매일 같은 형식의 입금 내역을 읽고, 계약 번호를 대조하고, 누락 항목을 표시하는 업무는 처리 경로를 비교적 명확하게 정할 수 있다. 반면 새로운 고객 산업을 조사하면서 자료의 공백을 찾고, 추가 질문을 만들고, 조사 방향을 바꾸는 업무는 처음부터 모든 경로를 정하기 어렵다.

여기서 자율성을 단계적으로 설계할 수 있다. 자료 조회만 허용할지, 내부 초안 작성까지 허용할지, 시스템의 값을 수정할지, 외부로 발송할지를 각각 결정한다. ‘에이전트 도입’이라는 하나의 결정으로 모든 권한을 묶을 필요는 없다. 조사와 초안은 자율적으로 진행하더라도 계약 조건 변경이나 고객 발송은 담당자가 승인하는 구조를 선택할 수 있다.

최근 설계 방향도 함께 볼 필요가 있다. Anthropic은 2026년 4월 8일 Managed Agents 설계 글에서 실행 환경, 에이전트 루프, 세션 기록을 분리하고, 모델이 발전하면 기존 하네스의 가정을 다시 검토해야 한다고 설명한다. LeanX는 이 관점을 업무 자료·권한·기록·평가 기준을 모델 교체 후에도 관리할 수 있게 하자는 실무 제안으로 연결한다. 특정 서비스가 모든 기업에 적합하다는 의미는 아니다.

2. 파일럿 후보를 고르는 네 가지 질문

첫째, 이 업무의 수요는 충분한가? 반복 빈도만 보지 말고 실제 투입 시간, 대기 때문에 지연되는 다음 업무, 처리량 변동을 확인한다. 드물게 발생해도 운영상 중요한 일은 별도로 평가해야 한다. 반대로 자주 발생하지만 이미 간단한 규칙으로 잘 처리되는 일이라면 기존 자동화 개선이 먼저일 수 있다.

둘째, 무엇을 잘한 결과라고 판정할 수 있는가? ‘좋은 보고서’보다는 수치 일치, 필수 항목 포함, 근거 연결, 형식 준수처럼 확인할 항목을 정한다. 주관적인 품질이 중요하다면 승인본과 반려본, 수정 이유를 함께 수집한다. 결과에 대한 합의가 없는 상태에서 모델만 바꾸면 파일럿의 종료 기준도 계속 바뀐다.

셋째, 필요한 자료를 신뢰할 수 있는가? 파일이 존재하는지와 업무에 사용할 수 있는지는 다르다. 최신 승인본, 적용 날짜, 고객·계약 식별자, 조회 권한, 누락 처리 방식이 정리돼야 한다. 어느 자료를 참조했는지 확인할 수 없다면 결과가 틀렸을 때 모델, 검색, 원본 데이터 중 어디를 고칠지 찾기 어렵다.

넷째, 누가 운영하고 예외를 처리하는가? 도입 담당자와 실제 승인 담당자가 다를 수 있다. 자료가 바뀌면 누가 갱신하는지, 실패하면 누구에게 알리는지, 수정 사항을 어떤 기준으로 다음 실행에 반영하는지 정한다. 운영 책임이 비어 있는 파일럿은 시연이 끝난 뒤 현업으로 넘어가기 어렵다.

이 네 질문은 일률적인 점수표로 모든 업무를 줄 세우기 위한 공식이 아니다. 선택 이유와 보류 이유를 남기는 기준이다. 데이터 접근이 막혀 있거나 승인 담당자가 없는 후보는 먼저 그 준비 작업을 해결해야 한다.

3. 업무 선정 매트릭스: 효과와 검증 준비도를 함께 본다

아래 매트릭스는 LeanX가 제안하는 정성적 의사결정 도구다. 가로축은 결과를 판정할 기준과 확인 자료가 얼마나 준비돼 있는지, 세로축은 업무 수요와 병목 해소의 기대 가치를 나타낸다. 실제 회사 데이터를 측정한 차트가 아니며 칸 안의 후보는 가상 예시다.

기대 업무 가치와 검증 준비도로 후보를 분류한 정성적 업무 선정 매트릭스. 가치 높음·준비 높음은 우선 파일럿, 가치 높음·준비 낮음은 기준 정비, 가치 낮음·준비 높음은 작은 실험, 둘 다 낮음은 보류
LeanX 제안: 기대 가치와 검증 준비도의 정성적 분류. 후보는 가상 예시이며 실측 차트가 아님.

기대 가치가 높고 검증 기준도 준비된 업무는 첫 파일럿 후보로 적합하다. 예를 들어 승인된 단가표, 대조 규칙, 담당자가 있는 반복 견적 대조 업무를 생각해볼 수 있다. 좁은 범위에서 실제 처리 결과를 기존 방식과 비교한다.

기대 가치는 높지만 검증 준비가 낮은 업무는 평가 기준과 자료 정리가 먼저다. 시장 조사 결과를 누가 어떤 기준으로 승인할지 합의하지 않은 상태라면 조사 에이전트를 늘리기 전에 필요한 산출물, 출처 요건, 미확인 항목 처리 방식을 정한다.

검증 준비는 높지만 기대 가치가 낮은 업무는 작고 비용이 제한된 실험으로 적합성을 확인한다. 학습 목적이라면 그 목적을 별도로 명시한다. 한 번 쓰고 끝날 초안 작성 도구를 전사 핵심 투자처럼 평가할 필요는 없다.

두 기준 모두 낮은 업무는 우선순위를 보류할 수 있다. 그 판단도 실패가 아니라 예산을 더 유용한 후보에 배분하기 위한 결정이다. 상황이 달라지면 후보를 다시 검토하되, 새로운 자료나 수요가 무엇인지 함께 기록한다.

4. 생산성은 체감과 실제 업무 결과를 구분해 측정한다

METR의 2025년 7월 연구 발표는 익숙한 오픈소스 프로젝트에서 일한 숙련 개발자 16명의 실제 작업 246건을 무작위로 AI 사용 허용·비허용 조건에 배정했다. 해당 환경에서는 AI를 허용했을 때 완료 시간이 19% 늘어났고, 참여자의 체감과 측정 결과가 달랐다. 이 결과를 모든 직무나 현재 모델에 일반화할 수는 없다.

업데이트도 중요하다. METR은 2026년 2월 24일 후속 발표에서 참가자와 작업의 선택 효과, 여러 에이전트를 병행할 때의 시간 측정 문제 때문에 후속 데이터로 현재 효과를 신뢰성 있게 추정하기 어렵다고 설명했다. 따라서 예전 수치를 현재 AI의 생산성 결론처럼 사용해서는 안 된다.

LeanX가 이 연구에서 가져오는 실무 질문은 ‘우리 업무에서는 무엇을 직접 확인했는가’다. 현업 담당자가 편리하다고 느끼는지 조사하는 것과 함께, 자료 준비부터 승인된 결과까지 걸린 시간과 결과 품질을 기록해야 한다. 업무 종류, 담당자 숙련도, 난이도, 도구 버전도 함께 남겨야 비교의 조건을 이해할 수 있다.

특히 여러 에이전트를 병행하면 시스템이 일한 경과 시간과 사람이 실제로 주의를 기울인 시간을 구분한다. 기다리는 동안 다른 일을 할 수 있다면 대기 시간 전체를 사람의 노동 시간으로 계산하지 않는다. 반대로 예외를 처리하고 검토하는 데 집중했다면 그 시간은 비용에서 빠지지 않아야 한다.

5. 가상 계산: 절감 시간과 현금 절감을 나누어 본다

아래는 계산 방법을 설명하기 위한 가상 예시다. 한 팀이 월 200건의 동일한 업무를 처리하고, 기존 방식의 건당 사람 투입 시간이 30분이라고 가정하자. 새 방식에서는 자료 준비·검토·수정·예외 처리까지 포함해 건당 18분이 필요하고, 별도 운영 유지에 월 10시간이 든다고 가정한다. 두 방식의 품질 기준이 같다는 전제다.

  1. 기존 사람 투입 시간: 200건 × 30분 ÷ 60 = 월 100시간.
  2. 새 방식의 사람 투입 시간: 200건 × 18분 ÷ 60 + 유지 10시간 = 월 70시간.
  3. 예상 확보 시간: 월 100시간 − 월 70시간 = 월 30시간.

유지 시간에는 자료 갱신과 결과 점검 등 건별 처리에 포함하지 않은 활동만 넣어 중복 계산을 피한다. 초기 구축과 교육에 쓴 시간은 별도 기록하고 평가 기간에 맞춰 함께 고려한다. 시스템 사용료, 연결 도구 비용, 저장·모니터링 비용도 추가해야 한다.

월 30시간을 확보했다는 가정이 곧 인건비의 현금 절감을 뜻하지는 않는다. 그 시간을 미처리 고객 문의, 납기 조정, 신규 제안처럼 실제 가치가 있는 업무에 배분할 수 있는지 확인해야 한다. 인력 지출이 그대로라면 이는 처리 여력의 변화로 설명하는 편이 정확하다.

마찬가지로 추가 매출은 단순히 확보 시간에 금액을 곱해 주장할 수 없다. 문의에서 계약으로 이어지는 결과를 관찰하고, 다른 요인의 영향을 고려해야 한다. 파일럿에서는 시간, 품질, 운영 비용, 후속 업무의 처리 여력을 각각 기록하는 것이 출발점이다.

6. 파일럿은 네 단계의 의사결정으로 설계한다

업무 선정 단계에서는 업무의 시작과 끝, 실제 수요, 기준 자료, 승인 담당자를 정한다. 예를 들어 ‘견적 업무 자동화’보다 ‘고객 요청과 승인된 단가표를 대조해 담당자가 검토할 차이 목록을 만드는 업무’처럼 결과물을 명확히 정의한다.

제한된 파일럿 단계에서는 조회할 자료, 생성할 산출물, 도구 권한, 실행 비용 상한, 오류 때 멈출 조건을 정한다. 외부 발송이 필요 없는 첫 실험이라면 초안과 차이 목록까지만 만들도록 한다. 예상되는 정상 요청뿐 아니라 누락, 오래된 자료, 식별자 불일치 같은 예외도 포함한다.

품질과 비용 비교 단계에서는 합의한 기준으로 결과를 판정한다. 기존 방식과 새 방식의 업무 조건을 맞추고, 담당자와 난이도를 기록한다. 평균 시간뿐 아니라 오래 걸린 사례와 반려 이유도 살펴본다. 작은 샘플의 결과는 제한된 범위의 신호로 해석하고, 회사 전체의 개선율로 확대하지 않는다.

확대·수정·중단 단계에서는 결정을 문서로 남긴다. 품질과 운영 비용이 합의한 기준을 충족하면 적용 범위를 늘린다. 특정 자료 누락이 병목이라면 자료 연결을 수정하고 같은 기준으로 재시험한다. 가치가 낮거나 예외 처리 부담이 크다면 중단하고 다음 후보로 옮긴다. 확대는 파일럿 시작 때 정한 승인 절차를 따른다.

7. AI 교육에서 운영 가능한 업무로 이어지는 인수인계

교육 이후에는 현업이 스스로 수정하고 운영할 수 있는 자료가 남아야 한다. 어떤 입력을 받는지, 승인된 원본이 어디에 있는지, 결과를 어디서 확인하는지, 무엇이 실패로 기록되는지 설명해야 한다. 파일럿의 성공과 담당자의 운영 능력을 함께 확인하는 것이다.

LeanX가 제안하는 인수인계 자료에는 업무 정의, 자료 목록과 적용일, 도구 권한, 검수 기준, 예외 처리 절차, 변경 이력이 포함된다. 모델이나 도구를 교체했을 때 같은 샘플로 다시 비교할 수 있도록 평가 자료도 보존한다. 기준 변경은 담당자가 승인하고 변경 이유를 남긴다.

회사에서 AI 전환을 검토 중이라면 먼저 세 가지를 준비해보자. 반복되거나 병목이 되는 업무 하나, 승인된 결과물과 수정 이유, 그 결과를 이어받을 담당자다. 이 자료가 있으면 교육, 파일럿, 구축의 적용 범위를 보다 구체적으로 논의할 수 있다.

LeanX와 AI 전환 적용 범위 상담하기

자주 묻는 질문

AI 전환의 첫 업무는 어떻게 선정하나요?

업무 수요와 기대 가치, 결과 판정 기준, 데이터 준비도, 운영 책임을 함께 확인합니다. 가치와 검증 준비가 모두 높은 후보부터 제한된 파일럿을 검토하고, 준비가 부족한 후보는 기준과 자료를 먼저 정리합니다.

워크플로와 에이전트는 어떻게 구분하나요?

워크플로는 미리 정의한 처리 경로로 모델과 도구를 연결하고, 에이전트는 수행 과정과 도구 사용을 동적으로 결정합니다. 필요한 자율성을 업무별로 정하고 실제 품질·비용으로 적합성을 비교해야 합니다.

AI가 확보한 시간이 바로 현금 절감인가요?

아닙니다. 사람 투입 시간이 줄어도 실제 인력 지출이 그대로라면 처리 여력이 늘어난 것입니다. 운영 비용과 초기 구축 비용을 함께 기록하고 확보한 시간을 가치 있는 업무에 활용하는지 확인해야 합니다.

시각화와 시간 계산은 실제 고객 성과인가요?

아닙니다. 매트릭스와 흐름도는 LeanX가 제안하는 정성적 의사결정 자료이며, 월 200건의 시간 계산은 가상 예시입니다. 실제 개선 효과는 같은 품질 기준을 적용한 파일럿에서 확인해야 합니다.

반복되는 업무와 승인 결과물, 운영 담당자를 바탕으로 LeanX와 AI 교육·파일럿·구축의 적용 범위를 정해보세요.

업무 하나 적용 상담하기

같은 주제에서 이어 읽기

전체 글