블로그
AI 벤치마크업무 자동화회계 자동화AX 컨설팅중소기업 AI 도입

AI가 주니어 회계사를 이긴 건 ‘직무’가 아니라 ‘업무의 모양’이다: 중소기업이 먼저 재야 할 기준선

Mercor가 2026년 10월 1일 공개한 연구에서 CPA 12명은 월말 결산 과제 4개를 평균 수십 분에 걸쳐 풀었고, 프런티어 모델은 10분 안에 거의 만점을 받았습니다. 18개월 전에는 모델이 사람 평균(약 37%)에도 못 미쳤습니다. 이 글은 ‘중간 길이·정의가 명확한 업무’라는 모양이 왜 핵심인지, 중소기업이 AI 도입 전에 사람 기준선을 어떻게 재야 하는지, 검토 체인과 도구 버전 관리를 어떻게 바꿔야 하는지 정리합니다.

LeanX 편집팀·2026년 10월 2일·수정 2026년 10월 3일·11분 읽기·11
AI가 주니어 회계사를 이긴 건 ‘직무’가 아니라 ‘업무의 모양’이다: 중소기업이 먼저 재야 할 기준선
바로 답하면: Mercor가 2026년 10월 1일 공개한 연구에서 공인회계사(CPA) 12명은 월말 결산 과제 4개를 과제당 수십 분에서 세 시간까지 걸려 풀었고 점수는 0~90%에 흩어졌습니다. 프런티어 모델은 같은 과제를 10분 안에 거의 만점으로 풀었고, 과제 기준당 비용은 사람의 10분의 1 아래였습니다. 핵심은 ‘회계사’라는 직무가 아니라 중간 길이·정의가 명확·파일을 뒤져 숫자를 맞추는 업무의 모양입니다. 중소기업은 그 모양의 업무를 골라 사람의 시간·정확도·비용 기준선을 먼저 재고, 검토 체인을 다시 짜는 것부터 시작하면 됩니다.

Wharton의 Ethan Mollick 교수는 2026년 10월 2일 LinkedIn에 한 문장을 인용했습니다. “중간 길이의 잘 정의된 회계 과제에서 프런티어 AI 모델은 이제 주니어 회계사보다 빠르고 정확하다. 우리 연구에서 가장 잘한 사람보다도.” 그리고 덧붙였습니다. 18개월 전에는 같은 모델이 사람 회계사보다 한참 아래였다고요. 출처는 AI 평가 데이터 회사 Mercor의 연구원 Aden Barton이 쓴 글 “Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants”입니다.

이 글은 그 연구를 과장 없이 옮기고, 결론을 ‘회계사 대체’가 아니라 ‘업무의 모양’으로 읽습니다. 지난 글 FDE가 기업에 들어가서 하는 일이 “고치기 전에 세라”였다면, 이번 글은 “무엇을 세야 하는가”입니다. 연구진이 밝힌 한계부터 적습니다. 과제는 AI가 가장 잘하는 기술만 측정했고, 고객 소통과 맥락 쌓기는 측정하지 않았습니다.

1. 연구가 실제로 한 일

Mercor는 자사 벤치마크 APEX-Accounting의 과제를 단순화해 주니어 회계사 12명에게 풀게 했습니다. 전원 CPA 자격자, 평균 경력 약 5.5년입니다. 과제는 월말 결산 시나리오 4개로, 회사의 작업 파일을 뒤져 맞는 숫자를 찾고, 계산하고, 결과를 표로 제출하는 형태입니다. 원래는 ‘AI가 사람을 얼마나 돕는가’를 재려 했지만 모델 단독 점수가 만점이어서 보조 효과를 잴 여지가 없었고, 결국 사람 단독 대 AI 단독 비교가 됐습니다.

항목연구가 밝힌 사실LeanX의 해석
참가자주니어 회계사 12명, 전원 CPA, 평균 경력 약 5.5년‘주니어’라 해도 자격과 경력이 있는 사람입니다. 중소기업 실무자와 비교하면 오히려 유리한 집단입니다.
과제월말 결산 시나리오 4개. 파일 탐색 → 계산 → 표 제출경리·재무·구매·정산에서 매달 반복되는 ‘파일 뒤져 숫자 맞추기’와 같은 모양입니다.
사람 성적과제당 30~180분, 점수 0~90%. 18개월 전 조사에서 사람 평균은 약 37%과제 설계자는 주니어 30%, 중간 55%를 예상했습니다. 숫자 하나를 놓치면 점수가 크게 떨어지는 설계입니다.
모델 성적프런티어 모델은 과제당 10분 미만, 거의 만점. 18개월 전에는 사람 평균 아래속도보다 ‘18개월’이 중요합니다. 지금 못 하는 업무도 내년에는 모양만 맞으면 됩니다.
비용과제 기준당 비용이 사람보다 10배 이상 낮음검토 비용은 여기 빠져 있습니다. 결과를 확인하는 사람의 시간은 따로 재야 합니다.
한계세부 지시 따르기·파일 탐색·숫자 정확도만 측정. 고객 소통·질문·맥락 쌓기는 미측정. 동료·업무 맥락 없는 조건그래서 결론은 ‘회계사 대체’가 아니라 ‘이 모양의 업무는 AI가 먼저’입니다.

연구진은 “결과가 도발적이어서 오해를 우려해 공개하지 않을까도 고민했다”고 썼습니다. 그만큼 한계 서술이 길고, 이 글도 그 한계를 그대로 옮깁니다.

2. 직무가 아니라 ‘업무의 모양’이 단위다

연구가 측정한 업무에는 세 가지 특징이 있습니다. 첫째 중간 길이입니다. 한 줄 질문도, 몇 주짜리 프로젝트도 아니고 사람이 30분에서 세 시간 걸리는 덩어리입니다. 둘째 정의가 명확합니다. 무엇을 찾아 어떤 표로 내야 하는지가 정해져 있습니다. 셋째 세부에 민감합니다. 파일 여러 개를 오가며 숫자 하나를 놓치면 결과가 틀립니다. 이 세 가지가 겹치는 업무는 회계에만 있지 않습니다. 매출 마감표 만들기, 거래처별 미수금 대사, 급여 정산 전 근태 취합, 세금계산서와 입금 내역 맞추기, 월간 광고비 집계가 모두 같은 모양입니다.

중소기업 대표가 흔히 묻는 “우리 경리 업무를 AI가 할 수 있나요”는 답하기 어렵습니다. 경리는 직무이고, 그 안에는 모양이 다른 업무 수십 개가 섞여 있기 때문입니다. 질문을 바꾸면 답이 나옵니다. “경리 업무 중 파일을 뒤져 숫자를 맞추는, 30분 넘게 걸리는, 결과 형식이 정해진 일이 몇 개인가.” 그 목록이 AI가 먼저 맡을 후보이고, 거래처와 통화하거나 사장 의중을 읽어 처리하는 일은 뒤로 미룹니다. 연구진이 측정하지 않았다고 밝힌 바로 그 영역입니다.

3. 벤치마크에 사람 기준선이 없었다는 교훈

이 연구의 제목은 ‘사람 기준선(Human Baselines)’입니다. 벤치마크 점수는 몇 년 사이 치솟았는데 미국 생산성 통계에는 거의 나타나지 않는 “1조 달러의 역설”을 풀려면, 벤치마크가 실제 업무와 어떻게 이어지는지, 그리고 사람은 같은 일을 어떻게 하는지를 알아야 한다는 문제의식에서 시작했습니다. 중소기업 버전은 더 단순합니다. AI를 들이기 전에 사람이 지금 그 일을 얼마나 걸려, 얼마나 정확하게, 얼마에 하는지를 적는 것입니다.

LeanX가 현장에서 보는 실패는 대부분 여기서 갈립니다. 기준선이 없으면 AI가 20분 만에 끝낸 정산표가 “원래 금방 하던 일”로 기억되고, 틀린 숫자 하나가 “역시 AI는 못 믿어”로 남습니다. 기준선이 있으면 같은 사건이 “사람 90분·오류 2건 → AI 12분·오류 1건·검토 15분”으로 적히고, 다음 달에 검토 기준을 고칠 수 있습니다. 지난 글 모델 경쟁과 평가 세트에서 말한 ‘우리 회사 평가 세트’가 바로 이 표입니다.

4. 검토 체인을 다시 짜지 않으면 비용이 돌아온다

연구는 과제 기준당 비용이 사람보다 10배 이상 낮다고 밝혔지만, 그 비용에는 검토가 빠져 있습니다. Mollick의 게시글에 달린 한 댓글은 이 점을 짚습니다. 실제 결산에서는 여전히 책임자가 최종 확인에 서명하고, 자기가 하지 않은 일을 검토하는 것은 자기 일을 검토하는 것보다 느리다는 것입니다. 생산성 통계의 지연은 “옛 검토 체인에 모델을 덧붙이고 누가 무엇을 확인하는지는 다시 설계하지 않는” 회사들에 있을 것이라는 추정입니다. 이 댓글은 개인의 의견이지만, 중소기업 현장과 정확히 맞습니다.

검토 체인을 다시 짜는 방법은 세 가지입니다. 첫째, 사람이 만든 결과를 사람이 보던 체인을 ‘AI가 만든 결과를 사람이 본다’로 바꿀 때 검토 항목을 줄이지 말고 바꿉니다. 전부 다시 계산하는 대신 합계 일치, 전월 대비 이상치, 거래처 수 변동처럼 틀렸을 때 가장 비싼 지점 다섯 개만 확인합니다. 둘째, AI에게 결과와 함께 근거 파일과 셀 위치를 적게 합니다. 검토가 ‘다시 찾기’에서 ‘따라가기’로 바뀝니다. 셋째, 틀린 건을 기준선 표에 적어 다음 달 검토 항목을 고칩니다. 연구에서 사람 점수가 0~90%로 흩어진 것처럼, AI도 과제 유형에 따라 흩어지므로 유형별로 봐야 합니다.

5. ‘덜 만들어진 도구’를 받아들이되 버전은 요구한다

Mollick은 같은 주에 다른 게시글에서 프런티어 모델을 가진 연구소들은 “반쯤 만든 제품”을 내놓아도 AI가 알아서 빈틈을 메우기 때문에 놀랄 만큼 잘 작동한다고 썼습니다. 문서가 부족하고, 예고 없이 바뀌고, 가끔 깨지지만, 그래도 잘 만든 전통 제품보다 나을 때가 많고 회사들은 그냥 적응하고 있다는 관찰입니다. 그 글에 달린 한 기술 임원의 댓글은 반대편을 짚습니다. 전통 제품은 버전으로 승인하는데, 행동이 모델에서 나오는 제품은 월요일에 보안 검토를 통과하고 금요일에 전혀 다르게 동작할 수 있으며 그걸 증명할 기록이 없다는 것입니다. 그가 제안한 것은 소박합니다. 공급사가 문서로 명시하는 버전 식별자와 행동 변경에 대한 사전 고지 기간을 조달 조건에 넣으라는 것입니다.

중소기업에 옮기면 이렇게 됩니다. 결산·정산처럼 숫자가 걸린 업무에 쓰는 AI 도구는 모델명과 버전을 기준선 표에 함께 적고, 모델이 바뀐 달은 같은 과제 20건으로 다시 점수를 냅니다. 연구가 보여준 ‘18개월 만에 0%에서 만점’은 반대 방향으로도 움직일 수 있기 때문입니다. 도구가 덜 만들어졌어도 쓰되, 우리 쪽 평가 세트가 버전 관리의 역할을 하게 하는 것입니다.

6. 2주 실행 카드: 업무의 모양부터 고르고 기준선을 잰다

아래 카드는 연구의 설계를 회사 안에서 쓰는 버전입니다. 회계사를 뽑아 실험하는 대신, 지금 그 일을 하는 담당자의 한 달을 기준선으로 씁니다.

[2주 실행 카드 — 업무의 모양과 사람 기준선]
1주차: 모양 고르기
  월: 경리·정산·구매·영업관리에서 매달 반복되는 업무를 전부 적는다 (___개)
  화: 각 업무에 세 가지 표시 — 중간 길이(30분~3시간) / 정의 명확(결과 형식 있음) / 세부 민감(파일 여러 개)
  수: 세 가지가 다 붙은 업무만 남긴다 (___개) → 거래처 통화·판단이 섞인 일은 뒤로
  목: 그중 1개를 고르고 담당자가 지난달에 한 실제 건 20건을 모은다 (입력 파일 + 결과표)
  금: 사람 기준선 — 건당 시간 ___분 / 오류 건수 ___ / 건당 비용(시간×시급) ___원 / 검토자 시간 ___분
2주차: AI 기준선과 검토 체인
  월: 같은 20건을 AI에 맡긴다. 결과와 함께 근거 파일·셀 위치를 적게 한다
  화: 채점 — 합격 ___건 / 틀린 유형 ___ / 건당 시간 ___분 / 모델명·버전 ___
  수: 검토 항목 5개 정하기 (합계 일치 / 전월 대비 이상치 / 거래처 수 / 날짜 범위 / 음수·공란)
  목: 사람이 AI 결과를 검토하는 시간 ___분 → 사람 기준선의 검토 시간과 비교
  금: 한 표로 정리 — 사람 vs AI: 시간·오류·비용·검토 시간. 다음 달 같은 표를 다시 채운다
종료 기준: 대표가 "이 모양의 업무 ___개 중 1개는 AI가 먼저 하고 사람은 5개 항목만 본다"를 숫자로 말할 수 있다

이 카드의 1주차가 LeanX AX 컨설팅의 2주 진단에서 하는 일이고, 2주차가 2주 구축에서 하는 일입니다. 회사 규모가 작을수록 업무 목록은 짧고 기준선은 빨리 나옵니다.

자주 묻는 질문

이 연구는 회계사가 AI로 대체된다는 뜻인가요? 연구진 스스로 아니라고 밝힙니다. 과제가 세부 지시 따르기, 파일 탐색, 숫자 정확도처럼 AI가 가장 잘하는 기술만 측정했고, 고객 소통·질문하기·맥락 쌓기는 측정하지 않았습니다. 동료도 업무 맥락도 없는 조건이 사람에게 불리했다고도 적었습니다.

중소기업은 회계사가 없는데 무엇을 재야 하나요? 직무가 아니라 업무의 모양을 봅니다. 파일 여러 개를 뒤져 숫자를 찾고 계산해 표로 내는, 중간 길이에 정의가 명확한 업무를 골라 담당자의 시간과 오류율을 먼저 적습니다. 그 숫자가 기준선입니다.

AI가 만점이면 사람 검토는 없애도 되나요? 아닙니다. 최종 서명자는 남습니다. 다만 검토 항목을 ‘전부 다시 계산’에서 ‘틀리면 가장 비싼 지점 다섯 개’로 바꾸고, AI에게 근거 위치를 적게 해 검토를 따라가기로 만듭니다.

출처: Aden Barton, “Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants”, Mercor Research (2026년 10월 1일 게시), Ethan Mollick의 LinkedIn 게시글(2026년 10월 2일)과 같은 계정의 10월 1일 게시글을 2026년 10월 2일 확인했습니다. 참가자 수·경력·과제 구성·점수 범위·시간·비용 배수·한계는 Mercor 글의 서술이며, 모델별 세부 수치는 원문 그래프와 논문에 있어 이 글에서는 범위만 옮겼습니다. Mercor는 AI 평가 데이터를 파는 회사이므로 연구에 이해관계가 있습니다. 검토 체인과 버전 식별자에 관한 내용은 두 게시글에 달린 개인 댓글의 의견이며, 중소기업 적용과 2주 실행 카드는 LeanX의 편집 해석입니다.

자주 묻는 질문

이 연구는 회계사가 AI로 대체된다는 뜻인가요?

연구진 스스로 아니라고 밝힙니다. 과제가 세부 지시 따르기, 파일 탐색, 숫자 정확도처럼 AI가 가장 잘하는 기술만 측정했고, 고객 소통·질문하기·맥락 쌓기 같은 비정형 업무는 측정하지 않았습니다. 동료도 없고 업무 맥락도 없는 조건이 사람에게 불리했다고도 적었습니다. 2026년 10월 2일 확인한 Mercor 블로그 기준입니다.

중소기업은 회계사가 없는데 무엇을 재야 하나요?

직무가 아니라 업무의 모양을 봅니다. 파일 여러 개를 뒤져 숫자를 찾고 계산해 표로 내는 일, 즉 중간 길이에 정의가 명확하고 세부에 민감한 업무를 골라, 담당자가 걸리는 시간과 틀리는 비율을 먼저 적습니다. 그 숫자가 AI 도입 전의 기준선이고, 도입 후 같은 표를 다시 채우면 효과가 드러납니다.

AI가 만점이면 사람 검토는 없애도 되나요?

아닙니다. 연구의 과제는 숫자 하나를 놓치면 점수가 크게 떨어지도록 설계됐고, 실제 결산에서는 최종 서명자가 남습니다. 다만 사람이 처음부터 만드는 체인에 AI를 끼워 넣는 대신, AI가 만든 결과를 사람이 어디서 어떤 기준으로 확인할지 다시 설계해야 합니다. 남이 한 일을 검토하는 것은 자기 일을 검토하는 것보다 느리다는 점을 감안해야 합니다.

우리 회사에서 ‘파일 뒤져서 숫자 맞추는’ 업무가 몇 개인지, 담당자가 몇 분 걸리는지 이번 주에 한 번만 재 보세요.

무료 AX 자가진단

같은 주제에서 이어 읽기

전체 글