모델이 또 바뀌었다: 프롬프트를 쌓는 회사와 평가·스킬·역할을 쌓는 회사의 차이
Opus 5.5, GPT-6 Sol, Meta Muse가 한 달 안에 쏟아지자 해외 AI 실무자들은 ‘프롬프트 작성을 아예 그만두고 에이전트·평가·스킬을 새 모델에 맞춰 갱신한다’고 말합니다. 이번 주 LinkedIn 논의를 근거로, 중소기업이 모델 갈아타기 대신 쌓아야 할 AI 자산 5가지와 2주 파일럿 카드를 정리합니다.

2026년 10월 1일, Wharton의 Ethan Mollick은 모델 순위 그래프 하나에 “그리고 다시 3파전”이라는 한 줄만 붙여 올렸고, 확인 시점에 좋아요 489개가 달렸습니다. AI 자문가 Allie K. Miller는 지난 7일의 출시를 정리한 글(확인 시점 좋아요 197·댓글 85) 끝에 자신의 계획을 세 줄로 적었습니다. “선제적 개인 에이전트 계속 테스트, 모든 에이전트·평가·스킬을 새 모델 성향에 맞춰 갱신, 그리고 프롬프트 작성은 아예 그만두기.” 같은 날 Miller는 “팀원 몇 명이 Codex로 Claude의 작업을 검수하는데, 우습게 들리지만 효과가 있다”고도 썼습니다.
두 사람의 글은 개인 의견입니다. 그러나 중소기업 대표가 지금 겪는 피로감을 정확히 짚습니다. 모델이 바뀔 때마다 직원들이 만들어 둔 프롬프트가 흔들리고, 어떤 모델을 써야 하는지 회의가 반복되고, “지난달에 잘 되던 게 왜 안 되지”가 이어집니다. 이 글은 그 피로감을 다섯 가지 자산과 2주 파일럿 카드로 바꿉니다. 지난 두 글 마찰이 사라지는 업무와 고객이 사람 대신 에이전트를 보낼 때가 ‘무엇이 바뀌는가’를 다뤘다면, 이번 글은 ‘바뀌어도 남는 것’을 다룹니다.
1. 이번 주 논의를 사실과 해석으로 나눠 읽기
아래 표의 ‘사실’은 해당 글에 적힌 내용이고, ‘해석’은 글쓴이의 전망입니다. 두 글은 광고·파트너십 표시가 있어 그 사실을 함께 적었습니다.
| 글쓴이 (2026년 10월 1일 확인) | 글에 적힌 사실 | 글쓴이의 해석·전망 | 중소기업에 던지는 질문 |
|---|---|---|---|
| Ethan Mollick (Wharton 교수, 개인 글, 좋아요 489) | 모델 순위 그래프에 “다시 3파전”이라고만 적었다. | 선두가 한 달 단위로 바뀐다. | 우리 회사의 모델 선택은 몇 달에 한 번 되돌릴 수 있는 결정인가? |
| Allie K. Miller (AI 자문가, 개인 글, 좋아요 197·댓글 85) | Opus 5.5·Sonnet 5.5, GPT-6 Sol·Luna, Meta Muse가 7일 안에 나왔다. 낮은 위험의 반복 업무(예: CRM 갱신)에는 빠른 모델을 쓰라고 권했다. 자신의 계획은 에이전트·평가·스킬 갱신과 ‘프롬프트 작성 중단’. | 모델 성향이 바뀌면 지시문이 아니라 자산을 갱신해야 한다. | 우리가 가진 것은 프롬프트 모음인가, 평가 세트와 스킬인가? |
| Allie K. Miller (같은 주 다른 글, 웨비나 안내 포함) | Claude Code와 Codex는 많은 일을 똑같이 하며, 팀원 일부는 Codex로 Claude의 작업을 검수한다. | “둘 중 하나”보다 “둘 다”가 답인 경우가 있다. | 영향이 큰 결과물에 두 번째 검수(모델 또는 사람)가 있는가? |
| Rowan Cheung (뉴스레터 운영자, Microsoft 파트너십 표시 글) | Copilot이 Chat·Cowork·Code를 한 화면으로 합치고, 이름·역할·목표를 가진 상시 에이전트 Autopilot을 비공개 미리보기로 낸다. | “묻는 곳, 위임하는 곳, 만드는 곳”이 나뉜다. | 직원들이 AI에게 ‘묻는 일’과 ‘맡기는 일’을 구분해 쓰고 있는가? |
| Molly Graham의 강연을 정리한 Lenny Rachitsky (개인 글) | “AI에게 레고를 넘기는 것은 사람에게 위임하는 것과 다르다. 어떤 레고는 절대 넘기면 안 된다. 모든 지식노동자는 이제 관리자다.” | 일은 사라지지 않고 몇 년마다 완전히 달라진다. | 우리 회사에서 AI에게 넘기지 않을 일의 목록이 있는가? |
| Ethan Mollick (개인 글, Anthropic 연구 인용) | 공개 가중치 모델이 곧 폐쇄형 모델과 같은 보안 위협을 가드레일 없이 만들 것이며, 그 시점이 가깝다. | 그에 맞춰 계획하는 편이 좋다. | 우리 데이터가 어떤 모델·어떤 서버로 나가는지 적어 둔 문서가 있는가? |
표를 한 줄로 줄이면 이렇습니다. 모델은 매달 바뀌지만, 평가·스킬·역할·검수·경계는 바뀌지 않습니다. 중소기업의 AI 자산은 후자입니다.
2. 왜 프롬프트는 자산이 되지 못하는가
많은 회사가 지난 1년 동안 ‘잘 되는 프롬프트’를 노션에 모아 두었습니다. 문제는 그 프롬프트가 특정 모델의 성향에 맞춰 조정된 결과물이라는 점입니다. Miller가 “새 모델 성향(vibes)에 맞춰 갱신한다”고 쓴 이유가 그것입니다. 모델이 바뀌면 같은 프롬프트가 더 장황해지거나, 형식을 무시하거나, 과하게 조심스러워집니다. 그때 회사에 남는 것은 “이 프롬프트가 좋았는데”라는 기억뿐입니다.
자산이 되려면 두 가지가 필요합니다. 첫째, 무엇이 잘된 결과인지 판정할 기준이 모델과 무관하게 적혀 있어야 합니다. 둘째, 업무의 역할·절차·예시가 프롬프트 한 덩어리가 아니라 재사용 가능한 단위(스킬)로 나뉘어 있어야 합니다. 아래 다섯 항목은 그 두 가지를 중소기업 규모로 쪼갠 것입니다.
3. 자산 1: 우리 업무 샘플로 만든 평가 세트
가장 먼저 만들 것은 평가 세트입니다. 거창한 벤치마크가 아니라, 우리 회사가 AI에게 시키는 업무 한 가지당 실제 입력 20~30건과 ‘합격 결과’의 기준입니다. 예를 들어 견적 문의 답변이라면 실제 문의 25건, 각 문의에 대해 반드시 들어가야 할 항목(납기, 단가 조건, 다음 단계)과 들어가면 안 되는 항목(확정되지 않은 할인)을 적습니다.
이 세트가 있으면 새 모델이 나왔을 때 할 일은 30분짜리입니다. 같은 25건을 돌리고, 합격 건수·형식 준수·토큰 비용을 이전 모델과 나란히 봅니다. Miller가 말한 “낮은 위험의 반복 업무에는 빠른 모델”도 이 표가 있어야 결정할 수 있습니다. 세트가 없으면 모델 변경은 회의실의 ‘느낌’ 결정으로 돌아갑니다.
4. 자산 2: 프롬프트가 아니라 스킬(역할·절차·예시)로 쪼갠 지시문
스킬은 “당신은 ○○ 담당자다. 이런 입력이 오면 이 순서로 처리하고, 이 형식으로 내놓는다. 좋은 예시와 나쁜 예시는 이것이다”를 한 파일로 만든 것입니다. 긴 프롬프트와 다른 점은 모델 성향에 기대는 문장(“간결하게”, “창의적으로”)을 빼고, 절차와 예시로 결과를 고정한다는 것입니다. 모델이 바뀌어 장황해지면 예시를 한 줄 추가하면 되고, 지시문 전체를 다시 쓰지 않습니다.
중소기업은 스킬을 많이 만들 필요가 없습니다. 반복 업무 상위 5개(문의 답변, 견적 초안, 주간 보고, 회의록 정리, 거래처 메일)만 스킬로 만들어도 직원 간 결과 편차가 줄고, 새 모델 테스트가 쉬워집니다. 이 다섯 개를 Rowan Cheung의 글에 나온 구분대로 ‘묻는 일(Chat)’, ‘맡기는 일(Cowork)’, ‘만드는 일(Code)’로 나눠 두면 어떤 도구에 붙일지도 분명해집니다.
5. 자산 3: 역할이 있는 에이전트와 넘기지 않을 레고 목록
Cheung이 소개한 Autopilot은 이름·역할·목표를 가진 상시 에이전트입니다(파트너십 글이므로 제품 묘사는 제조사 관점으로 읽는 편이 안전합니다). 도구와 무관하게 중소기업이 가져갈 것은 ‘역할 정의’ 그 자체입니다. “미수금 알림 담당”, “문의 1차 분류 담당”처럼 역할·목표·금지 행동을 한 장에 적어 두면, 어떤 플랫폼의 에이전트를 쓰든 같은 정의를 붙일 수 있습니다.
동시에 Molly Graham의 말처럼 절대 넘기지 않을 레고를 적습니다. 가격 확정, 채용 결정, 고객 불만의 최종 답변, 계약 문구처럼 책임이 사람에게 남아야 하는 일입니다. “모든 지식노동자는 이제 관리자”라는 말은, 직원 각자가 자기 업무 중 넘길 것과 남길 것을 구분해야 한다는 뜻입니다. 이 목록은 모델이 바뀌어도 바뀌지 않습니다.
6. 자산 4: 두 번째 검수 기준 (모델 검수와 사람 표본 검수)
Miller 팀이 Codex로 Claude의 작업을 검수한다는 대목은 중소기업에도 그대로 쓸 수 있습니다. 다만 모든 결과물에 두 번째 모델을 붙일 필요는 없습니다. 결제·발송·계약·대외 문서처럼 영향이 큰 결과물에는 다른 모델(또는 같은 모델의 별도 ‘검수 스킬’)이 기준표로 채점하게 하고, 나머지는 사람이 주 1회 표본 10건을 보는 것으로 충분합니다.
핵심은 검수 자체가 아니라 검수 기준이 문서로 있다는 것입니다. “수치가 원본과 일치하는가, 확정되지 않은 조건을 단정했는가, 금지 표현이 있는가” 같은 기준은 모델이 바뀌어도 남고, 자산 1의 평가 세트와 그대로 연결됩니다.
7. 자산 5: 데이터 경계 문서
Mollick은 공개 가중치 모델이 곧 가드레일 없는 보안 위협을 만들 것이라고 썼습니다. 중소기업 실무에서 이 경고는 한 장의 문서로 번역됩니다. 어떤 데이터(고객 연락처, 단가, 계약서, 직원 정보)가 어떤 도구·어떤 모델·어떤 서버로 나가는지, 나가면 안 되는 데이터는 무엇인지 적는 표입니다. 모델을 바꿀 때 이 표를 먼저 보면, “새 모델이 싸고 좋다”는 이유만으로 고객 데이터가 새 서버로 흘러가는 일을 막을 수 있습니다.
8. 2주 파일럿 카드
다섯 자산을 한 번에 만들 필요는 없습니다. 업무 하나를 골라 아래 카드를 채우면 2주 안에 ‘모델이 바뀌어도 남는 것’이 한 세트 생깁니다.
[2주 파일럿 카드 — 모델이 바뀌어도 남는 AI 자산] 대상 업무 1개: ___ (예: 견적 문의 답변) 평가 세트: 실제 입력 __건 / 합격 기준 3줄: ___ / 금지 항목: ___ 스킬 파일: 역할 ___ / 절차 __단계 / 좋은 예시 2 · 나쁜 예시 2 구분: 묻는 일 ☐ 맡기는 일 ☐ 만드는 일 ☐ 에이전트 역할 정의(선택): 이름 ___ / 목표 ___ / 금지 행동 ___ 넘기지 않을 레고: ___, ___, ___ 검수: 영향 큰 결과물 → 2차 검수 기준 __줄 / 나머지 → 주 1회 표본 __건 데이터 경계: 이 업무에서 외부로 나가는 데이터 ___ / 나가면 안 되는 데이터 ___ 모델 교체 테스트: 새 모델에 같은 __건 실행 → 합격 __건 / 비용 __ / 결정 ___ 종료 기준: 2주 뒤 모델을 바꿔도 스킬·평가·검수 기준을 다시 쓰지 않는다
카드가 채워지면 다음 모델이 나왔을 때 할 일은 맨 아래 한 줄, 모델 교체 테스트뿐입니다. LeanX의 AX 컨설팅은 이 카드를 회사의 반복 업무 5개로 확장하는 일부터 시작합니다.
자주 묻는 질문
지금 쓰는 프롬프트 모음은 버려야 하나요? 아닙니다. 그 안의 절차와 예시를 꺼내 스킬로 옮기고, 모델 성향에 기댄 문장만 지우면 됩니다.
평가 세트를 만들 사람이 없습니다. 담당자가 최근 처리한 업무 20건과 “이건 잘됐다/안 됐다” 판단만 있으면 됩니다. 기준 3줄은 대표나 팀장이 30분이면 적습니다.
모델을 자주 바꾸는 게 맞나요? 자주 바꾸라는 뜻이 아니라, 바꿔도 손해가 없게 만들라는 뜻입니다. 평가 세트가 있으면 바꾸지 않을 근거도 생깁니다.
출처: Ethan Mollick, LinkedIn 게시글 (다시 3파전), Allie K. Miller, LinkedIn 게시글 (지난 7일 출시 정리와 계획), Allie K. Miller, LinkedIn 게시글 (Claude Code와 Codex, 웨비나 안내 포함), Rowan Cheung, LinkedIn 게시글 (Microsoft 파트너십 표시, Copilot 업데이트), Lenny Rachitsky, LinkedIn 게시글 (Molly Graham 강연 정리), Ethan Mollick, LinkedIn 게시글 (공개 가중치 모델과 보안)을 2026년 10월 1일 확인했습니다. 각 글은 해당 인물의 개인 의견이며, 광고·파트너십 표시가 있는 글은 그 사실을 본문에 적었습니다. 모델 출시 시점과 가격 비교는 Miller의 글에 적힌 내용이고, 좋아요·댓글 수는 확인 시점 값입니다. 다섯 가지 자산과 파일럿 카드는 LeanX의 편집 해석입니다.
자주 묻는 질문
‘프롬프트 작성을 그만둔다’는 게 AI를 안 쓴다는 뜻인가요?
아닙니다. 2026년 10월 1일 기준 Allie K. Miller가 쓴 표현으로, 매번 손으로 긴 프롬프트를 쓰는 대신 역할·절차·예시를 담은 스킬(재사용 지시문)과 에이전트, 그리고 결과를 채점하는 평가 세트를 만들어 두고 새 모델이 나오면 그것만 갱신한다는 뜻입니다. 개인 의견이며 회사마다 적용 범위는 다릅니다.
중소기업이 모델을 바꿀 때 가장 먼저 확인할 것은 무엇인가요?
우리 업무 샘플 20~30건으로 만든 평가 세트를 새 모델에 돌려 정확도·형식·비용이 이전 모델보다 나은지 비교하는 것입니다. 평가 세트가 없으면 모델 변경은 ‘느낌’ 결정이 되고, 있으면 30분짜리 결정이 됩니다.
한 모델이 다른 모델의 결과를 검수하게 하는 건 과한가요?
Miller 팀은 Codex로 Claude의 작업을 검수한다고 썼습니다. 중소기업은 결제·발송·계약처럼 영향이 큰 결과물에만 두 번째 모델 검수를 두고, 나머지는 사람 표본 검수로 충분합니다. 핵심은 ‘검수 기준을 문서로 적어 두는 것’이며, 그 기준은 모델이 바뀌어도 그대로 남습니다.
우리 회사가 지금까지 만든 프롬프트 중 다음 모델에서도 쓸 수 있는 것이 몇 개인지 20분 안에 세어 보세요.
무료 AX 자가진단