유튜브에 “클로드로 AI 직원 100명을 고용해서 혼자 회사를 돌린다”는 영상이 늘었습니다. 여러 AI가 일을 나눠 처리하는 멀티에이전트는 실제 서비스에도 쓰입니다. 다만 일반 AI 상담 성과와 멀티에이전트 성과는 다르고, 프로젝트 취소 전망은 측정된 실패율이 아닙니다. 제목의 질문에 답하려면 에이전트 수보다 검증을 통과한 결과 한 건의 총비용과 가치를 비교해야 합니다. 공식 사례와 가정 계산으로 그 판단 기준을 정리합니다.
AI 직원, 멀티에이전트란 무엇인가
도구 없는 대화형 AI는 질문에 답하고, 에이전트는 검색·파일 수정·업무 시스템 입력 같은 도구를 사용해 과제를 수행합니다. 여러 에이전트가 협업하면 멀티에이전트입니다. 일을 나누고 결과를 합치는 역할을 오케스트레이터, 나눈 일을 처리하는 역할을 서브에이전트라고 부릅니다. “AI 직원 100명”은 마케팅 표현일 수 있으며, 실제 직원 수나 수익을 뜻하지 않습니다.
비용부터 봐야 합니다. Anthropic은 자사 리서치 시스템 데이터에서 멀티에이전트가 일반 채팅보다 약 15배의 토큰을 사용했다고 보고했습니다. 모든 모델·업무의 고정 배수는 아닙니다. 성능 개선으로 얻는 가치가 추가 모델 호출과 검토 비용보다 커야 합니다. Anthropic의 관측 범위
누가 실제로 AI 직원을 쓰고 있나 — 공개된 기업 사례
아래 세 자료는 원 개발사·제공사가 공개한 내용입니다. 서로 같은 지표를 측정하지 않으므로 합산 ROI로 쓰지 않습니다. 비용·인간 검토가 빠진 성능 수치를 순이익으로 환산하지도 않습니다.
| 원출처·시점 | 업무·구조 | 공개 결과와 해석 범위 |
|---|---|---|
| Anthropic 2025-06-13 | Claude Research. Opus 4가 리드하고 Sonnet 4 서브에이전트가 병렬 조사 | 자사 내부 리서치 평가에서 단일 Opus 4보다 성능이 90.2% 개선됐다고 보고. 보편 정확도나 ROI가 아니며 총 검토비·순이익은 제시하지 않음 |
| Klarna·OpenAI 2024년 첫 달 사례 | 고객 상담 AI 어시스턴트. 이 자료만으로 멀티에이전트 구조를 확인할 수 없음 | 첫 달 230만 대화, 정규직 상담원 700명분 업무라는 제공사 발표. 업무량 환산이며 700명 해고·순이익이나 멀티에이전트 ROI를 입증하지 않음 |
| Cognition 2025-06-12 | 코딩 에이전트의 작업 맥락 공유에 관한 개발사 설계 글 | 공유 맥락이 필요한 작업에서 단순 분할이 정보 손실을 만들 수 있다고 설명. 수익 수치나 통제된 비용 비교 연구가 아님 |
개인 개발자의 방법론도 참고할 수 있습니다. Geoffrey Huntley가 소개한 Ralph는 에이전트가 지시와 작업 상태를 반복해서 확인하는 방식입니다. 반복 루프 자체는 멀티에이전트를 뜻하지 않습니다. 이를 유튜브 콘텐츠 대부분의 방법론이라고 일반화하거나 언어 전체의 자율 제작 성과로 단정하지 않습니다.
성과 숫자는 같은 대상을 측정했나
Gartner는 2025년 6월 25일 에이전틱 AI 프로젝트의 40% 이상이 2027년 말까지 취소될 것이라고 전망했습니다. 비용 상승, 불명확한 사업 가치, 위험 통제를 이유로 든 미래 예측이며, 2026년 멀티에이전트의 측정 실패율이 아닙니다. 다른 대상과 방법으로 집계된 AI 도입·생산성 수치를 같은 시장의 ROI로 비교하려면 구조, 비용, 측정 기준이 일치하는지부터 확인해야 합니다. Gartner 원 발표
성공과 실패를 가르는 4가지
설계는 중요하지만 모델의 한계, 도구 오류, 업무 특성도 결과에 영향을 줍니다. 다음 네 항목을 작은 작업에서 점검해 보세요.
- 독립된 부분으로 나눌 수 있는가 — 조사 대상을 나누는 일은 병렬화 후보가 됩니다. 같은 문서·파일을 고치면 담당 범위와 합치는 절차를 정하고, 판단에 필요한 공통 맥락을 공유해야 합니다.
- 검증 장치가 있는가 — 완료 조건과 검토 책임자를 정하고, 자동 검사와 사람의 검토 시간을 기록합니다. 도구 실패·재시도·중단 조건도 결과에 포함해야 합니다.
- 실제 업무 시스템에서 가능한가 — 읽기·쓰기 권한, 연결 실패 처리, 결과 저장과 복구를 확인합니다. 특정 조사에서 원인 1위였다는 주장이나 Gartner 취소 전망의 단일 원인으로 단정하지 않습니다.
- 업무 지침과 합격 기준이 있는가 — 필요한 자료, 허용 범위와 완료 조건을 명시합니다. 사람이 쓰든 AI가 초안을 쓰든 실제 업무와 맞는지 검증해야 합니다.
리뷰에 필요한 요구사항과 변경 내용은 제공해야 합니다. 불필요한 긴 로그를 줄일 수는 있지만, 앞선 작업 맥락을 모르면 항상 더 잘한다는 근거는 아닙니다. Cognition도 협업에서 맥락 공유의 중요성을 설명합니다. 설계상의 주의점
멀티에이전트로 돈 버는 4가지 경로
아래는 검토할 수 있는 사업 경로입니다. 각 경로에서 고객의 지불 의사와 유지·검토 비용을 따로 확인해야 하며 수익을 보장하지 않습니다.
- ① 도구를 만들어 판다 — 사용자가 반복해서 해결하려는 문제를 제품으로 묶습니다. 모델 비용뿐 아니라 개발·지원·유지 비용을 가격 안에서 감당할 수 있는지 확인해야 합니다.
- ② 업무 도입을 지원한다 — 업무 분석, 시스템 연결, 검증 절차를 제공하는 방식입니다. 프로젝트 취소 전망만으로 고객 수요가 크다고 결론내릴 수는 없습니다.
- ③ 내 사업의 원가 절감을 검증한다 — 처리시간이 줄어도 검토·수정·연결 비용이 늘 수 있습니다. “몇 명분 업무”를 인건비 현금 절감으로 바로 환산하지 말고 기존 공정의 총비용과 비교하세요.
- ④ 좁은 업무에 맞춘 서비스를 만든다 — 자료 조사나 내부 문서 분류처럼 기준을 명확히 할 수 있는 업무가 후보입니다. 좁은 시장에도 경쟁·유지 비용이 있으므로 특정 개인에게 최적이라고 단정할 수는 없습니다.
클로드 AI 직원, 혼자 시작한다면
사람이 결정해야 할 것은 목표와 합격 기준, 권한과 검토 범위입니다. 모델이 더 많은 일을 하도록 만드는 것과 검증된 결과를 더 저렴하게 얻는 것은 같은 문제가 아닙니다.
먼저 같은 업무를 에이전트 하나로 처리해 기준을 만드세요. 나눌 수 있는 경우에만 2~3개 구조와 비교합니다. 대표 사례 20개 정도로 탐색을 시작할 수 있지만, 이 작은 표본이 보편 정확도나 사업성의 증명은 아닙니다. 같은 사례에서 승인된 완료 건수, 사실 오류, 재시도, 토큰·도구 비용, 사람의 검토·수정 시간을 기록하고 예산·중단 조건을 설정하세요. AI 업무 활용 기본기도 참고할 수 있습니다.
가정으로 계산해 보는 작업 한 건의 비용
실제로 실행한 실험이 아닌 계산 예시입니다. Opus 5.5 기본 요금인 입력 100만 토큰당 4달러·출력 20달러를 사용합니다. 단일 에이전트가 입력 10만·출력 1만 토큰을 쓰면 0.60달러입니다. 여기에 서브에이전트 3개가 각각 입력 5만·출력 5천 토큰을 쓴다고 가정하면 0.90달러가 더해져 모델 비용은 1.50달러입니다. 캐시·생각 토큰·재시도·도구·세금은 별도입니다. 공식 단가
사람의 검토가 건당 10분, 시간비용이 24달러라고 가정하면 4달러가 더해져 총 5.50달러입니다. 기존 사람이 20분을 썼다면 같은 가정에서 8달러지만, 검토가 20분으로 늘어나면 AI 공정은 9.50달러가 됩니다. 모델·도구 요금 + 재시도 + 사람 검토 + 개발·연결·유지 비용을 배분한 금액을 합산해 승인된 완료 건수로 나누어 비교해야 합니다. 이 예시는 특정 사업의 실제 절감액이 아닙니다.
멀티에이전트로 수익을 낼 가능성은 있지만, 에이전트 수가 사업성을 증명하지는 않습니다. 같은 업무 품질에서 추가 검토·운영 비용까지 포함한 결과 한 건의 총비용이 낮아지는지, 고객이 그 결과에 비용보다 큰 금액을 지불하는지부터 확인해야 합니다.
원출처 확인: 2026년 10월 2일. Anthropic 리서치 시스템 · Cognition 설계 글 · Klarna·OpenAI 고객 상담 사례 · Gartner 2027년 전망 · Claude API 요금 · Huntley의 Ralph. 발표 시점과 측정 대상을 본문에서 구분했습니다.
이 글은 정보 제공 목적이며, 특정 기업이나 자산에 대한 투자 권유가 아닙니다.

답글 남기기