anthropic

에이전트 코딩과 전문성의 지속적 수익

요약

Claude Code 사용 데이터를 분석한 결과, 에이전트 코딩은 '무엇을 할지'는 사람이, '어떻게 할지'는 AI가 결정하는 명확한 분업이 이루어지고 있음을 보여줍니다. 코딩 능력보다는 도메인 전문성이 성공적인 작업의 핵심 요소로 떠오르고 있습니다.

인사이트

  • 에이전트 코딩에서는 사람이 '무엇을 할지' 기획하고, AI(Claude)가 '어떻게 할지' 실행하는 명확한 분업 체계가 확립되었습니다.
  • 코딩 숙련도보다 도메인 전문성이 에이전트 코딩 도구의 효과적인 사용과 성공에 더 큰 영향을 미칩니다. 특정 분야에 대한 이해가 깊을수록 Claude를 더 잘 지시하고 더 많은 작업을 수행하게 할 수 있습니다.
  • 에이전트 코딩 덕분에 소프트웨어 엔지니어가 아닌 다른 직업군에 속한 사람들도 코딩 작업을 소프트웨어 전문가와 거의 비슷한 성공률로 수행할 수 있게 되었고, 이는 노동 시장에서 코딩 배경의 중요성을 낮추고 있습니다.

왜 중요한가

이 연구는 에이전트 코딩 도구가 단순히 코딩 작업을 자동화하는 것을 넘어, 노동 시장의 가치와 직무 역량의 중요성을 어떻게 변화시키고 있는지 보여줍니다. 코딩 능력보다는 문제 해결에 대한 깊은 이해, 즉 도메인 전문성이 더 중요해지고 있다는 점은 앞으로 AI 시대에 우리가 어떤 역량을 키워야 할지 명확한 방향을 제시해 줍니다. 특히 비개발자도 기술적인 작업을 성공적으로 수행할 수 있게 됨으로써, 더 많은 사람이 AI를 활용해 생산성을 높일 수 있는 가능성을 열어주고 있습니다.

에이전트 코딩과 꾸준히 이어지는 전문성 수익

주요 발견 내용

  • 이전 연구앤트로픽 팀의 작업 방식 변화에 대한 연구를 바탕으로, 앤트로픽 팀은 2025년 10월부터 2026년 4월까지 약 40만 건의 Claude Code 세션을 개인 정보 보호 분석으로 연구해서 대화형 에이전트 코딩에 대한 프레임워크를 만들었어요. 앤트로픽 팀은 작업 구성, 인간-AI 협업, 그리고 성공률을 평가했답니다.
  • 일반적인 세션에서, 사용자는 대부분의 기획 결정(무엇을 할지)을 내리고 Claude는 대부분의 실행 결정(어떻게 할지)을 내려요. 사용자가 세션에 더 많은 도메인 전문성을 가져올수록, Claude는 지시당 더 많은 작업을 처리하는 경향을 보여요. 코딩 작업에서 모든 주요 직업군은 소프트웨어 엔지니어와 거의 같은 성공률(사람이 하려던 일을 테스트 통과나 커밋된 작업 같은 검증 가능한 증거를 통해 달성하는 것)을 보였어요.
  • 사용자가 도메인 전문성이 많을수록 세션은 더 자주 성공으로 끝나요. 다만, 중급 사용자와 전문가 사용자 간의 격차는 그리 크지 않았어요. 앤트로픽 팀이 관찰한 7개월 동안 디버깅에 소요된 세션의 비중은 거의 절반으로 줄었고, 사용 방식은 코드 배포 및 실행, 데이터 분석, 비(非)코드 문서 작성 등 더 포괄적인 에이전트 사용으로 전환되는 모습을 보였어요.
  • 이 7개월 동안, 앤트로픽 팀이 프리랜서 구인 게시글과의 비교를 통해 추정한 일반적인 작업의 가치는 거의 모든 종류의 작업에서 평균 약 25% 정도 상승했어요.

서론

에이전트 코딩이 그야말로 대세가 되었어요. 2025년 말부터 코딩 에이전트 활동이 있는 GitHub 프로젝트의 비중이 2배 이상 늘었고, 1 Claude Code 사용자들은 이제 이 도구를 사용하며 주 평균 20시간을 보내고 있다고 해요.2 그렇다면 공식적인 코딩 경험이 없는 사람들도 복잡한 기술 작업을 에이전트에게 성공적으로 지시할 수 있을까요? 또, 이런 도구들의 빠른 채택과 개선은 지식 노동 전반에 어떤 의미를 가질까요? 아직 이 질문들에 대한 완벽한 답은 없지만, 앤트로픽 팀은 Claude Code 사용 데이터를 통해 초기 신호들을 살펴보았어요.

이 보고서는 2025년 10월부터 2026년 4월까지 약 23만 5천 명의 사용자로부터 얻은 약 40만 건의 대화형 세션을 개인 정보 보호 분석을 기반으로 Claude Code가 실제로 어떻게 사용되는지에 대한 증거를 제공하고 있어요. 이 연구는 Claude Code 세션의 자율성 측정Claude Code가 앤트로픽 팀의 작업 방식을 어떻게 변화시키고 있는지에 초점을 맞춘 이전 연구들을 기반으로 하고 있답니다.3 여기서 앤트로픽 팀은 대화형 AI 코딩 어시스턴트 사용법, 즉 어떤 종류의 작업이 수행되는지, 누가 수행하는지, 그리고 성공 여부를 설명하는 프레임워크를 소개하고 있어요. 앤트로픽 팀은 명령줄 인터페이스(CLI), Claude.ai, 또는 Claude Code 데스크톱 앱을 통한 Claude Code 사용에 중점을 두었답니다.4 모델의 능력이 향상됨에 따라 에이전트 코딩 사용 방식이 어떻게 변하는지 추적함으로써, 앤트로픽 팀은 이러한 도구들이 코딩 전문가와 지식 노동자들의 노동 시장에 어떤 영향을 미치는지 더 잘 이해할 수 있어요.

Claude Code에서 일어나는 일은 에이전트가 코딩이 아닌 다른 작업에도 통합되면서 지식 노동이 어디로 향할지에 대한 미리 보기일 수도 있어요. 앤트로픽 팀은 Claude가 더 복잡하고 가치 있는 작업을 처리하고 있다는 것을 발견했어요. 동시에, 에이전트 코딩에는 명확한 분업이 존재해요. 즉, 사람들은 무엇을 만들지 결정하고, 에이전트는 그것을 어떻게 만들지 결정하는 거죠.

또한 앤트로픽 팀은 코딩 숙련도가 아닌 도메인 전문성이 도구를 효과적으로 사용하는 데 더 큰 영향을 미친다는 증거를 보았어요. 특히 도메인 전문가들은 더 자주 성공하고, 오류나 오해에서 더 쉽게 회복하는 경향을 보여요. 하지만 전문가와 중급 사용자 간의 격차는 그리 크지 않은데요, 이는 해당 도메인에 대한 숙련도만으로도 깊은 숙달도를 가진 사람들만큼 효과적으로 도구를 사용할 수 있다는 걸 시사해요.

이러한 발견은 노동 시장의 가능한 변화에 대한 초기 통찰력을 제공해 줘요. 앤트로픽 팀의 데이터에서 성공은 사람이 해결하려는 문제를 얼마나 잘 이해하는지에 따라 결정되지, 코딩 교육을 받았는지 여부가 아니었답니다. 이러한 패턴이 경제 전반에 걸쳐 유지된다면, 에이전트 코딩 도구가 일부 구현 중심의 작업을 흡수하는 동시에, 직무에서 해결하는 문제에 대한 확고한 이해를 가진 사람들에게 보상을 제공할 것이라는 점을 시사해요. 코딩 에이전트가 도메인 전문성을 대체하는 것이 아니라, 작업자가 에이전트에게 더 많은 이해를 제공할수록 에이전트가 더 양질의 작업을 수행할 수 있게 되는 거죠.

업무 분담

사람들은 Claude Code를 무엇에 사용할까요?

사람들이 Claude Code를 무엇에 사용하는지 알아보기 위해, 앤트로픽 팀은 각 세션을 아홉 가지 작업 모드 중 하나로 분류했어요. 이 아홉 가지 모드는 세션이 달성하려는 목표를 가장 잘 설명하는 단일 활동이랍니다.5 네 가지 모드는 직접적으로 코드를 작성하거나 유지 관리하는 작업과 관련이 있어요. 예를 들어 새로운 것을 만들거나, 고장 난 것을 고치거나, 코드를 테스트하거나, 다른 에이전트나 자동화된 파이프라인을 조정하는 식이죠. 또 다른 카테고리는 소프트웨어를 운영하는 것, 즉 배포, 구성, 파이프라인 실행, 시스템 모니터링 등이 있어요. 두 가지 카테고리는 '무엇을 할지'를 파악하는 데 더 중점을 둬요. 기존 시스템이 어떻게 작동하는지 이해하거나, 변경하기 전에 계획을 세우는 것이죠. 그리고 코드와 관련 없거나 코드가 최종 제품에 부수적인 역할을 하는 두 가지 활동도 있어요. 데이터를 분석하고 프리젠테이션이나 다른 산문 형식의 문서를 통해 소통하는 것이랍니다.

세션의 약 56%는 코드 작성(25%), 수정(26%), 또는 테스트 및 조정(5%)으로 구성되어 있었어요. 소프트웨어 운영은 17%를 차지했고, 14%의 세션은 계획 또는 탐색이었으며, 13%는 분석 또는 산문 작성을 수행했답니다 (그림 1).

Figure 1: The nine modes of workEach interactive session is classified into the single mode that best describes what it is trying to accomplish.

앤트로픽 팀은 모델이 세션의 기록을 읽게 한 다음, 개인 정보 보호 분석 도구를 사용해서 각 세션을 분류해요. 그리고 이 분류 결과를 코드 라인이 추가되거나 삭제되었는지 여부를 포함하여 모든 세션에 대해 자동으로 기록되는 원격 측정 데이터와 비교해서 확인하죠. 두 출처는 높은 일치도를 보여주는데, 예를 들어 분류기가 코드 생성 또는 수정으로 분류한 세션의 90% 이상에서 원격 측정 데이터에서도 코드 변경이 나타났어요. 자세한 내용은 부록을 참고해 주세요.

누가 무엇을 결정할까요?

Claude Code는 얼마나 자율적일까요? 성능 평가 결과를 보면 그 잠재력은 높고 계속 상승하고 있어요. METR의 시간 지평선 평가 같은 벤치마크에서는 최첨단 모델들이 이제 사람이 몇 시간 걸릴 소프트웨어 작업을 도중에 장애물을 헤쳐나가면서 자율적으로 완료할 수 있게 되었다고 해요. 하지만 실제 사용 환경에서는 어떤 모습일까요? 여기서는 실제 세션에서 사용자와 Claude가 얼마나 주도권을 가지는지 살펴보았어요.

앤트로픽 팀은 이 질문을 두 가지 관점에서 탐구했어요. 첫째, 사용자가 Claude에게 결정을 얼마나 맡기는지에 초점을 맞췄고요, 둘째, Claude에게 얼마나 많은 행동을 위임하는지 살펴보았어요. 세션에서 의사 결정의 분담을 이해하기 위해, 앤트로픽 팀은 세션 내용을 기반으로 개인 정보 보호 결정 귀속 분류기를 구축했어요. 분류기에게 세션 내의 모든 의미 있는 결정을 나열하도록 요청했죠. 앤트로픽 팀은 이 결정들을 기획(무엇을 할지, 어떤 접근 방식을 취할지, 무엇이 완료된 것으로 간주할지)과 실행(어떤 파일을 변경할지, 어떤 코드를 작성할지, 어떤 언어로 작성할지, 어떤 명령을 실행할지)으로 분리했어요. 그런 다음 분류기는 각 결정을 Claude 또는 사용자에게 귀속시켰고, 모든 세션에 두 가지 숫자, 즉 사용자의 기획 결정 점유율과 사용자의 실행 결정 점유율을 부여했답니다.

평균적으로, 사람들은 기획 결정의 약 70%를 내리지만 실행 결정은 20%만 내렸어요 (그림 2). 실제로 에이전트 코딩에서는 명확한 분업이 존재해요. 즉, 사람들은 무엇을 만들지 결정하고, 에이전트는 그것을 어떻게 만들지 결정하는 거죠.

세션에서 행동 위임을 이해하기 위해 앤트로픽 팀은 세션 내용 대신 세션의 구조를 살펴보았어요. Claude Code 세션은 Claude와 사용자가 프롬프트(사용자로부터)와 행동(Claude가 수행)을 주고받으며 진행돼요. 사용자가 프롬프트를 작성하면 Claude가 작업을 수행하고, 그런 다음 사용자가 또 다른 프롬프트를 작성하는 식으로요. 일반적인 세션에는 이런 상호작용이 약 네 번 정도 이루어져요. 앤트로픽 팀이 관찰한 10월부터 4월까지의 과거 데이터에서, 사용자가 보내는 각 프롬프트는 평균 약 10가지, 때로는 100가지가 넘는 Claude의 행동을 유발했어요.6 각 상호작용에서 Claude는 파일을 읽고, 코드를 편집하고, 명령을 실행하며, 평균 2,400 단어의 결과물을 작성해요.

Claude가 사용자 확인 없이 얼마나 많은 작업을 수행하는지는 주로 누가 결정을 내리는지와 연관되어 있어요. 사용자가 실행 제어권을 유지할 때(즉, 실행 결정의 80% 이상을 내릴 때), Claude는 상호작용당 더 적은 행동(약 8가지)을 취했어요. 반대로 Claude가 기획 제어권을 가질 때(즉, 기획 결정의 80% 이상을 내릴 때), 가장 많은 수의 행동(약 16가지)을 수행했답니다.

Figure 2: Claude's share of planning and execution decisionsDistribution across sessions of the share of planning decisions (what to do) and execution decisions (how to do it) attributed to Claude rather than the user. In the typical session, the user makes about 70% of planning decisions while Claude makes about 80% of execution decisions.

전문성 수준

각 기록에서 Claude는 5단계 척도(초보자부터 전문가까지)로 사용자의 해당 작업에 대한 명백한 전문성을 평가했어요. 전문성 분류기는 세 가지 신호를 확인하는데요, 사용자가 지시를 얼마나 정확하게 구성하는지, Claude에게 무엇을 확인하도록 요청하는지, 그리고 사용자가 Claude를 수정하는 경향이 있는지 아니면 Claude가 사용자를 수정하는 경향이 있는지를 본답니다. 여기서 전문성은 직업 타이틀이나 일반적인 능력과는 상당히 다르다는 점, 그리고 결정적으로 작업 특정적이라는 점에 주목해 주세요. Rust에 대한 첫 질문을 하는 선임 엔지니어는 Rust 초보자인 셈이에요. Python을 한 번도 사용해 본 적 없는 회계사가 Claude에게 Python 스크립트가 어떤 조정 규칙을 반드시 준수해야 하는지 정확히 알려주고 월말 결산 시 잘못 처리된 예외 케이스를 잡아낸다면, 그 회계사는 해당 작업에 대한 전문가인 거죠.

아래 표는 분류기에서 각 전문성 수준을 어떻게 정의했는지 보여주며, 코딩 에이전트 세션의 공개 데이터셋인 SWE-chat에서 가져온 예시 요청도 함께 보여주고 있어요. 초보자로 분류된 대화는 도메인 특정 지식이 내포되지 않은 일반적인 지시를 내려요. 반면 전문가 대화는 코드베이스와 기술 환경에 대한 깊은 지식을 전달하는 것을 볼 수 있답니다.

Table 1: Expertise classifierThe examples paraphrase, anonymize and condense real sessions labeled by our classifiers. Many of the sessions used in the table come from a public dataset of agentic coding sessions, SWE-chat.

앤트로픽 팀은 전문성이 Claude의 출력 및 프롬프트당 활동과 어떻게 관련되는지 정량화했어요. 일반적인 초보자 세션에서는 각 프롬프트가 약 5가지 Claude 행동과 약 600단어의 출력을 유발하는 반면, 전문가 세션에서는 2배 이상 긴 행동 사슬(12가지 행동)과 5배 많은 출력(3,200단어)을 유발했어요 (그림 3). 이러한 초보자 세션과 전문가 세션 간의 격차는 모든 종류의 작업과 모든 작업 가치 범위 내에서 나타났답니다.

이러한 측정값은 에이전트가 얼마나 오래 실행되고 사람들이 자동으로 에이전트의 행동을 얼마나 자주 승인하는지를 추적했던 Claude Code에 대한 이전 보고서의 자율성 측정값을 보완해요. 대조적으로, 앤트로픽 팀의 결정 귀속 측정값은 세션 전체에서 누가 실질적인 결정을 내리는지를 파악하고, 프롬프트당 출력 및 행동 측정값은 각 인간 프롬프트가 Claude로부터 얼마나 많은 자율적인 활동을 유발하는지를 측정하고 있답니다.

Figure 3: Claude does more per prompt for more expert usersClaude produces more actions (left bar) and text output per prompt (right bar) for more expert users. Boxes span the interquartile range (split at the median). Whiskers represent the 5th to 95th percentile. White dots are geometric means. Both upward trends are statistically significant (p < 0.001), as is each adjacent-level step, and they remain significant (at +9% actions and +13% output per expertise level) in a regression controlling for work mode, task value, month, occupation, and model family, with standard errors clustered by user.

누가 Claude Code를 사용하고, 무엇을 위해 사용할까요?

사용자들

누가 이 작업을 수행하는지 이해하기 위해 앤트로픽 팀은 각 사용자의 직업을 세션 기록에서 추론하여 미국 노동통계청(Bureau of Labor Statistics)의 표준 직업 분류(SOC) 분류 체계의 23개 주요 그룹 중 하나에 매핑했어요. 분류기는 세션 시작 시 에이전트가 로드하는 프로젝트 컨텍스트, 파일 이름 및 구조, 참조하는 모든 아티팩트(예: 법률 문서, 임상 데이터, 재무 보고서, 교육 과정 등), 그리고 사용하는 어휘와 같은 신호에만 의존하도록 지시받았답니다.7 코딩 행위 자체를 코딩 전문직의 증거로 취급하지 않도록 명시적으로 지시받았어요. 세션은 소프트웨어 또는 데이터 작업이 사용자의 직업이라는 명확한 신호가 있을 때만 코딩 SOC 코드(컴퓨터 및 수학 직업)로 분류돼요. 예를 들어 변호사가 계약서 폴더에서 누락된 조항을 자동으로 플래그 지정하는 스크립트를 만드는 세션은, 비록 세션의 작업이 주로 소프트웨어일지라도 법률 직업으로 매핑되는 거죠. 사용자의 직업에 대한 신호가 없는 세션은 미분류 상태로 남겨져요.

앤트로픽 팀은 약 70%의 세션에서 직업을 추론할 수 있었어요. 이 중에서 대부분의 소프트웨어 관련 직업을 포함하는 컴퓨터 및 수학 직업은 예상대로 가장 큰 그룹이었답니다. 다음으로 큰 그룹은 비즈니스 및 금융 운영, 예술, 디자인 및 미디어, 관리, 그리고 생명, 물리 및 사회 과학이었어요. 앤트로픽 팀의 샘플에서 가장 빠르게 성장하는 비(非)소프트웨어 직업 그룹은 관리, 영업, 그리고 법률 직업이었죠.

작업들

Claude Code로 수행된 작업의 구성은 2025년 10월부터 2026년 4월 사이에 크게 변했어요. 가장 분명한 변화는 고장 난 코드를 수정하는 데 사용된 세션의 비중이 33%에서 19%로 거의 절반 가까이 줄어든 점이에요 (그림 4). 대신, 코드 주변 작업의 비중이 더 커졌어요. 소프트웨어 운영은 14%에서 21%로 증가했고요. 문서 작성과 데이터 분석은 약 10%에서 20%로 거의 두 배가 되었답니다.

작업 자체의 가치도 더욱 높아졌어요. 앤트로픽 팀은 각 세션의 경제적 가치를 프리랜서 시장에서 해당 작업의 비용이 얼마일지를 묻는 방식으로 추정했는데, 이는 실제 게시글의 공개 데이터셋을 기준으로 보정된 값이랍니다. 이 측정치에 따르면, 평균 세션의 추정 가치는 10월부터 4월까지 27% 상승했어요. 이러한 상승은 다양한 종류의 작업에 걸쳐 나타났답니다. 구축, 운영, 수정 유형의 작업 모두 가치가 약 3분의 1 이상(각각 약 43%, 34%, 32%) 증가했어요. 이 가격 추정치는 대략적인 값이라서, 앤트로픽 팀은 이것을 문자 그대로의 달러 가치로 읽기보다는 주로 시간 경과에 따른 작업 간의 비교를 위해 사용하고 있어요.8 작업 추정기 구성에 대한 자세한 내용은 부록을 참고해 주세요.

Figure 4: The composition and value of Claude Code work, October 2025 to April 2026Share of sessions in each work mode over the seven-month window. The share of sessions fixing broken code fell from 33% to 19%, while operating software, analyzing data, and writing documents grew.

성공은 사용자가 무엇을 가져오느냐에 달려 있어요

작업의 추정 가치는 Claude Code가 사람들이 업무를 수행하는 데 어떻게 도움을 주는지 파악하는 한 가지 방법이에요. 다른 관점은 얼마나 많은 세션이 성공적인지, 그리고 세션의 어떤 특성이 성공과 관련이 있는지를 살펴보는 거죠. 앤트로픽 팀의 모든 성공 측정에서 명확한 패턴을 볼 수 있었어요. 즉, 사람이 세션에서 더 많은 전문성을 보일수록 성공 가능성이 높아진다는 거예요. 대부분의 이득은 전문성 척도의 낮은 끝 부분에 집중되어 있었는데, 초보자 세션과 중급 세션 간의 격차가 중급과 전문가 간의 격차보다 더 컸답니다.

성공적인 세션의 특성으로 넘어가기 전에, 성공을 어떻게 측정하는지에 대해 정확히 짚고 넘어가야 할 것 같아요. 앤트로픽 팀은 사용자의 실제 결과를 관찰할 수 없고, 그들에게 Claude를 통해 원하는 것을 얻었는지 직접 물어볼 수도 없어요. 대신, 앤트로픽 팀은 두 가지 보완적인 기록 기반 측정에 의존하고 있답니다. 첫 번째인 *판단된 성공(judged success)*은 전체 기록을 읽고 사용자가 목표한 바를 달성했는지 여부를 결정하는 분류기에서 나와요(선택지: 성공, 부분 성공, 실패, 명확한 목표 없음). 그런 다음 두 개의 보조 분류기가 해당 판단에 대한 증거의 강도를 평가하여 *검증된 성공(verified success)*을 결정한답니다. 성공 신호 분류기는 검증 가능한 성공 증거를 찾아요. 특히, 작업과 일치하는 커밋 및 풀 리퀘스트와 같은 Git 활동, 테스트 스위트 통과, 그리고 사용자로부터의 명시적인 확인을 살펴보죠. 이 분류기는 세션을 "신호 없음"에서 "약한 신호"(1)를 거쳐 "여러 강력한 신호"(5)까지 점수를 매겨요. 병렬적인 실패 신호는 오류, 실패한 테스트, 재시도, 사용자가 출력에 반발하는 것과 같이 잘못된 일이 발생했다는 증거에 점수를 매긴답니다. 검증된 성공은 세션이 성공적으로 판단되고 최소한 하나의 강력한 검증 가능한 성공 신호가 있을 때만 충족돼요. 세션의 성공 또는 실패 정도에 초점을 맞춘 다음 분석에서는 전체 샘플의 약 7.7%를 차지하는 "명확한 목표 없음"으로 분류된 세션은 제외했어요.

전문성 수익

그렇다면 어떤 종류의 세션이 가장 성공적일까요? 위에서 설명한 세션의 전문성 등급이 세션 성공에 매우 중요하다는 것이 밝혀졌어요.

어떤 사람들은 전문성이 실제 동인이 아닐까 걱정할 수도 있어요. 예를 들어, 전문가들이 단순히 다른 작업을 선택하거나 다른 방식으로 차이를 보일 수도 있다는 거죠. 이 섹션에서 앤트로픽 팀은 같은 종류의 작업을 수행하고, 같은 추정 가치를 가지며, 같은 달에, 같은 주제로, 같은 광범위한 직업군에 속한 사람들의 세션을 비교함으로써 이 걱정을 부분적으로 해소하고, 개인의 평가된 전문성에 따라 결과가 어떻게 달라지는지 살펴보았답니다.

Table 2: Definitions of success and failure derived from classifiersThe examples paraphrase and summarize real sessions from a public dataset of agentic coding interactions, SWE-chat, labeled by our classifiers.

앤트로픽 팀의 모든 성공 측정에서, 사람이 세션에서 더 많은 전문성을 보일수록 세션이 성공할 가능성이 더 높았어요. 초보자로 평가된 세션은 가장 엄격한 측정치인 검증된 성공에 15%의 확률로 도달했고, 최소한 부분 성공은 77%의 확률로 달성했어요. 중급 이상으로 평가된 세션은 검증된 성공에 28-33%의 확률로 도달했고, 부분 성공은 91-92%의 확률로 달성했답니다 (그림 5).

각 측정에서 대부분의 이득은 초보자에서 중급으로 넘어갈 때 발생했어요. 중급과 전문가 사이에서는 그 기울기가 감소했죠. 그림 5의 회귀 분석에 대한 자세한 내용은 부록에서 확인할 수 있어요.

Figure 5: Expertise and how sessions endSession outcomes by the user's rated expertise at the task, on a five-point scale from novice to expert. The left panel includes all sessions. The middle and right panels restrict to sessions that hit trouble (failure signals > 3) and show the share that still end in various definitions of success and failure. Each point is an adjusted rate––we estimate the differences between expertise levels by comparing only sessions that share the same work mode, the same task-value band, the same month, the same task subject, and the same kind of user (software-related occupation or not). Details about the regressions behind these points are in the Appendix. Whiskers are confidence intervals on sample means (most are too small to be visible in this plot). These plots exclude sessions judged by the success outcome classifier to have no clear goal.

유사한 경향은 도중에 어려움에 직면하는 세션에서도 나타났어요. 앤트로픽 팀은 실패 신호가 검증된 실패 증거를 기록할 때 세션이 어려움에 처했다고 말한답니다. 이는 오류, 테스트 실패, 동일한 작업을 여러 번 시도하는 것, 또는 사용자가 좌절하거나 불만을 표현하는 것일 수 있어요. 어려움에 처한 세션 중에서, 초보자로 평가된 세션은 4%가 검증된 성공에 도달한 반면, 전문가로 평가된 세션은 15%가 검증된 성공에 도달했어요(위에 설명된 모든 통제 요소를 고려했을 때) (그림 5). 더 느슨한 측정치를 살펴보면, 최소한 부분 성공의 비율은 초보자의 경우 60%, 중급에서 전문가 세션의 경우 80-81%였답니다.

앤트로픽 팀은 또한 역관계––전문성과 다양한 실패 측정값 간의 관계도 추적했어요. 이 분석에서 실패로 판단된 세션은 부분적으로도 성공하지 못한 세션을 의미해요. 앤트로픽 팀은 문제가 있는 세션이 실패로 판단되고 코드 라인이 한 줄도 작성되지 않았을 때 포기되었다고 말한답니다. 사용자가 초보자로 보이는 세션의 19%가 포기되었고, 다른 모든 사용자의 경우 5-7%에 불과했어요. 다시 말해, 경험이 가장 적은 사용자들은 원하는 결과를 얻기 위해 고군분투할 때 포기할 가능성이 더 높았죠. 전문성의 가치 중 일부는 에이전트를 올바른 방향으로 이끌 수 있는 능력인 것 같아요.9

직업은 전문성보다 덜 중요할 수도 있어요

소프트웨어 관련 직업에 종사하는 사람들은 전체 세션의 약 30%에서 검증된 성공에 도달한 반면, 다른 직업군의 사용자들은 약 26%의 시간 동안 검증된 성공을 이루었어요. 코드를 생성하는 세션(즉, 최소 한 줄의 코드를 추가하거나 수정한 세션)에서는 이 수치가 각각 34%와 29%였답니다 (그림 6). 소프트웨어 관련 직업과 다른 직업 간의 격차는 앤트로픽 팀의 더 느슨한 성공 정의에서는 좁아지는데요, 두 그룹 모두 코드 생성 세션에서 최소한 부분 성공에 각각 89%와 88%의 확률로 도달했어요. 이 5% 포인트의 격차는 작고, 두 그룹 모두의 성공률이 증가했음에도 불구하고 7개월 동안 넓어지거나 좁아지지 않았답니다. 코드 생성 세션에서 앤트로픽 팀의 데이터셋에 있는 10대 주요 직업군 모두 소프트웨어 엔지니어와 성공률 측면에서 7% 포인트 이내의 차이를 보였어요. 관리직은 검증된 성공률이 가장 높았는데, 소프트웨어 엔지니어링 직업군보다 약간 높았죠. 그들의 높은 검증된 성공률은 에이전트를 지시하는 데 도움이 되는 관리 기술을 반영할 수도 있어요. 하지만 이는 앤트로픽 팀의 측정 방식에도 부분적으로 반영될 수 있는데요, 검증은 기록 내의 명시적인 확인에 부분적으로 의존하며, 관리자들이 원하는 것을 얻었을 때 이를 더 명확하게 소통할 가능성이 있기 때문이에요.10

Figure 6: Verified and judged success rates in coding sessions by inferred occupationShare of sessions meeting strict definitions of success––judged success and verified success––among sessions that add or change at least one line of code, by the user's inferred occupational group, for the ten largest groups. Every group is within seven percentage points of software/math users (SOC Code Computer and Mathematical Occupations). Error bars are 95% confidence intervals computed on distinct accounts.

앞으로의 전망

이 보고서의 결과는 에이전트 코딩이 어떤 형태의 지식과 기술은 증폭시키고, 다른 형태는 대체하는 새로운 그림을 제시하고 있어요. 코드를 생성하는 세션에서 모든 주요 직업군은 소프트웨어 관련 직업군과 몇 퍼센트 포인트 차이 내에서 성공률을 보였답니다. 이는 코딩 에이전트가 성공적인 프로그래밍에 있어 코딩 배경의 관련성을 낮추고 있다는 것을 보여줘요.

동시에, 성공적인 세션에서는 도메인 전문성이 더 많이 나타나는 경향이 있었어요. 전문가로 평가된 세션은 초보자로 평가된 세션보다 검증된 성공에 도달하는 빈도가 두 배 이상 높았고요. 세션이 어려움에 처했을 때, 초보자들은 다른 모든 사람보다 몇 배 더 높은 비율로 세션을 포기했어요. 이러한 협업의 형태는 이 그림에 더 많은 색깔을 입혀주는데, 도메인 전문가들은 자신이 내리는 각 지시로 Claude에게 더 많은 작업을 지시할 수 있다는 거예요. 따라서 Claude를 성공으로 이끄는 능력은 코드를 작성하는 능력보다는 도메인에 대한 숙달에서 오는 것이죠. 어떤 분야에서든 이러한 숙달을 가진 사람은 이전에 할 수 없었던 기술 작업을 이제는 할 수 있게 될 거예요. 하지만 그런 전문성이 없는 사람은 같은 도구에서 훨씬 적은 것을 얻게 된답니다. 그리고 이득은 주로 숙련도에서 오지, 완전한 통달에서 오는 것은 아니에요. 도메인에 대한 실질적인 이해만으로도 대부분의 이점을 얻을 수 있고, 깊은 전문화는 그 이상으로 조금 더 추가될 뿐이랍니다.

이러한 발견은 아직 예비적인 결과예요. 대부분의 앤트로픽 팀 연구와 마찬가지로, 세션에서 작성된 코드가 실제로 사용되거나 나중에 폐기되는지, 또는 경제적으로 가치 있는 결과물을 만들어내는지와 같은 실제 결과를 측정할 수는 없었답니다. 또한 이 보고서에서 제외된 비(非)대화형 사용량은 상당한 활동 비중을 차지하고 있어요. 이를 측정하기 위한 프레임워크를 개발하는 것은 향후 연구의 우선순위가 될 거예요. 그리고 모든 세션 분류는 모델이 기록을 읽은 결과에 의존하고 있어요. 부록에서는 앤트로픽 팀의 분류기가 예상되는 방향으로 독립적인 원격 측정 데이터를 추적하며, 대다수 세션에서 강력한 참조 모델과 일치한다는 것을 보여주고 있어요. 하지만 분류기는 대규모로 검증하기 여전히 어렵고, Claude Code 세션은 인간의 레이블이 정답으로 기능하기에는 너무 길고 복잡할 수 있어 추가적인 어려움이 따른답니다.

이 보고서의 그림은 모델, 사용자, 그리고 그들 사이의 업무 분담이 변화함에 따라 계속 업데이트될 거예요. 앤트로픽 팀은 이러한 측정값을 통해 중요한 변화를 실시간으로 추적할 수 있기를 바라고 있어요. 예를 들어, 시간이 지남에 따라 전문성 수익이 감소하기 시작한다면, 이는 모델이 현재 사용자들이 제공하는 필수적인 판단력을 제공하기 시작하고 있으며, 이러한 도구의 이점이 도메인 전문가를 넘어 확대되고 있다는 것을 시사할 거예요. 소프트웨어 직업군 외부 사용자들이 성공적으로 완료하는 코딩 세션의 비중이 계속 증가한다면, 이는 소프트웨어 생산이 단일 직업의 산물이 아니라 모든 분야에서 일상적인 업무의 일부가 되고 있음을 나타낼 수 있답니다. 이러한 변화는 에이전트 코딩의 혜택을 받는 사람과 그 혜택의 정도를 바꾸고, 노동 시장에서 가장 가치 있는 것이 무엇인지에 대한 함의를 가질 거예요.

부록

여기에서 확인할 수 있어요.

인용

@online{hitzig2026agentic,
author = {Zoe Hitzig and Maxim Massenkoff and Eva Lyubich and Shaoyi Zhang and Ryan Heller and Peter McCrory},
title = {Agentic coding and persistent returns to expertise},
date = {2026-06-16},
year = {2026},
url = {https://www.anthropic.com/research/claude-code-expertise},
}

감사의 글

다음 분들께 감사드립니다: Jake Eaton, Sarah Pollack, Hanah Ho, Szymon Sacher, Anton Korinek, Santi Ruiz, Kerry Persen, Ankur Rathi, Alex Tamkin, Heather Whitney, Cat Wu, Kacie Jenkins, Jennifer Martinez, Amie Rotherham, Boris Cherny, Eleanor Dorfman, Miles McCain, and Jack Clark.

각주

첫 번째 연구는 128,000개의 공개 저장소를 다루었는데, 2025년 10월 말 기준으로 프로젝트의 16-23%에서 코딩 에이전트 활동이 감지되었어요.1 동일한 방법론을 사용한 후속 연구에서는 이 기간 이후에 생성된 프로젝트에서 채택률이 두 배 이상 높다는 것을 발견했어요. 에이전트 코딩 활동 감지는 에이전트 공동 저자 태그 및 구성 파일에 의존하는데, 이는 실제 사용량을 과소평가할 가능성이 있답니다.

  • 여기서 측정하는 시간은 Claude Code가 활성화된 시간이지, 사용자가 Claude에게 타이핑하는 실제 작업 시간은 아니라는 점을 참고해 주세요.
  • 또한 Sarkar (2026)Baumann et al. (2026)은 각각 Cursor IDE 세션과 공개적으로 사용 가능한 세션을 연구하여 에이전트 코딩을 이해하는 데 도움이 되는 관점을 제시했어요.
  • 이 보고서에서 다루는 Claude Code 사용량에는 타사 통합 개발 환경(IDE)과 소프트웨어 개발 키트(SDK)를 통해 실행되는 사용량은 제외된다는 점을 참고해 주세요. 또한 사용자가 CLI를 통해 claude -p “<prompt>” 명령으로 단일 프롬프트를 실행하는 "헤드리스" 모드의 세션도 제외했어요. 이러한 사용량은 두 가지 주요 방식으로 다르기 때문에 제외했는데요, 대부분이 프로그래밍 방식이며 Claude Code가 사용자와 대화하는 대신 자동화된 도구 및 파이프라인에 내장되어 있고, 사용자가 있더라도 포함된 표면에서와 같이 사용자의 세션 전체를 볼 수 없기 때문이에요.
  • 이 보고서의 모든 분류기는 별도로 명시되지 않는 한 Claude Sonnet 4.6을 사용했어요. 분류기에 대한 자세한 내용(정확한 전체 텍스트 및 유효성 검사 결과 포함)은 부록에서 확인할 수 있답니다.
  • 프롬프트당 행동의 꼬리 부분이 길어요. 약 2%의 세션은 프롬프트당 평균 100개 이상의 행동을 하고, 약 270개 중 1개는 평균 200개 이상, 약 2,300개 중 1개는 평균 500개 이상의 행동을 한답니다.
  • 이 보고서의 모든 측정값과 마찬가지로, 이러한 추론은 앤트로픽 팀의 개인 정보 보호 분석 도구를 사용하여 생성되었어요. 어떤 연구자도 개별 기록을 읽지 않고, 직업 레이블은 식별 가능한 사용자와 연결되지 않으며, 최소 수 이상의 개별 사용자에 대한 집계만 관찰한답니다.
  • 여기서 취하는 추정 접근 방식은 세션 가치의 절대적인 가치보다는 상대적인 차이를 파악하기 위한 것이에요. 달러 금액은 프리랜서 시장(급여직이 아님)과의 비교를 기반으로 하며, Claude Code 세션과 구인 게시물 간의 궁극적으로 모호한 일치에서 비롯된답니다. 상대적인 추정치는 이러한 문제에서 일관된 편향을 제거할 것이므로, 앤트로픽 팀은 상대적 추정치에 더 중점을 두었어요.
  • 문제에 대한 조건부 분석은 사용자마다 다른 세션을 선택해요. 전문가들은 전체적으로 문제가 발생할 확률이 더 낮기 때문에, 그들이 겪는 문제 세션은 더 어려운 문제일 가능성이 높아요. 세션의 복잡성을 대변하는 프록시로 세션의 가격 추정치를 사용하면, 문제가 있는 세션의 평균 추정 가치가 전문성 척도의 가장 낮은 부분에서 가장 높은 부분으로 갈수록 거의 두 배가 된다는 것을 알 수 있어요. 따라서 회복률의 격차는 초보자들이 일상적인 문제에서 막히는 반면, 전문가들은 도전적이고 어려운 문제에서 막히는 것을 반영할 수도 있답니다.
  • 모델이 관리자를 잘못 분류하더라도, 사용자가 관리자일 가능성이 높다고 판단하는 데 사용된 신호(아마도 작업이 위임되고 지정되는 방식에서)는 더 큰 성공과 관련이 있는 경향이 있어요. 다시 말해, 관리자처럼 행동하는 것이 더 큰 성공을 가져다줄 수도 있다는 의미랍니다.
anthropic · 원문 보기 · 2026-06-11

이 글은 원문을 한국어로 번역한 것입니다. 저작권은 원 저작자에게 있습니다.