google-developers
Jules로 진짜 중요한 걸 측정해봐요
AI 코딩 에이전트가 수동적인 조수에서 주도적인 엔진으로 진화함에 따라, 구글은 '작업'이 아닌 '목표' 지향적인 에이전트를 평가하기 위한 새로운 벤치마크 방법론을 제시했어요. 실제 버그 수정 이력을 활용해 '그라운드 트루스'를 설정하고, 에이전트의 '인사이트 정책'과 '탐색 예산'이 얼마나 중요한지 예비 결과를 통해 보여줍니다.
google-developers
AI 코딩 에이전트가 수동적인 조수에서 주도적인 엔진으로 진화함에 따라, 구글은 '작업'이 아닌 '목표' 지향적인 에이전트를 평가하기 위한 새로운 벤치마크 방법론을 제시했어요. 실제 버그 수정 이력을 활용해 '그라운드 트루스'를 설정하고, 에이전트의 '인사이트 정책'과 '탐색 예산'이 얼마나 중요한지 예비 결과를 통해 보여줍니다.
anthropic
Claude Code 사용 데이터를 분석한 결과, 에이전트 코딩은 '무엇을 할지'는 사람이, '어떻게 할지'는 AI가 결정하는 명확한 분업이 이루어지고 있음을 보여줍니다. 코딩 능력보다는 도메인 전문성이 성공적인 작업의 핵심 요소로 떠오르고 있습니다.
openai-news
OpenAI의 Codex가 Gartner 매직 쿼드런트에서 AI 코딩 에이전트 리더로 선정되었으며, 엔터프라이즈 배포 역량과 보안 거버넌스에서 강점을 인정받았습니다.