anthropic

클로드의 확장된 사고

요약

클로드 3.7 소네트에 '확장된 사고 모드'가 추가되어 복잡한 문제에 대해 더 깊이 생각할 수 있으며, 사고 과정을 투명하게 공개합니다.

인사이트

  • 확장된 사고 모드는 동일한 모델이 더 많은 시간과 노력을 들여 답을 도출하게 하여, 복잡한 문제에서 성능이 크게 향상됨
  • 사고 과정을 공개함으로써 신뢰성과 정렬 연구에 도움이 되지만, 충실성 문제와 보안 위험도 존재
  • 병렬 테스트-시간 컴퓨팅 스케일링을 통해 GPQA 평가에서 84.8%의 높은 점수를 달성하며, 미래 모델 발전 가능성을 보여줌

왜 중요한가

클로드의 확장된 사고 기능은 AI가 더 복잡한 문제를 해결할 수 있는 길을 열었을 뿐만 아니라, 모델의 내부 사고 과정을 투명하게 공개함으로써 신뢰성과 정렬 연구에 기여합니다. 이는 AI 안전성과 성능 간의 균형을 맞추는 중요한 사례입니다.

클로드의 확장된 사고

손과 그 위로 여러 방향으로 뻗어 나가는 노드 집합을 손으로 그린 이미지

어떤 것들은 거의 즉시 떠오릅니다. "오늘은 무슨 요일이지?" 같은 것들이요. 반면에, 난해한 크로스워드 퍼즐을 풀거나 복잡한 코드를 디버깅하는 것처럼 훨씬 더 많은 정신적 지구력이 필요한 일들도 있습니다. 우리는 주어진 작업에 따라 인지적 노력을 더 많이 또는 덜 적용할 수 있습니다.

이제, 클로드도 같은 유연성을 가지게 되었습니다. 새로운 Claude 3.7 Sonnet으로 사용자는 "확장된 사고 모드"를 켜거나 끌 수 있으며, 모델이 더 까다로운 질문에 대해 더 깊이 생각하도록 지시할 수 있습니다¹. 그리고 개발자는 "생각 예산"을 설정하여 클로드가 문제에 얼마나 오래 걸릴지 정밀하게 제어할 수도 있습니다.

확장된 사고 모드는 별도의 전략을 가진 다른 모델로 전환하는 옵션이 아닙니다. 대신, 동일한 모델이 스스로에게 더 많은 시간을 주고, 답을 얻기 위해 더 많은 노력을 기울일 수 있게 하는 것입니다.

클로드의 새로운 확장된 사고 능력은 인상적인 지능 향상을 가져옵니다. 그러나 AI 모델이 어떻게 작동하는지, 어떻게 평가해야 하는지, 어떻게 안전성을 개선할 수 있는지에 관심이 있는 사람들에게는 많은 중요한 질문도 제기합니다. 이 글에서 우리는 얻은 통찰력을 공유하고자 합니다.

가시적인 사고 과정

클로드에게 더 오래 생각하고 더 어려운 질문에 답할 수 있는 능력을 부여하는 것 외에도, 우리는 그 사고 과정을 원시 형태로 보이도록 만들기로 결정했습니다. 여기에는 몇 가지 이점이 있습니다:

신뢰. 클로드가 생각하는 방식을 관찰할 수 있으면 그 답을 이해하고 확인하기가 더 쉬워지며, 사용자가 더 나은 출력을 얻는 데 도움이 될 수 있습니다. 정렬. 이전의 정렬 과학 연구 중 일부에서, 우리는 모델이 내적으로 생각하는 것과 외부적으로 말하는 것 사이의 모순을 사용하여 거짓말과 같은 우려되는 행동에 관여할 때를 식별했습니다. 흥미. 클로드가 생각하는 것을 지켜보는 것은 종종 매혹적입니다. 수학이나 물리학 배경을 가진 연구자 중 일부는 클로드의 사고 과정이 어려운 문제를 추론하는 자신의 방식과 놀랍도록 유사하다고 언급했습니다: 다양한 각도와 추론 분기를 탐색하고, 답을 이중, 삼중으로 확인하는 것입니다.

그러나 가시적인 사고 과정에는 몇 가지 단점도 있습니다. 첫째, 사용자는 공개된 사고가 클로드의 기본 출력보다 더 단절되고 개인적인 느낌이 덜 하다는 것을 알 수 있습니다. 그 이유는 우리가 모델의 사고 과정에 대해 표준 캐릭터 훈련을 수행하지 않았기 때문입니다. 우리는 클로드가 답에 도달하는 데 필요한 어떤 생각이든 할 수 있는 최대한의 여유를 주고 싶었습니다. 그리고 인간의 사고와 마찬가지로, 클로드는 때때로 잘못되었거나, 오해를 불러일으키거나, 완성되지 않은 생각을 하는 경우가 있습니다. 많은 사용자가 이것을 유용하게 여길 것입니다. 다른 사용자들은 (그리고 사고 과정에서 캐릭터가 덜 드러나는 내용) 실망스러워할 수도 있습니다.

또 다른 문제는 이른바 "충실성"입니다. 사고 과정에 있는 것이 실제로 모델의 마음속에서 일어나는 일을 진정으로 대표한다고 확신할 수 없습니다 (예를 들어, 사고 과정에 표시된 영어 단어는 단순히 모델이 특정 행동을 보이는 이유를 설명할 수 없을 수도 있습니다). 충실성의 문제와 그것을 어떻게 보장할 것인가는 우리의 활발한 연구 분야 중 하나입니다. 지금까지의 결과는 모델이 사고 과정에서 명시적으로 논의하지 않는 요소에 기반하여 결정을 내리는 경우가 매우 많다는 것을 시사합니다. 이는 현재 모델의 사고를 모니터링하는 것만으로 안전성에 대한 강력한 주장을 할 수 없다는 것을 의미합니다².

셋째, 몇 가지 안전 및 보안 문제를 제기합니다. 악의적인 행위자는 가시적인 사고 과정을 사용하여 클로드를 탈옥시키는 더 나은 전략을 구축할 수 있을 것입니다. 훨씬 더 추측적으로, 모델이 훈련 중에 자신의 내부 생각이 공개될 것임을 배운다면, 더 예측 불가능한 방식으로 생각하거나 특정 생각을 의도적으로 숨기도록 유도될 가능성도 있습니다.

이러한 후자의 우려는 미래의 더 강력한 Claude 버전에 특히 심각할 것입니다. 잘못 정렬될 경우 더 큰 위험을 초래할 수 있는 버전들이죠. 우리는 향후 릴리스에서 사고 과정을 공개하는 것의 장단점을 저울질할 것입니다³. 그동안 Claude 3.7 Sonnet의 가시적인 사고 과정은 연구 미리보기로 간주되어야 합니다.

클로드 사고의 새로운 테스트

에이전트로서의 클로드

Claude 3.7 Sonnet은 "액션 스케일링"이라고 부를 수 있는 향상된 기능의 혜택을 받습니다. 이는 함수를 반복적으로 호출하고, 환경 변화에 대응하며, 개방형 작업이 완료될 때까지 계속할 수 있는 능력입니다. 그러한 작업의 한 예는 컴퓨터 사용입니다. 클로드는 사용자를 대신하여 작업을 해결하기 위해 가상 마우스 클릭과 키보드 입력을 실행할 수 있습니다. 이전 모델과 비교하여 Claude 3.7 Sonnet은 컴퓨터 사용 작업에 더 많은 턴(그리고 더 많은 시간과 계산 능력)을 할당할 수 있으며, 그 결과는 종종 더 좋습니다.

이는 Claude 3.7 Sonnet이 멀티모달 AI 에이전트의 능력을 측정하는 평가인 OSWorld에서 어떻게 향상되었는지에서 확인할 수 있습니다. Claude 3.7 Sonnet은 처음에는 약간 더 나은 성능을 보이지만, 모델이 가상 컴퓨터와 계속 상호작용함에 따라 성능 차이는 시간이 지남에 따라 커집니다.

OSWorld 평가에서 클로드 3.5 소네트(신규)와 클로드 3.7의 성능을 보여주는 차트. x축은 단계 수, y축은 점수. 두 모델 모두 비슷한 위치에서 시작하여 더 많은 단계에서 성능이 향상되지만, 클로드 3.7 소네트가 더 빠르게 향상됨
The performance of Claude 3.7 Sonnet versus its predecessor model on the OSWorld evaluation, testing multimodal computer use skills. “Pass @ 1”: the model has only a single attempt to solve a particular problem for it to count as having passed.

클로드가 포켓몬을 하다

함께, 클로드의 확장된 사고와 에이전트 훈련은 OSWorld와 같은 많은 표준 평가에서 더 나은 성능을 발휘하는 데 도움이 됩니다. 그러나 또한 다른, 아마도 더 예상치 못한 작업에서 큰 향상을 가져옵니다.

포켓몬 게임, 특히 Game Boy 클래식 Pokémon Red를 하는 것이 바로 그런 작업입니다. 우리는 클로드에게 기본 메모리, 화면 픽셀 입력, 그리고 버튼을 누르고 화면을 탐색하는 함수 호출을 장착하여, 일반적인 컨텍스트 한계를 넘어서 수만 번의 상호작용을 통해 지속적으로 포켓몬을 플레이할 수 있게 했습니다.

아래 그래프에서, 우리는 Claude 3.7 Sonnet의 포켓몬 진행 상황을 확장된 사고 옵션이 없었던 이전 버전의 Claude Sonnet과 함께 표시했습니다. 보시다시피, 이전 버전은 게임 초기에 막혔으며, Claude 3.0 Sonnet은 이야기가 시작되는 마을인 태초마을의 집을 나가지도 못했습니다.

그러나 Claude 3.7 Sonnet의 향상된 에이전트 능력은 훨씬 더 발전하여, 세 명의 포켓몬 체육관 관장(게임의 보스)과 성공적으로 싸워 배지를 획득했습니다. Claude 3.7 Sonnet은 여러 전략을 시도하고 이전 가정에 의문을 제기하는 데 매우 효과적이며, 진행함에 따라 자신의 능력을 향상시킬 수 있습니다.

포켓몬 게임에서 다양한 클로드 소네트 모델의 성능을 보여주는 차트. x축은 AI가 수행한 행동 수, y축은 게임에서 달성한 이정표. 클로드 3.7 소네트가 게임의 이정표를 달성하는 데 가장 성공적임
Claude 3.7 Sonnet demonstrates that it is the very best of all the Sonnet models so far at playing Pokémon Red. On the x-axis is the number of interactions Claude completes as it plays the game; on the y-axis are important milestones in the game involving collecting certain items, navigating to certain areas, and defeating certain game bosses.

포켓몬은 Claude 3.7 Sonnet의 능력을 즐겁게 감상할 수 있는 방법이지만, 우리는 이러한 능력이 게임을 넘어 실제 세계에 영향을 미칠 것으로 기대합니다. 모델이 집중력을 유지하고 개방형 목표를 달성하는 능력은 개발자가 다양한 최첨단 AI 에이전트를 구축하는 데 도움이 될 것입니다.

직렬 및 병렬 테스트-시간 컴퓨팅 스케일링

Claude 3.7 Sonnet이 확장된 사고 기능을 사용할 때, "직렬 테스트-시간 컴퓨팅"의 혜택을 받는다고 설명할 수 있습니다. 즉, 최종 출력을 생성하기 전에 여러 개의 순차적 추론 단계를 사용하며, 진행하면서 더 많은 계산 리소스를 추가합니다. 일반적으로 이는 예측 가능한 방식으로 성능을 향상시킵니다. 예를 들어, 수학 문제에 대한 정확도는 샘플링할 수 있는 "생각 토큰"의 수에 따라 로그적으로 향상됩니다.

클로드 3.7 소네트의 수학적 성능을 사고 과정에 사용된 토큰 수에 따라 보여주는 그래프. x축은 토큰, y축은 정확도. 더 많은 토큰이 더 높은 정확도와 관련됨
Claude 3.7 Sonnet’s performance on questions from the 2024 American Invitational Mathematics Examination 2024, according to how many thinking tokens it’s allowed per problem. Note that even though we allow Claude to use the entire thinking budget, it generally stops short. We include in the plot the tokens sampled that are used to summarize the final answer.

우리 연구자들은 또한 병렬 테스트-시간 컴퓨팅을 사용하여 모델 성능을 향상시키는 실험을 해왔습니다. 그들은 여러 개의 독립적인 사고 과정을 샘플링하고, 진정한 답을 미리 알지 못한 채 최상의 것을 선택함으로써 이를 수행합니다. 이를 수행하는 한 가지 방법은 다수결 또는 합의 투표를 사용하는 것입니다. 가장 일반적으로 '최고'로 나타나는 답변을 선택하는 것입니다. 또 다른 방법은 다른 언어 모델(예: 클로드의 두 번째 복사본)을 사용하여 작업을 확인하거나 학습된 점수 함수를 사용하여 최고라고 생각하는 것을 선택하도록 요청하는 것입니다. 이러한 전략(및 유사한 작업)은 여러 다른 AI 모델의 평가 결과에서 보고되었습니다.

우리는 생물학, 화학, 물리학에 대한 까다로운 질문 세트인 GPQA 평가에서 병렬 테스트-시간 컴퓨팅 스케일링을 사용하여 놀라운 개선을 이루었습니다. 256개의 독립 샘플, 학습된 점수 모델, 최대 64k 토큰의 생각 예산을 사용하여 Claude 3.7 Sonnet은 GPQA 점수 84.8% (물리학 하위 점수 96.5% 포함)를 달성했으며, 다수결 투표의 한계를 넘어 계속 확장되는 이점을 얻습니다. 아래에 점수 모델 방법과 다수결 투표 방법에 대한 결과를 보고합니다.

병렬 테스트-시간 컴퓨팅 스케일링을 사용할 때 GPQA 평가에서 클로드 3.7 소네트의 성능을 보여주는 네 개의 그래프. 왼쪽 위부터 시계 방향으로 전체 시험, 생물학 섹션, 물리학 섹션, 화학 섹션의 성능을 보여줌. 평가 방식에 따라 여러 선이 표시됨
Experimental results from using parallel test-time compute scaling to improve Claude 3.7 Sonnet’s performance on the GPQA evaluation. The different lines refer to different methods of scoring the performance. “Majority @ N”: where multiple outputs are generated from a model for the same prompt with the majority vote taken as the final answer; “scoring model”: a separate model which is used to assess the performance of the model being evaluated; “pass @ N”: where models “pass” a test if any of a given number of attempts succeeds.

이와 같은 방법을 사용하면 일반적으로 클로드가 생각을 마칠 때까지 기다릴 필요 없이 답변의 품질을 향상시킬 수 있습니다. 클로드는 동시에 여러 가지 다른 확장된 사고 과정을 가질 수 있어, 문제에 대한 더 많은 접근 방식을 고려하고 궁극적으로 훨씬 더 자주 정답을 맞출 수 있습니다. 병렬 테스트-시간 컴퓨팅 스케일링은 새로 배포된 모델에서는 사용할 수 없지만, 미래를 위해 이러한 방법을 계속 연구하고 있습니다.

Claude 3.7 Sonnet의 안전 메커니즘

AI 안전 수준. Anthropic의 책임 있는 스케일링 정책은 적절한 안전 및 보안 조치를 구현하지 않는 한 모델을 훈련하거나 배포하지 않겠다고 약속합니다. 우리의 프론티어 레드팀과 정렬 스트레스 테스트 팀은 Claude 3.7 Sonnet이 이전 모델과 동일한 수준의 배포 및 보안 보호 조치(즉, AI 안전 수준(ASL) 2 표준)를 필요로 하는지 또는 더 강력한 조치가 필요한지 결정하기 위해 광범위한 테스트를 수행했습니다.

Claude 3.7 Sonnet에 대한 포괄적인 평가 결과, 현재 ASL-2 안전 표준이 여전히 적절함을 확인했습니다. 동시에, 이 모델은 모든 영역에서 향상된 정교함과 향상된 능력을 보여주었습니다. 화학, 생물학, 방사선, 핵(CBRN) 무기 생산과 관련된 작업을 조사한 통제 연구에서, 모델의 도움을 받은 참가자는 도움을 받지 않은 참가자에 비해 일부 성능 "향상"이 관찰되었습니다. 즉, 참가자는 온라인에서 이용 가능한 정보만 사용했을 때보다 성공에 더 가까이 다가갈 수 있었습니다. 그러나 이러한 작업을 수행하려는 모든 시도에는 중요한 실패가 포함되어 성공을 완전히 저해했습니다.

모델에 대한 전문가 레드팀의 피드백은 엇갈렸습니다. 일부 전문가는 CBRN 프로세스의 특정 영역에서 모델의 지식이 향상된 점을 언급했지만, 성공적인 종단 간 작업 완료에는 중요한 실패 빈도가 너무 높다는 것을 발견했습니다. 우리는 표적 분류기와 모니터링 시스템의 개발 및 배포를 가속화하여 ASL-2 조치를 적극적으로 강화하고 있습니다.

또한, 미래 모델의 능력으로 인해 다음 단계인 ASL-3 안전 장치로 이동해야 할 수도 있습니다. 탈옥을 방지하기 위한 헌법적 분류기에 대한 최근 작업과 다른 노력은 가까운 미래에 ASL-3 표준의 요구 사항을 구현할 수 있는 좋은 위치에 있습니다.

가시적인 사고 과정. ASL-2에서도 Claude 3.7 Sonnet의 가시적인 확장된 사고 기능은 새롭기 때문에 새로운 적절한 안전 장치가 필요합니다. 드물게 클로드의 사고 과정에는 잠재적으로 유해한 내용(주제에는 아동 안전, 사이버 공격, 위험한 무기 포함)이 포함될 수 있습니다. 이러한 경우, 우리는 사고 과정을 암호화할 것입니다. 이는 클로드가 사고 과정에 해당 내용을 포함하는 것을 막지 않지만(결국 완전히 무해한 응답을 생성하는 데 여전히 중요할 수 있음), 사고 과정의 관련 부분은 사용자에게 표시되지 않습니다. 대신, 사용자는 "이 응답에 대해 나머지 사고 과정을 사용할 수 없습니다"라는 메시지를 보게 됩니다. 우리는 이러한 암호화가 드물게 발생하고, 잠재적 피해가 높은 경우에만 발생하도록 목표하고 있습니다.

컴퓨터 사용. 마지막으로, 우리는 클로드의 컴퓨터 사용 능력(위에서 논의한 대로: 클로드가 사용자의 컴퓨터 화면을 보고 사용자를 대신해 작업을 수행할 수 있게 함)에 대한 안전 조치를 강화했습니다. 우리는 악의적인 제3자가 클로드가 컴퓨터를 사용하는 동안 볼 수 있는 곳에 비밀 메시지를 숨겨 사용자가 의도하지 않은 작업을 수행하도록 속일 수 있는 "프롬프트 인젝션" 공격에 대한 방어에서 상당한 진전을 이루었습니다. 프롬프트 인젝션에 저항하는 새로운 훈련, 이러한 공격을 무시하라는 지침이 포함된 새로운 시스템 프롬프트, 그리고 모델이 잠재적인 프롬프트 인젝션을 만날 때 트리거되는 분류기를 통해, 우리는 이제 이러한 공격을 88%의 시간 동안 방지합니다⁴. 이는 완화 조치 없이 74%에서 향상된 것입니다.

위 내용은 Claude 3.7 Sonnet에 대한 광범위한 안전 작업 중 일부를 요약한 것입니다. 자세한 정보, 분석 결과, 그리고 작동 중인 안전 장치의 몇 가지 예는 전체 시스템 카드를 참조하세요.

클로드 사용하기

지금 Claude.ai 또는 우리의 API에서 Claude 3.7 Sonnet을 사용할 수 있습니다. 그리고 클로드가 여러분에게 자신의 생각을 알려줄 수 있는 것처럼, 여러분도 여러분의 생각을 알려주시길 바랍니다. 새 모델에 대한 피드백을 feedback@anthropic.com으로 보내주세요.

각주

¹. 구체적으로, 이 기능은 Claude Pro, Team, Enterprise, 및 API 사용자에게 제공됩니다.

². 우리의 충실성 연구는 시스템 카드에 더 자세히 설명되어 있습니다. 또한, 신경망의 활성화 수준에서 모델 행동의 이유에 대한 완전한 이해는 기계적 해석 가능성의 미래 발전을 통해 달성될 수 있기를 바랍니다.

³. 사고 과정을 완전히 공개하는 것과 완전히 숨기는 것 사이의 중간 지점이 있을 수 있습니다. 예를 들어, 모델이 내부 사고 과정에 대해 질문받을 때 항상 진실을 말하도록 훈련하지만, 기본적으로 그 생각을 공개하지 않도록(그리고 특정 요청을 거부할 수 있도록) 하는 것이 더 바람직할 수 있습니다.

⁴. 이는 0.5%의 오탐률(프롬프트 인젝션 공격이 없음에도 안전 장치가 작동하는 경우)을 동반합니다. 우리는 안전 메커니즘을 개발하면서 이 비율을 줄이기 위해 노력하고 있습니다.

관련 콘텐츠

Fable 5의 사이버 보안 조치 및 탈옥 프레임워크에 대한 자세한 내용

더 읽어보기

클로드 소네트 5 소개

소네트 5는 코딩, 에이전트, 전문 업무에서 최고의 성능을 제공합니다.

더 읽어보기

Fable 5 재배포

Fable 5가 7월 1일 전 세계로 돌아옵니다. 또한 Amazon, Microsoft, Google 및 기타 Glasswing 파트너와 함께 탈옥 심각도 점수를 위한 업계 전반의 프레임워크를 제안하고 있습니다.

더 읽어보기

anthropic · 원문 보기 · 2025-02-24

이 글은 원문을 한국어로 번역한 것입니다. 저작권은 원 저작자에게 있습니다.