anthropic

AI를 위한 핵 안전 조치 개발

요약

앤트로픽은 미국 에너지부 산하 NNSA와 협력해 핵 관련 대화를 96% 정확도로 분류하는 AI 분류기를 개발하고 클로드에 배포했습니다.

인사이트

  • 공공-민간 협력은 핵 확산 위험 같은 민감한 분야에서 정부의 전문성과 기업의 기술력을 결합해 효과적인 안전 조치를 만들 수 있습니다.
  • 합성 데이터 생성은 분류기 개발에서 정보 공유 제약을 우회하는 핵심 해법이었습니다.
  • 실제 배포 시나리오에서는 계층적 요약 같은 추가 안전 장치를 결합해 분류기의 정밀도를 높이는 것이 중요합니다.

왜 중요한가

AI 모델의 능력이 향상됨에 따라 핵무기 관련 지식이 악용될 위험이 커지고 있습니다. 이번 협력은 AI 안전성을 높이는 구체적이고 실용적인 방법을 제시하며, 다른 국가 안보 영역으로 확장 가능한 모델을 보여줍니다.

프론티어 레드팀 뉴스레터 구독하기

최신 레드티밍 연구와 결과에 대한 업데이트를 받아보세요.

핵 기술은 본질적으로 이중 용도성을 띠고 있어요. 핵 반응로를 가동하는 물리학 원리가 무기 개발에 오용될 수도 있거든요. AI 모델이 더 강력해짐에 따라, 이 모델들이 사용자에게 국가 안보를 위협할 수 있는 위험한 기술 지식을 제공할 가능성이 있는지 면밀히 주시해야 합니다.

핵무기와 관련된 정보는 특히 민감하기 때문에, 민간 기업이 단독으로 이런 위험을 평가하는 것은 까다롭습니다. 그래서 지난 4월, 우리는 미국 에너지부(DOE) 산하 국가핵안보청(NNSA)과 파트너십을 맺고 모델의 핵 확산 위험을 평가하기 시작했고, 지금도 함께 평가 작업을 이어가고 있습니다.

이제 우리는 위험 평가를 넘어서, 이를 모니터링할 도구를 직접 만들고 있습니다. NNSA 및 DOE 국립연구소와 함께, 컨텐츠를 자동으로 분류하는 AI 시스템인 분류기를 공동 개발했어요. 예비 테스트에서 이 분류기는 핵 관련 대화를 우려되는 경우와 양성인 경우로 96% 정확도로 구분해냅니다(자세한 내용은 아래 참조).

이 분류기는 이미 클로드 트래픽에 배포되어, 모델 오용을 식별하는 광범위한 시스템의 일부로 작동하고 있습니다. 초기 배포 데이터는 분류기가 실제 클로드 대화에서도 잘 작동한다는 것을 보여줍니다.

우리는 이 접근 방식을 프론티어 AI 기업들의 산업 기구인 프론티어 모델 포럼과 공유할 예정입니다.

프론티어 AI 모델을 핵 오용으로부터 보호하는 것의 구체적인 중요성과 함께, 이번 최초의 협력 사례는 공공-민간 파트너십의 힘을 보여줍니다. 이러한 파트너십은 산업과 정부의 상호 보완적인 강점을 결합해 위험에 정면으로 대응하고, 모든 사용자를 위해 AI 모델을 더 신뢰할 수 있고 믿음직스럽게 만듭니다.

이 파트너십에서 우리는 위험 식별에 그치지 않고, 대응 방안도 개발했습니다. 1년 동안 NNSA 직원들이 안전한 환경에서 클로드 모델을 레드팀 테스트한 후, 우리는 함께 위험 완화 조치를 공동 개발하기 시작했습니다.

레드티밍 결과를 바탕으로, NNSA는 핵무기 개발에 관한 우려되는 대화와 핵 에너지, 의학, 정책에 관한 무해한 대화를 구분하도록 설계된 핵 위험 지표 목록을 신중하게 선별해 우리와 공유했습니다. 결정적으로, 이 목록은 우리 팀과 공유할 수 있는 수준의 분류 등급으로 작성되어, 방어 체계를 구축하는 데 사용할 수 있었습니다.

우리의 정책 및 안전 조치 팀은 이 목록을 활용해 실시간으로 우려되는 핵 질문을 식별하는 분류기를 만들었습니다. 분류기를 이메일 스팸 필터를 뒷받침하는 특수 레이블러라고 생각하면 됩니다. 정크 메일 대신, 이 분류기는 잠재적으로 유해한 대화를 식별하면서도 합법적인 논의는 허용합니다.

시스템을 검증하기 위해, 우리는 수백 개의 합성 테스트 프롬프트(일부는 우려되는 것, 일부는 양성인 것)를 생성해 분류기에 통과시키고 결과를 NNSA와 공유했습니다. NNSA는 분류기 점수가 예상 레이블(유해 또는 양성)과 일치하는지 확인했습니다. 그런 다음 피드백을 바탕으로 접근 방식을 개선하고, 정밀도를 높이기 위해 이 과정을 반복했습니다. 그림 1은 이 과정을 요약합니다.

분류기 개발 및 검증 프로세스 요약: NNSA가 위험 지표를 제공하고, 앤트로픽이 분류기를 구축하며, 합성 데이터로 테스트하고 NNSA가 검증하는 순환 과정
Figure 1: Classifier co-development process.

이 작업에서 가장 어려웠던 점은 기술적인 문제가 아니라, 국가 안보 기관과 민간 AI 기업 사이의 간극을 좁히는 것이었어요. 양측 모두 정보 공유 제약 아래 운영되어야 했습니다. NNSA는 특정 정보를 기밀로 유지해야 했고, 앤트로픽은 사용자 데이터를 보호해야 했죠. 그렇다면 분류기가 실제로 작동하는지 어떻게 검증할 수 있을까요? 합성 데이터 생성이 해결책이었습니다. NNSA의 예시 프롬프트를 사용해 수백 개의 테스트 케이스를 생성함으로써, 어느 쪽의 권리도 침해하지 않으면서 강력한 평가 세트를 만들 수 있었습니다.

AI 시스템이 너무 조심스러우면 합법적인 핵 공학 수업까지 거절할 수 있습니다. 반대로 너무 관대하면 나쁜 행위자를 의도치 않게 도울 수도 있고요.

우리의 분류기는 적절한 균형을 맞추는 것으로 보입니다. 합성 데이터를 사용한 예비 테스트에서, 핵무기 질문에 대해 94.8%의 탐지율을 달성했고, 거짓 양성은 0건이었습니다(전체적으로 이 테스트에서 분류기 레이블의 96.2%가 정확했으며, 그림 2에 나와 있습니다). 이는 이 시스템이 합법적인 교육, 의학, 연구 관련 대화를 우려되는 것으로 잘못 표시하지 않을 것임을 시사합니다. 이러한 정밀도는 핵 관련 대화가 AI 시스템에서 드물지만 국가 안보와 직결되는 고위험 주제이기 때문에 중요합니다.

분류기 예비 테스트 결과: 핵무기 관련 쿼리 94.8% 탐지, 거짓 양성 0%, 전체 정확도 96.2%
Figure 2: Comparison of the classifier’s assessment of synthetic exchanges to their known status showing correct assessment of all the true negatives and almost 95% of the true positives. The overall accuracy reflects the total proportion of correctly predicted labels.

우리는 이러한 리소스를 공개하여, 다른 주요 AI 기업들이 원한다면 유사한 안전 조치를 구현할 수 있도록 할 예정입니다. 이번 협력은 자발적인 공공-민간 협력을 통해 정부의 전문성이 어떻게 AI 안전을 향상시킬 수 있는지를 보여줄 뿐만 아니라, 위험 완화 접근 방식에서 서로 배울 수 있는 교류를 촉발하길 바랍니다.

앞서 언급했듯이, 우리는 분류기를 Safeguards 프레임워크의 실험적 추가 기능으로 배포하여 클로드 트래픽의 일정 비율을 모니터링하고 있습니다. 실제 성능은 분류기가 테스트 환경을 넘어서도 효과적으로 작동한다는 것을 확인시켜 주었습니다. 합성 테스트 데이터는 유해 및 양성 교환의 명확한 예를 제공했지만, 실제 사용자 트래픽 분포는 더 복잡하고 예상치 못한 경우가 많았지만, 분류기는 여전히 잘 작동했습니다.

실제 배포가 테스트와 어떻게 다른지 보여주는 한 예는, 분류기가 궁극적으로 양성이라고 판단된 핵무기 관련 대화를 플래그 지정한 경우입니다. 예를 들어, 최근 중동 사태로 핵무기 문제에 대한 관심이 다시 높아졌습니다. 이 기간 동안 핵 분류기는 실제 오용 시도가 아닌, 단지 이러한 사건과 관련된 대화를 잘못 플래그 지정하기도 했습니다. 이러한 교환이 계층적 요약을 거칠 때—여러 플래그 지정된 대화를 함께 검토—요약 단계에서 제공되는 추가 컨텍스트 덕분에 무해한 시사 토론으로 올바르게 식별된다는 것을 발견했습니다.

이는 두 가지 역학을 드러냅니다. 첫째, 실제 대화는 합성 데이터로 포착하기 어려운 회색 영역에 속하는 경우가 많고, 둘째, 여러 안전 도구를 결합하면 더 미묘하고 정밀한 시스템이 만들어진다는 점입니다.

궁극적으로, 분류기는 배포되었을 때 우려되는 콘텐츠(즉, 진짜 양성)를 성공적으로 탐지함으로써 그 가치를 입증했습니다. 예를 들어, 분류기가 배포된 사실을 모르는 앤트로픽 레드팀원들이 의도적으로 우려되는 프롬프트를 사용해 일상적인 적대적 테스트를 수행하고 있었습니다. 분류기는 이 테스트 질문들을 잠재적으로 유해한 것으로 올바르게 식별해 효과를 입증했습니다.

이 작업은 각 파트너의 강점(정부의 도메인 전문성과 산업계의 기술 역량)을 활용했으며, 초기 결과는 실제로 작동하고 있음을 보여줍니다. 이는 다른 국가 안보 영역에서도 복제될 수 있는 공공-민간 파트너십 모델을 보여줍니다. 또한 산업계가 지금 당장 의미 있는 안전 조치를 구현하기 위해 취할 수 있는 단계가 있음을 보여줍니다.

이번 협력에 헌신해 주신 NNSA 및 DOE 국립연구소 팀에게 감사드립니다. 이는 산업계와 정부가 어떻게 협력해 국가 안보를 강화할 수 있는지를 보여줍니다.

안전 이니셔티브에 대한 자세한 내용은 Responsible Scaling Policy, Frontier Red Team, Safeguards 작업을 참조하세요.

우리는 클로드가 앤트로픽 직원들의 정교한 로봇 작업을 도울 수 있는지에 대한 최신 테스트 결과를 보고합니다. Claude Opus 4.7이 인간의 도움 없이 작업할 때, 1년 전 참가자들이 완료한 모든 작업에서 가장 빠른 인간 팀보다 약 20배 빠른 것으로 나타났습니다.

이 보고서는 Claude Code가 실제로 어떻게 사용되는지에 대한 증거를 제공하며, 2025년 10월부터 2026년 4월까지 약 235,000명의 약 400,000개의 대화형 세션을 프라이버시를 보호하는 방식으로 분석한 결과를 기반으로 합니다.

최신 레드티밍 연구와 결과에 대한 업데이트를 받아보세요.

anthropic · 원문 보기 · 2023-11-03

이 글은 원문을 한국어로 번역한 것입니다. 저작권은 원 저작자에게 있습니다.