앤트로픽, 책임 있는 확장 정책 발표
요약
앤트로픽이 AI 모델의 재앙적 위험을 관리하기 위한 책임 있는 확장 정책(RSP)과 AI 안전 수준(ASL) 프레임워크를 공개했습니다.
인사이트
- ASL은 위험 수준에 따라 안전 기준을 차등 적용하며, ASL-2는 현재 모델, ASL-3는 대규모 위험 증가 시점을 기준으로 함
- 정책은 안전 조치를 스케일링의 선결 조건으로 삼아 '최고를 향한 경쟁'을 유도하도록 설계됨
- 현재 클로드 서비스에는 영향 없으며, 자동차·항공 산업의 사전 테스트 및 안전 설계와 유사한 접근
왜 중요한가
이 정책은 AI 개발에서 재앙적 위험을 체계적으로 관리하려는 최초의 구체적 산업 프레임워크 중 하나로, 정책 입안자와 다른 기업에 참고가 될 수 있습니다.
앤트로픽의 책임 있는 확장 정책 소개

오늘, 우리는 책임 있는 확장 정책(RSP)을 공개합니다. 이는 점점 더 강력해지는 AI 시스템 개발에 따른 위험을 관리하기 위해 채택하는 일련의 기술적·조직적 프로토콜입니다.
AI 모델이 더 강력해짐에 따라 경제적·사회적 가치를 창출하겠지만, 동시에 점점 더 심각한 위험을 초래할 것이라고 믿습니다. RSP는 재앙적 위험, 즉 AI 모델이 직접적으로 대규모 파괴를 일으키는 위험에 초점을 맞춥니다. 이러한 위험은 모델의 의도적인 오용(예: 테러리스트나 국가 행위자가 생물 무기를 만들기 위해 사용)이나 설계자의 의도와 반대로 자율적으로 행동하여 파괴를 일으키는 모델에서 발생할 수 있습니다.

RSP는 재앙적 위험을 다루기 위한 AI 안전 수준(ASL)이라는 프레임워크를 정의하며, 이는 미국 정부의 위험한 생물학적 물질 취급을 위한 생물 안전 수준(BSL) 표준을 느슨하게 본떴습니다. 기본 아이디어는 모델의 재앙적 위험 잠재력에 적합한 안전, 보안, 운영 표준을 요구하며, ASL 수준이 높아질수록 더 엄격한 안전 입증을 요구하는 것입니다.
ASL 시스템의 매우 간략한 요약은 다음과 같습니다.
- ASL-1: 의미 있는 재앙적 위험이 없는 시스템. 예: 2018년 LLM 또는 체스만 하는 AI 시스템.
- ASL-2: 위험한 능력의 초기 징후를 보이는 시스템. 예: 생물 무기 제작 방법을 안내할 수 있지만, 신뢰성이 부족하거나 검색 엔진에서 얻을 수 있는 정보 이상을 제공하지 않아 유용하지 않은 경우. 현재의 LLM(클로드 포함)은 ASL-2로 보입니다.
- ASL-3: 비AI 기준(예: 검색 엔진이나 교과서)에 비해 재앙적 오용 위험을 실질적으로 증가시키거나, 낮은 수준의 자율적 능력을 보이는 시스템.
- ASL-4 이상(ASL-5+): 현재 시스템과 너무 거리가 있어 아직 정의되지 않았지만, 재앙적 오용 가능성과 자율성에서 질적 도약을 포함할 가능성이 높습니다.
각 ASL 수준의 정의, 기준, 안전 조치는 본 문서에 자세히 설명되어 있지만, 높은 수준에서 ASL-2 조치는 현재의 안전·보안 기준을 나타내며 최근 백악관 약속과 상당 부분 겹칩니다. ASL-3 조치는 더 엄격한 기준을 포함하며, 예를 들어 비정상적으로 강력한 보안 요구 사항과, 세계적 수준의 레드팀이 적대적 테스트를 수행했을 때 의미 있는 재앙적 오용 위험이 나타나면 ASL-3 모델을 배포하지 않겠다는 약속(단순히 레드팀을 수행하겠다는 약속과 대조적) 등이 있습니다. ASL-4 조치는 아직 작성되지 않았지만(ASL-3에 도달하기 전에 작성하겠다는 약속), 오늘날에는 해결되지 않은 연구 문제일 수 있는 방법, 예를 들어 해석 가능성 방법을 사용하여 모델이 특정 재앙적 행동에 관여할 가능성이 낮다는 것을 메커니즘적으로 입증하는 것이 필요할 수 있습니다.
ASL 시스템은 재앙적 위험을 효과적으로 목표로 하면서도 유익한 응용과 안전 진전을 장려하는 균형을 맞추도록 설계했습니다. 한편으로 ASL 시스템은 AI 스케일링이 필요한 안전 절차를 준수할 수 있는 능력을 초과할 경우 더 강력한 모델의 훈련을 일시 중지하도록 암묵적으로 요구합니다. 그러나 동시에 필요한 안전 문제를 해결하여 추가 스케일링을 가능하게 하는 직접적인 인센티브를 제공하며, 이전 ASL 수준의 가장 강력한 모델을 다음 수준의 안전 기능 개발을 위한 도구로 사용할 수 있게 합니다¹. 이 정책이 프런티어 연구소 전체의 표준으로 채택된다면, 경쟁적 인센티브가 안전 문제 해결로 직접 연결되는 '최고를 향한 경쟁' 역학을 만들 수 있기를 바랍니다.
비즈니스 관점에서 RSP가 현재 클로드의 사용을 변경하거나 제품 가용성을 방해하지 않을 것임을 분명히 하고 싶습니다. 오히려 이는 자동차나 항공 산업에서 제품이 시장에 출시되기 전에 안전성을 엄격히 입증하는 것을 목표로 하는 사전 시장 테스트 및 안전 기능 설계와 유사하며, 이는 궁극적으로 고객에게 이익이 됩니다.
앤트로픽의 RSP는 이사회의 공식 승인을 받았으며, 변경 사항은 장기 혜택 신탁과의 협의 후 이사회 승인을 받아야 합니다. 전체 문서에서 평가 프로세스의 무결성을 보장하기 위한 여러 절차적 보호 장치를 설명합니다.
그러나 이러한 약속은 현재로서는 최선의 추정이며, 앞으로 구축해 나갈 초기 버전임을 강조하고 싶습니다. AI 분야의 빠른 변화와 많은 불확실성은 비교적 안정적인 BSL 시스템과 달리 빠른 반복과 방향 수정이 거의 확실히 필요함을 의미합니다.
전체 문서는 여기에서 읽을 수 있습니다. 정책 입안자, 제3자 비영리 조직, 유사한 배포 결정에 직면한 다른 기업에 유용한 영감을 제공하기를 바랍니다.
RSP 약속 개발을 지원한 핵심 통찰력과 전문성에 대해 ARC Evals에 감사드립니다. 특히 자율적 능력 평가와 관련하여 그들의 AI 위험 평가 전문성이 평가 절차를 설계하는 데 중요한 역할을 했습니다. 또한 우리의 접근 방식에 영감을 준 광범위한 ARC 책임 있는 확장 정책 프레임워크를 창시하고 주도한 ARC Evals의 리더십을 인정합니다.
각주
- 일반적으로 앤트로픽은 프런티어 AI 모델과의 작업이 AI 위험을 완화하는 새로운 방법을 개발하는 데 필수적인 요소임을 일관되게 발견했습니다.
관련 콘텐츠
Fable 5의 사이버 보호 및 탈옥 프레임워크에 대한 자세한 내용
Claude Sonnet 5 소개
Sonnet 5는 코딩, 에이전트, 전문 작업에서 프런티어 성능을 대규모로 제공합니다.
Fable 5 재배포
Fable 5가 7월 1일 전 세계로 돌아옵니다. 또한 Amazon, Microsoft, Google 및 기타 Glasswing 파트너와 함께 탈옥 심각도 점수 매기기를 위한 업계 전반의 프레임워크를 제안합니다.