LLM과 생물학적 위험
요약
앤트로픽 팀은 LLM이 생물학적 발견에 기여할 잠재력과 동시에 생물학적 위협에 악용될 가능성을 인식하고, 이에 대한 평가와 안전장치 구축이 책임감 있는 AI 개발의 핵심임을 강조하는 글이에요.
인사이트
- LLM은 방대한 생물학적 지식을 습득하여 비전문가도 생물학적 위협 계획을 수립하는 데 전문가 수준의 도움을 제공할 수 있게 되었어요.
- AI의 생물학적 위험 악용은 낮은 확률의 시나리오지만, 파급 효과가 매우 커서 이를 선제적으로 평가하고 완화하는 것이 책임감 있는 AI 개발의 필수 요소예요.
- 암묵적 지식의 영향 및 실제 실험실 환경에서의 AI 지원 능력에 대한 대규모 연구와 정부 및 산업 간의 긴밀한 협력이 생물학적 위험 관리에 중요해요.
왜 중요한가
LLM은 생물학 분야에 혁신을 가져올 수 있는 강력한 도구이지만, 동시에 악의적인 행위자가 생물학적 위협을 개발하는 데 활용될 경우 상상할 수 없는 재앙을 초래할 수 있기 때문이에요. 특히 AI가 비전문가의 위협 개발 능력을 향상시킬 수 있다는 연구 결과는, AI 기술 발전에 발맞춰 선제적인 안전장치와 다층적인 위험 평가 및 완화 노력이 시급함을 보여줘요.
프론티어 레드팀 뉴스레터를 구독하세요
최신 레드팀 연구 결과와 소식을 받아보세요.
앤트로픽 팀은 AI가 과학적 발견, 특히 생물학 및 의학 분야에서 인류의 삶을 개선할 잠재력을 믿고 있어요. 벤치링은 클로드를 활용해서 연구자들이 데이터를 구조화하고, 더 나은 질문을 던지고, 통찰력을 더 빨리 얻고, 과학 연구에 더 많은 시간을 쓸 수 있도록 돕고 있대요. 바이옴니도 클로드를 사용해서 생물정보학 분석 속도를 높이고 실험 설계까지 자동화하고 있고요.
하지만 동시에 AI는 근본적으로 이중 용도 기술이에요. 앤트로픽 팀이 AI를 책임감 있게 개발하려는 노력의 핵심 원칙 중 하나는, 과학자와 혁신가들에게 AI가 그렇게 유망한 만큼 악의적인 행위자가 그 능력을 오용할 가능성을 식별하고, 측정하고, 완화하는 거예요.
앤트로픽 팀이 클로드 오푸스 4를 출시했을 때, AI 안전 수준 3 (ASL-3) 보호 조치를 활성화했어요. 이 조치에는 모델이 화학, 생물학, 방사능, 핵 (CBRN) 무기 개발과 관련된 특정 작업을 돕는 것을 방지하는 데 집중된 배포 측정값이 포함되어 있었죠. 당시에도 언급했듯이, 이건 예방적 결정이었어요. 모델 평가에서 성능이 향상되면서, 가장 발전된 모델이 기초 STEM 배경을 가진 사람들이 이런 무기를 개발하려고 할 때 도움을 줄 수 있는 가능성을 더 이상 완전히 배제할 수 없게 되었기 때문이에요. 잠재적인 결과에 대한 평가 때문에, 초기 평가와 그에 따른 안전 조치의 주요 초점은 생물학 무기에 맞춰졌어요. 이 글에서는 AI와 생물학적 위험(biorisk)에 대한 앤트로픽 팀의 관점을 좀 더 자세히 이야기하려고 해요.
프론티어 AI 연구소들이 발표한 모든 안전 프레임워크에 생물학적 위험이 언급되어 있다는 점은 놀랍지만, 꼭 직관적인 건 아니에요.[1] 결국 프론티어 대규모 언어 모델(LLM)은 범용적인 모델이잖아요? 보통 알파폴드 같은 다른 파운데이션 모델과는 다르게 생물학적 응용 분야에 특화되어 있지 않거든요. 이런 범용적인 특성 때문에, 우선순위를 둘 수 있는 다른 보안 위협들도 많고요. AI의 보안 영향을 고려할 때, 생물학적 위험을 우선시하는 것에 대해 회의적일 수 있다는 점을 이해해요. 이 글에서는 그런 회의론자들이 던질 수 있는 몇 가지 질문들을 다뤄볼 거예요.
앤트로픽 팀의 목표는 공포심을 조장하는 게 아니에요. AI와 생물학적 위험에 대한 논의는 분명히 '낮은 확률/높은 영향' 시나리오 범주에 속하거든요.[2] 오히려, 이런 위험을 평가하고 방어하는 것이 책임감 있는 AI 개발의 중요한 요소라고 앤트로픽 팀이 믿는 이유를 확고히 하고 싶을 뿐이에요.
앤트로픽 팀은 AI가 악의적인 행위자들이 무기를 획득하고 개발하는 데 어떻게 도움을 줄 수 있을지 걱정하는 건, AI가 과거의 정보 및 통신 기술과 비슷한 점도 있고 다른 점도 있기 때문이에요.
최근 몇 년 동안 테러리스트 집단은 암호화된 통신, 암호화폐, 소셜 미디어 같은 기술을 빠르게 채택했어요. AI도 마찬가지일 거라고 봐야죠. 무기 제조 정보를 찾던 사람들이 물리적인 팸플릿이나 매뉴얼을 찾아야 했던 것에서 인터넷 검색으로 전환했듯이, 이제는 AI에 질문할 거라고 예상할 수 있어요.
하지만 다른 점은 AI가 진정한 조력자 역할을 할 잠재력이에요. 인터넷에는 모순되고 오해의 소지가 있는 정보가 넘쳐나고, 복잡하고 낯선 과정에서 어려움이 생겨도 웹사이트는 실시간으로 도움을 줄 수 없어요. 충분히 발전된 AI 모델은 신뢰할 수 있는 정보의 길잡이, 구현에 대한 암묵적이고 접근하기 어려운 지식의 원천, 그리고 데이터를 즉시 처리하고 통찰력을 생성할 수 있는 연구 조교 역할을 할 수 있어요.
AI의 도움을 받으려는 위협 행위자들의 영역에서 생물학적 위험, 그리고 더 광범위하게는 파국적 위험이 유일한 걱정거리는 절대로 아니에요. 사실 앤트로픽 팀은 사이버 보안에 대한 AI의 잠재적 영향 연구와 사기, 악성코드 개발, 여론 조작 등 다양한 분야에서 플랫폼을 악용하려는 자들의 실제 사용에 대한 정보 수집에 상당한 자원을 투자하고 있어요.
그럼에도 불구하고, 적어도 두 가지 요인 때문에 생물학적 위험이 특히 우려돼요. 첫째, 성공적인 생물학 공격의 잠재적 결과는 이례적으로 심각해요. 바이러스 공격의 영향은 초기 목표를 훨씬 넘어 확산될 수 있으며, 이는 국지적인 영향을 미치는 무기들과는 질적으로 달라요.
둘째, 생명공학의 다른 분야 발전이 이전에 “수동적” 생물 방어 역할을 했던 물질적 장벽 일부를 낮췄을 수 있어요. 예를 들어, 핵산 합성 비용 감소, 시약 키트 표준화, 표준 분자 생물학 장비(예: PCR 기기)의 쉬운 접근성 등이 물질 획득을 덜 병목 현상으로 만들고 있어요. AI 모델은 정보와 노하우에 대한 장벽을 더욱 낮춰주고요. 결과적으로, 높은 파급 효과와 증가하는 현실성이라는 이런 조합은 AI로 인한 추가적인 생물학적 위험을 다루는 것을 중요한 우선순위로 만들어요.
LLM은 금융 모델부터 팬픽션까지 방대한 양의 데이터로 훈련돼요. 이 훈련 과정에서 LLM은 거의 모든 것에 대해 배우죠. 훈련 데이터에 과학 논문, 서적, 생물학 관련 온라인 토론 등이 포함되어 있기 때문에, 모델은 다른 모든 정보와 함께 단백질 구조, 유전자 공학 기술, 바이러스학, 합성 생물학에 대한 정보를 흡수해요. 놀라운 점은 모델이 개선됨에 따라 이런 생물학적 지식이 얼마나 확장되었는지 하는 거예요.
물론 클로드와 다른 LLM들이 현재 전문가 수준으로 과학을 자율적으로 수행할 수 있는 건 아니에요. 하지만 잠재적으로 위험한 생물학적 측면과 관련된 지식을 테스트하기 위해 설계된 여러 평가에서, 모델들은 전문가 수준의 인간 성능에 근접하고 때로는 능가하고 있어요.
1년 만에 클로드는 실험실 환경에서 바이러스학 문제 해결 시나리오를 테스트하도록 설계된 평가에서 세계적 수준의 전문가보다 낮은 성능을 보이다가, 이제는 그 기준을 편안하게 뛰어넘는 수준에 도달했어요 (그림 1 참조).

이런 전문가 성능 초과 현상은 분자 생물학을 포함한 여러 벤치마크에서 나타나요.
게다가 이 평가에서 인간 기준선은 과학자들이 자신의 전문 분야 내에서 질문에 답하는 것을 기반으로 해요. 그래서 LLM이 인간 전문가가 따라잡기 힘든 하위 분야 전반에 걸쳐 폭넓은 지식을 개발할 수 있을 뿐만 아니라, 어떤 경우에는 LLM이 전문가의 '홈그라운드'에서조차 그들을 능가하고 있는 거죠.
AI가 생물학적 위험에 기여하는 바를 고려할 때, 단순히 퀴즈에서 얼마나 잘하는지 아는 것 이상이 필요해요. 실제 사람들이 참여하고, 실제 위협 시나리오를 밀접하게 반영하는 평가를 살펴봐야 해요. 게다가 AI 지식을 전문가와 비교하여 벤치마킹하듯이, AI의 유용성은 가장 쉽게 접근할 수 있는 대안, 즉 인터넷과 비교하여 측정해야 해요.
이 두 가지 기준을 충족하기 위해, 앤트로픽 팀은 가상의 생물학 무기 획득 과정 계획을 지원하는 AI의 능력을 측정하는 여러 통제된 실험을 수행했어요. 참가자들에게는 종합적인 생물학 무기 획득 계획을 작성하는 데 최대 이틀이 주어졌어요. 대조군은 기본적인 인터넷 리소스만 사용할 수 있었고, 모델 지원 그룹은 안전장치가 제거된 클로드에 추가로 접근할 수 있었어요. (이런 제한적인 경우에는, 기술의 최대 능력을 더 정확하게 평가하기 위해 신뢰할 수 있는 당사자에게 안전장치가 없는 모델 버전에 대한 접근 권한을 제공하는 것이 중요해요.) 결과로 나온 계획들은 생물방어 전문가들이 획득 경로의 주요 단계를 평가하는 상세한 채점 기준을 사용하여 채점했어요. 클로드 4 모델, 특히 클로드 오푸스 4에 접근할 수 있었던 참가자들은 인터넷만 사용한 대조군에 비해 훨씬 높은 점수를 받았고, 중대한 실패가 훨씬 적은 계획을 개발했어요.


이런 텍스트 기반의 능력 향상 실험은 암묵적 지식, 재료 접근성, 행위자의 끈기 같은 추가 요인이 포함되는 실제 시나리오를 완벽하게 대변하지는 못해요. 하지만 AI가 비전문 악의적 행위자에게 차별적으로 우수한 도움을 제공할 수 있다는 근본적인 타당성을 보여줘요.[3]
바이러스학에 대한 객관식 질문에 답하는 것, 생물학 무기 획득을 위한 텍스트 기반 계획을 돕는 것, 그리고 실제 실험실에서 일하는 위협 행위자가 생물학적 위협을 개발하도록 돕는 것 사이에는 분명한 차이가 있어요.
첫째, 실험실 생물학에는 AI 지식 제공이 효과를 발휘하기에는 너무 많은 암묵적 지식이 필요하다고 생각할 수도 있어요. 암묵적 지식은 다양한 반응의 타이밍과 관련된 미묘한 시각적 신호를 아는 것과 같이 말로 표현하기 어려운 기술적 능력, 그리고 프로토콜에 적혀 있지 않은 요소들처럼 전수되는 지혜를 포함해요. 만약 이런 장벽이 너무 커서 실험실의 어떤 초보자도 노력을 좌절시킨다면, AI가 미숙한 행위자를 위협이 될 정도로 능력을 향상시킬 잠재력에 대해 덜 걱정할 거예요. 둘째, AI와 생물학적 위험에 대한 우려를 뒷받침하는 시나리오의 타당성을 진정으로 검증하려면 실제 실험실 실험을 통한 대규모 증거가 필요해요. 앤트로픽 팀은 첫 번째 질문에 대한 초기 증거를 가지고 있고, 두 번째 접근 방식에 적극적으로 투자하고 있어요.
2024년에 앤트로픽 팀은 기본적인 생물학 실험실 프로토콜을 사용한 예비 '습식 실험실(wet lab)' 능력 향상 실험을 진행했어요. 일부 참가자들은 클로드 버전에 접근할 수 있었고, 다른 참가자들은 인터넷만 사용할 수 있었죠. 이 연구에서는 어떤 능력 향상 증거도 관찰되지 않았어요. 하지만 인터넷만 사용한 그룹을 포함한 모든 참가자들이 실제 실험실의 모든 작업에서 놀랍도록 잘 해냈다는 점을 발견했어요. 그래서 이 파일럿 연구가 AI 능력 향상에 대해 명확한 증거를 제시하지는 못했지만, 암묵적 지식이 많은 사람들이 주장했던 것만큼 중요한 병목 현상이 아닐 수도 있음을 시사했어요. 분명히 말하자면, 이 실험은 매우 작았고 (참가자 8명) 참가자들이 요청받은 프로토콜은 상당히 기본적인 것이었어요. 그럼에도 불구하고, 이 결과는 암묵적 지식의 역할과 실제 실험실에서 AI가 능력 향상을 제공할 잠재력에 대한 추가적인 통찰력을 제공할 더 큰 규모의 연구로 확장하는 것이 중요함을 강조했어요.
이 초기 연구를 이어서 진행하기 위해, 앤트로픽 팀은 프론티어 모델 포럼 (FMF)을 통해 더 큰 규모의 연구를 공동 후원하고 있어요. 이는 AI가 실험실에서 실제 작업을 수행하는 사람들을 도울 수 있는 능력을 추가로 조사하기 위함이에요. 팬데믹 예방 비영리 단체인 센티넬 바이오와 함께하는 이 습식 실험실 연구는 AI가 비전문가를 전문가 수준의 실험실 생물학 작업을 수행할 수 있는 수준으로 향상시킬 수 있는지 여부를 포함하여, 앤트로픽 팀이 우려하는 많은 시나리오를 시뮬레이션하여 증거를 수집할 거예요. 대조군의 성능은 암묵적 지식이 실험실에서 비전문가의 성능을 얼마나 제한하는지에 대한 더 나은 감각을 제공할 것이고, 처리군과의 비교는 이 실험의 더 큰 표본 크기 덕분에 능력 향상에 대한 더 명확한 측정을 제공할 거예요.
앤트로픽 팀은 이 연구 결과로부터 더 많은 것을 배우기를 기대하고 있어요. 이는 위험 평가에 중요한 정보를 제공할 거예요.
앤트로픽 팀은 현재 AI 모델이 비전문가가 생물학적 위협을 만들어내는 것을 돕는 능력을 평가하는 데 집중하고 있어요. 이는 생물방어 전문가들과의 상담과 LLM의 진화하는 능력에 대한 앤트로픽 팀의 이해를 바탕으로 하고요. 하지만 이것이 AI가 생물학적 위험에 기여할 수 있는 유일한 시나리오는 아니라는 점을 인지하고 있어요. 앤트로픽 팀은 이런 시나리오들을 연구하는 데 투자하고 있지만, 정부는 위협 행위자들의 계획과 의도에 대한 차별화된 지식과 전문성을 가지고 있어요. 앤트로픽 팀은 미국 AI 표준 및 혁신 센터 (CAISI) 및 영국 AI 보안 연구소와의 자발적인 협력 및 배포 전 테스트를 통해 얻은 통찰력으로부터 큰 도움을 받았어요. 정부와의 협력을 심화할 추가적인 기회를 기대하고 있어요. 위협 환경 이해에 대한 정부의 전문 지식과 최첨단 AI에 대한 산업 지식이 보완되는 민관 파트너십은 생물학적 위험 평가 및 완화를 최적화하는 유망한 길이라고 생각해요.
앤트로픽 팀은 개발자들이 앤트로픽의 책임 있는 확장 정책과 같은 보안 개발 프레임워크를 갖추고, 위험한 기능에 대한 모델 평가 결과를 공개하여 모델의 능력이 계속 성장함에 따라 AI의 영향에 대해 사회에 알리는 것과 같은 투명성 규범을 지지하는 것이 중요하다고 믿어요.
앤트로픽 팀은 헌법적 분류기(constitutional classifiers) 연구를 기반으로 자동화된 배포 안전장치를 개발했어요. 이 분류기 가드는 입력 및 출력을 실시간으로 모니터링하고 잠재적으로 해로운 정보의 좁은 범주를 차단하는 방식으로 작동해요. 앤트로픽 팀은 위협 행위자의 능력을 의미 있게 향상시킬 잠재력을 배제할 수 없는 모델에 이 보호 조치를 적용하고 있어요. 현재까지는 클로드 오푸스 4 계열 모델에만 적용했는데, 이는 예방 조치로 시행한 것이에요. (ASL-3 보호 조치 구현에 대한 자세한 내용은 이 보고서를 참조하세요.)
모든 모델에 걸쳐, 세이프가드 팀은 생물학의 위험한 응용을 포함하여 오용의 징후에 대해 플랫폼 활동을 모니터링하고 있어요. 이런 모니터링은 오용 패턴에 대한 통찰력을 제공하고, 언제 어떤 조치를 취해야 할지 결정하는 데 도움을 줘요.
앤트로픽 팀은 새로운 미국 AI 행동 계획의 핵심 구성 요소로 생물 보안에 대한 투자를 보게 되어 기뻐요. CAISI를 통한 국가 안보 평가 강조와 핵산 합성 스크리닝 강화 노력 모두 생물학적 위험에 대한 더 큰 회복력을 구축하는 데 도움이 될 거예요.
AI와 생물학적 위험이라는 주제는 위협 행위자, 모델의 능력, 그리고 그 능력이 정확히 어떻게 위험으로 이어지는지에 대한 불확실성으로 가득해요. 하지만 AI에 대한 증가하는 증거와 생물학적 위협의 근본적인 심각성을 고려할 때, AI 개발자와 정책 입안자들이 반드시 주의를 기울여야 할 주제라고 앤트로픽 팀은 믿어요. 앤트로픽 팀은 이 중요한 논의를 진전시키기 위해 생물학적 위험에 대한 연구를 더 많이 공유할 예정이에요.
[1] 이 내용은 2025년 7월 기준으로 METR에서 https://metr.org/faisc에 수집된 공개된 안전 프레임워크 검토를 기반으로 해요.
[2] 사실, 이 위험의 규모(심지어 그 규모를 의미 있게 추정하는 앤트로픽 팀의 능력)는 앤트로픽 내부에서도 건전한 논쟁의 원천이에요.
[3] 이 결과는 이전 연구에 대한 중요한 업데이트를 제공해요. 2023년에 유사한 연구 설계로 수행된 실험에서는 LLM을 사용하여 작성된 생물학 무기 공격 계획과 인터넷만 사용하여 작성된 계획 사이에 통계적으로 유의미한 차이가 없었어요. 하지만 연구 저자들이 당시 언급했듯이, “AI의 빠른 진화를 고려할 때, LLM 기술의 향후 발전을 모니터링하는 것이 현명해요.” 2025년 중반의 프론티어 AI 모델은 2023년 말보다 훨씬 뛰어나며, 앤트로픽 팀의 결과는 이제 생물학적 위험에 기여할 수 있는 더 명확한 경고 신호를 보여주고 있음을 입증해요.
사이버 보안에서는 실제 피해의 상당 부분이 N-day 취약점, 즉 이미 공개되었지만 일부 장치에서만 패치된 취약점에서 발생해요.
최신 레드팀 연구 결과와 소식을 받아보세요.