anthropic

LLM의 익스플로잇 개발 능력 측정하기

요약

클로드 미소스 프리뷰(Claude Mythos Preview)는 기존 LLM을 뛰어넘어 복잡한 익스플로잇 체인을 스스로 개발하는 능력을 보여줬으며, 새롭게 개발된 ExploitBench, ExploitGym, SCONE-bench 벤치마크에서 다른 모든 모델을 압도했어요.

인사이트

  • 클로드 미소스 프리뷰는 단순한 취약점 발견을 넘어, 취약점을 익스플로잇 프리미티브로 전환하고 이를 조합하여 완전한 엔드-투-엔드 공격 체인을 구축할 수 있는 독보적인 능력을 가지고 있어요.
  • 기존 벤치마크로는 최신 LLM의 고도화된 익스플로잇 개발 능력을 측정하기 어려웠고, 이에 ExploitBench, ExploitGym, SCONE-bench와 같은 더 복잡하고 현실적인 새로운 벤치마크들이 등장했어요.
  • 미소스 수준의 LLM이 널리 보급되면 익스플로잇 개발에 필요한 전문 지식과 시간 장벽이 크게 낮아져, 사이버 보안 위험이 증가하고 이에 대한 방어 전략 개발의 중요성이 더욱 커질 거예요.

왜 중요한가

최신 대규모 언어 모델, 특히 클로드 미소스 프리뷰는 스스로 복잡한 사이버 보안 익스플로잇을 개발하는 놀라운 능력을 보여주고 있어요. 이는 익스플로잇 개발을 '대중화'하여 더 많은 사람이 악성 공격을 시도할 수 있게 만들 가능성이 크다는 점에서 매우 중요해요. 이러한 LLM의 발전은 사이버 보안 환경에 중대한 변화를 가져올 것이므로, 모델의 능력을 정확히 평가하고 책임감 있게 배포하며 강력한 방어 메커니즘을 구축하는 것이 시급해요.

프론티어 레드팀 뉴스레터를 구독해 보세요

앤트로픽 팀의 최신 레드팀 연구 결과와 발견 사항들을 받아보세요.

뉴턴 청 (Newton Cheng), 킨 루카스 (Keane Lucas), 위니 샤오 (Winnie Xiao), 니콜라스 칼리니 (Nicholas Carlini), 밀라드 나스르 (Milad Nasr)

클로드 미소스 프리뷰(Claude Mythos Preview)의 익스플로잇 개발 능력은 이전의 프론티어 모델들과 비교했을 때 엄청난 도약이에요. 이것이 바로 앤트로픽 팀이 일반 출시 대신 프로젝트 글래스윙(Project Glasswing)을 통해 모델을 신중하게 선보인 주된 이유 중 하나였어요. 미소스 프리뷰는 복잡한 취약점을 찾아내는 능력도 놀라웠지만, 앤트로픽 팀의 내부 테스트에서 가장 우려됐던 점은 미소스 프리뷰가 취약점을 익스플로잇 프리미티브로 만들고, 이 프리미티브들을 조합해서 완전한 엔드-투-엔드 공격 체인을 구축할 수 있다는 거였어요.

앤트로픽 팀이 미소스 프리뷰의 결과를 발표했을 때, 모델이 새로운 제로데이 취약점을 찾고 그것들을 익스플로잇으로 만들도록 해서 그 능력을 측정했어요. 이런 정성적 평가는 모델의 능력을 보여주는 데 도움이 되지만, 이상적으로는 모델의 능력을 정확하게 측정할 수 있는 고품질 정량적 벤치마크가 있으면 좋겠다는 생각을 했어요. 미소스 프리뷰를 출시할 당시 앤트로픽 팀이 겪었던 문제는, 기존의 어떤 공개 익스플로잇 벤치마크도 초기 테스트에서 미소스 프리뷰의 능력을 제대로 포착할 만큼 어렵지 않았다는 점이에요.

하지만 지난 한 달 동안 두 가지 새로운, 더 도전적인 학술 벤치마크가 개발되는 것을 목격했어요. 바로 ExploitBenchExploitGym이에요. 앤트로픽 팀은 이 벤치마크를 만든 연구자들과 협력하여 미소스 프리뷰의 성능을 측정했고, MATS 및 Anthropic Fellows Program과 협력하여 스마트 컨트랙트 익스플로잇을 측정하기 위해 개발한 SCONE-bench의 업데이트된 버전에서도 미소스 프리뷰를 실행해 보았어요. 세 가지 벤치마크 모두에서 미소스 프리뷰가 다른 모든 평가 모델들을 꾸준히 능가한다는 것을 발견했어요. 앤트로픽 팀은 미소스 수준의 기능이 더 널리 보급되면 익스플로잇 개발에 필요한 지식과 전문성이 크게 줄어들 것이라는 추가적인 증거라고 생각해요.

ExploitBench는 대규모 언어 모델의 익스플로잇 개발 능력을 연구하기 위한 벤치마크예요. 카네기 멜론 대학교와 버그크라우드(Bugcrowd)의 이승현 씨와 데이비드 브럼리 교수님이 개발했어요. 이 벤치마크가 흥미로운 점은 언어 모델이 완전한 엔드-투-엔드 익스플로잇을 작성하는 능력을 측정하는 데 초점을 맞춘다는 거예요. 이전 벤치마크들은 일반적으로 언어 모델이 취약점의 존재를 보여주는 '개념 증명(proof-of-concept)'을 작성하는 능력을 측정하는 데 중점을 두었어요. 하지만 개념 증명은 버그가 재현 가능하거나 접근 가능하다는 것을 보여줄 뿐, 공격자가 실제로 해를 입히는 데 사용할 수 있다는 것을 의미하지는 않아요. ExploitBench에서는 언어 모델이 공격자에게 임의 코드 실행(ACE)과 같은 새로운 기능을 부여하기 위해 취약점에서 익스플로잇 프리미티브를 구축해야 해요.

ExploitBench는 익스플로잇 개발 과정을 16가지의 개별적인 능력으로 분해했어요. 이 각각의 능력은 프로그램적으로 검증되며, 이는 작동하는 익스플로잇을 구축하는 데 필요한 다양한 중간 능력을 세밀하게 분석할 수 있게 해줘요. 16가지 능력은 5단계 능력 티어로 나뉘어 '능력 사다리'를 형성해요.

이 프레임워크를 사용해 저자들은 V8 익스플로잇 트래커에서 가져온 V8 자바스크립트 및 웹어셈블리 엔진의 41가지(현재 패치됨) 취약점을 사용하는 V8 벤치마크를 구축했어요. V8 엔진은 크로미엄 기반 애플리케이션(예: 크롬, 엣지, 안드로이드 웹뷰), Node.js 환경(서버 백엔드), 그리고 일렉트론(Electron) 앱(예: VS 코드, 슬랙, 디스코드)에 사용되는 널리 쓰이는 인프라예요. 이 프레임워크의 핵심 요소는 보안 방어에 대한 테스트예요. V8 샌드박스는 웹페이지의 자바스크립트 객체가 상주하는 메모리를 분리해서 V8 버그가 브라우저 깊숙이 침투하는 발판이 되지 않도록 막아요. 가장 높은 점수를 받은 티어는 전체 V8 프로세스 내에서 임의 코드 실행을 의미하며 (브라우저에서는 전체 탭을 제어하는 것과 같아요).

취약한 V8 엔진 빌드와 특정 취약점을 수정하는 패치가 주어지면, 언어 모델은 해당 버그에 대한 익스플로잇을 구축하도록 지시받아요. 익스플로잇은 사람이나 LLM 평가자 없이 16가지 모든 능력에 대해 자동으로 점수가 매겨져요. 낮은 티어는 패치된 빌드와의 차등 실행으로 확인하고요. 높은 티어는 V8에 내장된 챌린지-응답(challenge-response) 기능을 사용하는데, 이는 여러 무작위 힙 레이아웃에 걸쳐 재생되므로 유출된 주소를 하드코딩하는 방식으로는 통과할 수 없어요. 기록(transcript)에 대한 별도의 정적 스캔은 다른 형태의 부정 행위를 걸러내는 백스톱 역할을 해요.

모든 모델은 300턴 예산이 있는 동일한 ExploitBench 하네스에서 실행되며, 이 하네스에는 Baseline과 Nudged 두 가지 변형이 있어요. Nudged 변형에서는 예산 한도에 가까워지면 모델에게 마무리를 하도록 경고하거나, 너무 일찍 멈추면 모델이 턴 예산을 모두 사용하도록 권장하기 위해 하네스가 추가 프롬프트를 적응적으로 삽입해요. 각 변형은 세 번의 시도를 거쳐 실행됩니다. 앤트로픽 팀은 모든 클로드 모델을 실행한 다음, 모든 결과와 기록을 벤치마크 저자들에게 제공했고, 저자들이 결과를 검증했어요.

ExploitBench V8 벤치마크에서 LLM 모델들의 익스플로잇 개발 능력 평가 결과. Mythos Preview가 다른 모델들을 크게 앞서는 모습을 보여줘요.
Figure 1: The highest tier achieved in 3 trials across 41 CVE environments and the Mean cap(abilities) achieved out of the 16 measured across all trials. Spend is calculated by API usage. Source: exploitbench.aiFigure 2: Cumulative number of environments out of 41 for which a model was able to reach a given capability tier for the Baseline variant.
ExploitBench V8 벤치마크에서 LLM 모델별 임의 코드 실행(ACE) 성공률 비교 그래프. Mythos Preview가 다른 어떤 모델도 달성하지 못한 높은 성공률을 기록했어요.
Figure 2: Cumulative number of environments out of 41 for which a model was able to reach a given capability tier for the Baseline variant.

모질라 파이어폭스(Mozilla Firefox)에 대한 이전 발견과 일관되게, 모든 언어 모델은 주어진 취약점에 도달하거나 트리거할 수 있지만, 클로드 오퍼스 4.6(Claude Opus 4.6) 이후의 모델만이 V8 샌드박스 내에서 프리미티브를 개발하는 데 진전을 보였어요. V8 샌드박스를 벗어나 T3에서 T2로 넘어가는 것은 다음 능력의 절벽인데요. 미소스 프리뷰는 테스트된 모델 중 유일하게 이 작업을 안정적으로 수행할 수 있었는데, 테스트된 환경의 절반 이상에서 성공했어요. 또한 Baseline 변형에서는 거의 절반의 환경에서 제어 흐름 하이재킹(T1)을 달성했어요. Baseline과 Nudged 변형을 결합했을 때, 미소스 프리뷰는 41개 CVE 중 21개에서 ACE를 달성했지만, 다른 어떤 모델도 두 변형 모두에서 1개 ACE도 달성하지 못했어요. 점수판에서 ACE를 달성한 유일한 다른 모델은 41개 CVE 중 2개에서만 성공했고, 그것도 독점적인 스캐폴드를 사용해서였어요.

또한, 저자들은 미소스 프리뷰의 몇 가지 익스플로잇 시도에 대해 심층 분석을 수행했어요. 한 사례에서는 미소스 프리뷰가 CVE-2023-6702 버그에 대해 거의 확정적인(near-deterministic) 익스플로잇을 만들 수 있었는데, 공개적으로 알려진 익스플로잇은 확률적이고 제어되지 않았어요. 익스플로잇 배포는 한 번의 시도로 제한될 수 있기 때문에, 안정성은 실제로 거래되는 익스플로잇에 있어 매우 중요해요. 미소스 프리뷰가 이를 달성한 방식 또한 인상적이었어요. ExploitBench의 저자 중 한 명인 이승현 씨는 이렇게 적었어요. "저는 1-day v8CTF 익스플로잇의 원저자와 이 익스플로잇 계획의 가능성에 대해 개인적으로 논의했었는데, 접근 방식의 복잡성 때문에 빠르게 기각했어요. 미소스는 이 특정 익스플로잇 기술에 대한 어떠한 공개 정보 없이도 이를 깔끔하고 완벽하게 실행했어요."

이러한 정성적 분석에 대한 더 자세한 내용은 여기에서 읽어보시거나, 더 많은 정보를 얻으려면 exploitbench.ai 벤치마크 웹사이트 또는 프리프린트를 참조하세요.

ExploitGym은 광범위한 목표 세트에 걸쳐 언어 모델의 익스플로잇 능력을 측정하는 것을 목표로 하는 두 번째 벤치마크예요. UC 버클리, 막스 플랑크 보안 및 프라이버시 연구소, UC 산타바바라, 애리조나 주립 대학교의 협력으로 개발되었으며(앤트로픽, OpenAI, 구글의 보안 연구자들도 기여했어요), CyberGym 취약점 재현 벤치마크의 후속 작업이에요.

ExploitGym의 저자들은 OSS-Fuzz의 많은 프로젝트, V8 엔진, 리눅스 커널에서 발견된 898개의 현재 패치된 취약점에 자신들의 평가 프레임워크를 적용했어요. 이 세 가지 목표 클래스는 전 세계에서 가장 많이 사용되는 소프트웨어의 상당 부분을 포괄해요.

주어진 취약점에 대해 언어 모델은 빌드 정보(취약한 소스 코드 및 빌드 스크립트), 취약점 정보(취약점 증명; 취약점 설명), 런타임 정보(컴파일된 바이너리; 실행 스크립트), 그리고 취약한 진입점을 실행하는 원격 타겟을 제공받아요. 그런 다음 언어 모델은 타겟의 보안 모델이 도달할 수 없게 만들어야 하는 권한 수준에서 코드를 실행하여, 타겟에 대한 무단 코드 실행을 달성하는 작동하는 익스플로잇을 개발해야 해요. 그리고 상승된 권한을 사용하여 동적으로 생성된 플래그를 검색해야 하고요. 시도는 올바른 플래그가 제출되고, 모델 평가자가 시도가 의도된 취약점(다른, 잠재적으로 더 쉽게 익스플로잇될 수 있는 취약점이 아니라)을 익스플로잇했다고 판단할 때만 성공으로 표시돼요. 평가 프레임워크는 V8 힙 샌드박스 및 리눅스 커널 주소 공간 레이아웃 무작위화(KASLR)와 같은 토글 가능한 보안 완화 기능을 지원해요.

평가를 위한 Baseline 프레임워크는 보안 완화 기능이 꺼진 상태에서 두 시간의 실제 시간 제한을 사용하고, 모델은 개발자가 권장하는 하네스로 실행돼요(예: 클로드 모델은 Claude Code 하네스로 실행돼요). 모든 모델은 동일한 프롬프트로 실행돼요. 앤트로픽 팀은 오퍼스 4.6과 미소스 프리뷰 실험을 실행했어요.

ExploitGym 벤치마크에서 LLM 모델들의 목표 취약점 및 대체 취약점을 통한 무단 코드 실행 성공률 비교. Mythos Preview가 가장 높은 성공률을 보여줘요.
Figure 3: Successes per model using the intended vulnerability with a two-hour timeout. Successes in each category are stacked, with total successes at the top of each bar.Figure 4: Total number of flag captures per model, including captures using an unintended vulnerability.
ExploitGym 벤치마크에서 LLM 모델별 타겟 클래스(OSS-Fuzz, V8, Linux 커널)별 익스플로잇 성공 횟수 분포. Mythos Preview는 모든 타겟 클래스에서 높은 성과를 보여줘요.
Figure 4: Total number of flag captures per model, including captures using an unintended vulnerability.

두 시간의 제한 시간 내에, 미소스 프리뷰는 의도된 취약점을 사용하여 157개 작업에서 무단 코드 실행을 성공적으로 달성했어요. 의도된 취약점을 사용하지 않는 코드 실행 경로를 포함하면 성공적인 플래그 캡처는 226개로 늘어나요. 이전 세대의 클로드 모델은 훨씬 낮은 성공률을 보였는데요. 예를 들어, 오퍼스 4.6은 의도된 취약점으로 15번 성공했고, 대체 취약점을 통한 성공을 포함하면 36번 성공했을 뿐이에요. 세 가지 타겟 클래스(OSS-Fuzz, V8, Linux 커널)별 성공 분포를 보면, 미소스 프리뷰의 개선 사항이 모든 클래스에 걸쳐 나타나며, 커널 익스플로잇을 자주 개발할 수 있는 두 모델 중 하나예요.

더 자세한 내용은 저자들의 블로그 또는 프리프린트에서 확인해 보세요.

작년에 MATS와 Anthropic Fellows Program과 협력하여, 앤트로픽 팀은 LLM이 스마트 컨트랙트의 취약점을 찾고 익스플로잇하는 능력을 연구하기 위해 스마트 컨트랙트 익스플로잇 벤치마크 (SCONE-bench)를 개발했어요. 각 스마트 컨트랙트에 대해 언어 모델은 취약점을 식별하고 로컬 시뮬레이션에서 컨트랙트가 관리하는 자금을 훔치는 익스플로잇을 생성하도록 지시받아요. 성능은 성공적인 익스플로잇으로 인한 총 (시뮬레이션된) 수익으로 측정돼요.

앤트로픽 팀은 모든 모델의 최신 지식 차단 날짜(2026년 1월 1일) 이후 보고된 12개의 익스플로잇을 사용하는 업데이트된 버전의 벤치마크를 실행했으며, 문제들은 DefiHackLabs 데이터셋에서 가져왔어요. 언어 모델이 성공적으로 익스플로잇한 각 스마트 컨트랙트에 대해, 앤트로픽 팀은 모델의 기본 토큰 수익을 코인게코 API(CoinGecko API)에서 보고된 실제 익스플로잇이 발생한 날짜의 역사적 환율을 사용하여 USD로 환산해서 익스플로잇의 달러 가치를 계산했어요. 그런 다음 모든 익스플로잇의 총 가치를 합산하여 아래 로그 스케일 그림에 나타냈어요.

SCONE-bench 스마트 컨트랙트 익스플로잇 벤치마크에서 LLM 모델별 성공적인 익스플로잇으로 얻은 총 가치(수익) 비교. Mythos Preview가 다른 모델들을 압도하는 수익을 기록했어요.
Figure 5: Total revenue (in log scale) from successfully exploiting smart contract vulnerabilities reported after the latest knowledge cutoff date across Anthropic models released over the last year, as tested in simulation and Best@8. The shaded region represents 90% CI calculated by bootstrap over the set of model-revenue pairs.

앤트로픽 팀은 미소스 프리뷰가 이 벤치마크에서 3천5백만 달러 상당의 스마트 컨트랙트를 익스플로잇할 수 있다는 것을 발견했어요. 이는 앤트로픽 팀이 테스트한 다음으로 가장 가까운 모델보다 1천5백만 달러, 약 75% 더 많은 금액이에요. 최신 프론티어 모델들은 취약점을 더 일관되게 익스플로잇할 수 있고(더 높은 공격 성공률에 해당), 주어진 익스플로잇을 더 효율적으로 활용하여 더 많은 자금을 훔칠 수 있어요. 미소스 프리뷰와 다른 모델들 간의 수익 격차는 주로 미소스 프리뷰가 테스트된 모든 취약점을 성공적으로 익스플로잇한 유일한 모델이라는 사실 때문이에요. 오퍼스 4.7이 truebit을 익스플로잇할 수 있었던 유일한 다른 모델이에요. 다른 모델들은 8회 시도 설정에서 makina를 익스플로잇할 수 없었어요. 앤트로픽 팀은 원래 게시물에서 오퍼스 4.5 이전 모델들의 성능이 총 수익 대 출시 시점을 기준으로 로그-선형 궤적을 따르며, 평균 두 배 증가 시간이 1.1개월이라고 언급했어요. 오퍼스 4.5 이후의 앤트로픽 팀 모델들은 이러한 추세를 계속 따르지만, 두 배 증가 시간이 0.7개월에 불과해요. 앤트로픽 팀은 그 게시물에서 "두 배 증가 추세가 결국 정체될 것으로 예상한다"고 언급했지만, 분명히 아직 정체기에 도달하지는 않았어요.

이 게시물과 함께, 앤트로픽 팀은 SCONE-bench의 하네스와 데이터셋을 여기에서 오픈 소스로 공개하고 있어요.

올해 2월의 가장 강력했던 모델들은 대부분의 방어 메커니즘이 비활성화된 시뮬레이션 시나리오에서 겨우 익스플로잇을 개발할 수 있었던 반면, 미소스 프리뷰는 세계에서 가장 널리 사용되는 소프트웨어에서 완전한 엔드-투-엔드 익스플로잇을 구축할 수 있어요. 앤트로픽 팀은 미소스 수준의 모델들이 향후 6~12개월 내에 널리 보급될 것이라고 생각해요. 그렇게 되면, 이러한 종류의 익스플로잇 개발은 전문가의 전문 지식을 훨씬 덜 필요로 하게 되어 점점 더 상용화될 거예요.

모델의 능력이 계속 향상됨에 따라, 모델이 무엇을 할 수 있는지 잘못 판단하는 비용도 함께 증가해요. 이러한 도전에 대처하려면 모델 능력에 대한 정확하고 포괄적인 프로파일을 구축해야 하며, 이는 다시 깊은 도메인 전문 지식을 가진 사람들이 구축한 고품질의 공개적으로 이용 가능한 벤치마크, 즉 현실적이고 어려운 작업을 개발해야 함을 의미해요. 사이버 공격 체인의 더 많은 취약점 클래스, 더 많은 타겟, 더 많은 단계에 걸쳐 ExploitBench 및 ExploitGym과 같은 더 많은 연구가 필요해요. 점점 강력해지는 모델로 인해 발생하는 위험을 연구하고 완화하려는 앤트로픽 팀의 노력의 일환으로, 앤트로픽 팀은 사이버 영역에서 모델에 대한 고품질의 엄격한 평가 개발을 지원하고 있어요. 더 자세한 내용은 외부 연구자 접근 프로그램(External Researcher Access Program)을 통해 문의해 주세요.

더 나은 측정은 책임감 있는 배포를 위해 필수적이지만 충분하지 않아요. 프로젝트 글래스윙으로 사이버 방어자들을 지원하는 것 외에도, 앤트로픽 팀은 사이버 검증 프로그램(Cyber Verification Program)을 도입하여, 잠재적으로 악의적인 사이버 위협을 더 적극적으로 차단하면서도 클로드를 사용하여 자체 소프트웨어와 인프라를 보호하는 방어자들을 지원하고 있어요.

앤트로픽 팀의 노력에 기여하고 싶으시다면, 연구 과학자 및 엔지니어, 위협 조사관, 정책 관리자, 공격 보안 연구원, 보안 엔지니어 등 다양한 직책의 채용 공고가 열려 있어요.

최신 경제 지수 보고서에서 앤트로픽 팀은 처음으로 시간 단위로 샘플링하여 다음 질문을 던졌어요. 사람들은 언제 클로드를 찾을까요? 무엇을 생산할까요? 그리고 AI가 그들의 작업에 미치는 영향을 어떻게 인식할까요?

이 보고서는 클로드가 앤트로픽 직원들이 정교한 로봇 공학 작업을 수행하는 데 도움이 될 수 있는지에 대한 최신 테스트 결과를 제공해요. 앤트로픽 팀은 인간의 도움 없이 작동하는 클로드 오퍼스 4.7이 1년 미만 전에 참가자들이 완료했던 모든 작업에서 가장 빠른 인간 팀보다 약 20배 더 빨랐다는 것을 발견했어요.

이 보고서는 2025년 10월부터 2026년 4월까지 약 23만 5천 명의 사용자로부터 얻은 약 40만 개의 대화형 세션을 개인 정보 보호 방식으로 분석하여, 클로드 코드가 실제로 어떻게 사용되는지에 대한 증거를 제공해요.

앤트로픽 팀의 최신 레드팀 연구 결과와 발견 사항들을 받아보세요.

anthropic · 원문 보기 · 2026-06-05

이 글은 원문을 한국어로 번역한 것입니다. 저작권은 원 저작자에게 있습니다.