AI 안전에 대한 앤트로픽의 핵심 관점: 언제, 왜, 무엇을, 어떻게 해야 할까요?
요약
앤트로픽은 AI가 10년 안에 인류 역사상 가장 큰 변화를 가져올 것이며, 안전한 AI 시스템 개발은 시급하고 다각적인 접근이 필요한 과제라고 말해요.
인사이트
- AI는 앞으로 10년 안에 지적 능력에서 인간을 능가할 가능성이 있으며, 산업혁명과 맞먹는 엄청난 사회적 영향을 미칠 거예요.
- 현재로서는 강력한 AI 시스템이 항상 인간에게 유익하고, 정직하며, 해롭지 않게 작동하도록 견고하게 훈련하는 방법을 알지 못해요.
- 앤트로픽은 확장 가능한 감독, 기계적 해석 가능성, 과정 중심 학습 등 다양한 경험적 연구를 통해 AI 안전 문제를 다각적으로 해결하는 데 가장 큰 기대를 걸고 있어요.
왜 중요한가
이 글은 AI 연구의 최전선에 있는 앤트로픽이 AI 발전의 속도와 잠재적 위험에 대해 어떤 시각을 가지고 있는지 명확하게 보여줘요. 단순한 우려를 넘어, 구체적인 안전 연구 접근 방식과 철학을 제시함으로써 AI 커뮤니티와 정책 입안자들이 안전하고 신뢰할 수 있는 미래 AI를 만드는 데 기여하고, 잠재적 위험에 대비해야 함을 강조하는 중요한 가이드라인이 될 수 있어요.
AI 안전에 대한 핵심 관점: 언제, 왜, 무엇을, 어떻게 해야 할까요?

우리는 앤트로픽을 설립했으며, AI의 영향이 산업혁명이나 과학혁명에 비견될 만하다고 믿어요. 하지만 이 모든 게 잘 진행될지는 확신할 수 없고요. 그리고 이런 엄청난 영향이 조만간, 아마도 향후 10년 안에 나타나기 시작할 거라고 생각하고 있어요.
이런 관점이 비현실적이거나 거창하게 들릴 수도 있고, 회의적인 시각을 가질 만한 충분한 이유도 있어요. 무엇보다도, '우리가 하는 일이 역사상 가장 큰 발전 중 하나일지도 모른다'고 말했던 거의 모든 사람이 틀렸고, 때로는 우스꽝스럽기까지 했거든요. 그럼에도 불구하고, 우리 앤트로픽은 급격한 AI 발전이 변혁적인 AI 시스템으로 이어질 세상에 진지하게 대비해야 할 충분한 증거가 있다고 믿어요.
앤트로픽의 모토는 '말만 하지 말고 보여줘라'였어요. 그래서 우리는 AI 커뮤니티 전반에 가치 있다고 생각하는 안전 지향적 연구를 꾸준히 발표하는 데 집중해왔죠. 지금 이 글을 쓰는 건, AI 발전에 대해 더 많은 사람이 알게 되면서 앤트로픽의 관점을 공유하고 전략과 목표를 설명하는 게 시의적절하다고 생각했기 때문이에요. 간단히 말해서, AI 안전 연구는 시급히 중요하며, 광범위한 공공 및 민간 주체의 지원을 받아야 한다고 생각하고 있어요.
그래서 이 글에서는 우리 앤트로픽이 왜 이런 모든 것을 믿는지 요약해볼 거예요. 왜 우리가 AI의 매우 빠른 발전과 막대한 영향력을 예상하는지, 그리고 그것이 AI 안전에 대한 우려로 이어진 과정을 말이죠. 그런 다음, 우리 앤트로픽의 AI 안전 연구 접근 방식과 그 배경에 있는 몇 가지 논리를 간략하게 요약할게요. 이 글을 통해 AI 안전 및 AI 발전에 대한 더 폭넓은 논의에 기여할 수 있기를 바라요.
이 글의 주요 내용을 요약하자면 이래요.
AI는 앞으로 10년 안에 매우 큰 영향을 미칠 거예요. AI 훈련에 사용되는 연산량의 기하급수적인 증가는 빠르고 지속적인 AI 발전의 예측 가능한 결과인데요, '스케일링 법칙'에 대한 연구는 더 많은 연산량이 능력의 전반적인 향상으로 이어진다는 걸 보여주고 있기 때문이에요. 간단한 외삽(Extrapolation)은 AI 시스템이 다음 10년 안에 훨씬 더 유능해질 것이며, 대부분의 지적 작업에서 인간 수준의 성능과 같거나 이를 초과할 수도 있다는 걸 시사해요. AI 발전이 둔화되거나 멈출 수도 있지만, 증거는 아마도 계속될 거라고 말해주고 있어요. 우리는 시스템이 견고하게 잘 행동하도록 훈련하는 방법을 알지 못해요. 지금까지 아무도 매우 강력한 AI 시스템이 견고하게 유용하고, 정직하며, 해롭지 않게 행동하도록 훈련하는 방법을 알지 못하고 있어요. 게다가, 급격한 AI 발전은 사회에 큰 혼란을 가져올 수 있고, 기업이나 국가가 신뢰할 수 없는 AI 시스템을 배포하게 할 수 있는 경쟁을 유발할 수 있어요. 이런 결과는 AI 시스템이 전략적으로 위험한 목표를 추구하거나, 중요한 상황에서 이 시스템이 더 순진한 실수를 저지르기 때문에 재앙적일 수 있어요. 우리 앤트로픽은 다각적이고 경험 중심적인 AI 안전 접근 방식에 가장 낙관적이에요. 앤트로픽은 안정적으로 안전한 시스템을 구축하려는 목표로 다양한 연구 방향을 추구하고 있으며, 현재는 스케일링 감독, 기계적 해석 가능성, 과정 중심 학습, 그리고 AI 시스템이 어떻게 학습하고 일반화하는지 이해하고 평가하는 것에 가장 큰 기대를 걸고 있어요. 우리 앤트로픽의 핵심 목표는 이 안전 작업을 차등적으로 가속화하고, 안전 문제가 쉽게 해결되는 시나리오부터 안전한 시스템을 만드는 것이 매우 어려운 시나리오까지 광범위한 시나리오를 포괄하려는 안전 연구의 프로필을 개발하는 거예요.
AI의 빠른 발전에 대한 우리의 대략적인 견해
AI 성능의 예측 가능한 1 향상으로 이어지는 세 가지 주요 요소는 훈련 데이터, 연산량, 그리고 개선된 알고리즘이에요. 2010년대 중반, 우리 중 일부는 더 큰 AI 시스템이 일관되게 더 똑똑하다는 것을 알아챘고, 그래서 AI 성능에서 가장 중요한 요소는 AI 훈련 연산량의 총 예산일 수 있다고 이론화했어요. 이를 그래프로 그렸을 때, 가장 큰 모델에 투입되는 연산량이 연간 10배씩 성장하고 있었다는 걸 (무어의 법칙보다 7배 빠른 두 배 증가 시간) 명확히 알 수 있었죠. 2019년, 앤트로픽의 창립팀이 될 여러 멤버들은 AI를 위한 스케일링 법칙을 개발하여 이 아이디어를 정교하게 만들었고, 단순히 AI를 더 크게 만들고 더 많은 데이터로 훈련시키면 예측 가능한 방식으로 AI를 더 똑똑하게 만들 수 있다는 걸 보여주었어요. 부분적으로는 이런 결과에 힘입어, 이 팀은 매개변수가 1,730억 개가 넘는, 아마도 최초의 현대적인 '대규모' 언어 모델인 GPT-3를 훈련시키는 데 일조했어요 2.
스케일링 법칙이 발견된 이후, 우리 앤트로픽의 많은 구성원들은 AI의 매우 빠른 발전이 꽤나 가능성이 높다고 믿어왔어요. 하지만 2019년에는 멀티모달(multimodality), 논리적 추론, 학습 속도, 작업 간 전이 학습, 그리고 장기 기억이 AI 발전의 속도를 늦추거나 멈출 수 있는 '벽'일 수 있다고 생각했어요. 그 이후 몇 년 동안, 멀티모달과 논리적 추론 같은 이런 '벽' 중 일부는 무너졌죠. 이런 상황을 감안할 때, 우리 대부분은 AI의 빠른 발전이 멈추거나 정체되지 않고 계속될 것이라고 점점 더 확신하게 되었어요. AI 시스템은 이제 다양한 작업에서 인간 수준의 성능에 근접하고 있는데도, 이런 시스템을 훈련하는 비용은 허블 우주 망원경이나 대형 강입자 충돌기 같은 '빅 사이언스' 프로젝트보다 훨씬 적어요. 이는 더 많은 성장의 여지가 있다는 뜻이죠 3.
사람들은 초기 단계의 기하급수적 성장을 인식하고 인정하는 데 서투른 경향이 있어요. 비록 AI에서 빠른 발전을 보고 있지만, 이런 국지적인 발전이 예외적인 것이고 곧 정상으로 돌아올 것이라고 가정하는 경향이 있죠. 하지만 우리 앤트로픽의 생각이 맞다면, 현재 느끼는 AI의 빠른 발전은 AI 시스템이 우리 자신의 능력을 뛰어넘는 광범위한 능력을 갖추기 전까지는 끝나지 않을 수 있어요. 게다가, AI 연구에 고급 AI를 사용하는 것에서 오는 피드백 루프는 이런 전환을 특히 신속하게 만들 수도 있어요. AI 연구자들의 생산성을 높이는 코드 모델과 인간 피드백 의존도를 줄여주는 헌법적 AI의 발전과 함께 이런 과정이 시작되는 걸 이미 보고 있어요.
이 모든 것이 맞다면, 대부분 또는 모든 지식 노동은 머지않은 미래에 자동화될 수 있어요. 이는 사회에 엄청난 영향을 미 미칠 것이고, 다른 기술의 발전 속도도 바꿀 가능성이 높아요 (알파폴드와 같은 시스템이 이미 오늘날 생물학을 가속화하는 것이 초기 사례이죠). 미래 AI 시스템이 어떤 형태를 띨지는 — 예를 들어, 독립적으로 행동할 수 있을지 아니면 단순히 인간에게 정보를 생성할지에 대해 — 아직 결정되지 않았어요. 하지만 이것이 얼마나 중요한 순간이 될 수 있는지는 아무리 강조해도 지나치지 않아요. AI 발전이 훨씬 더 관리하기 쉽게, 몇 년이나 수십 년이 아닌 수 세기에 걸쳐 진행될 정도로 늦춰지기를 바랄 수도 있겠지만, 우리는 바라는 결과가 아니라 예상되는 결과에 대비해야 해요.
물론 이 전체 그림이 완전히 잘못된 생각일 수도 있어요. 우리 앤트로픽은 그럴 가능성이 높다고 생각하지만, 아마도 AI 개발에 대한 우리의 작업 때문에 편향된 걸 수도 있죠. 설령 그렇다 해도, 이 그림이 너무나 그럴듯해서 자신 있게 무시할 수 없다고 생각해요. 잠재적으로 중대한 함의를 고려할 때, AI 기업, 정책 입안자 및 시민 사회 기관은 변혁적인 AI를 다루는 방법에 대한 연구와 계획에 매우 진지한 노력을 기울여야 한다고 믿어요.
어떤 안전 위험이 있을까요?
위에서 설명한 견해를 받아들일 의향이 있다면, AI가 우리의 안전과 보안에 위험이 될 수 있다고 주장하는 건 그리 어렵지 않아요. 우려해야 할 두 가지 상식적인 이유가 있죠.
첫째, 시스템이 설계자만큼 지능적이고 주변 환경을 인지하기 시작할 때, 안전하고 신뢰할 수 있으며 조종 가능한 시스템을 구축하는 것이 까다로울 수 있어요. 비유하자면, 체스 그랜드마스터가 초보자의 나쁜 수를 감지하는 것은 쉽지만, 초보자가 그랜드마스터의 나쁜 수를 감지하는 것은 매우 어렵죠. 만약 우리가 인간 전문가보다 훨씬 더 유능하지만 우리의 최선의 이익과 충돌하는 목표를 추구하는 AI 시스템을 만든다면, 그 결과는 참혹할 수 있어요. 이것이 바로 기술 정렬(Alignment) 문제예요.
둘째, 급격한 AI 발전은 고용, 거시 경제, 그리고 국가 내외의 권력 구조를 변화시키면서 매우 파괴적일 수 있어요. 이런 파괴는 그 자체로 재앙적일 수 있으며, 신중하고 사려 깊은 방식으로 AI 시스템을 구축하는 것을 더 어렵게 만들어 더 큰 혼란과 AI에 대한 더 많은 문제를 야기할 수도 있어요.
AI 발전이 빠르다면, 이 두 가지 위험 원천이 매우 중요할 거라고 생각해요. 이런 위험들은 또한 예상하기 어려운 다양한 방식으로 서로에게 복합적으로 작용할 거예요. 아마도 나중에 돌아보면 우리가 틀렸다고 판단할 수도 있고, 하나 또는 둘 모두 문제가 되지 않거나 쉽게 해결될 수도 있죠. 그럼에도 불구하고, 우리는 '잘못 판단하는 것'이 재앙이 될 수 있기 때문에 조심하는 편이 낫다고 믿어요.
물론, 우리는 이미 AI 행동이 개발자의 의도와 달라지는 다양한 방식을 경험했어요. 여기에는 유해성, 편향성, 신뢰성 부족, 부정직함, 그리고 최근에는 아첨하거나 권력을 원하는 모습을 보이는 것이 포함되죠. AI 시스템이 확산되고 더 강력해짐에 따라, 이런 문제들의 중요성이 커질 것이며, 그중 일부는 인간 수준의 AI 이상에서 우리가 마주할 문제들을 대표할 수 있다고 예상하고 있어요.
하지만 AI 안전 분야에서는 예측 가능한 변화와 예상치 못한 변화가 혼합되어 나타날 거라고 예상해요. 오늘날 AI 시스템에서 발견된 모든 문제를 만족스럽게 해결하더라도, 미래의 문제들도 모두 같은 방식으로 해결될 수 있다고 맹목적으로 가정하고 싶지는 않아요. 어떤 무서운, 추측성 문제들은 AI 시스템이 세상에서의 자신의 위치를 이해하고, 사람들을 성공적으로 속이거나, 인간이 이해하지 못하는 전략을 개발할 만큼 똑똑해진 후에야 발생할 수 있거든요. AI가 매우 발전했을 때만 발생할 수 있는 많은 우려스러운 문제들이 있어요.
우리 앤트로픽의 접근 방식: AI 안전에서의 경험주의
우리는 연구 대상과 긴밀하게 접촉하지 않고서는 과학 및 공학에서 빠른 발전을 이루기 어렵다고 믿어요. '최신 정보'에 대해 끊임없이 반복하는 것은 보통 과학적 발전에 매우 중요하죠. 우리 앤트로픽의 AI 안전 연구에서 AI에 대한 경험적 증거는 — 주로 계산 실험, 즉 AI 훈련 및 평가에서 비롯되지만 — 최신 정보의 주요 원천이에요.
이것이 이론적 또는 개념적 연구가 AI 안전에 설 자리가 없다는 뜻은 아니에요. 하지만 우리는 경험에 기반한 안전 연구가 가장 관련성이 높고 영향력이 클 것이라고 믿고 있어요. 가능한 AI 시스템, 가능한 안전 실패, 가능한 안전 기술의 공간은 넓고, 단순히 앉아서 혼자 탐색하기는 어려워요. 모든 변수를 고려하는 것이 어렵기 때문에, 결코 발생하지 않는 문제에 과도하게 매달리거나 발생하는 큰 문제들을 놓치기 쉬울 수 있어요 4. 좋은 경험적 연구는 종종 더 나은 이론적이고 개념적인 작업을 가능하게 하죠.
이와 관련해서, 우리는 안전 문제 감지 및 완화 방법이 미리 계획하기 극히 어렵고 반복적인 개발이 필요할 거라고 믿어요. 이런 점을 고려할 때, 우리는 '계획은 필수적이지만, 계획 자체는 쓸모없다'고 생각하는 경향이 있어요. 언제든 우리 연구의 다음 단계에 대한 계획을 염두에 둘 수는 있지만, 이 계획에 크게 집착하지 않아요. 그것들은 더 많은 것을 배움에 따라 바꿀 준비가 되어 있는 단기적인 베팅에 가깝죠. 이것은 분명히 현재 연구 방향이 성공할 것이라고 보장할 수 없다는 의미이지만, 이는 모든 연구 프로그램의 현실이기도 해요.
경험적 안전 연구에서 최첨단 모델의 역할
앤트로픽이 조직으로 존재하는 주요 이유 중 하나는 '최첨단' AI 시스템에 대한 안전 연구를 수행하는 것이 필수적이라고 믿기 때문이에요. 이를 위해서는 대규모 모델로 작업하고 안전을 우선시할 수 있는 기관이 필요하죠 5.
그 자체로 경험주의가 반드시 최첨단 안전 연구의 필요성을 의미하는 건 아니에요. 더 작고 덜 유능한 모델에서 경험적 안전 연구를 효과적으로 수행할 수 있는 상황을 상상할 수도 있겠죠. 하지만 우리는 우리가 처한 상황이 그렇다고 생각하지 않아요. 가장 기본적인 수준에서, 이는 대규모 모델이 소규모 모델과 질적으로 다르기 때문이에요 (여기에는 갑작스럽고 예측 불가능한 변화도 포함되죠). 하지만 규모는 안전과 더 직접적인 방식으로도 연결되어 있어요.
- 가장 심각한 안전 문제 중 상당수는 인간 수준에 근접한 시스템에서만 발생할 수 있으며, 이런 AI에 접근하지 않고서는 이런 문제에 대한 진전을 이루기 어렵거나 불가능해요.
- 헌법적 AI나 디베이트와 같은 많은 안전 방법은 대규모 모델에서만 작동할 수 있어요. 작은 모델로 작업하면 이런 방법을 탐색하고 증명하는 것이 불가능하죠.
- 우리의 우려는 미래 모델의 안전에 집중되어 있기 때문에, 모델이 확장됨에 따라 안전 방법과 속성이 어떻게 변하는지 이해해야 해요.
- 미래의 대규모 모델이 매우 위험한 것으로 판명된다면, 이렇다는 설득력 있는 증거를 개발하는 것이 필수적이에요. 이는 대규모 모델을 사용해야만 가능할 거라고 예상하고 있어요.
안타깝게도, 경험적 안전 연구에 대규모 모델이 필요하다면, 어려운 상충 관계에 직면해야 해요. 우리는 안전 관련 연구가 위험한 기술의 배포를 가속화하는 시나리오를 피하기 위해 모든 노력을 기울여야 해요. 하지만 동시에, 과도한 신중함 때문에 가장 안전을 의식하는 연구 노력이 항상 최첨단에 한참 뒤처진 시스템에만 참여하게 하여, 우리가 필수적이라고 여기는 연구를 극적으로 늦춰서도 안 되죠. 게다가, 실질적으로는 안전 연구만으로는 충분하지 않다고 생각해요. 최신 안전 연구를 실제 시스템에 가능한 한 빨리 통합할 수 있는 기관 지식을 갖춘 조직을 구축하는 것도 중요해요.
이러한 상충 관계를 책임감 있게 헤쳐나가는 것은 균형을 잡는 일이며, 이런 우려는 앤트로픽이 조직으로서 전략적 결정을 내리는 방식의 핵심이에요. 안전, 기능, 정책 전반에 걸친 우리의 연구 외에도, 이런 우려는 기업 지배 구조, 채용, 배포, 보안 및 파트너십에 대한 우리의 접근 방식을 이끌고 있어요. 가까운 미래에는 특정 능력 임계값을 넘어서는 모델을 안전 표준이 충족될 경우에만 개발하고, 독립적인 외부 기관이 우리 모델의 능력과 안전을 모두 평가하도록 허용하겠다는 대외적으로 명확한 약속도 할 계획이에요.
AI 안전에 대한 포트폴리오 접근 방식 채택
안전을 중요하게 생각하는 일부 연구자들은 AI 위험의 본질에 대한 강한 의견에 의해 동기 부여를 받아요. 우리 앤트로픽의 경험으로는 가까운 미래의 AI 시스템의 행동과 속성을 예측하는 것조차 매우 어려워요. 미래 시스템의 안전에 대해 선험적으로 예측하는 것은 훨씬 더 어려워 보이고요. 강한 입장을 취하기보다는, 우리는 광범위한 시나리오가 가능하다고 믿고 있어요.
불확실성의 특히 중요한 차원 중 하나는 광범위하게 안전하고 인간에게 거의 위험을 주지 않는 고급 AI 시스템을 개발하는 것이 얼마나 어려울지예요. 이런 시스템을 개발하는 것은 매우 쉬운 것부터 불가능한 것까지 스펙트럼의 어느 곳이든 놓일 수 있어요. 이 스펙트럼을 매우 다른 함의를 가진 세 가지 시나리오로 나누어 볼게요.
낙관적 시나리오: 안전 실패로 인한 고급 AI의 재앙적 위험 가능성이 매우 낮아요. 인간 피드백 강화학습(RLHF)이나 헌법적 AI(CAI)와 같이 이미 개발된 안전 기술들이 정렬에 대부분 충분하다는 거죠. AI의 주요 위험은 유해성 및 의도적인 오용과 같이 오늘날 직면하는 문제들의 연장선상에 있으며, 광범위한 자동화와 국제 권력 역학 변화 등에서 발생하는 잠재적 피해를 말해요. 이를 최소화하기 위해서는 AI 연구소와 학계 및 시민사회 기관과 같은 제3자가 상당한 양의 연구를 수행해야 할 거예요. 중간 시나리오: 재앙적 위험이 고급 AI 개발의 가능한, 심지어 그럴듯한 결과일 수도 있어요. 이를 막기 위해서는 상당한 과학적 및 공학적 노력이 필요하지만, 충분히 집중적인 작업을 통해 우리는 이를 달성할 수 있어요. 비관적 시나리오: AI 안전은 본질적으로 해결 불가능한 문제예요. 즉, 광범위하게 우리 자신보다 지적으로 유능한 시스템에 가치를 통제하거나 지시할 수 없다는 건 단순히 경험적인 사실이죠. 그래서 우리는 매우 진보된 AI 시스템을 개발하거나 배포해서는 안 돼요. 가장 비관적인 시나리오가 매우 강력한 AI 시스템이 생성되기 전까지는 낙관적인 시나리오처럼 보일 수 있다는 점을 언급할 필요가 있어요. 비관적인 시나리오를 진지하게 받아들이려면 시스템이 안전하다는 증거를 평가할 때 겸손하고 신중해야 해요.
만약 우리가 낙관적 시나리오에 있다면... (다행히도) 앤트로픽이 하는 모든 일의 중요성은 훨씬 낮아져요. 왜냐하면 재앙적인 안전 실패가 어쨌든 발생할 가능성이 낮기 때문이죠. 우리의 정렬 노력은 고급 AI가 진정으로 유익한 용도를 가질 수 있는 속도를 높일 것이고, AI 시스템이 개발됨에 따라 발생하는 단기적 피해 중 일부를 완화하는 데 도움이 될 거예요. 우리는 또한 정책 입안자들이 고급 AI가 제기하는 잠재적 구조적 위험 중 일부를 헤쳐나갈 수 있도록 우리의 노력을 전환할 수도 있어요. 이는 재앙적인 안전 실패의 가능성이 매우 낮다면 가장 큰 위험 원천 중 하나가 될 가능성이 높거든요.
만약 우리가 중간 시나리오에 있다면... 앤트로픽의 주요 기여는 고급 AI 시스템이 제기하는 위험을 식별하고, 강력한 AI 시스템을 훈련하는 안전한 방법을 찾아내고 전파하는 것이 될 거예요. 아래에서 더 자세히 논의될 우리 앤트로픽의 다양한 안전 기술 포트폴리오 중 적어도 일부는 이런 시나리오에서 유용할 거라고 기대하고 있어요. 이런 시나리오들은 헌법적 AI와 같은 기술을 반복하여 많은 점진적 진전을 이룰 수 있다고 믿는 '중간-쉬운 시나리오'부터, 기계적 해석 가능성에서 성공하는 것이 최선의 방법이라고 보이는 '중간-어려운 시나리오'까지 다양할 수 있어요.
만약 우리가 비관적 시나리오에 있다면... 앤트로픽의 역할은 AI 안전 기술이 고급 AI의 심각하거나 재앙적인 안전 위험을 막을 수 없다는 가능한 한 많은 증거를 제공하고, 세계의 기관들이 위험한 AI 개발을 막기 위해 공동의 노력을 기울이도록 경종을 울리는 것이 될 거예요. 만약 우리가 '준-비관적' 시나리오에 있다면, 이는 대신 AI 안전 연구에 공동의 노력을 집중하고 그동안 AI 발전을 중단하는 것을 의미할 수 있어요. 우리가 비관적 또는 준-비관적 시나리오에 있다는 징후는 갑작스럽고 알아차리기 어려울 수 있어요. 따라서 우리는 그렇지 않다는 충분한 증거가 없는 한, 항상 우리가 여전히 그런 시나리오에 있다는 가정하에 행동해야 해요.
이런 중대한 상황을 고려할 때, 우리 앤트로픽의 최우선 과제 중 하나는 우리가 어떤 종류의 시나리오에 있는지에 대한 더 많은 정보를 계속 수집하는 거예요. 우리가 추구하는 많은 연구 방향은 AI 시스템에 대한 더 나은 이해를 얻고, 고급 AI 시스템의 권력 추구나 속임수와 같은 우려스러운 행동을 감지하는 데 도움이 될 수 있는 기술을 개발하는 것을 목표로 하고 있어요.
우리 앤트로픽의 목표는 본질적으로 다음을 개발하는 거예요.
- AI 시스템을 더 안전하게 만드는 더 나은 기술.
- AI 시스템이 얼마나 안전하거나 안전하지 않은지 식별하는 더 나은 방법.
낙관적인 시나리오에서는 (1)이 AI 개발자들이 유익한 시스템을 훈련하는 데 도움이 되고 (2)가 그런 시스템이 안전하다는 것을 보여줄 거예요. 중간 시나리오에서는 (1)이 AI 재앙을 피하는 방법이 될 수 있고 (2)는 고급 AI가 제기하는 위험이 낮다는 것을 보장하는 데 필수적일 거예요. 비관적인 시나리오에서는 (1)의 실패가 AI 안전이 해결 불가능하다는 핵심 지표가 될 것이고 (2)는 이를 다른 사람들에게 설득력 있게 보여주는 것을 가능하게 할 거예요.
우리 앤트로픽은 이런 종류의 '포트폴리오 접근 방식'을 AI 안전 연구에 믿고 있어요. 위 목록의 단일 가능한 시나리오에 모든 것을 걸기보다는, AI 안전 연구가 가장 큰 영향력을 가질 가능성이 있는 중간 시나리오에서 상황을 크게 개선할 수 있는 연구 프로그램을 개발하는 동시에, AI 안전 연구가 AI 위험에 큰 영향을 미치지 못할 비관적인 시나리오에서는 경종을 울리려고 노력하고 있어요. 또한 기술 AI 안전 연구의 필요성이 그리 크지 않은 낙관적인 시나리오에서도 유익한 방식으로 그렇게 하려고 노력하고 있죠.
앤트로픽의 세 가지 AI 연구 유형
우리 앤트로픽은 연구 프로젝트를 세 가지 영역으로 분류해요.
능력(Capabilities): 글쓰기, 이미지 처리 또는 생성, 게임 플레이 등 모든 종류의 작업에서 AI 시스템을 전반적으로 더 좋게 만드는 것을 목표로 하는 AI 연구예요. 대규모 언어 모델을 더 효율적으로 만들거나 강화 학습 알고리즘을 개선하는 연구가 이 범주에 속하죠. 능력 연구는 우리가 정렬 연구에서 조사하고 활용하는 모델을 생성하고 개선해요. 우리는 AI 능력 발전 속도를 높이고 싶지 않기 때문에 일반적으로 이런 종류의 작업을 출판하지 않아요. 또한, 최첨단 능력 시연에 대해서도 신중하려고 노력해요 (출판 없이도요). 앤트로픽은 2022년 봄에 우리 앤트로픽의 주력 모델인 클로드(Claude)의 첫 버전을 훈련했고, 이를 공공 배포보다는 안전 연구에 우선적으로 사용하는 것을 결정했어요. 이후 클로드와 공개된 최첨단 기술 간의 격차가 줄어들면서 지금은 클로드를 배포하기 시작했죠. 정렬 능력(Alignment capabilities): 이 연구는 AI 시스템을 더 유용하고, 정직하며, 해롭지 않게, 그리고 더 신뢰할 수 있고 견고하며, 전반적으로 인간의 가치와 더 잘 정렬되도록 훈련하는 새로운 알고리즘을 개발하는 데 중점을 둬요. 앤트로픽의 현재 및 과거 작업으로는 디베이트, 확장 가능한 자동 레드팀, 헌법적 AI, 편향 제거, RLHF(인간 피드백 강화학습) 등이 포함돼요. 종종 이런 기술들은 실용적으로 유용하고 경제적 가치가 있지만, 반드시 그래야 하는 건 아니에요. 예를 들어, 새로운 알고리즘이 상대적으로 비효율적이거나 AI 시스템이 더 유능해질 때만 유용해지는 경우가 있죠. 정렬 과학(Alignment science): 이 영역은 AI 시스템이 실제로 정렬되었는지, 정렬 능력 기술이 얼마나 잘 작동하는지, 그리고 이런 기술의 성공을 더 유능한 AI 시스템에 어느 정도까지 외삽(Extrapolate)할 수 있는지 평가하고 이해하는 데 중점을 둬요. 앤트로픽의 이런 작업에는 기계적 해석 가능성의 광범위한 영역뿐만 아니라, 언어 모델로 언어 모델을 평가하는 작업, 레드팀 작업, 그리고 영향 함수(아래 설명)를 사용하여 대규모 언어 모델의 일반화를 연구하는 작업이 포함돼요. 정직성에 대한 우리 앤트로픽의 일부 작업은 정렬 과학과 정렬 능력의 경계에 놓여 있어요.
어떤 의미에서 정렬 능력과 정렬 과학을 '블루팀' 대 '레드팀' 구분으로 볼 수도 있어요. 정렬 능력 연구는 새로운 알고리즘을 개발하려고 시도하는 반면, 정렬 과학은 그 한계를 이해하고 노출하려고 노력하죠.
우리가 이 분류를 유용하다고 생각하는 한 가지 이유는 AI 안전 커뮤니티가 RLHF의 개발 — 경제적 가치도 창출하는 — 이 '정말로' 안전 연구였는지에 대해 종종 논쟁하기 때문이에요. 우리 앤트로픽은 그것이 맞다고 믿어요. 실용적으로 유용한 정렬 능력 연구는 더 유능한 모델을 위해 우리가 개발하는 기술의 토대가 돼요. 예를 들어, 헌법적 AI 및 AI 생성 평가에 대한 우리 앤트로픽의 작업뿐만 아니라 자동 레드팀 및 디베이트에 대한 현재 진행 중인 작업도 RLHF에 대한 이전 작업 없이는 불가능했을 거예요. 정렬 능력 작업은 일반적으로 AI 시스템이 더 정직하고 교정 가능하도록 만들어 정렬 연구를 지원할 수 있게 해주죠. 더욱이, 반복적인 정렬 연구가 인간에게 더 가치 있는 모델을 만드는 데 유용하다는 것을 입증하는 것은 AI 개발자들이 모델을 더 안전하게 만들고 잠재적인 안전 실패를 감지하는 데 더 많이 투자하도록 장려하는 데 유용할 수도 있어요.
AI 안전이 꽤나 다루기 쉬운 것으로 판명된다면, 우리 앤트로픽의 정렬 능력 작업이 가장 영향력 있는 연구가 될 수 있어요. 반대로, 정렬 문제가 더 어렵다면, 우리는 정렬 능력 기술의 허점을 찾는 데 정렬 과학에 점점 더 의존하게 될 거예요. 그리고 정렬 문제가 실제로 거의 불가능하다면, 우리는 고급 AI 시스템 개발을 중단하기 위한 매우 강력한 사례를 구축하기 위해 정렬 과학이 절실히 필요할 거예요.
앤트로픽의 현재 안전 연구
우리 앤트로픽은 안전한 AI 시스템을 훈련하는 방법을 찾기 위해 다양한 방향으로 노력하고 있으며, 일부 프로젝트는 고유한 위협 모델과 능력 수준을 다루고 있어요. 몇 가지 주요 아이디어는 다음과 같아요.
- 기계적 해석 가능성
- 확장 가능한 감독
- 과정 중심 학습
- 일반화 이해
- 위험한 실패 모드 테스트
- 사회적 영향 및 평가
기계적 해석 가능성
여러 면에서 기술 정렬(Alignment) 문제는 AI 모델에서 원치 않는 행동을 감지하는 문제와 불가분하게 연결되어 있어요. 새로운 상황에서도 (예를 들어, 모델의 '마음을 읽음으로써') 원치 않는 행동을 견고하게 감지할 수 있다면, 우리는 이런 실패 모드를 보이지 않는 모델을 훈련하는 방법을 찾을 가능성이 더 높겠죠. 그동안 우리는 모델이 안전하지 않으므로 배포해서는 안 된다는 것을 다른 사람들에게 경고할 수 있어요.
우리 앤트로픽의 해석 가능성 연구는 다른 종류의 정렬 과학이 남긴 공백을 채우는 것을 우선해요. 예를 들어, 해석 가능성 연구가 만들어낼 수 있는 가장 가치 있는 것 중 하나는 모델이 기만적으로 정렬되었는지 ('허니팟' 테스트와 같이 불일치를 드러내도록 시스템을 의도적으로 '유혹하는' 매우 어려운 테스트에도 '협조하는' 것) 인식하는 능력이라고 생각해요. 확장 가능한 감독 및 과정 중심 학습에 대한 우리 앤트로픽의 작업이 유망한 결과를 낸다면 (아래 참조), 우리는 매우 어려운 테스트에도 정렬된 것처럼 보이는 모델을 만들 수 있을 거라고 예상하고 있어요. 이는 우리가 매우 낙관적인 시나리오에 있거나 가장 비관적인 시나리오 중 하나에 있다는 것을 의미할 수 있죠. 이런 경우를 다른 접근 방식으로는 거의 불가능하지만, 해석 가능성으로는 그저 매우 어려운 수준으로 구별할 수 있을 거예요.
이는 우리 앤트로픽을 크고 위험한 베팅으로 이끌어요. 바로 기계적 해석 가능성인데, 이는 미지의 잠재적으로 안전하지 않은 컴퓨터 프로그램을 역설계하는 것과 유사하게 신경망을 인간이 이해할 수 있는 알고리즘으로 역설계하려고 노력하는 프로젝트예요. 우리의 희망은 이것이 궁극적으로 '코드 리뷰'와 유사한 작업을 가능하게 하여, 우리 모델을 감사하여 안전하지 않은 측면을 식별하거나 강력한 안전 보장을 제공하는 것이죠.
우리는 이것이 매우 어려운 문제이지만, 겉보기만큼 불가능하지는 않다고 믿어요. 한편으로 언어 모델은 크고 복잡한 컴퓨터 프로그램이고 ('중첩'이라고 부르는 현상은 상황을 더 어렵게 만들 뿐이에요). 다른 한편으로, 이 접근 방식이 처음 생각했던 것보다 더 실현 가능성이 있다는 징후를 보고 있어요. 앤트로픽 이전에 우리 팀의 일부는 시각 모델이 해석 가능한 회로로 이해될 수 있는 구성 요소를 가지고 있다는 걸 발견했어요. 그 이후, 우리는 이 접근 방식을 작은 언어 모델로 확장하는 데 성공했으며, 심지어 인컨텍스트 학습의 상당 부분을 이끄는 메커니즘도 발견했죠. 또한 우리는 기억을 담당하는 메커니즘과 같이, 불과 1년 전보다 신경망 계산의 메커니즘에 대해 훨씬 더 많이 이해하고 있어요.
이것은 단지 우리 앤트로픽의 현재 방향일 뿐이며, 우리는 근본적으로 경험에 의해 동기 부여를 받아요. 다른 작업이 더 유망하다는 증거가 보이면 방향을 바꿀 거예요! 더 일반적으로, 우리는 신경망과 학습의 상세한 작동 방식을 더 잘 이해하는 것이 우리가 안전을 추구할 수 있는 더 넓은 범위의 도구를 열어줄 거라고 믿어요.
확장 가능한 감독
언어 모델을 정렬된 AI 시스템으로 전환하려면 행동을 유도하기 위한 상당한 양의 고품질 피드백이 필요해요. 주요 우려 사항은 사람들이 필요한 피드백을 제공할 수 없을 수도 있다는 점이에요. 사람들이 다양한 상황에서 유해한 행동을 피하도록 모델을 적절히 훈련하기에 충분히 정확하거나 정보에 입각한 피드백을 제공할 수 없을 수도 있어요. 사람들이 AI 시스템에 속아서 실제로 원하는 것을 반영하는 피드백을 제공할 수 없을 수도 있고요 (예: 오해의 소지가 있는 조언에 실수로 긍정적인 피드백을 제공하는 경우). 문제가 복합적일 수도 있는데, 사람들이 충분히 노력하면 올바른 피드백을 제공할 수 있지만, 대규모로 그렇게 할 수는 없는 경우도 있겠죠. 이것이 바로 확장 가능한 감독(Scalable oversight) 문제이며, 안전하고 정렬된 AI 시스템을 훈련하는 데 핵심적인 문제가 될 가능성이 높아요.
궁극적으로 우리는 필요한 감독을 제공하는 유일한 방법은 AI 시스템이 부분적으로 스스로를 감독하거나 인간이 자신의 감독을 돕도록 하는 것이라고 믿어요. 어떤 식으로든, 우리는 소량의 고품질 인간 감독을 대량의 고품질 AI 감독으로 확대해야 해요. 이 아이디어는 이미 RLHF 및 헌법적 AI와 같은 기술을 통해 가능성을 보이고 있지만, 우리는 인간 수준 시스템에서 이런 기술을 신뢰할 수 있게 만들기 위해 훨씬 더 많은 여지가 있다고 생각해요.
우리 앤트로픽은 이런 접근 방식이 유망하다고 생각하는데, 언어 모델은 사전 훈련(Pretraining) 중에 이미 인간의 가치에 대해 많은 것을 배우기 때문이에요. 인간의 가치에 대해 배우는 것은 다른 과목을 배우는 것과 다르지 않으며, 더 큰 모델은 인간의 가치에 대해 더 정확한 그림을 가지고 있고 더 작은 모델에 비해 그것을 배우기 더 쉽다고 예상해야 해요. 확장 가능한 감독의 주요 목표는 모델이 인간의 가치를 더 잘 이해하고 그에 따라 행동하도록 하는 거예요.
확장 가능한 감독, 특히 CAI와 같은 기술의 또 다른 핵심 특징은 레드팀(일명 적대적 훈련)을 자동화할 수 있다는 거예요. 즉, AI 시스템에 잠재적으로 문제가 있는 입력을 자동으로 생성하고, AI가 어떻게 반응하는지 확인한 다음, AI가 더 정직하고 해롭지 않은 방식으로 행동하도록 자동으로 훈련할 수 있어요. 확장 가능한 감독을 사용하여 더 견고하게 안전한 시스템을 훈련할 수 있기를 바라고 있어요. 우리는 이런 질문들을 적극적으로 연구하고 있어요.
우리 앤트로픽은 CAI의 확장, 인간 지원 감독의 변형, AI-AI 디베이트 버전, 다중 에이전트 RL을 통한 레드팀, 모델 생성 평가를 포함하여 확장 가능한 감독을 위한 다양한 방법을 연구하고 있어요. 우리는 확장 가능한 감독이 인간 수준 이상의 능력을 가지면서도 안전하게 유지될 수 있는 시스템을 훈련하기 위한 가장 유망한 접근 방식일 수 있다고 생각하지만, 그런 접근 방식이 성공할 수 있는지 조사하기 위해 할 일이 많아요.
결과 달성보다는 과정 학습
새로운 작업을 학습하는 한 가지 방법은 시행착오를 거치는 거예요. 원하는 최종 결과가 어떤 모습인지 안다면, 성공할 때까지 새로운 전략을 계속 시도하면 되죠. 우리는 이를 '결과 중심 학습'이라고 불러요. 결과 중심 학습에서는 에이전트의 전략이 원하는 결과에 의해 전적으로 결정되며, 에이전트는 (이상적으로) 이를 달성하는 데 드는 비용이 적은 전략으로 수렴할 거예요.
종종, 학습하는 더 좋은 방법은 전문가가 성공하기 위해 따르는 과정에 대해 코치해주는 거예요. 연습 라운드 동안, 당신의 성공은 그리 중요하지 않을 수도 있어요. 대신 방법을 개선하는 데 집중할 수 있다면 말이죠. 개선됨에 따라, 당신에게 더 잘 맞을 수 있는 새로운 전략이 있는지 코치와 상의하며 더 협력적인 과정으로 전환할 수도 있어요. 우리는 이를 '과정 중심 학습'이라고 불러요. 과정 중심 학습에서 목표는 최종 결과를 달성하는 것이 아니라, 그 결과를 달성하는 데 사용될 수 있는 개별 과정을 숙달하는 거예요.
적어도 개념적인 수준에서, 고급 AI 시스템의 안전에 대한 많은 우려는 이런 시스템을 과정 중심 방식으로 훈련함으로써 해결돼요. 특히, 이 패러다임에서는:
- 인간 전문가들은 AI 시스템이 따르는 개별 단계를 계속 이해할 수 있을 거예요. 이런 과정들이 장려되려면 인간에게 정당화되어야 하기 때문이죠.
- AI 시스템은 불분명하거나 유해한 방식으로 성공을 달성하는 것에 대해 보상받지 않을 거예요. 왜냐하면 그들의 과정의 효율성과 이해 가능성을 기반으로만 보상받을 것이기 때문이죠.
- AI 시스템은 자원 획득이나 속임수와 같은 문제가 있는 하위 목표를 추구하는 것에 대해 보상받지 않을 거예요. 인간 또는 그 대리인(프록시)이 훈련 과정 중에 개별적인 탐욕스러운 과정에 대해 부정적인 피드백을 제공할 것이기 때문이에요.
우리 앤트로픽은 단순한 해결책을 강력히 지지하며, AI 훈련을 과정 중심 학습으로 제한하는 것이 고급 AI 시스템의 여러 문제들을 완화하는 가장 간단한 방법일 수 있다고 생각해요. 우리는 또한 과정 중심 학습의 한계를 식별하고 해결하며, 과정 중심 학습과 결과 중심 학습을 혼합하여 훈련할 때 안전 문제가 언제 발생하는지 이해하는 데 관심을 가지고 있어요. 현재 우리는 과정 중심 학습이 인간 수준의 능력까지 그리고 어느 정도 그 이상까지 안전하고 투명한 시스템을 훈련하는 가장 유망한 경로일 수 있다고 믿고 있어요.
일반화 이해
기계적 해석 가능성 연구는 신경망이 수행하는 계산을 역설계해요. 우리는 또한 대규모 언어 모델(LLM) 훈련 절차에 대한 더 상세한 이해를 얻으려고 노력하고 있어요.
LLM은 창의성부터 자기 보존, 속임수에 이르기까지 다양한 놀라운 창발적 행동을 보여주었어요. 이 모든 행동은 분명히 훈련 데이터에서 비롯되지만, 그 경로는 복잡해요. 모델은 먼저 방대한 양의 원시 텍스트로 '사전 훈련'되어 광범위한 표현과 다양한 에이전트를 시뮬레이션하는 능력을 학습하죠. 그런 다음 수많은 방식으로 파인튜닝되는데, 그중 일부는 예상치 못한 결과를 초래할 수 있어요. 파인튜닝 단계는 매개변수가 과도하게 많기 때문에, 학습된 모델은 사전 훈련의 암묵적인 편향에 결정적으로 의존해요. 이런 암묵적인 편향은 세계 지식의 상당 부분을 사전 훈련에서 구축된 복잡한 표현 네트워크에서 발생하죠.
모델이 기만적으로 정렬된 AI 역할을 하는 것과 같은 우려스러운 행동을 보일 때, 그것은 단지 거의 동일한 훈련 시퀀스의 무해한 반복일까요? 아니면 이런 행동 (또는 그것으로 이어지는 신념과 가치)이 AI 어시스턴트에 대한 모델의 개념의 필수적인 부분이 되어 다양한 상황에서 일관되게 적용되는 걸까요? 우리는 모델의 출력을 훈련 데이터로 추적하는 기술을 연구하고 있어요. 이는 모델을 이해하는 데 중요한 단서를 제공할 것이기 때문이죠.
위험한 실패 모드 테스트
하나의 주요 우려 사항은 고급 AI가 속임수나 전략적 계획 능력과 같이 더 작고 덜 유능한 시스템에는 없었던 유해한 창발적 행동을 개발할 가능성이에요. 우리는 이런 종류의 문제가 직접적인 위협이 되기 전에 예측하는 방법은, 위험할 만큼 유능하지 않은 소규모 모델에 이런 특성을 의도적으로 훈련시키는 환경을 설정하여, 이를 분리하고 연구하는 것이라고 생각해요.
우리 앤트로픽은 AI 시스템이 '상황을 인지'할 때 — 예를 들어, 훈련 환경에서 인간과 대화하는 AI라는 것을 인지할 때 — 어떻게 행동하는지, 그리고 이것이 훈련 중 행동에 어떤 영향을 미치는지에 특히 관심을 가지고 있어요. AI 시스템이 기만적이 되거나, 놀랍고 바람직하지 않은 목표를 개발할까요? 최상의 경우, 우리는 이런 경향이 규모에 따라 어떻게 달라지는지에 대한 상세한 정량적 모델을 구축하여, 위험한 실패 모드의 갑작스러운 출현을 미리 예측하는 것을 목표로 해요.
동시에, 연구 자체와 관련된 위험을 주시하는 것도 중요해요. 연구가 큰 해를 끼칠 수 없을 만큼 작은 모델로 수행된다면 심각한 위험을 수반할 가능성은 낮지만, 이런 종류의 연구는 우리가 위험하다고 간주하는 바로 그 능력을 유도하는 것을 포함하며, 더 큰 능력을 가진 더 큰 모델에서 수행될 경우 명백한 위험을 수반하죠. 우리 앤트로픽은 심각한 해를 끼칠 수 있는 모델에 대해 이 연구를 수행할 계획은 없어요.
사회적 영향 및 평가
우리 앤트로픽의 작업이 사회에 미칠 수 있는 잠재적 영향을 비판적으로 평가하는 것은 우리 연구의 핵심 기둥이에요. 우리 앤트로픽의 접근 방식은 AI 시스템의 능력, 한계, 그리고 사회적 영향 가능성을 평가하고 이해하기 위한 도구와 측정 기준을 구축하는 데 중점을 둬요. 예를 들어, 우리는 대규모 언어 모델의 예측 가능성과 예측 불가능성을 분석한 연구를 발표했는데, 이 연구는 이런 모델의 고수준 예측 가능성과 예측 불가능성이 어떻게 유해한 행동으로 이어질 수 있는지 연구해요. 그 작업에서 우리는 놀라운 능력이 문제가 있는 방식으로 어떻게 사용될 수 있는지 강조하고 있어요. 우리는 또한 다양한 모델 크기에서 공격적인 출력을 찾고 줄이기 위해 모델을 조사하는 언어 모델 레드팀 방법도 연구했어요. 가장 최근에는 현재의 언어 모델이 편향과 고정관념을 줄이라는 지시를 따를 수 있다는 것을 발견했죠.
우리 앤트로픽은 점점 더 강력해지는 AI 시스템의 급속한 배포가 단기, 중기, 장기적으로 사회에 어떤 영향을 미칠지 매우 우려하고 있어요. 우리는 AI 시스템의 잠재적으로 유해한 행동을 평가하고 완화하며, AI가 어떻게 사용될 수 있는지 예측하고, 경제적 영향을 연구하기 위한 다양한 프로젝트를 진행하고 있어요. 이 연구는 책임감 있는 AI 정책 및 거버넌스 개발에 대한 우리 앤트로픽의 작업에도 정보를 제공하죠. 오늘날 AI의 함의에 대한 엄격한 연구를 수행함으로써, 우리는 정책 입안자와 연구자들에게 이런 잠재적으로 중대한 사회적 피해를 완화하고 AI의 이점이 사회 전반에 걸쳐 광범위하고 균등하게 분배되도록 하는 데 필요한 통찰력과 도구를 제공하는 것을 목표로 하고 있어요.
마무리하며
우리 앤트로픽은 인공지능이 앞으로 10년 안에 전례 없는 영향을 세상에 미칠 수 있다고 믿어요. 컴퓨팅 파워의 기하급수적인 성장과 AI 능력의 예측 가능한 발전은 새로운 시스템이 오늘날의 기술보다 훨씬 더 발전할 것임을 시사하죠. 하지만 이런 강력한 시스템이 인간의 가치와 견고하게 정렬되어 치명적인 실패의 위험을 최소화할 수 있도록 보장하는 방법에 대해서는 아직 확실히 이해하지 못하고 있어요.
오늘날 사용 가능한 시스템이 임박한 우려를 제기한다고 생각하지 않는다는 점을 분명히 하고 싶어요. 하지만 훨씬 더 강력한 시스템이 개발될 경우 고급 AI로 인한 위험을 줄이는 데 도움이 되도록 지금 기초 작업을 수행하는 것이 현명하다고 생각해요. 안전한 AI 시스템을 만드는 것이 쉬운 것으로 판명될 수도 있지만, 우리는 덜 낙관적인 시나리오에 대비하는 것이 중요하다고 믿어요.
앤트로픽은 AI 안전에 대한 경험 중심적인 접근 방식을 취하고 있어요. 현재 활발히 진행 중인 주요 작업 영역으로는 AI 시스템이 어떻게 학습하고 현실 세계에 일반화하는지에 대한 이해를 높이는 것, AI 시스템에 대한 확장 가능한 감독 및 검토 기술을 개발하는 것, 투명하고 해석 가능한 AI 시스템을 만드는 것, 결과 추구 대신 안전한 과정을 따르도록 AI 시스템을 훈련하는 것, AI의 잠재적 위험한 실패 모드를 분석하고 이를 방지하는 방법, 그리고 정책 및 연구를 안내하기 위한 AI의 사회적 영향을 평가하는 것이 포함돼요. AI 안전 문제를 여러 각도에서 공략함으로써, 우리는 다양한 시나리오에서 성공하는 데 도움이 될 수 있는 '안전 작업 포트폴리오'를 개발하기를 바라요. 우리는 우리가 처한 시나리오에 대한 더 많은 정보가 제공됨에 따라 우리 앤트로픽의 접근 방식과 자원 배분이 빠르게 조정될 거라고 예상하고 있어요.
각주
- 알고리즘 발전 — AI 시스템 훈련을 위한 새로운 방법의 발명 — 은 측정하기 더 어렵지만, 발전 속도는 기하급수적이며 무어의 법칙보다 빠르다고 보여요. AI 능력의 발전을 외삽(extrapolate)할 때, 전체 성장률을 추정하려면 지출, 하드웨어 성능, 알고리즘 발전의 기하급수적 성장을 곱해야 해요.
- 스케일링 법칙은 비용 지출에 대한 정당성을 제공했지만, 이 작업을 수행하는 또 다른 근본적인 동기는 읽고 쓸 수 있는 AI로 전환하여 인간의 가치와 상호작용할 수 있는 AI를 훈련하고 실험하기 쉽게 만드는 것이었어요.
- 훈련에 사용되는 총 연산량 증가에서 AI 능력의 발전을 외삽(extrapolate)하는 것은 정확한 과학이 아니며 어느 정도 판단이 필요해요. 우리는 GPT-2에서 GPT-3로의 능력 향상이 주로 약 250배 증가한 연산량에서 비롯되었다는 것을 알고 있어요. 우리는 원래 GPT-3 모델과 2023년의 최첨단 모델 사이에는 50배의 추가 증가가 있을 거라고 추측해요. 향후 5년 동안 컴퓨팅 비용 및 지출 추세를 기반으로 가장 큰 모델을 훈련하는 데 사용되는 연산량이 약 1000배 증가할 것으로 예상할 수 있어요. 스케일링 법칙이 유지된다면, 이는 GPT-2에서 GPT-3 (또는 GPT-3에서 클로드)로의 도약보다 훨씬 더 큰 능력 향상으로 이어질 거예요. 앤트로픽에서는 이런 시스템의 능력에 대해 깊이 잘 알고 있으며, 이 정도로 훨씬 더 큰 도약은 우리 중 많은 사람들에게 대부분의 작업에서 인간 수준의 성능으로 이어질 수 있다고 느껴져요. 이는 직관 — 비록 정보에 기반한 직관이지만 — 을 사용해야 하며, 따라서 AI 능력의 발전을 추정하는 완벽한 방법은 아니에요. 하지만 (i) 이 두 시스템 간의 연산량 차이, (ii) 이 두 시스템 간의 성능 차이, (iii) 미래 시스템으로 투사할 수 있는 스케일링 법칙, 그리고 (iv) 컴퓨팅 비용 및 지출 추세를 포함한 근본적인 사실들은 누구에게나 이용 가능하며, 우리는 이들이 함께 다음 10년 안에 광범위한 인간 수준의 AI 시스템을 개발할 가능성이 10%를 넘는다는 것을 지지한다고 믿어요. 이 대략적인 분석에서는 알고리즘 발전을 무시하고, 연산량 수치는 우리가 세부 정보를 제공하지 않는 최상의 추정치예요. 하지만 여기서 내부적인 의견 불일치의 대부분은 동등한 연산량 증가에 따른 후속 능력 향상을 외삽하는 직관에 있어요.
- 예를 들어, AI 연구에서 오랫동안 이론적인 근거로 국소 최적점(Local minima)이 신경망 학습을 방해할 수 있다고 널리 가정했지만, 적대적 예제의 광범위한 존재와 같은 일반화 속성의 많은 질적 측면은 다소 미스터리하고 놀라운 것으로 다가왔어요.
- 대규모 모델에 대한 효과적인 안전 연구는 단순히 명목상의 (예: API) 시스템 접근을 요구하는 것이 아니에요. 해석 가능성, 파인튜닝, 강화 학습에 대한 작업을 수행하려면 앤트로픽 내부에서 AI 시스템을 개발해야 해요.