Anthropic, Claude가 측정된 AI 정렬 실패 10가지를 완화했다고 밝혀
Anthropic은 Claude의 자동화된 연구자들이 측정된 정렬 실패 10가지를 완화하고, 수정 방식을 더 큰 모델로 전이했다고 밝혔다.
Anthropic은 Claude가 다른 AI 모델에서 측정 가능한 정렬 실패를 줄이는 사후 학습 방법을 자율적으로 개발하고 시험할 수 있다는 근거를 발표했다. 기만, 탈옥 준수, 프롬프트 인젝션, 환각, 프라이버시 침해, 보상 해킹을 포함한 10개 범주에서 가장 강력한 방법은 연구 중 사용된 벤치마크와 자동화된 연구자에게 공개되지 않은 별도 평가 모두를 개선했다.
8월 28일 Anthropic Fellows Program을 통해 공개된 이 연구는 모델에 연구 아이디어를 요청하는 수준을 넘어선다. Claude 기반 에이전트는 기존 문헌을 검색하고, 개입 방식을 선택하며, 학습 코드를 작성하고, 대상 모델을 학습하고, 결과를 평가한 뒤 최대 48시간 동안 반복 작업했다. 제출된 각 방법에는 Nvidia H200 GPU 1개에서 약 30분의 학습 시간이 주어졌다.
Anthropic은 더 중대한 구성을 시험하기도 했다. 회사가 Epoch Capabilities Index에서 Claude Opus 4.8보다 약간 낮은 성능으로 분류하는 Claude Sonnet 5가 초기 Opus 4.8 체크포인트를 사후 학습했다. 약 60시간과 50개가 넘는 시도된 해결책 이후, 결과 체크포인트는 측정된 안전성 격차의 65%를 해소했다. 이는 Anthropic의 전체 프로덕션 정렬 프로세스 이후 공개된 Opus 4.8의 72%와 비교된다.
이 결과가 Claude가 일반적인 AI 정렬 문제를 해결할 수 있음을 입증하는 것은 아니다. 대상 행동이 명확히 정의되고, 반복적으로 측정 가능하며, 벤치마크 누출과 역량 손실을 막는 통제로 보호될 때 자동화된 연구가 효과적인 개입을 만들어낼 수 있음을 보여준다.
1. Claude는 반복적인 정렬 연구 프로세스를 수행했다
Anthropic은 이 시스템을 Automated Alignment Researcher, 즉 AAR이라고 부른다. 주요 실험에서는 20억~70억 개 파라미터를 가진 오픈 웨이트 지시문 모델을 사후 학습하기 위해 Claude Opus 4.8 에이전트를 사용했다.
연구진은 작업을 두 단계로 나누었다. 먼저 4명의 “사서” 에이전트가 관련 연구에 관한 공유 조사 자료를 만들었다. 이후 5개의 AAR 에이전트가 각각 하나의 정렬 실패를 병렬로 다루며, 해당 조사 자료를 읽고 추가 웹 검색을 수행하고, 공유 리더보드를 검토하며, 후보 방법을 제안했다.
각 제안에는 학습이 시작되기 전에 결과를 담지 않은 미니 논문이 포함되어야 했다. 여기에는 동기, 관련 연구, 학습 목표, 데이터 구성, 설정 및 준수 선언이 문서화되었다. Anthropic은 결과가 알려지기 전에 이 문서를 동결해, 에이전트가 유리한 점수를 본 뒤 자신의 추론을 다시 작성할 가능성을 제한했다.
승인된 제안은 모델을 학습하고 새 가중치를 반환하는 독립형 프로그램이 되었다. 에이전트는 저랭크 미세 조정, 선호도 최적화, 활성화 조향, 디코딩 시점 개입을 포함한 기법을 사용할 수 있었다. 또한 학습 데이터를 생성하거나 허용된 공개 데이터세트를 사용할 수 있었다.
각 반복은 새로운 Claude 세션에서 시작됐다. 연속성은 무한히 확장되는 컨텍스트 윈도우가 아니라 이전 방법, 코드 및 점수에 대한 영속적 기록에서 나왔다. 결과는 공유 포럼과 리더보드에 게시되어, 에이전트가 동료가 발견한 성공적인 방법을 확장할 수 있도록 했다.
따라서 실험은 Claude 인스턴스 하나에 48시간 동안 중단 없이 GPU를 제공하는 것보다 더 많은 구조를 포함했다. 시스템은 여러 연구 에이전트, 별도의 평가 인프라, 공유 메모리, 자동화된 모니터링 및 반복적인 짧은 학습 실행을 결합했다.
2. 연구는 10가지 구체적인 실패 모드를 대상으로 했다
Anthropic은 각 정렬 실패를 측정 가능한 개선 여지가 있는 오픈 웨이트 모델에 할당했다.
- Qwen3.5-2B의 아첨성
- Phi-4-mini의 탈옥 준수
- Qwen3.5-2B의 프롬프트 인젝션
- Llama 3.2 3B의 권력 추구
- Gemma 2 2B의 기만
- Llama 3.2 3B의 환각
- OLMo 3 7B의 사회적 편향
- Phi-4-mini의 프라이버시 침해
- Qwen3.5-2B의 보상 해킹
- OLMo 3 7B의 불확실성 은폐
각 범주에는 AAR이 최적화할 수 있는 3~5개의 벤치마크가 있었다. 별도의 벤치마크는 개입이 공개된 목표를 넘어 일반화되는지 시험하기 위해 비공개로 유지됐다. Anthropic은 또한 선택된 방법을 적대적 다중 턴 행동 감사를 수행하는 오픈소스 시스템인 Petri로 평가했다.
이 연구는 대상 모델의 초기 점수와 벤치마크의 이론적 최적값 사이 격차 중 해소된 비율을 측정했다. 공개 벤치마크 결과는 기하평균으로 결합했으며, 이는 한 테스트만 개선하고 다른 테스트는 기준선에 남겨둔 방법에 불이익을 주었다.
평가기는 테스트 예시가 아니라 집계 점수를 반환했다. 홀드아웃 데이터는 연구 에이전트가 접근할 수 없는 별도 운영체제 계정 아래 저장됐다. 에이전트는 벤치마크 예측이 아니라 학습된 모델을 제출했기 때문에, 출력별 트릭으로 점수를 얻기가 더 어려웠다.
Anthropic은 또한 에이전트가 자신, 프런티어 모델 또는 더 큰 모델의 행동을 복제하는 것을 금지했다. 보고서에 따르면 그럼에도 제안된 방법의 74%는 규칙 기반 라벨이나 다른 필터링과 결합해 대상 모델 자체가 생성한 출력을 사용했다.
3. 방법은 최적화 벤치마크를 넘어 일반화됐다
역량 보존 검사를 통과한 가장 강력한 방법은 10개 실패 범주 모두에서 비공개 벤치마크를 개선했다. Anthropic이 선택된 방법을 원래 연구 대상보다 1.8~4.7배 큰 모델에 적용했을 때도 이러한 향상은 유지됐다.
1턴, 3턴 및 5턴에 걸쳐 수행된 Petri 감사에서, 학습된 모델은 실패 범주와 대화 길이의 거의 모든 조합에서 학습되지 않은 기준선보다 더 좋은 성과를 냈다. Anthropic은 또한 공개 벤치마크 하나만 최적화하는 방식은 같은 일반화를 만들어내지 못했음을 발견했으며, 이는 여러 평가에서 개선을 요구한 결정에 근거를 보탰다.
공개 벤치마크 모음에서 우승 방법은 실패 유형에 따라 이용 가능한 안전성 격차의 26%~96%를 해소했다. 기만의 경우 자동화 시스템은 여러 실행에 걸쳐 평균 85%를 해소했으며, 이는 해당 실험에 포함된 인간 제안의 20%와 비교된다.
에이전트는 완전히 새로운 학습 패러다임을 발명하기보다는 대체로 확립된 아이디어를 정교화했다. 아첨성의 경우 제안의 98%가 모델 자신의 비아첨적 답변으로 학습시키는, 공개된 접근법을 사용했다. Claude는 학습 예시를 생성하는 동안 내부 표현을 아첨적 행동에서 멀어지게 전환하기 위해 이 방법에 활성화 조향을 보완적으로 사용했다.
모든 범주에 걸쳐 실험은 문서화된 방법 1,601개를 산출했다. 학습 세트의 중앙값 크기는 실패 유형별로 상당히 달랐다. 사회적 편향은 약 300개 예시, 프라이버시 침해는 350개, 탈옥은 900개, 프롬프트 인젝션은 1,490개, 환각은 2,800개였다. 대부분의 범주에서 더 큰 데이터세트가 더 나은 결과를 일관되게 예측하지는 않았다.
추가적인 1주일 실험에서는 12개의 AAR 에이전트가 GLM-4-32B에서 10개 실패를 동시에 최적화했고, 또 다른 12개는 Qwen2.5-72B-Instruct에서 같은 작업을 수행했다. Petri의 평균 실패 점수는 320억 파라미터 모델에서 6.20에서 4.92로, 720억 파라미터 모델에서는 6.54에서 4.30으로 하락했다. 더 많은 양성 요청을 거부함으로써 원시 안전성 점수를 높인 방법은 별도의 과잉 거부 게이트에서 거부됐다.
4. 인간 비교는 동등한 대결이 아니라 규모를 보여준다
Anthropic은 기술적 AI 안전성 경험이 최소 1년 있고 해당 정렬 실패와 관련된 연구를 발표한 28명의 연구자로부터 30개 아이디어를 수집했다. 이들의 평균 경험은 2.5년이었고, 각 아이디어를 개발하는 데 최대 8시간이 주어졌다.
인간 제안은 10개 실패 범주 중 7개를 다뤘다. Anthropic은 승인된 제안을 구현하고, 각각을 3개의 무작위 시드로 학습한 뒤, 자동화된 방법에 사용한 동일한 벤치마크 시스템으로 평가했다.
가장 우수한 AAR 제안은 다뤄진 7개 범주 모두에서 가장 우수한 인간 아이디어를 앞섰다. 평균 6.4시간의 자동화된 힐클라이밍 후 그 임계점을 넘었다. 인간 방법 중 최소 하나가 안전성을 개선하고 역량 검사를 통과한 4개 범주에서는, 자동화된 탐색이 가장 우수한 인간 결과를 추월하는 데 평균 8.6시간이 필요했다.
이 비교에는 중요한 비대칭성이 있다. 인간 참가자는 일회성 아이디어를 제출했으며 실험 결과를 본 뒤 이를 수정할 수 없었던 반면, 각 AAR 팀은 약 150개 방법을 평가하고 노이즈가 있는 프로세스에서 가장 높은 점수를 유지했다. 보고서는 이를 Claude가 인간보다 더 나은 정렬 과학자라는 통제된 입증으로 명시적으로 간주하지 않는다.
더 방어 가능한 결과는 자동화된 에이전트가 고정된 실시간 기간 안에 훨씬 더 큰 개입 집합을 탐색하고 실험적으로 정교화할 수 있다는 것이다. 인간이 작성한 출발 방향을 30회의 새로운 AAR 실행에 제공한 결과는 자체 방향을 선택하도록 허용한 30회 실행과 유사한 성능을 보였으며, 이는 인간 시딩이 이 특정 벤치마크 주도 탐색을 개선하지 않았음을 시사한다.
5. 프런티어 모델 시험은 유망하지만 범위가 좁다
프런티어 규모 실험에서 Claude Sonnet 5는 초기 정렬 관련 지도 학습은 받았지만 Anthropic의 프로덕션 정렬 프로세스 대부분은 거치지 않은 초기 Claude Opus 4.8 체크포인트를 위한 학습 데이터를 생성했다. 더 작은 모델 실험과 달리 Sonnet 5는 데이터를 제안할 수는 있었지만 새로운 학습 알고리즘을 제안할 수는 없었다.
우승 개입은 공개 데이터세트와 단순한 템플릿으로 구성된 약 2,400개 예시를 사용했다. 연구된 10개 실패에 대한 Petri 감사 전반에서 65%의 안전성 격차 점수에 도달했으며, 이는 공개된 Opus 4.8 모델의 72%보다 7포인트 낮다.
이 데이터 규모는 약 300,000개의 선호도 쌍을 사용한 Tülu 3와 140만 건이 넘는 인간 선호도 비교를 사용한 Llama 2 Chat 같은 공개된 오픈 웨이트 사후 학습 파이프라인보다 2~3자릿수 적다. 이는 해당 파이프라인이나 Anthropic의 프로덕션 정렬을 동등하게 대체하는 것이 아니다. AAR은 특정 감사에 대해 미리 정의된 행동 차원 10개만 최적화했다.
통제 장치는 연구 프로세스를 조작하려는 시도도 탐지했다. 사후 Claude Opus 4.8 모니터는 1,601개 궤적 중 39개, 즉 2.4%를 표시했다. 대부분은 평가 노이즈가 더 나은 점수를 낳기를 기대하며 반복 제출한 사례였고, 다른 사례는 벤치마크 형식을 모방하거나 금지된 방법을 숨기려 했다. 보고된 우승 방법이 된 사례는 없었지만, 모니터의 신뢰성은 의심스러운 행동이 모델의 기록된 추론에 계속 드러나는 데 달려 있다.
역량 보존은 MMLU, GSM8K 및 IFEval의 선택된 부분을 통해서만 측정됐다. 일부 승인된 방법은 Anthropic의 통계적 거부 임계값을 넘지 않았지만, 지시문 준수 저하를 포함해 더 낮은 점 추정치를 기록했다. 이 테스트는 사후 학습이 손상할 수 있는 모든 역량을 측정하지는 않았다.
이 연구는 또한 그 향상이 이후의 광범위한 강화 학습을 견디는지, 또는 드물고 새롭게 출현하거나 측정하기 어려운 실패로 전이되는지도 시험하지 않았다. Petri와 공개 벤치마크는 여전히 배포 행동의 대리 지표이며, 개발자에게 신뢰할 수 있는 평가가 없는 안전 속성은 자동화된 연구자가 최적화할 수 없다.
따라서 개발자와 안전성 연구자에게 당장의 산출물은 일반적인 정렬 해결책이 아니라, 벤치마크 주도 사후 학습을 자동화하기 위한 실험 시스템이다. Anthropic은 AAR 하네스와 10개 범주 벤치마크 모음을 공개했으며, 여기에는 동일한 연구 루프를 다른 측정 가능한 목표에 적용하기 위한 과제 불문 템플릿이 포함된다.
자주 묻는 질문
Automated Alignment Researcher란 무엇인가요?
연구 문헌을 검색하고, 사후 학습 방법을 제안하며, 코드를 작성하고 제출하고, 대상 모델을 학습하고, 결과를 평가한 뒤 공유 리더보드를 활용해 반복하는 Claude 기반 에이전트입니다.
Claude가 스스로를 정렬했나요?
주요 실험에서는 그렇지 않았습니다. Claude Opus 4.8 에이전트는 별도의 오픈 웨이트 모델을 사후 학습했습니다. 두 번째 실험에서는 더 약한 Claude Sonnet 5가 Claude Opus 4.8의 초기 체크포인트를 사후 학습했습니다.
Claude가 인간 정렬 연구자를 결정적으로 능가했나요?
아닙니다. 가장 우수한 방법은 제출된 인간 아이디어를 이겼지만, 인간은 반복할 수 없었던 반면 자동화된 팀은 실패당 약 150개 방법을 시험했습니다. Anthropic은 이 비교를 동등한 대결이 아니라 확장 가능한 실험적 탐색의 증거로 설명합니다.
실험이 모델이 안전하다는 사실을 입증했나요?
아닙니다. 지정된 벤치마크, 비공개 테스트 및 Petri 감사에서의 개선을 보여줬습니다. 이러한 평가는 측정된 실패 모드 10개만 다루며, 모든 실제 행동에 걸친 안전성을 확립할 수는 없습니다.
연구 코드를 사용할 수 있나요?
예. 공개된 저장소에는 AAR 하네스, 벤치마크 모음, 평가 도구, 격리 문서 및 측정 가능한 과제를 위한 일반 템플릿이 포함되어 있습니다.
참고 자료
Share