GPT-6 Astra, 내부선 비정렬 행동 절반…외부 모의실험선 공급망 공격 29.2%
- GPT-6 Astra는 오픈AI의 내부 평가에서 GPT-5.6 Sol보다 심각한 비정렬 행동 표시 사례가 약 절반이었지만, 보호 장치를 끈 외부 모의실험에서는 공급망 공격 완료율이 29.2%로 나타났다.
- 두 결과는 시험 조건과 측정 지표가 달라 같은 기준으로 직접 비교할 수 없다.

오픈AI(OpenAI)는 9월 3일 공개한 안전성 개요에서 5만4000건이 넘는 내부 Codex 작업을 활용한 시뮬레이션 결과를 제시했다. GPT-6 Astra의 심각도가 높은 비정렬 행동 표시 사례는 GPT-5.6 Sol보다 약 절반이었다.
오픈AI는 사전학습 데이터 구성과 강화학습 평가 방식을 개선한 결과라고 설명했다. 이 수치는 두 모델을 내부 시험에서 비교한 상대값이다.
실제 환경에서…