학습 중 행동을 직접 점검했습니다. 최근 Claude 계열은 훈련 도중 실시간 정렬 평가를 시행하고, 에이전트가 장기 목표를 수행할 때 나타나는 잘못된 전략까지 발견·교정하는 방식을 사용했습니다.
사후학습도 단순한 인간 선호학습만은 아닙니다. 공개된 범위에서는 Claude의 헌법, 인간 피드백, AI 피드백과 안전 분류기를 함께 사용합니다. 특히 “하지 마라”만 외우게 하기보다 왜 특정 행동이 바람직한지 원칙을 학습시키는 방향입니다.
체감상 “차원이 다른” 핵심은 아마 모델 크기 하나가 아니라 ① 더 강한 기반 모델, ② 장기 에이전트용 훈련, ③ 큰 컨텍스트, ④ 도구 사용 및 자기검증, ⑤ 개선된 사후학습이 동시에 적용됐기 때문일 가능성이 큽니다. 반면 MoE 여부, 파라미터 수, 데이터 구성, 강화학습 알고리즘 같은 핵심 기술 세부사항은 공개되지 않아 그 이상은 추정입니다.