Adfærd tjekket under træning. De seneste Claude-modeller er blevet evalueret for 'agentisk fejljustering' (f.eks. manipulation) i realtid under træningen, og eventuelle problemer blev rettet med det samme.
Ny form for eftertræning. I stedet for kun at bruge simpel menneskelig feedback, anvender Anthropic en kombination af Clauses forfatning, menneskelig feedback, AI-feedback og sikkerhedsklassifikatorer. Målet er at lære modellen hvorfor bestemt adfærd er ønskværdig, ikke bare at den skal undgå bestemte emner.
Følelsen af 'en helt anden liga' skyldes formentlig en kombination af fem faktorer: ① en stærkere grundmodel (Mythos-niveau), ② træning til langtidsholdbare agent-opgaver, ③ en stor kontekst, ④ evnen til at bruge værktøjer og selvvalidere, og ⑤ forbedrede eftertræningsmetoder. Om modellen bruger MoE-arkitektur, antallet af parametre eller den præcise forstærkningslæringsalgoritme, har Anthropic ikke oplyst.