Direkte justering under trening. Anthropic har for nylige Claude-modeller tatt i bruk sanntids justeringsevalueringer under trening. Dette gjør det mulig å oppdage og korrigere uønskede strategier som agenten kan utvikle når den jobber mot langsiktige mål .
Mer enn bare menneskelig tilbakemelding. Etter treningen brukes en kombinasjon av «Claudes grunnlov», menneskelig tilbakemelding, AI-tilbakemelding og sikkerhetsklassifiserere . Målet er å lære modellen prinsipper for hvorfor en handling er riktig, ikke bare å pugge forbud.
Følelsen av at Fable 5 er «i en annen dimensjon» kommer sannsynligvis av en kombinasjon av: ① et kraftigere basissystem, ② trening spesifikt for langvarige agentoppgaver, ③ stor kontekst, ④ avansert verktøybruk og selvvalidering, og ⑤ forbedrede ettertreningsmetoder. Hvorvidt modellen bruker MoE-arkitektur, antall parametere, dataoppsett eller forsterkningslæringsalgoritmer, er ikke offentlig kjent og forblir spekulasjon.