בדיקת התנהגות במהלך האימון. סדרת Claude האחרונה כללה הערכות יישור בזמן אמת במהלך האימון, ובנוסף זיהוי ותיקון של אסטרטגיות שגויות שהופיעו כאשר הסוכן ביצע משימות ארוכות טווח.
הלמידה המאוחרת אינה מסתמכת רק על העדפות אנושיות פשוטות. כפי שניתן לראות במסמכים הזמינים, Claude משתמש בשילוב של חוקה (constitution), משוב אנושי, משוב מבוסס בינה מלאכותית ומסווגי בטיחות. במיוחד, הדגש הוא על לימוד עקרונות (מדוע פעולה מסוימת רצויה) במקום שינון רשימת איסורים.
תחושת "בליגה אחרת" נובעת ככל הנראה משילוב של: ① מודל בסיס חזק יותר, ② אימון ייעודי למשימות סוכן ארוכות טווח, ③ חלון הקשר גדול, ④ יכולת שימוש בכלים ואימות עצמי, ⑤ למידה מאוחרת משופרת. לעומת זאת, פרטים כגון שימוש בארכיטקטורת MoE, מספר הפרמטרים, הרכב הנתונים או אלגוריתם הלמידה לחיזוק נותרו חסויים ולכן מהווים הערכה בלבד.