後續訓練不僅止於人類偏好學習。 根據公開資訊,Claude 的訓練結合了憲法、人類反饋、AI 反饋與安全分類器。 其方向並非只是讓模型記住「不可以做什麼」,而是讓模型學習「為什麼特定行為是值得提倡的」原則。
實際使用上感受到的「天差地遠」,其核心關鍵可能並非單一模型規模的擴大,而是 ① 更強大的基礎模型、② 針對長期代理任務的訓練、③ 更大的上下文視窗、④ 工具使用與自我驗證能力、⑤ 改進的後續訓練 這五大要素的綜效。至於是否採用 MoE 架構、參數量、數據組成、強化學習演算法等關鍵技術細節,由於 Anthropic 未公開,目前仍僅止於推測。