后训练不仅依赖人类偏好学习:公开信息显示,Claude 使用宪法 AI、人类反馈、AI 反馈以及安全分类器相结合的方式进行训练。 重点在于让模型理解“为什么”某些行为是可取的,而非简单记忆“不许做”。
实际上,“不同维度”的核心感受很可能源于 ① 更强的基础模型、② 针对长期智能体的训练、③ 超大上下文、④ 工具使用与自我验证、⑤ 改进的后训练 这五大因素同时生效。而关于是否采用 MoE、参数规模、数据组成、强化学习算法等关键技术细节,Anthropic 尚未公开,因此更深入的推测缺乏依据。