这足以让“Spud 是 OpenAI 内部模型代号”成为值得继续关注的说法,但还不能把它等同于已经公开的产品。OpenAI API Models 来源在本次材料中列出的是 gpt-5.4、gpt-5.4-mini、gpt-5.4-nano,未能确认 Spud 或 GPT-5.5 已经公开可用。
换句话说,更准确的表述应是:Spud 是一个被媒体报道的 OpenAI 内部模型代号;它的公开名称、能力分数、发布时间和 API 可用性,目前仍未获得 OpenAI 官方文件或可复现 benchmark 证实。
判断模型传闻时,关键不是有多少人转发,而是证据能不能追溯、复查和复现。比较可靠的证据通常包括:
按这个标准,Spud 的“存在与训练进度”有媒体报道支撑;但网传的跑分、demo、发布日期和 GPT-5.5 命名,大多还没有过线。
| 网传说法 | 目前能核实到什么 | 判断 |
|---|---|---|
| OpenAI 有一个代号为 Spud 的新模型 | The Information 标题直接提到 OpenAI 正准备 Spud AI model;The Decoder 转述称 OpenAI reportedly finished pretraining a new AI model codenamed Spud。 | 有媒体交叉印证,但未见官方确认 |
| Spud 已公开,或将以 GPT-5.5 名义推出 | 本次 OpenAI API Models 来源列出 gpt-5.4 系列,未确认 Spud/GPT-5.5 已公开。 | 未验证 |
| Spud benchmark 追近或超越 Claude Mythos | Holter 文中的 77.80% 是 Claude Mythos Preview 在 SWE-bench Pro 的数字,57.70% 是 GPT-5.4;对 Spud 的描述是 expectation 语气,不是 Spud 原始分数。 | 未验证 |
| SWE-bench 已有 Spud 成绩 | SWE-bench 有公开 leaderboard,但本次来源材料未提供可直接对应 Spud 的提交、结果页或 eval card。 | 未验证 |
| 3D 世界、SVG、网站设计、互动游戏 demo 证明 Spud 能力 | Geeky Gadgets 写明是 According to Universe of AI 的转述,并提到官方 performance metrics 仍未公开。 | 二手转述,不能当能力证明 |
| 4 月 16 日、2026 年第二季度、一定叫 GPT-5.5 | 有文章将 Spud 写成 GPT-5.5,并预期 2026 年第二季度或 4—5 月发布;Holter 标题也使用 Leaked April 16 Release 与 GPT-5.5 or GPT-6 Might Mean 这类未定语气。 | 偏传闻,未验证 |
| OpenAI Developer Community 出现 SPUD Release 字样 | 相关页面标题是《Please Add an Optional Expression Mode with the SPUD Release》,语境是用户 feature request,不是 release note、API 文档或 model card。 | 不能当官方确认 |
Spud 传闻里最容易被放大的部分,是 benchmark。Holter 文章提到 Claude Mythos Preview 在 SWE-bench Pro 为 77.80%,GPT-5.4 为 57.70%;但文章对 Spud 的关键表述是“the expectation is that Spud closes most or all of that gap”这一类推测语气。
因此,这些数字最多只能支持“有人用其他模型的分数来推测 Spud 可能追上”。它们不能支持“Spud 已有独立验证的 benchmark 分数”。
如果要把 Spud 跑分当成可信事实,至少需要看到以下证据之一:官方 benchmark 报告、model card、system card、公开 leaderboard 条目、eval card、运行日志、prompt set、submission,或第三方可复现测试。
SWE-bench 本身有公开 leaderboard,是核对编程能力跑分的重要基础来源;但本次来源材料没有提供任何可核实的 Spud leaderboard entry。
网上流传的 Spud demo 包括 3D simulations、interactive environments、website designs、SVG designs、interactive games 等。问题不在于这些 demo 一定是假的,而在于它们暂时不能证明“确实由 Spud 生成”,也不能证明“别人能复现同样结果”。
Geeky Gadgets 的相关报道明确写成 According to Universe of AI 的转述,并提到官方 performance metrics 仍未公开。 这意味着这些内容目前更适合归类为“网传输出”或“二手展示”,而不是已验证的产品能力。
要把这类 demo 升级为可引用证据,至少需要原始视频来源、完整 prompt、生成过程、模型名称、时间戳、可复现步骤,或者 OpenAI 官方 demo 页面。
“Spud 会叫 GPT-5.5”和“某天发布”是最吸睛、也最容易被二次传播的部分。有文章已经直接把 Spud 包装成 GPT-5.5,并写出 2026 年第二季度或 4—5 月的预期;另一边,Holter 文章标题使用 Leaked April 16 Release 和 GPT-5.5 or GPT-6 Might Mean 这类仍然不确定的写法。
从事实核查角度看,这些都没有达到官方发布门槛。除非 OpenAI 在模型文档、API、release notes 或官方博客中列出正式名称和可用性,否则“GPT-5.5”只能视为外界命名或推测,而不是已确认产品名。本次可查 OpenAI API Models 来源未能确认 Spud/GPT-5.5 已公开。
OpenAI Developer Community 上出现“SPUD Release”字样,容易被截图包装成官方暗示。但本次提供的相关页面标题是《Please Add an Optional Expression Mode with the SPUD Release》,语境是用户提出功能请求,而不是 OpenAI 的 release note、API 文档或 model card。
论坛提及可以说明社区有人在讨论 Spud;它不能证明 OpenAI 已确认 Spud 发布。
如果你要为 coding workflow、AI agent、产品路线图或采购决策评估模型,现阶段不应把 Spud 跑分当成已知事实。更稳妥的做法是:
Spud 可能确有其事,因为有具名媒体报道 OpenAI 正准备一个代号为 Spud 的模型,也有报道转述称它已完成预训练。 但可用于发布、采购或产品决策的结论要窄得多:目前不能把网传 benchmark、3D demo、发布日期或 GPT-5.5 命名当成已独立验证的事实。
对外沟通时,最准确的版本是:Spud 是一个被报道的 OpenAI 内部模型代号;其公开名称、能力、分数与发布时间仍未获得 OpenAI 官方文件或可复现 benchmark 证实。