這並不等於證明「Spud」從未在 OpenAI 內部存在。更精確的說法是:關於 Spud 的發布時間、基準表現,或「比 GPT-5.4 更會理解影像與文件」等公開說法,尚未被本次來源中的官方證據建立起來。
最強的官方證據指向 GPT-5.4。OpenAI 的 GPT-5.4 模型頁把 GPT-5.4 描述為用於複雜專業工作的前沿模型;OpenAI 的最新模型指南與模型索引也將讀者導向 GPT-5.4 。
相較之下,本次檢視到的 Spud 相關來源,來自一般網頁文章、Reddit、X 貼文與 YouTube 影片,而不是 OpenAI 官方模型頁、模型指南、模型卡或基準報告 。因此,較穩妥的判斷是:在 OpenAI 發布正式文件之前,GPT-5.5 Spud 應被當作傳聞或未驗證代稱。
| 主張 | 狀態 | 目前來源支持什麼 |
|---|---|---|
| GPT-5.5「Spud」是 OpenAI 官方公開模型 | 未驗證 | 本次檢視的 OpenAI 官方來源記載的是 GPT-5.4,沒有 GPT-5.5 或 Spud 的官方模型頁 。 |
| Spud 即將發布,或已經獲得驗證 | 未驗證 | 本次來源集中,Spud 相關說法來自一般網頁、社群或影片來源 。 |
| OpenAI 已記載多模態文件工作流程 | 對 GPT-5.4 而言可驗證 | OpenAI 提供 GPT-5.4 的視覺與文件理解指引,並有針對密集或空間敏感影像任務的提示建議 。 |
| Spud 在多模態 grounding 上優於 GPT-5.4 | 本次資料不支持 | 本次官方文件支持的是 GPT-5.4 相關指引,沒有提供 Spud 專屬能力或基準證據 。 |
OpenAI 官方 GPT-5.4 頁面說,GPT-5.4 是其用於複雜專業工作的前沿模型 。OpenAI 也提供一份聚焦 GPT-5.4 視覺與文件理解的 cookbook 指引 。
在本次取得的資料中,該指引包含幾類接近真實工作情境的例子:從手寫保險表單做結構化擷取、理解公寓平面圖的空間關係、解讀圖表,以及從警方表單中擷取 bounding box 位置 。
這些例子之所以重要,是因為文件理解不只是「把字讀出來」。真正可用於工作流程的 grounding,需要模型把答案連回頁面上的可見證據:欄位標籤與數值、表格儲存格、圖表標記、手寫字、文件版面與空間位置。
不過,也要把證據強度說清楚:本次檢視到的 GPT-5.4 材料是 OpenAI 撰寫的指引與示範,而不是能涵蓋所有生產環境文件流程的獨立稽核基準報告 。
OCR 的目標主要是讀出文字;多模態 grounding 則更進一步,要求系統把文字、版面、位置、視覺結構與推理連成一個可核對的答案。
研究脈絡也支持這個較寬的理解。文件理解的評估常涵蓋表單理解、收據解析與文件視覺問答(document VQA)等任務 。多頁文件 VQA 則可能要求模型跨頁推理、瀏覽文件、找出相關內容,再檢查特定頁面,而不能只靠單張截圖或單頁裁切 。
換句話說,一張漂亮的展示截圖不等於完整驗證。嚴肅評估應該包含你實際會處理的文件類型、掃描品質、頁數、手寫內容、表格、圖表、小字,以及容易出錯的邊界案例。
original 影像細節 。「Spud」這個名稱出現在傳聞式報導與社群內容中,但在本次檢視的官方來源裡,尚未被驗證為 OpenAI 的官方公開模型。更可操作的結論是:若你要做影像、表單、掃描件、圖表與文件理解工作,應以 OpenAI 已記載的 GPT-5.4 來規劃與測試;至於 GPT-5.5 Spud 的多模態 grounding 能力宣稱,應等到 OpenAI 發布官方模型頁、模型指南、模型卡或基準報告後再下判斷 。