目前可以確認的重點有三個:
attachment_search。但以上都沒有明確寫出「OCR」、沒有明確承諾「從照片或掃描件逐字擷取文字」,也沒有明確提到「收據解析」這類更具體的文件處理流程。
因此,較準確的說法是:Grok 有文件與圖片相關能力;但 Grok 4.3 是否能正式用作照片、掃描檔或收據 OCR,這次資料無法證實。
圖片理解通常是指模型能處理圖像內容,例如辨識場景、物件、畫面資訊,或根據圖片回答問題。
OCR,也就是光學字元辨識,範圍更窄、也更容易被檢驗:它要求系統從圖像中擷取可見文字,並盡量保留原本的順序與結構。若是收據或掃描文件,還常常需要辨識商戶名稱、日期、品項、金額、小數點、稅額、欄位位置與表格格式。
這個差異很重要。收據和掃描件可能有低光、歪斜、反光、摺痕、細字、多欄排版或模糊邊緣。即使某個模型能「理解圖片」,也不代表官方已承諾它能穩定、逐字、結構化地完成 OCR 或收據文字擷取。
| 能力 | 官方資料可支持的說法 | 不應自動推論 |
|---|---|---|
| 附加文件搜尋/推理 | Grok 可搜尋並推理聊天訊息中附加的文件,且會自動使用 attachment_search。 | 不等於所有掃描圖像都會被準確 OCR 成文字。 |
| 圖片理解 | xAI 文件列出 Images 能力,並有 Image Understanding 文件頁。 | 不等於官方保證能逐字抽取照片、掃描檔或收據文字。 |
| OCR/收據解析 | 這次提供的官方來源未明確寫明 OCR、掃描件文字抽取或收據解析。 | 不應宣稱 Grok 4.3 已有官方 OCR 支援。 |
換句話說,官方文件可用來支持「Grok 有圖片與文件上下文能力」;但要支持「Grok 4.3 有正式 OCR 功能」,證據仍不夠。
這次資料也包含 Threads、Hacker News、第三方網站、X 貼文與 YouTube 內容,討論 Grok 4.3 beta、文件生成、PDF 處理或聊天匯出等話題。
這些內容可以反映外界觀察、使用者討論或教學方向,但它們不是 xAI 的官方 OCR 文件。即使有第三方內容聲稱 Grok 4.3 beta 具備某些文件相關能力,也不足以證明 xAI 已正式支援照片 OCR、掃描件抽字或收據解析。
若是產品頁、銷售材料、教學文章或企業內部合規文件,建議只採用官方文件明確寫出的能力。未有明文支持的功能,應標示為「未證實」或「需實測」。
可以寫:
根據 xAI 文件,Grok 可以搜尋並推理附加到聊天訊息的文件;xAI 也列出 Grok 具備圖片/Image Understanding 相關能力。
不建議寫:
Grok 4.3 已官方支援從收據、掃描文件或照片直接 OCR 抽字。
原因很簡單:目前提供的官方來源沒有明確支持第二句。除非 xAI 之後發布清楚的 OCR、文件抽取、收據解析、掃描件處理或相關 API 文件,否則不宜把「圖片理解」包裝成正式 OCR 功能。
可以測,但要把它視為能力評估,而不是官方保證。比較務實的測法包括:
Grok 的附加文件搜尋/推理與圖片理解能力,有 xAI 官方文件支持。 但 Grok 4.3 是否能從照片、掃描文件或收據直接做 OCR 抽字,目前官方證據無法證實。
最安全的一句話是:可以說 Grok 有文件與圖片相關能力;但不應說 Grok 4.3 已獲官方確認支援 OCR。