就 Grok 來說,第一件事有官方資料支撐。xAI 的 Web Search 文件說,這個工具讓 Grok 可以即時搜尋網頁,並瀏覽網頁以尋找資訊。
X Search 文件則說,Grok 可以在 X(前稱 Twitter)上進行關鍵字搜尋、語意搜尋、使用者搜尋,以及抓取串文。 這代表 Grok 不只是能查一般網頁,也有針對 X 平台內容的結構化搜尋能力。
xAI 的 API 頁面也把 Grok API 描述為包含即時搜尋;xAI 在 X 上的貼文亦稱 Live Search 可讓 Grok 搜尋來自 X 與網際網路的即時資料。
真正關鍵的問題不是 Grok 能不能搜尋,而是 Grok 4.3 是否比 Grok 4、Grok 4.1 或 Grok 4.1 Fast 搜得更好。
這個較強的說法,目前沒有被提供的來源證實。來源中有 xAI 關於 Grok 4、Grok 4.1 與 Grok 4.1 Fast 的官方內容,提到原生工具使用、agentic search、工具呼叫,以及一般排行榜表現等主張。 但這些資料沒有提供針對 Grok 4.3 的檢索評測,也沒有把 Grok 4.3 與較早版本放在同一條件下比較資訊新鮮度、來源品質、引用準確度或 X 串文處理能力。
提供的來源中,唯一直接涉及 Grok 4.3 的資料是一篇第三方文章,主題是 Grok 4.3 Beta;它不是 xAI 官方發布說明,也不是可重現的檢索能力評估。 因此,它不足以支撐「Grok 4.3 在網頁或 X 搜尋上已有可量化優勢」這類結論。
若要公平測試 Grok 4.3,做法應該像產品評測,而不是只看型號數字。
比較測試至少應該讓 Grok 4.3 與早前可用的 Grok 版本,在同一時間回答同一批需要最新資訊的問題。測試題目應包括需要瀏覽網頁的任務,因為 xAI 文件描述 Web Search 可用於即時網頁搜尋與瀏覽。
也應納入 X 相關任務,例如:用關鍵字找貼文、用語意搜尋找相關討論、尋找特定使用者,以及正確抓取一整串 X 貼文;這些正是 xAI 的 X Search 文件列出的功能。
評分時還要把「找到資料」與「寫出答案」分開看。合理的評估項目包括:
沒有這類並排、可重現的比較,只憑「4.3」這個版本號,不能推論它的檢索能力必然優於 Grok 4、Grok 4.1 或 Grok 4.1 Fast。
最穩妥的結論是:Grok 具備文件記載的即時網頁搜尋與 X 搜尋能力,但目前提供的來源沒有證明 Grok 4.3 比 Grok 4、Grok 4.1 或 Grok 4.1 Fast 更有效地擷取最新資訊。
實務上,可以把 Grok 的網頁與 X 搜尋視為真實可用的功能;但若答案涉及新聞、金融、政策、技術版本或社群貼文脈絡,仍應檢查它實際引用了哪些來源。至於「Grok 4.3 搜尋能力已明顯升級」這個說法,在 xAI 或獨立評測者公布直接、可重現的比較結果之前,仍應視為尚待證實。