OpenAI 將 GPT 5.5 Instant 設為 ChatGPT 預設模型,健康相關幻覺減少 52.5%,在嚴謹評測中表現與前沿 Thinking 模型相當。 頂尖醫學期刊《NEJM AI》發表同儕審查研究:OpenAI o3 Deep Research 協助波士頓兒童醫院從 376 例先前專家束手無策的罕見病例中,成功診斷出 18 名兒童,診斷率近 5%。
研究答案

Create a landscape editorial hero image for this Studio Global article: What recent health-related improvements did OpenAI announce for GPT-5.5 Instant, how does it compare to physicians and previous models on he. Article summary: ## GPT-5.5 Instant Health Improvements. Topic tags: general, news, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
OpenAI 在 2026 年展開了迄今為止最積極的醫療領域布局,推出以 GPT-5.5 Instant 為核心的一系列產品——該模型已成為所有 ChatGPT 用戶的預設版本——並在波士頓兒童醫院展示了真實世界的臨床成果。以下整理這些變化、模型與人類醫生的比較,以及證據所呈現的實際情況。
2026 年 6 月 18 日,OpenAI 宣布 GPT-5.5 Instant 在健康智慧方面帶來顯著升級。該模型更能識別何時可能需要緊急照護、主動詢問相關背景資訊、清楚表達不確定性,並讓複雜的醫療資訊更容易理解 。OpenAI 同時強化了 ChatGPT 在長時間對話中偵測細微心理健康警訊的能力,並針對自傷等緊急情況進行安全回應訓練
。
每週有超過 2.3 億人 使用 ChatGPT 詢問健康與保健問題 。OpenAI 報告指出,被標記為至少有一項事實性問題的健康回應比例,在兩個月內下降了 71%
。在高風險的醫療、法律與財務提問中,GPT-5.5 Instant 產生的幻覺陳述比前一代 GPT-5.3 Instant 減少了 52.5%
。
OpenAI 表示,GPT-5.5 Instant 在健康問題上的表現已可與其前沿 Thinking 模型相提並論,並在 HealthBench 和 HealthBench Professional 上取得比 GPT-5.3 Instant 更高的分數 。獨立學術研究也證實了明確的世代進步:在臨床案例診斷準確率上,從 GPT-3.5 Turbo 的 74.4%(58/78)提升至 GPT-o3 的 93.6%(73/78)和 GPT-5 的 91.0%(71/78)
。
在最嚴格的評測 HealthBench Professional 上,專為臨床醫師設計的 GPT-5.4 in ChatGPT for Clinicians 系統獲得 59.0 分,顯著超越人類醫生基線的 43.7 分(p = 3.7 × 10⁻¹⁰)。在撰寫與文件任務上,其表現更是將近醫生基線的 2 倍(64.1 vs. 32.1)
。
一篇發表於《自然》期刊(2025)的綜合分析則顯示,生成式 AI 模型總體與醫生在診斷任務上無統計顯著差異——醫生準確率高 9.9%,但差異未達顯著水準(p = 0.10)。不過,AI 模型仍顯著落後於專家級醫生(準確率差異:15.8%,p = 0.007)
。結論:前沿 AI 在一般診斷上已與一般醫生大致相當,但仍落後於專科醫師。
在一篇發表於《NEJM AI》的同儕審查研究中,來自波士頓兒童醫院 Manton 中心、哈佛大學和 OpenAI 的研究人員,使用 o3 Deep Research 推理模型重新分析了 376 例先前未解的兒童罕見遺傳病例 。該系統連結臨床特徵、遺傳模式和科學文獻,產生診斷假設,並成功為 18 名兒童 找出診斷,涵蓋四個疾病領域——10 例神經發育障礙、4 例神經肌肉疾病、2 例猝死和 2 例兒童早期精神病
。研究人員稱此近 5% 的診斷率為「徹底的遊戲規則改變者」,因為這些患者的基因組先前已經過人類專家徹底分析
。
此外,波士頓兒童醫院更廣泛的 AI 整合已協助診斷 超過 40 種 先前無法解決的罕見疾病,每年節省 60,000 工作小時(相當於 700 萬美元的人力成本),並在降低營運成本同時擴大照護可及性 。
OpenAI 在 2026 年推出了三項不同的健康產品:
ChatGPT Health(2026 年 1 月 7 日)——消費者端功能,用戶可詢問健康話題、上傳醫療文件,並安全連接 Apple Health 和 MyFitnessPal 等健康應用程式。OpenAI 明確指出此功能非設計用於診斷或治療 。
OpenAI for Healthcare(2026 年 1 月 8 日)——符合 HIPAA 規範的企業級產品,為醫療機構提供 GPT-5 驅動工具,首批客戶包括 AdventHealth、Baylor Scott & White Health、波士頓兒童醫院、Cedars-Sinai Medical Center、HCA Healthcare、Memorial Sloan Kettering 癌症中心、Stanford Medicine Children's Health 與 UCSF 。
ChatGPT for Clinicians(2026 年 4 月 22 日)——免費提供給美國驗證醫師、護理師、醫師助理與藥師的專用版本。功能包括摘要醫療證據、草擬臨床文件、生成病患衛教資料,以及整合臨床指引與研究 。在 HealthBench Professional 上,此工具的表現顯著超越人類醫生
。
第四項模型更新 GPT-Rosalind(2026 年 6 月)則結合 GPT-5.5 的自主編碼能力與增強的科學智慧,專注於生物醫學研究工作流程 。
OpenAI 在 2026 年的醫療領域布局內容紮實,並有實際成果支撐——從醫療幻覺減少 52.5%,到在先前無法解決的病例中找到 18 個新診斷。該公司已建立明確的三層策略:消費者教育、免費臨床工具與企業部署。儘管仍需審慎看待——OpenAI 的評測為內部數據,且《自然》期刊的綜合分析也確認 AI 仍落後專家級醫生——但證據顯示,對於一般健康問題和臨床輔助任務,GPT-5.5 Instant 已不再是玩具,而是真正有用的工具。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 將 GPT 5.5 Instant 設為 ChatGPT 預設模型,健康相關幻覺減少 52.5%,在嚴謹評測中表現與前沿 Thinking 模型相當。
OpenAI 將 GPT 5.5 Instant 設為 ChatGPT 預設模型,健康相關幻覺減少 52.5%,在嚴謹評測中表現與前沿 Thinking 模型相當。 頂尖醫學期刊《NEJM AI》發表同儕審查研究:OpenAI o3 Deep Research 協助波士頓兒童醫院從 376 例先前專家束手無策的罕見病例中,成功診斷出 18 名兒童,診斷率近 5%。
OpenAI 在 2026 年推出三層健康策略:消費者端的 ChatGPT Health、符合 HIPAA 的企業方案 OpenAI for Healthcare,以及免費提供給美國臨床醫護的 ChatGPT for Clinicians。