OpenAI 為 ChatGPT 引入臨時「安全摘要」,讓系統能在整段對話中保留關鍵安全訊號,偵測逐步升高的心理或行為風險。[1][2] 這些摘要只記錄與安全相關的少量資訊、屬於短期上下文,不會保存完整對話或成為長期記憶。[1][2] 該更新主要針對自傷、心理危機與潛在暴力情境,並由 170 多位心理健康專家參與設計安全回應方式。[21]

Create a landscape editorial hero image for this Studio Global article: OpenAI’s New ChatGPT Safety System: How “Safety Summaries” Detect Risk Across Conversations. Article summary: OpenAI updated ChatGPT so it can detect risks that emerge gradually during conversations by using temporary “safety summaries” that carry forward only safety‑relevant signals.. Topic tags: openai, chatgpt, ai safety, mental health, responsible ai. Reference image context from search candidates: Reference image 1: visual subject "OpenAI says the update uses narrowly scoped safety summaries to preserve earlier safety-relevant context, improving safe responses when risk" source context "OpenAI adds safety summaries so ChatGPT can recognize risk across sensitive conversations - NG Tech LLC" Reference image 2: visual subject "A digital display features the text “OpenAI’s ChatGPT Health Tools Ignite Privacy and Saf
過去多數 AI 內容安全系統會逐條訊息審查:每一段使用者輸入都獨立評估是否包含危險內容。這在使用者直接表達危險意圖時有效,但對於逐漸發展的風險情境卻不一定足夠。
在真實世界中,許多高風險情況——尤其是心理健康危機——往往是在長時間對話中慢慢浮現的,而不是一開始就明確說出口。
為了補上這個缺口,OpenAI 為 ChatGPT 引入了新的機制:臨時「安全摘要」(Safety Summaries)。這項功能讓系統能在對話過程中保留少量安全相關線索,從而辨識風險是否正在逐步升高。
傳統的 AI 審查流程主要以單一訊息為單位。如果某一條訊息本身沒有明顯危險訊號,系統就可能判斷為安全。
但研究與內部分析顯示,許多問題互動其實是在長時間聊天過程中逐步演變的,例如:
如果 AI 無法理解前後脈絡,就可能錯過這些逐漸累積的警訊。
因此,OpenAI 的新設計目標是讓安全系統從「逐句判斷」轉為**「整段對話層級」的風險辨識**。
安全摘要是系統在某些對話過程中自動生成的簡短筆記。
重要的是:它們不是完整對話紀錄。系統只會記錄與安全風險相關的少量訊號。
這些摘要的設計有幾個特點:
簡單說,它的角色就像「提醒卡片」:當新的訊息出現時,系統能參考之前的警訊來判斷整體情況。
並不是所有對話都會產生安全摘要。
通常只有在系統偵測到可能存在較高風險的訊號時,才會啟用這種機制,例如:
在這些情況下,ChatGPT 可以利用摘要理解整體對話走向,並選擇更安全、更合適的回應策略。
OpenAI 表示,這次更新的核心焦點是心理健康與危機情境的安全處理。
相關安全設計主要希望讓 ChatGPT 更好地:
這些改進是與超過 170 位心理健康專家合作設計的,他們協助定義在脆弱或危機情境下更合適的 AI 回應方式。
此外,安全機制也試圖減少其他與長時間 AI 互動相關的風險,例如:
相關研究指出,聊天機器人的安全機制在長對話中往往更容易失效,因此需要新的設計來補強。
OpenAI 表示,在更新 ChatGPT 預設模型後,系統在處理心理與情緒困擾相關對話時的辨識與回應能力有所提升。
部分報告指出,這些模型更新是在與臨床專家合作後完成,測試中不符合安全標準的回應數量顯著下降,部分評估情境中的改善幅度可達 65%–80%。
不過,目前公開資訊通常只提供整體結果摘要,完整的評估方法、資料集與測試細節並未全部公開。因此外界仍難以完全評估改善的實際規模。
對學校、大學與教育科技平台來說,這項更新解決了一個現實問題:
學生的風險訊號很少在單一訊息中出現。
青少年與學生在與 AI 互動時,常常會透過長時間對話逐漸透露情緒或壓力。如果系統只看單一訊息,很可能忽略重要線索。
能夠理解整段對話的安全機制,理論上更有機會辨識:
這有助於降低聊天機器人在長時間互動中給出不安全回應的機率,而這正是 AI 安全長期面臨的挑戰之一。
當然,AI 安全機制仍然只是整體保護系統的一部分。真正有效的保護仍需要:
「安全摘要」代表 AI 安全設計的一個重要方向轉變。
過去系統多半只評估單一提示(prompt);未來則越來越強調跨整段對話的模式分析。
這種方法更接近真實人際互動的情況,也更符合風險通常是如何在現實中逐漸形成的。
OpenAI 表示,其 AI 安全流程是一個持續循環的系統,包括:模型訓練、部署前評估、實際使用監測,以及發布後的持續改進。
隨著對話式 AI 逐漸進入教育、工作與日常生活,能夠在長時間互動中辨識微妙風險訊號的能力,很可能會成為負責任 AI 系統的基本要求。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
OpenAI 為 ChatGPT 引入臨時「安全摘要」,讓系統能在整段對話中保留關鍵安全訊號,偵測逐步升高的心理或行為風險。[1][2]
OpenAI 為 ChatGPT 引入臨時「安全摘要」,讓系統能在整段對話中保留關鍵安全訊號,偵測逐步升高的心理或行為風險。[1][2] 這些摘要只記錄與安全相關的少量資訊、屬於短期上下文,不會保存完整對話或成為長期記憶。[1][2]
該更新主要針對自傷、心理危機與潛在暴力情境,並由 170 多位心理健康專家參與設計安全回應方式。[21]