OpenAI 於 9 月 3 日開始向有限組織分階段推出 GPT 6 Astra,稱其為最聰明、最具對齊性的模型,主打程式開發、研究、電腦操作及複雜多步驟任務。[5][13] OpenAI 公布 Astra 在 FrontierMath Tier 4 取得 98%、ARC AGI 3 取得 99.9%、ExploitBench 取得 100%;這些是該公司發布的評測結果,並非獨立重現的驗證。[13] Astra 是 OpenAI 首個被其 Preparedness Framework(準備度框架)列為「關鍵級」網路安全能力的模型;API 定價為每百萬輸入權杖 10 美元、輸出權杖 50 美元。[3][10]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce with the September 3 launch of GPT-6 Astra—including its claimed intelligence, alignment, record benchmark results,. Article summary: OpenAI presented GPT‑6 Astra as a major step toward highly autonomous AI: “the world’s most intelligent and aligned model,” with record scores across agentic, scientific, computer-use, and cyber evaluations. These are Op. Topic tags: general, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
OpenAI 於 9 月 3 日宣布 GPT-6 Astra,將它定位為可執行困難、多步驟工作的模型,涵蓋程式開發、研究、電腦操作及專業工作流程。公司稱它是目前最聰明、最具「對齊性」的模型,但初期並未全面開放,而是先提供給有限組織使用。2
5
13
這次發布最值得注意之處,不只在於 OpenAI 所宣稱的測試進展,更在於 Astra 是該公司第一個在其 Preparedness Framework(準備度框架) 中達到網路安全能力「關鍵級」(Critical)門檻的模型。10
12 因此,理解它的能力宣稱時,也必須一併看待其風險分級與分階段上線安排。
OpenAI 表示,Astra 在電腦操作、網頁瀏覽、軟體工程、網路安全、科學及專業工作方面均達到領先水準。開發者文件則將其用途描述為複雜推理、寫程式、電腦操作、研究與文件製作。1
3
13
公司公布的三項代表性結果為:
這些數字是 OpenAI 已公布的內部評測結果,並不是由獨立單位重現後得出的結論。高分能反映模型在特定測試題目上的進步,但不能單憑這些分數,就推論它已具備通用智慧、在真實情境中一貫可靠的判斷,或可在所有環境安全自主運作。
OpenAI 表示,Astra 是首個在其準備度框架下被評為「關鍵級」網路安全能力的模型。依公司的說法,若模型取得合適的工具與系統存取權限,它可在無須人類逐步指揮的情況下,找出先前未知的資安漏洞,並針對許多防護嚴密的系統開發新的利用方式。10
12
這項能力宣稱有兩個重要前提:
OpenAI 說明,已對有害網路行動增設更強的防護措施,並在 Astra 推出期間加入額外監控。5
10 沒有立即全面開放、而採取分階段存取,也與公司所辨識的額外風險一致。
OpenAI 也稱 Astra 是其最具對齊性的模型,表示它更能遵守任務界線並透明溝通。2
13
不過,這類說法需要謹慎解讀。模型發布語境中的「對齊」,通常是指在特定訓練方法與評測下的表現;它不保證 AI 代理一定能正確理解使用者意圖、遵守每一項營運邊界,或可在沒有人工覆核下安全部署。OpenAI 的發布說明也指出,Astra 加入額外監控,以辨識代理可能誤解指令的情況。5
對考慮導入 AI 代理的組織而言,實際問題不在於模型是否被標示為「對齊」,而在於:它獲得哪些權限、哪些高影響行動必須經人工核准、活動是否留下可查核紀錄,以及系統異常時能否快速停止。
提供的資料提及,部分評測數字後續曾出現補充或限定,包括基準資料污染的疑慮,以及特殊存取設定與預設正式環境存取設定可能不同。資料也提到,在某些測試中,僅依賴思維鏈(chain-of-thought)進行監控的效果,可能不如取得完整情境資訊的監控方式。
然而,現有的一手來源摘錄未提供所有公開成績完整、可獨立稽核的修訂紀錄,也未完整揭示底層監控方法。因此,較負責任的結論是:發布初期的亮眼分數與安全評估應視為仍可能演進的證據;若要依賴某個分數或部署主張,應先查閱最新的模型文件與安全資料。2
3
10
Astra 的發布,發生在較早的 OpenAI 模型資安測試事件之後。OpenAI 表示,該事件影響了公司對 Astra 的安全設計;同時強調 Astra 本身並非涉入該事件的模型,且事件的經驗已納入防護措施。10
這個脈絡之所以重要,是因為自主系統結合了模型能力,以及透過瀏覽器、程式工具與其他軟體採取行動的能力。模型能跨系統行動,正是其實用價值的一部分;但同一項特性也提高了隔離、最小權限原則與持續監控的重要性。
OpenAI 表示,Astra 初期先向有限組織推出,日後才計畫擴大開放。5
13
開發者透過 API 使用時,OpenAI 列出的 GPT-6 Astra 定價為:每百萬輸入權杖 10 美元、每百萬輸出權杖 50 美元。模型頁面同時列出 105 萬權杖的上下文視窗,以及最高 12.8 萬輸出權杖。3
ChatGPT 端則採取不同方案、逐步開放的安排。OpenAI 的說明指出,由 Astra 驅動的 GPT-6 Pro 正在向 Pro 100 美元、Pro 200 美元、Business 與 Enterprise 方案推出;Plus 方案則會隨推出進度,在 ChatGPT Work 與 Codex 使用 Astra。不同 ChatGPT 產品與工作區設定,實際可用性可能不同。6
GPT-6 Astra 的發布同時傳遞兩個不能拆開看的訊息:OpenAI 聲稱它在複雜、具代理性質的工作上有顯著進展;但公司也同時把它的網路安全能力列在最高風險層級。10
13
發布測試成績可視為 OpenAI 所稱、模型在其評測條件下能做到的事;分階段開放、額外監控與網路安全限制,則顯示公司並未將這些能力當作一般風險看待。對評估導入的團隊來說,重點應是受控部署:限縮工具範圍、為重大行動設置明確核准關卡、使用隔離環境,並保留可供檢視的紀錄,而不是預設基準測試表現會自然轉化為可信賴的自主性。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 於 9 月 3 日開始向有限組織分階段推出 GPT 6 Astra,稱其為最聰明、最具對齊性的模型,主打程式開發、研究、電腦操作及複雜多步驟任務。[5][13]
OpenAI 於 9 月 3 日開始向有限組織分階段推出 GPT 6 Astra,稱其為最聰明、最具對齊性的模型,主打程式開發、研究、電腦操作及複雜多步驟任務。[5][13] OpenAI 公布 Astra 在 FrontierMath Tier 4 取得 98%、ARC AGI 3 取得 99.9%、ExploitBench 取得 100%;這些是該公司發布的評測結果,並非獨立重現的驗證。[13]
Astra 是 OpenAI 首個被其 Preparedness Framework(準備度框架)列為「關鍵級」網路安全能力的模型;API 定價為每百萬輸入權杖 10 美元、輸出權杖 50 美元。[3][10]