OpenAI วางตำแหน่ง GPT-5.6 Sol ให้เป็นแนวหน้าใหม่ในสามโดเมนหลัก ได้แก่ การเขียนโค้ด ชีววิทยา และความปลอดภัยทางไซเบอร์
Terminal-Bench 2.1 ทดสอบเวิร์กโฟลว์บน command-line ที่ต้องมีการวางแผนหลายขั้นตอน การประสานงานเครื่องมือ และการทำซ้ำ เบนช์มาร์คนี้ประกอบด้วยงานเขียนโปรแกรมที่ซับซ้อน 89 งาน
ผลลัพธ์ประกอบด้วย:
| โมเดล | คะแนน |
|---|---|
| GPT-5.6 Sol Ultra | 91.9% |
| GPT-5.6 Sol (max) | 88.8% |
| Claude Mythos 5 | 88.0% |
| GPT-5.6 Terra | 84.3% |
| Claude Fable 5 | 84.3% |
| GPT-5.5 | 83.4% |
| GPT-5.6 Luna | 82.5% |
GPT-5.6 Sol Ultra ตั้งค่าระดับสูงสุดใหม่ที่ 91.9% คะแนน Sol มาตรฐานที่ 88.8% แซงหน้า Claude Mythos 5 ของ Anthropic ซึ่งเป็นโมเดลแนวหน้าที่ถูกจำกัดการเข้าถึง ที่ 88.0% เกือบหนึ่งจุดเต็ม
บน GeneBench v1 เบนช์มาร์คที่ประเมินงานวิเคราะห์จีโนมิกส์และชีววิทยาเชิงปริมาณระยะยาว OpenAI รายงานว่า Sol ทำผลลัพธ์ได้ดีกว่า GPT-5.5 ในขณะที่ใช้ output tokens น้อยกว่า นี่แสดงถึงการปรับปรุงประสิทธิภาพที่มีความหมายสำหรับเวิร์กโฟลว์การวิจัยทางวิทยาศาสตร์
บน ExploitBench เบนช์มาร์คการวิจัยความปลอดภัยทางไซเบอร์ GPT-5.6 Sol มีประสิทธิภาพเกือบเท่ากับ Mythos Preview ของ Anthropic ในขณะที่ใช้ output tokens ประมาณหนึ่งในสาม
บน ExploitGym เบนช์มาร์คที่สร้างโดยนักวิจัยจาก UC Berkeley ร่วมกับ OpenAI และห้องปฏิบัติการ AI ชั้นนำอื่นๆ โมเดล GPT-5.6 ทั้งสามรุ่นแสดงความสามารถด้านความปลอดภัยทางไซเบอร์ที่ดีขึ้นเมื่อการใช้เหตุผลเพิ่มขึ้น
สิ่งสำคัญคือ OpenAI ระบุว่า GPT-5.6 Sol ยังไม่ถึงเกณฑ์ Cyber Critical ภายใต้ Preparedness Framework ในการประเมินที่เกี่ยวข้องกับ Chromium และ Firefox โมเดลระบุจุดบกพร่องและ exploitation primitives ซึ่งเป็นส่วนประกอบสำคัญของ exploit แต่ไม่สามารถสร้าง functional full-chain exploit ได้ด้วยตนเองภายใต้เงื่อนไขที่ทดสอบ
โมเดลทั้งซีรีส์ GPT-5.6 ได้รับการประเมินภายในว่าเป็นความเสี่ยง "สูง" (สำหรับความสามารถด้านความปลอดภัยทางไซเบอร์และอาวุธชีวภาพ) แต่ไม่ใช่ระดับ "วิกฤต" สูงสุด
OpenAI กล่าวว่า GPT-5.6 Sol เปิดตัวด้วย "ชุดความปลอดภัยที่แข็งแกร่งที่สุดเท่าที่เคยมีมา" แนวทางด้านความปลอดภัยประกอบด้วย:
ในระหว่างการพรีวิว พรอมต์บางรายการอาจถูกทำให้ช้าลงหรือถูกบล็อกเพื่อการตรวจสอบเพิ่มเติม ในขณะที่ OpenAI ปรับแต่งอัตราการเกิด false-positive และ false-negative
การเปิดตัว GPT-5.6 ครั้งนี้แตกต่างจากการเปิดตัวครั้งก่อนๆ ของ OpenAI ตามคำขอของรัฐบาลสหรัฐฯ OpenAI เริ่มต้นด้วยการจำกัดการเข้าถึงเฉพาะกลุ่มพาร์ทเนอร์และองค์กรที่เชื่อถือได้กลุ่มเล็กๆ — Axios รายงานว่าการพรีวิวรวมถึงบริษัทที่ได้รับการอนุมัติประมาณ 20 ราย — ในขณะที่โมเดลอยู่ระหว่างการตรวจสอบความมั่นคงแห่งชาติเพิ่มเติม
การพรีวิวไม่ใช่โปรแกรมแบบ self-service ในวงกว้าง ในช่วงเวลานี้ GPT-5.6 Sol, Terra และ Luna สามารถเข้าถึงได้ผ่าน OpenAI API และ Codex เท่านั้นสำหรับกลุ่มที่จำกัดนี้ โมเดลเหล่านี้ไม่มีใน ChatGPT ในระหว่างการพรีวิว
OpenAI กล่าวว่าการเปิดตัวในวงกว้างใน ChatGPT, Codex และ API มีแผนจะเกิดขึ้น "ในอีกไม่กี่สัปดาห์ข้างหน้า"
OpenAI ระบุอย่างชัดเจนว่ามองว่าแนวทางที่รัฐบาลกำกับนี้เป็นมาตรการชั่วคราว: "เราเชื่อในการเข้าถึงในวงกว้าง และกระบวนการนี้ไม่ควรกลายเป็นค่าเริ่มต้นในระยะยาว" ในบันทึกภายใน CEO Sam Altman บอกกับพนักงานว่ารัฐบาลจะ "อนุมัติการเข้าถึงลูกค้าทีละรายในช่วงพรีวิวนี้" โดยหวังว่าจะปล่อยในวงกว้างขึ้นในอีกสองสามสัปดาห์ต่อมา
การหารือนี้เกิดขึ้นกับ Office of the National Cyber Director และ Office of Science and Technology Policy ซึ่งสะท้อนถึงกรอบการทำงานสำหรับโมเดลแนวหน้าใหม่ที่กำลังทดสอบโดยรัฐบาลทรัมป์
| โมเดล | Input / 1M tokens | Output / 1M tokens |
|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Terra | $2.50 | $15.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
ราคาของ Sol เท่ากับราคาของ GPT-5.5 ในขณะที่ Terra ราคาถูกกว่า GPT-5.5 ประมาณ 2 เท่า สำหรับการเปรียบเทียบ ราคาของ Sol ใกล้เคียงกับ Claude Opus 4.8 ($5/$25) มากกว่า Mythos 5 ของ Anthropic ที่ถูกจำกัดการเข้าถึง ($10/$50)
OpenAI ยังประกาศด้วยว่า GPT-5.6 Sol จะถูกปรับใช้บนฮาร์ดแวร์ Cerebras ในเดือนกรกฎาคม ด้วยความเร็วในการอนุมานสูงสุด 750 tokens ต่อวินาที
ตระกูล GPT-5.6 ถือเป็นการเปลี่ยนแปลงครั้งสำคัญจากการเปิดตัวครั้งก่อนๆ ของ OpenAI การจัดแพ็กเกจสามระดับ (Sol, Terra, Luna) เปิดตัวแบรนด์ที่คงทนซึ่งแยกซีรีส์โมเดลออกจากระดับความสามารถ ผลการทดสอบเบนช์มาร์ค — โดยเฉพาะคะแนนการเขียนโค้ดที่ล้ำสมัยของ Sol บน Terminal-Bench 2.1 และประสิทธิภาพที่เพิ่มขึ้นบน ExploitBench — แสดงให้เห็นถึงความก้าวหน้าที่มีความหมาย โดยเฉพาะในด้านความปลอดภัยทางไซเบอร์และชีววิทยา แต่ลักษณะที่กำหนดมากที่สุดของการเปิดตัวครั้งนี้อาจเป็นข้อจำกัดการเข้าถึงที่รัฐบาลกำหนด ซึ่งแสดงถึงกระบวนทัศน์ใหม่สำหรับการปรับใช้ AI แนวหน้า