ในทางกลับกัน Gemini 3.7 Flash ที่เปิดตัวเมื่อวันที่ 13 สิงหาคม มาพร้อมราคาเปิดตัวที่ถูกมาก: $0.75 ต่อล้านโทเค็นขาเข้า และ $3.75 ต่อล้านโทเค็นขาออก ซึ่งถูกกว่า Grok 4.6 เกือบสามเท่า และเป็นครึ่งหนึ่งของรุ่นก่อนหน้าอย่าง Gemini 3.6 Flash อย่างไรก็ตาม ราคาพิเศษนี้ใช้ได้ถึงสิ้นปี 2026 เท่านั้น หลังจากนั้นราคาจะกลับมาเป็นเท่าตัว
Grok 4.6 ทำคะแนน 61 บนดัชนี AA Intelligence Index ซึ่งเป็นการรวมคะแนนจาก 9 เกณฑ์ชี้วัด เทียบเท่า GPT-5.6 Sol Max (61) ตามหลัง Claude Fable 5 Max (62) เพียงแต้มเดียว และ Claude Opus 5 Max (63) สองแต้ม
| Benchmark | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
จุดเด่นที่แท้จริงของ Grok 4.6 คือ งานที่ต้องใช้ความรู้เฉพาะทาง (Knowledge Work) โดยมันทำคะแนนนำใน GDPval-AA v2 (1753 Elo) และ AA-Briefcase (1577) แต่กระนั้น สำหรับโมเดลที่ถูกวางตำแหน่งเป็นโมเดลโค้ดดิ้ง มันกลับมีคะแนน CursorBench v3.2 (69.9%) ตามหลัง Fable 5 Max (70.5%) เล็กน้อย แม้จะชนะ GPT-5.6 Sol Max (67.2%)
สำหรับ Gemini 3.7 Flash แม้จะเน้นราคาถูก แต่ประสิทธิภาพก็ไม่ธรรมดา โดยทำคะแนน FrontierCode v1.1 ได้ 43.6% สำหรับการสร้างโค้ดที่พร้อมผลิต ดีกว่า Claude Sonnet 5 (42.7%) และ GPT-5.6 Terra (41.3%) และยังมีคะแนนพุ่งกระฉูดใน DeepSWE v1.1 (49.0% เป็น 65.3%) และ AutomationBench (17.0% เป็น 30.4%)
การอัปเกรดครั้งใหญ่ของ Grok 4.6 คือการเพิ่มระดับการคิดแบบ xhigh ซึ่งเป็นโหมดใช้ความคิดอย่างหนักหน่วงสำหรับงาน Agentic และ Coding ที่ยากที่สุด โมเดลนี้ถูกปรับแต่งให้ ทนทานกับ Agent ระยะยาว โดยสามารถแก้ปัญหาต่างๆ ได้ในจำนวนรอบการคิดเพียงครึ่งเดียวของ Claude Opus 5 และใช้โทเค็นขาเข้าเพียงหนึ่งในสี่
SpaceXAI บอกว่า การปรับปรุงครั้งนี้มาจากการเทรนเสริมที่ยาวนานขึ้นและการปรับปรุง Supervised Fine-Tuning และ Reinforcement Learning ไม่ใช่การเพิ่มพารามิเตอร์แต่อย่างใด โดยยังคงใช้รากฐาน V9 ขนาด 1.5 ล้านล้านพารามิเตอร์เหมือน Grok 4.5
จุดแข็ง
ข้อจำกัด
เพียงสองวันหลังจากเปิดตัว Grok 4.6 ก็ถูกนำไปรวมกับ GitHub Copilot บนทุกแพลตฟอร์มการพัฒนาหลัก สามารถเลือกใช้ได้บน Pro, Pro+, Max, Business และ Enterprise และเลือกได้จาก 8 พื้นผิวการพัฒนา เช่น VS Code, Visual Studio, JetBrains IDEs และอื่นๆ การผสานรวมที่รวดเร็วนี้สะท้อนให้เห็นถึงความต้องการของนักพัฒนาที่มีต่อโมเดลนี้เป็นอย่างมาก
Grok 4.6 ประสบความสำเร็จในการนำ SpaceXAI กลับมาสู่แถวหน้าของวงการ AI ด้วยคะแนนเทียบเท่า GPT-5.6 Sol ในราคาที่ถูกกว่าอย่างมีนัยสำคัญ โดยเฉพาะอย่างยิ่งประสิทธิภาพที่เหนือชั้นในงาน Agentic อย่างไรก็ตาม การที่ Google ตอบโต้ภายใน 24 ชั่วโมงด้วย Gemini 3.7 Flash ที่ราคาถูกกว่ากว่าเกือบสามเท่า ทำให้ภาพรวมของตลาด AI ในตอนนี้คือการแบ่งขั้วอย่างชัดเจนระหว่าง: โมเดลระดับแนวหน้าในราคาลด (Grok 4.6) กับโมเดลระดับ Workhorse ที่ราคาถูกมาก (Gemini 3.7 Flash) นักพัฒนาต้องเลือกระหว่างคุณค่าที่แตกต่างกันอย่างสิ้นเชิง แต่หนึ่งในนั้น (Grok 4.6) ได้รับการตอบรับที่ดีเยี่ยมจากนักพัฒนาผ่าน GitHub Copilot แล้ว