Perbandingan Penanda Aras AI Terkini: GPT‑5.5, Claude Opus 4.7, Gemini 3.5 Flash, Grok 4.3, dan DeepSeek V4
GPT‑5.5 mendahului secara menyeluruh dalam penanda aras ejenik dan kerja pengetahuan seperti Terminal‑Bench 2.0 (82.7%) dan GDPval (84.9%), menjadikannya pilihan serba boleh yang paling selamat. Claude Opus 4.7 mengatasi model lain dalam pengekodan dunia sebenar, dengan skor 64.3% pada SWE‑Bench Pro dan 87.6% pada S...
Diterbitkan olehDisunting dengan GPT-5.5Imej dijana dengan GPT Image 2
GPT‑5.5 mendahului secara menyeluruh dalam penanda aras ejenik dan kerja pengetahuan seperti Terminal‑Bench 2.0 (82.7%) dan GDPval (84.9%), menjadikannya pilihan serba boleh yang paling selamat.
Claude Opus 4.7 mengatasi model lain dalam pengekodan dunia sebenar, dengan skor 64.3% pada SWE‑Bench Pro dan 87.6% pada SWE‑Bench Verified—pilihan terbaik untuk ejen perisian.
Gemini 3.5 Flash mengejutkan ramai: walaupun model pantas, ia mencapai 76.2% pada Terminal‑Bench 2.1, hampir menyamai GPT‑5.5 dan mengatasi Claude Opus 4.7 pada penanda aras yang sama.
Grok 4.3 menawarkan tetingkap konteks 1 juta token dan harga yang kompetitif ($1.25/juta token input), tetapi bukti awam yang setanding dengan model utama adalah terhad.
Research benchmarks for Gemini 3.5 Flash, GPT-5.5, Claude Opus 4.7, Grok 4.3, DeepSeek 4 and compare them as comprehensively as possiblePublic benchmark results across coding, agentic workflows, and knowledge tasks show different strengths among leading 2026 AI models.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: Research benchmarks for Gemini 3.5 Flash, GPT-5.5, Claude Opus 4.7, Grok 4.3, DeepSeek 4 and compare them as comprehensively as possible. Article summary: The strongest broad benchmark package among the models you named is GPT-5.5, based on published numbers for Terminal-Bench 2.0, GDPval, and OSWorld-Verified.. Topic tags: deepresearch, government, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# DeepSeek V4 vs Claude Opus 4.7 vs GPT-5.5: Frontier Model Showdown. We compare DeepSeek V4-Pro, Claude Opus 4.7, and GPT-5.5 across coding, reasoning, agentic tasks, pricing, and" source context "DeepSeek V4 vs Claude Opus 4.7 vs GPT-5.5: Benchmarks & Pricing" Reference image 2: visual subject "# Google’s Gemini 3.5 Flash scores within two point
openai.com
Penanda aras model bahasa besar bergerak pantas, dan membandingkan model daripada syarikat berbeza jarang sekali mudah. Makmal berbeza menerbitkan keputusan pada versi penanda aras yang berbeza, menggunakan peralatan penilaian dan tetapan penaakulan yang berlainan.
Namun, data awam yang mencukupi wujud untuk memberikan gambaran perbandingan yang boleh dipercayai bagi lima model utama 2026: GPT‑5.5 (OpenAI), Claude Opus 4.7 (Anthropic), Gemini 3.5 Flash (Google DeepMind), Grok 4.3 (xAI), dan DeepSeek V4 (DeepSeek). Hasilnya mendedahkan pasaran di mana satu model memimpin secara meluas, satu lagi mendominasi penanda aras pengekodan, dan model "flash" menghampiri keupayaan model perdana secara mengejutkan.
Gambaran Penanda Aras Terkini (2026)
Merentasi penanda aras ejenik dan kerja pengetahuan yang paling banyak dirujuk, GPT‑5.5 kini memegang pakej penanda aras awam keseluruhan yang paling kukuh. OpenAI melaporkan keputusan termasuk 82.7% pada Terminal‑Bench 2.0, 84.9% pada GDPval, dan 78.7% pada OSWorld‑Verified, semuanya penilaian yang direka untuk mengukur kerja pelbagai langkah yang kompleks seperti pengekodan terminal, tugas pengetahuan profesional, dan operasi komputer.
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Perbandingan Penanda Aras AI Terkini: GPT‑5.5, Claude Opus 4.7, Gemini 3.5 Flash, Grok 4.3, dan DeepSeek V4"?
GPT‑5.5 mendahului secara menyeluruh dalam penanda aras ejenik dan kerja pengetahuan seperti Terminal‑Bench 2.0 (82.7%) dan GDPval (84.9%), menjadikannya pilihan serba boleh yang paling selamat.
What are the key points to validate first?
GPT‑5.5 mendahului secara menyeluruh dalam penanda aras ejenik dan kerja pengetahuan seperti Terminal‑Bench 2.0 (82.7%) dan GDPval (84.9%), menjadikannya pilihan serba boleh yang paling selamat. Claude Opus 4.7 mengatasi model lain dalam pengekodan dunia sebenar, dengan skor 64.3% pada SWE‑Bench Pro dan 87.6% pada SWE‑Bench Verified—pilihan terbaik untuk ejen perisian.
What should I do next in practice?
Gemini 3.5 Flash mengejutkan ramai: walaupun model pantas, ia mencapai 76.2% pada Terminal‑Bench 2.1, hampir menyamai GPT‑5.5 dan mengatasi Claude Opus 4.7 pada penanda aras yang sama.
Claude Opus 4.7, bagaimanapun, menonjol dalam penanda aras kejuruteraan perisian dunia sebenar. Anthropic melaporkan 64.3% pada SWE‑Bench Pro dan 87.6% pada SWE‑Bench Verified, kedua-dua penanda aras mengukur sama ada model boleh membetulkan isu sebenar dalam repositori sumber terbuka.
Gemini 3.5 Flash Google adalah ketara kerana ia berada lebih rapat dengan model perdana berbanding model "fast inference" yang lain. Dalam jadual penanda aras merentas vendor Google, ia mendapat 76.2% pada Terminal‑Bench 2.1, berbanding 78.2% untuk GPT‑5.5 dan 66.1% untuk Claude Opus 4.7 pada versi penanda aras tersebut.
Grok 4.3 dan DeepSeek V4 lebih sukar untuk dinilai dengan tepat disebabkan perbezaan dalam ketelusan penilaian dan metodologi.
Penanda Aras Pengekodan
Prestasi pengekodan adalah salah satu bidang pembezaan yang paling jelas dalam kalangan model sempadan.
Claude Opus 4.7 mendahului isyarat awam yang paling kukuh di sini. Skor 64.3% pada SWE‑Bench Pro mewakili peningkatan besar berbanding model sebelumnya dan menunjukkan prestasi kukuh dalam menyelesaikan isu GitHub sebenar merentas pelbagai bahasa pengaturcaraan.
GPT‑5.5 OpenAI berprestasi lebih rendah sedikit pada penanda aras tersebut pada 58.6%, tetapi ia berprestasi sangat baik pada tugasan kejuruteraan yang lebih luas seperti aliran kerja berasaskan terminal. Sebagai contoh, Terminal‑Bench 2.0 mengukur automasi baris arahan yang kompleks dan koordinasi alat, di mana GPT‑5.5 mendahului dengan 82.7%.
Gemini 3.5 Flash mencapai 55.1% pada SWE‑Bench Pro, keputusan yang sederhana berbanding Opus 4.7 tetapi ketara untuk model pantas.
Penanda aras pengekodan awam untuk Grok 4.3 adalah kurang standard. Metrik yang dilaporkan termasuk skor seperti 81% pada IFBench dan 98% pada τ²‑Bench telecom, tetapi penilaian ini mengukur keupayaan yang lebih sempit dan tidak setanding secara langsung dengan SWE‑Bench atau Terminal‑Bench.
Untuk DeepSeek V4, penanda aras pengekodan yang disahkan secara awam masih terhad. Beberapa tuntutan berasal daripada ujian dalaman atau kebocoran dan belum dihasilkan semula secara bebas, menjadikan perbandingan yang boleh dipercayai sukar.
Aliran Kerja Ejenik dan Penggunaan Alat
Penanda aras moden semakin mengukur sejauh mana model menyelaras alat dan melaksanakan tugasan pelbagai langkah.
Google melaporkan bahawa Gemini 3.5 Flash mendahului beberapa penilaian penggunaan alat, termasuk 83.6% pada MCP Atlas dan 56.5% pada Toolathlon, penanda aras yang direka untuk mengukur orkestrasi pelbagai alat dan aliran kerja dunia sebenar.
GPT‑5.5 OpenAI berprestasi kukuh dalam domain yang sama melalui penanda aras seperti GDPval, yang mengukur tugas kerja pengetahuan merentas pelbagai profesion dan menunjukkan 84.9% menang atau seri berbanding model lain.
Claude Opus 4.7 juga berprestasi baik pada penanda aras penggunaan komputer. Skor 78.0% pada OSWorld‑Verified menunjukkan prestasi kukuh dalam mengendalikan antara muka desktop dan berinteraksi dengan alat perisian.
Pertimbangan Tetingkap Konteks, Kelajuan, dan Kos
Penanda aras sahaja tidak menangkap ciri-ciri penggunaan.
Grok 4.3 menekankan pemprosesan konteks panjang dan kecekapan kos. Dokumentasi xAI menyenaraikan tetingkap konteks 1 juta token, bersama harga sekitar $1.25 per juta token input dan $2.50 per juta token output, meletakkannya sebagai pilihan yang berpotensi lebih murah untuk beban kerja konteks besar.
Gemini 3.5 Flash direka sebagai model inferens berkelajuan tinggi dan sering digambarkan sebagai jauh lebih pantas daripada model sempadan sambil kekal kompetitif pada beberapa penanda aras ejenik.
Model DeepSeek biasanya memberi tumpuan kepada strategi penggunaan berat terbuka atau kos lebih rendah, yang boleh menjadikannya menarik untuk organisasi yang ingin menjalankan model berkuasa secara setempat atau pada infrastruktur tersuai.
Penilaian Bebas DeepSeek V4
Penilaian bebas yang paling boleh dipercayai bagi DeepSeek V4 datang daripada program CAISI Institut Piawaian dan Teknologi AS (NIST).
Menurut penilaian tersebut, DeepSeek V4 adalah model China yang paling berkebolehan yang diuji merentas domain seperti kejuruteraan perisian, tugas siber, dan matematik, tetapi ia ketinggalan kira-kira lapan bulan dalam keupayaan berbanding model sempadan terkemuka.
Laporan itu juga menyatakan bahawa keputusan penanda aras dalaman DeepSeek kelihatan lebih kukuh daripada ukuran CAISI yang bebas, menonjolkan kepentingan penilaian neutral dalam membandingkan model merentas makmal.
Mengapa Perbandingan Merentas Model Masih Tidak Sempurna
Walaupun dengan angka yang diterbitkan, membandingkan model secara langsung masih sukar kerana beberapa sebab:
Penanda aras sering muncul dalam versi berbeza (contohnya Terminal‑Bench 2.0 vs 2.1).
Beberapa keputusan datang daripada penilaian yang dijalankan oleh vendor dan bukannya suite ujian bebas.
Indeks komposit dan skor Elo (seperti GDPval‑AA) tidak setanding secara langsung dengan penanda aras berasaskan peratusan.
Oleh kerana isu-isu ini, "pemeringkatan 1‑ke‑5" yang ketat merentas semua model harus ditafsirkan dengan berhati-hati.
Apa yang Dicadangkan oleh Bukti Sekarang
Berdasarkan data awam terkuat yang ada:
GPT‑5.5 nampaknya model yang paling berkebolehan secara meluas merentasi kerja pengetahuan, penaakulan, dan tugas ejenik.
Claude Opus 4.7 kini menunjukkan kelebihan paling jelas dalam penanda aras pengekodan dunia sebenar seperti SWE‑Bench.
Gemini 3.5 Flash adalah luar biasa berkuasa untuk model inferens pantas dan bersaing rapat dengan model perdana dalam beberapa penilaian ejenik.
Grok 4.3 menawarkan panjang konteks yang kukuh dan metrik komposit yang menjanjikan tetapi mempunyai lebih sedikit perbandingan penanda aras piawai dengan model terkemuka.
DeepSeek V4 mewakili model China yang dinilai bebas paling kuat tetapi masih ketinggalan di belakang sempadan semasa menurut analisis NIST.
Dalam amalan, model "terbaik" bergantung kepada beban kerja: ejen pengekodan, pembantu penyelidikan, analisis konteks panjang, dan inferens sensitif kos semuanya boleh memihak kepada model yang berbeza walaupun penanda aras utama yang serupa.