Model ini juga berprestasi kukuh pada penanda aras kerja pengetahuan: GDPval menilai tugas merentas berpuluh-puluh profesion termasuk undang-undang, kewangan dan pengurusan produk, di mana GPT‑5.5 sepadan atau mengalahkan profesional dalam kira-kira 84.9% perbandingan.
Secara keseluruhan, angka ini menunjukkan GPT‑5.5 amat kuat dalam tugasan autonomi pelbagai langkah dan aliran kerja ejenik.
Claude Opus 4.7 dari Anthropic dianggap secara meluas sebagai salah satu model terkuat untuk tugas kejuruteraan perisian.
Keputusan penanda aras paling menonjol termasuk:
SWE‑bench menilai sama ada model boleh membetulkan pepijat sebenar dalam repositori sumber terbuka. Keupayaan Opus 4.7 menyelesaikan 87.6% tugas SWE‑bench Verified merupakan peningkatan ketara berbanding pendahulunya dan meletakkannya antara model terbaik untuk ejen pengekodan.
Walaupun skor Terminal‑Benchnya di belakang GPT‑5.5, penanda aras berpusat pengekodannya kekal antara yang terkuat dalam perbandingan awam.
Gemini 3.5 Flash dari Google agak luar biasa kerana ia diposisikan sebagai model pantas dan cekap kos dan bukannya model utama — namun ia masih mencatatkan keputusan kompetitif pada beberapa penanda aras ejenik.
Keputusan yang dilaporkan termasuk:
Google menyatakan model ini berjalan kira-kira empat kali lebih pantas daripada model frontier setanding sambil mengatasi Gemini 3.1 Pro yang lebih awal pada beberapa penanda aras ejen dan pengekodan.
Dalam amalan, kekuatan utama Gemini 3.5 Flash ialah pertukaran kelajuan-keupayaan: ia memberikan keputusan penanda aras hampir setanding model utama sambil menyasarkan kependaman rendah dan beban kerja pengeluaran.
DeepSeek V4 menonjol kerana ia merupakan salah satu model sumber terbuka paling berkemampuan yang dikeluarkan setakat ini.
Keluarga model ini merangkumi dua varian:
Menurut laporan teknikal model dan ringkasan penanda arasnya, V4‑Pro dalam mod penaakulan maksimum mencapai:
Keputusan ini meletakkannya hampir dengan model proprietari terkemuka dalam beberapa penanda aras pengekodan.
Walau bagaimanapun, penilaian bebas oleh program CAISI Institut Piawaian dan Teknologi Amerika Syarikat (NIST) mendapati keupayaan model ini ketinggalan di belakang frontier kira-kira lapan bulan, menonjolkan jurang antara keputusan yang dilaporkan sendiri dan keputusan bebas.
Grok 4.3 dari xAI mewakili peningkatan besar berbanding model Grok sebelumnya, terutamanya pada penanda aras tugas ejenik.
Angka yang diterbitkan termasuk:
Lonjakan lebih daripada 300 Elo pada GDPval‑AA berbanding versi Grok sebelumnya menunjukkan kemajuan besar dalam automasi tugas dunia sebenar.
Namun, analisis pihak ketiga secara umum meletakkan model ini di bawah sistem OpenAI dan Anthropic terbaharu pada penanda aras keupayaan keseluruhan.
Melihat merentas penilaian ini, corak yang konsisten muncul:
Walau bagaimanapun, kesimpulan ini harus dianggap sebagai arah dan bukannya muktamad kerana setiap vendor menonjolkan set penilaian yang berbeza.
Perbandingan penanda aras dalam AI moden semakin rumit kerana beberapa sebab:
Oleh sebab faktor ini, kedudukan relatif sebenar model frontier selalunya menjadi lebih jelas hanya selepas berbulan-bulan ujian bebas.
Bukti penanda aras terkini tidak menunjukkan satu model yang mendominasi setiap domain.
Sebaliknya, frontier semasa kelihatan khusus:
Apabila penanda aras bebas bertumpu dan lebih banyak ujian setara muncul, susunan tepat sistem ini kemungkinan akan terus berubah.