Model radzi sobie również znakomicie w benchmarkach pracy intelektualnej: GDPval ocenia zadania w kilkudziesięciu profesjach, w tym prawie, finansach i zarządzaniu produktem. GPT‑5.5 dorównuje lub przewyższa profesjonalistów w około 84,9% porównań.
Razem liczby te sugerują, że GPT‑5.5 jest szczególnie silny w autonomicznych, wieloetapowych zadaniach i agentowych przepływach pracy.
Claude Opus 4.7 od Anthropic jest powszechnie uważany za jeden z najmocniejszych modeli do zadań inżynierii oprogramowania.
Jego najważniejsze wyniki benchmarków:
SWE‑bench ocenia, czy model potrafi naprawić prawdziwe błędy w repozytoriach open‑source. Opus 4.7 rozwiązujący 87,6% zadań SWE‑bench Verified to znacząca poprawa w stosunku do poprzednika i plasuje go wśród najlepszych modeli dla agentów kodujących.
Choć jego wynik w Terminal‑Bench jest niższy niż GPT‑5.5, to kodowe benchmarki pozostają jednymi z najmocniejszych w publicznych porównaniach.
Gemini 3.5 Flash od Google jest nietypowy, ponieważ jest pozycjonowany jako szybki, ekonomiczny model, a nie flagowiec — a mimo to osiąga konkurencyjne wyniki w kilku agentowych benchmarkach.
Raportowane wyniki:
Google twierdzi, że model działa około cztery razy szybciej niż porównywalne modele z czołówki, jednocześnie przewyższając wcześniejszego Gemini 3.1 Pro w kilku agentowych i kodowych benchmarkach.
W praktyce główną zaletą Gemini 3.5 Flash jest kompromis między szybkością a możliwościami: osiąga wyniki bliskie flagowym modelom, celując w niskie opóźnienia i obciążenia produkcyjne.
DeepSeek V4 jest godny uwagi, ponieważ jest to jeden z najbardziej zaawansowanych modeli z otwartymi wagami, jakie do tej pory wydano.
Rodzina modeli obejmuje dwa warianty:
Według raportu technicznego modelu i podsumowań jego benchmarków, V4‑Pro w trybie maksymalnego wnioskowania osiąga:
Wyniki te plasują go blisko czołowych zastrzeżonych modeli w niektórych benchmarkach kodowania.
Jednak niezależna ocena programu CAISI amerykańskiego Narodowego Instytutu Standardów i Technologii (NIST) wykazała, że możliwości modelu pozostają w tyle za czołówką o około osiem miesięcy, co podkreśla lukę między wynikami raportowanymi przez twórców a niezależnymi testami.
Grok 4.3 od xAI to duży skok w porównaniu z wcześniejszymi modelami Grok, zwłaszcza w benchmarkach zadań agentowych.
Opublikowane liczby:
Skok o ponad 300 Elo w GDPval‑AA w porównaniu z wcześniejszymi wersjami Grok sugeruje znaczący postęp w automatyzacji rzeczywistych zadań.
Mimo to analizy zewnętrzne zazwyczaj plasują model poniżej najnowszych systemów OpenAI i Anthropic pod względem ogólnych benchmarków możliwości.
Patrząc na te oceny, wyłania się spójny obraz:
Wnioski te należy jednak traktować jako orientacyjne, a nie ostateczne, ponieważ każdy producent podkreśla inne zestawy testów.
Porównania benchmarków we współczesnej SI są coraz bardziej skomplikowane z kilku powodów:
Z tych powodów prawdziwy względny ranking modeli z czołówki często staje się jasny dopiero po miesiącach niezależnych testów.
Najnowsze dowody z benchmarków nie wskazują jednego modelu dominującego we wszystkich obszarach.
Zamiast tego obecna czołówka wydaje się wyspecjalizowana:
W miarę jak niezależne benchmarki będą się ujednolicać i pojawi się więcej testów porównawczych, dokładne uszeregowanie tych systemów będzie prawdopodobnie nadal ewoluować.