У лютому 2026 року OpenAI офіційно припинив використання SWE bench Verified: внутрішній аудит виявив, що щонайменше 59,4% найскладніших завдань мають тести, які відхиляють правильні рішення. У липні 2026 року OpenAI відкликав власну рекомендацію SWE bench Pro, виявивши, що близько 30% його завдань є «зіпсованими» й...
Research answer

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What led OpenAI to retract its recommendation of SWE-Bench Pro, and how does this retraction fit. Article summary: Here are the findings on the two-phase collapse of OpenAI's SWE-bench benchmarks and the broader pattern of AI coding benchmark erosion.. Topic tags: general, general web, user generated, education, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layo
За сім місяців OpenAI залишив обидва бенчмарки коду, які сам просував. Спочатку, в лютому 2026 року, компанія відмовилася від SWE-bench Verified — бенчмарку, який вона ж і створила, і який став галузевим стандартом. Потім, у липні 2026 року, OpenAI відкликала власну рекомендацію щодо запланованої заміни — SWE-bench Pro. Це подвійне відступання — не просто логістична проблема для розробників систем оцінки. Це сигнал про те, що сам спосіб, яким індустрія ШІ вимірює здатність до програмування, є фундаментально зламаним.
SWE-bench Verified з'явився в серпні 2024 року як ретельно відібрана людськими експертами підмножина оригінального бенчмарку SWE-bench від Принстонського університету. Він містив 500 завдань на Python, взятих із реальних issues на GitHub . Протягом приблизно 18 місяців він слугував головним мірилом того, наскільки добре ШІ-агенти можуть вирішувати реальні програмні проблеми
.
23 лютого 2026 року команда Frontier Evals з OpenAI офіційно припинила використання цього бенчмарку . Причини були нищівними:
Висновок OpenAI був однозначним: «Покращення на SWE-bench Verified більше не відображають значущого прогресу в реальних навичках розробки програмного забезпечення. Вони дедалі більше відображають те, наскільки модель була ознайомлена з бенчмарком під час навчання» .
OpenAI чітко рекомендував SWE-bench Pro — більший бенчмарк, створений компанією Scale AI на основі приватних репозиторіїв та репозиторіїв із вільними ліцензіями — як заміну .
8 липня 2026 року OpenAI оприлюднив результати детального аудиту SWE-bench Pro — того самого бенчмарку, який щойно був названий надійнішою альтернативою. Результати були нищівними :
Це змусило OpenAI відкликати свою рекомендацію щодо використання SWE-bench Pro, залишивши галузь без надійного наступника .
Подвійне відступання OpenAI — не ізольований випадок. Це частина системної кризи в тому, як сфера ШІ оцінює здатність до написання коду:
Подвійне відступання OpenAI — спочатку відмова від власного бенчмарку, а потім дискредитація його заміни — залишило ландшафт оцінки коду ШІ без довіреного лідера. Спільнота дедалі більше визнає, що високі бали на бенчмарках більше не є надійним прогнозом того, чи може ШІ-агент впоратися з реальними завданнями розробки програмного забезпечення . Нові методології оцінки — такі як спеціалізовані, змагальні або постійно оновлювані бенчмарки — є нагально необхідними, але ще не дозріли
.
Наразі кожен, хто намагається оцінити ШІ-агента коду, не має жодного єдиного стандарту, якому можна довіряти. Крах SWE-bench Verified та SWE-bench Pro — це не просто історія про два вадиві тести. Це історія про галузь, яка будувала швидше, ніж могла виміряти.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
У лютому 2026 року OpenAI офіційно припинив використання SWE bench Verified: внутрішній аудит виявив, що щонайменше 59,4% найскладніших завдань мають тести, які відхиляють правильні рішення.
У лютому 2026 року OpenAI офіційно припинив використання SWE bench Verified: внутрішній аудит виявив, що щонайменше 59,4% найскладніших завдань мають тести, які відхиляють правильні рішення. У липні 2026 року OpenAI відкликав власну рекомендацію SWE bench Pro, виявивши, що близько 30% його завдань є «зіпсованими» й непридатними для оцінки.
Проблема є системною: бенчмарки, зібрані з публічних репозиторіїв, дедалі більше вимірюють запам’ятовування, а не реальні навички програмування, що створює кризу довіри до показників ШІ.