Отже, джерела дають практичне уявлення про систему: навколо моделі працює середовище виконання з інструментами, пам’яттю стану, зворотним зв’язком і різними інтерфейсами. Але цього недостатньо, щоб підтвердити новий реліз під назвою «Harness» і його ліцензію Apache 2.0 саме 20 серпня.
Надані матеріали не встановлюють:
Вторинний матеріал згадує codex execapp-server як частини нібито випущеного фреймворку . Проте офіційні джерела описують ці можливості та компоненти в різний час і в різних контекстах. Без відповідного офіційного оголошення або запису в репозиторії їх не варто трактувати як підтвердження заявленого релізу.
Найпереконливіший підтверджений результат у наданих матеріалах стосується окремого експерименту OpenAI. На публічному наборі завдань ARC-AGI-3 модель GPT-5.6 Sol набрала 13,3% зі стандартним harness. Після ввімкнення збереження міркувань і стиснення контексту через Responses API результат зріс до 38,3% — приблизно утричі, — а використання вихідних токенів скоротилося приблизно вшестеро .
У цьому порівнянні не йдеться про зміну ваг моделі. Зміни стосувалися того, як середовище виконання передавало стан між послідовними кроками:
У рекомендаціях для розробників OpenAI подає ці налаштування як спосіб повторно використовувати вже виконану роботу та зберігати послідовність під час довгих завдань . Тому цей результат слід розуміти як показник роботи всієї зв’язки «модель плюс середовище виконання», а не як доказ того, що сама модель раптом стала втричі здібнішою.
Важливе й обмеження експерименту: він порівнює дві конфігурації виконання на публічному наборі оцінювання. Це не гарантує такого самого приросту для кожного агента, моделі, типу навантаження чи виробничого середовища.
Найнадійніший практичний висновок стосується не непідтвердженого оголошення Apache 2.0, а доступних способів будувати системи на основі агентної поведінки Codex:
Ці можливості дають змогу вбудовувати агента у власний продукт або інженерний процес, а не обмежувати його загальним чат-інтерфейсом. Розробник може додати спеціалізовані інструкції, інструменти, дозволи, перевірки та механізми збереження стану. Це підтверджений напрям інтеграції, тоді як твердження про єдиний відкритий Apache-фреймворк, який нібито об’єднує всі ці компоненти, залишається без офіційного підтвердження.
Надані джерела не називають компаній, які впровадили саме заявлений Apache-фреймворк, і не містять результатів його використання в юридичних, операційних, дослідницьких чи інших не програмних процесах.
Водночас є ширші дані про використання Codex корпоративними клієнтами. OpenAI повідомляла, що станом на червень Codex генерував 64% сукупного обсягу вихідних токенів Codex і ChatGPT у корпоративних клієнтів . Це свідчить про значну активність підприємств, але не доводить використання ними нібито випущеного пакета «Harness», не називає конкретних компаній і не підтверджує бізнес-ефект.
Підтверджена картина вказує на перехід від чат-помічника до делегованого виконання. Codex поєднує модель, інструменти, ітеративний цикл зі зворотним зв’язком, збереження або стиснення стану та середовища, здатні виконувати роботу в кілька етапів .
Для продуктових команд така архітектура може стати основою спеціалізованих агентів для програмних репозиторіїв, внутрішніх операцій, досліджень або інших контрольованих процесів. Якість таких систем залежатиме не лише від вибору моделі, а й від того, як розробники налаштують доступ до інструментів, збереження стану, обмеження контексту, перевірку результатів і відновлення після помилок.
Саме це — головний урок експерименту ARC-AGI-3: зміна harness може впливати і на можливості, і на ефективність агента. Але з огляду на доступні докази точніше говорити про документоване середовище виконання Codex та його API-компоненти, а не подавати реліз Apache 2.0 «Harness» 20 серпня як встановлений факт.