OpenAI’ın Codex “Harness” iddiası doğrulanmadı; ancak bağlam yönetimi ARC-AGI-3 skorunu üçe katladı
Sunulan yetkili kaynaklar, 20 Ağustos’ta Apache 2.0 lisanslı yeni bir Codex “Harness” yayımlandığını doğrulamıyor; ancak Codex’in planlama, kod düzenleme, test etme, gözlemleme ve hataları giderme döngüsünü belgeliyor. Codex kod okuyup değiştirebiliyor, çalıştırabiliyor; bulutta paralel ve arka planda görev yürütebi...
Sunulan yetkili kaynaklar, 20 Ağustos’ta Apache 2.0 lisanslı yeni bir Codex “Harness” yayımlandığını doğrulamıyor; ancak Codex’in planlama, kod düzenleme, test etme, gözlemleme ve hataları giderme döngüsünü belgeliyor.
Codex kod okuyup değiştirebiliyor, çalıştırabiliyor; bulutta paralel ve arka planda görev yürütebiliyor.
Sunulan kaynaklarda söz konusu Apache lisanslı çerçeveyi benimseyen şirketlerin isimleri veya kod dışı iş akışlarına ilişkin ölçülmüş sonuçlar yer almıyor.
What did OpenAI release on August 20 under the Apache 2.0 license as the core execution framework behind its Codex coding agent, what componThe key distinction is between Codex’s documented agent runtime and the unverified claim of a new Apache 2.0 Harness release.
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What did OpenAI release on August 20 under the Apache 2.0 license as the core execution framework behind its Codex coding agent, what compon. Article summary: ## What was released Insufficient evidence supports the claimed August 20 Apache 2.0 release of an OpenAI “Harness” as a named, open-source Codex execution framework. The available official material does confirm Codex’s . Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
openai.com
Codex’in “Harness”ı hakkında hangi bilgiler doğrulanıyor?
OpenAI’ın 20 Ağustos’ta Apache 2.0 lisanslı, “Harness” adı verilen yeni bir açık kaynak yürütme çerçevesi yayımladığı iddiası, burada sunulan yetkili kaynaklarla doğrulanmıyor. Bu iddia ikincil bir haberde yer alıyor; resmî kaynaklar ise Codex’in temel çalışma döngüsünü, farklı ürün yüzeyleriyle entegrasyonunu ve çalışma zamanındaki durum yönetiminin model performansını nasıl etkileyebildiğini açıklıyor .
Codex, tek seferlik bir isteme yanıt veren bir modelden daha fazlası olarak tasarlanıyor. Belgelenen temel ajan döngüsü kabaca şöyle ilerliyor:
Görevi planlama
Kodu düzenleme
Test, derleme veya lint gibi araçları çalıştırma
Sonuçları gözlemleme
Hataları giderme
Dokümantasyonu ya da görev durumunu güncelleme
Gerekiyorsa döngüyü tekrarlama
Bu süreç; modelin, kullanıcının talimatlarının, kod değişikliklerinin, araç çağrılarının ve yürütme ortamından gelen geri bildirimlerin koordinasyonunu sağlıyor . Codex kod okuyabiliyor, değiştirebiliyor ve çalıştırabiliyor. Bulut tabanlı iş akışlarında birden fazla görevi paralel olarak, arka planda ve gerektiğinde proaktif biçimde yürütebiliyor .
OpenAI’ın Codex App Server açıklaması da mimarinin doğrulanmış bir başka parçasını ortaya koyuyor. App Server, Codex’in ortak ajan mantığını web uygulaması, komut satırı arayüzü, IDE eklentisi ve macOS uygulaması gibi farklı kullanım yüzeylerine bağlayan çift yönlü bir JSON-RPC API’si sunuyor . Codex CLI ise geliştiricilerin inceleyip uyarlayabileceği açık kaynaklı bir referans uygulaması olarak tanımlanıyor. Geliştiriciler modeli doğrudan API üzerinden kullanabiliyor veya daha kolay entegrasyon için Codex SDK’dan yararlanabiliyor .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "OpenAI’ın Codex “Harness” iddiası doğrulanmadı; ancak bağlam yönetimi ARC-AGI-3 skorunu üçe katladı"?
Sunulan yetkili kaynaklar, 20 Ağustos’ta Apache 2.0 lisanslı yeni bir Codex “Harness” yayımlandığını doğrulamıyor; ancak Codex’in planlama, kod düzenleme, test etme, gözlemleme ve hataları giderme döngüsünü belgeliyor.
What are the key points to validate first?
Sunulan yetkili kaynaklar, 20 Ağustos’ta Apache 2.0 lisanslı yeni bir Codex “Harness” yayımlandığını doğrulamıyor; ancak Codex’in planlama, kod düzenleme, test etme, gözlemleme ve hataları giderme döngüsünü belgeliyor. Codex kod okuyup değiştirebiliyor, çalıştırabiliyor; bulutta paralel ve arka planda görev yürütebiliyor.
What should I do next in practice?
Sunulan kaynaklarda söz konusu Apache lisanslı çerçeveyi benimseyen şirketlerin isimleri veya kod dışı iş akışlarına ilişkin ölçülmüş sonuçlar yer almıyor.
Bu kaynaklar, modelin çevresinde araçları, durumu, geri bildirimleri ve farklı arayüzleri bir araya getiren pratik bir yürütme katmanına işaret ediyor. Ancak tek başlarına, OpenAI’ın 20 Ağustos’ta “Harness” adıyla yeni bir paketi Apache 2.0 lisansıyla yayımladığını kanıtlamıyor.
Hangi noktalar doğrulanmış değil?
Sunulan kanıtlar şu iddiaları kesinleştirmiyor:
20 Ağustos’ta gerçekten böyle bir sürüm yayımlandığını;
sürümün resmî adının “Harness” olduğunu;
Apache 2.0 lisansıyla dağıtıldığını;
iddia edilen pakete tam olarak hangi bileşenlerin dahil edildiğini;
hangi şirketlerin bunu benimsediğini ve ne sonuçlar elde ettiğini.
İddia,
codex exec
, Codex SDK ve app-server bileşenlerini söz konusu sürümün parçaları olarak tanımlayan ikincil bir haberde yer alıyor . Ancak sunulan resmî kaynaklar bu yetenek ve bileşenleri farklı tarihlerde, farklı bağlamlarda açıklıyor. Bu nedenle, eşleşen bir resmî duyuru veya depo kaydı bulunmadan söz konusu haber yeni bir sürüm için kesin doğrulama olarak kabul edilmemeli.
ARC-AGI-3’te akıl yürütmeyi koruma ve bağlam sıkıştırma neden önemliydi?
Sunulan materyaldeki en net, kaynaklarla desteklenen sonuç ayrı bir OpenAI deneyinden geliyor. GPT-5.6 Sol, ARC-AGI-3’ün herkese açık görev setinde standart Harness kullanıldığında %13,3 puan aldı. Responses API üzerinden akıl yürütmeyi koruma ve bağlam sıkıştırma etkinleştirildiğinde skor %38,3’e yükseldi. Bu, yaklaşık üç katlık bir artış anlamına gelirken çıktı belirteci kullanımı da yaklaşık altı kat azaldı .
Bu karşılaştırmada değiştirilen unsur model ağırlıkları değildi. Kritik fark, çalışma zamanının turlar arasındaki durumu nasıl taşıdığıydı:
Akıl yürütmeyi koruma (retained reasoning): Yararlı ara çıkarımların her adımın ardından silinmek yerine sonraki işlemlere taşınmasını sağladı. Böylece model, yaklaşımını her defasında baştan kurmak zorunda kalmadı.
Bağlam sıkıştırma (context compaction): Etkileşim uzadıkça eski görev geçmişinin tamamen atılması yerine sıkıştırılmış bir durumun korunmasını sağladı.
OpenAI’ın geliştirici rehberi, bu ayarları daha önce yapılan çalışmalardan yararlanmanın ve uzun görevlerde tutarlılığı korumanın yolları olarak sunuyor . Bu nedenle sonuç, yalnızca modelin kapasitesinin ölçümü olarak değil, model ile çalışma zamanının birlikte oluşturduğu sistemin performansı olarak değerlendirilmeli. Aynı modelin yalnızca farklı durum yönetimi ayarlarıyla üç kata yakın daha yüksek skor alması, ajan altyapısının sonuçlar üzerindeki etkisini gösteriyor.
Bununla birlikte önemli bir sınır var: Deney, herkese açık bir değerlendirme setinde iki farklı yürütme yapılandırmasını karşılaştırıyor. Aynı iyileşmenin her ajanda, modelde, iş yükünde veya üretim ortamında tekrarlanacağını kanıtlamıyor.
Geliştiriciler bugün hangi seçenekleri kullanabilir?
En güçlü doğrulanmış çıkarım, doğrulanmamış Apache 2.0 duyurusu değil; OpenAI’ın ajan tabanlı kodlama davranışı etrafında sunduğu entegrasyon seçenekleri:
Doğrudan API erişimi: Codex istem kılavuzu, en yüksek özelleştirme düzeyi için API kullanımını öne çıkarıyor .
Codex SDK: SDK, her arayüzü baştan kurmak istemeyen geliştiriciler için daha basit bir entegrasyon yolu olarak sunuluyor .
Açık kaynaklı CLI referansı: OpenAI, Codex CLI’yi incelenebilecek ve uyarlanabilecek bir referans uygulaması olarak tanımlıyor .
Ajan yürütme döngüsü: Planla–uygula–doğrula–onar modeli, uzun soluklu kodlama görevlerinin temel çalışma biçimini oluşturuyor .
Bulut yürütme: Codex, depolarla çalışabiliyor, kod çalıştırabiliyor ve bulut ortamında arka planda birden fazla görevi paralel yürütebiliyor .
Bu yetenekler, bir ajanı yalnızca genel amaçlı sohbet arayüzüyle sınırlamak yerine doğrudan bir ürünün veya mühendislik sürecinin içine yerleştirmeyi mümkün kılıyor. Geliştiriciler modelin çevresine alana özgü talimatlar, araçlar, izinler, doğrulama adımları ve durum yönetimi ekleyebiliyor. Bu, kaynaklarda görülen doğrulanmış entegrasyon yönü. Buna karşın, tüm bu bileşenleri tek bir Apache lisanslı Harness sürümünde birleştiren 20 Ağustos duyurusu sunulan resmî kaynaklarla doğrulanmış değil.
Benimseme kanıtı, sürüm iddiasından daha dar
Sunulan kaynaklar, iddia edilen Apache lisanslı çerçeveyi benimseyen şirketlerin isimlerini vermiyor. Ayrıca bu şirketlerin hukuk, operasyon, araştırma veya kodlama dışındaki iş akışlarında hangi sonuçları aldığına ilişkin şirket bazlı veriler de bulunmuyor.
Bununla birlikte Codex’in kurumsal müşteriler arasında kullanıldığına dair daha genel bir gösterge mevcut. OpenAI, haziran ayı itibarıyla kurumsal müşterilerde Codex’in, Codex ve ChatGPT’nin toplam çıktı belirteçlerinin %64’ünü oluşturduğunu bildirdi . Bu oran, kurumsal kullanımın önemli ölçekte olduğuna işaret edebilir; ancak iddia edilen Harness paketinin benimsendiğini, belirli şirketlerin hangileri olduğunu veya bunun ticari etkisini kanıtlamaz.
Stratejik açıdan anlamı ne?
Doğrulanmış tablo, sohbet tabanlı yardımdan görev devrine doğru bir yönelime işaret ediyor. Codex; modeli, araçları, yinelemeli geri bildirim döngüsünü, kalıcı ya da sıkıştırılmış durumu ve çok adımlı işleri yürütebilen çalışma ortamlarını bir araya getiriyor .
Ürün ekipleri bu mimariyi yazılım depoları, kurum içi operasyonlar, araştırma görevleri veya kontrollü başka iş akışları için özelleştirilmiş ajanlar geliştirmek üzere kullanabilir. Bu uygulamaların başarısı yalnızca model seçimine bağlı olmayacak. Araç erişiminin, durumun ne kadar süre korunacağının, bağlam sınırlarının, doğrulama süreçlerinin ve hatalardan kurtarma mekanizmalarının nasıl tasarlandığı da belirleyici olacak.
ARC-AGI-3 deneyinin kalıcı dersi burada yatıyor: Harness’i, yani modelin çevresindeki çalışma ve durum yönetimi katmanını değiştirmek hem yeteneği hem de verimliliği değiştirebilir. Ancak mevcut kanıtlara dayanarak, 20 Ağustos’taki Apache 2.0 lisanslı “Harness” sürümünü kesinleşmiş bir gerçek olarak sunmak yerine OpenAI’ın belgelenmiş Codex çalışma zamanı ve API bileşenlerinden söz etmek daha doğru.