Inherent’e göre 27 milyar parametreli Qwen 3.6 modeliyle çalışan Faraday, yayımlanmış bilimsel araştırmaların sonuçlarını bağımsız biçimde yeniden üretme görevinde Claude Opus 4.8 ve GPT 5.5’i geride bıraktı. Faraday’ın farkı yalnızca doğrulukta değil; pekiştirmeli öğrenmeyle hangi deneylerin yapılacağına ve nasıl t...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Londra’da kurulan ve eski Google DeepMind araştırmacıları tarafından yönetilen yapay zekâ laboratuvarı Inherent, yeni araştırma ajanı Faraday’ın belirli bir bilimsel görevde Anthropic’in Claude Opus 4.8 ve OpenAI’ın GPT-5.5 modellerini geride bıraktığını söylüyor. Görev, yayımlanmış bilimsel makalelerdeki bulguları, doğru yanıt önceden verilmeden bağımsız biçimde yeniden üretmekti. 25
Bu iddianın dikkat çekici tarafı, Faraday’ın karşılaştırıldığı sistemlerden çok daha küçük bir temel model üzerine kurulması. Faraday, 27 milyar parametreli Qwen 3.6 modelini kullanıyor. 15 Ancak kapsamı doğru koymak gerekiyor: Bu sonuç, Inherent’in bildirdiği belirli bir makale yeniden üretme değerlendirmesine ait. Faraday’ın genel anlamda Claude veya GPT-5.5’ten daha yetenekli olduğu bağımsız olarak kanıtlanmış değil.
Karşılaştırmanın odağında bilimsel araştırma sonuçlarının yeniden üretilmesi vardı. Bir yapay zekâ ajanı, yayımlanmış bir çalışmayı inceleyip yöntemi anlamaya, hipotezler kurmaya, deneyleri yeniden tasarlamaya ve elde ettiği sonuçları makaledeki bulgularla karşılaştırmaya çalışıyor. Bu, bir makaleyi özetlemekten veya bilinen bir soruya yanıt vermekten daha kapsamlı bir süreç.
Teknik değerlendirmeye ilişkin bir kaynak, Replica testini bilimsel şekilleri yeniden üretmeye odaklanan 310 görevlik bir kıyaslama olarak tanımlıyor. 8 Bu ayrıntı önemli: Belirli ve dar kapsamlı bir araştırma iş akışında başarılı olmak; modelin genel muhakeme, yazılım geliştirme, yazma ya da özgün bilimsel keşif alanlarında da otomatik olarak üstün olduğu anlamına gelmiyor.
Yapay zekâ yarışında model boyutu genellikle önemli bir avantaj olarak görülüyor. Inherent’in anlatısında ise daha küçük bir modelin, doğru eğitim ve araçlarla özel bir görevde çok daha büyük sistemlerle rekabet edebileceği gösterilmeye çalışılıyor. Faraday’ın temelinde 27 milyar parametreli Qwen 3.6 bulunurken, karşılaştırılan Claude Opus 4.8 ve GPT-5.5, daha büyük ve öncü sınıf sistemler olarak sunuluyor. 15
Buradan çıkarılacak sonuç, Qwen 3.6’nın tek başına tüm alanlarda rakiplerini geride bıraktığı değil. Faraday bir “ajan sistemi”: başarısı, temel modelin yanı sıra sonradan yapılan eğitim, araştırma iş akışı, araç kullanımı ve planlama ile uygulama arasındaki görev paylaşımına bağlı.
Başka bir deyişle, küçük bir temel model etrafında belirli bir amaca göre optimize edilmiş güçlü bir sistem kurmak, her durumda daha büyük bir model eğitmekten daha etkili olabilir. Inherent’in stratejik bahsi de burada yatıyor.
Inherent, Faraday’a yalnızca doğru yanıt üretmeyi değil, “research taste” olarak adlandırdığı araştırma sezgisini kazandırmaya çalıştığını belirtiyor. Bu ifade; hangi deneylerin yapılmaya değer olduğunu, deneylerin nasıl tasarlanacağını, sonuçların ne zaman yetersiz kaldığını ve hangi noktada yön değiştirmek gerektiğini değerlendirme becerisini anlatıyor. 4
Şirket bu davranışı geliştirmek için pekiştirmeli öğrenmeden yararlandığını söylüyor. Modelin her adımını önceden tarif etmek yerine, yürüttüğü araştırma sürecinin ve ulaştığı sonucun kalitesi ödüllendiriliyor. Bu yaklaşım, doğru cevabın baştan tanımlandığı kısa yanıtlı kıyaslamaları optimize etmekten farklı.
Faraday’ın her teknik adımı kendisinin gerçekleştirmesi de gerekmiyor. Ajan, OpenAI’ın GPT-5.5 Codex’i gibi kodlama araçlarından yararlanabiliyor. Bu düzende Faraday daha çok bir araştırma yöneticisi gibi çalışıyor: Bilimsel planı ve muhakemeyi sağlıyor, uzmanlaşmış kodlama ajanları ise planı çalıştırılabilir deneylere dönüştürmeye yardımcı oluyor. 6
Dolayısıyla bildirilen başarı, yalnızca 27 milyar parametreli temel modelin başarısı olarak okunmamalı. Sonuç, Faraday’ın planlama, karar verme ve dış araçları kullanma becerilerini bir araya getiren bütün iş akışına ait.
Bir bilimsel sonucu yeniden üretmek, yapay zekâ ajanını araştırmanın pratik tarafıyla karşı karşıya bırakıyor. Ajanın makaleyi yorumlaması, yöntemin arkasındaki varsayımları anlaması, deneyler seçmesi, başarısız denemelerle başa çıkması ve sonuçlarını yayımlanmış bulgularla karşılaştırması gerekiyor.
Inherent’in temel varsayımı şu: Yayımlanmış bir makale, sonuca ulaşmak için harcanan emeğin yalnızca görünen bölümünü anlatıyor. Deneme-yanılmalar, rafa kaldırılan yaklaşımlar ve araştırmacıların süreç içinde yaptığı pratik seçimler çoğu zaman makalenin dışında kalıyor. Bu görünmeyen süreci yeniden kurmaya çalışmak, bilimsel muhakeme için kontrollü bir antrenman alanı sağlayabilir. 5
Yeniden üretim görevlerinin bir başka avantajı da ölçülebilir olmaları. Ajanın başarısı, yayımlanmış sonucu tekrar elde edip edemediği ve deney kararlarının bilimsel açıdan savunulabilir olup olmadığı üzerinden değerlendirilebiliyor. Bu da henüz yanıtı bilinmeyen sorularla özgün araştırma yapmasından önce, yapay zekâya verilebilecek daha kontrollü bir aşama sunuyor.
Inherent, makale yeniden üretimini nihai hedef olarak görmüyor. Şirket Faraday’ı, farklı bilim alanlarında çalışabilecek ve zamanla gerçekten yeni bilgi üretmeye yardımcı olabilecek yapay zekâ bilim insanlarına doğru atılmış erken bir adım olarak konumlandırıyor. 13
Ancak bu, tek bir kıyaslama galibiyetinden çok daha büyük bir hedef. Yayımlanmış bir sonucu yeniden üretmek, yararlı araştırma davranışlarının varlığını gösterebilir; özgün keşif ise değerli ve yanıtsız soruları belirlemeyi, yeni hipotezler kurmayı, güvenilir testler tasarlamayı ve sonuçları bilimsel incelemeye dayanıklı hâle getirmeyi gerektirir.
Bu nedenle Faraday değerlendirmesi, söz konusu yolculuğun bir bölümüne ilişkin kanıt olarak görülmeli. Yapay zekânın otonom biçimde bilimsel keşif yaptığına dair kesin bir kanıt olarak değil.
Inherent, gizlilik döneminden yaklaşık 50 milyon dolarlık tohum yatırımıyla çıktı ve çalışmalarını Londra’da sürdürüyor. 5 Şirketin yaklaşık bir düzine kişilik ekibini 20–25 kişiye çıkarmayı planladığı aktarılıyor. Bu yaklaşım, dünyanın en büyük yapay zekâ laboratuvarlarıyla çalışan sayısı veya model eğitim bütçesi üzerinden yarışmak yerine, küçük ve yoğun araştırma odaklı bir ekip kurma stratejisine işaret ediyor.
Şirketin kurucu ortağı ve baş bilim insanı Edward Hughes, Birleşik Krallık’taki “garden leave” uygulamalarını eleştirdi. Bu uygulama, iş değiştiren çalışanların mevcut işlerinden ayrıldıktan sonra belirli bir süre çalışmadan beklemesini gerektirebiliyor; dolayısıyla deneyimli araştırmacıların başka şirketlere veya girişimlere geçişini yavaşlatabiliyor. Inherent, daha yüksek kaynaklara sahip şirketlerle, DeepMind gibi kurumlardan deneyimli yapay zekâ yeteneklerini çekme yarışında bunun rekabet dezavantajı oluşturduğunu düşünüyor. 6
Ortaya çıkan strateji ölçekten çok odaklanmaya dayanıyor: Küçük bir ekip, pekiştirmeli öğrenme, bilimsel karar verme ve giderek güçlenen dış kodlama araçları. Bu yaklaşım, başlangıçtaki testin ötesinde de işe yararsa, girişimlerin piyasadaki en büyük genel amaçlı modeli eğitmeden yapay zekâ araştırmalarında rekabet etmesinin alternatif bir yolunu sunabilir.
Inherent, Qwen 3.6 tabanlı ve yalnızca 27 milyar parametre kullanan Faraday’ın, yayımlanmış bilimsel bulguları bağımsız biçimde yeniden üretme görevinde GPT-5.5 ile Claude Opus 4.8’den daha iyi performans gösterdiğini söylüyor. 58
Asıl önemli fikir ise küçük bir modelin büyük bir modeli yenmesinden ibaret değil. Bilimsel çalışmalarda araştırma planlaması, uzun vadeli pekiştirmeli öğrenme ve araçları doğru biçimde koordine etme becerisi, ham model boyutu kadar belirleyici olabilir.
Şimdilik kanıtların desteklediği daha dar sonuç şu: Faraday, Inherent’in değerlendirdiği araştırma ajanı görevinde umut vadeden bir sistem. Ancak bu sonuç, Anthropic veya OpenAI modellerine karşı genel bir üstünlük göstermiyor; makale yeniden üretimi de tek başına otonom bilimsel keşif anlamına gelmiyor.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent’e göre 27 milyar parametreli Qwen 3.6 modeliyle çalışan Faraday, yayımlanmış bilimsel araştırmaların sonuçlarını bağımsız biçimde yeniden üretme görevinde Claude Opus 4.8 ve GPT 5.5’i geride bıraktı.
Inherent’e göre 27 milyar parametreli Qwen 3.6 modeliyle çalışan Faraday, yayımlanmış bilimsel araştırmaların sonuçlarını bağımsız biçimde yeniden üretme görevinde Claude Opus 4.8 ve GPT 5.5’i geride bıraktı. Faraday’ın farkı yalnızca doğrulukta değil; pekiştirmeli öğrenmeyle hangi deneylerin yapılacağına ve nasıl tasarlanacağına karar verme becerisi, yani şirketin ifadesiyle “araştırma sezgisi”, kazandırılmaya çalışıldı.
Inherent, makale yeniden üretimini gelecekte farklı alanlarda yeni bilimsel bilgi üretebilecek yapay zekâ bilim insanlarına giden yolda bir eğitim aşaması olarak görüyor.