Inherent mendakwa Faraday, ejen AI berasaskan model Qwen 3.6 dengan 27 bilion parameter, mengatasi Claude Opus 4.8 dan GPT 5.5 dalam menghasilkan semula dapatan kajian yang diterbitkan. Faraday dilatih melalui pembelajaran pengukuhan untuk membina apa yang dipanggil Inherent sebagai “naluri penyelidikan” — keupayaan...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inherent, makmal AI dari London yang diasaskan bekas penyelidik Google DeepMind, mendakwa ejen baharunya, Faraday, mengatasi Claude Opus 4.8 milik Anthropic dan GPT-5.5 OpenAI dalam satu tugas khusus: menghasilkan semula dapatan daripada kertas penyelidikan saintifik secara bebas tanpa diberikan jawapan terlebih dahulu. Keputusan itu menarik perhatian kerana Faraday dibina berasaskan Qwen 3.6, model yang agak kecil dengan 27 bilion parameter, bukannya sistem berskala besar di barisan hadapan industri. 25
Namun, skop dakwaan ini perlu difahami dengan jelas. Keputusan tersebut ialah hasil yang dilaporkan Inherent dalam penilaian pengulangan kajian — bukan bukti bebas bahawa Faraday secara umum lebih berkeupayaan daripada Claude atau GPT-5.5.
Perbandingan itu tertumpu pada pengulangan kajian saintifik. Ejen menerima sebuah kajian yang telah diterbitkan dan perlu membina semula sebahagian besar kerja tersebut untuk menghasilkan dapatan yang sama, bukannya sekadar meringkaskan kertas atau meneka jawapan yang sudah diketahui. Inherent berkata Faraday menunjukkan prestasi lebih baik daripada Claude Opus 4.8 dan GPT-5.5 dalam konteks itu. 5
Menurut laporan teknikal mengenai penilaian tersebut, Replica ialah penanda aras yang merangkumi 310 tugasan untuk menghasilkan semula rajah saintifik. 8 Perincian ini penting kerana kejayaan dalam aliran kerja penyelidikan yang sangat khusus tidak semestinya bermaksud prestasi lebih baik dalam penaakulan umum, pengekodan, penulisan atau penemuan saintifik.
Faraday beroperasi menggunakan Qwen 3.6 dengan 27 bilion parameter. Inherent menekankan perbezaan saiz yang ketara antara model asas Faraday dan sistem lebih besar yang digunakan sebagai perbandingan. 15
Bagaimanapun, mesej Inherent bukanlah bahawa Qwen 3.6 sahaja telah menggantikan semua model AI serba guna terkemuka. Faraday ialah sebuah sistem ejen: hasilnya bergantung pada model asas, latihan pascapembangunan, aliran kerja penyelidikan, penggunaan alat serta pembahagian tugas antara perancangan dan pelaksanaan.
Dengan kata lain, model asas yang lebih kecil masih boleh bersaing dalam tugas tertentu jika keseluruhan sistem di sekelilingnya dioptimumkan untuk tujuan itu. Inilah pertaruhan strategi Inherent — bukannya melatih model serba guna terbesar, tetapi menggunakan model kompak yang lebih baik dalam membuat keputusan saintifik dan menyelaraskan alat khusus.
Inherent menyifatkan keupayaan sasaran itu sebagai “research taste”, atau “naluri penyelidikan”: pertimbangan untuk menentukan eksperimen yang berbaloi, cara mereka bentuk eksperimen, waktu keputusan masih belum meyakinkan dan bila pendekatan perlu diubah. 4
Syarikat itu berkata ia menggunakan pembelajaran pengukuhan untuk membentuk tingkah laku tersebut. Berbanding menetapkan setiap langkah secara terperinci, pendekatan ini memberi ganjaran berdasarkan mutu proses dan hasil penyelidikan pada akhirnya.
Matlamat itu berbeza daripada mengoptimumkan sistem untuk penanda aras soalan pendek yang jawapannya telah ditentukan lebih awal. Dalam penyelidikan sebenar, cabaran utamanya sering terletak pada memilih soalan yang tepat dan memutuskan eksperimen yang patut dijalankan — bukan sekadar memberi jawapan yang betul.
Faraday juga tidak perlu melakukan semua kerja pelaksanaan sendiri. Ia boleh menggunakan ejen pengekodan, termasuk GPT-5.5 Codex daripada OpenAI, sebagai alat. Dalam pembahagian tugas ini, Faraday bertindak seperti pengarah penyelidikan: ia menyediakan perancangan dan pertimbangan saintifik, sementara sistem pengekodan khusus membantu menukar rancangan itu kepada eksperimen yang boleh dijalankan. 6
Oleh itu, kelebihan yang dilaporkan itu lebih tepat dikaitkan dengan keseluruhan aliran kerja ejen Faraday, bukan semestinya model Qwen 3.6 27B secara bersendirian.
Pengulangan kajian memberi AI cara yang konkrit untuk berlatih menjalankan sains. Ejen perlu memahami kertas penyelidikan, membentuk hipotesis tentang kaedah yang digunakan, memilih eksperimen, menangani percubaan yang gagal dan membandingkan hasilnya dengan dapatan yang diterbitkan.
Premis Inherent ialah kertas akhir biasanya hanya menunjukkan sebahagian kecil daripada kerja sebenar. Percubaan dan kesilapan, pendekatan yang diketepikan serta keputusan praktikal yang membawa kepada hasil akhir kebanyakannya tidak dipaparkan. Membina semula proses tersembunyi itu boleh menjadi medan latihan terkawal untuk penaakulan saintifik. 5
Tugas pengulangan juga lebih mudah dinilai berbanding penemuan yang benar-benar baharu. Ia mempunyai sasaran luaran yang jelas: sama ada ejen berjaya menghasilkan semula keputusan yang dilaporkan dan sama ada keputusan eksperimennya munasabah dari sudut sains.
Justeru, ia boleh menjadi langkah perantaraan sebelum AI diminta menyiasat persoalan yang jawapannya masih belum diketahui.
Inherent tidak menganggap pengulangan kertas sebagai destinasi akhir. Syarikat itu melihat Faraday sebagai langkah awal ke arah saintis AI yang boleh bekerja merentas bidang dan akhirnya membantu menghasilkan pengetahuan baharu. 13
Namun, itu ialah dakwaan yang jauh lebih besar daripada sekadar memenangi penanda aras. Sistem yang berjaya menghasilkan semula keputusan kajian menunjukkan keupayaan penyelidikan yang berguna, tetapi penemuan asli memerlukan lebih banyak perkara: mengenal pasti persoalan yang penting tetapi belum terjawab, menghasilkan hipotesis baharu, mereka bentuk ujian yang boleh dipercayai dan menghasilkan dapatan yang mampu bertahan melalui penelitian pakar.
Maka, penilaian Faraday wajar dilihat sebagai bukti bagi satu bahagian dalam perjalanan tersebut — bukan bukti bahawa matlamat saintis AI autonomi sudah tercapai.
Inherent muncul daripada mod senyap dengan pusingan pembiayaan awal bernilai AS$50 juta dan membina pasukannya di London, berhampiran ekosistem bakat yang melahirkan pengasasnya. 5 Syarikat itu dilaporkan merancang untuk berkembang daripada kira-kira sedozen pekerja kepada sekitar 20 hingga 25 orang, menandakan pendekatan kecil tetapi berintensiti tinggi dalam penyelidikan.
Strategi itu berbeza daripada perlumbaan untuk menandingi jumlah pekerja atau belanjawan latihan model milik makmal AI terbesar.
Pengasas bersama dan ketua saintis Edward Hughes pula mengkritik sekatan “garden leave” di United Kingdom. Amalan ini boleh menyebabkan penyelidik perlu menunggu sebelum berpindah kepada majikan baharu atau menyertai syarikat pemula. Menurut Inherent, perkara itu menjadi isu persaingan ketika syarikat cuba mendapatkan penyelidik AI berpengalaman, termasuk bakat daripada DeepMind, berdepan syarikat yang mempunyai sumber lebih besar. 6
Hasilnya ialah strategi yang lebih tertumpu: menggunakan pasukan yang kecil, melabur dalam pembelajaran pengukuhan dan pertimbangan saintifik, serta menggabungkan model asas yang lebih kecil dengan alat luaran yang semakin canggih.
Inherent mendakwa Faraday mengatasi GPT-5.5 dan Claude Opus 4.8 dalam menghasilkan semula dapatan kajian saintifik yang diterbitkan secara bebas, walaupun ia menggunakan model Qwen 3.6 dengan hanya 27 bilion parameter.
Idea yang lebih penting bukan semata-mata model kecil mengalahkan model besar. Sebaliknya, keputusan itu menunjukkan bahawa perancangan penyelidikan, pembelajaran pengukuhan jangka panjang dan penyelarasan alat mungkin sama penting dengan saiz model apabila AI digunakan untuk kerja saintifik.
Buat masa ini, bukti yang ada hanya menyokong kesimpulan yang lebih terhad: Faraday ialah sistem ejen penyelidikan yang menjanjikan untuk tugas yang dinilai oleh Inherent. Ia belum membuktikan keunggulan umum terhadap model Anthropic atau OpenAI, dan keupayaan mengulangi kajian juga belum sama dengan penemuan saintifik autonomi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent mendakwa Faraday, ejen AI berasaskan model Qwen 3.6 dengan 27 bilion parameter, mengatasi Claude Opus 4.8 dan GPT 5.5 dalam menghasilkan semula dapatan kajian yang diterbitkan.
Inherent mendakwa Faraday, ejen AI berasaskan model Qwen 3.6 dengan 27 bilion parameter, mengatasi Claude Opus 4.8 dan GPT 5.5 dalam menghasilkan semula dapatan kajian yang diterbitkan. Faraday dilatih melalui pembelajaran pengukuhan untuk membina apa yang dipanggil Inherent sebagai “naluri penyelidikan” — keupayaan memilih eksperimen yang wajar dijalankan dan merancang cara melaksanakannya.
Ejen itu boleh menggunakan alat sedia ada seperti GPT 5.5 Codex untuk kerja pengekodan, manakala Faraday bertindak sebagai pengarah penyelidikan.