Inherent tuyên bố Faraday vượt Claude Opus 4.8 của Anthropic và GPT 5.5 của OpenAI trong nhiệm vụ độc lập tái lập kết quả từ các bài báo khoa học đã công bố. Faraday dựa trên Qwen 3.6 với 27 tỷ tham số; hệ thống dùng học tăng cường để rèn “khẩu vị nghiên cứu”, còn các tác nhân lập trình như GPT 5.5 Codex có thể hỗ t...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inherent, phòng thí nghiệm AI tại London do các cựu nghiên cứu viên Google DeepMind thành lập, cho biết tác nhân nghiên cứu Faraday mới ra mắt đã vượt Claude Opus 4.8 của Anthropic và GPT-5.5 của OpenAI trong một nhiệm vụ cụ thể: tự mình tái lập kết quả từ các bài báo khoa học mà không được cung cấp đáp án trước. 25
Điểm gây chú ý là Faraday không dựa trên một mô hình có quy mô hàng trăm tỷ tham số. Hệ thống được xây dựng quanh Qwen 3.6, mô hình tương đối nhỏ với 27 tỷ tham số. 25
Tuy nhiên, cần đặt tuyên bố này đúng vào bối cảnh. Đây là kết quả do Inherent công bố trên một bài đánh giá chuyên biệt về tái lập nghiên cứu, chứ chưa phải bằng chứng độc lập cho thấy Faraday nói chung có năng lực cao hơn Claude hay GPT-5.5.
Bài so sánh tập trung vào việc tái lập nghiên cứu khoa học. Tác nhân nhận một công trình đã được công bố, sau đó phải tự diễn giải phương pháp, lựa chọn thí nghiệm và xây dựng lại đủ quy trình để kiểm tra xem có thể tạo ra những phát hiện tương tự hay không. Đây là một yêu cầu khác với việc tóm tắt bài báo hoặc đoán một đáp án đã biết. Inherent nói Faraday đạt kết quả tốt hơn Claude Opus 4.8 và GPT-5.5 trong bối cảnh này. 5
Một mô tả kỹ thuật về phép đánh giá cho biết Replica là bộ chuẩn gồm 310 nhiệm vụ, tập trung vào việc tái tạo các hình trong công trình khoa học. 8 Chi tiết này rất quan trọng: thành công trong một quy trình nghiên cứu được định nghĩa chặt chẽ có thể cho thấy năng lực hữu ích, nhưng không tự động phản ánh khả năng suy luận tổng quát, viết lách, lập trình hay khám phá khoa học trên mọi dạng bài.
Faraday chạy trên Qwen 3.6 với 27 tỷ tham số — nhỏ hơn đáng kể so với các hệ thống AI tiền tuyến được dùng để so sánh. Inherent đưa khoảng cách quy mô này vào trọng tâm của thông báo. 15
Dù vậy, thông điệp không phải là Qwen 3.6, khi đứng riêng lẻ, đã thay thế các mô hình đa dụng hàng đầu. Faraday là một hệ thống tác nhân, trong đó kết quả phụ thuộc vào mô hình nền, quá trình hậu huấn luyện, quy trình nghiên cứu, công cụ sử dụng và cách phân chia công việc giữa lập kế hoạch với thực thi.
Nói cách khác, một mô hình nền nhỏ vẫn có thể cạnh tranh trong nhiệm vụ chuyên biệt nếu toàn bộ hệ thống xung quanh được tối ưu cho nhiệm vụ đó. Inherent đang đặt cược vào hướng đi này thay vì chạy đua huấn luyện mô hình đa dụng lớn nhất.
Inherent dùng cụm từ “research taste”, có thể hiểu là “khẩu vị nghiên cứu”, để mô tả năng lực mà công ty muốn Faraday sở hữu: biết thí nghiệm nào đáng thực hiện, nên thiết kế chúng ra sao, khi nào kết quả còn chưa đủ thuyết phục và lúc nào cần đổi hướng. 4
Công ty cho biết đã sử dụng học tăng cường để phát triển hành vi này. Thay vì quy định cứng từng bước, phương pháp huấn luyện thưởng cho chất lượng của cả quá trình và kết quả nghiên cứu. Mục tiêu đó khác với việc chỉ tối ưu một bài kiểm tra trả lời ngắn, nơi đáp án đúng đã được xác định sẵn.
Faraday cũng không nhất thiết phải tự thực hiện mọi công đoạn kỹ thuật. Tác nhân này có thể sử dụng các công cụ lập trình, trong đó có GPT-5.5 Codex của OpenAI. Theo mô hình phân công mà Inherent mô tả, Faraday đóng vai trò như một giám đốc nghiên cứu: đưa ra định hướng khoa học và phán đoán, trong khi tác nhân lập trình chuyên biệt hỗ trợ biến kế hoạch thành các thí nghiệm có thể chạy được. 6
Vì vậy, lợi thế được báo cáo thuộc về toàn bộ quy trình tác nhân Faraday, không nhất thiết là năng lực của riêng mô hình Qwen 3.6 27B khi tách khỏi hệ thống.
Tái lập một công trình cho AI cơ hội thực hành các thao tác cốt lõi của nghiên cứu: đọc và diễn giải bài báo, hình thành giả thuyết về phương pháp bên dưới, chọn thí nghiệm, xử lý những lần thử thất bại rồi đối chiếu kết quả với phát hiện đã công bố.
Theo tiền đề của Inherent, bài báo hoàn chỉnh thường chỉ cho thấy phần nổi của công việc. Những lần thử và sai, phương án bị loại bỏ hay các quyết định thực tế dẫn đến kết quả cuối cùng phần lớn không xuất hiện trong văn bản. Việc tái dựng quá trình bị che khuất đó có thể trở thành môi trường được kiểm soát để rèn luyện năng lực suy luận khoa học. 5
Tái lập cũng dễ đánh giá hơn khám phá hoàn toàn mới. Một nhiệm vụ tái lập có mục tiêu bên ngoài rõ ràng: hệ thống có thể được kiểm tra xem có tái tạo được kết quả hay không, đồng thời các lựa chọn thí nghiệm có hợp lý về mặt khoa học hay không. Đây là bước trung gian hữu ích trước khi yêu cầu AI tự điều tra những câu hỏi chưa có lời giải.
Inherent không xem việc tái lập bài báo là đích đến cuối cùng. Công ty coi Faraday là bước đầu hướng tới những “nhà khoa học AI” có thể làm việc trên nhiều lĩnh vực và cuối cùng hỗ trợ tạo ra tri thức thực sự mới. 13
Đó là một tuyên bố lớn hơn nhiều so với việc thắng một bài đánh giá. Tái lập thành công cho thấy hệ thống đã thể hiện một phần hành vi nghiên cứu hữu ích. Nhưng khám phá nguyên bản còn đòi hỏi khả năng xác định câu hỏi chưa được giải đáp nhưng đáng theo đuổi, đưa ra giả thuyết mới, thiết kế phép kiểm chứng đáng tin cậy và tạo ra kết quả đủ sức vượt qua sự thẩm định.
Do đó, đánh giá Faraday hiện phù hợp hơn với cách hiểu rằng đây là bằng chứng cho một chặng trên lộ trình đó — chưa phải bằng chứng rằng mục tiêu khám phá khoa học tự động đã đạt được.
Inherent được cho là đã huy động 50 triệu USD ở vòng hạt giống và xây dựng đội ngũ tại London sau khi ra khỏi giai đoạn hoạt động kín. 5 Kế hoạch tăng quy mô từ khoảng một tá nhân sự lên khoảng 20–25 người cho thấy công ty đang theo đuổi mô hình nhóm nhỏ, tập trung cao độ vào nghiên cứu, thay vì cạnh tranh bằng quân số hoặc ngân sách huấn luyện mô hình với các phòng thí nghiệm AI lớn nhất.
Đồng sáng lập kiêm giám đốc khoa học Edward Hughes từng chỉ trích các quy định về “garden leave” tại Anh — khoảng thời gian người lao động phải chờ trước khi có thể chuyển sang công việc mới hoặc gia nhập startup. Inherent cho rằng đây là vấn đề cạnh tranh khi công ty muốn tuyển các nhà nghiên cứu AI giàu kinh nghiệm, trong đó có nhân sự từ DeepMind, để đối đầu với những doanh nghiệp được đầu tư tốt hơn. 6
Chiến lược của Inherent vì thế thiên về sự tập trung thay vì mở rộng bằng mọi giá: duy trì đội ngũ tinh gọn, đầu tư vào học tăng cường và năng lực phán đoán khoa học, đồng thời kết hợp mô hình nền nhỏ với các công cụ bên ngoài ngày càng mạnh.
Nếu cách tiếp cận này tiếp tục hiệu quả ngoài bài đánh giá ban đầu, các startup có thể có thêm một con đường cạnh tranh trong nghiên cứu AI mà không cần tự xây dựng mô hình lớn nhất thị trường.
Inherent cho biết Faraday đã vượt GPT-5.5 và Claude Opus 4.8 trong việc độc lập tái lập các phát hiện khoa học đã công bố, dù chỉ sử dụng mô hình Qwen 3.6 với 27 tỷ tham số. Điều đáng chú ý hơn không chỉ là chuyện một mô hình nhỏ thắng trong một phép so sánh, mà là vai trò của lập kế hoạch nghiên cứu, học tăng cường dài hạn và khả năng phối hợp công cụ trong các công việc khoa học.
Dựa trên bằng chứng hiện có, kết luận thận trọng nhất là Faraday là một hệ thống tác nhân nghiên cứu đầy hứa hẹn trong đúng nhiệm vụ mà Inherent đã đánh giá. Kết quả này chưa chứng minh Faraday vượt trội toàn diện so với mô hình của Anthropic hay OpenAI, và bản thân việc tái lập nghiên cứu cũng chưa đồng nghĩa với khám phá khoa học tự động.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Inherent tuyên bố Faraday vượt Claude Opus 4.8 của Anthropic và GPT 5.5 của OpenAI trong nhiệm vụ độc lập tái lập kết quả từ các bài báo khoa học đã công bố.
Inherent tuyên bố Faraday vượt Claude Opus 4.8 của Anthropic và GPT 5.5 của OpenAI trong nhiệm vụ độc lập tái lập kết quả từ các bài báo khoa học đã công bố. Faraday dựa trên Qwen 3.6 với 27 tỷ tham số; hệ thống dùng học tăng cường để rèn “khẩu vị nghiên cứu”, còn các tác nhân lập trình như GPT 5.5 Codex có thể hỗ trợ triển khai thí nghiệm.
Inherent xem việc tái lập nghiên cứu là bước tập dượt cho các “nhà khoa học AI”, với tham vọng dài hạn là hỗ trợ tạo ra tri thức khoa học mới ở nhiều lĩnh vực.