Inherent nói Faraday 27 tỷ tham số vượt Claude Opus 4.8 và GPT 5.5 trong một nhiệm vụ tái lập nghiên cứu cụ thể, nhưng kết quả này chưa chứng minh Faraday có thể độc lập tạo ra khám phá khoa học mới. Faraday được huấn luyện bằng học tăng cường dài hạn trên Replica, bộ benchmark gồm 310 nhiệm vụ yêu cầu tái tạo hình...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London AI lab founded by Google DeepMind alumni, announce about its 27-billion-parameter Faraday AI agent’s ability to. Article summary: Inherent says its 27-billion-parameter Faraday agent can independently reproduce findings from published scientific papers without being given the answer beforehand, and that it outperformed Anthropic’s Claude Opus 4.8 a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Inherent, một phòng thí nghiệm AI tại London do các cựu nhân sự Google DeepMind thành lập, cho biết tác nhân Faraday với 27 tỷ tham số có thể tái tạo kết quả từ những bài báo khoa học đã công bố mà không được cung cấp đáp án trước. Công ty cũng tuyên bố Faraday đạt kết quả tốt hơn Claude Opus 4.8 của Anthropic và GPT-5.5 của OpenAI trong nhiệm vụ tái lập nghiên cứu này. 259
Nếu được xác nhận qua các đánh giá rộng hơn và độc lập hơn, đây sẽ là kết quả đáng chú ý. Dù vậy, cần đọc tuyên bố này trong đúng phạm vi: Faraday được kiểm thử ở việc tái tạo những kết quả đã tồn tại, chứ chưa chứng minh khả năng tự phát hiện tri thức khoa học mới.
Inherent xây dựng Replica, một benchmark gồm 100 bài báo về học máy và AI cho khoa học, sau đó chuyển thành 310 nhiệm vụ tái lập. Mỗi nhiệm vụ yêu cầu tác nhân tái tạo một hình cụ thể trong bài báo, với thời gian và tài nguyên tính toán giới hạn, đồng thời không được xem biểu đồ gốc. 34
Thử thách này khó hơn việc yêu cầu mô hình tóm tắt bài báo hoặc sao chép một biểu đồ đã có. Tác nhân phải hiểu nội dung nghiên cứu, triển khai các thí nghiệm cần thiết, quyết định cách sử dụng tài nguyên và tạo ra kết quả đủ gần với phát hiện được báo cáo để được tính là tái lập thành công.
Inherent cho biết Faraday vượt Claude Opus 4.8 và GPT-5.5 trên benchmark này dù sử dụng mô hình 27 tỷ tham số nhỏ hơn đáng kể. 158 Tuy nhiên, đây là tuyên bố gắn với một benchmark cụ thể, không phải bảng xếp hạng tổng quát về năng lực khoa học hay lập trình của các hệ thống.
Theo Inherent, làm khoa học không chỉ là đạt được kết quả cuối cùng. Một nhà nghiên cứu giỏi còn phải biết thí nghiệm nào đáng thực hiện, thiết kế chúng ra sao, diễn giải những kết quả còn mơ hồ thế nào và khi nào cần đổi hướng nếu cách tiếp cận ban đầu thất bại. Công ty gọi tập hợp các phán đoán đó là “research taste”, có thể hiểu là “khẩu vị nghiên cứu”. 47
Điểm phân biệt này rất quan trọng. Một mô hình có thể tạo ra đầu ra trông hợp lý nhưng vẫn không tuân theo quy trình khoa học đáng tin cậy. Inherent nói Faraday được huấn luyện để hình thành những hành vi cần cho một cuộc điều tra dài hơi: đặt giả thuyết, kiểm tra, rút kinh nghiệm từ thất bại và chọn bước tiếp theo có triển vọng. 4
Học tăng cường dài hạn được dùng nhằm rèn luyện quá trình phán đoán đó, thay vì chỉ tối ưu một biểu đồ có vẻ giống với kết quả công bố. Việc tái lập cũng buộc tác nhân phải tự lần lại nhiều bước thử-sai thực tế vốn thường không được mô tả đầy đủ trong một bài báo. Inherent xem đây là nền tảng để tiến tới các nhiệm vụ nghiên cứu mở hơn. 49
Faraday không được giới thiệu như một hệ thống thay thế độc lập cho tác nhân lập trình mạnh. Thay vào đó, nó đóng vai trò lớp giám sát khoa học, chỉ đạo GPT-5.5 Codex của OpenAI trong các nhiệm vụ tái lập. Inherent ví cách sắp xếp này với một nhà khoa học sử dụng trợ lý lập trình: Faraday cung cấp kế hoạch và phán đoán khoa học, còn Codex đảm nhiệm phần lớn công việc triển khai. 39
Cách thiết kế này chuyển trọng tâm khỏi quy mô mô hình đơn thuần. Một mô hình nhỏ hơn vẫn có thể tạo ra giá trị nếu nó quyết định được công cụ lớn hơn cần làm gì, lúc nào nên đổi chiến thuật và cách đánh giá kết quả. Vì vậy, lợi thế mà Inherent công bố phần nào là lợi thế về điều phối—kết hợp năng lực lập kế hoạch khoa học với khả năng lập trình ở cấp độ tiên tiến—chứ chưa phải bằng chứng rằng mô hình 27 tỷ tham số của Faraday có năng lực tổng quát cao hơn mọi hệ thống lớn hơn.
Inherent cho biết công ty muốn xây dựng các tác nhân AI có thể cộng tác với nhà nghiên cứu như những đồng đội. Hệ thống này được kỳ vọng hỗ trợ lập kế hoạch, tiến hành, phản biện và lặp lại các thí nghiệm, trong khi con người vẫn giữ quyền định hướng và giám sát. 45
Faraday nên được xem là phiên bản ban đầu của ý tưởng đó: một mô hình cung cấp trực giác khoa học và khả năng quản lý quá trình nghiên cứu, đặt trên nền các công cụ lập trình đa dụng. Mục tiêu dài hạn được công ty nêu ra là phát triển những tác nhân có thể đóng góp vào việc khám phá tri thức mới, nhưng kết quả hiện tại mới chỉ thể hiện năng lực tái lập. 34
Ranh giới này không nên bị bỏ qua. Tái tạo một kết quả đã biết là phép thử có giá trị đối với độ tin cậy khoa học, nhưng tự nó chưa chứng minh tác nhân có thể đặt ra câu hỏi nguyên bản và quan trọng, tạo giả thuyết thực sự mới hoặc xác nhận khám phá trong thế giới thực.
Inherent là một phòng thí nghiệm tại London do các cựu nhân sự Google DeepMind sáng lập, và đã ra mắt sau thời gian hoạt động kín với vòng hạt giống được báo cáo trị giá 50 triệu USD. 25 Công ty đang tập trung vào những phần của khoa học có sự hỗ trợ từ AI mà các mô hình đa dụng có thể không tự học được đầy đủ: phán đoán khi thiết kế thí nghiệm, ra quyết định dài hạn, đánh giá kết quả và phối hợp giữa con người với công cụ phần mềm.
Việc Faraday sử dụng một hệ thống lập trình bên ngoài cũng phù hợp với chiến lược này. Thay vì cố gắng tích hợp mọi năng lực vào một mô hình duy nhất, Inherent đang phát triển một lớp chuyên biệt nhằm giúp các công cụ AI tiên tiến hiện có hoạt động hiệu quả hơn trong môi trường nghiên cứu khoa học. 39
Kết luận trước mắt khá thận trọng nhưng đáng chú ý: Inherent tuyên bố một mô hình giám sát tương đối nhỏ, được huấn luyện bằng học tăng cường, có thể vượt các hệ thống AI tiên tiến lớn hơn trên một benchmark tái lập được định nghĩa chặt chẽ. Câu hỏi lớn hơn—liệu cách tiếp cận này có thể tạo ra những đóng góp khoa học nguyên bản và đáng tin cậy hay không—vẫn còn bỏ ngỏ.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Inherent nói Faraday 27 tỷ tham số vượt Claude Opus 4.8 và GPT 5.5 trong một nhiệm vụ tái lập nghiên cứu cụ thể, nhưng kết quả này chưa chứng minh Faraday có thể độc lập tạo ra khám phá khoa học mới.
Inherent nói Faraday 27 tỷ tham số vượt Claude Opus 4.8 và GPT 5.5 trong một nhiệm vụ tái lập nghiên cứu cụ thể, nhưng kết quả này chưa chứng minh Faraday có thể độc lập tạo ra khám phá khoa học mới. Faraday được huấn luyện bằng học tăng cường dài hạn trên Replica, bộ benchmark gồm 310 nhiệm vụ yêu cầu tái tạo hình từ các bài báo học máy và AI cho khoa học mà không được xem biểu đồ gốc.
Mô hình nhỏ hơn đảm nhiệm việc lập kế hoạch và phán đoán khoa học, còn GPT 5.5 Codex xử lý phần triển khai mã và thực nghiệm chuyên sâu.