Inherent טוענת כי Faraday, המבוסס על מודל Qwen 3.6 עם 27 מיליארד פרמטרים, עלה בביצועיו על Claude Opus 4.8 של Anthropic ועל GPT 5.5 של OpenAI במשימה של שחזור עצמאי של תוצאות מחקרים שפורסמו. הסוכן נועד לשמש כמנהל מחקר: למידת חיזוק אימנה אותו להחליט אילו ניסויים כדאי לבצע וכיצד לתכנן אותם, בעוד כלי קידוד כמו GPT 5.5 Co...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
המעבדה הלונדונית Inherent, שהוקמה בידי יוצאי Google DeepMind, טוענת כי סוכן המחקר החדש שלה, Faraday, הצליח במשימה ממוקדת שבה גבר על Claude Opus 4.8 של Anthropic ועל GPT-5.5 של OpenAI: שחזור עצמאי של ממצאים ממאמרים מדעיים שפורסמו, בלי לקבל מראש את התשובה. 25
הכוכבית חשובה: מדובר בתוצאה שעליה דיווחה Inherent במסגרת הערכה של שחזור מאמרים — לא בהוכחה עצמאית לכך ש-Faraday הוא מודל טוב יותר באופן כללי מ-Claude או מ-GPT-5.5.
במקום לסכם מאמר או לנחש תשובה ידועה, הסוכן מקבל מחקר שפורסם ונדרש לבנות מחדש חלקים מספיקים מהעבודה כדי להגיע לממצאים דומים. לפי Inherent, Faraday ביצע את המשימה טוב יותר משני המודלים הגדולים יותר. 5
ההערכה הטכנית מתוארת כמבחן בשם Replica, הכולל 310 משימות המתמקדות בשחזור איורים מדעיים. 8 זהו מבחן צר יחסית: הצלחה בתהליך מחקר מוגדר יכולה להצביע על יכולות שימושיות, אך אינה מעידה בהכרח על עליונות בהיגיון כללי, כתיבה, תכנות, גילוי מדעי או מגוון משימות אחרות.
Faraday פועל על בסיס Qwen 3.6, מודל בעל 27 מיליארד פרמטרים — מספר קטן יחסית למערכות החזית הגדולות ששימשו להשוואה. Inherent הציגה את הפער הזה בגודל המודל כאחד ההיבטים הבולטים בתוצאה. 15
אבל המסקנה אינה ש-Qwen 3.6 לבדו החליף את המודלים המובילים. Faraday הוא מערכת של סוכן: התוצאה תלויה לא רק במודל הבסיס, אלא גם באימון שלאחריו, בתהליך העבודה, בשימוש בכלים ובחלוקת התפקידים בין תכנון לביצוע.
במילים אחרות, מודל בסיס קטן יותר עשוי להיות תחרותי במשימה מתמחה כאשר המערכת שנבנתה סביבו מותאמת היטב לאותה משימה. זהו לב האסטרטגיה של Inherent: לא להתחרות בהכרח על המודל הכללי הגדול ביותר, אלא לשלב מודל קומפקטי עם יכולת הכוונה מדעית וכלים חיצוניים חזקים.
Inherent מכנה את היכולת שאליה היא מכוונת "חוש מחקרי" — היכולת להחליט אילו ניסויים שווים את הזמן והמשאבים, כיצד לתכנן אותם, מתי תוצאה אינה חד-משמעית ומתי צריך לשנות כיוון. 4
החברה אומרת שפיתחה את ההתנהגות הזו באמצעות למידת חיזוק. במקום להכתיב לסוכן כל צעד, השיטה מתגמלת את איכות תהליך המחקר ואת התוצאה הסופית. זהו יעד שונה מאופטימיזציה למבחן קצר שבו התשובה הנכונה מוגדרת מראש.
Faraday גם אינו חייב לבצע בעצמו כל שלב טכני. הוא יכול להשתמש בסוכני קידוד, ובהם GPT-5.5 Codex של OpenAI, ככלים. בחלוקת העבודה הזו Faraday מתפקד יותר כמנהל מחקר: הוא מספק תכנון ושיקול דעת מדעיים, בעוד מערכת קידוד ייעודית מסייעת להפוך את התוכנית לניסויים שניתן להריץ. 6
לכן ההשוואה מורכבת יותר מכותרת שלפיה "מודל קטן ניצח מודלים גדולים". היתרון שעליו מדווחת Inherent שייך לזרימת העבודה המלאה של הסוכן — ולא בהכרח למודל Qwen בעל 27 מיליארד הפרמטרים כשהוא פועל לבדו.
שחזור מחקר מספק לסוכן AI דרך קונקרטית להתאמן במדע. עליו להבין את המאמר, לגבש השערות לגבי השיטה שמאחוריו, לבחור ניסויים, להתמודד עם ניסיונות כושלים ולהשוות את התוצאות שלו לממצאים שפורסמו.
ההנחה של Inherent היא שהמאמר המוגמר מציג רק חלק קטן מהעבודה שנדרשה כדי להגיע אליו. ניסוי וטעייה, גישות שנזנחו והחלטות מעשיות בדרך כלל אינם מופיעים בגרסה הסופית. שחזור התהליך הנסתר הזה יכול לשמש סביבת אימון מבוקרת לחשיבה מדעית. 5
בנוסף, קל יותר להעריך שחזור מאשר גילוי מקורי. במשימת שחזור יש יעד חיצוני: אפשר לבדוק אם הסוכן הצליח להגיע לתוצאה שדווחה ואם ההחלטות הניסיוניות שלו היו סבירות מבחינה מדעית. לכן מדובר בשלב ביניים שימושי לפני שמבקשים ממערכת AI לחקור שאלות שהתשובות עליהן עדיין אינן ידועות.
Inherent אינה מציגה את שחזור המאמרים כיעד הסופי. החברה מתארת את Faraday כצעד מוקדם בדרך לסוכני AI שיוכלו לעבוד בתחומי מדע שונים ולסייע בסופו של דבר ביצירת ידע חדש באמת. 13
זו טענה רחבה בהרבה מניצחון במבחן. מערכת שמסוגלת לשחזר תוצאה שפורסמה מפגינה התנהגות מחקרית חשובה, אך גילוי מקורי דורש גם לזהות שאלות פתוחות בעלות ערך, להציע השערות חדשות, לתכנן בדיקות אמינות ולהפיק תוצאות שיעמדו בביקורת.
לכן נכון לראות בהערכה של Faraday עדות לחלק אחד במסלול הזה — ולא הוכחה לכך שהמטרה הרחבה כבר הושגה.
Inherent יצאה מחשאיות לאחר שדווח כי גייסה 50 מיליון דולר בסבב סיד. החברה פועלת בלונדון, בסמוך למאגר הכישרונות שממנו הגיעו מייסדיה. 5 לפי התוכנית שדווחה, הצוות אמור לגדול מכעשרה עובדים לערך ל-20–25 עובדים — גישה קטנה וממוקדת-מחקר, ולא מרוץ להשוואת כוח האדם או תקציבי האימון של מעבדות ה-AI הגדולות.
אדוארד יוז, מייסד-שותף והמדען הראשי של החברה, מתח ביקורת על מגבלות ה-garden leave בבריטניה — תקופות שבהן עובדים שעזבו מקום עבודה אינם יכולים להתחיל מיד אצל מעסיק חדש או בסטארט-אפ. Inherent רואה בכך מכשול תחרותי בגיוס חוקרי AI מנוסים, כולל מועמדים מ-DeepMind, מול חברות בעלות משאבים רבים יותר. 6
מכאן נובעת אסטרטגיה ממוקדת: צוות רזה, השקעה בלמידת חיזוק ובשיקול דעת מדעי, ושילוב של מודל בסיס קטן עם כלים חיצוניים שהולכים ומשתפרים. אם הגישה הזו תצליח גם מעבר להערכה הראשונית, היא עשויה להציע לסטארט-אפים דרך להתחרות במחקר AI בלי לבנות את המודל הכללי הגדול ביותר בשוק.
Inherent אומרת ש-Faraday עלה בביצועיו על GPT-5.5 ועל Claude Opus 4.8 בשחזור עצמאי של ממצאים מדעיים שפורסמו — אף שהוא מבוסס על מודל Qwen 3.6 עם 27 מיליארד פרמטרים בלבד. הרעיון החשוב יותר אינו רק שמודל קטן ניצח בהשוואה נקודתית, אלא שתכנון מחקר, למידת חיזוק ארוכת-טווח ותיאום בין כלים עשויים להיות חשובים לא פחות מגודל המודל בעבודה מדעית.
נכון לעכשיו, הראיות תומכות במסקנה מצומצמת יותר: Faraday נראה כמערכת מבטיחה לסוכני מחקר במשימה שנבדקה על ידי Inherent. הן עדיין אינן מבססות עליונות כללית על המודלים של Anthropic או OpenAI, ושחזור מחקרים כשלעצמו אינו מוכיח יכולת לגילוי מדעי אוטונומי.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Inherent טוענת כי Faraday, המבוסס על מודל Qwen 3.6 עם 27 מיליארד פרמטרים, עלה בביצועיו על Claude Opus 4.8 של Anthropic ועל GPT 5.5 של OpenAI במשימה של שחזור עצמאי של תוצאות מחקרים שפורסמו.
Inherent טוענת כי Faraday, המבוסס על מודל Qwen 3.6 עם 27 מיליארד פרמטרים, עלה בביצועיו על Claude Opus 4.8 של Anthropic ועל GPT 5.5 של OpenAI במשימה של שחזור עצמאי של תוצאות מחקרים שפורסמו. הסוכן נועד לשמש כמנהל מחקר: למידת חיזוק אימנה אותו להחליט אילו ניסויים כדאי לבצע וכיצד לתכנן אותם, בעוד כלי קידוד כמו GPT 5.5 Codex יכולים לטפל במימוש הטכני.
בחברה רואים בשחזור מאמרים שלב אימון לקראת סוכני AI שיוכלו בעתיד לסייע ביצירת ידע מדעי חדש בתחומים שונים.