Inherent afirma que Faraday, basado en un modelo Qwen 3.6 de 27.000 millones de parámetros, superó a Claude Opus 4.8 y GPT 5.5 al reproducir de forma independiente resultados de investigaciones publicadas. El agente fue entrenado mediante aprendizaje por refuerzo para desarrollar lo que la empresa llama “criterio in...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Inherent, a London-based AI startup founded by Google DeepMind alumni with about a dozen employees and a recent $50 million seed ro. Article summary: Inherent claimed that Faraday outperformed Anthropic’s Claude Opus 4.8 and OpenAI’s GPT-5.5 at independently reproducing results from published scientific papers when the agent was not given the original answer in advanc. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Inherent, un laboratorio londinense de inteligencia artificial fundado por antiguos investigadores de Google DeepMind, asegura que su nuevo agente Faraday superó a Claude Opus 4.8, de Anthropic, y a GPT-5.5, de OpenAI, en una tarea concreta: reproducir de manera independiente los resultados de artículos científicos publicados sin conocer de antemano la respuesta. El dato llama la atención porque Faraday está construido sobre Qwen 3.6, un modelo relativamente pequeño de 27.000 millones de parámetros, y no sobre un sistema de escala puntera. 25
La precisión es importante: se trata del resultado comunicado por Inherent en una evaluación específica de replicación científica, no de una demostración independiente de que Faraday sea, en términos generales, más capaz que Claude o GPT-5.5.
La comparación se centró en la replicación científica. El agente recibe un estudio publicado y debe reconstruir el trabajo suficiente para reproducir sus conclusiones, en lugar de limitarse a resumir el artículo o anticipar una respuesta ya conocida. Inherent afirma que Faraday obtuvo mejores resultados que Claude Opus 4.8 y GPT-5.5 en ese escenario. 5
Un informe técnico describe Replica como una prueba de 310 tareas centrada en reproducir figuras científicas. 8 El alcance importa: rendir bien en un flujo de trabajo de investigación muy definido puede revelar capacidades útiles sin demostrar un desempeño superior en razonamiento general, programación, redacción o descubrimiento científico.
Faraday funciona sobre Qwen 3.6, con 27.000 millones de parámetros. Inherent presentó esa cifra como un contraste considerable frente a los sistemas más grandes utilizados para la comparación. 15
La conclusión que la empresa intenta impulsar no es que Qwen 3.6, por sí solo, haya sustituido a los principales modelos generalistas. Faraday es un sistema de agente: su rendimiento depende del modelo subyacente, el entrenamiento posterior, el flujo de investigación, el uso de herramientas y la forma en que se distribuyen las tareas entre planificación y ejecución.
En otras palabras, un modelo base más pequeño puede competir en una tarea especializada si todo el sistema que lo rodea está optimizado para ella. Esa es la apuesta estratégica de Inherent: en vez de entrenar el modelo generalista más grande, busca que un modelo compacto, dotado de una mejor dirección científica, coordine herramientas especializadas y tome decisiones experimentales más útiles.
Inherent describe la capacidad que quiere desarrollar como “research taste”, una expresión que puede traducirse como “criterio investigador”: saber qué experimentos merece la pena realizar, cómo diseñarlos, cuándo los resultados no son concluyentes y cuándo conviene cambiar de rumbo. 4
La empresa afirma que utilizó aprendizaje por refuerzo para fomentar ese comportamiento. En lugar de imponer cada paso, el método recompensa la calidad del proceso y del resultado final de la investigación. Es un objetivo distinto al de optimizar únicamente una prueba de respuestas breves, en la que la solución correcta ya está definida.
Además, Faraday no tiene que encargarse de cada detalle de implementación. Puede utilizar agentes de programación, incluido GPT-5.5 Codex de OpenAI, como herramientas. La división de tareas se parece más a la de un director de investigación: Faraday aporta la planificación y el juicio científico, mientras que un sistema especializado ayuda a convertir ese plan en experimentos ejecutables. 6
Por eso la comparación debe interpretarse con matices. La ventaja comunicada por Inherent corresponde al flujo de trabajo completo del agente, no necesariamente al modelo base de 27.000 millones de parámetros funcionando de forma aislada.
La replicación ofrece a un investigador de IA una forma concreta de practicar el método científico. El agente debe interpretar un artículo, formular hipótesis sobre el método utilizado, escoger experimentos, afrontar intentos fallidos y comparar sus resultados con los publicados.
La premisa de Inherent es que el artículo terminado solo muestra una parte del trabajo. El ensayo y error, los enfoques descartados y muchas decisiones prácticas que conducen al resultado final suelen quedar fuera. Reconstruir ese proceso oculto puede convertirse así en un entorno controlado para entrenar el razonamiento científico. 5
También resulta más fácil de evaluar que un descubrimiento completamente original. En una tarea de replicación existe un objetivo externo: se puede comprobar si el agente reproduce el resultado y si sus decisiones experimentales son científicamente defendibles. Esto la convierte en un paso intermedio antes de pedir a una IA que investigue preguntas cuyas respuestas todavía se desconocen.
La empresa no presenta la replicación de artículos como destino final. Describe Faraday como una primera etapa hacia científicos de IA capaces de trabajar en distintos campos y, con el tiempo, contribuir a generar conocimiento verdaderamente nuevo. 13
Se trata de una afirmación mucho más amplia que ganar una prueba. Reproducir un resultado publicado demuestra un comportamiento investigador valioso, pero el descubrimiento original exige identificar preguntas relevantes sin respuesta, formular hipótesis novedosas, diseñar pruebas fiables y producir resultados que resistan el escrutinio de otros expertos.
La evaluación de Faraday debe entenderse, por tanto, como una señal sobre una parte de ese recorrido, no como una prueba de que la meta de la ciencia autónoma ya se haya alcanzado.
Inherent salió del modo sigiloso con una ronda semilla cuya cuantía comunicada fue de 50 millones de dólares y está desarrollando el proyecto en Londres, cerca del ecosistema de talento del que proceden sus fundadores. 5 Su plan, según lo comunicado, es pasar de aproximadamente una docena de empleados a entre 20 y 25. El enfoque apunta a un equipo pequeño e intensivo en investigación, no a competir con los mayores laboratorios mediante una plantilla masiva o presupuestos equivalentes para entrenar modelos.
Edward Hughes, cofundador y científico jefe, ha criticado las restricciones británicas de garden leave, periodos en los que un empleado puede quedar obligado a no incorporarse de inmediato a otra empresa durante el preaviso. Inherent considera que estas limitaciones dificultan la contratación de investigadores experimentados, incluido talento procedente de DeepMind, frente a compañías con más recursos. 6
La estrategia resultante es de concentración, no de escala: un equipo reducido, inversión en aprendizaje por refuerzo y criterio científico, y una combinación de modelo base pequeño con herramientas externas cada vez más capaces. Si el enfoque funciona más allá de la evaluación inicial, podría ofrecer a otras startups una vía para competir en investigación de IA sin construir el modelo más grande del mercado.
Inherent afirma que Faraday superó a GPT-5.5 y Claude Opus 4.8 al reproducir de forma independiente resultados científicos publicados, pese a utilizar un modelo Qwen 3.6 de 27.000 millones de parámetros. La idea más relevante no es simplemente que un modelo pequeño haya ganado una comparación, sino que la planificación de la investigación, el aprendizaje por refuerzo a largo plazo y la coordinación de herramientas pueden ser tan importantes como la escala bruta del modelo en determinadas tareas científicas.
Por ahora, la evidencia respalda una conclusión más limitada: Faraday es un sistema prometedor de agente investigador en la tarea evaluada por Inherent. No demuestra una superioridad general sobre los modelos de Anthropic u OpenAI, ni que la replicación de artículos equivalga por sí sola a un descubrimiento científico autónomo.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Inherent afirma que Faraday, basado en un modelo Qwen 3.6 de 27.000 millones de parámetros, superó a Claude Opus 4.8 y GPT 5.5 al reproducir de forma independiente resultados de investigaciones publicadas.
Inherent afirma que Faraday, basado en un modelo Qwen 3.6 de 27.000 millones de parámetros, superó a Claude Opus 4.8 y GPT 5.5 al reproducir de forma independiente resultados de investigaciones publicadas. El agente fue entrenado mediante aprendizaje por refuerzo para desarrollar lo que la empresa llama “criterio investigador”: decidir qué experimentos merecen la pena y cómo diseñarlos.
Faraday puede apoyarse en herramientas externas, incluido GPT 5.5 Codex, para programar y ejecutar experimentos mientras el agente se concentra en la dirección científica.