Floatboat afirma que el mismo DeepSeek V4 Flash superó a Claude Opus 4.8 en cinco benchmarks de agentes tras cambiar únicamente el arnés de ejecución; el resultado aún no cuenta con replicación independiente. Con una proporción de 3:1 entre tokens de entrada y salida, el coste combinado declarado fue de 0,175 dólare...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
El resultado publicado por Floatboat el 7 de agosto de 2026 no debería leerse como una prueba de que DeepSeek-V4-Flash sea, por naturaleza, más capaz que Claude Opus 4.8. La interpretación más precisa es otra: se trata de una ablación comunicada por la propia empresa, en la que el modelo se mantuvo constante y se sustituyó el arnés de ejecución —el conjunto de herramientas, entorno y bucle operativo que permite a un agente actuar—. Según Floatboat, ese cambio bastó para colocar al modelo económico por delante de las comparaciones publicadas de Opus 4.8 en cinco benchmarks públicos de agentes. 3
La conclusión más interesante, aunque todavía provisional, es más estrecha: en tareas largas y con muchos pasos, el sistema que rodea al modelo puede contribuir tanto al éxito como el propio modelo. El experimento aún no ha sido replicado de forma independiente.
Floatboat asegura que utilizó la versión oficial DeepSeek-V4-Flash-0731, con las mismas entradas y parámetros, y que comparó el arnés minimalista oficial de DeepSeek con su propio arnés de evaluación. Este último empleaba un entorno físico aislado —una especie de espacio de trabajo seguro— con acceso persistente al área de trabajo y a los archivos, herramientas, estado conservado y un ciclo operativo que permitía inspeccionar resultados, corregir errores y continuar. 3
La diferencia es importante porque un agente no completa una tarea simplemente generando una buena respuesta una vez. Tiene que actuar sobre un entorno, observar qué ha ocurrido, actualizar su plan y evitar que un error arruine el trabajo ya realizado.
En el arnés de Floatboat, DeepSeek-V4-Flash obtuvo, según la empresa:
Floatboat afirma que estas cifras superaron las comparaciones publicadas de Claude Opus 4.8 en los cinco benchmarks. 3
El titular necesita contexto. Las tablas públicas pueden mezclar resultados obtenidos con arneses, instrucciones, configuraciones de herramientas, parámetros de muestreo y procedimientos de evaluación distintos. Por eso, la parte más informativa del experimento es el control interno: el mismo modelo de DeepSeek con un arnés diferente. Aun así, sigue siendo un resultado comunicado por una empresa, no una verificación independiente.
El precio declarado para DeepSeek era de 0,14 dólares por millón de tokens de entrada y 0,28 dólares por millón de tokens de salida. Con una proporción de 3:1 entre entrada y salida, el coste combinado sería:
(3 × 0,14 + 0,28) ÷ 4 = 0,175 dólares por millón de tokens
Floatboat utilizó para Claude Opus 4.8 los precios indicados de 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Con la misma proporción:
(3 × 5 + 25) ÷ 4 = 10 dólares por millón de tokens
En ese supuesto, Opus resulta aproximadamente 57,1 veces más caro que DeepSeek en precio combinado de tokens de API. 3
Eso no significa que completar una tarea cueste 57,1 veces más. El cálculo no incluye cargos por herramientas, cómputo, almacenamiento en caché, longitud del contexto, reintentos, ingeniería ni el coste de operar el propio arnés. Es una comparación del precio de los tokens del modelo, no un análisis del coste total de propiedad.
Floatboat comunicó mejoras relativas del 1,9 %, 9,6 %, 12,6 %, 19,9 % y 23,6 % al ordenar los cinco benchmarks desde los trabajos de horizonte más corto hasta los de horizonte más largo. La empresa presenta la secuencia como no decreciente: el arnés tendría menos impacto en tareas acotadas y más importancia cuando aumentan los pasos dependientes entre sí. 3
Un agente puede tomar decisiones razonables y, aun así, fracasar en una tarea extensa. Necesita, entre otras cosas:
Un bucle de ejecución deficiente puede convertir un razonamiento correcto en pérdida de contexto, llamadas inválidas a herramientas, finalización prematura o cambios imposibles de recuperar. Un modelo más potente puede mejorar las decisiones locales, pero no puede compensar por completo un entorno que no conserva el estado, no ofrece información útil o no permite recuperarse de los errores.
De ahí que el resultado trascienda la comparación entre dos modelos. La pregunta deja de ser únicamente «¿qué modelo es más inteligente?» y pasa a ser «¿qué combinación de modelo y entorno puede terminar la tarea de forma fiable?».
Floatboat introdujo el Harness Leverage Ratio, o HLR, para comparar el beneficio de cambiar el arnés con el de actualizar el modelo:
HLR = beneficio de cambiar únicamente el arnés
───────────────────────────────────────
beneficio de actualizar al sistema de referencia más potente
Un HLR superior a 1 significa que, en el benchmark y la comparación seleccionados, el cambio de arnés produjo un aumento de puntuación mayor que el salto medido hacia el sistema de referencia más potente. El HLR no es un estándar de la industria: su valor depende del modelo base, el modelo de referencia, la versión del benchmark y los controles de evaluación. 2
4
En DeepSWE, Floatboat informó de que Flash pasó de 54,4 puntos con el arnés de DeepSeek a 67,25 con el suyo: una mejora de 12,85 puntos. El resultado citado para Opus 4.8 era de 58,0, es decir, una diferencia de 3,6 puntos sobre la base de DeepSeek. Eso produce un HLR aproximado de 3,57. 3
Floatboat también indicó que el HLR aumentó de 0,78 en la tarea más corta a 3,57 en la más larga. Si otros equipos consiguen reproducir el patrón, respaldaría la idea de que las mejoras del entorno de ejecución se vuelven desproporcionadamente valiosas cuando una tarea exige más estado, llamadas a herramientas y recuperación. No debe tratarse, sin embargo, como una ley universal: cambiar el sistema de referencia o la configuración de evaluación modificaría el resultado.
Las descripciones públicas presentan Floatboat como un entorno de trabajo nativo para agentes orientado a profesionales independientes y negocios de una sola persona. Su propuesta combina archivos, navegación web, interacciones con IA, calendarios, comunicaciones y habilidades o flujos de trabajo reutilizables. 1 En un anuncio de lanzamiento de mayo de 2026, la empresa describió su apuesta por flujos de trabajo proactivos activados por el calendario e identificó a Sequoia y Welight Capital como inversores.
18
Esta visión coloca el entorno de ejecución en el centro, en lugar de tratarlo como una simple capa alrededor de un modelo de lenguaje. El agente debe mantener el contexto entre aplicaciones, actuar en el momento adecuado, respetar permisos y avanzar sin obligar al usuario a reconstruir manualmente cada paso.
Si el resultado supera pruebas independientes, la ventaja competitiva de los agentes cotidianos podría desplazarse hacia la infraestructura de ejecución: gestión segura del estado, observabilidad, verificación, recuperación, permisos y control por parte del usuario.
También abriría una estrategia más flexible para elegir modelos. Los modelos económicos podrían encargarse de trabajos rutinarios dentro de un entorno bien diseñado, mientras que los modelos premium quedarían reservados para tareas que realmente requieran razonamiento o criterio más profundos. El mejor producto no sería necesariamente el modelo más barato ni el más potente por separado, sino el sistema capaz de utilizar cada modelo donde resulte más eficaz.
La cautela sigue siendo esencial. El documento técnico de Floatboat es la principal evidencia disponible sobre el experimento del 7 de agosto, y la propia empresa reconoce que las comparaciones generales entre modelos utilizan arneses y configuraciones de evaluación diferentes. Para convertir las «cinco victorias» en un resultado consolidado de la industria harían falta nuevas ejecuciones independientes, artefactos de evaluación publicados y controles más estrictos sobre instrucciones, presupuestos, herramientas, reintentos y versiones de los datos. 3
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Floatboat afirma que el mismo DeepSeek V4 Flash superó a Claude Opus 4.8 en cinco benchmarks de agentes tras cambiar únicamente el arnés de ejecución; el resultado aún no cuenta con replicación independiente.
Floatboat afirma que el mismo DeepSeek V4 Flash superó a Claude Opus 4.8 en cinco benchmarks de agentes tras cambiar únicamente el arnés de ejecución; el resultado aún no cuenta con replicación independiente. Con una proporción de 3:1 entre tokens de entrada y salida, el coste combinado declarado fue de 0,175 dólares por millón de tokens para DeepSeek frente a 10 dólares para Opus: unas 57,1 veces más caro.
Las mejoras comunicadas crecieron del 1,9 % en las tareas más cortas al 23,6 % en las más largas, lo que apunta al valor de la persistencia, las herramientas, la verificación y la recuperación.