Hark se apartó deliberadamente del paradigma estándar de los modelos de lenguaje de gran escala (LLM). En lugar de predecir la siguiente palabra en una secuencia de texto, el modelo de Handoff está diseñado para predecir la siguiente acción en la interfaz gráfica de usuario: un clic, un desplazamiento o una entrada de teclado en una ubicación específica de la pantalla . La versión actual utiliza un modelo post-entrenado (ajustado a partir de una base existente), con planes de transitionar al pre-entrenamiento desde cero más adelante en 2026
. Hark afirma que este enfoque le permite iterar más rápidamente en los pipelines de datos y métodos de entrenamiento antes de comprometerse con una ejecución completa de pre-entrenamiento
.
Hark afirma que Handoff obtuvo la puntuación más alta hasta la fecha en el benchmark Online-Mind2Web (OM2W), un estándar de la industria evaluado por humanos para el rendimiento de la IA en navegación web . Las puntuaciones reportadas son:
El precio se sitúa en $0.18 por millón de tokens de entrada y $2.37 por millón de tokens de salida, menos de una décima parte del costo de GPT-5.5 ($5 de entrada / $30 de salida) . Hark afirma que Handoff es más rápido y dramáticamente más barato que los modelos de frontera de OpenAI, Anthropic y Google para tareas de uso web
. Estas son afirmaciones de la compañía en un benchmark de terceros; la verificación independiente de las tasas de finalización de tareas del mundo real y las comparaciones de costos aún no está disponible.
A agosto de 2026, Handoff se encuentra en una fase de vista previa de investigación cerrada. Los usuarios pueden registrarse en una lista de espera en el sitio web de Hark. Se espera un lanzamiento público completo para finales del verano de 2026 . El stack tecnológico aún está en evolución: el modelo está post-entrenado por ahora, con pre-entrenamiento planeado antes de que finalice el año
.