El costo de ejecutar agentes de IA está obligando a varias startups a cambiar de estrategia: Harvey, Abridge, Ramp y Rogo están adaptando modelos de pesos abiertos o evaluando entrenar los suyos para reducir la factura y la dependencia de OpenAI y Anthropic. Harvey, cuya valuación ronda los 15,600 millones de dólares, vio caer su margen bruto de cerca de 50% al inicio de 2026 a menos 50% en junio, según una persona familiarizada con sus finanzas citada por Bloomberg en un reporte reseñado por The Next Web. Tras lanzar en agosto un modelo basado en Kimi K3, sus márgenes volvieron a ser positivos después de ese lanzamiento y otros cambios, aunque la empresa no confirmó las cifras. El movimiento convierte el modelo de IA en una decisión de costos y control, no solo de rendimiento.
Harvey descubrió el costo de crecer con modelos ajenos
La presión apareció cuando el uso de Harvey se disparó. La empresa dijo que su consumo de tokens aumentó más de 20 veces desde enero, mientras una actualización de sus agentes en marzo elevó la actividad de los clientes. Cuando cada tarea depende de modelos alquilados y cada respuesta consume más tokens, el crecimiento puede deteriorar el margen aunque también aumenten los ingresos.
En agosto, Harvey lanzó Tenet, su primer modelo postentrenado sobre Kimi K3, de Moonshot AI, con apoyo de Fireworks. La compañía no entrenó una base desde cero: tomó un modelo de pesos abiertos y lo ajustó para trabajos jurídicos de largo alcance. En sus propias pruebas, Harvey afirmó que Tenet completó casi el doble de tareas reservadas de su benchmark LAB que el Kimi K3 original y 20% más tareas de LAB Contracts. También sostuvo que los pesos abiertos permiten reducir el costo por token y que el entrenamiento buscó disminuir los tokens usados durante la inferencia.
Este giro ya tenía un antecedente público. Nuestra cobertura previa sobre Harvey Tenet explicó que la empresa estaba probando varias bases abiertas para funciones jurídicas distintas. Lo nuevo del reporte es el impacto financiero atribuido a ese cambio: personas familiarizadas con el trabajo dijeron que el margen bruto volvió a terreno positivo tras el lanzamiento y otros ajustes de uso. Harvey declinó comentar sus cifras específicas.
La misma cuenta aparece en salud, soporte y finanzas
Abridge confirmó en junio que trabaja con NVIDIA en un modelo fundacional para conversaciones clínicas. La startup está construyéndolo sobre la familia abierta Nemotron, con entrenamiento en infraestructura Blackwell y datos desidentificados. Su objetivo declarado es mejorar la precisión, la auditabilidad y la personalización de tareas médicas, una muestra de por qué una empresa vertical puede preferir controlar una parte mayor de su modelo.
El patrón también aparece fuera de la salud. Según el reporte, Decagon ya dirige 80% de las consultas de sus clientes a modelos propios. Ramp, que recaudó 750 millones de dólares en junio, está evaluando entrenar modelos por primera vez. Su co-CEO Karim Atiyeh dijo que esa opción no tenía sentido un año atrás, pero que la mejora de los modelos de pesos abiertos cambió el cálculo. Rogo, una startup de software para instituciones financieras, también estudia seguir esa ruta.
La lectura que dejan estos casos es más específica que la construcción de un rival general de GPT o Claude. Adaptar un modelo abierto para una tarea repetitiva y especializada permite conservar mayor control sobre los datos, el comportamiento del sistema y el costo de cada flujo de trabajo, mientras se reserva el acceso a modelos de frontera para los trabajos que todavía requieren más capacidad.
Los modelos propios no reemplazan todo
La estrategia tampoco elimina la dependencia de los grandes laboratorios. The Next Web reportó que Anthropic mostró en un foro para inversionistas una diapositiva sobre startups que entrenan sus propios modelos, junto con el recordatorio de que Harvey todavía necesita Claude Opus para sus tareas más difíciles. La propia Harvey presenta Tenet como una investigación en desarrollo y dice que incorporará sus capacidades al producto con el tiempo.
La lectura más prudente es que se está extendiendo una arquitectura híbrida. Los modelos abiertos o postentrenados pueden atender tareas de alto volumen donde el precio por token y la eficiencia pesan mucho; los sistemas de OpenAI o Anthropic siguen cubriendo trabajos más complejos cuando la calidad justifica el costo. Harvey incluso advierte en su investigación que el costo no depende solo del precio de cada token, sino también de cuántos tokens necesita el sistema para completar una tarea.
Para estas startups, la pregunta dejó de ser únicamente qué modelo obtiene el mejor resultado en una prueba. También deben saber cuánto cuesta resolver cada expediente, conversación clínica, consulta de soporte o análisis financiero. Las cifras de margen de Harvey no son públicas ni una prueba universal, pero muestran por qué el control de la capa de modelos se convirtió en una decisión de negocio.