Saltar al contenido
IA

TypeSafe sale del sigilo con 40 mdd y una IA que no escribe: en su prueba empata con Sonnet 5

TypeSafe, la startup de Diogo Almeida, coautor de InstructGPT, levantó 40 mdd y lanzó Jev, un modelo que responde con probabilidades en vez de texto. Cuesta 42 dólares por mil millones de tokens de entrada y, en su propia prueba, promedia la misma exactitud que Claude Sonnet 5.

por Patricia Rodriguez
Close-up of colorful programming code displayed on a computer monitor with a dark background.
Foto de Nemuel Sereti en Pexels

TypeSafe AI, el laboratorio de San Francisco fundado por el exinvestigador de OpenAI Diogo Almeida, salió del sigilo el 15 de septiembre de 2026 con 40 millones de dólares en financiamiento semilla encabezado por DCVC. Su primer modelo público, Jev, no redacta texto: contesta preguntas acotadas con probabilidades que un programa puede usar tal cual. TypeSafe lo vende por velocidad y precio, con cifras como 193.6 veces más rápido y 444.6 veces más barato, pero su propio sitio de evaluaciones ofrece una lectura más sobria. Con las respuestas de otros dos modelos como referencia, Jev promedia 67.8% de exactitud en cuatro flujos de trabajo, igual que Claude Sonnet 5 y por debajo de Sol, de OpenAI (74.1%), y de Claude Opus 5 (73.1%). Su ventaja está en el costo y el tiempo: 0.0004 dólares y 0.4 segundos por caso.

Jev contesta con probabilidades y el código decide

Jev es el primer System One Model de TypeSafe, una categoría que la empresa bautizó a partir de la distinción de Daniel Kahneman entre el pensamiento rápido e intuitivo y el lento y deliberado. El desarrollador le envía un estado, que puede ser texto o datos de su programa, junto con preguntas tipadas que define de antemano, y el modelo devuelve todas las respuestas en una sola consulta, cada una con su probabilidad. La documentación describe tres tipos de pregunta: Choice, para elegir entre opciones de una lista; Score, para calificar en una escala; y Noul, que estima de 0 a 1 si una afirmación es verdadera.

La lógica queda del lado del software. En lugar de pedirle a Jev que califique la propuesta de una startup, la documentación recomienda preguntar por separado por el tamaño del mercado, la viabilidad técnica y la diferenciación, y combinar los puntajes con una fórmula propia. TypeSafe asegura que cada pregunta se evalúa en paralelo y de forma aislada, así que sumar preguntas casi no altera el tiempo de respuesta.

Mike Taylor, jefe de evaluaciones de Every, lo explicó con un caso de atención al cliente. Si el programa pregunta si un cliente suena enojado, Jev puede devolver 0.9, una probabilidad estimada de 90%, y el software decide si escala la queja a un gerente. Un chatbot, en cambio, está entrenado para contestar con texto elaborado, y esa respuesta hace fallar a un programa que esperaba un número entre 0 y 1. Taylor escribió que resolver eso de forma nativa vuelve a Jev muy rápido y barato, y advirtió que todavía no está claro qué tan bien hace el trabajo.

Man analyzing design flowchart on whiteboard in a professional office setting.
Imagen ilustrativa: con Jev, el modelo responde preguntas acotadas y el código decide qué hacer con cada probabilidad · Foto de Christina Morillo en Pexels

El precio completa el argumento. TypeSafe cobra 0.042 dólares por millón de tokens de entrada, o 42 dólares por cada mil millones, y no cobra la salida porque, según la empresa, cuesta demasiado poco para medirla. Su propia comparación sitúa la entrada de los modelos de lenguaje actuales entre 0.20 y 10 dólares por millón. Jev está en acceso anticipado y la compañía va dando entrada a desarrolladores desde una lista de espera. El nombre viene de William Stanley Jevons: TypeSafe espera que abaratar la inteligencia multiplique sus usos, como ocurrió con la demanda de carbón cuando las máquinas de vapor se volvieron más eficientes.

Cada cifra del lanzamiento mide algo distinto

El comunicado habla de un modelo hasta 100 veces más rápido y barato que otros de frontera, con menos de 100 milisegundos de latencia. El anuncio de Almeida, publicado un día antes, calcula de 40 a 200 veces más velocidad y respuestas de 70 a 500 milisegundos, y la portada de TypeSafe destaca 193.6 veces más rapidez y 444.6 veces menos costo. La tabla resume qué respalda cada cifra, según los propios materiales de la empresa.

Cifras de desempeño del lanzamiento de Jev y qué respalda cada una, según los materiales de TypeSafe (septiembre de 2026)
Cifra Dónde aparece Qué mide, según TypeSafe
Hasta 100 veces más rápido y barato; menos de 100 ms de latencia Comunicado del 15 de septiembre Compara con «otros modelos de frontera» sin nombrarlos ni decir en qué tareas
De 40 a 200 veces más rápido; de 70 a 500 ms por respuesta Anuncio de Almeida del 14 de septiembre Consultas con la forma que Jev maneja, frente a modelos de inteligencia similar; en general medidas desde laptops en la costa oeste de EE. UU.
193.6 veces más rápido y 444.6 veces más barato Portada de TypeSafe Sus cuatro flujos de evaluación; la empresa dice que están en el extremo alto de las ganancias reales
0% de alucinaciones Anuncio y portada No es una medición: la empresa garantiza que la respuesta respeta el formato pedido
67.8% de exactitud promedio Sitio de evaluaciones Coincidencia con el promedio de GPT-6 Astra y Claude Fable 5.1, en flujos que armó su propio equipo

La cifra de alucinaciones pide una aclaración aparte. TypeSafe presenta a Jev como un modelo que no puede alucinar, pero su anuncio admite que el 0% de sus gráficas no es empírico: como la respuesta siempre coincide con el esquema pedido, la empresa lo coloca por definición. Las tasas que atribuye a los modelos de lenguaje salen de OpenRouter, y TypeSafe reconoce que ahí casi seguro hay sesgo, porque las consultas más complejas podrían enviarse a mejores modelos.

RuntimeWire, un medio independiente de startups y tecnología con sede en Austin y San Francisco, subrayó que la garantía evita campos inventados y llamadas mal formadas, pero que Jev todavía puede elegir la respuesta equivocada. Para eso están los campos de probabilidad y confianza: el programa fija un umbral para actuar solo y manda los casos dudosos a revisión.

En la prueba de TypeSafe, Jev queda a mitad de la tabla

El sitio de evaluaciones compara nueve modelos en cuatro tareas: incidentes de seguridad, revisión de trazas de agentes, procesamiento de facturas y atención al cliente. Todos reciben el mismo flujo de preguntas y reglas, y TypeSafe da ese flujo por correcto. La respuesta de referencia es el promedio de lo que contestan GPT-6 Astra y Claude Fable 5.1 con razonamiento alto; el resto corre con el razonamiento predeterminado de cada proveedor.

En el promedio, Jev obtiene 67.8%, lo mismo que Claude Sonnet 5 y una décima de punto menos que GPT-5.6 Terra (67.9%), el modelo que TypeSafe considera más comparable al suyo en inteligencia. Sol encabeza con 74.1% y Claude Opus 5 le sigue con 73.1%. La distancia aparece en las otras columnas: Jev gasta 0.0004 dólares y 0.4 segundos por caso, contra 0.0304 dólares y 10.1 segundos de Terra, y 0.1174 dólares y 78.1 segundos de Sonnet 5.

Si se comparan solo las versiones que usan el flujo, el promedio esconde diferencias por tarea. En incidentes de seguridad, el 61.7% de Jev solo queda debajo de Claude Opus 5 (66.2%) y Sol (62.5%), y en atención al cliente su 76.0% se queda a 2.3 puntos porcentuales de Sol (78.3%). En facturas, donde el flujo encadena siete rondas de preguntas, cae a 61.8% y solo supera a Claude Haiku 4.5 (42.9%); ahí Sol alcanza 79.1% y Opus 5, 78.4%.

La misma tabla deja un hallazgo que no depende de Jev. TypeSafe también probó a cada modelo con toda la política metida en un solo prompt, y en el promedio de las cuatro tareas todos resultaron más exactos, baratos y rápidos con el flujo descompuesto. El salto más grande es el de Claude Haiku 4.5, que pasa de 18.1% como prompt único a 53.6% con el flujo.

La propia TypeSafe pone los matices. Los flujos los armaron integrantes de su equipo de capacidades, lo que puede introducir sesgo, aunque la empresa dice que no los eligió para favorecer a Jev y que quedan fuera de la distribución con la que lo entrenó. Usar a GPT-6 Astra y Claude Fable 5.1 como referencia inclina el resultado hacia OpenAI y Anthropic, y la compañía cree que por eso subestima a Jev y a los modelos de DeepSeek. RuntimeWire agregó que el lanzamiento no llegó acompañado de una evaluación independiente, ni de pesos o un artículo con detalle suficiente para que otros reproduzcan los resultados.

Un coautor de InstructGPT que tomó la dirección opuesta al chat

Almeida firmó el artículo de InstructGPT de 2022, el trabajo de OpenAI que ajustó GPT-3 primero con demostraciones de evaluadores humanos y después con aprendizaje por refuerzo a partir de sus clasificaciones de respuestas, la técnica conocida como RLHF. En las evaluaciones humanas de ese artículo, las respuestas del InstructGPT de 1,300 millones de parámetros fueron preferidas sobre las de GPT-3, de 175,000 millones. El comunicado de TypeSafe lo presenta como coinventor de RLHF y de ChatGPT, y RuntimeWire precisa que su nombre figura en los créditos del ChatGPT original y que antes trabajó en Google Brain.

Su anuncio arranca con una pregunta: «Los modelos llevan años siendo sobrehumanos en el chat, así que ¿dónde está toda la automatización?». La portada de TypeSafe sostiene que el RLHF optimiza para lo que prefieren las personas y arrastra problemas como el exceso de confianza y la falta de fiabilidad, por lo que los modelos de lenguaje necesitan a un humano en el circuito. Jev se entrena con otro método, que la empresa llama aprendizaje por refuerzo para decisiones calibradas (RLCD), y TypeSafe afirma que en su modelo una confianza más alta significa una exactitud más alta.

Almeida fundó TypeSafe en 2024 con Erik Gafni y Sasha Sheng. Según RuntimeWire, Sheng trabajó en ingeniería de investigación en Meta y FAIR, y Gafni creó antes Ravel, una startup de IA para genómica, además de pasar por Invitae y Freenome. En el comunicado, Almeida dijo que pasó años en modelos diseñados para que la IA interactuara mejor con las personas, pero que estas no pueden ser las únicas consumidoras de inteligencia si la IA va a cambiar de fondo cómo se trabaja. «Con el tiempo, la mayor parte de la inteligencia debería vivir dentro del software, funcionando en silencio en segundo plano», agregó.

James Hardiman, socio general de DCVC, dijo que TypeSafe ataca uno de los mayores retos pendientes de la IA: convertir modelos cada vez más capaces en tecnología que los desarrolladores puedan integrar en productos con fiabilidad y a escala. Dealroom ubica la ronda en el percentil 99 de las rondas semilla de IA de su muestra histórica, que suma 28,473 operaciones.

Otro firmante de aquel artículo, John Schulman, cofundador de OpenAI y hoy científico jefe de Thinking Machines, calculó el 11 de septiembre en el podcast de Dwarkesh Patel que en tres o cuatro años habrá una IA capaz de superar a los mejores expertos humanos en cualquier trabajo frente a una computadora. En esa conversación también describió cómo un modelo nuevo deslumbra y al mes empieza a parecer torpe, cuando los usuarios chocan con las zonas donde juzga peor o no sabe revisarse a sí mismo, como contamos.

Schulman ve la superinteligencia en 3 o 4 años
Schulman calcula 3 o 4 años para una IA que supere a los mejores expertos; sus colegas, entre 5 y 10.

Los 40 millones le dan a TypeSafe margen para sacar su tesis del laboratorio. La empresa considera fáciles de comprobar la velocidad y el precio por llamada, aunque admite que no puede demostrar que su tarifa no esté subsidiada. La exactitud, que es lo que decide si un programa puede actuar sin supervisión, llegó al lanzamiento sin una evaluación independiente, como señaló RuntimeWire.

Fuentes: 1, 2, 3, 4

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia