PrismML lanzó el 17 de septiembre Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8-27B, el modelo de Alibaba, cuyos pesos de lenguaje ocupan 5.95 GB en su archivo más compacto, frente a unos 54 GB de la referencia FP16. La empresa afirma que conserva 98.2% del promedio de rendimiento de la versión original en sus propios benchmarks. El avance puede ampliar la ejecución local de un modelo de 27B, pero no prueba que ya funcione de forma general en smartphones: el tamaño anunciado no incluye cada componente ni equivale a toda la memoria necesaria para ejecutarlo.
Los 5.95 GB cubren el modelo de lenguaje, no todo el sistema
La reducción viene de reemplazar la mayoría de los pesos, los valores que el modelo aprende durante el entrenamiento, por valores ternarios: -1, 0 o +1, con escalas FP16 por grupos. El paquete más compacto, PTQ1_0, ocupa 5.95 GB; PrismML también ofrece otro empaquetado de 7.21 GB. La torre de visión se descarga por separado y añade 0.63 GB si se necesitan entradas de imagen.
Por eso, 5.9 GB es una descripción válida de los pesos de lenguaje, pero no del tamaño de todas las variantes multimodales ni del consumo completo de memoria al usar el modelo. PrismML afirma que Bonsai 2 puede ejecutarse mediante CUDA y MLX, con soporte para Mac, iPhone y iPad, aunque sus mediciones públicas de velocidad corresponden a GPUs de Nvidia y laptops Apple, no a un teléfono.
Este es un seguimiento del Bonsai 27B que FomoEra cubrió en julio, cuando PrismML promocionó una variante de 3.9 GB y una demostración en iPhone. Para Bonsai 2, la compañía no publicó un modelo de teléfono compatible, un mínimo de RAM ni una prueba de rendimiento móvil. TechCrunch lo resume con cautela: el archivo podría caber en un smartphone de gama alta, no que el modelo ya esté listo para cualquier celular.
El 98.2% no equivale a paridad en cada prueba
PrismML calcula esa retención a partir de promedios propios. Su ficha de modelo reporta 84.78 puntos para Bonsai 2 y 86.32 para Qwen3.8-27B FP16 en 14 benchmarks de modo de razonamiento, una relación que redondea a 98.2%. La página de lanzamiento usa otro agregado, 83.9 frente a 85.4, y también llega a 98.2%; los materiales consultados no explican por qué cambian la suite y los puntajes.
El desglose confirma que la compresión no afecta a todas las capacidades por igual. En la ficha, matemáticas pasa de 97.06 a 96.57 y programación de 89.07 a 89.42, mientras visión baja de 71.36 a 66.19 y conocimiento y razonamiento de 85.55 a 79.86. PrismML describe esas pruebas como evaluadas con EvalScope y vLLM sobre una Nvidia H100; al ser resultados publicados por la propia empresa, el porcentaje aún no es una validación independiente ni una garantía para tareas de producción.
La novedad no es que un archivo de 5.95 GB convierta cualquier teléfono en una estación de IA. Es que PrismML ya pone a prueba una compresión de más de nueve veces para un modelo de 27B que puede correr localmente en hardware mucho más accesible que su referencia FP16. Lo que falta confirmar fuera de sus propios laboratorios es cuánto de esa ventaja sobrevive en móviles, contextos largos y flujos reales de agentes.