PrismML Bonsai 2 27B Reduce la IA Local, pero las Pruebas Más Difíciles Aún Importan
PrismML lanzó Bonsai 2 27B el 17 de septiembre, comprimiendo un modelo de 27.000 millones de parámetros en un paquete de 5,9 GB para hardware de consumo. La empresa afirma que PrismML Bonsai 2 27B conserva el 98,2 % del rendimiento agregado en benchmarks de su equivalente de precisión completa.
Esa combinación cambia los cálculos sobre la IA local. Antes, los desarrolladores tenían que elegir entre modelos más pequeños que cabían cómodamente y modelos más grandes con un razonamiento más sólido. Bonsai 2 desafía ese compromiso al situar un sistema multimodal de clase 27B dentro del rango de memoria de los portátiles y las tarjetas gráficas de consumo.
Sin embargo, que los pesos quepan es solo la primera prueba. Los resultados agregados de PrismML son reportados por el proveedor, varios formatos de empaquetado ocupan más de 5,9 GB y el modelo depende actualmente de componentes de runtime personalizados. La mayor incógnita es si los modelos locales compactos pueden seguir siendo fiables durante tareas largas impulsadas por herramientas.
PrismML Bonsai 2 27B Integra IA de Clase 27B en 5,9 GB
El lanzamiento es relevante porque PrismML redujo la huella del modelo de lenguaje sin modificar la arquitectura subyacente de 27B.
Bonsai 2 se deriva de Qwen3.8-27B, un modelo multimodal que procesa texto e imágenes. PrismML mantuvo la arquitectura mientras convertía la mayoría de los pesos del modelo de lenguaje a una representación ternaria.
Los pesos ternarios utilizan tres valores posibles: menos uno, cero y uno. Un valor de escala compartido permite al runtime traducir esos valores compactos en operaciones numéricas útiles durante la inferencia.
Esta representación difiere de simplemente eliminar parámetros o sustituir el modelo por una arquitectura más pequeña. Bonsai 2 sigue conteniendo aproximadamente 27.000 millones de parámetros, pero cada peso comprimido requiere mucho menos almacenamiento que un valor convencional de 16 bits.
El anuncio de lanzamiento de PrismML describe un modelo de 27.800 millones de parámetros entrenado con TPU v5 de Google. Sus materiales de modelo más detallados enumeran 27.360 millones de parámetros totales, incluidos el backbone de lenguaje, las capas de embeddings, la cabeza de salida y la torre de visión.
El paquete GGUF publicado más pequeño utiliza el formato PTQ1_0 de PrismML. Almacena el componente de lenguaje en aproximadamente 5,95 GB, frente a unos 54 GB de la referencia de precisión completa.
Un segundo paquete GGUF, denominado PQ2_0, ocupa alrededor de 7,21 GB. Los pesos de lenguaje MLX para dispositivos Apple usan unos 7,67 GB porque ese contenedor almacena información adicional de escalado.
El paquete MLX completo alcanza 8,60 GB tras añadir la torre de visión sin comprimir de 0,92 GB. Por tanto, la cifra destacada de 5,9 GB describe el empaquetado más pequeño del modelo de texto, no todas las configuraciones descargables.
Esa distinción no elimina el logro. Incluso los paquetes más grandes siguen estando muy por debajo del requisito de memoria del modelo de precisión completa. Sin embargo, afecta a lo que compradores y desarrolladores deben esperar de una descarga específica.
Según su documentación, el modelo conserva una capacidad de contexto de 262.144 tokens. Una ventana de contexto es la cantidad de texto u otra información tokenizada que un modelo puede procesar durante una interacción.
Bonsai 2 también preserva la arquitectura de atención híbrida de Qwen3.8-27B. Aproximadamente tres cuartas partes de sus capas utilizan atención lineal, lo que limita el crecimiento de memoria asociado a prompts largos.
PrismML publicó los pesos bajo la licencia Apache 2.0. La empresa ofrece compilaciones GGUF para implementaciones basadas en llama.cpp y una versión MLX para hardware de Apple.
Esa disponibilidad otorga a los desarrolladores más control que un servicio exclusivamente en la nube. Los equipos pueden inspeccionar los archivos, ejecutar inferencia dentro de su propio entorno y probar el modelo sin enviar cada prompt a un proveedor externo.
El lanzamiento se basa en el primer modelo Bonsai 27B de PrismML, presentado en julio de 2026. Esa generación anterior estableció el enfoque de compresión de la empresa, mientras que Bonsai 2 lo aplica a un modelo base Qwen más reciente.
El nuevo lanzamiento eleva la retención de rendimiento agregado declarada de aproximadamente el 95 % al 98,2 %. Más importante aún, desplaza la propuesta de PrismML de ejecutar un modelo grande localmente a preservar suficiente calidad para trabajo serio.
Por Qué un Modelo Local de 27B Presiona a las Alternativas Más Pequeñas
Bonsai 2 cuestiona la suposición de que la implementación local exige bajar a un modelo de clase 8B.
Los usuarios de modelos locales suelen equilibrar tres restricciones conectadas: memoria, velocidad de respuesta y calidad de salida. Aumentar el tamaño del modelo puede mejorar la capacidad, pero también eleva los requisitos de almacenamiento, ancho de banda de memoria y runtime.
La cuantización convencional reduce esos requisitos al representar los pesos del modelo con menos bits. Sin embargo, una cuantización agresiva puede perjudicar el rendimiento de forma desigual, especialmente en tareas que implican razonamiento extendido o seguimiento preciso de instrucciones.
PrismML sostiene que su enfoque ternario modifica esta curva. Su model card informa de un promedio real de 1,72 bits por peso para la representación central.
En la evaluación de PrismML de 14 benchmarks en modo de razonamiento, la compilación Bonsai de 5,9 GB registró una puntuación media de 84,78. La referencia Qwen3.8-27B de precisión completa obtuvo 86,32.
Una compilación convencional IQ2_XXS ocupaba 9,4 GB en la misma comparación y obtuvo 72,59. Una compilación UD-Q4_K_XL más grande alcanzó 85,18 utilizando 17,6 GB.
Estas cifras respaldan una afirmación limitada pero importante. Dentro de la configuración de pruebas de PrismML, Bonsai 2 preservó sustancialmente más calidad agregada que la comparación convencional de pocos bits.
La compresión también permite que el modelo de lenguaje completo permanezca en memoria rápida en más dispositivos. Cuando los pesos se trasladan a una memoria de sistema más lenta, la inferencia puede volverse demasiado lenta para un uso interactivo.
PrismML informa de hasta 143 tokens generados por segundo en una Nvidia GeForce RTX 5090. Sus mediciones de Apple incluyen aproximadamente 47 tokens por segundo en un M5 Max y 28,7 en un M5 Pro.
Estos resultados son específicos del hardware y proceden de la empresa. No deben tratarse como velocidades universales, porque la longitud del prompt, el formato de empaquetado, el runtime y las condiciones térmicas afectan al rendimiento.
Aun así, el rango de implementación es significativo. Un desarrollador puede ejecutar potencialmente un asistente privado de programación en una estación de trabajo, mientras que un portátil Apple puede alojar un competente modelo local de investigación o documentos.
Eso ejerce presión sobre los modelos más pequeños de propósito general. Un modelo de 8B mantiene ventajas en tiempo de arranque, sobrecarga de memoria y soporte en hardware más antiguo. Sin embargo, el tamaño de memoria por sí solo se convierte en una razón más débil para elegirlo si un modelo comprimido de 27B cabe en el mismo dispositivo.
Los proveedores de nube enfrentan una presión distinta. La inferencia local puede eliminar la latencia de red y mantener los prompts dentro del perímetro de seguridad de una organización.
Pensemos en un equipo de ingeniería que trabaja con código fuente propietario. Un modelo local puede revisar archivos, generar pruebas y buscar documentos técnicos sin transmitir el repositorio a un servicio remoto de inferencia.
La misma lógica se aplica a registros personales, notas internas de reuniones y documentos regulados. Los equipos pueden combinar un modelo local con una base de conocimiento con capacidad de búsqueda mientras mantienen la recuperación y la generación cerca del material de origen.
Los modelos en la nube seguirán siendo preferibles para muchas tareas exigentes. Pueden ofrecer capacidades más sólidas, escalado gestionado y soporte operativo maduro.
Por tanto, el desafío inmediato no es que la IA local sustituya a la nube. Es que los modelos locales se vuelvan lo bastante capaces para asumir una porción mayor del trabajo rutinario, privado y sensible a la latencia.
La Compresión Ternaria Es el Mecanismo Detrás de la Menor Huella
Bonsai 2 reduce el tráfico de memoria al almacenar la mayoría de los pesos de lenguaje como códigos compactos de tres valores que los kernels personalizados procesan directamente.
La inferencia estándar de precisión completa suele almacenar cada peso con 16 bits. Para un modelo denso con decenas de miles de millones de parámetros, esos valores generan una gran huella de memoria antes de considerar el estado del runtime.
Bonsai 2 asigna a cada peso comprimido uno de tres valores. PrismML agrupa 128 pesos bajo una escala compartida de 16 bits, llevando su representación efectiva declarada a aproximadamente 1,71 bits por peso.
Un pequeño conjunto de tensores de mayor precisión eleva el promedio de todo el modelo a 1,72 bits. PrismML afirma que esos tensores representan aproximadamente el 0,098 % del modelo de lenguaje.
La conversión también utiliza una rotación de Hadamard, una transformación matemática aplicada antes de la asignación ternaria. Redistribuye valores inusualmente grandes que, de otro modo, pueden hacer que la cuantización de pocos bits sea menos precisa.
En tiempo de ejecución, se aplica una transformación equivalente a las activaciones, que son los valores intermedios generados a medida que la entrada avanza por la red. Los pesos empaquetados permanecen comprimidos en lugar de expandirse de nuevo a precisión completa.
Este diseño importa porque la inferencia local suele estar limitada por el ancho de banda de memoria. El procesador mueve repetidamente los pesos desde la memoria mientras produce tokens, por lo que reducir los bytes transferidos por paso puede mejorar la velocidad y el consumo energético.
El repositorio del runtime admite implementaciones CUDA, Metal, Vulkan, ROCm y orientadas a CPU en diferentes generaciones de Bonsai. También ofrece servicio local, visión e integraciones de herramientas.
Bonsai 2 tiene una limitación de compatibilidad en el lanzamiento. La transformación requerida de activación Hadamard aún no se ha incorporado al proyecto estándar llama.cpp.
Actualmente, los usuarios deben depender del fork de PrismML o de los binarios instalados por sus scripts de configuración. Eso crea una dependencia de la implementación y el ritmo de lanzamientos de la empresa.
La diferencia entre los formatos de empaquetado añade otra capa. PTQ1_0 utiliza un almacenamiento más denso y alcanza el tamaño destacado de 5,95 GB, mientras que PQ2_0 sitúa cada valor ternario en una ranura de dos bits.
El empaquetado más denso reduce el tráfico de memoria, pero decodificarlo requiere más operaciones aritméticas. Las mediciones de PrismML muestran que ninguno de los formatos es siempre más rápido en todos los procesadores gráficos.
La versión Apple MLX presenta otra concesión. Su contenedor almacena tanto una escala como un sesgo para cada grupo, aumentando el paquete del modelo de lenguaje a 7,67 GB.
Por ello, los desarrolladores deberían elegir un formato según su runtime real, en lugar de descargar automáticamente el archivo más pequeño. La compilación óptima depende de la memoria disponible, los kernels compatibles, la generación del procesador y las necesidades de procesamiento de prompts.
El sistema de visión también queda fuera de la narrativa principal de compresión. PrismML incluye la torre de visión de 0,92 GB de Qwen en precisión completa, en lugar de convertirla a pesos ternarios.
Esta decisión ayuda a explicar por qué un paquete multimodal completo ocupa más almacenamiento que la cifra de 5,9 GB para texto. También puede proteger la calidad de visión frente a pérdidas adicionales por cuantización.
En términos prácticos, Bonsai 2 no es simplemente un archivo diminuto que funciona en todas partes. Es un sistema coordinado de modelo y runtime cuyas ventajas dependen de kernels compatibles de pocos bits.
Eso hace que el lanzamiento sea técnicamente más interesante que una carga convencional de cuantización posterior al entrenamiento. También convierte la adopción del ecosistema en una parte esencial de la historia.
La Afirmación del 98,2 % Requiere una Lectura Más Detallada
El resultado agregado de los benchmarks es alentador, pero no significa que Bonsai 2 preserve el 98,2 % de cada capacidad o flujo de trabajo.
El anuncio público de PrismML cita una puntuación agregada de 83,9 en un conjunto de 20 benchmarks. Compara ese resultado con 85,4 para Qwen3.8-27B, lo que produce la cifra declarada de retención del 98,2 %.
La ficha técnica detallada presenta una agregación distinta de 14 benchmarks. Allí, Bonsai 2 obtiene 84.78 frente a 86.32 en precisión completa, lo que también equivale a aproximadamente un 98.2%.
Ambos cálculos son reportados por la empresa. Las diferentes suites y totales no deben combinarse como si representaran una única prueba reproducida de forma independiente.
El rendimiento también varía según la categoría. En los resultados de 14 benchmarks, Bonsai 2 obtiene 96.57 en cuatro pruebas de matemáticas, frente a 97.06 con precisión completa.
Su categoría de programación alcanza 89.42, ligeramente por encima de la puntuación de referencia de 89.07. El seguimiento de instrucciones también sube de 81.25 a 82.66.
Esas pequeñas mejoras no demuestran que la compresión mejore el modelo subyacente. El muestreo de benchmarks, las variaciones de puntuación y el comportamiento de decodificación pueden producir inversiones modestas.
Las pérdidas más grandes aparecen en conocimiento, razonamiento y visión. Bonsai 2 registra 79.86 en la categoría combinada de conocimiento y razonamiento, frente a 85.55 para la referencia.
Su promedio de visión cae a 66.19 desde 71.36. En OCR Bench v2, que evalúa el reconocimiento de texto en imágenes, Bonsai 2 obtiene 56.88 frente a 60.99.
Estas diferencias importan en flujos de trabajo intensivos en documentos. Un modelo puede seguir siendo fuerte en matemáticas y código mientras pierde precisión al interpretar capturas de pantalla, formularios escaneados, gráficos o evidencia visual detallada.
El resultado agéntico también exige cautela. Bonsai 2 obtiene 74.92 en BFCL v3, un benchmark de llamadas a herramientas, frente a 76.74 con precisión completa.
Se trata de una brecha agregada relativamente pequeña. Sin embargo, una sola prueba de llamadas a herramientas no puede establecer la fiabilidad en ciclos agénticos prolongados.
Los sistemas agénticos amplifican los errores. Una selección de archivo, comando o conclusión intermedia ligeramente incorrecta puede cambiar cada paso posterior.
La capacidad de contexto largo plantea una distinción similar. Admitir 262,144 tokens significa que la arquitectura y el entorno de ejecución pueden aceptar esa cantidad. No garantiza una recuperación ni un razonamiento consistentes en todas las posiciones.
Las pruebas independientes serán más importantes aquí. Los evaluadores deberían comparar los mismos conjuntos de prompts, versiones del entorno de ejecución, tamaños de contexto y ajustes de decodificación entre Bonsai 2 y Qwen de precisión completa.
Los primeros informes prácticos ya son mixtos. Un usuario informó haber ejecutado el modelo íntegramente en un Mac mini M2 con 8GB a unos 7.6 tokens por segundo, lo que respalda la afirmación básica de que cabe en ese equipo.
Otros usuarios tempranos han cuestionado su comportamiento ante prompts complejos y razonamientos prolongados. Estos informes son anecdóticos, específicos del hardware y demasiado tempranos para establecer un perfil de calidad estable.
La cobertura de SiliconANGLE describe correctamente las cifras de rendimiento y eficiencia como afirmaciones de la empresa. Esa distinción debe seguir siendo visible hasta que maduren las evaluaciones independientes.
PrismML ha demostrado claramente un lanzamiento inusualmente compacto con pesos públicos y archivos reproducibles. Aún no ha establecido que cada carga de trabajo exigente experimente solo una pérdida de capacidad del 1.8%.
La IA local mejora la privacidad, pero el despliegue sigue teniendo costes
Bonsai 2 amplía lo que puede permanecer local, aunque el autoalojamiento traslada la responsabilidad operativa del proveedor al usuario.
El caso de uso más claro es el procesamiento privado de documentos. Un usuario podría resumir notas locales, extraer información de archivos internos o buscar en una colección de conocimiento sensible sin subir el material fuente.
El desarrollo de software es otro objetivo lógico. Un asistente de programación alojado localmente puede inspeccionar un repositorio, proponer parches, llamar a herramientas de desarrollo y generar pruebas dentro del límite de acceso existente de la estación de trabajo.
El soporte multimodal añade tareas basadas en imágenes. Los equipos podrían analizar capturas de interfaces, extraer texto de documentos o combinar diagramas con instrucciones escritas.
Sin embargo, la brecha en benchmarks de visión implica que esos escenarios necesitan validación. El reconocimiento óptico de caracteres de alto riesgo no debería depender de una puntuación agregada general.
La inferencia local puede reducir la exposición a terceros, pero no convierte automáticamente una aplicación en segura. Un servidor de modelos aún puede configurarse incorrectamente, quedar expuesto a una red o recibir permisos excesivos para archivos y comandos.
El servidor de demostración de PrismML se vincula a una dirección local de forma predeterminada, según su documentación. Los usuarios que cambien esa dirección pueden exponer el servicio más allá de la máquina.
Los agentes que usan herramientas introducen riesgos adicionales. Un modelo que puede editar archivos o ejecutar comandos necesita límites de permisos, registro y revisión humana.
Los equipos también deben gestionar las actualizaciones del modelo. Un proveedor de nube puede reemplazar la infraestructura de forma centralizada, mientras que los despliegues locales pueden acumular distintos binarios, versiones de pesos y ajustes de configuración entre dispositivos.
El requisito de un entorno de ejecución personalizado aumenta esa carga. Las correcciones de seguridad y los cambios de compatibilidad deben llegar al fork de PrismML antes de que los usuarios los reciban mediante la ruta compatible.
La adecuación del hardware también debe evaluarse con la aplicación completa. Los pesos del modelo son solo una parte del consumo de memoria.
El entorno de ejecución necesita memoria de trabajo, la caché clave-valor almacena el estado del contexto y los componentes multimodales consumen recursos adicionales. Por lo tanto, los prompts largos pueden llevar un dispositivo nominalmente compatible más allá de su límite cómodo.
El funcionamiento con batería presenta otra disyuntiva. PrismML informa de unos 27.5 vatios de potencia de GPU y 34.1 vatios entre CPU y GPU durante la decodificación en un M5 Pro.
Esas mediciones no incluyen todos los componentes del sistema y no pueden compararse directamente con las mediciones de placas Nvidia. Aun así, muestran que la inferencia local no es gratuita.
El mejor patrón de despliegue podría ser híbrido. El trabajo rutinario y sensible puede permanecer en el dispositivo, mientras que las tareas excepcionalmente difíciles se trasladan a un modelo gestionado más potente bajo reglas explícitas.
Esta disposición permite a una organización controlar cuándo los datos salen de la máquina. También evita obligar a un modelo compacto a gestionar tareas donde la calidad importa más que la privacidad o la latencia.
La decisión debería basarse en el rendimiento medido de las tareas, no solo en el número de parámetros. Un equipo debería probar su propio código, documentos, imágenes y secuencias de herramientas antes de reemplazar un servicio existente.
Bonsai 2 hace que esas pruebas sean más accesibles porque sus pesos y recursos de ejecución son públicos. El trabajo pendiente es demostrar que los ahorros operativos compensan los costes de integración y mantenimiento.
Qué observar tras el lanzamiento de Bonsai 2 27B
Tres señales determinarán si Bonsai 2 se convierte en una opción duradera de IA local: evaluaciones independientes, soporte de ejecución upstream y adopción sostenida en producción.
La primera señal es la reproducción independiente de benchmarks. Las pruebas más valiosas compararán Bonsai 2 con Qwen3.8-27B de precisión completa y cuantizaciones convencionales en condiciones idénticas.
Los evaluadores deberían informar de algo más que promedios. Los fallos por tarea, la longitud de las respuestas, los ciclos de razonamiento, la precisión visual y la recuperación en contexto largo revelarán dónde la compresión cambia el comportamiento.
La programación agéntica merece una atención especial. Un benchmark que requiera muchas llamadas a herramientas, navegación por repositorios y ejecución de pruebas ofrece una prueba de estrés mejor que la finalización aislada de código.
Si Bonsai 2 se mantiene cerca de la precisión completa en esas evaluaciones, el argumento de PrismML sobre la densidad de inteligencia será mucho más sólido. Grandes caídas de calidad limitarían los mejores usos del modelo a tareas más simples o tolerantes.
La segunda señal es el soporte en entornos de ejecución convencionales. PrismML afirma que Bonsai 2 actualmente necesita su fork de llama.cpp porque la transformación de activación Hadamard no está integrada upstream.
La aceptación en proyectos ampliamente utilizados reduciría la fricción de instalación y la dependencia de los binarios de un solo proveedor. También expondría la implementación a más revisión, optimización y pruebas de hardware.
Un soporte más amplio de entornos de ejecución puede importar tanto como la calidad en benchmarks. Un formato técnicamente impresionante tendrá dificultades si los desarrolladores no pueden desplegarlo mediante herramientas conocidas.
La tercera señal es la adopción real fuera de las demostraciones. Los recuentos de descargas ofrecen una pista temprana, pero las aplicaciones repetibles y las integraciones mantenidas aportan mejor evidencia.
Los indicadores útiles incluyen asistentes de programación estables, sistemas privados de investigación, búsqueda multimodal local y pilotos empresariales que continúen más allá de la evaluación. Los informes de fallos son igual de valiosos porque identifican las cargas de trabajo para las que un modelo compacto no está preparado.
La competencia también se intensificará. Los modelos convencionales de cuatro bits ya ofrecen una calidad sólida cuando los usuarios tienen más memoria, mientras que los modelos nativos más pequeños siguen siendo más fáciles de ejecutar en hardware modesto.
Bonsai 2 no elimina esas opciones. Introduce un nuevo punto en la curva, combinando un modelo base más grande con una compresión inusualmente agresiva.
Para los desarrolladores, el siguiente paso es realizar pruebas prácticas. Descarguen el paquete adecuado, reproduzcan un benchmark pequeño en la máquina objetivo y evalúen prompts reales antes de ampliar permisos.
Para los compradores empresariales, exijan precisión a nivel de tarea, compromisos de soporte del entorno de ejecución y un modelo de seguridad claro. No traten la cifra del 98.2% como una garantía general de nivel de servicio.
PrismML Bonsai 2 27B ya ha establecido el resultado básico: un modelo de la clase 27B puede ocupar menos de 6GB en su formato más pequeño solo para lenguaje. La cuestión abierta es si esa densidad sigue siendo fiable cuando el trabajo real se vuelve largo, visual y agéntico.
¿Mejoraría un modelo local privado su flujo de trabajo, o sus compromisos de mantenimiento y calidad superarían el control que proporciona? La respuesta ahora depende menos de si cabe un modelo capaz y más de lo que ocurre después.



