Kimi Linear acaba de superar a la atención completa en sus propios términos
- Ethan Carter

- 30 jul
- 15 min de lectura
Kimi Linear le dio a Moonshot AI un resultado que los investigadores de la atención lineal perseguían desde hace años: una calidad reportada superior a la atención completa en tres escenarios exigentes. La empresa afirma que su arquitectura lideró las pruebas de contexto corto, las evaluaciones de contexto largo y el aprendizaje por refuerzo bajo condiciones de entrenamiento equivalentes.
Las cifras de eficiencia refuerzan ese desafío. Moonshot reporta hasta un 75 % menos de uso de caché clave-valor y una decodificación 6,3 veces más rápida con un contexto de un millón de tokens. Estas mejoras provienen de sustituir la mayoría de las capas de atención global por Kimi Delta Attention, manteniendo a la vez capas globales ocasionales.
Ese diseño híbrido pone bajo presión a la atención completa, específicamente a Multi-Head Latent Attention. La atención completa ha seguido siendo la opción más segura en calidad pese a sus crecientes costes de memoria y computación. Moonshot sostiene que los desarrolladores de modelos ya no tienen que aceptar esa disyuntiva.
La evidencia es considerable, pero no definitiva. Las comparaciones proceden de los propios experimentos de Moonshot, utilizando una familia de modelos y su sistema interno de entrenamiento. Los pesos abiertos, los kernels y el código de serving hacen que las afirmaciones sean inusualmente verificables, pero el comportamiento en producción sigue dependiendo de la corrección del software y de las condiciones del hardware.
Kimi Linear cambia la disyuntiva de la atención
Moonshot no presenta Kimi Linear como un compromiso menor. Presenta la arquitectura como un sustituto más potente de la atención completa.
El informe técnico describe un modelo de mezcla de expertos con 48.000 millones de parámetros totales y 3.000 millones de parámetros activos. Los parámetros activos son el subconjunto utilizado para cada token, que determina en gran medida la computación necesaria durante la inferencia.
El modelo combina Kimi Delta Attention, o KDA, con Multi-Head Latent Attention, o MLA. KDA es un mecanismo recurrente de atención lineal que mantiene un estado de tamaño fijo en lugar de almacenar cada clave y valor anteriores.
MLA es una forma comprimida de atención global asociada a los diseños de modelos de DeepSeek. Reduce los requisitos de caché en comparación con la atención convencional de múltiples cabezas, pero su caché sigue creciendo con la secuencia.
Moonshot utiliza tres capas de KDA por cada capa de MLA. Las capas globales preservan el acceso directo a todo el contexto, mientras que las capas lineales gestionan la mayor parte del procesamiento de tokens mediante actualizaciones recurrentes de estado.
Esa proporción importa porque la atención lineal pura todavía afronta un problema de capacidad de memoria. Un estado fijo debe comprimir una secuencia completa en una representación limitada. Los detalles pueden entrar en conflicto, desvanecerse o resultar difíciles de recuperar a medida que crecen las entradas.
La atención completa evita ese cuello de botella específico al preservar representaciones de tokens anteriores. Cada token nuevo puede compararse directamente con el historial almacenado, aunque la caché resultante crece con la longitud del contexto.
Kimi Linear no pretende que esta restricción de estado finito haya desaparecido. En cambio, la arquitectura asigna trabajos distintos a dos mecanismos. KDA aporta procesamiento local y recurrente eficiente, mientras que las capas MLA periódicas restauran el acceso global.
Moonshot entrenó sus principales modelos de comparación con 1,4 billones de tokens y la misma receta. Según el informe, Kimi Linear superó al modelo de referencia de MLA completo en todas las evaluaciones de preentrenamiento de contexto corto enumeradas.
Su puntuación en MMLU-Pro alcanzó 51,0, frente a 47,2 para MLA completo. Kimi Linear también obtuvo 73,8 en MMLU, mientras que MLA alcanzó 71,6.
El patrón se extendió a HellaSwag, ARC-Challenge, Winogrande y Big-Bench Hard. Los márgenes individuales variaron, pero Moonshot no reportó ninguna pérdida en contexto corto en la comparación listada.
Ese resultado invierte el argumento habitual contra la atención lineal. Históricamente, los equipos aceptaban los métodos lineales porque reducían los costes de inferencia, no porque mejoraran de forma consistente la calidad en benchmarks convencionales.
Investigaciones como linear transformers establecieron el argumento computacional hace años. Reordenar los cálculos de atención podía hacer que el procesamiento autorregresivo fuera lineal respecto a la longitud de la secuencia y mantener un estado recurrente de tamaño constante.
La calidad siguió siendo el problema más difícil. La atención Softmax podía establecer conexiones precisas y dependientes del contenido a lo largo de una secuencia. Las primeras alternativas lineales a menudo perdían precisión, especialmente cuando las tareas requerían recuperación exacta o asociaciones complejas.
Por tanto, Kimi Linear cambia más que la clasificación de un benchmark. Aporta evidencia de que un híbrido cuidadosamente diseñado puede impulsar la eficiencia y la calidad en la misma dirección.
Esa evidencia crea la tensión central del artículo. Si pruebas independientes respaldan los resultados de Moonshot, la atención completa dejará de ser la opción predeterminada automática para modelos de contexto largo sensibles a la calidad.
Por qué la decodificación de contexto largo pone bajo presión a la atención completa
La ventaja decisiva aparece durante la generación, cuando cada token adicional obliga a un modelo de atención completa a revisar una caché en expansión.
Una caché clave-valor almacena las representaciones de atención de tokens anteriores. Evita que un modelo tenga que recomputar todo su historial durante cada paso de decodificación.
La caché sigue creciendo a medida que la conversación, el documento o la trayectoria de un agente se alargan. Ese crecimiento consume memoria de acelerador y reduce el número de solicitudes que un servidor puede procesar simultáneamente.
MLA ya comprime sustancialmente esta caché. Aun así, Moonshot informa de que Kimi Linear reduce el uso de caché hasta en otro 75 % frente a su modelo de referencia de MLA completo.
La razón está en la combinación de capas. Solo una cuarta parte de las capas de atención utiliza MLA y requiere una caché dependiente de la longitud de la secuencia. Las tres capas KDA mantienen estados recurrentes cuyo tamaño no se expande con cada token.
Esta distinción se vuelve importante para cargas de trabajo intensivas en decodificación. Los agentes de programación de larga duración, los sistemas de investigación y los asistentes que usan herramientas pueden generar trayectorias extensas tras recibir grandes entradas.
Un benchmark de contexto convencional suele enfatizar el prefill, el procesamiento inicial de una entrada. Las cargas de trabajo de agentes añaden otra exigencia porque la generación puede continuar durante muchos pasos de razonamiento y respuestas de herramientas.
Moonshot midió el tiempo por token de salida a lo largo de longitudes de decodificación crecientes. Con un millón de tokens, el informe indica 1,84 milisegundos para Kimi Linear y 11,48 milisegundos para MLA.
Esa es la base de la ventaja reportada de 6,3 veces. La brecha era menor en longitudes más cortas y luego se amplió a medida que la caché de MLA ejercía mayor presión sobre la memoria y el procesamiento por lotes.
La comparación no significa que cada despliegue vaya a producir seis veces más tokens por segundo. El resultado de Moonshot refleja una configuración específica de hardware, de modelo, de procesamiento por lotes y de implementación.
El rendimiento también difiere de la latencia de una única solicitud. Una caché más pequeña permite a un servidor alojar lotes más grandes, lo que puede elevar el rendimiento total incluso cuando la computación individual cambia de forma menos drástica.
El informe muestra una ventaja de prefill más moderada. Con una longitud de entrada de un millón de tokens, Kimi Linear supuestamente procesó el prompt 2,9 veces más rápido que MLA.
Estas mediciones explican por qué la arquitectura apunta a los agentes y no solo al resumen de documentos. Un sistema que lee una vez y responde brevemente obtiene menos valor de una decodificación de estado constante.
Un sistema que razona repetidamente, llama a herramientas, recibe observaciones y sigue generando afronta una curva de costes distinta. Su historial crece durante la tarea, precisamente cuando la presión de la caché se vuelve más difícil de gestionar.
Esta presión alcanza a desarrolladores de modelos, plataformas de inferencia y compradores empresariales. Los desarrolladores deben decidir si la atención global en todas partes sigue justificando su coste de serving.
Las plataformas de inferencia necesitan kernels y planificadores que comprendan el estado recurrente de la atención. Los compradores empresariales necesitan evidencia de que el menor uso de memoria se mantiene bajo requisitos realistas de concurrencia, recuperación y fiabilidad.
Para el trabajo intensivo en conocimiento, el contexto largo también necesita organización, no solo capacidad bruta. Una base de conocimiento con búsqueda puede seleccionar evidencia relevante antes de que un modelo la procese.
Kimi Linear no elimina esa necesidad arquitectónica. Cambia el coste de procesar y ampliar el contexto que proporcione la aplicación.
Por tanto, la presión a corto plazo recae con mayor fuerza sobre los desarrolladores de agentes de IA de larga duración. Ahora cuentan con una implementación abierta que afirma ofrecer mejor calidad junto con una curva de costes de decodificación más plana.
Cómo Kimi Linear utiliza una memoria recurrente más inteligente
KDA mejora la atención lineal al controlar con mayor precisión qué borra y qué preserva su memoria recurrente.
Kimi Delta Attention amplía Gated DeltaNet, una arquitectura anterior que combina compuertas de decaimiento con una actualización de memoria basada en la regla delta. El artículo de Gated DeltaNet reportó mejoras frente a Mamba2 y DeltaNet en tareas de recuperación y lenguaje.
Una regla delta actualiza la memoria según el error de predicción. En términos simplificados, el modelo intenta sustituir una asociación clave-valor desactualizada en lugar de añadir continuamente nueva información.
Ese comportamiento de actualización ayuda a evitar que la memoria se convierta en una suma descontrolada de todo lo visto anteriormente. También ofrece al estado recurrente una forma de revisar asociaciones previas.
Gated DeltaNet añade un mecanismo de decaimiento que determina la rapidez con la que se desvanece la memoria. Sin embargo, una sola compuerta puede seguir aplicándose de forma demasiado amplia a un estado con muchos canales distintos.
KDA hace que ese control sea más granular. Sus compuertas de grano más fino pueden permitir que distintas partes del estado olviden a velocidades diferentes, según el token actual y las proyecciones aprendidas.
Eso importa porque el contexto útil no caduca de manera uniforme. Una señal temporal de formato puede dejar de ser relevante rápidamente, mientras que una restricción del usuario o la definición de una función debería seguir disponible.
La arquitectura ofrece al modelo mayor control sobre esta asignación. Sigue teniendo memoria recurrente finita, pero puede utilizar esa capacidad de forma más selectiva.
Moonshot también diseñó un algoritmo de entrenamiento por fragmentos para KDA. La fragmentación permite al modelo procesar grupos de tokens en paralelo durante el entrenamiento, en lugar de aplicar cada actualización recurrente de forma secuencial.
El informe utiliza una estructura especializada de transición diagonal más bajo rango. Esta forma matemática hace más eficiente el cálculo por fragmentos y preserva el comportamiento previsto de la regla delta.
Este trabajo de implementación es esencial. Una arquitectura con una complejidad atractiva aún puede fracasar si sus kernels introducen suficiente sobrecarga como para borrar el beneficio teórico.
Las mediciones de prefill de Moonshot indican que KDA añade una latencia insignificante frente al híbrido Gated DeltaNet evaluado en el informe. Sin embargo, ofreció mejores resultados en benchmarks que ese modelo de referencia.
La comparación con Gated DeltaNet también revela por qué la atención global sigue presente en el diseño. Kimi Linear y el híbrido Gated DeltaNet estuvieron cerca en las evaluaciones de contexto corto, con Kimi generalmente por delante.
Con un contexto de 128.000 tokens, el híbrido Gated DeltaNet promedió 51,2 en la suite de contexto largo de Moonshot. MLA completo promedió 52,2, mientras que Kimi Linear alcanzó 54,5.
Por tanto, la ruta de eficiencia pura no dominó la calidad en contexto largo. El resultado más sólido surgió de combinar KDA con MLA periódica y de utilizar el tratamiento posicional elegido por Moonshot.
En RULER, una suite sintética que prueba recuperación y manipulación en contextos largos, Kimi Linear obtuvo 84,3. MLA completo obtuvo 81,3, mientras que el híbrido Gated DeltaNet obtuvo 80,5.
Kimi Linear también lideró RepoQA con 68,5, frente a 63,0 para ambas líneas de base. RepoQA evalúa la respuesta a preguntas sobre repositorios de software, lo que lo hace relevante para sistemas de programación y búsqueda de código.
No lideró todas las tareas de contexto largo. MLA obtuvo 36,1 en LongBench v2, frente a 35,0 para Kimi Linear. MLA también lideró la evaluación Frames por 60,5 frente a 58,8.
Esas excepciones importan. Muestran que KDA no ha eliminado todas las ventajas de la atención completa, incluso dentro de la propia evaluación de Moonshot.
El resultado agregado siguió favoreciendo al híbrido. Más importante aún, sus mayores ganancias de eficiencia aparecen allí donde la línea de base de atención completa se vuelve más costosa.
Así funciona Kimi Linear sin convertirlo en un tutorial de producto. Trata la memoria recurrente y el acceso global a tokens como recursos complementarios, y los distribuye capa por capa.
Esa asignación es el mecanismo detrás de la inversión. Moonshot no hizo que la atención lineal imitara la atención completa en todas partes. Conservó suficiente atención global para cubrir el punto más débil de la memoria recurrente.
El aprendizaje por refuerzo pone a prueba un tipo distinto de memoria
Los resultados de aprendizaje por refuerzo de Moonshot sugieren que la arquitectura puede sostener trayectorias generadas largas, no solo recuperar hechos de prompts extensos.
El aprendizaje por refuerzo introduce una prueba diferente a la del preentrenamiento. El modelo genera respuestas, recibe recompensas y se actualiza hacia comportamientos que obtienen mejores puntuaciones según el objetivo de entrenamiento.
Para los modelos de razonamiento, esas salidas pueden volverse extensas. Un modelo puede explorar cálculos, revisar pasos intermedios o producir secuencias prolongadas de uso de herramientas antes de llegar a una respuesta.
Moonshot comparó Kimi Linear con MLA completo mediante aprendizaje por refuerzo con recompensas verificables. RLVR utiliza resultados que pueden comprobarse automáticamente, como la corrección de una respuesta matemática.
La empresa afirma que ambos modelos utilizaron el mismo algoritmo e hiperparámetros. Moonshot evaluó su progreso en pruebas matemáticas que incluían AIME 2025 y MATH 500.
Según el artículo, Kimi Linear mantuvo un mejor rendimiento durante el proceso de entrenamiento. Su ventaja apareció tanto en las curvas de precisión de entrenamiento como en las de evaluación con datos retenidos.
Este resultado importa porque el estado fijo de la atención lineal podría haber tenido dificultades con el razonamiento prolongado. Los pasos tempranos importantes podrían desaparecer a medida que se expande la secuencia generada.
Las curvas de Moonshot sugieren que los controles de memoria de KDA, combinados con capas globales periódicas, preservaron suficiente estado útil para las cargas de trabajo de razonamiento evaluadas.
El informe no proporciona una replicación independiente de esa conclusión. También utiliza el conjunto interno de entrenamiento matemático de Moonshot, que los investigadores externos no pueden inspeccionar por completo.
Los hiperparámetros equivalentes mejoran la equidad, pero no resuelven todas las comparaciones. Un esfuerzo de ajuste específico para cada arquitectura podría cambiar los resultados absolutos o reducir la brecha.
Hay otra interpretación que considerar. La arquitectura Kimi Linear podría aportar una ventaja de optimización al sistema de entrenamiento de Moonshot, en lugar de una ventaja universal de calidad.
Eso seguiría siendo útil, pero haría la afirmación más limitada. Otros tamaños de modelo, mezclas de datos, diseños de recompensa y marcos de entrenamiento podrían producir clasificaciones diferentes.
La configuración de mezcla de expertos de 48.000 millones de parámetros también complica la generalización. Un modelo con 3.000 millones de parámetros activos no se comporta exactamente como un modelo denso del mismo tamaño activo.
Sus capas de expertos contienen mucha más capacidad total de la que sugiere el recuento de parámetros activos. Los resultados podrían depender de la interacción entre expertos dispersos y la pila híbrida de atención.
Por tanto, los desarrolladores deberían separar tres preguntas. ¿KDA mejora el modelo de Moonshot, la atención lineal híbrida mejora arquitecturas comparables y mejora una carga de trabajo de producción específica?
El artículo aporta evidencia alentadora para la primera pregunta y una línea de investigación creíble para la segunda. Solo una evaluación a nivel de carga de trabajo puede responder la tercera.
Para un agente empresarial, la precisión en benchmarks no es suficiente. El sistema debe conservar instrucciones, citar la evidencia correcta, manejar fallos de herramientas y mantenerse estable durante interacciones repetidas.
Una arquitectura de estado recurrente también puede ser más difícil de inspeccionar. La atención completa expone una caché vinculada directamente a tokens anteriores, mientras que KDA comprime el historial en matrices de estado aprendidas.
Esa compresión es la fuente de su eficiencia. También hace que los fallos sean menos intuitivos cuando el modelo olvida o sobrescribe algo importante.
Por tanto, el aprendizaje por refuerzo fortalece el argumento de Moonshot sin cerrar el caso. Muestra que la arquitectura siguió siendo competitiva bajo un régimen de entrenamiento de salidas largas que somete directamente a estrés la memoria.
El código abierto hace que las afirmaciones sean comprobables, y la pila de software añade riesgo
El lanzamiento abierto de Kimi Linear reduce la barrera de verificación, pero la corrección de la implementación pasa ahora a formar parte de la corrección del modelo.
Moonshot publicó puntos de control preentrenados y ajustados por instrucciones junto con el artículo. También publicó el kernel KDA y una implementación para el motor de inferencia vLLM.
El repositorio oficial describe un despliegue de vLLM compatible con OpenAI con una longitud máxima de modelo de 1.048.576 tokens. Documenta la misma proporción de tres a uno entre capas KDA y MLA.
Los investigadores pueden inspeccionar la arquitectura, ejecutar evaluaciones controladas y comparar el consumo de memoria. Los equipos de infraestructura pueden perfilar los kernels en lugar de basarse únicamente en gráficos de un informe.
Los pesos del modelo también permiten pruebas de fallos dirigidas. Los evaluadores pueden variar la ubicación de la evidencia, introducir hechos en competencia o ampliar la generación tras un prellenado largo.
Esta apertura es especialmente importante para un nuevo mecanismo de atención. Pequeños errores en el diseño del estado, los límites de bloques, el almacenamiento en caché o el procesamiento por lotes pueden corromper silenciosamente el comportamiento de contexto largo.
Un posterior informe de error de vLLM ilustra ese riesgo. El informe identificó un aparente error en el diseño del estado recurrente que afectaba al prellenado por bloques de KDA en varias versiones de vLLM.
El informante descubrió que los prompts cortos seguían siendo coherentes, mientras que la recuperación en contexto largo fallaba. Una prueba de aguja devolvía texto de relleno cercano en lugar de la frase solicitada.
El problema se marcó como resuelto, pero su existencia deja una lección más amplia. Una arquitectura de modelo evaluada en benchmarks y una ruta de servicio en producción no son el mismo artefacto.
El servicio de atención completa cuenta con años de optimización, pruebas y experiencia operativa. KDA requiere kernels más recientes y lógica de gestión de estado en múltiples backends de hardware.
vLLM ahora expone un módulo Kimi Linear, lo que mejora la accesibilidad. La compatibilidad no garantiza un rendimiento o fiabilidad idénticos entre versiones.
Los equipos que evalúen el modelo deberían fijar versiones exactas de software. Deberían probar la recuperación tras prellenado largo, la decodificación por lotes, el almacenamiento en caché de prefijos y el comportamiento del estado a través de los límites de bloques.
También deberían medir la concurrencia real. El mayor beneficio de rendimiento del artículo depende en parte de utilizar la memoria ahorrada para lotes más grandes.
Si una aplicación atiende solo una solicitud de bajo volumen, la ganancia operativa puede ser diferente. Una plataforma de agentes con alta concurrencia podría beneficiarse mucho más de la caché más pequeña.
El hardware también importa. Los kernels especializados pueden comportarse de forma diferente entre arquitecturas NVIDIA o aceleradores alternativos. La disponibilidad de kernels puede determinar si la eficiencia teórica llega a producción.
La validación más sólida combinaría pruebas de calidad independientes con mediciones de servicio de extremo a extremo. Los evaluadores deberían informar del hardware, la precisión, el tamaño de lote, la longitud de entrada, la longitud de salida y el commit de software.
También deberían comparar con MLA optimizado en lugar de únicamente con la atención convencional de múltiples cabezas. Moonshot eligió MLA como línea de base, lo que hace más exigente la reducción de caché afirmada.
El lanzamiento merece reconocimiento por posibilitar ese trabajo. Muchas afirmaciones arquitectónicas llegan sin pesos ni código eficiente, dejando a terceros sin capacidad para reproducir el resultado central.
Aun así, los artefactos abiertos no convierten automáticamente en ciertas las conclusiones del artículo. Transforman una afirmación de empresa en una propuesta de ingeniería falsable.
Qué observar tras el lanzamiento de Kimi Linear
El próximo veredicto depende de la replicación independiente, un soporte de servicio estable y la adopción en modelos de producción más grandes.
La primera señal es la replicación de benchmarks bajo condiciones de entrenamiento equivalentes. Los equipos independientes deben comparar KDA híbrido con atención completa utilizando recuentos de parámetros, datos y presupuestos de entrenamiento equivalentes.
Las comparaciones solo de inferencia no pueden aislar la contribución de la arquitectura. Un modelo puede diferir en la calidad de los datos, el enrutamiento de expertos, la optimización o el posentrenamiento.
Los estudios más valiosos entrenarán múltiples arquitecturas desde cero. Deberían abarcar modelado de lenguaje de contexto corto, recuperación de contexto largo, tareas de código y aprendizaje por refuerzo.
Las ganancias consistentes reforzarían la afirmación central de Moonshot. Los resultados mixtos sugerirían que Kimi Linear funciona mejor bajo determinadas escalas o recetas de entrenamiento.
La segunda señal es la fiabilidad del servicio entre versiones de vLLM y plataformas de hardware. Las pruebas de contexto largo deberían convertirse en comprobaciones rutinarias de regresión para la gestión del estado de KDA.
Un soporte estable haría que la arquitectura fuera creíble para agentes de producción. Los fallos repetidos de estado o kernel debilitarían el caso, independientemente de los resultados del modelo a nivel de artículo.
Los equipos deberían observar si las herramientas de despliegue admiten reutilización de prefijos, cuantización, decodificación especulativa y procesamiento continuo por lotes sin sacrificar la corrección de KDA. Esas funciones determinan la economía real del servicio.
La tercera señal es la adopción arquitectónica. El respaldo más sólido sería que KDA apareciera en sistemas Moonshot más grandes o en familias de modelos no relacionadas.
La adopción demostraría que Moonshot considera el diseño escalable más allá de un punto de control de investigación. El uso externo indicaría que otros equipos pueden reproducir sus ventajas de entrenamiento e inferencia.
Los despliegues más grandes también expondrán el diseño a cargas de trabajo más difíciles. Las tareas multiagente, la programación a escala de repositorio, la síntesis de investigación y el uso prolongado de herramientas pueden someter la memoria a estrés de forma distinta que los conjuntos académicos.
Los lectores no deberían reducir la historia a una afirmación de velocidad seis veces mayor. Esa cifra representa el punto de decodificación de contexto largo más favorable de la configuración reportada por Moonshot.
El avance mayor es un desafío creíble al estatus de la atención completa como opción predeterminada que prioriza la calidad. Kimi Linear combina la eficiencia recurrente con suficiente acceso global para evitar el compromiso habitual.
Para los desarrolladores, la pregunta práctica es específica: ¿la arquitectura conserva la evidencia y las instrucciones que su aplicación necesita durante una generación larga?
Para los equipos de infraestructura, la pregunta se refiere a la capacidad utilizable. ¿La caché reducida se traduce en lotes seguros más grandes, menor latencia o menos aceleradores bajo tráfico representativo?
Para los compradores empresariales, la fiabilidad debería anteponerse a las etiquetas arquitectónicas. Pidan a los proveedores pruebas de recuperación en contexto largo, versiones de software, supuestos de concurrencia y análisis de fallos.
Kimi Linear ofrece ahora a la industria algo concreto que poner a prueba. Ejecútelo con sus prompts reales más largos, amplíe la salida y verifique qué se conserva. Si los resultados independientes coinciden con el informe de Moonshot, la atención completa necesitará una defensa más sólida que la familiaridad.


