Tencent abre el código de AngelSpec y desafía la decodificación especulativa de talla única
- Ethan Carter

- 30 jul
- 15 min de lectura
Tencent Hunyuan ha abierto el código de AngelSpec tras informar de una inferencia de Hy3-A21B hasta 2,40 veces más rápida que la decodificación autorregresiva estándar. El marco combina soporte de entrenamiento, evaluación y despliegue para dos rutas diferentes de decodificación especulativa. Su afirmación central cuestiona una suposición común: un único método de borrador no puede manejar eficientemente todas las cargas de trabajo de modelos de lenguaje.
AngelSpec incluye la predicción de múltiples tokens, o MTP, que propone varios tokens futuros mediante un borrador autorregresivo ligero. También introduce DFly, un sistema de difusión por bloques que genera en paralelo un grupo más largo de tokens. Tencent afirma que DFly ofreció entre un 10,5 % y un 11,8 % más de rendimiento que DFlash en las condiciones de servicio evaluadas.
La comparación importa porque DFlash ya había alejado la decodificación especulativa del borrador estrictamente secuencial. AngelSpec no se limita a proponer otro borrador más rápido. Organiza dos enfoques contrastados según la carga de trabajo que cada uno gestiona mejor y, después, ajusta la verificación según las condiciones de ejecución.
El resultado es un marco abierto con una visión más operativa de la aceleración de la inferencia. Los desarrolladores pueden revisar la ruta de entrenamiento, probar los modelos de borrador Hy3 publicados y analizar cómo cambia el rendimiento con el tráfico. Sin embargo, las mejoras comunicadas por Tencent proceden de sus propios modelos, configuraciones y diseño de evaluación. Los resultados independientes en producción siguen siendo la evidencia decisiva que falta.
AngelSpec convierte una elección de investigación en una elección de despliegue
AngelSpec aborda la decodificación especulativa como un problema de selección según la carga de trabajo, no como una competición por una arquitectura de borrador universal.
Los investigadores de Tencent enviaron la primera versión del artículo de AngelSpec el 28 de julio de 2026. Una versión revisada llegó el 29 de julio. La empresa anunció después el lanzamiento de código abierto con código de entrenamiento y pesos del modelo de borrador Hy3-A21B.
La decodificación especulativa utiliza un borrador más pequeño o económico para proponer varios tokens futuros. El modelo objetivo completo comprueba esas propuestas en conjunto y acepta el prefijo coincidente. Cuando las propuestas son precisas, el sistema produce varios tokens válidos sin requerir el mismo número de costosas pasadas por el modelo objetivo.
El método preserva la distribución de salida del modelo objetivo cuando se implementa con el proceso requerido de verificación y rechazo. Por tanto, modifica la eficiencia con la que se generan los tokens, en lugar de sustituir las respuestas del modelo objetivo por las del borrador.
La calidad del borrador sigue determinando si esa ventaja teórica se convierte en una mejora práctica de velocidad. Un borrador débil produce tokens rechazados, añade trabajo sin avanzar la generación. Un borrador grande puede predecir con precisión, pero consumir demasiado tiempo y memoria. La verificación también puede resultar costosa cuando los sistemas prueban más candidatos de los que justifica una solicitud.
AngelSpec reúne esas variables en un único marco de entrenamiento y evaluación. Admite MTP y decodificación especulativa paralela por bloques, incluida la generación de estados ocultos, el entrenamiento con contextos largos, flujos de trabajo de rollout y la evaluación de aceptación en línea. El lanzamiento pretende cubrir una mayor parte del camino entre un punto de control de investigación y un servicio de inferencia operativo.
Las dos rutas de borrador del marco dividen el problema según el comportamiento de salida. Tencent entrena su borrador MTP con datos conversacionales variados, donde el lenguaje es abierto y los siguientes tokens siguen siendo relativamente inciertos. Entrena la ruta de difusión por bloques con código y matemáticas, donde las continuaciones más largas suelen seguir estructuras más previsibles.
Esta especialización es el cambio más importante del anuncio. Muchas comparaciones de decodificación especulativa preguntan qué método gana de media. AngelSpec pregunta, en cambio, qué estructura de borrador se ajusta a una distribución concreta y expone ambas estructuras mediante una ruta de desarrollo común.
Los pesos incluidos también hacen que el lanzamiento sea más comprobable que un artículo que describe un sistema no disponible. Tencent afirma haber publicado borradores MTP y DFly para Hy3-A21B a través de sus canales de modelos. Los desarrolladores siguen necesitando el modelo objetivo correspondiente y hardware de servicio adecuado, pero no tienen que recrear todas las etapas de entrenamiento antes de comenzar la evaluación.
Hy3 ofrece un objetivo exigente para el lanzamiento. El repositorio oficial del modelo Hy3 describe un modelo de mezcla de expertos con 295.000 millones de parámetros totales y 21.000 millones de parámetros activos. También enumera una capa MTP de 3.800 millones de parámetros y una ventana de contexto de 256.000 tokens.
Estas especificaciones hacen que la eficiencia de inferencia sea económicamente importante. Solo se activa una fracción del modelo completo para cada token, pero el servicio sigue requiriendo memoria, comunicación y cálculo del modelo objetivo considerables. Un borrador que aumente la salida aceptada por paso de verificación puede mejorar la latencia o el rendimiento sin reentrenar el modelo principal.
Por tanto, AngelSpec llega como algo más que otro complemento para Hy3. Ofrece un marco explícito para elegir, entrenar y evaluar sistemas de borrador a medida que cambian las condiciones de servicio. Ese alcance más amplio ejerce presión sobre la decodificación especulativa de talla única.
Las mejoras comunicadas presionan a las estrategias de borrador estáticas
La afirmación más sólida de Tencent no es solo la aceleración máxima, sino la ventaja de DFly en cada nivel de concurrencia evaluado, de 4 a 64.
Según el artículo, DFly ofreció una aceleración integral de entre 1,98 y 2,40 veces frente a la decodificación autorregresiva en Hy3-A21B. Tencent también informa de entre un 10,5 % y un 11,8 % más de rendimiento que DFlash y una salida media aceptada aproximadamente un 30 % más larga.
La concurrencia mide cuántas solicitudes procesa a la vez el sistema de servicio. Cambia el equilibrio entre cálculo, eficiencia de agrupación, presión de memoria y sobrecarga de verificación. Un método que parece rápido para una solicitud puede perder su ventaja cuando muchas solicitudes compiten por los mismos aceleradores.
Tencent afirma que DFly logró el mayor rendimiento medio en cada nivel de concurrencia evaluado, de 4 a 64. Ese intervalo importa porque incluye tráfico relativamente ligero y un servicio con agrupación más intensa. El resultado sugiere que el planificador y la estrategia de verificación de DFly contribuyeron más allá de la tasa bruta de aceptación del modelo de borrador.
Las cifras aún requieren una interpretación cuidadosa. Una aceleración de 2,40 veces no significa que todos los usuarios vean llegar las respuestas 2,40 veces antes. La aceleración integral depende de la carga de trabajo del benchmark, la longitud de salida, la mezcla de solicitudes, la política de agrupación, el perfil de hardware y la configuración de referencia.
El rendimiento y la latencia también responden a preguntas distintas. El rendimiento mide cuánto trabajo completa un sistema a lo largo del tiempo. A los usuarios interactivos suele importarles más el tiempo hasta el primer token y la demora entre los tokens posteriores. Un servicio puede aumentar el rendimiento total mientras ofrece mejoras menores o irregulares para una solicitud individual.
Esta distinción ejerce presión sobre los equipos de inferencia que usan políticas de borrador fijas. Una política estática puede elegir una longitud de borrador, una profundidad de verificación o un borrador para todo el tráfico. AngelSpec sostiene que estas decisiones deberían responder al dominio, las características de la solicitud, la carga en línea y el hardware de despliegue.
Por tanto, el objetivo bajo presión no es una empresa concreta. Es el enfoque que trata la decodificación especulativa como un accesorio fijo del modelo. Si los hallazgos de Tencent se mantienen en otros entornos, los operadores necesitarán lógica de enrutamiento y planificación que entienda cuándo el trabajo de borrador sigue siendo valioso.
DFlash ofrece la comparación más directa. Su diseño de difusión por bloques utiliza estados ocultos del modelo objetivo para predecir en paralelo múltiples tokens de borrador. El enfoque evita generar cada propuesta mediante un paso independiente de borrador secuencial.
Los autores de DFlash informaron de una aceleración superior a seis veces en experimentos seleccionados y de mejoras frente a EAGLE-3. Esos resultados emplearon objetivos y condiciones de prueba diferentes, por lo que no deberían compararse directamente con el máximo de 2,40 veces de AngelSpec. La afirmación relevante de Tencent es la comparación controlada con DFly comunicada dentro de su propia evaluación de Hy3.
Los sistemas de estilo EAGLE siguen siendo otra referencia importante. Utilizan características del modelo objetivo para guiar un borrador autorregresivo más pequeño, y a menudo organizan las propuestas para una verificación eficiente. Estos sistemas pueden ofrecer resultados estables en textos variados, pero las dependencias secuenciales dentro del borrador pueden limitar la rapidez con la que se proponen secuencias largas de candidatos.
MTP ocupa una versión más ligera de esa ruta autorregresiva. Es más fácil de integrar cuando el objetivo ya expone capas de predicción compatibles. El propio lanzamiento de Hy3 de Tencent incluye una capa MTP, lo que convierte al modelo en un banco de pruebas natural para comparar el borrador ligero con un sistema especializado paralelo por bloques.
La presión de AngelSpec sobre los despliegues existentes es práctica. Los equipos deben decidir si el modelo adicional, la lógica de planificación, el perfilado y el uso de memoria producen suficientes tokens aceptados como para justificar su complejidad. El marco les proporciona código y pesos para explorar esa cuestión, pero no convierte la respuesta en universal.
Cómo AngelSpec hace que DFly sea más selectivo
DFly combina el borrador paralelo con información autorregresiva y, después, dedica el trabajo de verificación donde el rendimiento esperado es mayor.
Un borrador de difusión por bloques predice varias posiciones a la vez en lugar de completarlas una por una. La predicción paralela reduce la latencia del borrador, especialmente cuando el bloque candidato es largo. Sin embargo, los tokens dentro de una frase o una secuencia de código dependen en gran medida de tokens anteriores de ese mismo bloque.
Esa dependencia genera una debilidad. Si cada posición se predice a partir de vecinos enmascarados o incompletos, las propuestas posteriores pueden perder información que un borrador autorregresivo recibe de forma natural. Un error temprano puede acortar el prefijo aceptado por el modelo objetivo y desperdiciar gran parte del bloque propuesto.
DFly aborda esta tensión con dos componentes conectados. Su columna vertebral se condiciona a características del modelo objetivo mientras mantiene la generación paralela por bloques. Una cabeza autorregresiva condicionada por predecesores también proporciona a las predicciones información sobre tokens anteriores, mejorando las dependencias dentro del bloque propuesto.
La arquitectura no convierte todo el borrador en un proceso secuencial convencional. El diseño de Tencent busca preservar el trabajo paralelo en la columna vertebral y añadir suficiente información de los predecesores para mejorar la coherencia de los candidatos. Ese equilibrio es fundamental para el aumento anunciado en la longitud media aceptada.
La longitud aceptada es el número de tokens propuestos que aprueba el modelo objetivo antes de encontrar una discrepancia. Los prefijos aceptados más largos distribuyen cada costoso paso de verificación entre una mayor cantidad de salida útil. Sin embargo, maximizar solo la longitud aceptada puede inducir a error si producir y comprobar esos candidatos consume demasiado tiempo.
Por ello, AngelSpec añade un método de verificación adaptativa llamado D-Cut. La profundidad de verificación se refiere a cuánto de cada continuación propuesta comprueba el modelo objetivo. Una profundidad fija puede invertir demasiado en candidatos inciertos o detenerse demasiado pronto en los altamente previsibles.
D-Cut trata la capacidad de verificación como un recurso compartido a nivel de lote. Estima el valor esperado de conservar posiciones candidatas adicionales y compara ese valor con un coste de ejecución perfilado. El planificador puede entonces dirigir más trabajo de verificación hacia prefijos de alta confianza en múltiples solicitudes.
Esta es una decisión de servicio, no meramente una decisión de modelo. Dos solicitudes que se ejecutan a través del mismo modelo pueden justificar distintas profundidades de verificación. Una finalización de código estructurada puede mantener un prefijo largo y confiado, mientras que una respuesta de chat abierta puede divergir tras apenas unos pocos tokens.
El hardware también cambia el cálculo. Un lote de verificación más grande puede ser eficiente en una configuración de aceleradores y costoso en otra. Los costes de comunicación, el ancho de banda de memoria, los kernels y el paralelismo del modelo objetivo influyen en si otra posición candidata ahorra tiempo.
Por eso AngelSpec perfila el coste de ejecución en lugar de basarse únicamente en estimaciones de probabilidad. Un candidato puede parecer propenso a ser aceptado y, aun así, ofrecer poca utilidad si comprobarlo amplía un lote hasta una forma ineficiente. El planificador necesita tanto confianza como coste del sistema medido.
La documentación sobre decodificación especulativa de Nvidia ilustra cómo los marcos de despliegue ya exponen configuraciones específicas para cada método. Su compatibilidad con DFlash requiere un modelo borrador, longitud de borrador, token de máscara y capas objetivo seleccionadas. AngelSpec lleva el problema un paso más allá, hacia la asignación adaptativa entre solicitudes activas.
La división por dominios complementa esa adaptación en tiempo de ejecución. MTP sigue siendo la ruta ligera para resultados conversacionales con mayor incertidumbre. DFly apunta al código y las matemáticas, donde los bloques paralelos pueden captar secuencias predecibles más largas. Ningún método obtiene automáticamente prioridad sobre todas las solicitudes.
Pensemos en un servicio de programación con IA que genera una batería de pruebas repetitiva. Las importaciones, las firmas de funciones y los patrones de aserciones pueden hacer que el siguiente bloque sea relativamente predecible. DFly puede proponer una continuación más larga, y D-Cut puede mantener una verificación más profunda mientras la confianza siga siendo alta.
Ahora pensemos en el mismo servicio respondiendo a una pregunta ambigua sobre arquitectura. Varias explicaciones válidas pueden partir del mismo prompt. El prefijo aceptado puede acortarse porque el modelo borrador y el objetivo eligen formulaciones distintas. Una propuesta MTP más pequeña puede evitar gastar recursos en un bloque candidato largo con pocas probabilidades de sobrevivir.
Este mecanismo hace que el lanzamiento sea más relevante que una mejora aislada de benchmark. Replantea la decodificación especulativa como una política que abarca los datos de entrenamiento, la arquitectura del borrador, la clasificación de solicitudes y el coste de servicio. La aceleración proviene de coordinar esas capas, en lugar de maximizar una única métrica aislada.
Lo que las cifras de AngelSpec no demuestran
AngelSpec aporta evidencia propia creíble, pero aún no demuestra que DFly gane en todos los modelos, hardware o cargas de tráfico de producción.
Los resultados del artículo proceden del equipo que diseñó el marco y entrenó los modelos borrador. Las comparaciones reportadas no se habían reproducido de forma independiente en el momento del lanzamiento. Los lectores deben considerar las aceleraciones como afirmaciones medidas por la empresa, no como garantías universales de rendimiento.
La dependencia del modelo es la primera limitación. DFly utiliza características internas del modelo objetivo, por lo que un borrador queda estrechamente ligado a la arquitectura y las características de entrenamiento de su objetivo. Un borrador Hy3-A21B no puede convertirse sin más en un acelerador plug-and-play para una familia de modelos no relacionada.
Esa conexión incrementa los costes de entrenamiento y mantenimiento. Cada objetivo compatible puede necesitar su propio proceso de extracción de estados ocultos, mezcla de datos de entrenamiento, checkpoint y ciclo de validación. Las actualizaciones del modelo objetivo también pueden requerir nuevas pruebas de compatibilidad o un nuevo entrenamiento del borrador.
La dependencia del hardware crea otra incertidumbre. Tencent afirma que D-Cut utiliza el coste de ejecución perfilado, reconociendo que la mejor política de verificación cambia entre sistemas. Una política ajustada para un clúster puede necesitar nuevos perfiles antes de rendir bien en aceleradores o topologías de red diferentes.
Las cifras públicas destacadas también condensan varias cargas de trabajo en rangos. El código, las matemáticas y la conversación tienen distinta predictibilidad. El rendimiento medio puede ocultar categorías débiles, longitudes de prompt desfavorables o patrones de tráfico en los que la sobrecarga del borrador se acerca al cómputo objetivo ahorrado.
El comportamiento con contexto largo merece un escrutinio especial. AngelSpec admite entrenamiento de contexto largo, y Hy3 indica una ventana de contexto de 256.000 tokens. Sin embargo, las grandes cachés de clave-valor aumentan la presión de memoria y pueden cambiar el coste relativo del borrador y la verificación. Los resultados con contextos más cortos no pueden resolver el rendimiento cerca de la ventana máxima del modelo.
La preservación de calidad también exige disciplina de implementación. La decodificación especulativa puede preservar la distribución del objetivo mediante el algoritmo adecuado de aceptación y rechazo. Los atajos de despliegue, la verificación aproximada, el muestreo alterado o la cuantización incompatible pueden cambiar los resultados. Los operadores deben validar tanto la velocidad como la equivalencia de comportamiento.
La memoria es otro coste real. El modelo objetivo, el modelo borrador, las interfaces de estados ocultos y los búferes adicionales de ejecución deben coexistir. Incluso un borrador ligero puede reducir el espacio disponible para la caché de clave-valor o para lotes más grandes. La compensación de capacidad resultante puede eliminar una ganancia de rendimiento en despliegues con restricciones de memoria.
La complejidad operativa también importa. Un servicio de producción debe monitorizar la longitud de aceptación, el tiempo de borrador, el tiempo de verificación, el comportamiento de la cola y el rendimiento de reserva. El enrutamiento entre MTP y DFly introduce otra capa de decisión cuyos errores pueden enviar las cargas de trabajo equivocadas al borrador equivocado.
El lanzamiento de código abierto hace que estas preguntas sean comprobables, lo cual es valioso. No las responde automáticamente. Los equipos deberían reproducir una línea base autorregresiva en su propio hardware antes de comparar cualquiera de las rutas de AngelSpec.
Después deberían separar las mediciones por carga de trabajo y nivel de tráfico. Entre las categorías útiles se incluyen el chat interactivo, la finalización de código, el razonamiento matemático, las trazas de uso de herramientas y la generación de textos largos. Cada categoría debería incluir percentiles de latencia, rendimiento, consumo de memoria, longitud de aceptación y comprobaciones de equivalencia de salida.
Una comparación justa con DFlash también exige condiciones equivalentes. Deben utilizarse el mismo modelo objetivo, precisión, marco de servicio, distribución de prompts, longitud de salida y concurrencia. De lo contrario, las afirmaciones arquitectónicas pueden quedar entrelazadas con la calidad de los kernels o las diferencias de configuración.
Los comentarios de la comunidad ofrecen señales tempranas, pero no sustituyen una reproducción controlada. Los informes de despliegue local suelen usar modelos cuantizados, hardware de consumo o motores de servicio modificados. Estos resultados pueden revelar problemas de compatibilidad, aunque rara vez se acercan lo suficiente a la configuración del artículo como para validar su rango destacado.
La brecha de benchmark no hace que AngelSpec sea poco importante. Define la siguiente etapa de la historia. Tencent ha proporcionado una arquitectura, una ruta de código y pesos de modelo que equipos externos pueden poner a prueba en condiciones que los autores originales no controlaron.
Tres señales determinarán si AngelSpec trasciende Hy3
La importancia de AngelSpec dependerá de la replicación independiente, un soporte más amplio de modelos y evidencia de que el enrutamiento adaptativo resiste el tráfico real de producción.
La primera señal es un benchmark reproducible de Hy3-A21B realizado por un equipo independiente de inferencia. La prueba más sólida usaría los pesos MTP y DFly publicados, al tiempo que informaría sobre hardware, precisión, versiones de framework, mezcla de prompts y longitudes de salida. Debería comparar la decodificación autorregresiva, MTP, DFlash y DFly en condiciones equivalentes.
Una replicación cercana al rango de 1,98 a 2,40 veces de Tencent reforzaría la afirmación central. Ganancias consistentes frente a DFlash también sugerirían que el condicionamiento del predecesor y D-Cut aportan valor más allá del borrador general de difusión por bloques. Ganancias menores o inestables limitarían el atractivo práctico de AngelSpec.
El informe independiente más útil publicaría más que el rendimiento medio. Debería incluir tiempo hasta el primer token, latencia entre tokens, latencia de cola, uso de memoria, longitud aceptada y rendimiento en distintos niveles de concurrencia. Esas mediciones mostrarían si la eficiencia agregada mejora la experiencia del usuario.
La segunda señal es la compatibilidad con otra familia importante de modelos objetivo. Actualmente, AngelSpec tiene su evidencia más clara y sus pesos de borrador publicados en torno a Hy3. Una adaptación exitosa a Qwen, Llama u otro modelo abierto ampliamente desplegado pondría a prueba si su marco se generaliza más allá de la arquitectura de Tencent.
La adaptación también revelaría el coste real de adopción. Los investigadores tendrían que generar estados ocultos del objetivo, entrenar borradores especializados, integrar la verificación y perfilar el comportamiento de ejecución. Una adaptación documentada con un esfuerzo de ingeniería razonable reforzaría la afirmación del marco sobre su usabilidad integral.
No atraer adaptaciones sugeriría que AngelSpec es principalmente un paquete de optimización para Hy3. Ese resultado aún podría beneficiar a los usuarios de los modelos de Tencent, pero debilitaría el argumento más amplio a favor de un marco unificado de decodificación especulativa.
La tercera señal es la evidencia de producción con cargas de trabajo mixtas. El argumento de Tencent se apoya en la heterogeneidad, por lo que un benchmark estático no puede validarlo por completo. La prueba decisiva es si un servicio activo puede elegir entre MTP y DFly a medida que cambian el tráfico, los dominios y la utilización del hardware.
Los operadores deberían observar con qué frecuencia las decisiones de enrutamiento mejoran la salida aceptada por unidad de coste de verificación. También deberían medir las tasas de reserva y los errores de enrutamiento. Un sistema adaptativo complejo debe superar una línea base más sencilla después de incluir su sobrecarga de monitorización y planificación.
Esta prueba es especialmente relevante para servicios que combinan chat, programación, trabajo matemático y acciones de agentes. Estos productos generan salidas con entropía y longitud muy diferentes. Ofrecen las condiciones en las que el borrador especializado debería superar a una política universal.
Si los despliegues con cargas mixtas muestran ganancias estables, los competidores tendrán presión para exponer controles de enrutamiento similares. Los marcos de servicio podrían evolucionar desde seleccionar un algoritmo especulativo al inicio hasta asignar algoritmos y presupuestos de verificación por solicitud.
Si las ganancias se desploman fuera de cargas de trabajo seleccionadas, los métodos más simples seguirán siendo atractivos. MTP puede ser más fácil de operar, especialmente cuando un modelo ya incluye capas compatibles. Las estrategias de borrador estáticas también reducen la cantidad de modelos y políticas que los equipos deben mantener.
Los desarrolladores que evalúen el lanzamiento deberían conservar los resultados de sus pruebas y sus decisiones de configuración en una base de conocimiento de ingeniería consultable. Los experimentos de decodificación especulativa implican suficientes variables interrelacionadas como para que las ejecuciones no documentadas se vuelvan rápidamente imposibles de comparar.
AngelSpec ya ha cambiado la pregunta a la que se enfrentan los ingenieros de inferencia. La elección ya no es solo si activar la decodificación especulativa. Es si el borrador, la distribución de entrenamiento, la política de verificación y el perfil de hardware se ajustan lo bastante bien a cada solicitud como para ahorrar trabajo real.
Los próximos uno a tres meses deberían revelar si equipos externos reproducen las cifras de Tencent, adaptan DFly más allá de Hy3 y validan el enrutamiento adaptativo bajo demanda activa. Hasta entonces, AngelSpec es un experimento abierto serio con resultados propios prometedores, no un ganador consolidado.
Para los equipos que actualmente sirven Hy3, el siguiente paso útil es un benchmark controlado frente a sus configuraciones autorregresivas y MTP existentes. Para todos los demás, la pregunta clave es más acotada: ¿el borrador consciente de la carga de trabajo ofrece suficiente eficiencia sostenida como para justificar otro modelo y una capa de planificación? La respuesta determinará si AngelSpec se convierte en un marco de inferencia ampliamente adoptado o sigue siendo una ventaja bien diseñada ligada principalmente a la propia familia de modelos de Tencent.


