top of page

El lanzamiento de StepAudio 3 coloca a StepFun en primer lugar en los benchmarks de IA de voz, pero la pila completa enfrenta una prueba más difícil

16 sept
14 min de lectura

StepFun lanzó cinco modelos StepAudio 3 el 15 de septiembre y afirma haber obtenido el primer puesto en tres evaluaciones de IA de voz. El lanzamiento de StepAudio 3 abarca conversación en tiempo real, reconocimiento de voz, síntesis de voz, generación general de audio y creación musical. Esa amplitud importa tanto como las clasificaciones destacadas.

Según StepFun, StepAudio 3 Realtime obtuvo un 98.9% en dinámica conversacional y un 99.7% en razonamiento sobre voz en las evaluaciones de Artificial Analysis. StepAudio 3 ASR registró una tasa de error de palabras del 1.7%, empatando en el primer lugar en reconocimiento no streaming. ASR significa reconocimiento automático de voz, el proceso de convertir el habla grabada en texto.

La presión inmediata recae sobre proveedores como Alibaba, OpenAI, Microsoft, ElevenLabs, Cartesia e Inworld. Sin embargo, la competencia central es más amplia que StepFun frente a una sola empresa. StepFun apuesta a que una familia de audio coordinada puede superar a un conjunto de servicios de voz especializados.

Ese argumento sigue inconcluso. El liderazgo en benchmarks puede establecer credibilidad técnica, pero no garantiza fiabilidad en producción, consistencia lingüística ni preferencia de los usuarios. StepAudio 3 TTS, Gen y Music tampoco cuentan con el mismo nivel de validación independiente visible que los modelos de tiempo real y reconocimiento.

El lanzamiento de StepAudio 3 cubre toda la cadena de audio

StepFun no lanzó un único modelo de voz mejorado. Presentó cinco endpoints especializados que cubren casi todas las principales cargas de trabajo de audio.

StepAudio 3 Realtime gestiona la interacción oral en directo. Escucha y responde mediante audio mientras sigue pausas, interrupciones, señales emocionales y cambios en la intención conversacional.

StepAudio 3 ASR convierte la voz en texto. StepFun afirma que admite chino, inglés, dialectos regionales, habla mixta chino-inglés, grabaciones largas y terminología especializada.

StepAudio 3 TTS convierte texto en voz. TTS significa texto a voz, y el nuevo modelo está orientado a aplicaciones interactivas que deben empezar la reproducción antes de generar la respuesta completa.

StepAudio 3 Gen desempeña un papel creativo más amplio. Según se informa, puede combinar voces, diálogos, sonidos ambientales, efectos y música de fondo a partir de instrucciones en lenguaje natural y audio de referencia.

StepAudio 3 Music se centra en la creación musical estructurada. StepFun afirma que los usuarios pueden generar canciones, organizar acompañamientos alrededor de voces sin acompañamiento, crear versiones y revisar música mediante prompts de múltiples turnos.

Los cinco modelos llegaron a la plataforma para desarrolladores de StepFun, según el lanzamiento oficial de la empresa. Esa disponibilidad convierte el anuncio en un evento de despliegue, no solo en una vista previa de investigación.

El lanzamiento crea una secuencia de producto clara. Un sistema puede reconocer una solicitud, razonar sobre su significado, responder con voz, generar sonidos de apoyo y producir música dentro de la familia de modelos de un único proveedor.

Pensemos en una aplicación de aprendizaje interactivo. Podría transcribir la pregunta de un estudiante, detectar incertidumbre en la voz del hablante, explicar la respuesta en voz alta y generar una escena sonora ilustrativa.

Un sistema de atención al cliente ofrece otro ejemplo. Podría mantener una conversación en directo mientras una herramienta consulta un pedido y luego retomar con el resultado sin imponer silencio.

Los equipos creativos podrían describir una escena con dos interlocutores, ruido de calle y música de fondo. StepAudio 3 Gen está diseñado para representar esos elementos como una secuencia de audio coordinada.

Estos ejemplos describen capacidades previstas, no despliegues de producción documentados de manera independiente. Aun así, muestran por qué la estructura de cinco modelos merece atención más allá del titular de la clasificación.

Las pilas de voz anteriores solían conectar componentes separados de reconocimiento, lenguaje y síntesis. Ese diseño ofrece flexibilidad a los desarrolladores, pero cada conexión añade latencia y otra oportunidad de pérdida de información.

Una transcripción puede conservar las palabras mientras pierde vacilación, sarcasmo, énfasis o contexto de fondo. Un modelo de lenguaje posterior no puede razonar sobre información acústica que la etapa de transcripción eliminó.

Los modelos de audio nativos intentan evitar esa pérdida procesando el sonido directamente. El sistema en tiempo real de StepFun sigue esta vía, mientras que sus productos ASR y TTS separados conservan opciones modulares para aplicaciones convencionales.

Por tanto, el lanzamiento de StepAudio 3 admite ambas opciones arquitectónicas. Los desarrolladores pueden usar un modelo integrado de voz a voz o ensamblar una canalización a partir de componentes más específicos.

Este enfoque dual tiene sentido comercial. Un centro de llamadas puede priorizar transcripciones auditables, mientras que un personaje conversacional podría valorar más el ritmo y la continuidad emocional.

Los cinco lanzamientos también reducen la necesidad de coordinar generaciones de modelos de proveedores no relacionados. Que eso produzca mejores operaciones depende de la documentación, el acceso regional, la observabilidad y un rendimiento estable bajo tráfico real.

Estas cuestiones llevan directamente a lo que está en juego a nivel competitivo. StepFun ha presentado un catálogo de audio completo, pero cada componente compite en un mercado distinto y saturado.

Los resultados de Artificial Analysis dan a StepFun un punto de entrada creíble

Los resultados de los benchmarks importan porque miden partes distintas de la interacción oral, no cinco versiones de la misma capacidad.

Artificial Analysis separa el razonamiento sobre voz de la dinámica conversacional y la finalización de tareas. Su metodología de benchmark refleja una verdad básica sobre los agentes de voz: sonar fluido y completar trabajo son problemas diferentes.

El razonamiento sobre voz utiliza Big Bench Audio, una colección de 1,000 preguntas de audio adaptadas de Big Bench Hard. Los modelos reciben preguntas habladas y deben generar respuestas mediante audio.

El benchmark cubre falacias formales, navegación, conteo de objetos y problemas de lógica. Una puntuación alta indica que un modelo puede razonar sobre entradas habladas, aunque no capta todas las conversaciones reales.

La dinámica conversacional utiliza partes de Full Duplex Bench. Full duplex significa que ambas partes pueden hablar y reaccionar sin esperar rígidamente turnos alternos.

La evaluación prueba si un modelo permanece callado durante pausas naturales, responde en verdaderos límites de turno, gestiona interrupciones y reconoce confirmaciones breves. Estos comportamientos determinan si un asistente de voz parece receptivo o habla constantemente por encima del usuario.

StepFun afirma que StepAudio 3 Realtime obtuvo un 99.7% en razonamiento sobre voz y un 98.9% en dinámica conversacional. La empresa presentó ambas puntuaciones como resultados de primer lugar al anunciar la familia.

El artículo técnico de tiempo real asociado documenta de forma independiente el resultado de 98.9 en Full Duplex Bench. También informa de una puntuación MMSU de 90.6 y una tasa de éxito de tareas macro del 56.0% en el benchmark tau-Voice.

MMSU evalúa la comprensión y el razonamiento en contenidos hablados. Tau-Voice evalúa si un agente de voz completa tareas de atención al cliente de varios pasos que implican herramientas y condiciones conversacionales cambiantes.

Estos resultados revelan una distinción importante. StepAudio 3 puede acercarse a la saturación en pruebas estructuradas de razonamiento y toma de turnos, mientras que el éxito en tareas sigue siendo mucho menor.

Esa brecha no es exclusiva de StepFun. Los agentes de voz pueden reconocer una instrucción y responder de forma natural, pero aun así no completar la transacción solicitada.

Artificial Analysis introdujo su índice de voz a voz para combinar razonamiento, comportamiento conversacional, rendimiento de agentes y señales de preferencia. Su visión general del índice explica por qué ninguna puntuación única define el mejor modelo de voz.

Las páginas activas de Artificial Analysis también pueden cambiar a medida que varían los proveedores, las versiones de prueba y los requisitos de calificación. Sus resúmenes públicos actualmente indexados no muestran de forma consistente StepAudio 3 en todas las vistas.

Esto crea un límite de verificación que los lectores deberían comprender. Las puntuaciones del día de lanzamiento aparecen en el anuncio y el material técnico de StepFun, mientras que una posición estable en una clasificación pública puede cambiar o actualizarse con retraso.

El resultado de ASR tiene una salvedad similar. StepFun informa de una tasa de error de palabras del 1.7% para StepAudio 3 ASR en la evaluación no streaming de Artificial Analysis.

La tasa de error de palabras mide sustituciones, eliminaciones e inserciones respecto a una transcripción de referencia. Las puntuaciones más bajas son mejores, pero un único agregado puede ocultar grandes diferencias entre acentos, entornos y áreas temáticas.

StepFun afirma que el resultado empata con Fun-Realtime-ASR-preview de Alibaba. Las cifras comparativas comunicadas sitúan a MAI-Transcribe-2 de Microsoft en el 2.0% y a Scribe v2 de ElevenLabs en el 2.2%.

Estas diferencias son pequeñas en términos absolutos. Aun así, pueden importar cuando las organizaciones procesan millones de palabras, especialmente si los errores afectan a nombres, números o terminología regulada.

Sin embargo, la precisión no streaming no predice automáticamente la calidad de transcripción en directo. Los sistemas streaming deben producir resultados parciales antes de escuchar la frase completa, lo que genera un equilibrio distinto entre precisión y latencia.

Artificial Analysis describe su clasificación ASR no streaming como una evaluación agregada entre conjuntos de datos de voz. Los compradores deberían seguir probando sus propios acentos, micrófonos, vocabulario y condiciones de ruido.

Las victorias en benchmarks dan a StepFun una invitación sólida a realizar esa evaluación. No eliminan la necesidad de hacerlo.

StepAudio 3 Realtime compite con el modelo de canalización

La competencia más importante enfrenta el audio nativo unificado con la cadena consolidada de reconocimiento, razonamiento de texto, herramientas y síntesis de voz.

Los agentes de voz tradicionales comienzan con ASR. Un modelo de texto interpreta la transcripción, llama a herramientas cuando es necesario y pasa su respuesta a un sistema TTS.

Esa canalización sigue siendo atractiva porque cada capa puede sustituirse de manera independiente. Los equipos pueden elegir un proveedor para reconocimiento, otro para razonamiento y otro para una voz preferida.

La debilidad aparece entre esas capas. La transcripción puede eliminar significado acústico, el procesamiento secuencial añade demora y los servicios separados complican la gestión de interrupciones.

StepAudio 3 Realtime utiliza lo que sus investigadores denominan un bucle continuo de escuchar-conversar-pensar-actuar. El modelo está diseñado para seguir escuchando mientras produce voz y gestiona herramientas.

Su componente Deep Perception interpreta información semántica y acústica. Seamless Duplex coordina la entrada y la salida simultáneas, incluidas las pausas, las interrupciones y las respuestas breves de retroalimentación.

El mecanismo definitorio del modelo es Think-While-Speaking. StepFun afirma que permite que el razonamiento privado continúe en paralelo con la entrega oral.

Ese diseño aborda una difícil disyuntiva de la IA de voz. Un razonamiento más extenso puede mejorar una respuesta, pero esperar por él puede hacer que un intercambio hablado parezca poco receptivo.

Empezar a hablar temprano reduce la demora percibida. También puede crear un nuevo riesgo si el razonamiento posterior contradice palabras que el sistema ya ha pronunciado.

El informe técnico de StepFun afirma que el sistema coordina la planificación y la voz sin bloquear la conversación. El artículo informa de un rendimiento comparable al de modos de razonamiento dedicados mientras el modelo habla en tiempo real.

La formulación importa. Se trata de resultados de investigación comunicados bajo condiciones de prueba definidas, no de una garantía de que todas las aplicaciones mantendrán simultáneamente velocidad y precisión.

El Voice Agent integrado puede ejecutar llamadas a herramientas de forma asíncrona, según el artículo. Un modelo podría empezar a explicar un proceso mientras una acción independiente recupera información.

Esta capacidad se aplica a reservas, soporte minorista, gestión de cuentas y programación. También plantea preguntas operativas sobre qué debería decir el modelo antes de que una herramienta devuelva un resultado.

Un agente bien diseñado debe distinguir la información confirmada de una explicación provisional. De lo contrario, un habla más rápida puede generar afirmaciones seguras que un sistema externo desmienta posteriormente.

OpenAI, Google, xAI y Alibaba han impulsado la interacción de audio nativa, mientras proveedores especializados continúan mejorando capas individuales de la cadena. StepFun entra en una competencia ya dividida entre varios objetivos de optimización.

Alibaba es el rival de referencia más cercano en los resultados de lanzamiento reportados. Sus modelos Qwen Audio se sitúan cerca de la cima de las evaluaciones de razonamiento de voz y conversación mostradas por Artificial Analysis.

OpenAI y Google ofrecen plataformas de aplicaciones más amplias con adopción existente entre desarrolladores. Su posición les proporciona ventajas de distribución que el liderazgo en benchmarks por sí solo no puede eliminar.

ElevenLabs, Cartesia, Inworld y otros especialistas de voz compiten en naturalidad, controlabilidad, latencia y herramientas de producción. Estas cualidades influyen en las decisiones de compra incluso cuando otro modelo lidera una prueba de razonamiento.

La respuesta de StepFun es la amplitud. Su familia ofrece un modelo nativo en tiempo real, al tiempo que conserva servicios dedicados de reconocimiento, síntesis, generación y música.

Esta estructura evita obligar a cada cliente a adoptar una única arquitectura. También crea una exigente obligación de producto, porque StepFun debe mantener cinco experiencias distintas en lugar de un único endpoint estrella.

Un proveedor unificado puede simplificar la autenticación, el soporte y la coordinación de modelos. También puede concentrar el riesgo operativo si una plataforma se convierte en la dependencia detrás de cada función de audio.

Por ello, los desarrolladores deberían evaluar la arquitectura, no solo muestras de salida. La pregunta adecuada es si la familia integrada de StepFun reduce suficiente complejidad como para justificar una dependencia más profunda de la plataforma.

Para los equipos que procesan entrevistas o grabaciones de reuniones, las transcripciones fiables también alimentan sistemas posteriores de investigación y recuperación de información. Una base de conocimiento de IA con capacidad de búsqueda resulta útil solo cuando el habla capturada sigue siendo precisa y atribuible.

Esto ilustra lo que está en juego a mayor escala. Los modelos de voz suministran cada vez más información a otros sistemas automatizados, por lo que un error plausible puede propagarse mucho más allá de una sola conversación.

Lo que los benchmarks de StepAudio 3 no establecen

StepFun cuenta con pruebas de competitividad técnica, pero el registro público sigue siendo desigual entre modelos, idiomas y condiciones reales de producción.

La primera limitación se refiere a la cobertura. Las afirmaciones de lanzamiento más sólidas se centran en StepAudio 3 Realtime y StepAudio 3 ASR.

StepAudio 3 TTS no apareció en la clasificación actual de voces controladas recuperada durante la investigación. El ranking visible situaba al anterior StepAudio 2.5 TTS por detrás de varios competidores más recientes.

Artificial Analysis utiliza votación ciega de preferencias para sus arenas de voz. Las clasificaciones pueden cambiar a medida que llegan más comparaciones, y los intervalos de confianza pueden superponerse incluso cuando los rangos mostrados difieren.

La ausencia de una entrada de StepAudio 3 TTS no implica una baja calidad. Significa que el lanzamiento aún no aporta evidencia independiente y comparable de preferencias para ese modelo.

StepAudio 3 Gen cuenta con un informe técnico detallado, pero muchas de sus evaluaciones proceden del propio diseño experimental de StepFun. El artículo sobre generación informa sobre TTS zero-shot, diseño de voz, voces cantadas, efectos, música y generación de audio mixto.

TTS zero-shot significa generar la voz de un nuevo hablante a partir de una referencia breve sin entrenamiento adicional del modelo. El diseño de voz crea una voz a partir de instrucciones descriptivas en lugar de copiar a un hablante de referencia.

Los investigadores describen un sistema autorregresivo discreto que genera audio como tokens. Autorregresivo significa que predice elementos sucesivos basándose en los ya producidos.

Su tokenizador representa audio general a 12,5 pasos por segundo mediante 16 libros de códigos residuales. Un libro de códigos es un conjunto aprendido de símbolos discretos utilizado para comprimir información de audio.

El modelo base predice el primer libro de códigos a lo largo del tiempo. Un transformer causal más pequeño completa los 15 libros de códigos restantes, añadiendo detalle acústico.

Esto difiere de los generadores de audio basados en difusión, que refinan señales continuas mediante pasos repetidos de eliminación de ruido. StepFun sostiene que una representación discreta compartida puede admitir voz, sonidos, voces cantadas y música dentro de un mismo marco.

El artículo informa de una puntuación Elo de 1.755,33 en TTS en chino en la evaluación de la empresa. También reporta 410 victorias, 39 empates y 51 derrotas en 500 comparaciones.

Para el diseño de voz, el artículo informa de una puntuación Elo de 1.668,5 y una tasa agregada de victorias del 75,5 % en 196 comparaciones. Estas cifras son útiles, pero no son intercambiables con los resultados de arenas públicas.

Los evaluadores, la selección de modelos, los prompts y los procedimientos de puntuación determinan qué puede respaldar un benchmark. Las comparaciones realizadas por empresas deben seguir etiquetándose como evidencia generada por la empresa.

StepAudio 3 Music necesita un examen independiente aún mayor. La generación de música se evalúa según composición, calidad de audio, consistencia vocal, cumplimiento del prompt y estructura a largo plazo.

StepFun afirma que el modelo comprende secciones como estrofas, estribillos y puentes. También permite control mediante la notación ABC, un formato de texto para representar notas musicales.

Estos controles parecen útiles para la creación iterativa. No establecen con qué fiabilidad el modelo sigue arreglos complejos ni mantiene la identidad melódica a lo largo de una canción completa.

Los derechos de autor y los derechos de voz crean otra área sin resolver. La generación basada en audio de referencia puede permitir localización legítima y trabajo creativo, pero también puede reproducir características protegidas o personalmente identificables.

El anuncio no aclara cómo funcionan la verificación de identidad, el consentimiento, las marcas de agua o la detección de uso indebido en cada endpoint. Los compradores empresariales necesitarán respuestas directas sobre políticas y aspectos técnicos.

El rendimiento lingüístico presenta otra incertidumbre. StepFun destaca el chino, el inglés, los dialectos, el cambio de código y el vocabulario especializado.

Las puntuaciones agregadas no pueden mostrar si cada idioma y dialecto funciona igual de bien. Los benchmarks en inglés también pueden subestimar los puntos fuertes de StepFun en chino y revelar poco sobre idiomas con menor soporte.

La fiabilidad en producción es la brecha final. Una demostración puede funcionar con audio controlado, mientras que un agente desplegado se enfrenta a voces superpuestas, conexiones débiles, interlocutores alterados y fallos inesperados de herramientas.

La latencia también debe medirse más allá del primer sonido. Un sistema puede comenzar a hablar rápidamente y aun así hacer pausas poco naturales, corregirse a sí mismo o retrasar la respuesta decisiva.

Estas limitaciones no invalidan el lanzamiento de StepAudio 3. Definen la evidencia necesaria para determinar si la fortaleza en los rankings se convierte en adopción duradera.

Tres señales mostrarán si se mantiene el liderazgo de StepFun

La siguiente fase debería juzgarse mediante clasificaciones independientes estables, comportamiento de despliegue verificado y respuestas competitivas de plataformas de voz consolidadas.

La primera señal es la persistencia de StepAudio 3 en las páginas públicas de Artificial Analysis. El liderazgo del día de lanzamiento cobra más significado si el modelo sigue apareciendo después de las actualizaciones de evaluación.

Los lectores deberían seguir el índice combinado de voz a voz, no solo el razonamiento de voz y la dinámica conversacional. La vista combinada incluye evidencia de finalización de tareas y preferencias que se asemeja más a un producto operativo.

Una sólida posición general reforzaría la afirmación de StepFun de que el modelo en tiempo real equilibra razonamiento, interacción y acción. Una posición combinada más baja expondría una especialización detrás de los primeros puestos del titular.

La tasa de éxito en tareas tau-Voice del 56,0 % reportada ofrece una referencia útil. Mejorarla importaría más que pasar del 99,7 % a una puntuación de razonamiento ligeramente superior.

La segunda señal es la prueba independiente de StepAudio 3 TTS, Gen y Music. Estos modelos representan gran parte de la amplitud creativa de la familia, pero carecen de evidencia de terceros igual de visible.

Para TTS, conviene observar clasificaciones de preferencias ciegas, consistencia a lo largo de pasajes extensos, fidelidad de clonación y rendimiento con acentos desconocidos. El tiempo hasta el primer audio también importa para el uso interactivo.

Para Gen, los evaluadores deberían comprobar si varios hablantes conservan identidades estables. También deberían comprobar si los eventos sonoros solicitados ocurren en el orden correcto.

Para Music, la evidencia decisiva incluirá estructura a largo plazo y control editable. Las muestras cortas atractivas no pueden establecer si un modelo sigue revisiones a lo largo de composiciones completas.

Resultados independientes que coincidan con las comparaciones internas de StepFun reforzarían el argumento de una pila completa. Grandes diferencias limitarían la historia a la interacción en tiempo real y el reconocimiento.

La tercera señal es cómo responden Alibaba, OpenAI, Google y los proveedores especializados de voz. Un liderazgo en benchmarks es más relevante cuando cambia las prioridades de lanzamiento de los competidores.

Alibaba ya se sitúa cerca de StepFun en las evaluaciones de voz reportadas. Una actualización rápida de Qwen podría convertir la primera posición en un breve intercambio entre dos familias de modelos chinos.

OpenAI y Google pueden combinar modelos de voz nativos con plataformas de razonamiento y aplicaciones ampliamente utilizadas. Pueden responder mediante distribución, soporte de herramientas o fiabilidad, en lugar de con una puntuación de benchmark más alta.

Los especialistas de voz pueden responder con menor latencia, controles más sólidos, mejor observabilidad o salvaguardas empresariales más claras. Estos factores pueden superar una pequeña brecha de precisión para los compradores de producción.

El desafío de StepFun es convertir su amplitud técnica en una experiencia coherente para desarrolladores antes de que los rivales cierren las brechas visibles. La documentación, el tiempo de actividad, las herramientas de evaluación y los controles de seguridad transparentes determinarán esa conversión.

El lanzamiento de StepAudio 3 cambia la posición de StepFun en la IA de voz. Ahora es líder en benchmarks con un modelo para casi cada etapa de la creación e interacción de audio.

La prueba más difícil comienza después del anuncio. ¿Puede StepFun mantener resultados de primer lugar mientras demuestra que su pila de cinco modelos funciona en aplicaciones ruidosas, multilingües y dependientes de herramientas?

Los desarrolladores deberían comparar los modelos con sus propias grabaciones, flujos de trabajo y casos de fallo. El resultado más informativo no será otra demostración, sino un agente de voz que complete trabajo real sin perder contexto ni control.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page