Los modelos de voz de Microsoft AI desplazan la carrera de los agentes de voz de las demostraciones a la latencia
Microsoft ha lanzado tres modelos de voz de Microsoft AI dirigidos a los retrasos y las brechas lingüísticas que todavía hacen que muchos agentes de voz parezcan artificiales. La gama incluye el primer modelo de transcripción en streaming de la compañía, además de dos generadores de voz multilingües. Una variante puede empezar a devolver texto provisional poco más de 100 milisegundos después de recibir audio.
El lanzamiento importa porque Microsoft no está presentando otra demostración aislada de voz. Está empaquetando modelos de escucha y habla como partes complementarias de una canalización de agentes de voz. Esto aumenta la presión sobre OpenAI, ElevenLabs, Deepgram y otros proveedores que compiten por suministrar la pila conversacional completa.
Microsoft afirma que su nuevo modelo de transcripción lidera un benchmark independiente. Sin embargo, las clasificaciones en benchmarks no resuelven las cuestiones de fiabilidad en producción, cobertura lingüística, interrupciones, seguridad o rendimiento en condiciones reales y complejas. La verdadera competencia se desarrollará en llamadas de clientes, reuniones, aulas y servicios multilingües.
Microsoft convierte la voz en streaming en una línea de productos
El cambio central es la decisión de Microsoft de competir en ambos extremos de una conversación de voz.
Microsoft anunció MAI-Transcribe-2-Streaming, MAI-Voice-2.1 y MAI-Voice-2.1-Flash el 1 de octubre de 2026. Los tres proceden de la familia interna de modelos MAI de Microsoft AI.
MAI-Transcribe-2-Streaming convierte voz en directo en texto en 60 idiomas. También realiza detección automática y continua del idioma, lo que significa que una aplicación no necesita conocer el idioma del hablante antes de que comience el procesamiento.
La transcripción en streaming difiere del procesamiento de una grabación terminada. El modelo consume el audio entrante y produce palabras provisionales, denominadas transcripciones parciales, antes de que el hablante complete una expresión. Después revisa esas palabras a medida que llega contexto adicional y consolida una versión estable.
Según el anuncio del modelo, los primeros resultados parciales llegan poco más de 100 milisegundos después de que el audio alcance el sistema. Microsoft también afirma que sus evaluaciones internas mostraron que las palabras aparecían el doble de rápido que con su competidor más cercano en escenarios de dictado y subtitulado.
Estas afirmaciones describen mediciones distintas. El tiempo hasta el primer resultado parcial indica con qué rapidez una interfaz puede mostrar o procesar una hipótesis temprana. La afirmación de que las palabras aparecen el doble de rápido se refiere a la comparación interna de Microsoft. Ninguna de las dos cifras describe por sí sola el retraso total antes de que un agente dé una respuesta útil.
El modelo de transcripción admite varias aplicaciones inmediatas. Los subtítulos en directo pueden actualizarse mientras una persona habla. Un agente de atención al cliente puede empezar a clasificar una solicitud antes de que quien llama termine. Una herramienta de reuniones puede preparar notas o recuperar información relevante mientras continúa la conversación.
Los dos modelos de generación de voz abordan el camino de vuelta. MAI-Voice-2.1 admite 23 idiomas y 26 configuraciones regionales. Microsoft afirma que una única voz generada puede cambiar entre los idiomas compatibles mientras mantiene su identidad reconocible y adopta un acento nativo.
Esta distinción importa para los productos internacionales. Muchos sistemas pueden hablar varios idiomas, pero pueden requerir voces distintas para cada mercado. Un tutor, asistente de soporte o personaje multimedia puede sonar como una persona diferente cada vez que cambia el idioma.
MAI-Voice-2.1 busca, en cambio, preservar la identidad del hablante. Una aplicación educativa podría pasar del inglés al mandarín sin sustituir al aparente profesor. Un agente de servicio podría responder a clientes en distintos idiomas sin perder la voz de marca elegida por su operador.
MAI-Voice-2.1-Flash admite los mismos idiomas y el mismo comportamiento del hablante entre lenguas. Microsoft diseñó esta variante para cargas de trabajo en las que el volumen de salida y el tiempo de respuesta importan más. La compañía afirma que puede generar 45 segundos de audio con una latencia de extremo a extremo de 150 milisegundos.
Microsoft también afirma que Flash ofrece una inferencia del modelo un 55 por ciento más rápida que alternativas comparables. Estas siguen siendo mediciones comunicadas por la empresa, por lo que los desarrolladores deberán probarlas con sus propios prompts, regiones, formatos de audio y patrones de tráfico.
Los tres modelos están disponibles mediante Microsoft Foundry y MAI Playground. Los modelos de voz también se distribuyen a través de OpenRouter, mientras que Microsoft incluye Vercel, Azure Voice Live y una próxima integración con LiveKit entre las vías de acceso.
El lanzamiento amplía una línea que Microsoft inició a principios de 2026. MAI-Transcribe-1 procesaba voz pregrabada en 25 idiomas, pero su tarjeta de modelo excluía explícitamente la transcripción en tiempo real. El nuevo modelo de streaming convierte esa capacidad prevista en un servicio comercialmente accesible.
Por qué los modelos de voz de Microsoft AI apuntan a todo el presupuesto de latencia
Un agente de voz convincente depende del retraso combinado de escuchar, razonar, usar herramientas y hablar.
Un agente de voz funciona como un bucle. Recibe audio, determina qué se ha dicho, decide qué hacer, posiblemente llama a una herramienta y convierte el resultado en voz. El retraso introducido en cualquier punto de esa secuencia pasa a formar parte de la espera del usuario.
Por eso una cifra rápida de transcripción no puede sostener por sí sola la experiencia. Un modelo puede mostrar palabras parciales rápidamente y tardar más en finalizar una frase. El sistema de razonamiento puede entonces esperar a que termine un turno completo. Una consulta lenta a una base de datos o un generador de voz puede borrar cada milisegundo ahorrado antes.
La estrategia de Microsoft consiste en reducir el retraso en ambos límites de audio. MAI-Transcribe-2-Streaming proporciona texto antes de que un usuario termine de hablar. MAI-Voice-2.1-Flash comienza a generar la respuesta con un retraso de extremo a extremo comunicado de 150 milisegundos.
Ese diseño da más tiempo a la capa de razonamiento. Un agente puede empezar a identificar la intención, preparar una búsqueda o seleccionar una herramienta a partir de una transcripción temprana. No siempre necesita esperar a una grabación de audio completa.
Pensemos en una persona que llama a una aerolínea para cambiar un vuelo al viernes por la mañana. Un sistema de streaming puede reconocer el destino, la fecha y la acción solicitada a medida que llegan. Puede comenzar a comprobar los campos pertinentes antes de que la persona termine la frase.
El agente aún necesita prudencia. Actuar sobre texto parcial inestable puede generar errores costosos. “Cancela mi vuelo” y “no canceles mi vuelo” muestran por qué una transcripción provisional no puede activar automáticamente cada llamada a una herramienta.
Por ello, los desarrolladores necesitan políticas que diferencien la preparación reversible de la acción con consecuencias. Recuperar un registro de reserva puede ser seguro durante una transcripción parcial. Cancelar esa reserva debe esperar a un lenguaje estable y una confirmación explícita.
La documentación del modelo de streaming ofrece a los desarrolladores los detalles operativos necesarios para conectar flujos de audio y recibir resultados en evolución. Sin embargo, el diseño de la implementación sigue siendo tan importante como la velocidad bruta del modelo.
La detección de turnos plantea otro desafío. Una pausa puede significar que el hablante ha terminado, o que está pensando. Si un agente responde demasiado rápido, interrumpe. Si espera demasiado, el intercambio se siente lento.
Por tanto, el mejor sistema equilibra varias medidas: tiempo hasta el primer resultado parcial, tiempo hasta una transcripción estable, detección de final de turno, retraso de razonamiento, duración de llamadas a herramientas y tiempo hasta la primera salida audible. Optimizar una medición puede empeorar otra.
La precisión también cambia el valor de la velocidad. Un resultado parcial rápido pero inestable puede hacer que una aplicación prepare la acción equivocada. Una transcripción más lenta puede ofrecer aun así una mejor experiencia total si reduce las correcciones y las tareas fallidas.
Microsoft afirma que MAI-Transcribe-2-Streaming alcanzó la primera posición en precisión de transcripciones finales y parciales en Artificial Analysis. También afirma que el modelo se sitúa en la frontera de Pareto entre precisión y latencia, donde mejorar una dimensión exigiría sacrificar la otra.
Es un enfoque útil, pero los usuarios deben distinguir entre una clasificación independiente y una auditoría independiente de cada afirmación de Microsoft. Las entradas del benchmark, la distribución de idiomas, el ruido, los micrófonos y las reglas de puntuación pueden diferir de un despliegue concreto.
Los equipos de producción deberían medir el bucle completo. Las pruebas útiles incluyen voz con acentos, alternancia de idiomas, nombres propios, interrupciones, conversaciones de fondo, audio telefónico deficiente, pausas largas y temas que cambian rápidamente.
Los equipos que trabajan con reuniones grabadas también necesitan más que palabras en directo en una pantalla. Deben conectar las transcripciones con notas, decisiones y material de referencia. Un flujo de trabajo que combine la grabación gratuita con conocimiento consultable puede hacer que la transcripción siga siendo útil después de que termine la llamada.
La principal presión recae sobre la pila de voz integrada de OpenAI
Microsoft cuestiona la idea de que un único modelo integrado de voz a voz sea la única vía hacia una interacción de voz natural.
OpenAI ha orientado a los desarrolladores hacia una arquitectura en tiempo real estrechamente integrada. Su Realtime API puede intercambiar audio directamente con un modelo multimodal, reduciendo las transferencias necesarias en una canalización tradicional de transcripción, razonamiento y voz.
En mayo de 2026, OpenAI presentó GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper. La empresa describió GPT-Realtime-Whisper como un modelo de transcripción en streaming que procesa la voz mientras una persona habla.
El lanzamiento de modelos de voz de OpenAI situó la voz como una interfaz capaz de comprender contexto, razonar, traducir, usar herramientas y actuar durante una conversación. Los nuevos modelos de Microsoft entran en ese mismo mercado con un enfoque más visiblemente modular.
La competencia no es simplemente Microsoft contra OpenAI. También es una disputa entre diseños de canalización.
Un modelo integrado de voz a voz puede conservar el tono, el ritmo, la emoción y las señales conversacionales que pueden desaparecer cuando la voz se convierte en texto sin formato. También puede reducir el trabajo de orquestación porque un modelo gestiona una mayor parte del intercambio.
Un sistema modular da a los desarrolladores mayor control sobre cada etapa. Pueden inspeccionar transcripciones, seleccionar un modelo de razonamiento independiente, definir controles de aprobación, almacenar registros textuales y sustituir componentes individuales sin reconstruirlo todo.
El lanzamiento de Microsoft refuerza el argumento modular. Sus modelos de transcripción y voz pueden trabajar juntos, pero siguen siendo servicios distintos. El modelo de razonamiento y la lógica empresarial pueden situarse entre ellos.
Esa estructura puede resultar atractiva para compradores empresariales. Las transcripciones de texto proporcionan una capa auditable para la revisión de calidad, las comprobaciones de cumplimiento, la recuperación de información y la supervisión humana. Los equipos también pueden dirigir distintas conversaciones a distintos modelos de razonamiento.
La modularidad tiene costes. Cada límite entre servicios introduce otra conexión, modo de fallo y fuente de latencia. Los desarrolladores deben gestionar el estado de sesión y determinar cuándo el texto provisional se vuelve lo bastante fiable para una acción posterior.
Los sistemas integrados tienen sus propios riesgos. Pueden ser más difíciles de inspeccionar cuando el modelo pasa directamente de la entrada de audio a la salida de audio. Depurar por qué un agente malinterpretó a una persona que llama puede requerir trazas más completas que las que proporciona una transcripción limpia.
La posición de Microsoft es más sólida cuando los compradores quieren elegir componentes dentro de un entorno Azure existente. Foundry ya funciona como catálogo y capa de despliegue para modelos de Microsoft y proveedores externos. Los nuevos servicios MAI dan a Microsoft un mayor control sobre los modelos que ofrece allí.
El lanzamiento también reduce la dependencia de Microsoft de un único socio para las capacidades de voz. OpenAI sigue siendo un proveedor destacado de Foundry, pero Microsoft ahora puede ofrecer un modelo interno de transcripción en streaming junto a opciones de socios y terceros.
Esto no significa que Microsoft haya sustituido la pila más amplia de tiempo real de OpenAI. El anuncio de Microsoft se centra en la entrada y salida de audio. No demuestra que los modelos MAI igualen el razonamiento, la comprensión emocional o la gestión de interrupciones de un sistema integrado.
En cambio, Microsoft ofrece a los desarrolladores otra opción arquitectónica. Pueden crear un agente de voz cuyas capas de escucha y habla procedan de Microsoft, mientras eligen un modelo de razonamiento según la calidad de la tarea, la gobernanza o los requisitos operativos.
Para los compradores, esto cambia la pregunta de evaluación. La cuestión ya no es si un proveedor tiene una demostración de voz. Es si sus componentes producen conversaciones fiables y medibles al conectarse con herramientas empresariales.
Las voces multilingües elevan la competencia
La cobertura lingüística se está convirtiendo en un problema de sistemas, no en una casilla de verificación en la ficha de un modelo.
MAI-Transcribe-2-Streaming admite 60 idiomas, mientras que los dos nuevos modelos de voz admiten 23 idiomas y 26 configuraciones regionales. Esta diferencia define la primera limitación importante del paquete de Microsoft.
Un sistema puede entender a un usuario en un idioma que la voz MAI seleccionada no puede hablar. Los desarrolladores deben identificar la intersección entre la cobertura de entrada y salida, y decidir qué ocurre fuera de ella.
El desafío aumenta cuando una conversación contiene más de un idioma. Microsoft afirma que su modelo de transcripción detecta continuamente los cambios de idioma. Sus modelos de voz pueden conservar una identidad de hablante mientras alternan entre idiomas compatibles.
Esta combinación es valiosa para la alternancia de códigos, cuando los hablantes cambian de idioma dentro de una conversación. También puede respaldar la atención al cliente en regiones donde los usuarios suelen mezclar un idioma local con el inglés.
La identidad de voz añade otra capa. Microsoft afirma que los nuevos modelos de voz pueden clonar una voz en los idiomas compatibles a partir de unos pocos segundos de audio de referencia. La documentación de voz asociada describe cómo los desarrolladores pueden acceder a MAI-Voice-2.1 y a su variante Flash.
Una voz clonada puede mantener una aplicación reconocible en distintos mercados. También puede generar riesgos de suplantación. Un requisito de referencia breve reduce la barrera práctica tanto para usos legítimos de marca como para copias no autorizadas.
Microsoft afirma que los modelos incluyen protecciones de consentimiento destinadas a prevenir usos indebidos. El anuncio no aporta suficientes pruebas públicas para concluir cómo se comportan esas protecciones ante muestras editadas, cuentas comprometidas o intentos de ingeniería social.
Los despliegues empresariales necesitarán controles que vayan más allá de una salvaguarda a nivel de modelo. Estos pueden incluir consentimiento documentado, acceso limitado a los activos de voz, divulgación de las salidas, registros de auditoría y procedimientos para retirar una voz cuando cambie la autorización.
La calidad multilingüe también exige revisión humana. El acento nativo no equivale a adecuación cultural. La pronunciación, el grado de formalidad, el vocabulario regional, el ritmo y el tono emocional pueden determinar si una voz generada resulta creíble.
Los competidores ya imponen un listón alto a Microsoft. ElevenLabs afirma que su modelo Scribe v2 Realtime admite más de 90 idiomas, produce transcripciones parciales y consolidadas, y ofrece funciones como marcas de tiempo y detección de entidades. Su documentación de transcripción indica una latencia aproximada de 150 milisegundos para el modelo en tiempo real.
Deepgram aborda el mercado mediante reconocimiento de voz conversacional y gestión de turnos. Su documentación de Flux destaca la detección integrada de final de turno, el comportamiento conversacional configurable y patrones de respuesta inferiores a un segundo para agentes de voz.
Estos productos no ofrecen conjuntos de funciones idénticos. Un proveedor puede liderar en número de idiomas, pero diferir en precisión para un idioma concreto. Otro puede gestionar mejor el audio telefónico, detectar los turnos con más fiabilidad o proporcionar controles más útiles.
La cobertura de transcripción en 60 idiomas de Microsoft es más amplia que la de su anterior modelo MAI-Transcribe-1, que cubría 25 idiomas. Sin embargo, los totales públicos de idiomas no deben sustituir las pruebas por idioma.
Un promedio de referencia puede ocultar un rendimiento débil en el mercado más importante para un comprador. Incluso un modelo sólido puede tener dificultades con dialectos, nombres, términos especializados o hablantes cuyas condiciones de audio difieren de los datos de prueba.
La misma cautela se aplica a la calidad de voz. Una muestra de voz puede sonar convincente en una demostración preparada, pero volverse repetitiva durante sesiones largas. Puede pronunciar mal direcciones, cambiar de acento inesperadamente o aplanar las señales emocionales necesarias en llamadas de asistencia delicadas.
Las empresas deben probar recorridos multilingües completos. Esto implica comprobar qué escucha el sistema, qué idioma detecta, cómo representa la transcripción, qué decide la capa de razonamiento y cómo suena la respuesta.
El agente de voz internacional más útil no será el que tenga la lista de idiomas más larga. Será el que gestione cambios, incertidumbre, nombres, consentimiento y escalamiento sin confundir al usuario.
Una transcripción más rápida no elimina el riesgo de producción
Las afirmaciones de rendimiento de Microsoft son prometedoras, pero los despliegues reales expondrán condiciones que las clasificaciones no pueden reproducir por completo.
La primera incertidumbre se refiere a la transferencia de los resultados de referencia. Artificial Analysis ofrece a los compradores un punto de comparación independiente, pero cada carga de trabajo tiene su propia distribución. Un modelo probado con muestras limpias de referencia puede comportarse de forma distinta en llamadas telefónicas comprimidas o salas de conferencias concurridas.
La calidad de las transcripciones parciales merece especial atención. Los sistemas en streaming revisan su salida a medida que llega más audio. Este comportamiento mejora la precisión final, pero puede hacer que el texto parpadee en pantalla o activar trabajo posterior a partir de una frase que más tarde cambia.
Las aplicaciones deberían rastrear la estabilidad de la transcripción en lugar de tratar cada token como definitivo. También deberían separar la detección tentativa de intención de las acciones irreversibles.
Las conversaciones largas introducen problemas de memoria. Un sistema puede necesitar conservar nombres, compromisos e identidades de los hablantes durante una hora. Ese requisito difiere de descodificar con precisión una frase corta.
Investigadores de Microsoft han explorado desafíos relacionados con VibeVoice-ASR-Streaming. El informe técnico describe un enfoque integral que transcribe el habla y atribuye palabras a los hablantes a medida que llega el audio.
Los investigadores publicaron variantes de 1.500 millones y 7.000 millones de parámetros. Su evaluación encontró sólidos resultados de reconocimiento y atribución de hablantes en pruebas de reuniones y nueve idiomas.
El informe también documenta limitaciones. El rendimiento se degrada durante periodos prolongados de habla superpuesta porque el decodificador debe serializar varios hablantes en un único flujo de salida. Esta es una advertencia importante para reuniones, debates y entornos de asistencia muy activos.
MAI-Transcribe-2-Streaming es un modelo comercial independiente, por lo que los hallazgos de VibeVoice no deben atribuirse directamente a él. No obstante, la investigación ilustra por qué la evaluación del habla en directo debe incluir hablantes superpuestos e identidad persistente.
La privacidad crea otro riesgo. Los sistemas de voz en directo pueden procesar conversaciones que contienen información personal, financiera, médica o corporativa. Un modelo de baja latencia no responde dónde se almacena el audio, cómo se conservan los registros ni quién puede acceder a las transcripciones.
Las organizaciones deben revisar la configuración del servicio disponible en su región. También deben determinar si su caso de uso requiere avisos de consentimiento, conservación limitada, redacción, revisión humana o restricciones sobre decisiones automatizadas.
Los equipos de seguridad deberán considerar la inyección de instrucciones mediante voz. Una persona que llama podría indicar a un agente que ignore políticas o revele datos. El audio de fondo podría contener órdenes que el sistema trate erróneamente como una entrada autorizada.
La clonación de voz aumenta la superficie de ataque. Incluso cuando un modelo aplica comprobaciones de consentimiento, la aplicación circundante debe autenticar quién puede crear, gestionar y desplegar una voz clonada.
La fiabilidad durante problemas de red también importa. Los sistemas en streaming dependen de conexiones persistentes y de la entrega ordenada del audio. La pérdida de paquetes, la conectividad móvil o las interrupciones regionales del servicio pueden afectar al tiempo y la integridad de las transcripciones.
Los desarrolladores deberían definir comportamientos de respaldo. Una aplicación podría cambiar a un menú de voz más sencillo, solicitar entrada de texto, reintentar una llamada a una herramienta o transferir la conversación a una persona.
La incertidumbre final es la aceptación por parte de los usuarios. Un sistema rápido aún puede fracasar si las personas no confían en él. Los usuarios necesitan saber cuándo están hablando con un agente automatizado, cuándo se está creando una transcripción y cómo contactar con una persona.
El lanzamiento de Microsoft mejora los ingredientes técnicos. No elimina el trabajo operativo necesario para hacer que esos ingredientes sean seguros y fiables.
Qué observar a medida que los modelos de voz de Microsoft llegan a cargas de trabajo reales
La siguiente etapa se medirá mediante pruebas de producción, no con otra muestra de voz pulida.
La primera señal son las pruebas independientes en distintos idiomas y condiciones acústicas. La posición más alta de Microsoft en las referencias da credibilidad al lanzamiento, pero los compradores necesitan resultados para su audio real.
Las evaluaciones útiles deberían incluir llamadas de bajo ancho de banda, hablantes con acento, ruido de fondo, interrupciones, alternancia de códigos, nombres propios y vocabulario del sector. Deberían informar tanto de la precisión final como de la estabilidad de las transcripciones parciales.
Si MAI-Transcribe-2-Streaming mantiene su posición en estas condiciones, se reforzará la afirmación de Microsoft sobre un equilibrio favorable entre precisión y latencia. Si el rendimiento varía notablemente según el idioma o el tipo de audio, el lanzamiento parecerá más especializado.
La segunda señal es la adopción a través de Foundry, Azure Voice Live, Vercel, OpenRouter y el soporte previsto para LiveKit. La distribución importa porque los agentes de voz necesitan más que un punto de conexión de modelo.
Los desarrolladores necesitan autenticación, observabilidad, disponibilidad regional, gestión de sesiones, integración de herramientas y un comportamiento predecible bajo carga. Un modelo que encaja en una infraestructura consolidada tiene ventaja sobre otro que rinde bien pero genera fricción operativa.
Hay que observar despliegues detallados de clientes, en lugar de proyectos de demostración. Un caso de producción debería explicar el volumen de llamadas, la finalización de tareas, las tasas de escalamiento, las correcciones de transcripciones y la satisfacción de los usuarios.
La tercera señal es la respuesta competitiva. OpenAI puede profundizar la integración entre transcripción, razonamiento, traducción y voz. ElevenLabs puede ampliar sus herramientas de transcripción y voz, mientras Deepgram puede seguir enfatizando la detección de turnos y los controles específicos para agentes.
Esa respuesta revelará si Microsoft ha cambiado el mercado. Si los rivales centran nuevos lanzamientos en el presupuesto combinado de latencia, la identidad de voz entre idiomas o el despliegue modular, estarán respondiendo al enfoque de Microsoft.
Las aplicaciones de trabajo del conocimiento ofrecen una prueba especialmente práctica. La transcripción rápida adquiere más valor cuando las palabras resultantes se conectan con documentos, reuniones anteriores, decisiones y tareas. Los sistemas que admiten knowledge blending pueden convertir una transcripción en directo en contexto, en lugar de otro archivo aislado.
Los desarrolladores deberían evitar elegir un proveedor basándose en una sola cifra de latencia. Deben crear un conjunto de pruebas representativo, medir el ciclo conversacional completo e inspeccionar los fallos con usuarios reales.
Los compradores empresariales deberían preguntar si el sistema espera antes de realizar acciones importantes, gestiona cambios de idioma, protege las voces clonadas, conserva registros de auditoría y transfiere las conversaciones de forma fluida a personas. Estas respuestas importarán más que la primera respuesta de una demostración.
Los modelos de voz con IA de Microsoft ofrecen ahora a la compañía una plataforma creíble para escuchar y hablar. La siguiente pregunta es si los equipos pueden convertir esa velocidad en conversaciones que sigan siendo precisas, seguras y útiles cuando las personas reales dejan de seguir el guion.



