top of page

La rivalidad entre ByteDance y Google pone a prueba en directo el audio y el video con SeedRealtime

11 ago
14 min de lectura

Según informes, ByteDance lanzó SeedRealtime el 11 de agosto, incorporando un nuevo modelo audiovisual a la competencia directa con los sistemas multimodales en directo de Google. El informe de lanzamiento identifica el modelo como un lanzamiento audiovisual en tiempo real. Sin embargo, importantes detalles técnicos y comerciales siguen sin estar disponibles en los materiales de ByteDance indexados públicamente.

Esta carencia importa porque la IA multimodal en tiempo real ya no es una demostración de laboratorio. Google ya ofrece a los desarrolladores interacción bidireccional de audio, video y texto mediante su Gemini Live API. Sus modelos pueden observar una transmisión de video, escuchar a un usuario, responder con voz y llamar a herramientas externas durante una misma sesión.

Por tanto, la rivalidad entre ByteDance y Google va más allá de las puntuaciones de benchmarks y los medios generados. La próxima competencia gira en torno a la percepción continua, el ritmo conversacional, la distribución del producto y la confianza. SeedRealtime solo será relevante si ByteDance logra conectar esos elementos dentro de un sistema utilizable.

SeedRealtime amplía la apuesta de ByteDance por la IA en tiempo real

SeedRealtime parece conectar dos áreas que ByteDance ha desarrollado por separado: la interacción de voz en directo y la comprensión visual multimodal.

El grupo Seed de ByteDance ya ha creado una amplia cartera de modelos. Incluye modelos multimodales generales, sistemas de voz en tiempo real, generadores de imágenes y herramientas de generación de audio y video. El posicionamiento reportado de SeedRealtime sugiere un avance hacia un asistente capaz de observar y conversar de forma continua.

Esto difiere de procesar un video grabado después de subirlo. Un modelo en tiempo real debe interpretar una transmisión entrante mientras decide cuándo responder. También debe conservar suficiente contexto para comprender cómo cambian la escena y la conversación.

El sistema podría admitir escenarios como mostrar mediante una cámara un problema con un dispositivo mientras se solicita orientación hablada. Otros usos incluyen atención al cliente visual, interpretación en directo, asistencia de accesibilidad, formación remota y compras interactivas.

Estos ejemplos describen la categoría, no funciones confirmadas de SeedRealtime. ByteDance no había publicado una ficha de modelo, guía de API, informe de benchmarks ni página de lanzamiento detallada indexados públicamente cuando se preparó este análisis. Sus entradas, salidas, idiomas compatibles, límites de contexto y disponibilidad exactos siguen sin estar claros.

El nombre también requiere un manejo cuidadoso. “Audiovisual” podría describir varios sistemas diferentes. Un modelo podría ingerir sonido y video, pero responder solo con texto. Otro podría devolver voz nativa mientras sigue una transmisión de cámara en directo.

Una versión más ambiciosa mantendría un contexto visual y acústico continuo, al tiempo que admitiría interrupciones. Ese diseño se parece más a un participante en directo que a una secuencia de solicitudes independientes.

El trabajo previo de ByteDance muestra por qué esta interpretación es plausible. En abril, la empresa presentó Seeduplex como un modelo de voz full-duplex. Full duplex significa que un sistema puede escuchar y hablar al mismo tiempo, en lugar de imponer turnos rígidos.

ByteDance afirmó que la interacción de Seeduplex podía suprimir voces no relacionadas e interferencias de fondo. La empresa también identificó la entrada visual como una extensión prevista para coordinar la escucha, la visión y el habla.

SeedRealtime parece seguir esa dirección declarada. Sin embargo, una hoja de ruta relacionada no confirma que ambos sistemas compartan una arquitectura. ByteDance no ha explicado públicamente si SeedRealtime amplía Seeduplex, Seed2.0 u otra familia de modelos.

La distinción importa para los desarrolladores. Una demostración de investigación renombrada ofrece un valor inmediato limitado. Un modelo estable con interfaces de streaming documentadas representaría un lanzamiento de plataforma significativo.

ByteDance también debe aclarar dónde se ejecutará el modelo. La distribución mediante Doubao, Volcano Engine, BytePlus, CapCut u otro servicio produciría audiencias y requisitos de gobernanza diferentes.

Por ahora, el cambio verificado es más limitado de lo que podría sugerir el titular. Según los informes, ByteDance ha presentado un modelo audiovisual en tiempo real, avanzando en su apuesta pública por la interacción multimodal continua. Los detalles operativos necesarios para evaluar ese avance siguen incompletos.

Por qué la competencia entre ByteDance y Google gira en torno a la latencia

La métrica decisiva no es si un modelo puede comprender audio y video, sino si puede hacerlo con la rapidez suficiente para una interacción natural.

Los sistemas multimodales tradicionales reciben una imagen, grabación o prompt completo antes de producir una respuesta. Un sistema en directo no tiene un límite claro. Nueva información sonora y visual sigue llegando mientras el modelo razona y responde.

Esto genera varias formas de latencia. El sistema debe codificar los medios entrantes, detectar si el usuario ha terminado de hablar, razonar sobre la solicitud y generar una respuesta. La transmisión por red y la lógica de la aplicación añaden más retrasos.

Un modelo puede rendir bien en benchmarks de video almacenado y aun así parecer inutilizable durante una conversación. Incluso una respuesta correcta resulta frustrante cuando llega después de que haya pasado el momento en el que se requería ayuda.

La detección de turnos plantea otro desafío. Las personas hacen pausas, reinician frases, hablan unas sobre otras o se dirigen a alguien más en la habitación. Un asistente útil debe distinguir la vacilación de la finalización y el habla de fondo de una entrada intencional.

La sincronización visual añade más complejidad. El usuario podría decir “ese cable” mientras mueve la cámara. El modelo debe vincular la frase con el objeto correcto en el momento adecuado. También debe evitar referirse a un fotograma anterior cuando la escena cambia.

Google ya ha expuesto estas concesiones de ingeniería mediante la Gemini Live API. El servicio utiliza conexiones WebSocket persistentes para streaming bidireccional. Acepta entradas de audio, video y texto, al tiempo que admite salida de audio nativa.

La documentación de Google también revela restricciones prácticas. Su guía actual de capacidades enumera duraciones de sesión predeterminadas limitadas para audio continuo y uso combinado de audio y video. Los desarrolladores pueden ampliar las sesiones mediante técnicas adicionales de gestión, pero los límites muestran que el contexto continuo implica costes reales.

Esta superficie existente para desarrolladores otorga a Google una ventaja importante. Los equipos pueden examinar formatos de mensajes, comportamiento de sesiones, identificadores de modelos, autenticación y patrones de integración. Después, pueden medir el rendimiento dentro de sus propias aplicaciones.

SeedRealtime necesita documentación comparable antes de que los desarrolladores puedan realizar una comparación seria entre ByteDance y Google. Una demostración pulida no puede revelar el comportamiento con redes débiles, interrupciones rápidas, salas concurridas o sesiones prolongadas.

La latencia de la primera respuesta es solo una medición. Los desarrolladores también necesitan conocer el retraso al final del turno, la recuperación ante interrupciones, la velocidad de llamadas a herramientas, el comportamiento de muestreo de video y la retención de contexto. La latencia de cola importa porque las pausas largas ocasionales pueden dañar toda una experiencia.

La calidad del audio también afecta a la velocidad percibida. Un modelo que empieza a hablar rápidamente pero se corrige con frecuencia puede parecer más lento de lo que sugiere una respuesta medida. Un ritmo natural requiere coordinación entre el razonamiento y la generación de voz.

ByteDance cuenta con experiencia relevante a gran escala de consumo. Sus plataformas procesan extensas transmisiones de video, audio y señales de interacción. Esa base podría ayudar con la infraestructura de medios, la optimización móvil y la distribución.

Sin embargo, la escala en sistemas de recomendación no se transfiere automáticamente a la interacción generativa en directo. Un asistente personal debe mantener un contexto específico de la sesión y producir una respuesta individualizada. No puede depender solo de clasificar contenido existente.

Por tanto, el mecanismo importante es la coordinación continua. SeedRealtime debe alinear percepción, razonamiento, toma de turnos y voz sin permitir que un componente bloquee al resto. Esa integración determinará si el modelo parece presente o simplemente rápido.

Google ya cuenta con una ventaja de distribución operativa

Google entra en esta competencia con API desplegadas, superficies de consumo e integraciones de dispositivos, mientras que SeedRealtime comienza con una brecha de información.

Google describe sus modelos en directo como sistemas para aplicaciones de voz de baja latencia, uso de herramientas y recuperación de información en tiempo real. Sus modelos de diálogo en directo aceptan múltiples formatos de entrada y se conectan con Google AI Studio y la Gemini API.

La empresa también controla Android, Search, Workspace, YouTube y una cartera de hardware en expansión. Estas superficies proporcionan lugares donde la asistencia audiovisual en directo puede convertirse en un comportamiento recurrente.

Un asistente consciente de la cámara gana valor a través del contexto. Puede ayudar a los usuarios a inspeccionar un electrodoméstico, interpretar una señal, identificar un objeto o navegar por software desconocido. El modelo se vuelve más útil cuando puede actuar mediante servicios conectados.

Google puede conectar las interacciones en directo con Search y herramientas definidas por desarrolladores. Un sistema podría observar un producto, recuperar información de apoyo y ejecutar una acción de seguimiento sin terminar la conversación.

ByteDance tiene una posición de distribución diferente. TikTok, Douyin, CapCut y servicios relacionados sitúan a la empresa cerca de los creadores y la comunicación visual. Ese acceso podría respaldar asistencia de producción en directo, orientación con cámara, comercio y edición de medios.

ByteDance también opera Doubao, su asistente de IA para consumidores chinos. Un modelo audiovisual en tiempo real podría reforzar ese producto al permitir a los usuarios mostrar problemas en lugar de describirlos mediante texto.

Por tanto, las empresas abordan la misma categoría técnica desde historias de producto diferentes. Google parte de la búsqueda, la informática móvil y la infraestructura para desarrolladores. ByteDance parte del video de formato corto, las herramientas de creación, la recomendación y el consumo frecuente de medios.

Este contraste hace que SeedRealtime sea más que otro anuncio de modelo. ByteDance no necesita reproducir todos los casos de uso de Google. Puede concentrarse en interacciones en las que el video ya es central para la actividad del usuario.

Un creador podría pedir a un asistente que evalúe el encuadre mientras graba. Un vendedor podría recibir orientación hablada durante una demostración de producto en directo. Un espectador podría hacer preguntas sobre una escena cambiante sin salir de la interfaz de video.

Estas siguen siendo aplicaciones potenciales hasta que ByteDance confirme su despliegue. No obstante, muestran por qué la distribución de la empresa podría presionar a Google pese a su entrada posterior en la plataforma.

La presión también opera en sentido contrario. Las API documentadas de Google ofrecen a los desarrolladores una vía más clara para realizar pruebas y desplegar productos. Google puede mejorar sus modelos con diversas cargas de trabajo empresariales y de consumo antes de que SeedRealtime sea ampliamente accesible.

Por tanto, el principal oponente no es simplemente un modelo frente a otro. Es la distribución de ByteDance centrada en los medios frente a la plataforma multimodal consolidada de Google.

En la competencia entre ByteDance y Google, la ubicación del producto puede importar más que una pequeña diferencia en benchmarks. Los usuarios rara vez eligen un modelo fundacional de forma aislada. Se encuentran con él a través de una aplicación que ya concentra sus datos, atención o flujo de trabajo.

Los desarrolladores toman decisiones similares. Comparan fiabilidad, disponibilidad geográfica, controles de moderación, soporte, observabilidad y esfuerzo de integración. Un modelo capaz puede perder adopción cuando su ruta de despliegue sigue siendo incierta.

ByteDance debe explicar si SeedRealtime es un lanzamiento de investigación, una función para consumidores, un servicio empresarial o una plataforma para desarrolladores. Hasta entonces, Google conserva la propuesta más comprobable.

La IA audiovisual en tiempo real tiene modos de fallo graves

Un modelo que observa y escucha continuamente genera riesgos de privacidad, precisión y seguridad que no aparecen en el chat de texto convencional.

El riesgo más inmediato es una percepción errónea expresada con confianza. El movimiento de la cámara, la mala iluminación, las oclusiones, el ruido y los hablantes simultáneos pueden distorsionar la evidencia disponible. Un modelo podría identificar el objeto equivocado o vincular el habla con un evento visual no relacionado.

Eso se vuelve peligroso cuando los usuarios solicitan orientación médica, mecánica, financiera o de seguridad. Una respuesta tardía es inconveniente. Una instrucción rápida pero incorrecta puede causar daños antes de que el usuario reconozca el error.

Los sistemas continuos también afrontan un difícil problema de atención. Deben decidir qué partes del entorno importan y cuáles deben ignorarse. Capturarlo todo aumenta el coste y la exposición de privacidad, mientras que un filtrado agresivo puede eliminar contexto importante.

La detección de actividad de voz no resuelve esto por sí sola. Un televisor cercano, otra persona o un clip de audio generado podrían contener habla que parezca dirigida al asistente. Las señales visuales pueden ayudar, pero también introducir nuevos errores.

La interacción full-duplex agrava el desafío. El sistema debe determinar cuándo dejar de hablar tras una interrupción. Debe conservar el contexto útil sin insistir obstinadamente en completar una respuesta obsoleta.

Google describe la escucha proactiva como la capacidad de distinguir la interacción directa de la conversación de fondo. Es una afirmación importante sobre el producto, pero los desarrolladores todavía necesitan pruebas independientes con distintos acentos, dispositivos, entornos y necesidades de accesibilidad.

ByteDance hace afirmaciones relacionadas sobre Seeduplex, incluida la supresión de interferencias y la detección adaptativa de final de intervención. SeedRealtime necesitará evidencia nueva porque añadir visión cambia tanto la distribución de entrada como la superficie de seguridad.

La privacidad es igualmente importante. Una cámara en directo puede captar rostros, documentos, pantallas, ubicaciones y personas presentes que nunca aceptaron interactuar con un sistema de IA. Los micrófonos pueden registrar conversaciones sensibles más allá de la solicitud prevista.

Los desarrolladores necesitan respuestas claras sobre retención, procesamiento regional, uso para entrenamiento, registro y eliminación. También necesitan controles que muestren cuándo hay una transmisión activa y qué información se está enviando.

La voz generada introduce riesgos de suplantación. Un sistema que puede reproducir voces o reaccionar ante personas visibles podría permitir contenido engañoso, uso no autorizado de la imagen o ingeniería social.

Google afirma que su audio generado por IA recibe marcas de agua SynthID. Las marcas de agua no impiden el uso indebido, pero ofrecen un método para identificar resultados generados.

No se encontró ninguna divulgación pública comparable sobre SeedRealtime en el momento de la publicación. ByteDance debería explicar si los resultados reciben marcadores de procedencia detectables y cómo maneja el sistema la identidad facial y vocal.

La empresa también debe abordar la inyección de instrucciones a través del entorno. Un cartel, una pantalla, una grabación o una persona podrían proporcionar instrucciones diseñadas para anular el objetivo del usuario. La percepción en directo convierte el mundo circundante en un canal de entrada no confiable.

Los sistemas conectados a herramientas elevan lo que está en juego. Un asistente que puede ver una instrucción y realizar una acción necesita límites estrictos de autorización. Debe separar el contenido observado de los comandos aprobados por el usuario.

La actual brecha de verificación no significa que SeedRealtime carezca de salvaguardas. Significa que los observadores externos aún no pueden evaluarlas. Las afirmaciones sobre seguridad, latencia o precisión deben seguir siendo provisionales hasta que ByteDance publique evidencia técnica.

Este es el equilibrio central de la IA multimodal en tiempo real. Un contexto más continuo puede hacer que un asistente sea más útil, pero también amplía la cantidad de información sensible y adversarial que procesa el sistema.

Los benchmarks no resolverán la rivalidad entre ByteDance y Google

SeedRealtime necesita evidencia basada en escenarios porque las clasificaciones estáticas no pueden reproducir el ritmo y la incertidumbre de la interacción en directo.

Una evaluación útil debería comenzar con tareas de extremo a extremo. Los evaluadores podrían pedir a un modelo que diagnostique un problema visual cambiante mientras recibe correcciones habladas. Otra prueba podría consistir en identificar al hablante activo en una sala ruidosa.

La evaluación debe medir la finalización de las tareas, no solo la similitud de las respuestas. El sistema debe detectar cambios relevantes, pedir aclaraciones, interrumpir de forma segura y evitar actuar cuando la evidencia es insuficiente.

Las mediciones de latencia necesitan distribuciones en lugar de promedios. Un modelo podría responder rápidamente la mayor parte del tiempo, pero bloquearse durante escenas complejas. Informar de las demoras medianas y de percentiles altos expondría esa inestabilidad.

El muestreo de vídeo merece especial atención. Transmitir cada fotograma es costoso y normalmente innecesario. Sin embargo, muestrear con demasiada poca frecuencia puede hacer que un modelo pierda eventos breves o asocie el habla con el momento equivocado.

La retención de contexto es otra variable crítica. Durante una sesión de reparación, el usuario puede referirse a un objeto mostrado varios minutos antes. El asistente debe conservar el estado relevante sin preservar indefinidamente cada fotograma sensible.

Los desarrolladores también deberían probar el comportamiento ante correcciones. Cuando un usuario dice: “No, me refería al conector de la izquierda”, el modelo debería actualizar su interpretación. Repetir la respuesta original revelaría una vinculación débil con el contexto.

La cobertura lingüística no puede reducirse a un recuento de idiomas compatibles. La calidad de audio varía según los acentos, el cambio de código, los términos especializados y las condiciones ruidosas. El razonamiento visual también puede depender de productos regionales, sistemas de escritura y contexto cultural.

Los materiales públicos de Google describen la traducción de voz en directo entre muchos idiomas y pares de idiomas. Sus páginas actuales de modelos también proporcionan tipos de entrada, límites de contexto, disponibilidad y estado del modelo.

Esa transparencia no demuestra superioridad, pero permite el escrutinio. ByteDance debería publicar información equivalente para SeedRealtime. De lo contrario, los analistas no podrán determinar si ambos productos sirven para las mismas tareas.

El acceso independiente importa tanto como la documentación. Las demostraciones seleccionadas pueden ocultar casos de fallo mediante iluminación favorable, habla clara, sesiones breves y prompts ensayados. Las pruebas abiertas revelan cómo se comporta un sistema fuera de sus condiciones preferidas.

ByteDance ha publicado anteriormente tarjetas de modelo detalladas para otros lanzamientos de Seed. La tarjeta de modelo de Seed2.0, por ejemplo, analiza la comprensión multimodal, el razonamiento, las capacidades de agentes y la evaluación orientada a aplicaciones.

Un informe técnico de SeedRealtime debería explicar su arquitectura sin revelar detalles sensibles de implementación. También debería documentar las categorías de datos de entrenamiento, el diseño de evaluación, las limitaciones conocidas y los controles de seguridad.

La expresión “tiempo real” necesita un significado medible. ByteDance debería informar del tiempo hasta el primer audio, la respuesta a interrupciones, la cadencia de procesamiento de fotogramas y la fiabilidad de las sesiones sostenidas. Una sola demostración no puede establecer esas propiedades.

La comparación entre ByteDance y Google será creíble cuando ambos sistemas puedan probarse con hardware, redes, prompts y tareas idénticos. Hasta entonces, la conclusión mejor respaldada se refiere a la preparación de la plataforma, no a la calidad del modelo.

Google ofrece actualmente una ruta más clara para los desarrolladores. ByteDance plantea la incógnita sin responder más intrigante: si su experiencia en medios puede producir un modelo de interacción en directo distintivo a escala.

Tres señales mostrarán si SeedRealtime importa

El acceso, las pruebas independientes de rendimiento y el despliegue de producto determinarán si SeedRealtime cambia el mercado o se queda en un titular.

La primera señal es el acceso técnico oficial. ByteDance debería publicar una API, una interfaz de producto, una tarjeta de modelo o una demostración de investigación reproducible. La documentación debe indicar las entradas aceptadas, las salidas generadas, las expectativas de latencia, los idiomas, los límites de sesión y la disponibilidad regional.

El acceso para desarrolladores reforzaría el argumento de que SeedRealtime es un lanzamiento de plataforma. Un programa de invitación limitada seguiría aportando evidencia útil si equipos externos pueden publicar sus resultados. El silencio continuado debilitaría la afirmación.

La segunda señal son las pruebas independientes frente a los modelos en directo de Google. Las evaluaciones más informativas utilizarán escenas cambiantes, interrupciones, voces superpuestas, conexiones débiles y llamadas a herramientas de varios pasos.

Los evaluadores deberían informar de los resultados completos de las tareas y las tasas de fallo. También deberían examinar los controles de privacidad, el comportamiento de rechazo, la recuperación tras errores y la consistencia durante sesiones más largas.

Un resultado sólido mostraría que SeedRealtime ofrece interacción fiable en una clase específica de tareas. No necesita ganar en todas las categorías. Fortalezas claras en flujos de trabajo para creadores, comercio o asistencia de vídeo multilingüe establecerían una diferenciación.

La tercera señal es el despliegue dentro de un producto importante de ByteDance. La integración con Doubao, CapCut, Douyin, TikTok, Volcano Engine o BytePlus revelaría el público al que se dirige la empresa.

El despliegue para consumidores pondría a prueba la usabilidad y la moderación a escala. El acceso empresarial pondría a prueba la fiabilidad, la gobernanza y la integración. Un lanzamiento centrado en creadores respaldaría el argumento de que ByteDance está utilizando estratégicamente su posición en medios.

La ventaja de Google seguirá siendo significativa si ByteDance no puede conectar el modelo con productos. Por el contrario, una integración rápida podría reducir la brecha porque ByteDance ya posee superficies visuales de alta frecuencia.

Los lectores también deberían distinguir la generación de la interacción. ByteDance cuenta con sólidos productos de generación de audio y vídeo, pero SeedRealtime supuestamente pertenece a la categoría de percepción en directo. El éxito en una no garantiza el éxito en la otra.

Para los desarrolladores, la acción inmediata es sencilla. No rediseñen un sistema de producción en torno a un anuncio sin documentación de interfaz ni pruebas independientes. Sigan las condiciones de acceso, el comportamiento de las sesiones, el tratamiento de datos y el soporte de herramientas.

Los compradores empresariales deberían solicitar evidencia de sus propios entornos. Una demostración en una oficina tranquila dice poco sobre un almacén, centro de soporte, tienda, vehículo o reunión multilingüe.

Los trabajadores del conocimiento deberían observar cómo estos asistentes manejan la corrección y la incertidumbre. Un modelo en directo útil debe decir cuándo no puede ver, oír o identificar algo de forma fiable. La expresión fluida nunca debe sustituir a la evidencia fundamentada.

La carrera entre ByteDance y Google tiene ahora un nuevo participante reportado, pero la carga de la prueba recae en ByteDance. SeedRealtime necesita especificaciones públicas, validación externa y distribución real en productos.

Si llegan esas tres señales, la IA audiovisual en tiempo real ganará otra plataforma creíble y una competencia más fuerte. Si no llegan, el ecosistema documentado de Google seguirá siendo el punto de referencia práctico. ¿Qué empresa permitirá primero que los usuarios prueben sus promesas en condiciones reales?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page