top of page

Sarvam AI Saaras V4 eleva el nivel del habla índica, pero los benchmarks son solo el comienzo

27 sept
15 min de lectura

Sarvam AI lanzó Saaras V4 con soporte para 22 idiomas indios, inglés global y cinco formas de dar formato a una transcripción. El lanzamiento de Sarvam AI Saaras V4 también afirma ofrecer una precisión líder en varios benchmarks de habla inglesa e índica. Esta combinación aumenta la presión sobre los servicios de propósito general de OpenAI, ElevenLabs y Deepgram.

El anuncio es relevante porque el reconocimiento de voz en India no consiste simplemente en un problema de transcripción en inglés. Las conversaciones reales combinan idiomas regionales, términos en inglés, acentos locales, audio telefónico comprimido y cambios frecuentes de interlocutor. Un sistema puede rendir bien con grabaciones limpias y, aun así, tener dificultades con las llamadas que las empresas realmente reciben.

Sarvam apuesta a que la profundidad regional puede competir con la cobertura lingüística más amplia y la infraestructura consolidada de los proveedores globales. Sus cinco diferenciadores más claros son un decodificador personalizado de modelo de lenguaje, una amplia cobertura índica, cinco modos de salida nativos, prompting de términos clave y streaming de baja latencia. Sin embargo, la mayor parte de la evidencia de rendimiento sigue procediendo de las evaluaciones de Sarvam, por lo que los resultados en despliegues reales siguen siendo la prueba más importante.

Sarvam AI Saaras V4 cambia la competencia del ASR multilingüe

Saaras V4 convierte el modelo de voz centrado en India de Sarvam en un desafío más amplio para las plataformas globales de transcripción.

Sarvam anunció el modelo el 24 de agosto de 2026 mediante su detallado lanzamiento de Saaras V4. Introdujo la versión de API varios días antes y puso el modelo a disposición general para Sarvam Voice Agents el 2 de septiembre.

El lanzamiento mantiene el soporte para los 22 idiomas programados de India y amplía el reconocimiento de inglés más allá del inglés indio. Sarvam describe esta incorporación como soporte para inglés global, incluidos acentos representados en conjuntos de datos internacionales de voz.

Este cambio amplía la carga de trabajo a la que puede dirigirse el modelo. Una operación de atención al cliente en India podría recibir llamadas en hindi, tamil o bengalí junto con conversaciones en inglés indio, británico o estadounidense. Utilizar un único sistema de reconocimiento en esas llamadas puede reducir las reglas de enrutamiento y el cambio entre modelos.

Saaras V4 está disponible mediante REST, batch, WebSocket heredado e interfaces en tiempo real más recientes. La documentación del modelo de Sarvam enumera los agentes de voz, la analítica de llamadas, el habla con mezcla de códigos y el audio telefónico de 8 kHz entre sus usos objetivo.

La interfaz REST acepta grabaciones de hasta 30 segundos. El servicio batch procesa archivos de hasta dos horas, mientras que la opción de streaming devuelve transcripciones parciales durante conversaciones en directo. La separación de interlocutores está disponible mediante procesamiento batch.

El lanzamiento también ilustra un rápido ciclo de producto. Saaras V3 llegó en febrero de 2026 con los mismos 22 idiomas indios e inglés. Sarvam afirmó que esa versión redujo la tasa de error de palabras en IndicVoices de aproximadamente un 22 por ciento a cerca de un 19 por ciento.

V4 cambia la afirmación competitiva. V3 se presentó principalmente como un especialista en habla india. V4 añade benchmarks internacionales de inglés y se presenta como un modelo único para cargas de trabajo tanto índicas como de inglés más amplio.

Esto no significa que Sarvam cubra de pronto todos los idiomas que admite un servicio global de transcripción. Saaras sigue centrado en 23 idiomas identificados, mientras que otras plataformas anuncian catálogos lingüísticos mucho más grandes. Su argumento es la profundidad dentro de los idiomas que admite, más que la lista de idiomas más extensa posible.

Esta distinción crea la tensión central del artículo. Sarvam afirma que la especialización ha producido un mejor reconocimiento en idiomas indios difíciles sin sacrificar el rendimiento en inglés. Los proveedores globales pueden responder con una cobertura más amplia, herramientas maduras y funciones que van más allá de la transcripción básica.

Para los compradores empresariales, por tanto, la decisión no gira en torno a una posición en un único ranking. Se trata de qué sistema funciona de forma fiable con sus acentos, vocabulario, canales de audio y patrones de alternancia de códigos reales.

Un decodificador de 3.000 millones de parámetros conecta el audio con el lenguaje

La primera característica definitoria es una arquitectura diseñada para tratar la transcripción como generación contextual de lenguaje, no como coincidencia aislada de sonidos.

Saaras V4 combina un codificador de audio con un decodificador autorregresivo de modelo de lenguaje de 3.000 millones de parámetros. Sarvam afirma que entrenó internamente desde cero este decodificador híbrido de espacio de estados.

El codificador de audio extrae información fonética y acústica de una forma de onda. Un adaptador de submuestreo temporal comprime después esa información antes de proyectarla en el espacio de embeddings del decodificador. Esta reducción ayuda a que las grabaciones más largas se ajusten al contexto disponible del modelo.

El decodificador procesa esas representaciones de audio junto con un prompt de texto. Genera tokens de transcripción secuencialmente y retroalimenta cada resultado al modelo antes de producir el siguiente token.

Este enfoque importa cuando varias palabras suenan de forma similar. La evidencia acústica por sí sola puede no resolver qué palabra utilizó un interlocutor. El contexto de la oración, la gramática y las secuencias probables de palabras pueden guiar al decodificador hacia una transcripción plausible.

Un decodificador basado en LLM también admite instrucciones que controlan la salida. El mismo modelo subyacente puede recibir una solicitud para preservar muletillas, normalizar números, transliterar el habla o traducir el resultado al inglés.

Sin embargo, la decodificación contextual introduce un riesgo conocido. Un modelo que predice texto plausible puede producir palabras que parecen razonables pero que nunca se pronunciaron. Este fallo es especialmente grave en registros médicos, financieros, legales y de cumplimiento normativo.

Sarvam afirma que V4 fue diseñado para grabaciones ruidosas, variación dialectal y habla con mezcla de códigos. Son condiciones exigentes porque la señal acústica ya puede ser ambigua. Un decodificador sensible al lenguaje puede ayudar, pero no debe sustituir evidencia ausente por una invención fluida.

Por ello, los desarrolladores deberían probar por separado los errores de eliminación, inserción y sustitución. Una transcripción aparentemente legible todavía puede omitir una salvedad, alterar un número o sustituir un nombre poco habitual.

La arquitectura también plantea preguntas sobre la reproducibilidad. Sarvam describe el modelo y el proceso de evaluación, pero no ha publicado los pesos de Saaras V4. Los compradores no pueden inspeccionar de forma independiente sus datos de entrenamiento, ejecutarlo en su propia infraestructura ni verificar cada afirmación arquitectónica.

Eso convierte a la API alojada en la unidad práctica de evaluación. Los equipos deben medir el servicio tal como se entrega, incluida la latencia, el tiempo de actividad, el manejo de datos y la estabilidad de las transcripciones.

El tamaño del modelo por sí solo ofrece poca orientación. Un decodificador más pequeño puede superar a uno mayor cuando su entrenamiento de audio y cobertura lingüística se ajustan mejor a la carga de trabajo. A la inversa, un modelo especializado puede tener dificultades cuando las conversaciones quedan fuera de sus dominios previstos.

La pregunta útil es si esta arquitectura reduce los errores en habla india real sin crear nuevos errores contextuales. Los resultados de benchmark de Sarvam ofrecen una señal alentadora, pero el audio de los clientes aportará la evidencia más sólida.

Cinco modos de salida eliminan varios pasos de procesamiento

La segunda característica principal es un único modelo que produce cinco representaciones distintas de la misma grabación.

Saaras V4 admite los modos transcribe, verbatim, code-mixed, transliteration y translation. Son más que opciones de formato estéticas porque cada uno sirve a un flujo de trabajo posterior diferente.

El modo transcribe produce texto en el idioma original y normaliza elementos como números y fechas. También restaura la puntuación, lo que hace que el resultado sea apto para lectura, indexación y análisis rutinario.

El modo verbatim preserva las muletillas y las formas habladas de los números. Los equipos de cumplimiento, investigadores y analistas de conversaciones pueden preferir esta versión porque la normalización puede borrar detalles sobre cómo se dijo algo.

El modo code-mixed conserva las palabras de idiomas indios en su escritura nativa mientras mantiene las palabras inglesas pronunciadas en caracteres latinos. Este formato refleja cómo muchas conversaciones multilingües se escriben y revisan de forma natural.

El modo transliteration reproduce el enunciado en caracteres latinos sin traducir su significado. Sarvam lo describe como un estilo utilizado habitualmente en la comunicación digital informal. Puede ayudar a los lectores a entender hindi hablado u otro idioma compatible sin leer su escritura nativa.

El modo translation convierte directamente el habla índica compatible en texto en inglés. Puede servir a equipos internacionales de soporte, sistemas de informes y analistas que necesitan un idioma común de salida.

Los pipelines tradicionales suelen realizar estas tareas con componentes separados. Un servicio reconoce el habla, otro normaliza la transcripción y un tercero la traduce o translitera. Cada transformación adicional puede introducir errores o perder información.

Saaras V4 genera las cinco formas dentro de un único modelo. Sarvam sostiene que este diseño evita errores en cascada procedentes de etapas separadas de preprocesamiento.

Esta afirmación tiene atractivo práctico. Una plataforma de atención al cliente podría almacenar el habla literal para revisión, mostrar texto normalizado a un agente y enviar la salida en inglés a un sistema analítico. Un modelo de reconocimiento podría atender cada destino.

Los cinco modos también hacen que el habla sea más utilizable dentro de los flujos de trabajo de conocimiento. Las grabaciones de reuniones y entrevistas son más fáciles de buscar cuando los equipos pueden elegir texto normalizado o traducido. Una base de conocimiento de IA con capacidad de búsqueda puede entonces conectar las transcripciones con notas y documentos relacionados.

Aun así, un modelo no elimina todas las decisiones de procesamiento. Los equipos deben determinar qué representación es la autoritativa, cómo preservar la grabación original y si el texto traducido es adecuado para decisiones sensibles.

El modo translation solo genera salida en inglés, según la documentación de Sarvam. No ofrece traducción arbitraria entre cada par de idiomas compatibles.

Las marcas de tiempo a nivel de palabra tampoco están disponibles en la respuesta estándar. La API proporciona tiempos a nivel de frase o fragmento, mientras que el procesamiento batch puede añadir transcripciones atribuidas a interlocutores.

Estos límites importan para editores de subtítulos, revisión forense y aplicaciones que necesitan una alineación exacta. Los competidores que ofrecen temporización detallada por palabra o edición de transcripciones pueden seguir siendo preferibles para esas tareas.

No obstante, los cinco modos distinguen a Saaras de un endpoint básico de voz a texto. Sarvam trata la representación de la transcripción como parte del reconocimiento, lo que refleja mejor las exigencias de los sistemas de producción multilingües.

La cobertura índica se extiende más allá de los idiomas más grandes

La tercera característica distintiva es un soporte de producto consistente para los 22 idiomas programados de India, incluidos varios idiomas con pocos recursos.

Saaras V4 admite hindi, bengalí, tamil, telugu, maratí, guyaratí, canarés, malayalam, panyabí, asamés, urdu y odia. También cubre nepalí, konkani, cachemir, sindhi, sánscrito, santali, manipuri, bodo, maithili y dogri.

Esta amplitud es significativa porque los recursos de entrenamiento están distribuidos de forma desigual. Los idiomas principales cuentan con corpus de voz más grandes, más grabaciones etiquetadas y mayor demanda comercial. Los idiomas más pequeños suelen recibir un reconocimiento más débil o ningún soporte.

Sarvam afirma que V4 logra resultados de vanguardia en los 22 idiomas. Esto sigue siendo una afirmación de la empresa, aunque la compañía publicó su método de evaluación y nombró los conjuntos de datos utilizados.

Para diez lenguas indias, Sarvam evaluó el modelo en Vistaar. La evaluación incluyó Common Voice, FLEURS, Gramvaani, IndicTTS, Kathbath, grabaciones ruidosas de Kathbath y MUCS.

Sarvam informa tanto la tasa convencional de error de palabras como LLM-WER. La WER estándar cuenta sustituciones, inserciones y eliminaciones entre una predicción y una transcripción de referencia.

LLM-WER añade un paso de evaluación semántica. Intenta distinguir las diferencias que alteran el significado de las variaciones ortográficas o de formato que preservan el contenido subyacente.

Esta distinción puede ser útil para las lenguas indias porque las formas escritas y las convenciones de normalización varían. Dos transcripciones pueden comunicar las mismas palabras y, aun así, recibir una penalización de WER convencional.

Sin embargo, un evaluador basado en otro modelo de lenguaje introduce criterio subjetivo en la métrica. Los resultados pueden depender del modelo que arbitra y de sus instrucciones. La WER convencional sigue siendo más fácil de reproducir, incluso cuando exagera algunas diferencias inocuas.

La identificación de idioma es otra parte de la afirmación de cobertura de Sarvam. Según se informa, Saaras V4 registra una tasa de error de identificación del 2,9 por ciento en las diez lenguas indias más habladas. Sarvam informa un 5,22 por ciento en las 22 lenguas.

La detección automática elimina la necesidad de etiquetar cada grabación de antemano. Esto resulta útil para colas de llamadas compartidas, líneas de servicio público y aplicaciones de consumo dirigidas a audiencias multilingües.

No obstante, la identificación de idioma se vuelve más compleja durante el cambio de código lingüístico. La API de Sarvam devuelve el idioma predominante cuando aparecen varios idiomas. Las aplicaciones que necesitan etiquetas de idioma a nivel de palabra pueden requerir lógica adicional.

Los rivales globales presentan la cobertura multilingüe de forma diferente. ElevenLabs afirma que su sistema de transcripción reconoce más de 90 idiomas y ofrece marcas de tiempo a nivel de palabra, detección de entidades y diarización de hablantes.

Los modelos multilingües de Deepgram admiten el cambio de código lingüístico en tiempo real en una colección más acotada de idiomas ampliamente utilizados. Sus servicios de streaming consolidados y sus herramientas para agentes de voz crean una ventaja competitiva distinta.

OpenAI describe GPT-4o Transcribe como una mejora en la tasa de error de palabras y el reconocimiento de idiomas frente a modelos Whisper anteriores. Parte de su atractivo reside en la integración con una plataforma de modelos más amplia.

La respuesta de Sarvam no consiste en igualar todos los idiomas globales. Consiste en afirmar un rendimiento más sólido en un mercado específico y lingüísticamente complejo.

Esta estrategia presiona a los competidores allí donde una cobertura amplia puede ocultar una calidad inconsistente. Incluir un idioma en una lista no demuestra cómo maneja el sistema los acentos regionales, las escrituras mixtas, los nombres, la compresión telefónica o el habla informal.

También deja a Sarvam expuesta fuera de su conjunto principal. Una empresa multinacional que cubra idiomas europeos, africanos y de Asia Oriental puede preferir un proveedor más amplio, aunque Saaras funcione mejor en llamadas indias.

Por lo tanto, el caso más sólido para V4 parece darse en cargas de trabajo donde la precisión en lenguas indias importa lo suficiente como para justificar una evaluación especializada o una arquitectura con varios proveedores.

Los keyterms y el streaming abordan audio de producción difícil

La cuarta y la quinta función abordan dos problemas recurrentes de despliegue: el vocabulario especializado y la demora conversacional.

El prompting de keyterms permite que una aplicación proporcione nombres, productos, ubicaciones, acrónimos o términos técnicos antes de la transcripción. El modelo otorga entonces mayor consideración a esos términos durante la decodificación.

Esto importa porque los nombres propios se encuentran entre los errores de reconocimiento más perjudiciales. Una transcripción puede preservar la frase circundante y, aun así, escribir mal el nombre del cliente, medicamento, empresa o máquina de la que se habla.

Las API REST y batch de Sarvam aceptan hasta 50 keyterms para Saaras V4. Según su documentación, el endpoint de streaming no expone actualmente la misma función.

Sarvam evaluó el prompting con IndicContextEval, un benchmark asociado con AI4Bharat. La empresa informa una WER del 16,03 por ciento en la configuración L5, que proporciona una lista en escritura nativa de entidades del dominio y el idioma.

Ese resultado sugiere que el prompting ayuda, pero también ilustra un requisito de despliegue. Las aplicaciones necesitan una forma fiable de seleccionar los términos adecuados antes de cada grabación.

Un hospital podría proporcionar nombres de profesionales clínicos, medicamentos y procedimientos. Un centro de llamadas financiero podría proporcionar nombres de fondos, valores y entidades de clientes. Enviar una enorme lista genérica podría reducir la utilidad del prompt.

Las aplicaciones en tiempo real enfrentan otra limitación. Una transcripción debe aparecer con suficiente rapidez para que un agente de voz responda sin pausas incómodas.

Sarvam afirma que Saaras V4 puede devolver su primer token de streaming en menos de 150 milisegundos. También sostiene que el sistema puede procesar grabaciones de varios minutos en un segundo.

Estas cifras deben tratarse como rendimiento informado por el proveedor. La demora de extremo a extremo también incluye transporte de red, almacenamiento en búfer de audio, detección de punto final, procesamiento de la aplicación y el siguiente modelo en una canalización de agente de voz.

El primer token no es necesariamente una transcripción estable. Los sistemas de reconocimiento por streaming suelen revisar el texto anterior a medida que llega más audio. Los desarrolladores deberían medir tanto la latencia inicial como el tiempo necesario para obtener un segmento finalizado.

Sarvam amplió la disponibilidad en tiempo real de V4 después de su lanzamiento. Su registro de cambios de septiembre indica que el modelo pasó a estar disponible mediante la nueva Realtime API, aunque V3 seguía siendo el predeterminado en ese momento.

Este detalle merece atención. La documentación describía Saaras V4 como el modelo más reciente y, al mismo tiempo, seguía recomendando V3 como predeterminado. Esto sugiere que los clientes no deberían asumir que V4 es automáticamente la migración más segura para todas las cargas de trabajo.

La baja latencia tampoco garantiza un buen manejo de turnos. La detección de actividad de voz debe decidir cuándo un hablante ha hecho una pausa o ha terminado. Una configuración agresiva puede interrumpir a las personas, mientras que una prudente añade una demora perceptible.

El audio telefónico ruidoso eleva la exigencia. Sarvam afirma que V4 fue diseñado para llamadas de 8 kHz, clipping, interferencias, mezcla de idiomas y variación dialectal. Estas condiciones aparecen con frecuencia juntas en grabaciones de soporte y servicio de campo.

Una prueba significativa debería combinarlas. Los clips limpios de estudio no revelan qué ocurre cuando una persona que llama habla rápido, cambia de idioma, menciona un nombre desconocido y habla al mismo tiempo que otra persona.

Los equipos también deberían examinar las funciones operativas alrededor del modelo. La monitorización, el procesamiento regional, los controles de retención, el manejo de fallos, los límites de tasa y el soporte pueden importar tanto como una pequeña ventaja de precisión.

La combinación de prompting de keyterms y streaming de Saaras V4 es prometedora porque aborda fallos reales de producción. El resultado competitivo depende de si esas capacidades siguen siendo fiables a escala.

Los benchmarks necesitan pruebas independientes de producción

Sarvam ha publicado evidencia sustancial, pero sus afirmaciones de rendimiento más amplias aún requieren verificación más allá de comparaciones realizadas por la empresa.

Para inglés, Sarvam evaluó Saaras V4 en siete conjuntos de datos. Cubren habla de salas de reuniones, podcasts, audiolibros, vídeo web, grabaciones de estudio, acústica difícil, llamadas financieras, discurso parlamentario e inglés con acento indio.

Los conjuntos de datos nombrados son AMI, GigaSpeech, dos divisiones de LibriSpeech, SPGISpeech, VoxPopuli y Svarah. Sarvam afirma que V4 logró la WER media más baja en ese grupo.

La empresa informa que utilizó resultados del Open ASR Leaderboard para seis conjuntos de datos internacionales. Afirma que la normalización y la puntuación siguieron el código publicado por el leaderboard.

Esto es más informativo que un benchmark interno sin nombre. Identifica los conjuntos de datos, el enfoque de puntuación y los sistemas competidores.

Sin embargo, las comparaciones siguen siendo recopiladas y presentadas por Sarvam. Las versiones de los modelos, la configuración de las API, la configuración de prompts, el preprocesamiento de audio y el momento de lanzamiento pueden influir en los resultados.

Una media de benchmark también puede ocultar debilidades. Un modelo puede liderar en general y perder en un acento, canal o estilo de habla concreto. Los compradores deberían revisar resultados a nivel de conjunto de datos que se parezcan a su propio tráfico.

La evaluación Indic presenta complejidad adicional. Algunos competidores no admiten todos los idiomas, mientras que otros pueden requerir una selección explícita del idioma. La cobertura ausente y el reconocimiento deficiente son limitaciones diferentes, aunque ambas impidan un despliegue exitoso.

Saaras V4 también compite con productos de alcances distintos. ElevenLabs pone el énfasis en una amplia compatibilidad de idiomas, marcas de tiempo detalladas, detección de entidades y edición. Deepgram se centra en gran medida en infraestructura de transcripción en tiempo real. OpenAI integra la transcripción con una plataforma de IA más amplia.

El catálogo de idiomas más reducido de Sarvam puede ser una ventaja cuando el esfuerzo de entrenamiento se concentra en el habla india. También puede ser una desventaja para empresas que desean un contrato global y una API.

La privacidad y la gobernanza requieren una revisión independiente. Los sistemas de voz alojados procesan conversaciones que pueden contener información personal, financiera o sanitaria. Las clasificaciones de precisión no responden dónde se almacena el audio, quién puede acceder a él ni cómo funciona la retención.

El despliegue cerrado del modelo limita la inspección externa. Los investigadores pueden evaluar los resultados de la API, pero no pueden auditar completamente los datos de entrenamiento, reproducir el modelo ni estudiar los errores sin acceso al servicio.

Saaras también carece de marcas de tiempo a nivel de palabra en su respuesta documentada. El modo Translate solo produce inglés, y el endpoint REST en tiempo real tiene un límite de entrada de 30 segundos. Se requiere procesamiento batch para archivos más largos.

Estas son limitaciones manejables, pero complican cualquier afirmación de que un modelo sustituye una pila completa de transcripción. Los sistemas de producción aún necesitan almacenamiento, revisión de calidad, controles de políticas y comportamiento de respaldo.

La evidencia más sólida de Sarvam se refiere a la precisión del habla y la cobertura Indic. Su evidencia más débil se refiere a la fiabilidad a largo plazo bajo carga de clientes, el comportamiento ante errores en dominios sensibles y las ventajas operativas frente a proveedores consolidados.

La respuesta correcta no es descartar los benchmarks. Es reproducirlos con grabaciones representativas mientras se rastrean los errores importantes para la aplicación.

Un equipo de atención al cliente debería ponderar mucho los números de cuenta y los nombres de productos. Un asistente de reuniones debería probar hablantes superpuestos y atribución. Un flujo de trabajo de medios debería examinar puntuación, temporización y estabilidad en formatos largos.

Los desarrolladores también deberían comparar resultados normalizados y literales. Una puntuación WER baja puede verse diferente cuando la aplicación debe preservar cada vacilación, número o corrección.

Tres señales determinarán si el lanzamiento de Sarvam AI Saaras V4 cambia el mercado.

Primero, las evaluaciones independientes deben reproducir sus ventajas en habla india ruidosa e inglés global. Resultados consistentes de terceros reforzarían la afirmación central de precisión de Sarvam. Grandes discrepancias la debilitarían.

Segundo, la adopción en producción debe extenderse más allá de las demostraciones. La evidencia significativa incluiría uso sostenido en centros de llamadas, agentes de voz, sistemas de reuniones y flujos de trabajo de medios multilingües.

Tercero, los competidores responderán mediante una mejor cobertura Indic, cambio de código lingüístico u opciones de despliegue regional. Una respuesta visible de proveedores más grandes confirmaría que Sarvam ha creado presión comercial.

Para los desarrolladores, la acción inmediata es sencilla. Creen un conjunto de evaluación privado a partir de grabaciones representativas y consentidas, incluidos acentos difíciles y audio deficiente. Puntúen las entidades importantes por separado de la WER global.

Los compradores empresariales deberían probar la latencia, la estabilidad de la transcripción, la separación de hablantes y la gobernanza de datos junto con la precisión bruta. Los trabajadores del conocimiento deberían observar si las herramientas de reuniones y entrevistas adoptan Saaras sin reducir el control de edición.

Sarvam ha presentado un sólido argumento técnico a favor del reconocimiento de voz multilingüe especializado. Ahora Saaras V4 debe demostrar que su ventaja en los benchmarks se mantiene en las condiciones desordenadas de las conversaciones reales.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page