top of page

El debut de Claude Sonnet 5.5 en Agent Arena se sitúa tercero, pero queda fuera de la frontera de Pareto

hace 5 días
15 min de lectura

Claude Sonnet 5.5 entró en Agent Arena en tercera posición con una puntuación de mejora neta del 12,5%, pese a quedar fuera de su frontera de Pareto de eficiencia de costes. El resultado sitúa a los modelos de Anthropic en las tres primeras posiciones. También plantea una comparación incómoda dentro de la propia gama de Anthropic.

La instantánea de lanzamiento de Arena mostró que el coste mediano por tarea de Sonnet era aproximadamente un 73% superior al del Claude Opus 5.5, que ocupaba el segundo lugar. Opus también obtuvo la puntuación general más alta. Esa combinación implica que Sonnet no ofreció ni un mejor resultado ni un coste inferior en esta configuración concreta.

Por lo tanto, el resultado de Claude Sonnet 5.5 en Agent Arena cuenta dos historias. Anthropic ha creado otro modelo de agente altamente competitivo, pero su configuración Max no ofrece la clara ventaja de valor que los compradores podrían esperar de Sonnet. La verdadera competencia es Sonnet 5.5 Max frente a Opus 5.5 High, no Anthropic frente a otro proveedor de modelos.

Esta distinción importa porque Anthropic presenta a Sonnet como el complemento más rápido y económico de Opus. La evaluación conductual en vivo de Arena mide algo distinto a los precios por token o a un benchmark controlado de laboratorio. Mide cómo se comportan sesiones completas de agentes, incluida su duración, uso de herramientas, correcciones y resultados.

Los resultados de Claude Sonnet 5.5 en Agent Arena ponen a Anthropic al mando

El debut de Sonnet en tercer lugar le da a Anthropic un pleno en las tres primeras posiciones de Agent Arena, pero la clasificación por sí sola oculta la disyuntiva interna.

Arena anunció que Claude Sonnet 5.5 Max debutó con una puntuación de mejora neta de aproximadamente el 12,5%. La mejora neta estima cuánto modifica un modelo seleccionado varias señales de resultados de los usuarios frente a la distribución de referencia de Arena.

El modelo quedó por detrás de Claude Fable 5.1 Max y Claude Opus 5.5 High en la clasificación general. La página en vivo de Arena mostraba más de dos millones de sesiones de agentes repartidas entre decenas de modelos cuando apareció el resultado.

Sonnet 5.5 también registró una mejora de 8,1 puntos porcentuales respecto a Sonnet 5 High en el anuncio de Arena. El modelo anterior se situaba considerablemente más abajo en la clasificación general. Ese avance generacional es significativo, aunque las dos entradas utilicen configuraciones de esfuerzo distintas.

El resultado más sólido por categoría llegó en Chat. Según la instantánea oficial de la clasificación, Sonnet 5.5 ocupó allí el primer puesto con una puntuación de mejora neta del 15,6%. Fable 5.1 y Opus 5.5 le siguieron en esa categoría.

Su perfil no se limitó a tareas conversacionales. El modelo también lideró la señal de recuperación de bash de Arena en torno al momento de su debut. La recuperación de bash mide con qué eficacia un agente se recupera después de que falle un comando.

Esta capacidad importa en flujos de trabajo de programación, investigación y documentos. Los agentes reales se encuentran con frecuencia con archivos ausentes, paquetes no disponibles, comandos inválidos o herramientas que devuelven resultados inesperados. Un modelo que reconoce el fallo y se ajusta puede preservar un flujo de trabajo que, de otro modo, sería útil.

Sonnet también registró una baja tasa de alucinación de herramientas. En este contexto, la alucinación de herramientas significa intentar invocar una herramienta que el agente en realidad no posee. Incluso errores poco frecuentes pueden detener flujos automatizados o confundir a los usuarios.

La clasificación agregada combina varias señales de este tipo, en lugar de medir un único criterio de éxito. Un modelo puede destacar en recuperación y, aun así, quedar por detrás en otros aspectos, incluida la capacidad de seguir indicaciones o la finalización confirmada de tareas.

La tabla de clasificación de Arena informó de miles de sesiones de Sonnet 5.5. Se trata de una muestra conductual significativa, pero el modelo tenía menos observaciones que el líder con más tiempo en funcionamiento. Los intervalos de confianza seguían visibles junto a las puntuaciones comunicadas.

Esos intervalos evitan una lectura simplista del orden. El tercer puesto es la clasificación mostrada, pero las estimaciones cercanas aún contienen incertidumbre estadística. El resultado es una señal inicial sólida, no un veredicto permanente.

La tabla de clasificación también es dinámica. Los modelos reciben sesiones adicionales, el comportamiento de los usuarios cambia y el método de evaluación puede evolucionar. Las cifras públicas de Arena ya se habían movido ligeramente después de que apareciera la publicación de lanzamiento.

Esa variación no invalida el anuncio. Muestra por qué toda afirmación sobre una tabla de clasificación en vivo necesita una fecha y una configuración. «Sonnet 5.5 ocupa el tercer puesto» describe una instantánea, no una propiedad inmutable del modelo.

Por qué la frontera de Pareto excluye a Sonnet 5.5

Sonnet 5.5 Max queda fuera de la frontera de Pareto porque Opus 5.5 High ofrece una puntuación general superior con un coste mediano por tarea menor.

Una frontera de Pareto contiene opciones que no están dominadas en las dimensiones medidas. Aquí, esas dimensiones son la mejora neta y el coste mediano por tarea.

Un modelo pertenece a esa frontera si ninguna entrada competidora es a la vez menos costosa y más eficaz. Un modelo queda fuera de la frontera cuando otra entrada mejora una dimensión sin sacrificar la otra.

Opus 5.5 High plantea exactamente ese problema para Sonnet 5.5 Max. El anuncio de Arena situó a Opus por delante en mejora neta, al tiempo que mostraba que el coste mediano por tarea de Sonnet era aproximadamente un 73% mayor.

La comparación no significa que Opus siempre vaya a costar menos. Significa que Opus produjo el mejor resultado de coste-rendimiento en las sesiones medidas por Arena y con la configuración de esfuerzo seleccionada.

Este es el giro central del artículo. Anthropic describe Sonnet 5.5 como un complemento más rápido y económico de Opus 5.5. La economía observada por Arena a nivel de tarea invirtió esa relación para las dos entradas de la tabla de clasificación.

Las configuraciones importan. Sonnet se ejecutó con esfuerzo Max, mientras que Opus se ejecutó con esfuerzo High. Los ajustes de esfuerzo determinan cuánta computación y razonamiento aplica un modelo antes de completar una tarea.

Un mayor esfuerzo puede mejorar los resultados difíciles, pero también puede alargar las respuestas e incrementar el consumo de tokens. Las cifras de Arena a nivel de tarea incluyen las consecuencias de esas decisiones.

El propio anuncio de Sonnet 5.5 de Anthropic plantea un punto relacionado. La empresa afirma que Sonnet complementa a Opus de manera más eficaz con ajustes de esfuerzo más bajos, donde disminuyen los costes por tarea.

Esa matización ayuda a reconciliar ambas historias. Sonnet puede tener tarifas publicadas por token más bajas y, aun así, producir una tarea completada más cara con esfuerzo Max. El precio por token y el coste por tarea están relacionados, pero no son intercambiables.

Una tarea con razonamiento extenso, llamadas repetidas a herramientas o una salida extensa puede costar más incluso cuando cada token tiene una tarifa inferior. Los flujos de trabajo de agentes amplifican esta diferencia porque el modelo decide cuánto trabajo realizar.

Arena informó de que Sonnet 5.5 Max generó muchos más tokens de salida medianos por tarea que Opus 5.5 High. Esa diferencia ofrece un mecanismo plausible para explicar el mayor coste por tarea.

No demuestra que haya desperdicio. Una respuesta más larga podría contener trabajo más completo, artefactos más ricos o una elaboración innecesaria. La tabla de clasificación agregada no puede revelar qué explicación se aplica a cada sesión.

La frontera de Pareto también responde a una pregunta limitada. Identifica opciones eficientes dentro de los datos observados por Arena, no el modelo universalmente mejor para todas las organizaciones.

La latencia, los controles de seguridad, la disponibilidad de despliegue, la longitud de contexto y el estilo de salida pueden afectar una decisión de producción. Ninguno de esos factores desaparece porque un punto quede fuera de una frontera bidimensional.

Aun así, los compradores no deberían ignorar la dominación. Cuando una configuración obtiene una puntuación más alta y cuesta menos en el mismo entorno de evaluación, la carga se desplaza a la opción dominada.

Sonnet 5.5 Max necesita una ventaja específica para la carga de trabajo que justifique elegirlo en lugar de Opus 5.5 High. Su liderazgo en Chat, velocidad, estilo de salida o comportamiento de recuperación podrían proporcionar esa ventaja. La clasificación general por sí sola no lo hace.

El método de Agent Arena cambia lo que significa «mejor»

Agent Arena mide el comportamiento en flujos de trabajo reales, por lo que sus puntuaciones reflejan conjuntamente las decisiones del modelo, las reacciones de los usuarios, las herramientas y la dinámica de las sesiones.

Los benchmarks tradicionales suelen presentar un conjunto fijo de preguntas o tareas. Después, los investigadores comparan las respuestas con soluciones predeterminadas, juicios de expertos o pruebas automatizadas.

La evaluación de agentes de Arena adopta un enfoque diferente. Su metodología de evaluación extrae señales de sesiones reales de Agent Mode en lugar de un conjunto de pruebas seleccionado.

Estas sesiones pueden abarcar muchos turnos. Los usuarios piden a los modelos que creen artefactos, investiguen temas, escriban código, analicen archivos y se recuperen de fallos. Sus acciones posteriores pasan a formar parte de los datos de evaluación.

Arena rastrea comentarios explícitos, incluido el éxito de tareas informado por los usuarios. También extrae señales implícitas, como elogios, quejas, correcciones, descargas de artefactos, alucinaciones de herramientas y recuperación de comandos.

Después, la plataforma estima el efecto de tratamiento asociado a cada componente del agente. Arena denomina a este enfoque rastreo causal. El modelo orquestador es un componente, mientras que las herramientas y las decisiones del arnés pueden convertirse en componentes adicionales.

Este diseño intenta separar los efectos del modelo de las diferencias en el tráfico que recibe cada modelo. Es más ambicioso que simplemente promediar votos positivos.

La puntuación de mejora neta resultante es un agregado. Arena calcula efectos para señales individuales y luego los combina en la métrica de la tabla de clasificación.

Este enfoque capta comportamientos que las pruebas estáticas no detectan. Un modelo puede conocer la respuesta correcta y, sin embargo, no completar un flujo de trabajo. Podría llamar a una herramienta inexistente, ignorar una corrección o afirmar que un trabajo incompleto está terminado.

El uso real puede revelar esos fallos. Arena afirma que sus trazas también muestran si los usuarios delegan trabajos completos, intensifican el control después de una respuesta inicial o descargan los artefactos resultantes.

La visión general de Agent Mode que lo acompaña describe la programación como la mayor categoría de tareas en su mezcla inicial de cargas de trabajo. La investigación y la planificación también representaron proporciones considerables.

Esa distribución ayuda a explicar por qué la recuperación de bash y la fiabilidad de las herramientas influyen en las clasificaciones. Agent Arena no evalúa la calidad del chat de forma aislada. Evalúa modelos que operan dentro de un sistema habilitado para herramientas.

El método también introduce limitaciones. Los usuarios de Arena son autoseleccionados y sus tareas no representan todas las cargas de trabajo empresariales. Los casos de uso populares pueden influir más en el agregado que otros poco frecuentes pero críticos.

Los comentarios de los usuarios son ruidosos. Un artefacto descargado puede indicar satisfacción, curiosidad o simplemente el deseo de inspeccionar el resultado. Los elogios en lenguaje natural no siempre significan que el trabajo subyacente sea correcto.

Los ajustes causales ayudan a abordar la asignación desigual, pero no pueden transformar trazas observacionales en una prueba controlada de todas las capacidades. La metodología de Arena debe complementar los benchmarks reproducibles, no sustituirlos.

El arnés también importa. Las descripciones de las herramientas, los prompts de sistema, el comportamiento del sandbox, los límites de tiempo y el diseño de la interfaz pueden moldear los resultados. Un agente de producción con componentes diferentes puede comportarse de manera distinta a su equivalente en Arena.

Por eso, el resultado de Claude Sonnet 5.5 en Agent Arena debe interpretarse como una observación a nivel de sistema. No aísla el modelo en bruto del entorno que lo rodea.

Esta distinción es especialmente importante al comparar Arena con las evaluaciones de Anthropic. Anthropic informa de puntuaciones de benchmarks fijos bajo configuraciones de modelo documentadas. Arena observa trabajo abierto creado por sus usuarios.

Ambos responden a preguntas útiles. Uno pregunta si un modelo puede resolver una evaluación definida. El otro pregunta cómo se comporta un agente cuando las personas le asignan trabajo real a través de una plataforma específica.

La verdadera competencia es Sonnet Max frente a Opus High

El competidor más fuerte de Anthropic en este resultado es la propia Anthropic, porque Opus desafía el papel de eficiencia esperado de Sonnet.

La familia Claude ofrece tradicionalmente a los compradores una jerarquía reconocible. Opus apunta a los trabajos más exigentes, Sonnet equilibra rendimiento y coste operativo, y Haiku cubre casos de uso de mayor volumen.

Anthropic mantiene ese enfoque en sus materiales sobre Sonnet 5.5. La empresa posiciona el modelo para tareas diarias bien definidas, correcciones de errores, documentos pulidos, presentaciones y hojas de cálculo.

Opus 5.5 sigue siendo la opción para trabajos complejos y abiertos que exigen criterio sostenido. Anthropic afirma que las pruebas internas y externas continúan encontrando que Opus es más sólido en esas situaciones.

El orden de Agent Arena respalda el componente de capacidad de esa distinción. Opus se sitúa por encima de Sonnet en la clasificación general. Lo sorprendente es la relación observada entre coste y tarea.

Con esfuerzo Max, Sonnet invirtió suficiente tiempo o tokens como para perder su ventaja de eficiencia. Esto convierte el ajuste de esfuerzo en parte de la decisión de producto, no en un detalle menor de implementación.

Un comprador que comparase nombres de modelos sin configuraciones no detectaría esto. «Sonnet frente a Opus» es demasiado amplio. La pregunta relevante es qué combinación de modelo, nivel de esfuerzo, prompt, conjunto de herramientas y regla de detención sirve mejor a una carga de trabajo.

Anthropic expone controles de esfuerzo para permitir que los desarrolladores equilibren calidad, velocidad y consumo. Su documentación del modelo también describe una gran ventana de contexto y una capacidad de salida considerable.

Estas capacidades hacen posibles los flujos de trabajo largos. No garantizan que un razonamiento más extenso produzca resultados proporcionalmente mejores.

Un agente de programación puede beneficiarse de pasos de revisión adicionales cuando edita un repositorio complejo. El mismo comportamiento puede convertirse en una sobrecarga innecesaria cuando corrige un defecto pequeño y claramente delimitado.

Un agente de investigación puede necesitar múltiples búsquedas y verificaciones de fuentes para una afirmación controvertida. No debería aplicar el mismo proceso a una consulta factual sencilla.

Por ello, las organizaciones necesitan enrutamiento específico para cada carga de trabajo. Las tareas rutinarias pueden comenzar con menor esfuerzo, mientras que los trabajos inciertos o relevantes pueden escalar a una configuración más potente.

El resultado de la categoría Chat complica esa regla de un modo útil. Sonnet lideró Chat pese a situarse tercero en la clasificación general. Los equipos centrados en el trabajo interactivo podrían valorar más su comportamiento conversacional que su posición agregada.

La recuperación en Bash aporta otro posible factor diferenciador. Los desarrolladores que ejecutan flujos de trabajo frágiles en línea de comandos podrían preferir un modelo que se recupere eficazmente tras comandos fallidos.

Sin embargo, esas ventajas necesitan validación local. Arena no publica los prompts de cada organización, sus herramientas privadas, límites de seguridad ni pruebas de aceptación.

El dominio de Anthropic en los tres primeros puestos también aumenta la presión sobre proveedores rivales. OpenAI, Google, DeepSeek, Moonshot y otros laboratorios deben competir contra una familia de configuraciones de Claude.

No obstante, ese dominio no debe interpretarse como un control permanente del mercado. Agent Arena cambia a medida que llegan nuevos modelos y se acumulan más sesiones.

Un competidor de menor coste puede remodelar la frontera de Pareto sin ocupar el primer puesto. Solo necesita ofrecer un punto de eficiencia mejor para compradores que no requieren la puntuación líder absoluta.

Esa dinámica importa más que un gráfico de podio. Los mercados de agentes premian a los modelos que alcanzan un resultado aceptable con un comportamiento predecible y un uso controlado de recursos.

La competencia interna de Anthropic puede reforzar ese mercado. Opus establece una referencia de alta calidad, mientras que Sonnet debe justificarse mediante velocidad, calidad de interacción o eficiencia ajustada.

Para los compradores, el resultado advierte contra las suposiciones a nivel de familia. El posicionamiento de producto proporciona una hipótesis inicial. Las mediciones de tareas completadas determinan si esa hipótesis resiste el contacto con el trabajo real.

Lo que la clasificación no demuestra

La tabla de posiciones no demuestra que Sonnet sea, en general, menos económico que Opus, porque el resultado cubre configuraciones concretas y sesiones de usuarios cambiantes.

La incertidumbre más clara se refiere al esfuerzo. Arena comparó Sonnet en Max con Opus en High, no ambos modelos bajo un presupuesto de razonamiento idéntico.

Esta discrepancia de configuración es legítima para una clasificación en vivo porque los usuarios se encuentran con variantes reales de producto. Resulta menos útil para aislar el efecto del modelo subyacente.

Una comparación homogénea probaría varios niveles de esfuerzo con el mismo conjunto de tareas. Registraría éxito de la tarea, latencia, llamadas a herramientas, volumen de entrada, volumen de salida y correcciones humanas necesarias.

Los datos en vivo de Arena responden a una pregunta diferente. Muestran qué ocurrió en sesiones naturales asignadas a través de la plataforma.

La madurez de la muestra crea otra salvedad. Los modelos nuevos inicialmente tienen menos sesiones e intervalos de incertidumbre más amplios que las entradas ya consolidadas. Su posición puede variar a medida que crece el uso.

Las cifras de lanzamiento y la clasificación en vivo posterior ya muestran diferencias modestas. El coste mediano por tarea se calcula durante un período móvil, por lo que una mezcla cambiante de cargas de trabajo puede modificar la cifra.

Un aumento repentino de tareas de programación complejas podría incrementar tanto el uso de tokens como el coste por tarea. Una mezcla posterior dominada por sesiones de Chat más cortas podría reducirlos.

Por tanto, la prima reportada del 73 % se interpreta mejor como una proporción puntual. Es lo bastante sólida para explicar la exclusión de Pareto en el lanzamiento, pero no lo bastante permanente para presupuestos a largo plazo.

La puntuación también es multidimensional. Un único agregado puede ocultar la fortaleza de un modelo en una señal y su debilidad en otra.

Los resultados líderes de Sonnet en Chat y recuperación en bash lo ilustran. Un equipo podría seleccionarlo racionalmente por esas propiedades, aceptando una clasificación general inferior.

Las tasas de alucinación de herramientas requieren una cautela similar. Pequeñas diferencias porcentuales pueden ser estadística u operativamente significativas, pero no describen la gravedad de cada error.

Llamar a la herramienta de búsqueda equivocada es inconveniente. Intentar una operación destructiva no válida es más grave. Una única tasa no comunica esa distinción.

Ninguna clasificación pública puede probar por completo las condiciones empresariales confidenciales. Los modelos se comportan de manera diferente con repositorios privados, documentos internos extensos, API propietarias e instrucciones específicas de cada organización.

Los requisitos de seguridad y cumplimiento añaden más restricciones. La posición de un modelo no puede determinar si su ruta de despliegue cumple requisitos de residencia de datos, retención o control de acceso.

Anthropic también realiza varias afirmaciones de rendimiento y eficiencia basadas en sus propias pruebas. Esas afirmaciones merecen lenguaje de atribución porque el proveedor diseñó las pruebas y controló el entorno.

La empresa afirma que Sonnet 5.5 generalmente necesita menos tokens que su predecesor. Esa comparación no resuelve por qué Sonnet Max utilizó más recursos que Opus High en las sesiones observadas por Arena.

La conclusión más creíble sigue siendo limitada. Sonnet 5.5 tuvo un debut sólido, pero la configuración Max probada carecía de una ventaja de coste-rendimiento frente a Opus 5.5 High.

Cualquier conclusión más amplia requiere más evidencia. Las afirmaciones de que Sonnet es inherentemente ineficiente, o de que Opus siempre es la mejor compra, exceden lo que respaldan los datos de Arena.

Tres señales decidirán si se mantiene la compensación de Sonnet

Los resultados con menor esfuerzo, una brecha estable de coste por tarea y el rendimiento en cargas de trabajo repetibles determinarán si el perfil de lanzamiento de Sonnet es estructural o temporal.

La primera señal es Sonnet 5.5 con ajustes de menor esfuerzo. Anthropic afirma que el modelo complementa a Opus de la manera más eficaz cuando funciona con menos esfuerzo.

Si las entradas de Sonnet con menor esfuerzo conservan gran parte de su mejora neta mientras reducen el consumo por tarea, la actual exclusión de Pareto parecerá específica de la configuración. Ese resultado reforzaría el posicionamiento de producto de Anthropic.

Si Sonnet pierde demasiado rendimiento al reducirse el esfuerzo, el resultado de Max se vuelve más relevante. Los compradores enfrentarían una decisión más difícil entre el comportamiento más sólido de Sonnet y su papel previsto de eficiencia.

La segunda señal es la relación móvil del coste mediano por tarea. Arena debería acumular más sesiones tanto para Sonnet 5.5 como para Opus 5.5.

Una brecha persistente, combinada con que Opus mantenga la puntuación superior, reforzaría el hallazgo de dominancia. Sonnet necesitaría fortalezas específicas por categoría para justificar su lugar.

Un estrechamiento o una inversión debilitaría la interpretación del lanzamiento. Podría indicar que las sesiones iniciales de Sonnet fueron inusualmente largas, que el comportamiento de los usuarios cambió o que el modelo recibió actualizaciones de ajuste.

Los lectores deberían vigilar los intervalos de confianza junto a las clasificaciones destacadas. Un pequeño cambio de posición importa menos cuando los rangos de incertidumbre se solapan de forma sustancial.

La tercera señal es la prueba independiente sobre cargas de trabajo de agentes repetibles. Los equipos necesitan evaluaciones que reproduzcan las mismas tareas de programación, investigación y documentos en ambos modelos.

Esas pruebas deberían calificar los artefactos finales, no solo las respuestas. También deberían registrar correcciones, recuperación ante fallos, tiempo de finalización y consumo de recursos.

Un agente que termina una tarea al primer intento puede ser más barato que otro con tarifas de tokens más bajas que requiere tres correcciones. El tiempo de revisión humana debe incluirse en el mismo cálculo.

Las organizaciones deberían crear un conjunto representativo de tareas a partir de sus propios flujos de trabajo. Eliminar datos privados puede hacer que esas tareas sean seguras para una evaluación repetida.

Los registros de evaluación también necesitan contexto. Una base de conocimientos con capacidad de búsqueda puede conservar prompts, configuraciones de modelos, archivos fuente, notas de revisores y resultados aceptados para comparaciones posteriores.

Esta práctica importa porque los modelos y plataformas en vivo cambian. Una decisión tomada a partir de una instantánea de la clasificación de octubre puede quedar desactualizada tras una actualización del modelo o un cambio de enrutamiento.

Los equipos deberían comenzar con pilotos acotados. Comparen Sonnet y Opus en tareas cuyo éxito pueda revisarse objetivamente y, después, amplíen tras medir los patrones de fallo.

Para los agentes conversacionales, incluyan correcciones posteriores y solicitudes ambiguas. Para los agentes de programación, incluyan comandos fallidos, pruebas incompletas y convenciones específicas del repositorio.

Para los agentes de investigación, prueben la calidad de las citas, la selección de fuentes, el manejo de contradicciones y si el modelo marca claramente las afirmaciones no resueltas. Una respuesta extensa y pulida no es automáticamente correcta.

El debut de Claude Sonnet 5.5 en Agent Arena establece que el modelo pertenece a la vanguardia del mercado de agentes. No establece que el esfuerzo Max sea su mejor punto operativo.

Esa es la decisión que los compradores deben probar ahora. ¿Conserva Sonnet sus fortalezas en Chat y recuperación con un nivel de esfuerzo menor, o sigue siendo Opus a la vez más potente y más económico?

La próxima actualización de la clasificación ofrecerá una respuesta. Una evaluación controlada construida a partir de su trabajo real ofrecerá la respuesta que importa.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page