top of page

Prueba Simon Pelican de Anthropic: Claude Fable 5.1 luce mejor, pero solo después de pensar mucho más tiempo

2 sept
15 min de lectura

Anthropic lanzó Claude Fable 5.1 con una puntuación reportada del 52,6 % en un benchmark científico, pero la prueba simon pelican de Anthropic revela una historia de rendimiento diferente. Simon Willison pidió al modelo generar un SVG de un pelícano montando una bicicleta. Produjo su resultado más convincente solo después de dedicar mucho más tiempo y tokens de salida al máximo esfuerzo de razonamiento.

Ese contraste hace que el experimento sea más útil de lo que su absurda premisa sugiere. Anthropic presenta Fable 5.1 como un modelo para programación, trabajo de conocimiento y problemas de larga duración. El pelícano de Willison pone a prueba qué ocurre cuando esas capacidades se enfrentan a una pequeña tarea de programación visual con restricciones físicas evidentes.

El resultado no sustituye las evaluaciones formales de Anthropic. Es una demostración compacta del equilibrio que existe detrás de ellas. Fable 5.1 puede inspeccionar, revisar y mejorar su trabajo, pero razonar más no ofrece una ganancia uniforme. El mejor resultado llegó con un esfuerzo computacional mucho mayor, mientras que los ajustes inferiores mostraron poca deliberación visible.

Anthropic lanzó un modelo diseñado para seguir trabajando

Claude Fable 5.1 trata menos de responder un prompt rápidamente y más de mantener una tarea hasta que los detalles encajen.

Anthropic presentó Claude Fable 5.1 y Claude Mythos 5.1 el 1 de septiembre de 2026. La empresa los describe como el mismo modelo subyacente con distintas salvaguardas. Fable está disponible de forma general, mientras que Mythos está restringido a programas de investigación aprobados.

Los materiales de lanzamiento de la empresa se centran en programación, investigación y trabajo de conocimiento de larga duración. Anthropic afirma que Fable 5.1 evita correcciones superficiales, comprueba su propio trabajo y sigue siendo eficaz durante proyectos que abarcan horas o varias aplicaciones.

Estas afirmaciones importan porque muchos fallos actuales de la IA ocurren después de un comienzo prometedor. Un modelo puede redactar un plan plausible, generar código funcional y aun así perder de vista las restricciones durante revisiones posteriores. El rendimiento de larga duración depende de mantener el estado, probar resultados intermedios y corregir errores sin dañar el trabajo previo.

Los resultados de benchmark de Anthropic muestran mejoras moderadas en varias pruebas establecidas. El mayor salto reportado aparece en Terminal-Bench-Science 0.1, una evaluación de tareas científicas completadas mediante un entorno de terminal.

Fable 5.1 obtuvo un 52,6 % en la configuración de Anthropic. La empresa reportó un 24,7 % para Fable 5, un 29,0 % para Opus 5 y un 22,4 % para GPT-5.6 Sol en la misma comparación. Anthropic también revela un error estándar de entre 3,5 y 4,5 puntos porcentuales para cada modelo.

Otros resultados avanzaron con márgenes menores. Fable 5.1 alcanzó un 55,8 % en Terminal-Bench 4.0, frente al 42,0 % de Fable 5. Obtuvo un 31,4 % en AutomationBench, mientras que Fable 5 logró un 17,1 %.

Estas son cifras reportadas por la empresa, no medidas universales de la calidad del modelo. Anthropic también señala que las salvaguardas afectaron algunas tareas de evaluación. Ciertas solicitudes marcadas recibieron ceros, mientras que otras se redirigieron a distintos modelos Claude.

Esa revelación complica las comparaciones directas. Un benchmark puede medir el modelo subyacente, el sistema de seguridad desplegado, el arnés de agentes o alguna combinación de los tres. Los usuarios empresariales se encuentran con el producto combinado, por lo que esos detalles operativos deben formar parte de cualquier discusión sobre el rendimiento.

Los primeros clientes de Anthropic aportaron ejemplos de respaldo. MongoDB afirmó que el modelo investigó sus servicios y documentación antes de construir un prototipo durante varios días. Millennium afirmó que Fable 5.1 rastreó un fallo poco común hasta una biblioteca externa después de que modelos anteriores no detectaran la causa.

Estos informes son útiles, pero proceden de socios de lanzamiento seleccionados. Muestran cómo pueden ser los despliegues exitosos, no el resultado promedio en cada base de código o flujo de trabajo.

El pelícano de Willison ocupa el extremo opuesto del espectro de evaluación. No tiene un sistema empresarial, laboratorio de investigación ni gran colección de documentos. Su valor proviene de hacer visible el comportamiento del modelo.

Por qué Simon Willison sigue haciendo que los modelos dibujen pelícanos

El prompt del pelícano es valioso porque el éxito exige que muchas pequeñas relaciones funcionen a la vez, incluso cuando la tarea parece trivial.

Willison ha pedido repetidamente a modelos de lenguaje que generen un SVG de un pelícano montando una bicicleta. SVG es un formato de imagen basado en texto, por lo que un modelo de lenguaje puede crear la imagen completa escribiendo marcado estructurado e instrucciones de dibujo.

Un resultado plausible necesita ruedas reconocibles, un cuadro de bicicleta, manillar, pedales y un pelícano. Un buen resultado también debe conectarlos correctamente. Las patas del ave deberían alcanzar los pedales, su ala debería llegar al manillar y su cuerpo debería situarse sobre el cuadro.

Estas relaciones crean una prueba compacta de planificación y consistencia espacial. Un modelo puede producir código SVG válido y, aun así, fallar en la escena real. Podría dibujar patas desconectadas, ruedas mal colocadas, articulaciones imposibles o un animal que simplemente flota sobre una bicicleta.

La prueba se hizo popular porque las primeras mejoras eran fáciles de observar. Los mejores modelos tendían a producir código más limpio, geometría más coherente y mayor adhesión al prompt. Una imagen podía revelar errores que un largo informe de benchmark podría ocultar tras una puntuación agregada.

Más tarde, Willison perdió confianza en esa conexión. En su reevaluación de julio, argumentó que la calidad de los pelícanos ya no seguía la calidad general de los modelos con la misma fiabilidad que antes. El estilo de creación de imágenes, las preferencias de entrenamiento y los ajustes de razonamiento influían cada vez más en el resultado.

Esa limitación cambia el propósito del benchmark. Es una evidencia débil para declarar que un modelo es universalmente mejor que otro. Sigue siendo útil para comparar modelos relacionados, niveles de razonamiento y ejecuciones repetidas en condiciones similares.

El experimento con Claude Fable 5.1 sigue ese enfoque más acotado. Willison probó cinco ajustes de razonamiento: bajo, medio, alto, extra alto y máximo. Fable 5.1 no ofrecía ningún ajuste que desactivara por completo el razonamiento.

Con esfuerzo bajo, el modelo produjo una ilustración limpia y reconocible. La transcripción registrada por Willison no mostró razonamiento resumido, aunque la respuesta contenía 1.998 tokens de salida y tardó 23,8 segundos.

El esfuerzo medio se comportó de forma similar. La salida utilizó 1.977 tokens, tardó 23 segundos y nuevamente no mostró un resumen de razonamiento. La imagen final no presentó una ventaja evidente sobre el resultado con esfuerzo bajo.

El esfuerzo alto finalmente reveló un pequeño rastro de planificación. El modelo describió la escena prevista, incluida la bicicleta, el pelícano, el fondo, las ruedas y la colocación del cuerpo. Utilizó 2.612 tokens de salida y terminó en 29,6 segundos.

La mejora visible siguió siendo modesta. Ese resultado importa porque los controles de razonamiento suelen presentarse como un simple dial de calidad. En este experimento, pasar de bajo a alto no generó una ganancia proporcional.

El ajuste extra alto cambió el comportamiento de forma drástica. El modelo generó 36.767 tokens de salida y trabajó durante siete minutos y 51 segundos. Su razonamiento abordó las proporciones del ave, las patas, los pedales, la posición del ala y el carácter visual.

El esfuerzo máximo prolongó aún más ese proceso. Utilizó 65.927 tokens de salida y tardó 13 minutos y 54 segundos. Willison calificó el resultado como el mejor pelícano que había visto de un modelo de Anthropic.

La imagen incluía un casco azul, una cesta para peces, una bicicleta coherente y un contacto más cuidado entre el ave y la máquina. Sus detalles visuales reflejaban una inspección repetida, en lugar de una generación de una sola pasada.

Esa progresión es el experimento real. El prompt se mantuvo estable mientras cambiaba la deliberación disponible para el modelo. Fable 5.1 no se limitó a dibujar un pelícano mejor en cada ajuste superior. Cerca del extremo máximo, pasó a un modo de trabajo distinto.

La prueba Simon de Anthropic revela una brecha de esfuerzo

El mejor pelícano demuestra una autocorrección más sólida, pero también revela hasta qué punto la calidad puede depender del esfuerzo de inferencia.

La prueba simon de Anthropic resulta más informativa cuando se trata como una comparación dentro de una misma familia de modelos. Bajo, medio y alto produjeron ilustraciones aceptables con una separación visible limitada. Extra alto y máximo activaron un razonamiento mucho más prolongado y una revisión más deliberada.

Con esfuerzo máximo, el modelo hizo más que enumerar los objetos que debía dibujar. Consideró cómo debían interactuar esos objetos. El rastro de razonamiento examinó la colocación del casco, la superposición del pico, las formas de las plumas, los detalles del manillar y la curva de la horquilla delantera de la bicicleta.

Ese comportamiento se parece a una revisión iterativa de diseño. El modelo generó una estructura, inspeccionó defectos probables y ajustó componentes individuales. También rechazó añadidos innecesarios cuando amenazaban la claridad.

Un rastro mostró al modelo reconsiderando un casco de bicicleta porque podría interferir con la cresta reconocible del pelícano. Otro identificó la curva incorrecta de la horquilla y cambió un punto de control para mejorar su dirección.

Estas decisiones son pequeñas, pero ilustran una capacidad más amplia. Los agentes útiles de larga duración deben detectar cuándo su primer intento es simplemente plausible. Después necesitan aislar una debilidad y revisarla sin desestabilizar todo lo demás.

Ese mecanismo conecta el pelícano con el trabajo real de programación. Un agente de software podría crear una función que supera una prueba básica y, aun así, viola una restricción arquitectónica. Un agente de investigación podría completar un análisis antes de notar que una suposición corrompe la conclusión.

El problema más difícil no es producir más texto. Es dedicar computación adicional a las comprobaciones adecuadas. El rastro máximo de Fable 5.1 sugiere avances en ese comportamiento, al menos dentro de esta tarea de programación visual.

Sin embargo, el experimento también revela una curva de esfuerzo desigual. El nivel medio no superó al bajo de forma significativa, pese a ser un ajuste superior. El nivel alto añadió cierta planificación, pero no transformó la imagen. La mayor parte de la ganancia visible llegó mucho después.

Por tanto, los desarrolladores deberían evitar asumir que cada paso de razonamiento compra la misma calidad. Una carga de trabajo puede permanecer por debajo de un umbral en el que el esfuerzo adicional cambia poco. Otra puede beneficiarse solo cuando el modelo tiene suficiente margen para realizar inspecciones repetidas.

Esto crea un desafío de evaluación. Si un equipo prueba solo el ajuste predeterminado, puede subestimar lo que el modelo puede hacer. Si prueba solo el esfuerzo máximo, puede medir una configuración demasiado lenta para el uso normal.

Anthropic afirma que Fable 5.1 usa por defecto esfuerzo alto en Claude Code, mientras que otras interfaces de Claude utilizan esfuerzo medio. Los resultados de Willison sugieren que los valores predeterminados de la interfaz pueden moldear la impresión completa que tiene un usuario del modelo.

La prueba también separa la calidad de salida de la eficiencia operativa. El pelícano máximo era mejor, pero requirió sustancialmente más tokens y tiempo que las versiones de menor esfuerzo. Ese equilibrio importa incluso cuando un artículo evita hablar de precios específicos.

Los agentes de larga duración consumen capacidad de cómputo mientras planifican, inspeccionan archivos, llaman herramientas, ejecutan pruebas y revisan su trabajo. Un resultado exitoso puede justificar ese esfuerzo en una tarea difícil. El mismo proceso sería excesivo para una ilustración desechable o una transformación rutinaria.

La pregunta práctica no es si el razonamiento máximo es bueno. Es si el trabajo adicional cambia la decisión, reduce la revisión posterior o evita un error costoso.

Esa distinción presiona a Anthropic y a sus competidores. OpenAI, Google y otros proveedores de modelos exponen cada vez más controles de razonamiento o asignan automáticamente capacidad de cómputo. Los compradores necesitan pruebas de que esos controles se correspondan claramente con el valor de las cargas de trabajo.

El pelícano sugiere que esa correspondencia sigue siendo irregular. Una etiqueta más alta no garantiza un resultado visiblemente mejor, mientras que la configuración superior puede comportarse como un producto sustancialmente distinto.

El benchmark científico eleva la apuesta

La puntuación científica de Anthropic hace importante a Fable 5.1, pero el pelícano explica por qué esa puntuación requiere contexto operativo.

Terminal-Bench-Science 0.1 está diseñado en torno a flujos de trabajo científicos que los agentes realizan en entornos de terminal. Sus tareas abarcan campos como biología, química, física, ciencias de la Tierra, matemáticas e ingeniería.

El benchmark científico se lanzó poco antes de Fable 5.1. Contiene 70 tareas aportadas por científicos, con resultados que pueden comprobarse dentro de entornos controlados.

Esa estructura es más rigurosa que evaluar una ilustración. Las tareas exigen que los agentes naveguen por software, manipulen datos, utilicen herramientas científicas y alcancen resultados verificables. Su objetivo es parecerse a partes del trabajo de investigación real.

El resultado del 52,6% de Anthropic llama la atención porque más que duplica la puntuación del 24,7% que informó para Fable 5. La diferencia sigue siendo muy superior al error estándar divulgado.

La comparación aún requiere cautela. Anthropic reprodujo los resultados del modelo anterior utilizando su propia configuración de evaluación. La clasificación pública informó un 30,0% para Opus 5 y un 21,4% para Fable 5, mientras que Anthropic midió un 29,0% y un 24,7%.

La empresa afirma que esas diferencias se encuentran dentro del ruido estadístico esperado. Aun así, los lectores deben distinguir entre las ejecuciones de la clasificación pública y las comparaciones realizadas por el proveedor.

Un benchmark nuevo también tiene un historial limitado. Los investigadores aún no han observado con qué rapidez los desarrolladores optimizan prompts, arneses y herramientas en torno a sus tareas. Tampoco cuentan con un historial prolongado que conecte las mejoras del benchmark con una producción científica medible.

Eso no hace que el resultado carezca de importancia. Significa que es una señal temprana, no un veredicto definitivo.

El benchmark oficial y la prueba del pelícano miden cosas distintas. Terminal-Bench-Science pregunta si un agente completa un flujo de trabajo científico definido. El pelícano revela cómo el modelo asigna esfuerzo mientras resuelve un problema de restricciones visibles.

En conjunto, respaldan una conclusión más acotada. Fable 5.1 parece rendir mejor en trabajo sostenido basado en herramientas, y su comportamiento más sólido surge cuando dispone de suficiente capacidad de cómputo para inspeccionar resultados intermedios.

Anthropic ofrece varios ejemplos científicos más allá del benchmark. La empresa afirma que sus modelos trabajaron en ligandos de proteínas, cartografía planetaria y optimizaciones de GPU para modelos biológicos. Estas afirmaciones combinan la salida del modelo con herramientas externas y, en algunos casos, validación de laboratorio.

La empresa también afirma que Fable 5.1 entrenó una red neuronal que produjo un mapa de elevación de mayor resolución que cubre un tercio de Venus. Según Anthropic, el mapa resuelve detalles de dos a tres kilómetros en lugar de 10 a 20 kilómetros.

Estos ejemplos merecen más escrutinio que un prompt de una sola vez. Un resultado científico depende de la selección de datos, la configuración de herramientas, los métodos de validación y la supervisión humana. El modelo puede realizar un trabajo importante sin ser responsable de todo el proceso de descubrimiento.

Esta distinción importa para la adopción empresarial. Un comprador no despliega una puntuación de benchmark. Despliega un modelo dentro de un sistema con permisos, datos propietarios, revisores, presupuestos, salvaguardas y procedimientos ante fallos.

La evidencia más sólida procederá de flujos de trabajo repetidos en los que los equipos puedan comparar tasas de finalización, tiempo de corrección y requisitos de revisión humana. Un modelo que obtiene una puntuación más alta pero exige una verificación exhaustiva puede generar menos valor del esperado.

Por el contrario, un modelo más lento puede valer la pena cuando evita un error difícil. Los socios de lanzamiento de Anthropic destacan ejemplos relacionados con fallos poco frecuentes, cambios de código en múltiples servicios e investigación sin supervisión. Esos son precisamente los casos en los que un razonamiento adicional tiene un retorno plausible.

El benchmark científico aumenta la presión sobre OpenAI y Google porque establece una ventaja visible en una nueva evaluación agéntica. Sin embargo, la competencia más amplia no se reduce a una clasificación. Se trata de si los modelos pueden convertir el razonamiento prolongado en trabajo fiable y auditable.

Lo que el pelícano no demuestra

Un SVG pulido es evidencia de una ejecución exitosa, no una prueba de que Claude Fable 5.1 razonará de forma fiable en tareas no relacionadas.

La primera limitación es el tamaño de la muestra. Willison mostró una secuencia a través de cinco niveles de esfuerzo. Las salidas de los modelos pueden variar entre ejecuciones, incluso cuando el prompt y la configuración no cambian.

Una comparación más sólida repetiría cada configuración varias veces. Los revisores podrían puntuar la consistencia física, la validez del código, la calidad visual, el tiempo de ejecución y la longitud de la salida. Eso revelaría si el resultado máximo era habitual o excepcionalmente bueno.

La segunda limitación es el juicio subjetivo. La mayoría de los espectadores puede coincidir en que el pelícano máximo parece más completo, pero el atractivo visual no es una propiedad única y medible. Una persona puede preferir una ilustración minimalista, mientras que otra valora el detalle decorativo.

La tercera limitación es la contaminación. El prompt del pelícano lleva mucho tiempo circulando públicamente. Los desarrolladores de modelos pueden ver los ejemplos, y las imágenes relacionadas pueden aparecer en los datos de entrenamiento o evaluación.

No hay evidencia de que Anthropic optimizara explícitamente Fable 5.1 para este prompt. Aun así, una prueba conocida se vuelve menos útil como medida independiente cuando muchas salidas y discusiones son públicas.

Willison ya reconoce que la relación del benchmark con la calidad general de los modelos se ha debilitado. Su mejor uso restante es la comparación controlada, especialmente dentro de la familia de modelos de un mismo proveedor.

La cuarta limitación se refiere al razonamiento visible. La ausencia de un resumen de razonamiento no demuestra que el modelo no haya realizado razonamiento interno. Los productos pueden ocultar, comprimir o mostrar selectivamente los rastros.

Willison describió cuidadosamente que los niveles bajo y medio parecían omitir el razonamiento. Esa distinción periodística debe mantenerse. El comportamiento registrado de la interfaz es observable, pero el proceso interno del modelo no está plenamente disponible.

La quinta limitación es que los rastros largos pueden generar una confianza falsa. Un modelo que analiza muchos detalles aún puede cometer un error básico. Una mayor deliberación puede mejorar la detección de errores, pero también puede generar revisiones innecesarias o racionalizar un enfoque defectuoso.

El seguimiento animado hace visible ese riesgo. Una solicitud de Hacker News preguntó si el pelícano resuelto podía animarse. Willison volvió a proporcionar el SVG máximo a Fable 5.1 con esfuerzo alto y la instrucción de animarlo.

El modelo produjo una versión animada utilizando 26.201 tokens de salida. Willison señaló que las ruedas parecían girar en la dirección equivocada después de la conversión a vídeo, aunque el SVG original parecía correcto.

Este seguimiento es más que una broma. Pone a prueba si un modelo puede conservar un artefacto funcional mientras añade comportamiento. Ese patrón se parece al mantenimiento de software, donde una nueva función puede revelar problemas ausentes en la implementación original.

El experimento completo del pelícano de Willison también muestra por qué los artefactos finales necesitan una inspección directa. Un SVG válido, un rastro de razonamiento coherente y un comando de animación exitoso no garantizan que cada relación visual haya sobrevivido a la exportación.

Una sexta limitación procede de la alineación con el benchmark. El pelícano evalúa principalmente la generación de SVG, las relaciones espaciales y el diseño iterativo. Dice poco sobre fiabilidad factual, decisiones de seguridad, juicio científico o rendimiento con datos empresariales privados.

Las evaluaciones formales de Anthropic cubren algunas de esas áreas, pero muchos resultados siguen siendo informados por el proveedor. Los testimonios de socios de lanzamiento también describen éxitos seleccionados, en lugar de tasas de fallo controladas.

Eso deja una brecha de verificación importante. Fable 5.1 parece capaz de realizar un trabajo más sostenido, pero los equipos aún necesitan pruebas independientes basadas en sus propias tareas. Deben medir con qué frecuencia el modelo termina correctamente, no lo impresionante que parece su mejor sesión.

Una evaluación útil debería incluir requisitos ambiguos, fallos de herramientas, documentos desactualizados y contenido adversarial. Los agentes de ejecución prolongada deben gestionar esas condiciones sin cambiar silenciosamente el objetivo.

Por tanto, la tensión central sigue sin resolverse. Fable 5.1 puede dedicar mucho más tiempo a mejorar una salida, pero los usuarios necesitan formas fiables de decidir cuándo ese esfuerzo está justificado y cuándo el modelo debe detenerse.

Tres señales mostrarán si Fable 5.1 cumple

La próxima prueba es si las mejoras de Fable 5.1 en benchmarks y demostraciones resisten la repetición, los flujos de trabajo reales y la presión competitiva.

La primera señal es la reproducción independiente de Terminal-Bench-Science 0.1. Los investigadores deberían ejecutar Fable 5.1 en múltiples ensayos utilizando arneses documentados y acceso comparable a herramientas.

Resultados cercanos a la cifra del 52,6% de Anthropic reforzarían la afirmación de la empresa. Una puntuación pública sustancialmente menor sugeriría que la configuración de evaluación, el prompting o la configuración privada contribuyeron más de lo que implica el titular.

La variación entre ejecuciones también importará. Un modelo con un buen promedio pero fallos impredecibles presenta un perfil operativo distinto al de uno que produce resultados ligeramente inferiores, pero más estables.

La segunda señal es la evidencia a nivel de carga de trabajo procedente de desarrolladores y equipos empresariales. Las métricas más reveladoras incluirán tasas de finalización exitosa, tiempo de revisión, defectos corregidos, ejecuciones interrumpidas y frecuencia de intervención humana.

Los equipos deberían comparar el razonamiento alto y máximo en las mismas tareas internas. También deberían registrar los casos en los que el esfuerzo adicional no cambia nada o empeora el resultado.

Esa evidencia convertiría la brecha de esfuerzo entre Anthropic y Simon en una cuestión operativa. Si el razonamiento máximo evita de forma consistente fallos costosos, el mayor tiempo de ejecución se vuelve defendible. Si las mejoras solo aparecen en demostraciones seleccionadas, será difícil justificar la configuración superior.

La tercera señal es cómo responden los modelos competidores. GPT-5.6 Sol de OpenAI queda por detrás de Fable 5.1 en la comparación científica de Anthropic, mientras que los modelos de Google siguen siendo sólidos en la generación de SVG visualmente expresivos.

Un competidor puede responder de varias maneras. Puede superar a Fable en la clasificación científica pública, mejorar la asignación automática de razonamiento, reducir el tiempo necesario para obtener resultados comparables o publicar evaluaciones independientes de flujos de trabajo más sólidas.

La respuesta más significativa combinará calidad con previsibilidad. Los desarrolladores no solo necesitan un modelo capaz de producir un artefacto extraordinario. Necesitan controles que comuniquen cuánto esfuerzo recibió una tarea y por qué el sistema se detuvo.

Para los trabajadores del conocimiento, el mismo principio se aplica a la investigación y al análisis de documentos. Una respuesta más larga no es necesariamente una respuesta mejor. El sistema útil es el que comprueba la evidencia, detecta restricciones ausentes y expone claramente la incertidumbre.

La prueba del pelícano de Anthropic y Simon ofrece a Claude Fable 5.1 una demostración memorable, pero su lección no es que el benchmark haya sido resuelto. La lección es que la autorrevisión sostenida ahora produce un trabajo visiblemente mejor, mientras que el coste de esa revisión sigue siendo desigual.

Los desarrolladores deberían probar el modelo con artefactos que puedan inspeccionar y fallos que ya comprendan. Ejecuten la misma tarea con múltiples niveles de esfuerzo, comparen los resultados finales y registren dónde el razonamiento adicional cambia el resultado.

La próxima demostración convincente no debería ser otro pájaro perfecto. Debería mostrar que Fable 5.1 puede aplicar la misma corrección cuidadosa en tareas repetidas y trascendentales sin exigir el máximo esfuerzo cada vez.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page