La carrera entre Anthropic y GPT divide los benchmarks mientras Astra reinicia el reloj de la AGI
- Sophie Larsen

- hace 4 días
- 18 min de lectura
GPT-6 Astra de OpenAI alcanzó 169 en un índice de modelos, pero solo 61 en otro, lo que intensificó la rivalidad entre Anthropic y GPT en torno al liderazgo en benchmarks. Epoch AI situó a Astra en primer lugar entre 267 modelos evaluados. Artificial Analysis, en cambio, lo clasificó por detrás de Claude Fable 5.1 de Anthropic.
Normalmente, ese desacuerdo daría lugar a otro lanzamiento de modelo sin conclusiones claras. El resultado de Astra en ARC-AGI-3 hace que este caso sea más difícil de descartar. El modelo obtuvo un 62,7 % mediante el harness estándar de ARC Prize, frente al 7,8 % reportado para GPT-5.6 Sol.
Según la evaluación de ARC Prize, Astra también completó las tareas interactivas con mayor eficiencia de acciones que un humano promedio. François Chollet afirmó que su avance fue aproximadamente el doble de rápido de lo que esperaba. Aun así, no llegó a declararlo AGI.
Por tanto, la cuestión central no es si un leaderboard eligió al ganador equivocado. Es si los benchmarks actuales miden siquiera el mismo tipo de inteligencia. La competencia entre Anthropic y GPT enfrenta ahora el rendimiento amplio en pruebas con la eficiencia adaptativa en entornos desconocidos.
GPT-6 Astra produjo dos veredictos contradictorios
El lanzamiento de Astra convirtió la clasificación de modelos en una disputa sobre qué eligen medir los evaluadores.
OpenAI presentó GPT-6 Astra el 3 de septiembre de 2026. La empresa lo posicionó como un modelo para uso de ordenadores, navegación, ingeniería de software, ciencia, ciberseguridad y trabajo profesional.
Su anuncio de Astra describió resultados de vanguardia en varias evaluaciones seleccionadas por la empresa. OpenAI también reportó un 99,9 % en ARC-AGI-3 mediante una configuración de evaluación específica del proveedor.
Las puntuaciones agregadas independientes ofrecieron una imagen menos coherente. El índice de capacidades de Epoch AI otorgó a Astra 169 puntos, por delante de Claude Fable 5.1 con 163. GPT-5.6 Sol y Claude Opus 5 recibieron 162 cada uno.
El índice de Epoch combina resultados de numerosos ámbitos de capacidad. Entre ellos se incluyen matemáticas, ciencia, conocimiento, programación y otras tareas exigentes. Su puntuación intenta resumir el progreso general en lugar de aislar una habilidad concreta.
En ese compuesto, Astra lidera. El resultado respalda el argumento de OpenAI de que el modelo representa un cambio generacional significativo. También sugiere que las mejoras más sólidas de Astra se concentran en las áreas destacadas por la combinación de evaluaciones de Epoch.
Artificial Analysis llegó a una conclusión diferente. Su Intelligence Index otorgó a Astra 61, al mismo nivel que GPT-5.6 Sol. Claude Fable 5.1 lideró la comparación con 66, mientras que Claude Opus 5 obtuvo 63.
La comparación de modelos abarca conocimiento, programación, matemáticas y comprensión de texto. Su composición y sus procedimientos de prueba difieren de los del índice de Epoch. Los números resultantes no pueden tratarse como dos mediciones de un objeto idéntico.
Los resultados individuales de Astra también fueron desiguales. Mejoró notablemente en varias tareas científicas y de agentes. Sin embargo, Artificial Analysis registró un rendimiento más débil en áreas que incluían razonamiento de contexto largo y ciertas evaluaciones profesionales.
Su panorama en programación fue igualmente mixto. Astra habría alcanzado 67 en el Coding Agent Index, mientras que Claude Fable 5.1 llegó a 70. Astra utilizó sustancialmente menos pasos de razonamiento que varios modelos competidores en pruebas comparables.
Esa eficiencia importa porque la carga práctica de un modelo va más allá de su tarifa publicada por token. Un modelo que usa menos tokens, menos acciones o menos tiempo transcurrido puede ser preferible pese a una puntuación principal inferior.
Por tanto, el lanzamiento generó dos relatos legítimos pero incompletos. Epoch afirma que Astra tiene el perfil de capacidades generales más sólido. Artificial Analysis sostiene que no lidera en una colección fija de tareas habituales de razonamiento.
Ninguno de los dos veredictos resuelve por sí solo qué modelo es mejor para desarrolladores o empresas. Un equipo de software valora un rendimiento de programación reproducible. Un grupo de investigación puede priorizar el razonamiento matemático, el uso de herramientas o la resolución de problemas novedosos.
El momento también limita las conclusiones firmes. Epoch contaba con menos evaluaciones de programación registradas para Astra que para algunos modelos consolidados cuando apareció la comparación inicial. Al menos una ejecución de programación disponible de Astra utilizó una configuración de razonamiento media.
Los leaderboards iniciales suelen combinar resultados maduros con una cobertura incompleta. Los modelos nuevos reciben pruebas adicionales, actualizaciones de harness y cambios de configuración tras su lanzamiento. Las clasificaciones pueden moverse aunque el modelo subyacente no cambie.
Eso hace que el contraste entre 169 y 61 sea informativo, no absurdo. Los números revelan distintas prioridades de evaluación. También advierten a los compradores contra tratar cualquier puntuación agregada como una medida universal de inteligencia.
La competencia entre Anthropic y GPT se ve diferente según la carga de trabajo que se sitúe en el centro. Claude lidera el índice más orientado al texto de Artificial Analysis. Astra lidera el compuesto actual de Epoch y registra avances inusuales en razonamiento interactivo.
La cuestión más relevante comienza allí donde ambos índices agregados se vuelven menos descriptivos. ARC-AGI-3 no pide a un modelo recuperar una respuesta ni completar un ejercicio de programación familiar. Le pide al sistema descubrir cómo funciona un mundo desconocido.
ARC-AGI-3 cambió el significado de la comparación
El resultado más sólido de Astra se refiere a la adaptación bajo incertidumbre, no a responder preguntas convencionales.
ARC-AGI-3 evalúa agentes dentro de entornos interactivos desconocidos. Un sistema debe explorar, inferir reglas, recordar observaciones, planificar acciones y reconocer objetivos sin recibir instrucciones habituales sobre la tarea.
El benchmark limita la dependencia de hechos memorizados y del conocimiento lingüístico. Sus entornos funcionan más como pequeños juegos desconocidos que como exámenes convencionales. El éxito exige aprender mediante interacción, en lugar de reconocer un patrón de prompt conocido.
Esta distinción importa porque los modelos de lenguaje grandes pueden obtener buenas puntuaciones gracias a una amplia exposición previa. Un benchmark basado en entornos desconocidos intenta reducir esa ventaja. Evalúa si un sistema puede adquirir comportamientos útiles durante la evaluación.
El informe de ARC-AGI-3 describió la exploración, la planificación, la memoria, la adquisición de objetivos y la alineación como requisitos centrales. Cuando apareció el benchmark en marzo de 2026, los sistemas de frontera evaluados obtuvieron menos del 1 %.
Los humanos pudieron resolver todos los entornos evaluados sin entrenamiento específico para cada tarea. Los participantes humanos no fueron igual de rápidos ni eficientes, pero el benchmark estableció que cada entorno podía comprenderse mediante interacción.
Seis meses después, Astra alcanzó un 62,7 % en el conjunto semiprivado usando el harness estándar de ARC Prize. Los resultados verificados registran esta ejecución con el máximo esfuerzo de razonamiento.
Esa puntuación fue más de ocho veces superior al 7,8 % reportado para GPT-5.6 Sol. También superó en más del doble el 30,2 % registrado para Claude Opus 5. Inicialmente no había datos comparables disponibles para Claude Fable 5.1.
El resultado es importante porque el modelo no se limitó a resolver más entornos. Según el análisis de ARC Prize, Astra usó menos acciones que el humano promedio en las tareas completadas con éxito.
La eficiencia de acciones mide cuán directamente alcanza un agente una solución. Un sistema ineficiente puede tener éxito solo después de una exploración aleatoria extensa. Un sistema más eficiente construye una representación interna precisa con menos movimientos.
Astra habría superado el nivel medio de eficiencia humana en esta medida. Eso no significa que haya superado a los humanos en inteligencia general. Significa que sus trayectorias exitosas en ARC-AGI-3 requirieron menos acciones que el promedio humano.
La distinción evita exagerar el hallazgo. Los humanos siguieron demostrando una cobertura completa de los entornos. La tasa de éxito de Astra con el harness estándar permaneció muy por debajo del 100 %.
OpenAI también reportó un resultado del 99,9 % mediante un harness de adaptador del proveedor. Esta configuración conserva el estado de razonamiento opaco del modelo entre solicitudes y compacta conversaciones más largas. El harness estándar solo conserva las notas seleccionadas por el modelo.
Por tanto, la puntuación más alta mide a Astra con una infraestructura no disponible para todos los proveedores. ARC Prize advierte que no debe utilizarse para una clasificación directa entre proveedores. Es evidencia sobre una configuración de sistema, no una comparación neutral con Claude.
La brecha entre el 62,7 % y el 99,9 % es reveladora por sí misma. La inteligencia aparente de un modelo depende en parte de cómo lo rodean la memoria, el contexto, las herramientas y el estado de razonamiento oculto.
Eso crea un nuevo problema de evaluación. Los compradores despliegan cada vez más sistemas completos de agentes, no modelos de lenguaje aislados. Sin embargo, la infraestructura específica del proveedor puede dificultar o imposibilitar una comparación justa.
El resultado de Astra sigue representando un cambio brusco bajo la configuración estándar. El salto desde el 7,8 % de Sol no puede explicarse por el adaptador del proveedor. Ambas cifras proceden de la ruta de evaluación más comparable.
ARC-AGI-3 también difiere de las versiones anteriores de ARC. ARC-AGI-1 utilizaba transformaciones visuales estáticas que fueron saturándose cada vez más. ARC-AGI-2 aumentó la dificultad mientras conservaba un formato de rompecabezas abstracto.
Astra obtuvo un 95 % en ARC-AGI-2, frente al 92,5 % de Sol. Esa diferencia menor no respaldaría una afirmación dramática sobre inteligencia. La tercera generación interactiva crea una separación más clara.
Este historial explica por qué Chollet se centró en el rendimiento de Astra en ARC-AGI-3. El modelo mostró un nuevo nivel de competencia en tareas diseñadas en torno a lo desconocido. Eso se aproxima más a su definición de inteligencia que la excelencia en habilidades que pueden ensayarse.
El resultado del benchmark no pone fin al debate sobre la AGI. Cambia su evidencia más sólida. En lugar de preguntar si un modelo sabe lo suficiente, los evaluadores pueden preguntar con qué eficiencia aprende cuando su conocimiento existente es insuficiente.
La rivalidad entre Anthropic y GPT gira ahora en torno a la eficiencia
La presión competitiva proviene de cuánto razonamiento necesita un modelo, no solo de cuántas respuestas acierta.
Los modelos Claude de Anthropic siguen siendo competidores formidables en programación y trabajo profesional. Claude Fable 5.1 superó a Astra en el Intelligence Index y el Coding Agent Index de Artificial Analysis.
La ventaja de Astra parece situarse en otra dimensión. Habría igualado a Claude Fable 5 en un resultado de programación comparable utilizando menos pasos computacionales. También requirió menos pasos que GPT-5.6 Sol y Claude Opus 5.
Menos pasos de razonamiento pueden reducir los recursos totales consumidos por una tarea. Ese beneficio puede compensar una tarifa más alta por token. También puede acortar los tiempos de espera y reducir las oportunidades de que un agente se desvíe.
La distinción se parece a la eficiencia de combustible. El precio del combustible de un vehículo no revela el coste de un viaje terminado. La distancia, el consumo y la fiabilidad determinan el resultado real.
Los compradores de IA afrontan el mismo problema de cálculo. Las tarifas publicadas de entrada y salida describen unidades de consumo. No muestran cuántas unidades necesita un modelo para terminar un trabajo útil.
Astra habría consumido menos tokens de razonamiento que Sol en varias tareas de agentes. La comparación de The Decoder estimó que esta eficiencia redujo la diferencia en los costes de tareas completadas, pese a la mayor tarifa por unidad de Astra.
No hacen falta cifras de precios para comprender la presión estratégica. Anthropic no puede responder a Astra simplemente ganando un índice amplio de inteligencia. OpenAI no puede reclamar la victoria mientras Claude conserve ventajas en pruebas importantes de programación.
Ambas empresas deben demostrar trabajo completado en condiciones coherentes. Eso incluye la tasa de éxito, el uso total de cómputo, la latencia, las correcciones humanas y la recuperación tras acciones fallidas.
Esto aleja la competencia anthropic GPT de las impresiones que generan los chatbots. Los sistemas agénticos operan entre archivos, navegadores, terminales y software empresarial. Sus fallos pueden propagarse por un flujo de trabajo antes de que un usuario los detecte.
Un agente eficiente pero poco fiable aporta poco valor. Un agente muy preciso también puede resultar poco práctico si requiere demasiado tiempo y cómputo. El sistema líder debe gestionar ambas limitaciones.
La eficiencia interactiva de Astra aumenta la presión sobre Anthropic porque Claude construyó gran parte de su reputación en torno a la programación y al uso controlado de herramientas. Una ventaja clara de Astra en el trabajo informático adaptativo alcanzaría ese mercado central.
El liderazgo de Claude Fable 5.1 en el índice genera una presión equivalente sobre OpenAI. Impide que las puntuaciones más altas de Astra se conviertan en una afirmación indiscutida de liderazgo general. Los clientes pueden señalar una evaluación independiente en la que el resultado del nivel predecesor sigue siendo visible.
Los equipos empresariales deberían considerar estos resultados como hipótesis sobre cargas de trabajo. Un flujo de investigación centrado en matemáticas puede favorecer a un modelo. Una migración de repositorios o un proceso de soporte puede producir una clasificación diferente.
Los equipos también necesitan registros de sus propias evaluaciones. Guardar prompts, resultados, correcciones y decisiones en una base de conocimiento de IA con capacidad de búsqueda facilita la auditoría de las comparaciones entre modelos.
Sin ese registro, los compradores corren el riesgo de evaluar los modelos a través de éxitos memorables. Las demostraciones impresionantes atraen la atención, mientras que los fallos silenciosos se diluyen en el trabajo habitual.
El mismo problema afecta a la interpretación de los benchmarks. Las puntuaciones agregadas ocultan las distribuciones de tareas. Una ventaja de cinco puntos en un índice no significa que un modelo gane todas las evaluaciones ni que ofrezca una mejor economía para cada flujo de trabajo.
El resultado de Astra en el Coding Agent Index ilustra el problema. Claude Fable 5.1 lideró en la puntuación, pero, según los informes, Astra necesitó menos pasos. La clasificación cambia si una organización valora la finalización bruta por encima del coste, o la eficiencia por encima de una pequeña diferencia de puntuación.
El resultado de ARC-AGI-3 intensifica este debate porque vincula la eficiencia con la adaptación. Astra no solo ahorró pasos en una tarea de programación conocida. Los utilizó de forma eficaz mientras descubría reglas desconocidas.
Esa combinación es relevante para los despliegues reales de agentes. El software empresarial cambia, los sitios web presentan estados inesperados y los repositorios contienen convenciones no documentadas. Un agente útil debe adaptarse sin recibir un manual de instrucciones perfecto.
Sin embargo, los pequeños mundos de juego de ARC siguen siendo abstracciones. Eliminan muchas complicaciones presentes en las organizaciones, incluidos objetivos ambiguos, controles de acceso, juicio social y consecuencias por acciones incorrectas.
La conclusión responsable es más acotada. Astra aporta evidencia de que el razonamiento adaptativo y la eficiencia de acción mejoraron notablemente. Que esas ganancias se transfieran al trabajo profesional sostenido aún requiere pruebas independientes.
Por lo tanto, el ganador de la carrera anthropic GPT dependerá de la evidencia de despliegue. El liderazgo en benchmarks puede conseguir una prueba. La finalización fiable y eficiente de tareas determina si el modelo se mantiene.
Chollet adelantó su previsión sin declarar la AGI
La reacción de Chollet reconoce un progreso más rápido mientras preserva una definición exigente de la inteligencia general.
François Chollet creó el Abstraction and Reasoning Corpus original en 2019. Lo diseñó para evaluar la adquisición de habilidades y no solo el conocimiento acumulado.
Su argumento ha cuestionado durante mucho tiempo las narrativas estándar de escalado. Un sistema puede mejorar en muchas tareas conocidas sin adquirir una inteligencia adaptativa amplia. La cobertura de entrenamiento y la preparación para benchmarks pueden imitar la generalización.
Las tareas de ARC intentan revelar esa diferencia. Minimizan la dependencia del lenguaje, los hechos almacenados y los formatos profesionales reconocibles. Un modelo debe inferir una tarea a partir de la evidencia disponible durante la evaluación.
Cuando se lanzó ARC-AGI-3, Chollet esperaba, según los informes, que un modelo de frontera lo saturara en aproximadamente un año. Astra llegó unos seis meses después y casi lo saturó bajo el harness especializado de OpenAI.
Chollet caracterizó el progreso como aproximadamente dos veces más rápido de lo esperado. También describió Astra como un cambio de nivel para los problemas de razonamiento interactivo.
Esas declaraciones adelantaron su previsión sobre la AGI, pero no establecieron una fecha. Tampoco consideraron que el resultado de un solo benchmark fuera prueba suficiente.
El razonamiento de Chollet importa más que la predicción llamativa. ARC-AGI-3 evalúa en pequeñas cantidades propiedades cualitativas asociadas con la inteligencia general. Estas incluyen exploración bajo incertidumbre, modelado causal y adaptación sin instrucciones explícitas.
Un modelo que muestra esas propiedades en entornos restringidos ha cruzado un umbral significativo. No necesariamente ha demostrado la misma competencia en el mundo abierto.
Esta distinción separa la evidencia de capacidades de la etiqueta AGI. La AGI no tiene una definición operativa aceptada universalmente. Empresas, investigadores y contratos pueden aplicar umbrales diferentes.
El presidente de OpenAI, Greg Brockman, ofreció una interpretación más amplia en el lanzamiento. Dijo que personalmente creía que la empresa había alcanzado la AGI, mientras dejaba a los usuarios decidir si Astra satisfacía sus definiciones.
Esa retórica eleva lo que está en juego en torno a cada benchmark. Llamar AGI a un modelo invita a un escrutinio que va más allá de las clasificaciones de modelos. Genera expectativas sobre fiabilidad, autonomía, transferencia y rendimiento en dominios desconocidos.
ARC-AGI-3 respalda parte de esa narrativa. Astra se adaptó eficazmente en entornos diseñados para resistir la memorización directa. Su puntuación en el harness estándar también dejó una brecha considerable respecto a una cobertura humana completa.
Otros resultados refuerzan la imagen mixta. Según los informes, Astra se convirtió en el único modelo de la evaluación estandarizada FrontierMath Erdős de Epoch que resolvió dos de 68 problemas abiertos con demostraciones verificadas por máquina.
La verificación mediante Lean significa que un software formal comprobó la validez lógica de esas demostraciones. Esto hace que el resultado sea más difícil de inflar mediante prosa persuasiva pero incorrecta.
Según los informes, surgieron tres soluciones adicionales de ejecuciones no estándar que utilizaron mucho más cómputo. Epoch excluyó esos intentos de la comparación puntuada porque no siguieron el mismo presupuesto de evaluación.
Este límite es esencial. El mejor resultado observado de un modelo puede demostrar posibilidad. Una ejecución estandarizada proporciona una mejor base para la comparación.
El rendimiento de Astra en matemáticas formales sugiere capacidades más sólidas de búsqueda y verificación. Sus resultados más débiles en algunas tareas profesionales y de contexto largo muestran que esas capacidades no se transfieren de forma uniforme.
Una declaración de AGI debe abordar esa desigualdad. La inteligencia general no es idéntica a una colección de puntuaciones récord. Implica una capacidad de adaptación fiable cuando el entorno, el objetivo y la evidencia cambian a la vez.
La historia anterior de ARC ofrece una advertencia. El o3 de OpenAI produjo un resultado importante en ARC-AGI-1, generando un debate similar sobre si se había cruzado un umbral.
Posteriormente, los investigadores destacaron el coste, la exposición a las tareas y la diferencia entre dominar un benchmark y la inteligencia general. ARC-AGI-2 y ARC-AGI-3 se crearon en parte para restaurar margen de evaluación.
El rendimiento de Astra comprimió ese margen más rápido de lo que Chollet esperaba. Este es el verdadero cambio en la previsión. Los diseñadores de benchmarks ahora tienen menos tiempo para crear pruebas que sigan siendo informativas en la frontera.
La lección no es que la evaluación haya fracasado. Es que los benchmarks útiles requieren una renovación continua. Una vez que una tarea se satura o se convierte en un objetivo directo, pierde parte de su capacidad para distinguir la adaptación general de la optimización especializada.
Las brechas entre benchmarks son la razón más sólida para la cautela
Los resultados de Astra se vuelven menos concluyentes cuando se examinan conjuntamente los harnesses, la cobertura y los métodos agregados.
La primera incertidumbre se refiere al alcance de la evaluación. La puntuación de 169 de Epoch resume una colección amplia pero en evolución. El 61 de Artificial Analysis refleja una mezcla y una ponderación fijas diferentes.
Un índice compuesto puede cambiar cuando un modelo carece de resultados en un dominio. También puede hacer hincapié en áreas donde un nuevo modelo recibió pruebas exhaustivas durante el lanzamiento.
El registro inicial de Astra en Epoch contenía, según los informes, una cobertura limitada de programación. Claude Fable 5.1 obtuvo los mejores resultados en varias evaluaciones de programación. Por lo tanto, comparar sus totales principales corre el riesgo de ocultar evidencia desigual.
La segunda incertidumbre se refiere al diseño del harness. Un harness controla cómo un modelo recibe contexto, conserva el estado, utiliza herramientas y envía respuestas.
El harness estándar de ARC Prize permite que las notas seleccionadas persistan. El adaptador de proveedor de OpenAI conserva un estado de razonamiento opaco y compacta las interacciones largas. Estas son condiciones operativas materialmente diferentes.
La puntuación del 99,9 por ciento muestra lo que Astra puede hacer con su infraestructura nativa. No debería presentarse como una victoria directa sobre modelos evaluados mediante la interfaz estándar.
Este problema crecerá a medida que los proveedores de modelos optimicen sistemas completos. El razonamiento oculto, la memoria propietaria, el enrutamiento y las políticas de herramientas pueden mejorar los resultados al tiempo que reducen la reproducibilidad independiente.
La tercera incertidumbre se refiere a la transferencia de tareas. ARC-AGI-3 aísla la adaptación dentro de pequeños mundos interactivos. Esto hace que la prueba sea científicamente útil, pero operativamente incompleta.
Un agente empresarial debe gestionar permisos, instrucciones contradictorias, objetivos poco claros y sistemas externos cambiantes. También debe saber cuándo detenerse y solicitar juicio humano.
La eficiencia de movimientos de Astra no verifica esos comportamientos. Completar un rompecabezas con menos acciones es distinto de editar datos de producción sin causar daños.
El material de seguridad de OpenAI añade otra razón para realizar pruebas cuidadosas. La empresa afirma que Astra recibió un entrenamiento de robustez y alineamiento más sólido que Sol. También reconoce una mayor dificultad para supervisar el razonamiento avanzado.
Su visión general de seguridad analiza controles para la ciberseguridad y los despliegues que utilizan herramientas. Las afirmaciones de seguridad de la empresa siguen siendo reportadas por el proveedor hasta que haya una evaluación independiente más amplia.
Un uso informático más capaz aumenta tanto el valor como la exposición. Un agente que navega software de forma eficiente puede automatizar flujos de trabajo largos. Esa misma autonomía incrementa las consecuencias de instrucciones malinterpretadas o controles de acceso débiles.
Una preocupación aparte implica la orientación hacia benchmarks. La previsión original de Chollet incluía una condición sobre cuán directamente los laboratorios persiguieran ARC-AGI-3.
Un modelo entrenado o ajustado en torno al razonamiento interactivo puede mejorar rápidamente sin adquirir una capacidad equivalente en otros ámbitos. Eso no invalida el resultado. Limita hasta qué punto debe generalizarse la mejora.
La contaminación de datos es menos directa para mundos interactivos que para preguntas estáticas. Aun así, un proveedor puede optimizar en torno a los principios, las interfaces o la retroalimentación de desarrollo del benchmark.
La evaluación repetida también crea efectos de selección. La mejor configuración entre muchos intentos puede parecer mucho más sólida que el resultado esperado de un despliegue ordinario.
La página de ARC Prize enumera múltiples configuraciones de harness para Astra. Los compradores deberían distinguir la mejor ejecución observada del rendimiento repetible con una configuración fija.
Los presupuestos de coste complican aún más las comparaciones. La ejecución de Astra con el harness estándar, que obtuvo un 62,7 por ciento, utilizó un presupuesto de evaluación considerable. El resultado del adaptador de proveedor costó menos en conjunto, pero dependió de una configuración especializada.
La pregunta relevante no es si ese gasto estaba justificado. Es si otro modelo recibió oportunidades, configuraciones e infraestructura equivalentes.
Las comparaciones de eficiencia humana requieren un cuidado similar. Astra utilizó menos movimientos en las tareas completadas con éxito que el ser humano promedio. Los humanos resolvieron una proporción más amplia de los entornos del benchmark.
La eficiencia condicionada al éxito no equivale a una superioridad general. Un sistema puede actuar de forma directa cuando comprende una tarea, pero fracasar por completo en otras.
La información debe preservar ambos hechos. Astra superó el umbral promedio de eficiencia de acciones humanas. No igualó la cobertura humana completa mediante el arnés estándar.
Por lo tanto, el desacuerdo entre benchmarks aporta más valor que cualquiera de las clasificaciones por separado. Expone las dimensiones ocultas tras la palabra “mejor”.
Astra parece más sólido en razonamiento adaptativo, determinadas tareas científicas y trabajo agéntico eficiente. Claude Fable 5.1 conserva ventajas en un importante índice independiente de inteligencia y varias métricas de programación.
Esa incertidumbre debe orientar el despliegue. Las organizaciones necesitan tareas representativas, presupuestos fijos, pruebas repetidas e intervenciones humanas registradas. Deben evaluar la recuperación ante fallos con el mismo rigor que el éxito en el primer intento.
Los equipos pueden preservar esos resultados mediante un flujo de trabajo de IA documentado. Un registro de evaluación duradero facilita la comparación de cambios de modelo posteriores.
Ningún benchmark público puede reproducir las restricciones de todas las organizaciones. Las diferencias entre benchmarks no son ruido que deba promediarse. Son información sobre dónde se concentran las capacidades de cada modelo.
Tres señales decidirán si Astra cambió la carrera
La próxima prueba es determinar si la eficiencia adaptativa de Astra se mantiene en evaluaciones neutrales y en el uso profesional cotidiano.
La primera señal es una batería más amplia de pruebas de ARC-AGI-3 neutrales respecto al proveedor. Claude Fable 5.1, los modelos Gemini más recientes y otros sistemas de frontera necesitan ejecuciones comparables mediante el arnés estándar.
La ventaja de Astra se refuerza si los competidores permanecen cerca del rango reportado para Claude Opus 5. Se debilita si otros modelos se acercan al 62,7 por ciento al evaluarse en condiciones equivalentes.
También importan las ejecuciones repetidas de Astra. Una distribución estable demostraría que el resultado refleja una capacidad fiable. Una variación amplia sugeriría que la mejor puntuación observada exagera el rendimiento habitual.
La segunda señal es una cobertura independiente ampliada de programación y uso de computadoras. El índice de Epoch necesita más resultados de Astra con configuraciones de razonamiento coherentes.
La puntuación de 169 del modelo gana credibilidad si las pruebas de programación añadidas mantienen su ventaja. Resulta menos convincente si una cobertura más completa acerca a Astra a Sol o lo sitúa por debajo de Claude Fable 5.1.
Los estudios reales de uso de computadoras deben informar sobre la finalización de tareas, el tiempo transcurrido, las intervenciones y los daños provocados por errores. Los totales de tokens por sí solos no pueden reflejar la carga operativa de un agente que fracasa.
Los evaluadores independientes también deberían distinguir entre los sistemas nativos de los proveedores y los arneses comunes. Ambos son útiles, pero responden a preguntas diferentes.
Las evaluaciones nativas muestran el mejor producto al que puede acceder un cliente. Las evaluaciones estandarizadas aíslan una mayor parte del modelo subyacente y permiten una competencia más justa.
La tercera señal es la evidencia procedente de despliegues sostenidos. OpenAI lanzó inicialmente Astra a un conjunto limitado de organizaciones antes de ampliar su disponibilidad.
Esos usuarios pueden comprobar si el razonamiento interactivo se transfiere a repositorios, navegadores, procesos de investigación y sistemas empresariales. Los informes más sólidos documentarán tareas repetidas, en lugar de demostraciones seleccionadas.
Astra refuerza la interpretación de AGI si aprende flujos de trabajo desconocidos con pocos ejemplos y una corrección humana limitada. Debilita esa interpretación si los usuarios deben preparar extensamente los entornos a su alrededor.
Preste especial atención a la recuperación ante fallos. La adaptación general requiere más que encontrar una ruta exitosa. Un sistema debe detectar errores, revisar sus supuestos y evitar repetir acciones perjudiciales.
La rivalidad entre Anthropic y GPT se intensificará a medida que ambos proveedores publiquen resultados centrados en agentes. La respuesta de Claude no necesita superar todas las puntuaciones de Astra. Debe demostrar dónde su fiabilidad o eficiencia genera un trabajo finalizado de mayor calidad.
OpenAI afronta la misma carga. Un salto en ARC-AGI-3 sustenta una afirmación creíble sobre razonamiento adaptativo. No elimina la ventaja de Claude en Artificial Analysis ni los resultados individuales más débiles de Astra.
Por ello, el calendario revisado de Chollet se entiende mejor como una advertencia para actualizar las expectativas. Los sistemas de frontera están adquiriendo razonamiento interactivo más rápido de lo que anticipaba un destacado diseñador de benchmarks.
Eso no establece una fecha definitiva para la AGI. Acorta el periodo durante el cual las pruebas existentes pueden distinguir los sistemas de frontera del comportamiento humano adaptativo.
Los desarrolladores deberían responder evaluando los modelos frente a estados desconocidos, y no solo con prompts depurados. Los compradores empresariales deberían medir las correcciones y la supervisión junto con la precisión. Los trabajadores del conocimiento deberían preguntarse si un agente puede recuperarse cuando falla su primera interpretación.
La cuestión importante ya no es qué clasificación merece una confianza absoluta. Es qué evaluación se parece al trabajo que se está delegando y si sus condiciones coinciden con el despliegue previsto.
Actualmente, Astra posee el resultado más llamativo en tareas interactivas desconocidas. Claude Fable 5.1 tiene la puntuación más sólida en otro importante índice independiente. Epoch sitúa a Astra por delante en conjunto.
Todos esos hallazgos pueden ser ciertos. En conjunto, muestran que la competencia entre modelos de frontera ha superado una única cifra.
Elija un flujo de trabajo representativo, preserve la evidencia y vuelva a evaluarlo cuando lleguen resultados neutrales de ARC y evaluaciones de programación más amplias. Ese enfoque revelará más que otra discusión sobre si Astra ya merece la etiqueta de AGI.


