top of page

OpenAI afirma que dos ajustes de API triplicaron la puntuación de GPT-5.6 Sol en ARC-AGI-3

OpenAI cambió dos ajustes de API y casi triplicó la puntuación pública de GPT-5.6 Sol en ARC-AGI-3, del 13,3% al 38,3%. El relato de OpenAI se centra en el razonamiento conservado y la compactación, dos opciones de gestión del contexto disponibles mediante la Responses API. En conjunto, OpenAI afirma que también redujeron los tokens de salida en un factor de seis.

Ese resultado complica la interpretación habitual de un benchmark de IA. El modelo evaluado no recibió nuevo entrenamiento, un presupuesto de razonamiento mayor ni una herramienta específica para juegos. En cambio, OpenAI modificó el arnés de evaluación, es decir, la capa de software que transmite observaciones, acciones e historial de conversación entre el modelo y el benchmark.

Por tanto, el conflicto central no es GPT-5.6 Sol frente a otro modelo. Es un arnés genérico y estandarizado frente a un arnés de producción consciente del modelo. Uno favorece la comparabilidad y expone a los agentes a la misma interfaz básica. El otro conserva el estado que, según OpenAI, sus modelos de razonamiento necesitan para trabajos largos e interactivos.

Esta distinción importa porque ARC-AGI-3 no pide una única respuesta final. Presenta juegos desconocidos sin instrucciones en lenguaje natural. Los agentes deben inferir las reglas de cada juego, descubrir su objetivo, probar hipótesis, recordar fallos y adaptarse a lo largo de muchas acciones.

Un sistema que olvida su razonamiento después de cada movimiento se enfrenta a una tarea distinta de otro que puede conservar un plan en evolución. Del mismo modo, un agente que pierde sus observaciones más antiguas cuando se llena el contexto no experimenta el mismo juego que uno que recibe un resumen compacto.

El resultado de OpenAI no resuelve qué arnés produce la clasificación más justa. Sí muestra que el diseño del arnés puede cambiar la capacidad medida más que muchas actualizaciones de modelos. Esto presiona a los operadores de benchmarks, desarrolladores de modelos y equipos de evaluación empresarial para que documenten todo el sistema evaluado.

Cómo ocurrió el salto de puntuación según OpenAI

El modelo siguió siendo el mismo, mientras cambió su vía de memoria.

OpenAI publicó su análisis el 29 de julio de 2026, tras investigar resultados inesperadamente débiles de GPT-5.6 Sol. Su preocupación inicial era sencilla. Un modelo que había resuelto matemáticas difíciles y sesiones de juego largas parecía ineficaz en entornos bidimensionales de apariencia simple.

La discrepancia original incluía varias cifras de puntuación. OpenAI señaló que GPT-5.6 Sol había obtenido una puntuación global de ARC-AGI-3 del 7,8%, mientras que GPT-5.5 obtuvo un 0,4%. En el conjunto público de tareas utilizado para su comparación controlada, GPT-5.6 Sol obtuvo un 13,3% con el arnés oficial.

OpenAI reconstruyó entonces la evaluación mediante su Responses API. El arnés revisado conservaba el razonamiento entre acciones y sustituyó el truncamiento progresivo por compactación. Según el análisis de benchmark de la compañía, esa configuración elevó la puntuación del conjunto público al 38,3%.

La puntuación utiliza la Eficiencia Relativa de Acciones Humanas, o RHAE. Esta métrica compara el progreso exitoso con el número de acciones que necesitan los humanos. Un agente recibe menos crédito cuando resuelve una tarea de forma ineficiente, por lo que la exploración a ciegas y los errores repetidos tienen un coste medible.

OpenAI estimó que el evaluador humano medio obtuvo un 48% con la misma base. Esa estimación procedía de registros oficiales de juego, no de una afirmación de que cada humano obtenga un 48%. ARC Prize describe por separado el 100% como la puntuación por superar cada juego con la misma eficiencia que su referencia humana.

Por tanto, el resultado del 38,3% no cerró la brecha con los humanos. Sí acercó mucho más a GPT-5.6 Sol al evaluador medio estimado por OpenAI. Más importante aún, lo hizo sin una actualización del modelo.

El hallazgo sobre los tokens de salida añade otra inversión. Una memoria más larga podría parecer más costosa porque el agente transporta más contexto. Sin embargo, OpenAI informa que la configuración revisada utilizó seis veces menos tokens de salida. El modelo dedicó menos salida a reconstruir repetidamente reglas y planes que ya había desarrollado.

La repetición de un juego ofrece un ejemplo concreto. OpenAI mostró un entorno en el que ningún modelo de frontera en la clasificación correspondiente superó el primer nivel. Según se informa, su arnés revisado de Responses API permitió a GPT-5.6 Sol completar los seis niveles.

Los resultados verificados de ARC Prize aportan un contexto útil. Su tarjeta de puntuación de GPT-5.6 sitúa a Sol con razonamiento máximo y una puntuación semi-privada de ARC-AGI-3 del 7,78%. También registra un resultado del 87% en el juego público FT09, el primer juego público de ARC-AGI-3 ganado por un modelo.

Esas cifras describen conjuntos y perspectivas de evaluación diferentes, por lo que los lectores no deberían combinarlas en una sola cifra de rendimiento. La comparación controlada del 13,3% al 38,3% es la evidencia relevante para la afirmación de OpenAI sobre los dos ajustes.

Esta distinción es fácil de pasar por alto en la cobertura de benchmarks. Un experimento de conjunto público, una puntuación semi-privada verificada y un resultado en un juego responden a preguntas diferentes. El experimento de OpenAI pregunta específicamente cómo se comporta un modelo cuando el arnés conserva una mayor parte de su estado de trabajo.

La respuesta es llamativa, pero acotada. El razonamiento conservado y la compactación mejoraron este modelo en este conjunto público de tareas bajo la implementación de OpenAI. El resultado no establece una ganancia idéntica para todos los modelos, agentes, longitudes de contexto o cargas de trabajo de producción.

El arnés oficial también estaba evaluando el olvido

ARC-AGI-3 midió al agente y a la arquitectura de información que lo rodea.

ARC-AGI-3 difiere de los benchmarks estáticos en los que un modelo recibe una pregunta y devuelve una respuesta. Consiste en entornos interactivos que requieren percepción, planificación, acción y corrección repetidas. Su visión general del benchmark destaca la adquisición de objetivos, modelos de mundo adaptables, planificación a largo plazo y aprendizaje impulsado por la experiencia.

El benchmark no contiene instrucciones en lenguaje natural que expliquen cada juego. Un agente recibe una representación del fotograma actual y un conjunto de acciones posibles. Debe determinar qué objetos importan, cómo cambian las acciones el entorno y qué cuenta como progreso.

Esta configuración hace que la memoria forme parte de la capacidad evaluada. Una hipótesis útil puede surgir después de varias acciones fallidas. Una observación posterior puede confirmar o rechazar esa hipótesis. Si el arnés elimina el razonamiento que conecta esos eventos, el agente debe reconstruir su interpretación a partir de un registro más limitado.

OpenAI descubrió que el arnés oficial descartaba el razonamiento privado después de cada acción de juego. El modelo todavía podía ver movimientos anteriores y notas breves. Sin embargo, no podía acceder a los planes, descubrimientos o supuestos que produjeron esos movimientos.

El arnés también utilizaba truncamiento progresivo. Una vez que la conversación superaba los 175.000 caracteres, eliminaba los mensajes más antiguos. Por tanto, las ejecuciones largas podían borrar observaciones y acciones tempranas, incluso cuando esos eventos seguían siendo relevantes para el nivel actual.

Estos comportamientos eran consecuencias intencionadas de un diseño genérico, no evidencia de un benchmark defectuoso. ARC Prize favorece un arnés relativamente simple porque expone las limitaciones de los modelos y permite la comparación entre proveedores. Los despliegues comerciales suelen utilizar funciones específicas de cada proveedor que no se trasladan limpiamente entre APIs.

Esto crea el principal antagonismo del artículo: evaluación estandarizada frente a evaluación alineada con producción.

Un arnés estandarizado pregunta qué modelo rinde mejor mediante una interfaz común. Este enfoque limita el trato especial y reduce la posibilidad de que la optimización privada de un proveedor domine la comparación.

Un arnés alineado con producción pregunta hasta qué punto rinde bien un modelo cuando se despliega según las recomendaciones de su creador. Este enfoque se parece a las aplicaciones reales, pero puede difuminar la frontera entre la capacidad del modelo y la ingeniería de sistemas.

Ninguna de las dos preguntas carece de sentido. Simplemente producen mediciones diferentes.

La preocupación surge cuando una puntuación de clasificación se presenta como una propiedad del modelo por sí solo. Si un arnés elimina repetidamente un estado que otro modelo espera conservar, la prueba también mide la compatibilidad entre el entrenamiento del modelo y la infraestructura de evaluación.

ARC Prize ha reconocido lo difíciles que siguen siendo los entornos. Su informe técnico afirma que los humanos resolvieron el 100% de los entornos evaluados, mientras que los sistemas de frontera obtuvieron menos del 1% en marzo de 2026. El benchmark fue diseñado para exponer una amplia brecha en eficiencia adaptativa.

Las puntuaciones posteriores de GPT-5.6 Sol muestran progreso, especialmente en juegos públicos individuales. Sin embargo, un resultado del 38,3% en el conjunto público aún deja un margen considerable antes de alcanzar la eficiencia humana. También procede del propio arnés y análisis del desarrollador del modelo.

La lección no es que ARC-AGI-3 se haya vuelto fácil. Es que un benchmark interactivo puede evaluar accidentalmente una amnesia artificial junto con la planificación y la exploración.

Este problema se extiende más allá de los juegos. Los agentes de programación deben recordar decisiones arquitectónicas entre llamadas a herramientas. Los agentes de investigación deben retener qué fuentes respaldan o contradicen una afirmación. Los sistemas de atención al cliente deben conservar las restricciones introducidas al principio de una conversación.

Un equipo empresarial que evalúe esos sistemas descartando repetidamente su estado interno puede subestimar un rendimiento útil. Un equipo que permita una optimización específica del proveedor sin restricciones puede producir resultados difíciles de comparar o reproducir.

La mejor respuesta es una divulgación más completa. Un informe de benchmark debería identificar la versión del modelo, el esfuerzo de razonamiento, la política de contexto, los elementos de respuesta conservados, el comportamiento de compactación, el prompt, las herramientas, el presupuesto de acciones y el método de puntuación. Sin esa información, una puntuación carece de contexto operativo esencial.

El razonamiento conservado evita que el agente empiece de cero

Conservar el razonamiento dio a GPT-5.6 Sol continuidad entre acciones, reduciendo el trabajo de interpretación repetido.

Los modelos de razonamiento generan elementos internos de razonamiento antes de producir texto visible o llamadas a herramientas. Estos elementos no son lo mismo que una explicación dirigida al usuario. Forman parte del estado de trabajo del modelo durante una interacción de varios pasos.

En el arnés oficial examinado por OpenAI, cada acción de juego terminaba efectivamente con ese estado. La siguiente solicitud incluía movimientos anteriores y notas breves, pero descartaba el razonamiento que los conectaba. GPT-5.6 Sol se enfrentaba repetidamente a la misma carga interpretativa.

Imaginemos un agente que explora una cuadrícula con objetos de colores. Prueba si un color marca obstáculos y después descubre que ese mismo color cambia tras un movimiento exitoso. Esa observación podría invalidar su primera teoría y establecer una nueva regla.

Un registro de movimientos anota dónde hizo clic el agente. No necesariamente conserva por qué hizo clic, qué alternativas descartó ni qué implicaba el fotograma resultante. Esos detalles pueden determinar si la siguiente acción avanza una estrategia o repite un error anterior.

OpenAI utilizó la Responses API y pasó el identificador de la respuesta anterior entre turnos. Su actual guía de modelos explica que GPT-5.6 puede reutilizar elementos de razonamiento disponibles entre turnos. Los desarrolladores también pueden controlar cuánto razonamiento previo sigue siendo relevante mediante ajustes de contexto de razonamiento.

Según OpenAI, el razonamiento conservado cambió el comportamiento de GPT-5.6 Sol de dos maneras. El modelo dedicó menos tiempo a pensar antes de cada acción y utilizó estrategias más coherentes durante ejecuciones más largas. Ya no necesitaba reinterpretar el juego desde el principio después de cada movimiento.

Eso explica cómo el uso de tokens pudo disminuir mientras crecía el estado retenido. Los tokens de salida incluyen el razonamiento y las respuestas que el modelo genera de nuevo. Si los hallazgos previos siguen disponibles, el modelo puede evitar producir otra reconstrucción extensa.

La distinción se parece a la diferencia entre que un equipo de proyecto conserve registros de decisiones y que reciba solo una lista de tareas completadas. La lista muestra lo que ocurrió. No conserva las opciones descartadas, las restricciones ni las pruebas que dieron forma al plan actual.

Para los trabajadores del conocimiento, el mismo problema aparece cuando un asistente de IA gestiona una investigación larga. Cada documento recuperado modifica la teoría de trabajo. Si el sistema conserva solo enlaces y respuestas breves, las conclusiones posteriores pueden perder el razonamiento que hizo relevantes esas fuentes.

Aquí es donde una base de conocimiento consultable externa puede complementar el contexto del modelo. Los registros duraderos de las fuentes deben seguir siendo examinables incluso cuando un agente compacte su estado de trabajo temporal.

El razonamiento retenido también introduce compensaciones. El razonamiento antiguo puede quedar obsoleto después de que cambie la tarea. Una teoría inicial incorrecta puede influir en pasos posteriores si el sistema nunca la marca como descartada. Más memoria no equivale automáticamente a mejor memoria.

La guía de la API de OpenAI refleja ese problema. Permite a los desarrolladores conservar el razonamiento entre todos los turnos cuando los objetivos se mantienen estables, o centrarse en el turno actual cuando el razonamiento anterior ha perdido relevancia. Esa elección debe responder al flujo de trabajo, no a una regla general.

Los juegos de ARC-AGI-3 ofrecen un entorno favorable para la continuidad. El objetivo y el entorno siguen relacionados entre las acciones, por lo que las hipótesis anteriores suelen importar. Una conversación de soporte que cambia de tema de forma abrupta presenta un problema distinto de gestión del contexto.

Las políticas de seguridad y privacidad también afectan a la implementación. Algunas organizaciones no pueden almacenar el historial de respuestas indefinidamente. Otras usan configuraciones sin estado o de retención cero. Esos equipos deben gestionar cuidadosamente los elementos de razonamiento cifrados y otros objetos de respuesta necesarios para la continuidad.

Por tanto, retener el razonamiento describe un comportamiento del sistema, no un permiso para exponer contenido privado de cadena de pensamiento. Las aplicaciones deben conservar los elementos de respuesta compatibles mediante la API y, al mismo tiempo, presentar a los usuarios explicaciones concisas y apropiadas.

El experimento de OpenAI también plantea una pregunta práctica de evaluación. Si un agente falla después de treinta pasos, los revisores deberían examinar si su plan era erróneo o si el arnés eliminó el estado necesario para continuar ese plan.

Esos modos de fallo requieren correcciones diferentes. Un fallo de razonamiento exige un modelo, prompt o estrategia mejores. Un fallo de gestión del estado exige una infraestructura distinta. Tratar ambos como inteligencia del modelo oculta dónde debe concentrarse el esfuerzo de ingeniería.

La compactación conserva el pasado sin cargarlo todo

La compactación sustituyó la eliminación indiscriminada por una representación más breve del historial que conservaba lo importante.

Todo agente de larga duración termina enfrentándose a un límite de contexto o económico. Conservar cada observación, resultado de herramienta y pensamiento intermedio puede hacer que las solicitudes posteriores sean más lentas y menos enfocadas. Retener el razonamiento por sí solo no resuelve el crecimiento ilimitado del contexto.

El arnés oficial de ARC-AGI-3 gestionaba ese crecimiento mediante truncamiento progresivo. Cuando el historial superaba su umbral, eliminaba el contenido más antiguo. Esa política es predecible y neutral respecto al proveedor, pero presupone que la información antigua importa menos por ser antigua.

Los juegos interactivos contradicen esa premisa. Una acción inicial puede revelar el objetivo. Una pista vista al comienzo puede explicar un símbolo encontrado mucho después. Eliminar contenido cronológicamente puede borrar conocimiento fundamental mientras se conservan fotogramas recientes pero repetitivos.

La compactación utiliza una política distinta. Condensa el contexto anterior en una representación más pequeña que preserva el estado relevante. El agente puede continuar con un contexto manejable sin cargar con cada token original.

OpenAI afirma que su implementación de ARC utilizó un límite de 175.000 tokens para la compactación. El arnés oficial empleó 175.000 caracteres para el truncamiento. OpenAI sostiene que estos umbrales eran en líneas generales comparables porque las cuadrículas de acciones se tokenizaban aproximadamente a un carácter por token.

Ese detalle de implementación importa. Si los límites diferían de manera sustancial, la mejora de puntuación podría reflejar un contexto efectivo mayor en lugar de una mejor estrategia de memoria. La comparación de OpenAI intenta mantener el umbral cercano mientras cambia la forma en que sobrevive la información antigua.

La documentación de compactación de la empresa describe la compactación como una forma de reducir el tamaño del contexto durante flujos de trabajo largos de la Responses API. El estado compactado resultante puede permitir la continuidad sin exigir que las aplicaciones reenvíen una transcripción ilimitada.

La compactación no es almacenamiento sin pérdidas. Un resumen puede omitir detalles, reducir la incertidumbre o conservar una interpretación incorrecta. Su valor depende de seleccionar la información que necesitarán las acciones futuras.

ARC-AGI-3 plantea una prueba exigente para esa selección. El agente debe conservar reglas descubiertas, objetivos, significados de objetos, hipótesis fallidas, progreso de nivel y acciones previstas. Las cuadrículas repetidas y el razonamiento redundante pueden recibir menos atención.

OpenAI informa de que el arnés compactado conservó el aprendizaje durante ejecuciones más largas y generó menos tokens de salida. Su animación comparativa mostró que el agente revisado razonaba menos por acción y avanzaba por los juegos con mayor rapidez.

La reducción de seis veces en tokens de salida es operativamente importante incluso sin hablar de precios monetarios. Un menor volumen de salida puede reducir la latencia y liberar capacidad para más evaluaciones. También puede facilitar la inspección de los rastros del agente, siempre que el estado compactado siga siendo suficientemente informativo.

Sin embargo, los lectores deben tratar la cifra como específica de la carga de trabajo. ARC-AGI-3 produce cuadrículas de texto repetitivas y muchas acciones secuenciales. Una revisión legal, un flujo de trabajo médico o un análisis financiero pueden contener detalles que se resistan a una resumición agresiva.

Los equipos de evaluación deberían probar la calidad de la compactación por separado del éxito final de la tarea. Pueden comparar las restricciones retenidas, la consistencia factual, la recuperación tras interrupciones y la capacidad del agente para explicar qué pruebas dieron forma a una decisión.

Una prueba útil introduce pronto un hecho crítico, llena el contexto con actividad posterior y luego comprueba si el agente aplica correctamente ese hecho. Otra prueba cambia un requisito a mitad de camino y verifica que la compactación preserve la revisión en lugar de la instrucción original.

Estas pruebas exponen una compensación central. El truncamiento progresivo ofrece una pérdida transparente porque los revisores saben exactamente qué mensajes desaparecieron. La compactación ofrece continuidad selectiva, pero sus omisiones pueden ser más difíciles de detectar.

Para los agentes de producción, la continuidad selectiva suele ajustarse mejor a la tarea. Los humanos no recuerdan cada fotograma visual ni cada frase. Mantienen un modelo de trabajo que prioriza objetivos, restricciones, descubrimientos y preguntas sin resolver.

Esa analogía no debe excusar fallos ocultos. Los desarrolladores necesitan rastros, herramientas de repetición y evaluaciones controladas para comprobar si la compactación conservó el estado correcto. De lo contrario, una respuesta final segura puede ocultar una restricción inicial ausente.

Por tanto, el hallazgo de OpenAI no consiste tanto en ampliar una ventana de contexto. Consiste en cambiar qué sobrevive cuando la ventana no puede contenerlo todo.

Lo que la puntuación triplicada no demuestra

Un experimento con un conjunto público ejecutado por el desarrollador no puede determinar la configuración de referencia universal más justa.

La evidencia de OpenAI respalda una conclusión limitada y valiosa. GPT-5.6 Sol obtuvo mejores resultados en la implementación de ARC-AGI-3 de OpenAI cuando se retuvo el razonamiento y la compactación sustituyó al truncamiento progresivo.

No demuestra que el arnés oficial sea inválido. La configuración oficial persigue un objetivo distinto: exponer el comportamiento del modelo mediante una interfaz genérica que los participantes del benchmark puedan reproducir entre proveedores.

Las funciones específicas de cada proveedor complican una comparación equitativa. OpenAI puede retener sus elementos nativos de razonamiento mediante la Responses API. Otro proveedor puede representar el estado interno de otra manera, exponer controles de continuación diferentes o depender de otra arquitectura de memoria.

Permitir que cada empresa optimice un arnés privado puede convertir un benchmark de modelos en una competición de sistemas. Ese formato aún puede medir algo útil, especialmente para compradores que seleccionan sistemas de agentes completos. Ya no aísla el comportamiento del modelo con la misma claridad.

El resultado también procede del experimento de OpenAI con el conjunto de tareas público. Los juegos públicos están disponibles para su inspección y desarrollo, lo que crea más oportunidades para ajustar el arnés. Los resultados semiprivados proporcionan una comprobación más sólida frente a ajustes directos específicos de cada tarea.

La clasificación verificada de ARC Prize sigue situando a GPT-5.6 Sol en el 7,78 % en el conjunto semiprivado con razonamiento máximo. Esa puntuación supera a otras variantes de la familia GPT-5.6 que figuran allí, pero sigue estando muy por debajo de la finalización y eficiencia humanas.

La diferencia entre el 38,3 % de la comparación pública de OpenAI y el 7,78 % de la evaluación semiprivada verificada requiere una interpretación cuidadosa. No contradice automáticamente el hallazgo sobre el arnés porque los conjuntos de tareas son distintos. Sí muestra por qué una mejora en un conjunto público no debe convertirse en una afirmación general sobre aprendizaje de juegos similar al humano.

La estimación de OpenAI del 48 % para un evaluador humano promedio aporta contexto, pero no equivalencia. Los humanos y los modelos pueden fallar de forma distinta, usar patrones de acción diferentes y responder de manera diferente a interfaces desconocidas. RHAE condensa esos comportamientos en una puntuación.

El experimento también combina dos cambios. El razonamiento retenido y la compactación estaban activos en la comparación principal. OpenAI describe el efecto conductual de cada uno, pero las cifras principales publicadas no aíslan por completo la contribución de cada configuración.

Una ablación más completa informaría de cuatro configuraciones: ninguna de las dos opciones, solo razonamiento retenido, solo compactación y ambas juntas. Las ejecuciones repetidas ayudarían a cuantificar la varianza, especialmente cuando la exploración del agente puede seguir rutas diferentes.

La comparación de tokens de salida merece el mismo escrutinio. Menos tokens indican una mayor eficiencia en este arnés. No revelan la latencia total, el procesamiento de tokens de entrada, la sobrecarga de compactación ni el trabajo de ingeniería necesario para mantener el estado.

Los operadores de benchmarks afrontan ahora presión desde ambas direcciones. Si mantienen arneses genéricos, deberían explicar que los resultados de la clasificación pueden infravalorar las configuraciones de producción. Si aceptan arneses optimizados, deberían revelar qué capacidades proceden del modelo y cuáles del código circundante.

Los proveedores de modelos tienen una responsabilidad paralela. Deberían publicar configuraciones reproducibles, prompts, umbrales de contexto, presupuestos de acciones y cuadros de puntuación. Una afirmación sobre configuraciones resulta más útil cuando equipos independientes pueden repetirla.

Los compradores empresariales deberían evitar elegir entre pruebas genéricas y optimizadas. Necesitan ambas.

Una prueba genérica muestra cómo se comportan los modelos candidatos bajo restricciones comunes. Una prueba representativa de producción muestra si el sistema completo tiene éxito en el flujo de trabajo real del comprador. La diferencia entre esos resultados mide la sensibilidad a la integración.

Esa sensibilidad es en sí misma un riesgo empresarial. Un modelo que funciona bien solo mediante una pila especializada de gestión de estado puede ser más difícil de migrar. Un arnés genérico que elimina capacidades esenciales puede llevar a los equipos a elegir un modelo más débil por la razón equivocada.

La pregunta relevante no es si el benchmark o OpenAI tiene razón. La pregunta es qué límite del sistema describe cada puntuación.

Tres señales que vigilar tras el resultado de ARC-AGI-3 de OpenAI

La replicación independiente, las pruebas semiprivadas y una mejor documentación de los arneses determinarán si el resultado cambia las prácticas de evaluación.

La primera señal es una reproducción independiente de la mejora del 13,3% al 38,3%. Una réplica creíble debería utilizar los mismos juegos públicos, esfuerzo de razonamiento, límites de acciones, umbrales de contexto y método de puntuación. También debería informar de la variación entre ejecuciones.

La replicación reforzaría la afirmación de OpenAI de que la gestión del estado explica gran parte de la brecha de rendimiento observada. Una mejora sustancialmente menor sugeriría que detalles de implementación no documentados, el prompting o las decisiones del evaluador contribuyeron más que los dos ajustes mencionados.

La segunda señal es una evaluación semiprivada que utilice razonamiento retenido y compactación. Las tareas públicas ayudan a los desarrolladores a diagnosticar el comportamiento, pero los entornos no vistos o restringidos ofrecen una prueba más sólida de generalización. Mejoras similares en ellos demostrarían que la mejora del harness se transfiere más allá de los juegos públicos conocidos.

Una mejora semiprivada pequeña debilitaría la interpretación amplia. Podría indicar que una mejor memoria ayuda al modelo a ejecutar estrategias conocidas sin resolver el desafío más profundo de adquirir nuevos objetivos y reglas.

La tercera señal es un cambio en los estándares de divulgación de los benchmarks. Los futuros rankings deberían publicar las políticas de gestión de contexto junto a las puntuaciones. Los informes deberían indicar si los elementos de razonamiento se conservaron entre acciones, cómo se eliminó o compactó el historial antiguo y qué funciones específicas de cada proveedor se habilitaron.

Esta información permitiría a los lectores comparar dos perspectivas útiles. Una mide los modelos mediante una interfaz estandarizada. La otra mide sistemas completos configurados de acuerdo con las indicaciones del proveedor.

Los desarrolladores deberían aplicar la misma disciplina a sus propias evaluaciones. Conserven la línea de base antes de cambiar la configuración. Después, prueben por separado el razonamiento retenido, la compactación y su combinación en cargas de trabajo representativas.

Midan más que el éxito final. Hagan seguimiento de los tokens de salida, el crecimiento de la entrada, la latencia, las acciones repetidas, la retención de restricciones, la recuperación de hipótesis fallidas y los errores causados por memoria obsoleta. Una puntuación más alta puede ocultar nuevos modos de fallo si la evaluación solo observa el resultado final.

Los equipos también deberían examinar dónde ayuda la continuidad. Las tareas largas de programación, la investigación interactiva, los agentes de navegador y el análisis en varias etapas suelen depender de descubrimientos acumulados. Las solicitudes breves de clasificación o extracción pueden beneficiarse poco del razonamiento persistente.

El hallazgo de OpenAI ofrece una advertencia clara: una evaluación de agentes puede penalizar al modelo por políticas de memoria impuestas por el evaluador. También puede favorecer al modelo mediante una infraestructura que los competidores no pueden reproducir.

El siguiente paso útil no es declarar correcto a ninguno de los dos harnesses. Es ejecutar ambos, etiquetarlos con precisión y publicar suficientes detalles para que otros entiendan la diferencia.

Para cualquiera que esté creando un agente de larga duración, la pregunta inmediata es práctica: ¿su sistema conserva los objetivos, las evidencias y las hipótesis descartadas que necesita la siguiente acción? Pruebe esa continuidad antes de culpar al modelo y vuelva a probarla después de cada cambio en la compactación o la política de contexto.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

​Añade una barra de búsqueda a tu cerebro

Solo tienes que preguntarle a remio

Recuérdalo todo

No organices nada

bottom of page