Claude Opus 4.6 pierde 65 puntos a medida que las tareas de MineExplorer se vuelven más complejas
- Sophie Larsen

- hace 1 día
- 15 min de lectura
Claude Opus 4.6 de Anthropic lideró MineExplorer, aunque su tasa de éxito cayó del 77% en tareas de un salto al 12% en tareas de cuatro saltos. El modelo completó solo el 41% del benchmark en total, según resultados publicados por el equipo LongCat de Meituan.
Ese desplome es la verdadera historia de Anthropic MineExplorer. Claude rindió bien cuando el objetivo requería un paso directo. Tuvo dificultades cuando el éxito dependía de descubrir y coordinar varios requisitos previos no explicitados dentro de un mundo cambiante.
MineExplorer mide esta brecha mediante 813 escenarios de Minecraft verificados por humanos y de hasta tres minutos de duración. Evalúa 18 modelos multimodales de ocho familias de modelos, incluidos sistemas Claude, GPT y Gemini. Los autores del benchmark han publicado su código, conjunto de datos, flujo de trabajo de generación de tareas y entorno de evaluación.
El resultado cuestiona una suposición habitual sobre los agentes multimodales. Reconocer una amenaza, un objeto o un recurso no significa que un modelo pueda mantener un plan útil mientras el entorno cambia. MineExplorer convierte esa distinción en una curva de fallos medible.
Los benchmarks anteriores de Minecraft examinaban la planificación, el seguimiento de instrucciones, la construcción o el conocimiento del juego. En cambio, MineExplorer elimina muchas tareas que dependen en gran medida de reglas específicas de Minecraft. Su objetivo declarado es más amplio: la exploración que combina percepción, razonamiento y acción a lo largo de una trayectoria sostenida.
El benchmark sigue siendo un preprint, y Minecraft no puede representar todos los entornos físicos. Sin embargo, los hallazgos ejercen una presión inmediata sobre las afirmaciones de que una visión más potente y un contexto más largo producen automáticamente agentes autónomos fiables.
MineExplorer convierte tres minutos en una prueba seria para agentes
MineExplorer desplaza el objetivo de evaluación de reconocer una escena a sobrevivir una secuencia de decisiones interdependientes.
El equipo LongCat presentó MineExplorer en un preprint de mayo de 2026. Una segunda versión llegó el 12 de junio, mientras que el equipo técnico de Meituan publicó un resumen detallado de resultados en julio.
Cada episodio puede ejecutarse durante 1.800 pasos del entorno. Un paso representa 0,1 segundos, lo que produce tres minutos de interacción continua. El mundo se actualiza tras cada acción, por lo que el modelo debe reconsiderar repetidamente lo que ve y qué debería hacer después.
Esa duración parece corta según estándares humanos. Es larga para un agente que debe observar imágenes, mantener el estado, seleccionar acciones y recuperarse de errores a lo largo de cientos de interacciones.
Las tareas se dividen por número de saltos. Una tarea de un salto presenta un objetivo que no requiere que el agente infiera una subtarea no explicitada. Los escenarios de dos a cuatro saltos añaden requisitos previos ocultos que deben descubrirse a través del entorno.
Consideremos un agente al que se le indica llegar a una ubicación protegida. La ruta inmediata podría estar bloqueada, la herramienta necesaria podría encontrarse en otro lugar y las entidades hostiles podrían restringir el movimiento. La instrucción nombra el destino, pero no todas las acciones necesarias para alcanzarlo.
MineExplorer representa cada tarea compuesta con un estado inicial, una instrucción en lenguaje natural, un grafo de dependencias e hitos basados en reglas. El grafo de dependencias registra la estructura oculta de la tarea. El modelo nunca recibe ese grafo completo.
Los hitos permiten al evaluador medir el progreso parcial sin pedir a otro modelo de lenguaje que juzgue toda la trayectoria. Un hito puede detectar si el agente encontró un objeto, entró en una zona o completó una acción intermedia necesaria.
Los autores compararon estos resultados automatizados con evaluaciones humanas de trayectorias de Claude Opus 4.6. Los conjuntos de hitos completados recibieron puntuaciones humanas medias cercanas a cuatro en una escala de cinco puntos. Los conjuntos totalmente fallidos se mantuvieron por debajo de tres.
Esa concordancia no hace que el evaluador sea perfecto. Sí aporta evidencia de que completar hitos captura un progreso significativo, en lugar de eventos arbitrarios del juego.
El equipo también intentó separar la exploración de la pericia memorizada de Minecraft. Las tareas atómicas candidatas se examinaron por su dependencia de convenciones específicas del juego. Se eliminaron las tareas dominadas por conocimientos especializados.
Esta decisión de diseño importa porque un agente puede fallar un objetivo de Minecraft por dos motivos muy distintos. Puede carecer de una receta de la wiki del juego o no lograr conectar la evidencia visible con un plan viable.
MineExplorer intenta poner el énfasis en el segundo problema. Sus 14 categorías de capacidades abarcan percepción, razonamiento y acción. Incluyen percepción espacial y temporal, seguimiento de entidades, conciencia de recursos, razonamiento causal, movimiento, recolección, colocación, fabricación y combate.
Los 813 ejemplos publicados abarcan dependencias de uno a cuatro saltos. El conjunto de datos abierto incluye texto de las tareas, comandos de configuración de escenas, tareas atómicas seleccionadas, hitos, grafos de dependencias y notas de diseño.
Esto es más que un conjunto estático de preguntas. Los investigadores pueden examinar cómo se construyeron las escenas, repetir evaluaciones, crear variantes más difíciles o utilizar el entorno para entrenamiento.
Esta apertura da al benchmark la oportunidad de influir en el desarrollo de agentes. También hace que sus supuestos sean más fáciles de cuestionar, una característica importante para un benchmark que formula afirmaciones amplias sobre la exploración.
Por qué el liderazgo de Anthropic MineExplorer sigue siendo una advertencia
Claude Opus 4.6 ganó la comparación, pero su ventaja revela lo lejos que sigue estando cada modelo evaluado de un comportamiento fiable a largo plazo.
El benchmark evaluó 18 modelos multimodales avanzados de ocho familias. Claude Opus 4.6 logró la mayor tasa global de éxito en tareas, alcanzando el 41%.
Un resultado del 41% puede parecer respetable si se observa únicamente como una posición en la clasificación. Parece mucho más débil cuando se separa por profundidad de tarea.
Claude Opus 4.6 completó el 77% de las tareas de un salto. Su tasa de éxito cayó al 12% en las tareas de cuatro saltos. El descenso de 65 puntos muestra que las dependencias adicionales hacen más que añadir un poco de dificultad.
Cada requisito previo oculto crea otra oportunidad para perder el plan. El modelo debe detectar evidencia relevante, inferir un objetivo intermedio, ejecutarlo correctamente y preservar su relación con el objetivo final.
Un error temprano puede propagarse durante el episodio. Pasar de largo un recurso necesario impide la siguiente acción. Elegir la ruta equivocada consume pasos y cambia la vista del agente. Una observación posterior podría entonces interpretarse utilizando un estado interno que ya es incorrecto.
Por eso el resultado de Anthropic MineExplorer ejerce presión sobre más que Anthropic. Claude fue el modelo más fuerte de la prueba. Por tanto, su curva de fallos actúa como un límite superior para esta configuración concreta, no como evidencia de una debilidad aislada de Claude.
Los hallazgos también complican la narrativa estándar sobre el escalado de modelos. El artículo informa de que los modelos más grandes y los modos de razonamiento dedicados no mejoraron el rendimiento de manera consistente.
Más parámetros pueden fortalecer la percepción o el razonamiento ante un prompt delimitado. Un entorno dinámico exige otra capacidad: mantener una alineación útil entre la memoria, las observaciones actuales y los objetivos cambiantes.
Un contexto más largo no garantiza esa alineación. Puede conservar imágenes antiguas que ya no describen la escena actual. Esas observaciones pueden competir con evidencia más reciente en vez de ayudar al modelo.
Los autores probaron esta cuestión aumentando el número de fotogramas visuales históricos. El rendimiento terminó por disminuir a medida que las observaciones obsoletas interferían con la comprensión del modelo sobre el estado actual.
También examinaron si los modelos simplemente necesitaban más tiempo. Los agentes sin éxito siguieron fallando incluso cuando los episodios permitían hasta 1.800 pasos. Las tareas resolubles tendían a completarse antes, mientras que las interacciones adicionales no rescataron muchas trayectorias fallidas.
Estos resultados debilitan dos soluciones fáciles. Dar a un agente más contexto no equivale a darle mejor memoria. Darle más acciones no equivale a darle un mejor plan.
La presión se extiende a los desarrolladores que crean agentes para usar computadoras, sistemas de robótica y herramientas de investigación automatizada. Esos productos operan fuera de una captura de pantalla fija. Sus entornos cambian en respuesta tanto al agente como a eventos externos.
Un agente de navegador puede necesitar localizar un registro, cambiar un filtro, interpretar la página actualizada y verificar el envío final. Un robot de almacén puede necesitar redirigirse tras descubrir que un pasillo está bloqueado. Un agente de investigación puede necesitar revisar su búsqueda después de descubrir evidencia contradictoria.
En cada caso, el objetivo visible oculta decisiones de requisitos previos. Un modelo puede realizar correctamente cada acción aislada y aun así fracasar en el trabajo completo.
MineExplorer no demuestra que las tasas de fallo se transfieran directamente a navegadores o robots. Muestra que el éxito en pruebas multimodales cortas ofrece garantías limitadas una vez que se acumulan las dependencias ocultas.
Esta distinción debería afectar las decisiones de compra y despliegue. Los compradores deberían preguntar cómo se comporta un agente en flujos de trabajo completados, no solo si su modelo reconoce pantallas o genera acciones siguientes plausibles.
El problema real es la navegación, no el reconocimiento visual
Casi el 60% de los fallos de Claude Opus 4.6 se atribuyeron a la navegación, lo que convierte al movimiento con estado en el cuello de botella más claro del benchmark.
El análisis de fallos del equipo LongCat separa los errores de navegación de problemas como la interacción con objetos o el razonamiento de tareas. La navegación representó casi el 60% de los fallos analizados.
Esa cifra no significa que el modelo simplemente careciera de indicaciones. La navegación en un mundo abierto combina memoria espacial, reconocimiento visual, control de acciones y gestión de objetivos.
El agente debe saber dónde está, recordar dónde ha estado y determinar si el movimiento produjo el resultado previsto. También debe decidir cuándo abandonar una ruta o explorar una alternativa.
Una prueba de visión estática aísla solo parte de ese ciclo. El modelo ve una imagen y responde a una pregunta. La escena no cambia a causa de su respuesta, y una respuesta equivocada no distorsiona la siguiente observación.
Minecraft crea retroalimentación. Si el agente gira en la dirección equivocada, su siguiente imagen contiene evidencia diferente. Si queda atascado contra un obstáculo, los comandos de movimiento repetidos consumen tiempo sin avanzar en la tarea.
El modelo entonces debe diagnosticar si falló la ruta, la acción o su plan original. Esta distinción es difícil cuando las observaciones llegan como fotogramas separados, en lugar de como un mapa interno estable.
Las puntuaciones de capacidades de MineExplorer refuerzan esta interpretación. Claude Opus 4.6 recibió una puntuación de percepción de 61,91 y una puntuación de razonamiento de 54,71. En la mayoría de los modelos evaluados, la percepción superó a la acción, mientras que la acción superó al razonamiento.
Los modelos podían identificar a menudo detalles relevantes. Tenían más dificultades para convertir esos detalles en una estrategia coordinada que sobreviviera al cambio del entorno.
Esto crea una inversión importante en la forma en que suele presentarse el progreso multimodal. Una mejor comprensión de imágenes amplía lo que un agente puede detectar, pero también expone la debilidad del sistema de planificación que consume esas observaciones.
Un modelo que detecta diez objetos relevantes todavía debe decidir cuál importa ahora. Debe conectar esa elección con el objetivo final y conservar la conexión después de que cambie el punto de vista.
El benchmark se basa en el enfoque ReAct, que intercala razonamiento con acciones y nuevas observaciones. El marco ReAct original fue diseñado para permitir que los modelos revisaran su razonamiento mediante retroalimentación del entorno.
MineExplorer muestra dónde puede romperse ese ciclo en trayectorias más largas. El razonamiento se desconecta del estado actual, las acciones dejan de servir al objetivo original o las nuevas observaciones no activan una revisión necesaria.
La navegación amplifica los tres problemas. Un agente mal ubicado ve evidencia equivocada, construye una estimación errónea del estado y elige nuevas acciones desde una posición degradada.
Este es un problema más difícil que generar una cadena de razonamiento más larga. Un agente necesita una representación estructurada de entidades persistentes, ubicaciones, hitos completados, rutas fallidas y dependencias sin resolver.
El historial visual sin procesar es un sustituto débil. Almacena lo que vio la cámara, no lo que el agente debería recordar.
La misma distinción se aplica a los agentes empresariales. Una transcripción de cada pantalla anterior no produce automáticamente un estado fiable del flujo de trabajo. El agente debe saber qué formulario se envió, qué filtro sigue activo y qué requisito continúa sin resolverse.
Para los sistemas incorporados, la navegación se convierte tanto en una prueba física como cognitiva. El modelo debe moverse por el espacio mientras conserva la estructura lógica de la tarea.
Por tanto, la proporción de fallos del 60% en MineExplorer apunta a trabajo a nivel de sistema. Mejores controladores locales, mapas explícitos, memoria causal, supervisión del progreso y políticas de recuperación pueden importar tanto como un modelo base más potente.
Qué mide el benchmark y qué no mide
MineExplorer ofrece una prueba de estrés útil, pero sus resultados siguen limitados a un mundo simulado y a una distribución de tareas definida por investigadores.
El argumento escéptico más sólido se refiere a la validez externa. Minecraft ofrece un mundo 3D dinámico con reglas coherentes, pero no reproduce todas las dificultades presentes en hogares, fábricas, oficinas o espacios públicos.
Los robots reales enfrentan física incierta, ruido de sensores, daños físicos y restricciones de seguridad. Los agentes de uso informático encuentran estados ocultos de las aplicaciones, barreras de autenticación, ventanas emergentes e interfaces cambiantes.
Minecraft elimina muchas de estas complicaciones. Sus objetos son discretos, su física es repetible y su entorno puede reiniciarse de forma exacta.
Ese control también es una ventaja. Los investigadores pueden comparar modelos en condiciones idénticas y rastrear fallos sin poner en riesgo equipos ni usuarios.
La clave es tratar MineExplorer como un instrumento de diagnóstico, no como una puntuación universal de inteligencia incorporada. Un resultado del 41% no significa que Claude completaría el 41% de flujos de trabajo reales no relacionados.
El filtrado de conocimiento del benchmark también requiere escrutinio. Los autores utilizan juicios de modelos de lenguaje para clasificar si las tareas atómicas dependen principalmente de conocimiento general o de convenciones específicas de Minecraft.
Ese proceso reduce factores de confusión evidentes relacionados con el conocimiento del juego. No puede garantizar que todas las tareas retenidas estén libres de efectos de familiaridad.
Los modelos entrenados con vídeos, guías o debates sobre partidas de Minecraft aún pueden reconocer distribuciones y comportamientos comunes. Distintas familias de modelos pueden haber encontrado cantidades diferentes de ese material.
El propio benchmark sigue siendo un trabajo en curso, según su registro en arXiv. Futuras revisiones podrían modificar tareas, prompts, controladores o procedimientos de evaluación.
El diseño del controlador es especialmente importante. Un modelo multimodal rara vez manipula un juego solo mediante razonamiento abstracto. El sistema de agentes circundante convierte las salidas del modelo en comandos de movimiento e interacción.
Por tanto, el rendimiento refleja tanto el modelo subyacente como su andamiaje. Un mejor sistema de mapeo o controlador de bajo nivel podría mejorar los resultados sin modificar el modelo.
Los autores del benchmark reconocen otra limitación. MineExplorer se centra actualmente en la evaluación empírica, aunque su infraestructura también puede admitir entrenamiento.
Entrenar en el entorno del benchmark crea su propio riesgo. Una vez que los desarrolladores optimizan directamente para tareas públicas, las mejoras en la clasificación pueden reflejar especialización en el benchmark en lugar de exploración general.
El código de MineExplorer, totalmente abierto, facilita la replicación y la ampliación. También hace más importantes las cuestiones de contaminación y sobreajuste para futuras versiones de modelos.
Las evaluaciones independientes deberían preservar escenarios de prueba ocultos. También deberían variar los diseños de escena, las estructuras de dependencia, las implementaciones de controladores y los formatos de prompt.
El contexto histórico respalda esta cautela. MinePlanner publicó previamente 45 tareas de Minecraft para planificación de largo horizonte y descubrió que los planificadores consolidados tenían dificultades con entornos grandes que contenían muchos objetos.
El benchmark MinePlanner se centró en planificación proposicional y numérica, en lugar de exploración multimodal interactiva. Sus resultados mostraron, aun así, que Minecraft puede revelar problemas de escalabilidad ocultos por dominios de planificación más pequeños.
Otros sistemas han examinado el seguimiento de instrucciones, la construcción, la memoria y las habilidades abiertas. Estos proyectos utilizan el mismo juego para preguntas diferentes, por lo que sus puntuaciones principales no deben compararse directamente.
La contribución específica de MineExplorer es la combinación de interacción visual continua, requisitos previos ocultos, construcción de tareas de múltiples saltos y evaluación de hitos basada en reglas.
Su afirmación de ser el “primero” debe interpretarse dentro de esa definición. Minecraft ya acogía investigación de largo horizonte antes de MineExplorer. La afirmación de novedad del equipo se refiere a la exploración multimodal de mundo abierto a escala de minutos bajo su estructura de evaluación particular.
Otra limitación es la falta de una reacción independiente amplia tan poco tiempo después de su lanzamiento. La interpretación más detallada procede actualmente de los autores y de sus canales técnicos afiliados.
Los resultados medidos están disponibles para su inspección, pero las explicaciones causales siguen siendo parcialmente interpretativas. La elevada proporción de fallos de navegación, por ejemplo, no aísla por completo si la causa raíz fue el mapeo, la memoria, la planificación o la ejecución de acciones.
Estas incertidumbres no eliminan el hallazgo central. El éxito cae de forma pronunciada a medida que se acumulan requisitos previos ocultos. Definen qué deben separar los experimentos posteriores.
El código abierto convierte a MineExplorer en algo más que una clasificación
El lanzamiento importa porque los investigadores pueden comprobar si mejores sistemas de memoria, controladores o métodos de entrenamiento aplanan la curva de fallos de largo horizonte.
El equipo utilizó un flujo de trabajo multiagente para construir las instancias del benchmark. Cinco agentes especializados colaboran bajo un orquestador que controla su secuencia.
El flujo de trabajo comienza con un borrador inicial de tarea. Después, agentes especialistas y de validación debaten el diseño, identifican incoherencias y revisan la escena, el grafo de dependencias y los evaluadores de hitos.
Según la evaluación humana de los autores, este proceso incrementó la validez de las instancias en aproximadamente 30 puntos porcentuales frente a una línea base de un solo agente. También elevó las puntuaciones de calidad en alrededor de 0,5 puntos, con el mayor beneficio en las tareas de cuatro saltos.
La versión final contiene 813 instancias verificadas por humanos. Un subconjunto difícil independiente ofrece 100 escenarios seleccionados por su mayor dificultad.
Este proceso de generación aborda un problema persistente de los benchmarks. Construir manualmente cientos de entornos interactivos es lento, mientras que las tareas generadas por modelos sin restricciones suelen contener objetivos imposibles o evaluaciones defectuosas.
Combinar síntesis automatizada con verificación humana ofrece un camino intermedio. El enfoque puede producir más tareas mientras mantiene un filtro de calidad.
El mismo método puede generar escenarios de entrenamiento, no solo casos de prueba. Los investigadores pueden crear grafos de dependencias, instanciar escenas de sandbox y adjuntar comprobaciones deterministas de hitos.
Esto importa porque los agentes de largo horizonte necesitan practicar con fallos que se desarrollan con el tiempo. Los conjuntos de datos visuales estáticos no pueden enseñar la recuperación tras un giro equivocado o un requisito previo omitido.
La infraestructura abierta también invita a alternativas al escalado integral de modelos. Un equipo puede mantener constante el modelo base y probar mapas espaciales explícitos, memoria episódica, grafos causales o planificadores jerárquicos.
Otro experimento podría separar la planificación de alto nivel del movimiento de bajo nivel. El modelo podría seleccionar objetivos mientras un controlador especializado se encarga de evitar obstáculos y ejecutar rutas.
Los investigadores pueden entonces preguntar si los fallos de navegación reflejan inteligencia débil, control motor débil o una interfaz inestable entre ambos.
El benchmark también puede respaldar el diseño de currículos. Los agentes podrían empezar con tareas de un salto y luego avanzar hacia grafos de dependencias más profundos a medida que se estabiliza su tasa de finalización.
Sin embargo, los conjuntos de entrenamiento y evaluación deben permanecer diferenciados. Reutilizar escenarios públicos convertiría MineExplorer en una prueba de memorización.
El resultado futuro más informativo no será una pequeña mejora en la clasificación. Será una caída más suave desde las tareas de un salto hasta las de cuatro saltos.
Un sistema que aumenta el éxito global mientras conserva la misma curva de colapso ha mejorado la competencia local. Un sistema que mantiene el rendimiento a medida que se profundizan las dependencias ha mejorado la coordinación de largo horizonte.
Esa distinción debería dar forma a los informes futuros. La tasa global de éxito de tareas comprime varios comportamientos en una sola cifra. El rendimiento específico por salto revela dónde el agente deja de funcionar de forma fiable.
El lanzamiento abierto proporciona a equipos externos las herramientas para probar estas afirmaciones. También les permite proponer evaluaciones más difíciles sin reconstruir toda la infraestructura de Minecraft.
Qué observar tras el resultado de Anthropic en MineExplorer
La siguiente fase debería centrarse en la replicación independiente, mejores sistemas de navegación y un rendimiento estable en tareas multi-salto no vistas.
La primera señal es la reproducción independiente de la puntuación global del 41% y de la caída del 77% al 12%. Los investigadores deberían volver a ejecutar Claude Opus 4.6 y otros modelos con configuraciones documentadas de controlador, prompt y entorno.
Una reproducción cercana reforzaría la afirmación de que los requisitos previos ocultos impulsan un patrón general de fallos. Grandes diferencias sugerirían que el andamiaje del agente aporta más de lo que indica la clasificación inicial.
La segunda señal es si los sistemas explícitos de estado y navegación reducen la categoría de fallo dominante. Los experimentos útiles deberían comparar el historial de fotogramas sin procesar con mapas, memoria estructurada, grafos causales de tareas y políticas de recuperación de rutas.
Una mejora significativa reduciría los fallos de navegación sin sacrificar el rendimiento de razonamiento o acción. Simplemente aumentar la ventana de contexto no respondería a la crítica central del benchmark.
La tercera señal es el rendimiento de modelos más nuevos en escenarios de cuatro saltos reservados. Los desarrolladores deberían informar el éxito de las tareas por número de saltos, no solo mediante un promedio general.
Un modelo que obtiene una puntuación más alta en tareas de un salto, pero se mantiene cerca del 12% en tareas de cuatro saltos, no ha cerrado la brecha de largo horizonte. Resultados más sólidos en estructuras de dependencia no vistas aportarían mejor evidencia de exploración general.
Los lectores también deberían observar si los desarrolladores de modelos adoptan MineExplorer o evaluaciones relacionadas en las tarjetas oficiales de sistema. Esa inclusión indicaría que la interacción multimodal prolongada se está convirtiendo en un objetivo estándar de capacidad.
Para los desarrolladores, la lección práctica ya está clara. No evalúen un agente únicamente mediante acciones aisladas o demostraciones pulidas.
Prueben flujos de trabajo completos con requisitos previos ocultos, estados cambiantes y oportunidades de recuperación. Midan dónde el agente pierde de vista su objetivo y distingan los errores de percepción de los fallos de navegación, razonamiento y control.
Los compradores empresariales deberían solicitar la misma evidencia. La posición de un modelo en un benchmark dice poco sobre si un agente integrado puede completar de forma consistente un proceso de varias etapas.
MineExplorer no resuelve el debate sobre la IA incorporada. Proporciona una forma reproducible de hacer más difícil ignorar una debilidad.
El resultado de Anthropic en MineExplorer es especialmente revelador porque Claude Opus 4.6 quedó en primer lugar. El modelo más fuerte probado aun así perdió 65 puntos porcentuales a medida que la profundidad de la tarea aumentó de un salto a cuatro.
Esa es la inversión central del benchmark. Los modelos multimodales actuales a menudo pueden describir un mundo que no pueden navegar de forma fiable.
Por tanto, el próximo hito creíble para los agentes no es otra respuesta perfecta basada en una captura de pantalla. Es el progreso sostenido en un entorno desconocido, incluida la capacidad de detectar un paso en falso y recuperarse antes de que termine la tarea.


