top of page

MineExplorer, 작업 깊이가 깊어질수록 멀티모달 에이전트의 한계를 드러내다

Anthropic의 Claude Opus 4.6은 MineExplorer에서 선두를 차지했지만, 성공률은 1홉 작업의 77%에서 4홉 작업의 12%로 떨어졌다. Meituan의 LongCat 팀이 공개한 결과에 따르면, 이 모델의 벤치마크 전체 완료율은 41%에 그쳤다.

바로 이 급락이 Anthropic MineExplorer 이야기의 핵심이다. Claude는 목표 달성에 직접적인 한 단계만 필요한 경우에는 좋은 성과를 냈다. 그러나 변화하는 세계 안에서 명시되지 않은 여러 선행 조건을 발견하고 조율해야 하는 경우에는 어려움을 겪었다.

MineExplorer는 최대 3분 동안 이어지는 813개의 인간 검증 Minecraft 시나리오를 통해 이 격차를 측정한다. Claude, GPT, Gemini 시스템을 포함해 8개 모델 계열의 멀티모달 모델 18종을 시험한다. 벤치마크 저자들은 코드, 데이터세트, 작업 생성 워크플로, 평가 환경을 공개했다.

이 결과는 멀티모달 에이전트에 관한 익숙한 가정에 의문을 제기한다. 위협, 물체, 자원을 인식한다고 해서 환경이 변하는 동안 모델이 유용한 계획을 유지할 수 있다는 뜻은 아니다. MineExplorer는 그 차이를 측정 가능한 실패 곡선으로 바꾼다.

이전 Minecraft 벤치마크는 계획 수립, 지시 이행, 건설 또는 게임 지식을 검토했다. 반면 MineExplorer는 Minecraft 특유의 규칙에 크게 의존하는 작업을 다수 제거했다. 명시된 목표는 더 폭넓다. 지속되는 궤적 위에서 지각, 추론, 행동을 결합하는 탐색이다.

이 벤치마크는 아직 프리프린트이며, Minecraft가 모든 물리적 환경을 대변할 수는 없다. 그럼에도 이 발견은 더 강한 시각 능력과 더 긴 컨텍스트가 자동으로 신뢰할 수 있는 자율 에이전트를 만든다는 주장에 즉각적인 압력을 가한다.

MineExplorer는 3분을 본격적인 에이전트 테스트로 바꾼다

MineExplorer는 평가 대상을 장면 인식에서 상호 의존적인 의사결정 연속을 견뎌내는 능력으로 전환한다.

LongCat 팀은 2026년 5월 프리프린트에서 MineExplorer를 소개했다. 6월 12일에는 두 번째 버전이 뒤따랐고, Meituan의 기술팀은 7월에 상세한 결과 요약을 공개했다.

각 에피소드는 1,800개의 환경 단계까지 진행될 수 있다. 한 단계는 0.1초를 의미하므로, 3분간의 연속 상호작용이 이뤄진다. 세계는 모든 행동 뒤에 갱신되며, 모델은 자신이 보는 것과 다음에 해야 할 일을 반복적으로 재고해야 한다.

이 시간은 인간 기준으로는 짧게 들린다. 하지만 이미지를 관찰하고, 상태를 유지하고, 행동을 선택하며, 수백 번의 상호작용에 걸친 실수에서 회복해야 하는 에이전트에게는 긴 시간이다.

작업은 홉 수에 따라 나뉜다. 1홉 작업은 에이전트가 명시되지 않은 하위 작업을 추론할 필요가 없는 목표를 제시한다. 2홉부터 4홉까지의 시나리오에는 환경을 통해 발견해야 하는 숨은 선행 조건이 추가된다.

보호된 위치에 도달하라는 지시를 받은 에이전트를 생각해 보자. 바로 가는 길은 막혀 있을 수 있고, 필요한 도구는 다른 곳에 있을 수 있으며, 적대적 개체가 이동을 제약할 수 있다. 지시는 목적지를 언급하지만, 거기에 도달하기 위해 필요한 모든 행동을 명시하지는 않는다.

MineExplorer는 각 복합 작업을 초기 상태, 자연어 지시, 의존성 그래프, 규칙 기반 마일스톤으로 표현한다. 의존성 그래프는 숨은 작업 구조를 기록한다. 모델은 이 완전한 그래프를 받지 못한다.

마일스톤은 평가자가 다른 언어 모델에 전체 궤적의 판단을 맡기지 않고도 부분 진척도를 측정할 수 있게 한다. 마일스톤은 에이전트가 물체를 찾았는지, 영역에 들어갔는지, 필요한 중간 행동을 완료했는지 감지할 수 있다.

저자들은 이러한 자동 결과를 Claude Opus 4.6 궤적에 대한 인간 평가와 비교했다. 완료된 마일스톤 집합은 5점 척도에서 평균 4점에 가까운 인간 점수를 받았다. 완전히 실패한 집합은 3점 미만에 머물렀다.

이러한 일치가 평가기를 완벽하게 만드는 것은 아니다. 다만 마일스톤 완료가 임의의 게임 이벤트가 아니라 의미 있는 진척도를 포착한다는 근거를 제공한다.

팀은 또한 탐색 능력과 암기된 Minecraft 전문 지식을 분리하려 했다. 후보 원자 작업은 게임 특유의 관습 의존성을 기준으로 선별됐다. 전문 지식이 지배적인 작업은 제거됐다.

이 설계 선택은 중요하다. 에이전트가 Minecraft 목표에 실패하는 이유는 크게 두 가지로 다를 수 있기 때문이다. 게임 위키에 나오는 제작법을 모를 수도 있고, 보이는 증거를 실행 가능한 계획과 연결하지 못할 수도 있다.

MineExplorer는 두 번째 문제를 강조하려 한다. 14개 능력 범주는 지각, 추론, 행동을 포괄한다. 여기에는 공간 및 시간 지각, 개체 추적, 자원 인식, 인과 추론, 이동, 수집, 배치, 제작, 전투가 포함된다.

공개된 813개 사례는 1홉부터 4홉까지의 의존성을 아우른다. 공개 데이터세트에는 작업 텍스트, 장면 설정 명령, 선택된 원자 작업, 마일스톤, 의존성 그래프, 설계 노트가 포함된다.

이는 단순한 정적 문제 집합이 아니다. 연구자들은 장면이 어떻게 구성됐는지 살펴보고, 평가를 재실행하고, 더 어려운 변형을 만들거나, 학습용 환경으로 활용할 수 있다.

이러한 개방성은 이 벤치마크가 에이전트 개발에 영향을 미칠 기회를 제공한다. 또한 탐색에 관한 폭넓은 주장을 하는 벤치마크에서 중요한 특성인, 그 가정에 이의를 제기하기도 쉽게 만든다.

Anthropic MineExplorer의 선두가 여전히 경고인 이유

Claude Opus 4.6은 비교에서 승리했지만, 그 선두는 시험된 모든 모델이 신뢰할 수 있는 장기 행동과 얼마나 거리가 먼지를 드러낸다.

이 벤치마크는 8개 계열에 걸친 최첨단 멀티모달 모델 18종을 평가했다. Claude Opus 4.6은 전체 작업 성공률 41%로 가장 높은 성과를 기록했다.

41%라는 결과는 리더보드 순위만 보면 그럴듯해 보일 수 있다. 그러나 작업 깊이별로 분리하면 훨씬 약해 보인다.

Claude Opus 4.6은 1홉 작업의 77%를 완료했다. 4홉 작업에서는 성공률이 12%로 떨어졌다. 65%포인트 하락은 추가 의존성이 약간의 난이도만 더하는 것이 아님을 보여준다.

각 숨은 선행 조건은 계획을 놓칠 또 하나의 기회를 만든다. 모델은 관련 증거를 알아차리고, 중간 목표를 추론하고, 이를 정확히 수행하며, 최종 목표와의 관계를 유지해야 한다.

초기의 실수는 에피소드 전체에 전파될 수 있다. 필요한 자원을 지나치면 다음 행동이 불가능해진다. 잘못된 경로를 선택하면 단계를 소모하고 에이전트의 시야가 바뀐다. 이후의 관찰은 이미 잘못된 내부 상태를 바탕으로 해석될 수 있다.

이 때문에 Anthropic MineExplorer 결과는 Anthropic만을 압박하지 않는다. Claude는 이 테스트에서 가장 강한 모델이었다. 따라서 이 실패 곡선은 고립된 Claude의 약점을 보여주는 것이 아니라, 이 특정 설정에서의 상한선으로 작용한다.

이 발견은 표준적인 모델 스케일링 서사도 복잡하게 만든다. 논문은 더 큰 모델과 전용 사고 모드가 성능을 일관되게 개선하지 못했다고 보고한다.

더 많은 파라미터는 제한된 프롬프트에서 지각이나 추론을 강화할 수 있다. 그러나 동적인 환경에는 또 다른 능력이 요구된다. 메모리, 현재 관찰, 변화하는 목표 사이에 유용한 정렬을 유지하는 능력이다.

더 긴 컨텍스트가 그 정렬을 보장하지는 않는다. 현재 장면을 더 이상 설명하지 않는 오래된 이미지를 보존할 수 있기 때문이다. 이러한 관찰은 모델에 도움이 되기보다 더 새로운 증거와 경쟁할 수 있다.

저자들은 과거 시각 프레임 수를 늘려 이 문제를 시험했다. 오래된 관찰이 현재 상태에 대한 모델의 이해를 방해하면서 성능은 결국 하락했다.

또한 모델에 단순히 시간이 더 필요한지도 살폈다. 실패한 에이전트들은 에피소드에 최대 1,800단계가 허용돼도 여전히 실패했다. 해결 가능한 작업은 더 일찍 완료되는 경향을 보였으며, 추가 상호작용은 많은 무너진 궤적을 구하지 못했다.

이 결과는 두 가지 손쉬운 해결책을 약화시킨다. 에이전트에 더 많은 컨텍스트를 주는 것은 더 나은 메모리를 주는 것과 같지 않다. 더 많은 행동 기회를 주는 것도 더 나은 계획을 주는 것과 같지 않다.

압력은 컴퓨터 사용 에이전트, 로보틱스 시스템, 자동화된 연구 도구를 만드는 개발자에게까지 이어진다. 이러한 제품은 고정된 스크린샷 밖에서 작동한다. 그 환경은 에이전트와 외부 사건 모두에 반응해 변한다.

브라우저 에이전트는 기록을 찾고, 필터를 변경하고, 갱신된 페이지를 해석하고, 최종 제출을 확인해야 할 수 있다. 창고 로봇은 통로가 막힌 것을 발견한 뒤 경로를 다시 설정해야 할 수 있다. 연구 에이전트는 상충하는 증거를 발견한 뒤 검색을 수정해야 할 수 있다.

각 경우에서 눈에 보이는 목표는 선행 의사결정을 숨긴다. 모델은 고립된 각각의 행동을 정확히 수행하면서도 전체 작업에는 실패할 수 있다.

MineExplorer는 실패율이 브라우저나 로봇에 그대로 이전된다고 증명하지는 않는다. 다만 숨은 의존성이 누적되면 짧은 멀티모달 테스트에서의 성공이 제한적인 보장만 제공한다는 점을 보여준다.

이 구분은 조달 및 배포 결정에 영향을 미쳐야 한다. 구매자는 모델이 화면을 인식하거나 그럴듯한 다음 행동을 생성하는지만이 아니라, 완료된 워크플로 전반에서 에이전트가 어떻게 수행하는지 물어야 한다.

진짜 문제는 시각 인식이 아니라 탐색이다

Claude Opus 4.6 실패의 거의 60%는 탐색에 기인한 것으로 분석됐으며, 상태를 유지하는 이동이 이 벤치마크의 가장 분명한 병목으로 나타났다.

LongCat 팀의 실패 분석은 탐색 실수를 물체 상호작용이나 작업 추론 같은 문제와 분리한다. 탐색은 분석된 실패의 거의 60%를 차지했다.

이 수치가 모델에 단순히 길 안내 능력이 부족했다는 뜻은 아니다. 열린 세계에서의 탐색은 공간 기억, 시각 인식, 행동 제어, 목표 관리를 결합한다.

에이전트는 자신이 어디에 있는지 알고, 어디를 지나왔는지 기억하며, 이동이 의도한 결과를 냈는지 판단해야 한다. 또한 경로를 포기하거나 대안을 탐색할 시점도 결정해야 한다.

정적인 시각 테스트는 그 순환의 일부만 분리한다. 모델은 이미지를 보고 질문에 답한다. 장면은 답변 때문에 변하지 않으며, 한 번의 잘못된 응답이 다음 관찰을 왜곡하지도 않는다.

Minecraft는 피드백을 만든다. 에이전트가 잘못된 방향으로 돌면 다음 이미지는 다른 증거를 담는다. 장애물에 걸리면 반복적인 이동 명령은 작업을 진전시키지 못한 채 시간을 소모한다.

그다음 모델은 경로가 실패했는지, 행동이 실패했는지, 아니면 원래 계획이 잘못됐는지 진단해야 한다. 관찰이 안정적인 내부 지도 대신 개별 프레임으로 들어올 때 이 구분은 어렵다.

MineExplorer의 능력 점수는 이러한 해석을 뒷받침한다. Claude Opus 4.6은 지각 점수 61.91점, 추론 점수 54.71점을 받았다. 평가된 대부분의 모델에서 지각은 행동을 앞섰고, 행동은 추론을 앞섰다.

모델들은 관련 세부 사항을 식별하는 데는 종종 성공했다. 그러나 그 세부 사항을 환경 변화에도 살아남는 조율된 전략으로 바꾸는 데는 더 큰 어려움을 보였다.

이는 멀티모달 발전이 일반적으로 제시되는 방식에 중요한 반전을 만든다. 더 나은 이미지 이해는 에이전트가 알아차릴 수 있는 범위를 넓히지만, 동시에 그 관찰을 소비하는 계획 시스템의 약점을 드러낸다.

관련 물체 10개를 감지하는 모델도 지금 무엇이 중요한지 결정해야 한다. 그 선택을 최종 목표와 연결하고, 관점이 바뀐 뒤에도 그 연결을 유지해야 한다.

이 벤치마크는 추론과 행동, 새로운 관찰을 교차시키는 ReAct 접근법을 활용한다. 원래의 ReAct 프레임워크는 모델이 환경 피드백을 통해 추론을 수정할 수 있도록 설계됐다.

MineExplorer는 그러한 루프가 장기적인 궤적에서 어떻게 무너질 수 있는지 보여준다. 추론이 현재 상태와 분리되거나, 행동이 원래 목표에 더 이상 기여하지 않거나, 새로운 관찰이 필요한 수정으로 이어지지 못한다.

탐색은 이 세 가지 문제를 모두 증폭시킨다. 위치를 잘못 파악한 에이전트는 잘못된 증거를 보고, 잘못된 상태 추정을 만들며, 저하된 위치에서 추가 행동을 선택하게 된다.

이는 더 긴 사고 사슬을 생성하는 것보다 어려운 문제다. 에이전트는 지속되는 개체, 위치, 완료한 이정표, 실패한 경로, 해결되지 않은 의존성을 구조적으로 표현해야 한다.

원시 시각 기록은 이를 대체하기에 부족하다. 카메라가 본 것을 저장할 뿐, 에이전트가 기억해야 할 것을 저장하지는 않는다.

같은 구분은 엔터프라이즈 에이전트에도 적용된다. 이전 화면을 모두 기록한 트랜스크립트가 자동으로 신뢰할 수 있는 워크플로 상태를 만들어 주지는 않는다. 에이전트는 어떤 양식이 제출됐는지, 어떤 필터가 활성화된 상태인지, 어떤 요구사항이 여전히 해결되지 않았는지를 알아야 한다.

물리적 시스템에서 탐색은 물리적 시험이자 인지적 시험이 된다. 모델은 작업의 논리적 구조를 유지하면서 공간을 이동해야 한다.

따라서 MineExplorer에서 탐색이 실패의 60%를 차지한다는 결과는 시스템 수준의 개선이 필요함을 시사한다. 더 나은 로컬 컨트롤러, 명시적 지도, 인과적 메모리, 진행 상황 모니터링, 복구 정책은 더 강력한 기본 모델만큼 중요할 수 있다.

벤치마크가 측정하는 것과 측정하지 않는 것

MineExplorer는 유용한 스트레스 테스트를 제공하지만, 그 결과는 하나의 시뮬레이션 세계와 연구자가 정의한 작업 분포에 한정된다.

가장 강력한 회의론적 논거는 외적 타당성에 관한 것이다. Minecraft는 일관된 규칙을 갖춘 역동적인 3D 세계를 제공하지만, 가정·공장·사무실·공공장소에서 발견되는 모든 어려움을 재현하지는 않는다.

실제 로봇은 불확실한 물리 법칙, 센서 노이즈, 물리적 손상, 안전 제약에 직면한다. 컴퓨터 사용 에이전트는 숨겨진 애플리케이션 상태, 인증 장벽, 팝업, 변화하는 인터페이스를 마주한다.

Minecraft는 이러한 복잡성 중 상당수를 제거한다. 객체는 이산적이고, 물리 법칙은 반복 가능하며, 환경은 정확히 초기화할 수 있다.

이러한 통제 가능성은 장점이기도 하다. 연구자들은 동일한 조건에서 모델을 비교하고, 장비나 사용자를 위험에 빠뜨리지 않고 실패를 추적할 수 있다.

핵심은 MineExplorer를 체화 지능의 보편적 점수가 아니라 진단 도구로 다루는 것이다. 41%라는 결과가 Claude가 관련 없는 실제 워크플로의 41%를 완료한다는 뜻은 아니다.

이 벤치마크의 지식 필터링도 면밀히 검토할 필요가 있다. 저자들은 언어 모델의 판단을 사용해 원자적 작업이 주로 일반 지식에 의존하는지, Minecraft 고유의 관습에 의존하는지를 분류한다.

이 과정은 명백한 게임 지식 혼란 변수를 줄인다. 하지만 남은 모든 작업이 친숙성 효과에서 자유롭다고 보장할 수는 없다.

Minecraft 동영상, 가이드, 게임 플레이 토론으로 학습된 모델은 여전히 흔한 배치와 행동을 인식할 수 있다. 모델 계열마다 그러한 자료에 노출된 정도도 다를 수 있다.

arXiv 기록에 따르면 이 벤치마크 자체는 여전히 진행 중인 작업이다. 향후 개정판에서는 작업, 프롬프트, 컨트롤러, 평가 절차가 달라질 수 있다.

컨트롤러 설계는 특히 중요하다. 멀티모달 모델은 추상적 추론만으로 게임을 조작하는 경우가 드물다. 주변의 에이전트 시스템이 모델 출력을 이동 및 상호작용 명령으로 변환한다.

따라서 성능은 기반 모델과 그 스캐폴딩을 함께 반영한다. 더 나은 매핑 시스템이나 저수준 컨트롤러는 모델을 바꾸지 않고도 결과를 개선할 수 있다.

벤치마크 저자들은 또 다른 한계도 인정한다. MineExplorer는 현재 실증적 평가에 초점을 맞추고 있지만, 인프라는 학습도 지원할 수 있다.

벤치마크 환경에서 학습하면 그 자체로 위험이 생긴다. 개발자가 공개 작업을 직접 최적화하기 시작하면 리더보드 향상은 일반적 탐색 능력이 아니라 벤치마크 특화 능력을 반영할 수 있다.

완전히 공개된 MineExplorer 코드는 복제와 확장을 더 쉽게 만든다. 동시에 이후 모델 릴리스에서 오염과 과적합 문제가 더 중요해진다.

독립 평가는 숨겨진 테스트 시나리오를 유지해야 한다. 또한 장면 배치, 의존성 구조, 컨트롤러 구현, 프롬프트 형식을 다양하게 바꿔야 한다.

역사적 맥락도 이러한 주의를 뒷받침한다. MinePlanner는 이전에 장기 계획을 위한 Minecraft 작업 45개를 공개했고, 많은 객체가 있는 대규모 환경에서 기존 플래너들이 어려움을 겪는다는 사실을 확인했다.

MinePlanner 벤치마크는 상호작용형 멀티모달 탐색보다 명제 및 수치 계획에 초점을 맞췄다. 그 결과 역시 Minecraft가 더 작은 계획 도메인에서는 드러나지 않는 확장성 문제를 노출할 수 있음을 보여줬다.

다른 시스템들은 지시 이행, 건설, 메모리, 개방형 기술을 검토해 왔다. 이 프로젝트들은 서로 다른 질문을 위해 같은 게임을 사용하므로, 핵심 점수를 직접 비교해서는 안 된다.

MineExplorer의 구체적 기여는 연속적인 시각적 상호작용, 숨겨진 선행 조건, 다단계 작업 구성, 규칙 기반 이정표 평가의 결합이다.

그것의 “최초” 주장은 이 정의 안에서 읽어야 한다. Minecraft는 MineExplorer 이전에도 장기 연구의 무대였다. 팀의 새로움 주장은 특정 평가 구조 아래에서 이뤄지는 분 단위의 오픈월드 멀티모달 탐색에 관한 것이다.

또 다른 한계는 출시 직후 폭넓은 독립적 반응이 부족하다는 점이다. 현재 대부분의 상세한 해석은 저자들과 그들의 관련 기술 채널에서 나온다.

측정된 결과는 검토할 수 있지만, 인과적 설명은 일부 해석적 성격을 띤다. 예를 들어 탐색이 실패에서 큰 비중을 차지한다는 사실만으로 근본 원인이 매핑, 메모리, 계획, 행동 실행 중 무엇이었는지를 완전히 분리할 수는 없다.

이러한 불확실성이 핵심 발견을 지우지는 않는다. 숨겨진 선행 조건이 누적될수록 성공률은 급격히 떨어진다. 이는 후속 실험이 무엇을 분리해야 하는지 규정한다.

오픈소스 공개로 MineExplorer는 리더보드 그 이상이 된다

이번 공개가 중요한 이유는 연구자들이 더 나은 메모리, 컨트롤러, 학습 방법이 장기 작업 실패 곡선을 완만하게 만들 수 있는지 검증할 수 있기 때문이다.

팀은 벤치마크 인스턴스를 구성하기 위해 멀티 에이전트 워크플로를 사용했다. 다섯 개의 전문 에이전트가 순서를 제어하는 오케스트레이터 아래에서 협력한다.

워크플로는 초기 작업 초안으로 시작한다. 이후 전문 에이전트와 검증 에이전트가 설계를 논의하고, 불일치를 식별하며, 장면·의존성 그래프·이정표 평가기를 수정한다.

저자들의 인간 평가에 따르면, 이 과정은 단일 에이전트 기준선보다 인스턴스 유효성을 약 30%포인트 높였다. 또한 품질 점수를 약 0.5점 끌어올렸으며, 가장 큰 효과는 4홉 작업에서 나타났다.

최종 릴리스에는 인간이 검증한 인스턴스 813개가 포함된다. 별도의 고난도 하위 집합은 더 높은 난도를 기준으로 선정된 시나리오 100개를 제공한다.

이 생성 파이프라인은 지속적인 벤치마크 문제를 해결한다. 수백 개의 상호작용 환경을 수작업으로 구축하는 일은 느린 반면, 제약 없는 모델 생성 작업에는 불가능한 목표나 망가진 평가가 포함되는 경우가 많다.

자동화된 합성과 인간 검증을 결합하면 중간 경로를 제공한다. 이 접근법은 품질 관문을 유지하면서 더 많은 작업을 만들 수 있다.

같은 방법은 테스트 사례뿐 아니라 학습 시나리오도 생성할 수 있다. 연구자들은 의존성 그래프를 만들고, 샌드박스 장면을 인스턴스화하며, 결정론적 이정표 검사를 연결할 수 있다.

이는 장기 작업 에이전트가 시간에 따라 전개되는 실패를 연습해야 하기 때문에 중요하다. 정적인 시각 데이터셋은 잘못된 방향 전환이나 놓친 선행 조건에서 회복하는 법을 가르칠 수 없다.

오픈 인프라는 엔드투엔드 모델 스케일링의 대안도 불러들인다. 팀은 기본 모델을 고정한 채 명시적 공간 지도, 일화적 메모리, 인과 그래프, 계층적 플래너를 시험할 수 있다.

또 다른 실험은 고수준 계획과 저수준 이동을 분리할 수 있다. 모델은 목표를 선택하고, 전문 컨트롤러는 장애물 회피와 경로 실행을 담당할 수 있다.

그러면 연구자들은 탐색 실패가 약한 지능, 약한 운동 제어, 혹은 둘 사이의 불안정한 인터페이스를 반영하는지 물을 수 있다.

이 벤치마크는 커리큘럼 설계도 지원할 수 있다. 에이전트는 1홉 작업으로 시작한 뒤 완료율이 안정되면 더 깊은 의존성 그래프로 진행할 수 있다.

다만 학습 세트와 평가 세트는 구분된 상태로 유지되어야 한다. 공개 시나리오를 재사용하면 MineExplorer는 암기 테스트가 된다.

가장 유의미한 미래 결과는 작은 리더보드 상승이 아닐 것이다. 1홉 작업에서 4홉 작업까지의 하락 폭이 더 완만해지는 결과다.

전체 성공률을 높이면서 같은 붕괴 곡선을 유지하는 시스템은 로컬 역량을 개선한 것이다. 의존성이 깊어져도 성능을 유지하는 시스템은 장기 조정 능력을 개선한 것이다.

이 구분은 향후 보고 방식을 이끌어야 한다. 전체 작업 성공률은 여러 행동을 하나의 숫자로 압축한다. 홉별 성능은 에이전트가 어디서부터 신뢰성 있게 작동하지 못하는지를 드러낸다.

오픈 릴리스는 외부 팀에 이러한 주장을 검증할 도구를 제공한다. 또한 전체 Minecraft 스택을 다시 구축하지 않고도 더 어려운 평가를 제안할 수 있게 한다.

Anthropic MineExplorer 결과 이후 주목할 점

다음 단계는 독립적 재현, 개선된 탐색 시스템, 그리고 보지 못한 다중 홉 작업에서의 안정적인 성능에 초점을 맞춰야 한다.

첫 번째 신호는 전체 점수 41%와 77%에서 12%로의 하락을 독립적으로 재현하는 일이다. 연구자들은 문서화된 컨트롤러, 프롬프트, 환경 설정 아래에서 Claude Opus 4.6 및 다른 모델을 다시 실행해야 한다.

유사한 재현 결과는 숨겨진 선행 조건이 일반적 실패 패턴을 유발한다는 주장을 강화할 것이다. 큰 차이가 난다면, 에이전트 스캐폴딩의 기여가 초기 리더보드가 보여주는 것보다 크다는 뜻일 수 있다.

두 번째 신호는 명시적 상태 및 탐색 시스템이 지배적인 실패 범주를 줄이는지 여부다. 유용한 실험은 원시 프레임 기록을 지도, 구조화된 메모리, 인과적 작업 그래프, 경로 복구 정책과 비교해야 한다.

의미 있는 개선은 추론이나 행동 성능을 희생하지 않으면서 탐색 실패를 줄여야 한다. 단순히 컨텍스트 창을 늘리는 것만으로는 이 벤치마크의 핵심 비판에 답할 수 없다.

세 번째 신호는 홀드아웃된 4홉 시나리오에서 신규 모델이 보이는 성능이다. 개발자는 전체 평균만이 아니라 홉 수별 작업 성공률을 보고해야 한다.

1홉 작업에서 더 높은 점수를 받지만 4홉 작업에서는 여전히 12%에 머무는 모델은 장기 작업 격차를 해소하지 못한 것이다. 보지 못한 의존성 구조에서 더 강한 결과가 나와야 일반적 탐색 능력에 관한 더 나은 증거가 된다.

독자들은 모델 개발사가 MineExplorer나 관련 평가를 공식 시스템 카드에 채택하는지도 지켜봐야 한다. 포함된다면 장시간 멀티모달 상호작용이 표준 역량 목표가 되고 있다는 신호가 될 것이다.

개발자에게 실용적 교훈은 이미 분명하다. 고립된 행동이나 정교하게 다듬어진 시연만으로 에이전트를 평가하지 말아야 한다.

숨겨진 선행 조건, 변화하는 상태, 복구 기회를 갖춘 완전한 워크플로를 테스트하라. 에이전트가 어디서 목표를 놓치는지 측정하고, 지각 오류를 탐색·추론·제어 실패와 구분하라.

엔터프라이즈 구매자도 같은 증거를 요구해야 한다. 모델의 벤치마크 순위는 통합 에이전트가 다단계 프로세스를 일관되게 완료할 수 있는지에 대해 거의 말해주지 않는다.

MineExplorer는 체화 AI 논쟁을 결론짓지 않는다. 대신 한 가지 약점을 더 이상 무시하기 어렵게 만드는 재현 가능한 방법을 제공한다.

Anthropic MineExplorer 결과가 특히 드러내는 바가 큰 이유는 Claude Opus 4.6이 1위를 차지했기 때문이다. 가장 강력했던 테스트 모델조차 작업 깊이가 1홉에서 4홉으로 늘어나자 65%포인트를 잃었다.

이것이 벤치마크의 핵심적인 반전이다. 현재의 멀티모달 모델은 자신이 안정적으로 탐색할 수 없는 세계를 종종 설명할 수 있다.

따라서 다음으로 신뢰할 만한 에이전트의 이정표는 또 하나의 완벽한 스크린샷 정답이 아니다. 낯선 환경에서 꾸준히 진전을 이루고, 잘못된 방향으로 들어섰음을 알아차린 뒤 작업이 끝나기 전에 회복하는 능력까지 포함하는 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page