top of page

MineExplorer 작업이 더 복잡해지자 Claude Opus 4.6, 65포인트 하락

Anthropic의 Claude Opus 4.6은 MineExplorer에서 선두를 차지했지만, 성공률은 1홉 작업의 77%에서 4홉 작업의 12%로 떨어졌다. Meituan의 LongCat 팀이 공개한 결과에 따르면, 이 모델의 벤치마크 전체 완료율은 41%에 그쳤다.

이 급락이 Anthropic MineExplorer 이야기의 핵심이다. 목표 달성에 직접적인 한 단계만 필요할 때 Claude는 좋은 성과를 냈다. 그러나 변화하는 세계 안에서 명시되지 않은 여러 전제 조건을 발견하고 조율해야 할 때는 어려움을 겪었다.

MineExplorer는 최대 3분 동안 지속되는, 사람이 검증한 Minecraft 시나리오 813개를 통해 이 격차를 측정한다. Claude, GPT, Gemini 시스템을 포함해 8개 모델 계열의 멀티모달 모델 18개를 시험한다. 벤치마크 저자들은 코드, 데이터셋, 작업 생성 워크플로, 평가 환경을 공개했다.

이 결과는 멀티모달 에이전트에 관한 익숙한 가정에 도전한다. 위협, 물체, 자원을 인식한다고 해서 환경이 변하는 동안 유용한 계획을 유지할 수 있다는 뜻은 아니다. MineExplorer는 이 차이를 측정 가능한 실패 곡선으로 바꾼다.

기존 Minecraft 벤치마크는 계획, 지시 이행, 건설, 게임 지식을 살폈다. 반면 MineExplorer는 Minecraft 고유 규칙에 크게 의존하는 작업을 다수 제외한다. 저자들이 밝힌 목표는 더 넓다. 지속적인 궤적에 걸쳐 지각, 추론, 행동을 결합하는 탐색이다.

이 벤치마크는 아직 사전 공개 논문이며, Minecraft가 모든 물리적 환경을 대변할 수는 없다. 그럼에도 이 결과는 더 강한 시각 능력과 더 긴 컨텍스트가 자동으로 신뢰할 수 있는 자율 에이전트를 만든다는 주장에 즉각적인 압박을 가한다.

MineExplorer, 3분을 본격적인 에이전트 시험으로 바꾸다

MineExplorer는 평가 대상을 장면 인식에서 상호 의존적인 의사결정 연속을 헤쳐 나가는 능력으로 전환한다.

LongCat 팀은 2026년 5월 사전 공개 논문에서 MineExplorer를 소개했다. 6월 12일에는 두 번째 버전이 뒤따랐고, Meituan 기술팀은 7월에 상세한 결과 요약을 공개했다.

각 에피소드는 환경 단계 기준으로 1,800단계까지 실행될 수 있다. 한 단계는 0.1초를 의미하므로, 총 3분간의 연속 상호작용이 이뤄진다. 매 행동 뒤 세계가 갱신되기 때문에 모델은 자신이 보는 것과 다음에 해야 할 일을 계속 재검토해야 한다.

사람의 기준으로는 짧아 보일 수 있다. 그러나 이미지를 관찰하고, 상태를 유지하며, 행동을 선택하고, 수백 번의 상호작용에 걸쳐 실수에서 회복해야 하는 에이전트에게는 긴 시간이다.

작업은 홉 수에 따라 나뉜다. 1홉 작업은 에이전트가 명시되지 않은 하위 작업을 추론할 필요가 없는 목표를 제시한다. 2홉부터 4홉까지의 시나리오는 환경을 통해 발견해야 하는 숨겨진 전제 조건을 더한다.

보호된 장소에 도달하라는 지시를 받은 에이전트를 생각해 보자. 바로 가는 길은 막혀 있을 수 있고, 필요한 도구는 다른 곳에 있을 수 있으며, 적대적 개체가 이동을 제한할 수도 있다. 지시는 목적지를 언급하지만, 그곳에 도달하기 위해 필요한 모든 행동을 알려주지는 않는다.

MineExplorer는 각 복합 작업을 초기 상태, 자연어 지시, 의존성 그래프, 규칙 기반 마일스톤으로 표현한다. 의존성 그래프는 숨겨진 작업 구조를 기록한다. 모델은 이 완전한 그래프를 받지 못한다.

마일스톤을 사용하면 평가자는 다른 언어 모델에 전체 궤적의 판단을 맡기지 않고도 부분적 진전을 측정할 수 있다. 마일스톤은 에이전트가 물체를 발견했는지, 지역에 들어갔는지, 필요한 중간 행동을 완료했는지를 감지할 수 있다.

저자들은 이러한 자동 평가 결과를 Claude Opus 4.6 궤적에 대한 인간 평가와 비교했다. 완료된 마일스톤 집합은 5점 척도에서 평균 4점에 가까운 인간 평가를 받았다. 완전히 실패한 집합은 3점 미만에 머물렀다.

이 일치가 평가기를 완벽하게 만드는 것은 아니다. 다만 마일스톤 완료가 임의의 게임 이벤트가 아니라 의미 있는 진전을 포착한다는 근거를 제공한다.

팀은 또한 탐색과 암기된 Minecraft 전문 지식을 분리하려 했다. 후보 원자 작업은 게임 고유 관례에 대한 의존도를 기준으로 선별됐다. 전문 지식이 지배적인 작업은 제외됐다.

이 설계 선택은 중요하다. 에이전트가 Minecraft 목표에 실패하는 데에는 매우 다른 두 이유가 있을 수 있기 때문이다. 게임 위키의 조합법을 모르거나, 눈에 보이는 증거를 실행 가능한 계획과 연결하지 못할 수 있다.

MineExplorer는 두 번째 문제를 강조하려 한다. 14개 역량 범주는 지각, 추론, 행동을 포괄한다. 여기에는 공간 및 시간 지각, 개체 추적, 자원 인식, 인과 추론, 이동, 수집, 배치, 제작, 전투가 포함된다.

공개된 813개 사례는 1홉부터 4홉까지의 의존성을 아우른다. 공개 데이터셋에는 작업 텍스트, 장면 설정 명령, 선택된 원자 작업, 마일스톤, 의존성 그래프, 설계 노트가 포함된다.

이는 단순한 정적 문제 세트가 아니다. 연구자는 장면이 어떻게 구축됐는지 살피고, 평가를 재실행하며, 더 어려운 변형을 만들거나, 이 환경을 학습에 사용할 수 있다.

이러한 개방성은 이 벤치마크가 에이전트 개발에 영향을 미칠 기회를 제공한다. 또한 탐색에 관한 폭넓은 주장을 하는 벤치마크에 중요한 특성인, 그 가정에 도전하기도 쉽게 만든다.

Anthropic MineExplorer 선두 기록이 여전히 경고인 이유

Claude Opus 4.6은 비교에서 이겼지만, 그 선두는 시험된 모든 모델이 신뢰할 수 있는 장기 행동과 얼마나 거리가 먼지를 드러낸다.

이 벤치마크는 8개 계열에 걸쳐 고급 멀티모달 모델 18개를 평가했다. Claude Opus 4.6은 전체 작업 성공률 41%로 가장 높은 성과를 기록했다.

41%라는 결과는 리더보드 순위만 보면 꽤 괜찮아 보일 수 있다. 하지만 작업 깊이별로 나누어 보면 훨씬 약해 보인다.

Claude Opus 4.6은 1홉 작업의 77%를 완료했다. 그러나 4홉 작업에서 성공률은 12%로 떨어졌다. 65포인트 하락은 추가 의존성이 단지 약간의 난이도만 더하는 것이 아님을 보여준다.

숨겨진 전제 조건 하나마다 계획을 잃을 기회가 하나 더 생긴다. 모델은 관련 증거를 알아차리고, 중간 목표를 추론하며, 이를 정확히 실행하고, 최종 목표와의 관계를 유지해야 한다.

초기의 실수는 에피소드 전체로 전파될 수 있다. 필요한 자원을 지나치면 다음 행동이 막힌다. 잘못된 경로를 선택하면 단계를 소모하고 에이전트의 시야가 바뀐다. 이후 관찰은 이미 잘못된 내부 상태를 바탕으로 해석될 수 있다.

이 때문에 Anthropic MineExplorer 결과는 Anthropic만 압박하는 것이 아니다. Claude는 이 시험에서 가장 강한 모델이었다. 따라서 이 실패 곡선은 고립된 Claude의 약점을 보여주는 근거가 아니라, 이 특정 설정에서의 상한선으로 작용한다.

이 발견은 표준적인 모델 스케일링 서사도 복잡하게 만든다. 논문은 더 큰 모델과 전용 사고 모드가 성능을 일관되게 개선하지는 않았다고 보고한다.

더 많은 파라미터는 제한된 프롬프트에서 지각이나 추론을 강화할 수 있다. 하지만 동적 환경에는 또 다른 역량이 필요하다. 메모리, 현재 관찰, 변화하는 목표 사이의 유용한 정렬을 유지하는 능력이다.

더 긴 컨텍스트가 그 정렬을 보장하지는 않는다. 현재 장면을 더 이상 설명하지 못하는 오래된 이미지를 보존할 수 있다. 이런 관찰은 모델을 돕기보다 더 새로운 증거와 경쟁할 수 있다.

저자들은 과거 시각 프레임 수를 늘려 이 문제를 시험했다. 오래된 관찰이 현재 상태에 대한 모델의 이해를 방해하면서 성능은 결국 하락했다.

또한 모델에 단순히 더 많은 시간이 필요했는지도 살폈다. 실패한 에이전트는 에피소드에 최대 1,800단계를 허용해도 계속 실패했다. 해결 가능한 작업은 대체로 더 이른 시점에 완료됐으며, 추가 상호작용은 많은 실패한 궤적을 구하지 못했다.

이 결과는 두 가지 쉬운 해결책을 약화시킨다. 에이전트에 더 많은 컨텍스트를 주는 것은 더 나은 메모리를 주는 것과 같지 않다. 더 많은 행동 기회를 주는 것도 더 나은 계획을 주는 것과 같지 않다.

압박은 컴퓨터 사용 에이전트, 로봇 시스템, 자동화 연구 도구를 만드는 개발자에게까지 확장된다. 이들 제품은 고정된 스크린샷 밖에서 작동한다. 그 환경은 에이전트와 외부 사건 모두에 반응해 변한다.

브라우저 에이전트는 기록을 찾고, 필터를 바꾸고, 갱신된 페이지를 해석한 뒤, 최종 제출을 검증해야 할 수 있다. 창고 로봇은 통로가 막힌 것을 발견한 후 경로를 변경해야 할 수 있다. 연구 에이전트는 상충하는 증거를 발견한 후 검색을 수정해야 할 수 있다.

각 경우에서 눈에 보이는 목표는 전제 조건을 수반한 의사결정을 숨긴다. 모델은 각각의 고립된 행동을 정확히 수행하고도 전체 작업에는 실패할 수 있다.

MineExplorer는 실패율이 브라우저나 로봇에 직접 이전될 것임을 증명하지는 않는다. 다만 숨겨진 의존성이 누적되면 짧은 멀티모달 시험에서의 성공이 제한적인 보장만 제공한다는 점을 보여준다.

이 차이는 조달과 배포 결정에 영향을 미쳐야 한다. 구매자는 모델이 화면을 인식하는지, 그럴듯한 다음 행동을 생성하는지만이 아니라, 완료된 워크플로 전반에서 에이전트가 어떤 성과를 내는지 물어야 한다.

진짜 문제는 시각 인식이 아니라 내비게이션이다

Claude Opus 4.6 실패의 거의 60%가 내비게이션에 기인한 것으로 분석돼, 상태를 유지하는 이동이 이 벤치마크의 가장 뚜렷한 병목으로 나타났다.

LongCat 팀의 실패 분석은 내비게이션 실수를 물체 상호작용이나 작업 추론 같은 문제와 분리한다. 내비게이션은 분석된 실패의 거의 60%를 차지했다.

이 수치가 모델이 단순히 길을 몰랐다는 뜻은 아니다. 열린 세계에서의 내비게이션은 공간 기억, 시각 인식, 행동 제어, 목표 관리를 결합한다.

에이전트는 자신이 어디에 있는지 알고, 어디를 지나왔는지 기억하며, 이동이 의도한 결과를 낳았는지 판단해야 한다. 또한 언제 경로를 포기하고 대안을 탐색할지도 결정해야 한다.

정적 시각 시험은 그 순환의 일부만 분리한다. 모델은 이미지를 보고 질문에 답한다. 그 답 때문에 장면이 변하지 않으며, 한 번의 잘못된 응답이 다음 관찰을 왜곡하지도 않는다.

Minecraft는 피드백을 만든다. 에이전트가 잘못된 방향으로 돌면 다음 이미지에는 다른 증거가 담긴다. 장애물에 막히면 반복된 이동 명령은 작업을 진전시키지 못한 채 시간을 소모한다.

그다음 모델은 경로가 실패했는지, 행동이 실패했는지, 아니면 원래 계획이 틀렸는지 진단해야 한다. 관찰이 안정적인 내부 지도 대신 개별 프레임으로 들어올 때 이 구분은 어렵다.

MineExplorer의 역량 점수는 이러한 해석을 뒷받침한다. Claude Opus 4.6은 지각 점수 61.91점과 추론 점수 54.71점을 받았다. 평가된 대부분의 모델에서 지각은 행동을 앞섰고, 행동은 추론을 앞섰다.

모델은 관련 세부 사항을 종종 식별할 수 있었다. 하지만 그 세부 사항을 환경 변화에도 견디는 조율된 전략으로 전환하는 데는 더 큰 어려움을 보였다.

이는 멀티모달 발전이 보통 제시되는 방식에 중요한 역전을 만든다. 더 나은 이미지 이해는 에이전트가 알아차릴 수 있는 것을 넓히지만, 동시에 그 관찰을 소비하는 계획 시스템의 약점을 드러낸다.

관련 물체를 열 개 감지하는 모델도 지금 무엇이 중요한지 결정해야 한다. 그 선택을 최종 목표와 연결하고, 관점이 바뀐 뒤에도 그 연결을 유지해야 한다.

이 벤치마크는 추론과 행동, 새 관찰을 교차시키는 ReAct 접근법을 활용한다. 원래의 ReAct 프레임워크는 모델이 환경 피드백을 통해 추론을 수정할 수 있도록 설계됐다.

MineExplorer는 더 긴 궤적에서 그 순환이 어디서 끊어질 수 있는지를 보여준다. 추론이 현재 상태와 분리되거나, 행동이 원래 목표에 기여하지 않게 되거나, 새로운 관찰이 필요한 수정을 촉발하지 못할 수 있다.

내비게이션은 이 세 가지 문제를 모두 증폭시킨다. 잘못된 위치에 놓인 에이전트는 잘못된 증거를 보고, 잘못된 상태 추정을 구축하며, 저하된 위치에서 추가 행동을 선택한다.

이는 더 긴 사고 사슬을 생성하는 것보다 더 어려운 문제다. 에이전트에는 지속적인 개체, 위치, 완료된 마일스톤, 실패한 경로, 미해결 의존성을 구조적으로 표현하는 방식이 필요하다.

원시 시각 이력은 이를 대체하기에 부족하다. 이는 카메라가 본 것을 저장할 뿐, 에이전트가 기억해야 할 것을 저장하지는 않는다.

같은 구분은 엔터프라이즈 에이전트에도 적용된다. 이전의 모든 화면에 대한 기록이 신뢰할 수 있는 워크플로 상태를 자동으로 만들어 주지는 않는다. 에이전트는 어떤 양식이 제출됐는지, 어떤 필터가 여전히 활성화돼 있는지, 어떤 요구사항이 아직 해결되지 않았는지를 알아야 한다.

물리 환경에서 작동하는 시스템에게 내비게이션은 물리적이면서도 인지적인 시험이 된다. 모델은 작업의 논리적 구조를 보존하면서 공간을 이동해야 한다.

따라서 MineExplorer의 60% 실패 비중은 시스템 수준의 작업이 필요하다는 점을 시사한다. 더 나은 로컬 컨트롤러, 명시적 지도, 인과적 메모리, 진행 상황 모니터링, 복구 정책은 더 강력한 기본 모델만큼 중요할 수 있다.

벤치마크가 측정하는 것과 측정하지 않는 것

MineExplorer는 유용한 스트레스 테스트를 제공하지만, 그 결과는 여전히 하나의 시뮬레이션 세계와 연구자가 정의한 작업 분포에 한정된다.

가장 강력한 회의적 논거는 외적 타당성과 관련된다. Minecraft는 일관된 규칙을 갖춘 동적인 3D 세계를 제공하지만, 가정, 공장, 사무실, 공공장소에서 발견되는 모든 난점을 재현하지는 않는다.

실제 로봇은 불확실한 물리 법칙, 센서 노이즈, 물리적 손상, 안전 제약에 직면한다. 컴퓨터 사용 에이전트는 숨겨진 애플리케이션 상태, 인증 장벽, 팝업, 변화하는 인터페이스를 마주한다.

Minecraft는 이러한 복잡성 중 상당수를 제거한다. 객체는 이산적이고, 물리 법칙은 반복 가능하며, 환경은 정확히 초기화할 수 있다.

이러한 통제는 장점이기도 하다. 연구자들은 동일한 조건에서 모델을 비교하고, 장비나 사용자를 위험에 빠뜨리지 않고 실패를 추적할 수 있다.

핵심은 MineExplorer를 물리 환경 지능의 보편적 점수가 아니라 진단 도구로 다루는 것이다. 41%라는 결과가 Claude가 관련 없는 실제 워크플로의 41%를 완료한다는 뜻은 아니다.

벤치마크의 지식 필터링도 면밀히 검토할 필요가 있다. 저자들은 언어 모델의 판단을 활용해 원자적 작업이 주로 일반 지식에 의존하는지, 아니면 Minecraft 특유의 관습에 의존하는지를 분류한다.

이 과정은 명백한 게임 지식 교란 요인을 줄인다. 그러나 남은 모든 작업이 친숙성 효과에서 자유롭다고 보장할 수는 없다.

Minecraft 동영상, 가이드, 게임 플레이 토론으로 학습된 모델은 여전히 일반적인 레이아웃과 행동을 인식할 수 있다. 모델 계열마다 이런 자료에 노출된 정도도 다를 수 있다.

arXiv 기록에 따르면 벤치마크 자체도 아직 진행 중인 작업이다. 향후 개정에서는 작업, 프롬프트, 컨트롤러, 평가 절차가 바뀔 수 있다.

특히 컨트롤러 설계가 중요하다. 멀티모달 모델은 추상적 추론만으로 게임을 조작하는 경우가 드물다. 주변의 에이전트 시스템이 모델 출력을 이동 및 상호작용 명령으로 변환한다.

따라서 성능은 기반 모델과 그 스캐폴딩을 모두 반영한다. 더 나은 매핑 시스템이나 저수준 컨트롤러는 모델을 바꾸지 않고도 결과를 개선할 수 있다.

벤치마크 저자들은 또 다른 한계도 인정한다. MineExplorer는 현재 경험적 평가에 초점을 맞추고 있지만, 인프라는 훈련도 지원할 수 있다.

벤치마크 환경에서 훈련하면 그 자체로 위험이 생긴다. 개발자가 공개 작업에 맞춰 직접 최적화하기 시작하면, 리더보드 향상은 일반적 탐색 능력보다 벤치마크 특화 능력을 반영할 수 있다.

완전히 공개된 MineExplorer 코드는 재현과 확장을 더 쉽게 만든다. 동시에 이후 모델 출시를 위한 오염과 과적합 문제도 더 중요하게 만든다.

독립 평가는 숨겨진 테스트 시나리오를 보존해야 한다. 또한 장면 레이아웃, 의존성 구조, 컨트롤러 구현, 프롬프트 형식을 다양화해야 한다.

역사적 맥락도 이러한 주의를 뒷받침한다. MinePlanner는 이전에 장기 계획 수립을 위한 45개의 Minecraft 작업을 공개했고, 많은 객체를 포함한 대규모 환경에서 기존 플래너들이 어려움을 겪는다는 사실을 확인했다.

MinePlanner 벤치마크는 상호작용형 멀티모달 탐색이 아니라 명제 및 수치 계획에 초점을 맞췄다. 그럼에도 결과는 Minecraft가 더 작은 계획 도메인에서는 드러나지 않는 확장성 문제를 노출할 수 있음을 보여줬다.

다른 시스템들은 지시 이행, 건설, 메모리, 개방형 기술을 살펴봤다. 이 프로젝트들은 서로 다른 질문을 위해 같은 게임을 사용하므로, 핵심 점수를 직접 비교해서는 안 된다.

MineExplorer의 구체적 기여는 지속적인 시각적 상호작용, 숨겨진 선행 조건, 다중 홉 작업 구성, 규칙 기반 마일스톤 평가의 결합에 있다.

이들의 “최초” 주장은 이 정의 안에서 해석해야 한다. MineExplorer 이전에도 Minecraft는 장기 연구의 무대가 됐다. 팀의 참신성 주장은 특정 평가 구조 아래에서 분 단위의 오픈월드 멀티모달 탐색에 관한 것이다.

또 다른 한계는 출시 직후 폭넓은 독립 반응이 부족하다는 점이다. 현재 상세한 해석 대부분은 저자들과 그들이 소속된 기술 채널에서 나온다.

측정된 결과는 검토할 수 있지만, 인과적 설명은 부분적으로 해석에 머문다. 예를 들어 내비게이션의 큰 실패 비중은 근본 원인이 매핑, 메모리, 계획, 행동 실행 중 무엇인지를 완전히 분리하지 못한다.

이런 불확실성이 핵심 발견을 지우지는 않는다. 숨겨진 선행 조건이 누적될수록 성공률은 급격히 떨어진다. 이는 추가 실험이 무엇을 분리해야 하는지 규정한다.

오픈소싱이 MineExplorer를 리더보드 그 이상으로 만드는 이유

이 공개가 중요한 이유는 연구자들이 더 나은 메모리, 컨트롤러 또는 훈련 방식이 장기 과제 실패 곡선을 완만하게 만들 수 있는지 시험할 수 있기 때문이다.

팀은 벤치마크 인스턴스를 구성하기 위해 멀티 에이전트 워크플로를 사용했다. 순서를 제어하는 오케스트레이터 아래에서 다섯 개의 전문 에이전트가 협력한다.

워크플로는 초기 작업 초안으로 시작한다. 이후 전문 및 검증 에이전트가 설계를 토론하고, 불일치를 식별하며, 장면, 의존성 그래프, 마일스톤 평가기를 수정한다.

저자들의 인간 평가에 따르면, 이 과정은 단일 에이전트 기준선 대비 인스턴스 유효성을 약 30%포인트 높였다. 또한 품질 점수를 약 0.5점 올렸으며, 네 홉 작업에서 가장 큰 효과를 보였다.

최종 공개본에는 인간 검증을 거친 813개 인스턴스가 포함돼 있다. 별도의 고난도 하위 세트는 더 높은 난이도로 선정된 100개 시나리오를 제공한다.

이 생성 파이프라인은 지속적인 벤치마크 문제를 해결한다. 수백 개의 상호작용 환경을 수작업으로 구축하는 것은 느리고, 제약 없는 모델 생성 작업에는 종종 불가능한 목표나 망가진 평가가 포함된다.

자동화된 합성과 인간 검증을 결합하면 중간 경로를 제공한다. 이 접근법은 품질 관문을 유지하면서 더 많은 작업을 생산할 수 있다.

같은 방식으로 테스트 사례뿐 아니라 훈련 시나리오도 생성할 수 있다. 연구자들은 의존성 그래프를 만들고, 샌드박스 장면을 인스턴스화하며, 결정론적 마일스톤 검사를 연결할 수 있다.

이는 장기 과제 에이전트가 시간이 흐르며 전개되는 실패를 연습해야 하기 때문에 중요하다. 정적 시각 데이터셋은 잘못된 길이나 놓친 선행 조건에서 회복하는 법을 가르칠 수 없다.

공개 인프라는 엔드투엔드 모델 확장에 대한 대안도 초대한다. 팀은 기본 모델을 고정한 채 명시적 공간 지도, 일화 기억, 인과 그래프, 계층형 플래너를 시험할 수 있다.

또 다른 실험은 고수준 계획과 저수준 이동을 분리할 수 있다. 모델이 목표를 선택하고, 전문 컨트롤러가 장애물 회피와 경로 실행을 담당하는 방식이다.

그러면 연구자들은 내비게이션 실패가 부족한 지능, 부족한 운동 제어, 또는 둘 사이의 불안정한 인터페이스를 반영하는지 물을 수 있다.

벤치마크는 커리큘럼 설계도 지원할 수 있다. 에이전트는 한 홉 작업부터 시작한 뒤 완료율이 안정되면 더 깊은 의존성 그래프로 진행할 수 있다.

다만 훈련 및 평가 세트는 구분된 상태로 유지돼야 한다. 공개 시나리오를 재사용하면 MineExplorer는 암기 테스트로 변질된다.

가장 유익한 향후 결과는 작은 리더보드 향상이 아닐 것이다. 한 홉에서 네 홉 작업으로 갈 때 더 완만한 하락세를 보이는 결과일 것이다.

전체 성공률을 높이면서도 동일한 붕괴 곡선을 유지하는 시스템은 로컬 역량을 개선한 것이다. 의존성이 깊어져도 성능을 유지하는 시스템은 장기 조정 능력을 개선한 것이다.

이 구분은 향후 보고 방식을 형성해야 한다. 전체 작업 성공률은 여러 행동을 하나의 숫자로 압축한다. 홉별 성능은 에이전트가 어느 지점에서 안정적으로 작동하지 못하는지 드러낸다.

공개된 버전은 외부 팀에 이러한 주장을 검증할 도구를 제공한다. 또한 전체 Minecraft 스택을 다시 구축하지 않고도 더 어려운 평가를 제안할 수 있게 한다.

Anthropic MineExplorer 결과 이후 주목할 점

다음 단계는 독립 재현, 개선된 내비게이션 시스템, 보지 못한 다중 홉 작업에서의 안정적인 성능에 초점을 맞춰야 한다.

첫 번째 신호는 41%의 전체 점수와 77%에서 12%로의 하락을 독립적으로 재현하는 것이다. 연구자들은 문서화된 컨트롤러, 프롬프트, 환경 설정 아래에서 Claude Opus 4.6 및 다른 모델을 다시 실행해야 한다.

유사한 재현 결과는 숨겨진 선행 조건이 일반적 실패 패턴을 유발한다는 주장을 강화할 것이다. 큰 차이가 난다면 에이전트 스캐폴딩이 초기 리더보드가 보여주는 것보다 더 크게 기여한다는 뜻일 수 있다.

두 번째 신호는 명시적 상태 및 내비게이션 시스템이 지배적인 실패 범주를 줄이는지 여부다. 유용한 실험은 원시 프레임 이력과 지도, 구조화된 메모리, 인과적 작업 그래프, 경로 복구 정책을 비교해야 한다.

의미 있는 개선은 추론이나 행동 성능을 희생하지 않고 내비게이션 실패를 줄여야 한다. 단순히 컨텍스트 윈도우를 늘리는 것만으로는 벤치마크의 핵심 비판에 답할 수 없다.

세 번째 신호는 새로운 모델이 홀드아웃된 네 홉 시나리오에서 보이는 성능이다. 개발자들은 전체 평균뿐 아니라 홉 수별 작업 성공률을 보고해야 한다.

한 홉 작업에서 더 높은 점수를 얻으면서도 네 홉 작업에서는 12% 수준에 머무는 모델은 장기 과제 격차를 해소하지 못한 것이다. 보지 못한 의존성 구조에서의 더 강한 결과가 일반 탐색 능력에 대한 더 나은 증거를 제공할 것이다.

독자들은 모델 개발자들이 공식 시스템 카드에 MineExplorer 또는 관련 평가를 채택하는지도 지켜봐야 한다. 포함된다면 장시간 멀티모달 상호작용이 표준 역량 목표가 되고 있음을 시사할 것이다.

개발자에게 실질적인 교훈은 이미 분명하다. 에이전트를 고립된 행동이나 정교한 데모만으로 평가하지 말아야 한다.

숨겨진 선행 조건, 변화하는 상태, 회복 기회를 포함한 완전한 워크플로를 시험하라. 에이전트가 목표를 놓치는 지점을 측정하고, 지각 오류를 내비게이션, 추론, 제어 실패와 구분하라.

엔터프라이즈 구매자도 같은 증거를 요구해야 한다. 모델의 벤치마크 순위는 통합된 에이전트가 다단계 프로세스를 일관되게 완료할 수 있는지에 대해 거의 말해주지 않는다.

MineExplorer가 물리 환경 AI 논쟁을 종결하지는 않는다. 다만 하나의 약점을 더 이상 무시하기 어렵게 만드는 재현 가능한 방법을 제공한다.

Anthropic MineExplorer 결과가 특히 드러내는 이유는 Claude Opus 4.6이 1위를 차지했기 때문이다. 테스트된 모델 중 가장 강력한 모델조차 작업 깊이가 한 홉에서 네 홉으로 증가하자 65%포인트를 잃었다.

이것이 벤치마크의 핵심적 반전이다. 현재의 멀티모달 모델은 자신이 신뢰성 있게 탐색할 수 없는 세계를 종종 설명할 수 있다.

따라서 신뢰할 만한 에이전트의 다음 이정표는 또 하나의 완벽한 스크린샷 답변이 아니다. 낯선 환경에서 꾸준히 진전을 이루고, 잘못된 방향으로 갔음을 알아차린 뒤 작업이 끝나기 전에 복구하는 능력까지 포함하는 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page