WorldWeaver, 멀티 에이전트 비디오 모델에 공유 메모리 부여… Minecraft는 첫 번째 시험대일 뿐
- Olivia Johnson
- 1일 전
- 10분 분량
WorldWeaver가 두 에이전트 비디오 모델에 명시적인 공유 메모리를 도입하며, 최근 프레임만으로 세계를 재구성하는 파이프라인에 도전장을 던졌다. W²라고도 불리는 이 모델은 동기화된 Minecraft 시점을 생성하는 동안 세계 상태 레지스터에 변화하는 정보를 저장한다. 연구 결과는 영속적인 인터랙티브 세계를 구현하려면 그럴듯한 비디오만으로는 충분하지 않음을 시사한다.
이 연구는 UCLA와 Adobe Research 연구진이 수행했다. 연구진은 2026년 7월 23일 WorldWeaver 논문을 제출했다. 핵심 경쟁 구도는 아키텍처에 있다. 영속적 공유 상태와, 롤링 컨텍스트 윈도 안에 압축된 관측 이력의 대결이다.
이 차이는 여러 에이전트가 정확히 같은 장면을 보지 못한다는 점에서 중요하다. 한 플레이어가 벽 뒤로 이동하는 동안 다른 플레이어는 밖에서 계속 건축할 수 있다. 보이는 픽셀만 기억하는 모델은 두 시점이 다시 연결될 때 숨겨진 변화를 재구성해야 한다.
반면 WorldWeaver는 공유 환경과 각 에이전트의 상태를 요약하는 학습 가능한 토큰을 유지한다. 새 청크가 생성될 때마다 이 토큰을 업데이트한다. 이후 청크는 최근 프레임과 가장 최근에 확정된 상태 모두에 의존한다.
연구진의 2인 Minecraft 평가 범위 안에서 보고된 성능 향상은 상당하다. WorldWeaver는 재학습한 Solaris 베이스라인의 81.0과 비교해 종합 세계 점수 105.1을 기록했다. 다만 실험은 여전히 범위가 좁고 시뮬레이터 기반이며, 실제 환경에서는 좀처럼 제공되지 않는 감독 신호에 의존한다.
WorldWeaver, 생성기 내부에 공유 상태를 배치하다
핵심 변화는 비디오 메모리를 한 번 더 개선한 것이 아니라, 에이전트와 롤아웃 단계 전반에 걸쳐 유지되는 별도의 상태 경로를 마련한 데 있다.
스트리밍 자기회귀 확산 모델은 비디오를 연속된 청크로 생성한다. 각 청크는 최근 프레임과 중간 어텐션 정보를 저장하는 키-값 캐시를 통해 다음 청크의 조건이 된다. 이 설계는 전체 이력을 다시 열어보지 않고도 생성을 관리 가능한 수준으로 유지한다.
한계는 관측 정보가 최근 윈도에서 사라질 때 나타난다. 생성기는 남아 있는 픽셀만으로 누락된 정보를 다시 추론해야 한다. 이 재구성 과정에서 위치, 객체 상태, 정체성 또는 관계의 불일치가 발생할 수 있다.
문제는 멀티 에이전트 환경에서 더 커진다. 각 카메라는 하나의 기저 환경을 부분적으로 투영한 화면을 제공한다. 유효한 모델은 특정 카메라의 시야 밖에서 일어나는 변화를 추적하면서 이러한 투영을 조정해야 한다.
WorldWeaver는 환경의 변화하는 상태를 위해 예약된 학습 가능 토큰인 세계 상태 레지스터를 추가한다. 이 토큰은 시각 토큰과 나란히 놓이지만 역할은 다르다. 레지스터는 개별 프레임이 활성 컨텍스트에서 벗어나도 유지돼야 하는 정보를 요약한다.
각 롤아웃 단계에서 생성기는 이전 레지스터, 최근 프레임, 현재 행동을 읽는다. এরপর 새 시각 청크를 만든 뒤 업데이트된 레지스터를 확정한다. 이 레지스터가 다음 청크의 조건이 된다.
이 과정은 관측과 상태 업데이트가 교차하는 순서를 만든다. 최근 프레임은 상세한 지역 증거를 제공한다. 레지스터는 시간과 시점 전반의 연속성을 위한 압축된 메커니즘을 제공한다.
이 구조는 단순히 프레임 캐시를 확장하는 것과 다르다. 더 큰 캐시는 더 많은 관측 정보를 보존하지만, 그 관측 정보는 여전히 카메라 의존적이며 시각적으로 인코딩돼 있다. 모델은 해당 정보가 필요할 때마다 관련 상태를 다시 추출해야 한다.
WorldWeaver는 모델이 그 추상화를 지속적으로 유지하도록 요구한다. 연구진은 레지스터를 영속적이면서 동적으로 업데이트할 수 있는 것으로 설명한다. 롤아웃이 진행되는 동안 모든 에이전트가 공유 표현에 증거를 보탠다.
이 접근법은 오래된 레지스터 이력도 제한한다. 추론 시 시스템은 모든 중간 상태를 누적하는 대신 초기 레지스터와 가장 최근에 확정된 레지스터를 유지한다. 이 선택은 이 메커니즘을 확장되는 메모리 아카이브보다 순환 상태에 가깝게 만든다.
프로젝트의 방법 개요는 동기화된 2인 Minecraft 롤아웃을 보여준다. 두 플레이어는 하나의 생성된 환경 안에서 행동하며, 숨겨진 표현은 이들의 위치와 주변 장면을 추적한다.
Minecraft는 환경이 정밀한 시뮬레이터 상태를 제공하기 때문에 유용하다. 연구진은 에이전트의 위치, 속도, 방향, 컨트롤러 입력을 측정할 수 있다. 또한 두 플레이어 모두 볼 수 없는 상공 시점도 포착할 수 있다.
이러한 신호는 숨겨진 상태를 검토 가능하게 만든다. 이를 통해 팀은 생성된 비디오가 두 카메라 전반에서 동일한 기저 세계에 대응하는지 물을 수 있다. 픽셀 품질만으로는 이 질문에 답할 수 없다.
따라서 이 소식의 핵심은 더 보기 좋은 Minecraft 영상이 아니다. 일관성을 기대되는 부수 효과에서 생성 과정의 감독 대상 구성 요소로 옮긴 데 있다.
여러 에이전트에게 프레임 이력이 부담이 되는 이유
관측 이력은 카메라가 본 것을 기록하지만, 인터랙티브 세계 모델은 그러한 관측이 사라진 뒤에도 무엇이 여전히 사실인지 보존해야 한다.
단일 카메라 비디오 모델은 작은 논리적 오류를 종종 감출 수 있다. 객체가 멀리 떨어진 프레임 사이에서 약간 이동하더라도 시퀀스는 여전히 그럴듯해 보일 수 있다. 멀티 에이전트 생성에서는 이러한 오류가 더 쉽게 드러난다.
Alpha가 블록을 설치하는 동안 Bravo가 다른 방향을 보고 있다고 가정해 보자. 이후 Bravo가 카메라를 다시 돌렸을 때 그 시점에는 해당 블록이 보여야 한다. Alpha의 행동은 Alpha의 비디오 스트림만이 아니라 하나의 공유 환경을 바꿔야 한다.
이제 플레이어들이 서로 떨어진 상황을 생각해 보자. 이들의 최근 프레임 이력에는 서로 다른 지형, 객체, 카메라 움직임이 담긴다. 다시 만나면 모델은 모순되는 지형을 만들어내지 않고 두 이력을 조정해야 한다.
롤링 시각 캐시는 이 작업을 제대로 뒷받침하지 못한다. 최근 관측을 우선시하고 상태를 외형과 얽어 놓는다. 보이지 않는 플레이어나 숨겨진 구조에 관한 정보는 새 프레임이 이전 프레임을 대체하면서 희미해질 수 있다.
명시적 상태는 현재 카메라와 무관한 사실을 보존할 수 있다. 위치, 방향, 인근 배치, 완료된 행동은 원본 픽셀이 윈도를 벗어나도 계속 이용할 수 있다.
WorldWeaver는 세 종류의 목표로 레지스터를 감독한다. 에이전트 통계는 위치, 속도, 방향을 포착한다. 조감도는 전역 배치를 제약하고, 장면 텍스트는 현재 행동에 대한 의미론적 설명을 제공한다.
각 목표는 서로 다른 실패 모드를 겨냥한다. 에이전트 통계는 지역적 움직임과 정체성을 보존하는 데 도움이 된다. 상공 표현은 두 에이전트에 공통의 기하학적 기준을 제공한다.
장면 텍스트는 레지스터가 저수준 시각 특징만이 아니라 의미 있는 관계를 유지하도록 유도한다. 논문의 캡셔닝 과정은 각 플레이어의 행동, 상대 위치, 거리, 시선 방향을 설명한다.
이 주석은 동기화된 에이전트 시점, 상공 프레임, 컨트롤러 입력을 사용한다. 이들은 생성된 각 청크 안에서 실제로 무슨 일이 일어났는지에 대한 이례적으로 직접적인 정보를 제공한다.
이 감독은 비디오 생성 목적 자체가 레지스터가 무엇을 기억해야 하는지 규정하지 않기 때문에 중요하다. 비감독 토큰은 유용한 정보, 관련 없는 질감, 또는 롤아웃 중 불안정해지는 혼합물을 흡수할 수 있다.
연구진은 상태 목표가 생성과 해석 가능성 모두를 바꿨다고 밝혔다. 학습 전용 디코딩 헤드는 레지스터에서 에이전트 좌표, 상공 특징, 장면 설명을 복원할 수 있다. 이 헤드들은 추론 시 제거되므로 배포 단계에 디코딩 작업을 추가하지 않는다.
이 지점에서 이 접근법은 기존 스트리밍 파이프라인에 압박을 가한다. 컨텍스트 윈도를 확장하면 이전 관측에 대한 접근은 개선되지만, 정식 공유 상태를 만들지는 못한다.
이 비교는 특히 2026년 2월의 멀티플레이어 월드 모델인 Solaris와 관련이 깊다. Solaris는 동기화된 멀티플레이어 데이터 수집과 플레이어 시점 간 조정된 생성을 도입했다.
Solaris는 1,264만 장의 멀티플레이어 프레임으로 구성된 데이터세트를 보고했다. 또한 이동, 메모리, 그라운딩, 건축, 시점 일관성을 포괄하는 평가 범주를 마련했다.
WorldWeaver는 이 환경을 채택하고 비교를 위해 동일한 학습 데이터로 Solaris를 재학습했다. 이어 생성 중 정보가 지속되는 방식을 바꿨다.
Solaris는 시각 토큰에 대한 플레이어 간 어텐션을 통해 관측을 동기화한다. WorldWeaver는 이러한 상호작용을 유지하면서 별도의 공유 상태 채널을 도입한다. 핵심 질문은 명시적 상태가 시각 컨텍스트보다 더 안정적으로 오래 유지되는지다.
논문의 결과는 이 실험에서 상태 기반 경로를 지지한다. 하지만 토큰 레지스터가 더 긴 컨텍스트, 외부 메모리 또는 구조화된 맵보다 항상 낫다는 점을 입증하지는 않는다.
이 연구가 보여주는 것은 더 좁은 범위지만 여전히 가치 있다. 두 비디오 스트림이 하나의 변화하는 환경을 설명해야 할 때, 명시적 상태 감독은 측정 가능한 논리적 일관성을 개선할 수 있다.
세계 상태 레지스터가 생성 메커니즘을 바꾸다
WorldWeaver는 시각 합성과 상태 유지를 분리한 뒤, 두 경로가 자체적으로 누적되는 오류를 견디도록 학습시킨다.
이 모델은 3단계 학습 과정을 따른다. 첫 번째 단계는 사전학습된 단일 플레이어 비디오 모델을 동기화된 멀티플레이어 교사 모델로 적응시키는 것이다. 양방향 어텐션은 이 교사 모델이 전체 클립을 관찰하면서 에이전트 간 장면 구조를 학습하도록 한다.
두 번째 단계는 교사 모델을 인과적 생성기로 전환한다. 인과적 생성은 각 출력이 시퀀스 내 해당 시점에서 이용 가능한 정보에만 의존한다는 뜻이다. 미래 프레임을 볼 수 없는 인터랙티브 스트림에 필요하다.
이 단계에서 프레임 토큰은 최근 시각 컨텍스트와 최신 레지스터를 사용한다. 레지스터 토큰은 지역 프레임 윈도와 선행 레지스터를 읽는다. 모델은 관측 예측과 상태 업데이트를 교차 수행한다.
레지스터는 확정되는 모든 단계에서 보조 감독을 받는다. 회귀 헤드는 에이전트 통계를 예측한다. 또 다른 디코더는 정렬된 조감도에 대응하는 특징을 예측한다.
텍스트 헤드는 장면 설명을 예측한다. 전체 학습 목적은 이러한 상태 손실을 확산 모델의 프레임 생성 손실과 결합한다.
이 결합 목적은 잠재적인 충돌을 만든다. 픽셀 생성은 세밀한 시각 재구성을 보상하는 반면, 상태 모델링은 압축되고 안정적인 정보를 보상한다. 그렇지 않으면 하나의 Transformer 가중치 집합이 두 역할을 모두 충족해야 한다.
WorldWeaver는 Mixture-of-Transformers 설계로 이 충돌을 해결한다. 이 아키텍처는 레지스터 토큰과 프레임 토큰에 별도의 파라미터 분기를 제공하면서, 이들 간의 공동 어텐션은 유지한다.
이 분리는 독립적인 모델을 사용하는 것과는 다르다. 시각 토큰과 상태 토큰은 여전히 동일한 인터리브 시퀀스 안에서 정보를 교환한다. 다만 각 토큰 유형은 자신의 역할에 맞춘 가중치를 받는다.
이 설계는 레지스터 감독이 더 풍부해질수록 더욱 유용해진다. 논문은 동일한 경로가 픽셀을 생성하고 검증 가능한 세계 의미론을 인코딩해야 할 때 밀집형 공유 가중치가 어려움을 겪을 수 있다고 보고한다.
세 번째 단계는 또 다른 실패 원인을 다룬다. 모델은 대개 정확한 과거 프레임으로 학습하지만, 배포 시에는 자체적으로 생성한 불완전한 출력에 의존한다. 그렇게 작은 오류는 생성된 모든 프레임이 다음 프레임의 컨텍스트가 되면서 누적된다.
WorldWeaver는 모델이 자체 생성 결과를 바탕으로 앞으로 전개되도록 훈련하는 방법인 Self Forcing을 적용한다. 이 기법은 추론 전에 시스템을 실제 배포 환경과 유사한 조건에 노출한다.
여기서 문제는 프레임 드리프트와 레지스터 드리프트를 모두 포함한다. 잘못 생성된 시점은 다음 상태 업데이트를 오염시킬 수 있다. 오염된 상태는 다시 모든 에이전트의 이후 시점을 왜곡할 수 있다.
따라서 모델은 훈련 중 프레임과 확정된 레지스터를 모두 롤아웃한다. 깨끗한 참조 데이터뿐 아니라 자신이 실제로 생성한 이력에서 이어가는 법을 학습한다.
추론 스케줄은 네 번의 디노이징 단계를 사용한다. 각 프레임이 디노이징된 뒤 모델은 이를 순환형 시각 캐시에 추가한다. 이어 다음 생성 단계를 시작하기 전에 레지스터를 업데이트한다.
이 순환은 논문의 핵심 메커니즘이다. WorldWeaver는 단순히 과거 관측을 검색하거나 생성 후 메타데이터를 덧붙이는 방식이 아니다. 상태 업데이트가 자기회귀 루프에 직접 참여한다.
다른 연구들은 더 명시적인 외부 메모리로 같은 문제에 접근해 왔다. 예를 들어 MultiGen은 편집 가능한 멀티플레이어 디퓨전 월드를 위해 메모리, 관측, 동역학을 분리한다.
MultiGen의 외부 표현은 사용자가 환경 구조를 변경할 수 있게 한다. WorldWeaver는 학습된 토큰 형태로 생성기 내부에 상태를 유지한다. 이 방식은 메모리를 작게 만들지만, 직접적인 편집성은 떨어진다.
이 대조는 중요한 설계 선택을 드러낸다. 구조화된 외부 맵은 점검 가능한 제어를 제공하지만 시스템이 그 표현을 유지해야 한다. 내부 레지스터는 유연성을 제공하지만 모호하거나 잘못된 상태를 숨길 수 있다.
WorldWeaver는 그 중간 지점을 차지하려 한다. 레지스터는 추론 중 잠재 상태로 남지만, 명시적인 훈련 목표가 그 내용을 부분적으로 복원 가능하게 만든다. 이 시스템은 검증을 완전히 포기하지 않으면서 내부 상태를 학습한다.
이 메커니즘은 합성 게임을 넘어선 활용 가능성도 시사한다. 로봇 플릿 시뮬레이터는 공유 물체 위치를 유지하면서 개별 관측을 생성할 수 있다. 훈련 환경은 한 에이전트의 행동이 다른 에이전트가 이후 마주치는 상황을 어떻게 바꾸는지 모델링할 수 있다.
디지털 트윈 시스템도 서로 다른 센서가 불완전한 시야를 제공할 때 유사한 문제에 직면한다. 지속 상태는 시뮬레이션 환경이 계속 진화하는 동안 이러한 시야 전반의 증거를 통합할 수 있다.
다만 WorldWeaver는 이러한 응용을 검증하지 않았다. 그 근거는 두 에이전트, 동기화된 행동, 이례적으로 접근하기 쉬운 정답 데이터를 갖춘 통제된 Minecraft 세션에서 나온다.
이 아키텍처는 분명한 기술적 주장을 제시한다. 더 광범위한 응용에 관한 주장은 여전히 열려 있다.
점수는 개선됐지만, 현실 세계 데이터 격차는 남아 있다
보고된 성과 향상은 명시적 상태 모델링을 뒷받침하지만, WorldWeaver가 시뮬레이터 감독 없이 복잡한 상태를 복원할 수 있음을 보여주지는 않는다.
연구진은 이동, 그라운딩, 메모리, 건설, 일관성을 평가한다. 시각-언어 모델 정확도와 생성된 이미지와 참조 이미지의 시각적 분포를 비교하는 Fréchet Inception Distance, 즉 FID를 사용한다.
또한 이 측정값들을 종합 월드 점수로 결합한다. WorldWeaver는 이 지표에서 105.1점을 기록한다. 재훈련된 Solaris 모델은 81.0점, 프레임 연결 기준선은 49.1점을 기록한다.
가장 큰 정확도 개선은 상태에 민감한 범주에서 나타난다. 그라운딩은 Solaris의 81.3에서 WorldWeaver의 93.8로 상승한다. 건설은 9.4에서 28.1로 증가한다.
일관성은 57.8에서 76.6으로 높아진다. 이동도 개선돼 Solaris의 79.7과 비교해 82.8에 도달한다.
메모리에서는 우위가 더 작다. WorldWeaver는 46.9를 기록하고 Solaris는 43.8에 도달한다. 프레임 연결 기준선의 점수는 37.5다.
FID 결과는 더 엇갈린다. WorldWeaver는 이동과 일관성을 포함한 여러 범주에서 개선되지만, 모든 시각 비교에서 선두를 차지하지는 않는다. 메모리 FID는 64.8로, Solaris의 61.2와 비교된다.
이 차이는 중요하다. 논리적 상태와 시각적 품질은 관련돼 있지만 동일하지는 않다. 모델은 올바른 사건을 유지하면서도 이를 부정확하게 렌더링할 수 있다. 반대로 이전 행동과 모순되는 매력적인 프레임을 만들 수도 있다.
WorldWeaver의 더 높은 종합 결과는 레지스터가 결합된 목표에 도움이 된다는 점을 시사한다. 그렇다고 모든 품질 상충관계를 없애는 것은 아니다.
절제 실험도 상태 메커니즘을 뒷받침한다. 연구진은 감독 유형을 달리하고, 공유된 조밀 가중치와 분리된 트랜스포머 아키텍처를 비교한다.
결과는 서로 다른 상태 목표가 서로 다른 행동에 도움이 된다는 점을 나타낸다. 어떤 단일 신호도 모든 범주를 지배하지 않는다. 결합된 감독은 보고된 전체 구성 중 가장 강력한 성능을 낸다.
반지도 실험은 가장 명백한 확장성 우려를 다룬다. 팀은 라벨이 지정된 세트를 1,000개 클립으로 고정한 뒤, 라벨이 없는 비디오를 늘려가며 추가한다.
라벨 없는 클립이 없을 때 종합 월드 점수는 63.2다. 라벨 없는 클립 5,000개를 추가하면 82.3으로 오른다. 라벨 없는 클립 10,000개에서는 점수가 90.3에 도달한다.
이 결과는 더 작은 라벨링 컬렉션이 레지스터 의미론의 기준점 역할을 하고, 일반 비디오가 생성을 개선할 수 있음을 시사한다. 라벨링된 상태의 필요성을 없애지는 않지만, 이 통제된 환경에서는 필요한 비율을 낮춘다.
몇 가지 주의점은 남아 있다.
첫째, 이 논문은 arXiv 프리프린트이며 아직 동료 심사를 통과하지 않았다. 평가 프레임워크, 종합 점수, 아키텍처 결론은 독립적인 재현이 필요하다.
둘째, 모델은 Minecraft에서 작동한다. 이 환경은 이산 블록, 접근 가능한 컨트롤러 입력, 깔끔한 동기화, 정확한 시뮬레이터 상태를 갖춘다. 실제 장면은 이와 동등한 주석을 거의 제공하지 않는다.
창고 로봇은 반사 표면, 변형 가능한 물체, 사람, 이동하는 장비를 관찰할 수 있다. 신뢰할 수 있는 조감도나 숨겨진 상호작용의 완전한 기록이 없을 수 있다.
셋째, 실험은 두 에이전트를 다룬다. 시점이 추가되면 정보와 충돌이 모두 늘어난다. 레지스터는 더 많은 정체성, 관측, 상호작용을 모호한 요약으로 붕괴시키지 않고 보존해야 한다.
넷째, 레지스터 자체도 드리프트할 수 있다. Self-forcing은 모델을 자신의 오류에 노출하지만, 잘못된 업데이트 뒤의 복구를 보장할 수는 없다. 한 번의 잘못된 상태가 이후 모든 에이전트에 영향을 미칠 수 있다.
다섯째, 보고된 상태는 부분적으로만 해석 가능하다. 훈련 헤드는 선택된 목표를 디코딩하지만, 이 프로브가 레지스터에 저장된 모든 것을 드러내지는 않는다. 높은 프로브 정확도가 완전하거나 인과적으로 올바른 표현을 보장하지는 않는다.
이 모델은 자동화된 장면 설명에도 의존한다. 이 캡션들은 시각적 관측과 함께 정답 컨트롤러 입력을 사용한다. 현실 세계 데이터는 더 약하고, 더 잡음이 많거나, 추정된 행동 라벨을 필요로 한다.
저자들은 논문에서 핵심 한계를 인정한다. 주요 개선은 추가 상태 감독에 의존하는 반면, 현실 세계의 상태는 더 복잡하고 종종 उपलब्ध하지 않다.
이 인정은 연구의 실제 최전선을 규정한다. WorldWeaver는 강한 관측 가능성 아래에서 신뢰할 만한 상태 아키텍처를 제시한다. 진실이 숨겨진 환경에서 상태 발견 문제를 해결한 것은 아니다.
공유 상태의 확장성을 보여줄 증거
다음 증거는 두 플레이어 Minecraft를 넘어 상태 레지스터를 검증하고, 계산상 상충관계를 분리하며, 잘못된 업데이트 이후의 복구를 측정해야 한다.
첫 번째 신호는 공개된 코드와 평가 설정에서의 독립적인 재현이다. 연구자들은 보고된 105.1 월드 점수를 검증하고, 범주별 향상이 서로 다른 랜덤 시드에서도 유지되는지 살펴봐야 한다.
재현 과정은 종합 지표도 점검해야 한다. 결합 점수는 전반적 성능을 명확히 할 수 있지만, 논리적 정확도와 시각적 충실도 사이의 상충관계를 가릴 수 있다.
두 번째 신호는 불완전한 감독을 갖춘 더 폭넓은 환경이다. 유용한 후속 연구는 동기화된 에이전트를 유지하되, 정확한 상공 맵이나 시뮬레이터 좌표는 제거하는 방식일 수 있다.
이 시험은 레지스터가 추정된 기하 정보, 잡음이 있는 언어, 부분적인 행동 기록으로부터 안정적인 상태를 학습할 수 있는지 보여줄 것이다. 성공한다면 로보틱스와 체화 시뮬레이션에 대한 근거가 강화될 것이다.
실패한다면 WorldWeaver의 성과가 레지스터 설계 자체보다 특권적 주석에 더 크게 의존한다는 점을 시사할 것이다. 그 결과 역시 미래 시스템에 정보를 제공하겠지만, 아키텍처의 실용적 범위를 좁히게 된다.
세 번째 신호는 에이전트 수와 시간 범위 전반의 확장이다. 두 시점은 중요한 출발점을 제공하지만, 추가 행위자가 같은 환경을 수정할수록 공유 상태는 더 어려워진다.
향후 평가는 네 명 이상의 에이전트에서 일관성이 어떻게 달라지는지 추적해야 한다. 또한 레지스터 용량, 캐시 크기, 누적 오류가 제한 요인이 되는 시점도 보고해야 한다.
더 긴 롤아웃에는 표적화된 스트레스 테스트가 필요하다. 한 에이전트가 물체를 숨기고 해당 지역을 떠난 뒤, 원래 프레임이 캐시에서 사라진 후 돌아올 수 있다. 첫 번째 에이전트가 없는 동안 다른 에이전트가 그 물체를 수정할 수도 있다.
이러한 테스트는 지속 상태와 단기 시각 회상을 분리할 것이다. 또한 레지스터가 보이지 않는 관계를 업데이트하는지, 아니면 단지 압축된 최근 이력을 저장하는지를 드러낼 것이다.
연구자들은 수정 행동도 측정해야 한다. 한 시점이 잘못된 물체나 위치를 생성하면, 이후 증거가 공유 상태를 바로잡아야 한다. 그렇지 않으면 명시적 메모리는 국지적 환각을 시스템 전체의 확정 사항으로 바꿀 수 있다.
외부 메모리 시스템은 유용한 비교 대상이다. 구조화된 맵은 기하 구조를 강제하고 직접 편집을 지원할 수 있지만, 자체적인 재구성 부담을 수반한다. 학습된 레지스터는 유연성을 유지하지만 감사하기는 더 어렵다.
설득력 있는 벤치마크는 동일한 데이터와 계산 조건에서 두 접근법을 비교해야 한다. 하나의 기준선을 결정적인 것으로 취급하는 대신, 긴 컨텍스트, 잠재 레지스터, 명시적 외부 상태를 포함해야 한다.
계산 비용 보고도 중요해질 것이다. 논문에 따르면 훈련 전용 감독 헤드는 추론 작업을 추가하지 않는다. 하지만 레지스터 토큰과 분리된 트랜스포머 가중치는 여전히 메모리, 훈련 비용, 생성 처리량에 영향을 준다.
실시간 인터랙티브 시스템은 이러한 비용과 일관성 향상 사이의 균형을 맞춰야 한다. 지나치게 느린 공유 상태는 반응성 있는 에이전트, 게임, 로보틱스 시뮬레이션을 지원할 수 없다.
WorldWeaver는 하나의 좁은 질문에 유용한 답을 제공한다. 최근 비디오 프레임은 공유 세계를 정의하기에 충분하지 않다. 레지스터는 생성기가 시점 전반의 사실을 명시적으로 유지할 공간을 제공한다.
더 어려운 질문은 시뮬레이터가 답을 알려주지 않을 때 그러한 사실을 학습할 수 있는지다. 다중 에이전트 월드 모델을 평가하는 개발자들은 이 경계를 면밀히 지켜봐야 한다.
특권적 라벨이 사라진 뒤에도 미래 시스템은 상태를 유지할까? 한 에이전트가 오류를 도입한 뒤 공유 메모리를 수정할 수 있을까? 에이전트 수가 늘어나도 일관성을 유지할까?
이러한 테스트는 WorldWeaver가 재사용 가능한 아키텍처인지, 아니면 강력한 Minecraft 결과인지 판정할 것이다. 현재로서는 논쟁을 더 정밀하게 만든다. 월드 모델은 최신 이미지뿐 아니라 세계 자체를 기억해야 한다.