Danijar Hafner의 월드 모델 에이전트가 맞닥뜨린 가장 어려운 시험: 예기치 못한 상황
- Sophie Larsen

- 50분 전
- 13분 분량
Danijar Hafner는 제품을 대부분 공개하지 않은 채 휴머노이드 로봇으로 가득한 비밀 스타트업으로 자신의 월드 모델 에이전트를 옮겼다. 보도에 따르면 Embo라는 이름의 이 회사는 그의 핵심 연구 아이디어를 직접 시험하는 곳이다. 에이전트는 현실 세계에서 행동하기에 앞서 가능한 미래를 미리 연습해야 한다는 것이다.
이 접근법은 통제된 환경에서 이미 인상적인 성과를 냈다. Hafner의 Dreamer 연구는 Minecraft에서 다이아몬드를 수집하는 데 필요한 긴 연속 행동을 포함해, 상상한 경험을 통해 에이전트를 훈련했다. 물리적 로봇은 잘못된 예측이 실제 손상으로 이어질 수 있기 때문에 더 어려운 문제를 제기한다.
시점 또한 중요성을 높인다. Hafner의 전 직장인 Google DeepMind는 휴머노이드와 기타 기계 전반으로 Gemini Robotics를 확장하고 있다. 다른 자금력이 풍부한 로보틱스 기업들도 범용 제어 모델을 추진 중이다. Hafner는 더 큰 규모의 시연 데이터를 암기하는 것보다 예측, 계획, 적응이 더 중요해질 것이라고 보고 있다.
Danijar Hafner의 월드 모델 에이전트, 화면을 떠나다
새 벤처는 상상 속 미래를 다루던 연구 프로그램을 물리적 로보틱스 기업으로 전환한다.
원문 스타트업 프로필에 따르면, Hafner의 간소한 사무실은 샌프란시스코 SoMa 지구에 자리한다. 회사는 문에 이름조차 표시하지 않은 채 비밀 운영 모드를 유지하고 있다.
보도에 따르면 미완성 공간에는 휴머노이드 로봇들이 배치돼 있다. 이들은 형태와 크기가 다양하며, 일부는 중국에서 들여왔다. 이 기계들은 Hafner가 수년간 개발해 온 계획 시스템에 물리적 몸체를 제공한다.
보도에 따르면 Hafner는 2025년 가을 Google DeepMind를 떠났다. 그의 퇴사는 Dreamer 연구 계보를 대형 연구소에서 독립적인 상업적 노력으로 옮겼다. 공개 보도와 업계 디렉터리는 이 스타트업을 Embo로 지목하지만, 웹사이트와 제품 범위, 사업 모델은 여전히 불분명하다.
회사가 제시하는 과제는 설명하기는 쉽지만 해결하기는 어렵다. 낯선 집에 들어가는 로봇은 모든 방을 정확히 기록한 데이터에 의존할 수 없다. 새 가구, 옮겨진 물건, 변하는 조명, 사람, 반려동물, 불완전한 지시를 이해해야 한다.
익숙한 동작만 재현하도록 훈련된 로봇은 조건 하나가 바뀌어도 실패할 수 있다. 누군가 컵을 옮긴 뒤에도 예상한 위치로 손을 뻗을 수 있다. 의자가 길을 막은 뒤에도 계속 원래의 보행 경로를 따를 수 있다.
Hafner의 대안은 에이전트에 내부 예측 모델을 부여한다. 월드 모델은 행동 뒤 환경이 어떻게 바뀌는지 추정하는 학습된 표현이다. 에이전트는 움직이기 전에 이러한 추정치를 활용해 가능한 행동을 평가할 수 있다.
이 과정은 하나의 긴 계획을 생성한 뒤 맹목적으로 따르는 방식과 다르다. 유능한 물리적 에이전트는 예측하고, 행동하고, 결과를 관찰한 뒤 계획을 갱신해야 한다. 새로운 관찰은 이전의 내부 예측이 불완전했음을 드러낼 수 있다.
따라서 이 스타트업은 까다로운 명제 위에 서 있다. 현실이 훈련 데이터와 다를 때도 월드 모델은 유용성을 유지해야 한다. 또한 사건이 전개되는 동안 로봇이 반응할 수 있을 만큼 빠르게 작동해야 한다.
Dreamer는 이 명제의 연구 기반을 제공한다. Hafner와 그의 공동 연구자들은 최근의 언어 모델 에이전트 물결 이전부터 이 계열을 개발하기 시작했다. 이들의 연구는 텍스트만 예측하는 대신 상호작용을 통해 행동을 학습하는 데 초점을 맞췄다.
첫 Dreamer 시스템은 압축된 내부 표현 안에서 연습함으로써 시각 입력으로부터 장기 행동을 학습했다. DreamerV2는 이 접근법을 Atari 게임 전반으로 확장했다. DreamerV3는 동일한 기본 알고리즘이 여러 다른 영역에서 작동하도록 만들고자 했다.
이 발전 과정은 Hafner가 검증되지 않은 개념적 구호를 내세워 로보틱스에 진입하는 것이 아니라는 점에서 중요하다. 그는 문서화된 연구 프로그램을 훨씬 덜 관대한 환경에 적용하고 있다. 남은 질문은 과거의 성과가 어디까지 이전될 수 있느냐다.
게임은 에이전트에게 정의된 행동과 측정 가능한 보상을 제공한다. 휴머노이드 로봇은 잡음이 많은 센서, 마모된 부품, 불확실한 마찰, 숨겨진 속성을 가진 물체와 마주한다. 사람 역시 시뮬레이션 속 캐릭터보다 예측하기 어렵게 행동한다.
Embo의 초기 의미는 이 전환에서 나온다. 이 회사는 단순히 또 하나의 휴머노이드 몸체를 만드는 것이 아니다. 주변 환경이 바뀔 때 몸체가 무엇을 해야 하는지 결정하는 지능 계층에 집중하는 것으로 보인다.
지금 상상된 경험이 중요한 이유
로보틱스 기업에는 모든 실수를 반드시 필요한 학습으로 취급하지 않으면서 제한된 물리적 경험으로 학습하는 에이전트가 필요하다.
현대 AI 모델은 방대한 디지털 데이터세트의 혜택을 받아왔다. 로보틱스에는 이와 동등한 수준의 깨끗하고 다양하며 행동 라벨이 붙은 경험 공급이 부족하다. 물리적 움직임을 기록하려면 시간이 들고, 하드웨어가 필요하며, 안전 위험도 수반한다.
언어 모델은 다른 문서를 처리하면서 누군가의 발 위에 떨어뜨리지 않는다. 새 훈련 데이터를 수집하는 로봇은 충돌하거나, 물체를 손상시키거나, 관절을 과열시키거나, 사람이 재설정해야 할 수 있다. 이러한 제약은 물리적 시행착오를 유난히 비싸게 만든다.
시뮬레이션은 도움이 되지만, 시뮬레이션 세계는 현실을 단순화한다. 질감, 접촉력, 센서 잡음, 변형 가능한 재료, 인간 행동은 물리적 세계의 대응물과 다를 수 있다. 시뮬레이터에서 작동하는 정책은 배포 후 실패할 수 있다.
월드 모델 에이전트는 가능한 중간 경로를 제시한다. 시스템은 실제 관찰로부터 학습한 뒤, 다음에 일어날 수 있는 일을 내부적으로 예측한다. 훈련은 모든 후보 행동을 하드웨어에서 실행하지 않고도 이러한 상상된 궤적을 활용할 수 있다.
Hafner의 초기 DayDreamer 프로젝트는 물리적 기계에서 이 원리를 시험했다. 해당 로봇 학습 논문은 에이전트가 시뮬레이터에 의존하지 않고 현실 세계에서 직접 학습하는 방식을 설명했다.
연구진은 네 종류의 로봇에서 DayDreamer를 평가했다. 과제에는 이동, 물체 조작, 시각 내비게이션이 포함됐다. 한 사족보행 로봇은 물리적 기계가 수집한 경험을 바탕으로 회복하고, 일어서고, 걷는 법을 배웠다.
이 실험들이 범용 가정용 로봇을 입증한 것은 아니다. 다만 학습된 월드 모델이 광범위한 시뮬레이션과 수작업 과제 설계에 대한 의존도를 줄일 수 있음을 보여줬다. 이 증거는 이제 Embo의 더 큰 승부를 뒷받침한다.
DreamerV3는 재사용 가능한 알고리즘의 가능성을 확장했다. 동료 심사를 거친 DreamerV3 연구에 따르면, 이 시스템은 150개가 넘는 과제에 하나의 구성을 사용했다. 적용 영역에는 연속 제어, Atari 게임, Minecraft가 포함됐다.
Minecraft 결과는 특히 눈에 띄는 시연이 됐다. 다이아몬드를 수집하려면 탐험, 자원 수집, 도구 제작, 그리고 서로 의존하는 많은 행동이 필요하다. 대부분의 중간 동작은 즉각적인 성공 신호를 내지 않기 때문에 보상은 드물게 주어진다.
DreamerV3는 인간의 게임플레이 데이터나 단계적 커리큘럼 없이 픽셀 데이터만으로 이 과제를 학습했다. 이 결과는 상상된 궤적이 즉각적 반응뿐 아니라 먼 목표까지 뒷받침할 수 있음을 시사했다.
이 능력은 물리적 에이전트와 직접 연결된다. 방을 청소하는 일은 가치가 나중에야 드러나는 여러 단계로 이뤄진다. 로봇은 먼저 장애물을 옮기고, 용기를 열고, 물건을 꺼낸 뒤, 올바른 곳에 놓아야 할 수 있다.
반응형 시스템은 익숙한 동작을 각각 완수하면서도 더 큰 목표는 놓칠 수 있다. 장기 계획에는 초기 선택이 이후의 가능성을 어떻게 바꾸는지 추적하는 능력이 필요하다. Hafner의 연구는 예측 모델을 그 연결을 유지하는 메커니즘으로 다룬다.
Dreamer 4는 이 아이디어를 한층 더 밀어붙였다. 이 시스템은 복잡한 상호작용을 시뮬레이션하는 확장 가능한 월드 모델 안에서 행동을 훈련한다. 보도에 따르면 이 시스템은 훈련 중 게임과 상호작용하지 않고 오프라인 경험만으로 Minecraft의 다이아몬드 과제를 완료했다.
Dreamer 4 프로젝트는 이 과제가 20,000회를 넘는 마우스와 키보드 행동 시퀀스를 포함한다고 설명한다. 또한 OpenAI의 초기 Video PreTraining 에이전트보다 100배 적은 데이터를 사용했다고 밝힌다.
이는 게임 안에서 나온 연구 결과이지, 휴머노이드가 낯선 주방을 안전하게 다룰 수 있다는 증거는 아니다. 그럼에도 이는 로보틱스 개발자들이 직면한 두 가지 압박을 다룬다. 긴 행동 시퀀스를 겨냥하고, 온라인 실험에 대한 의존도를 낮춘다.
긴급성은 로봇 하드웨어와 로봇 적응성 사이의 격차가 커지는 데서 나온다. 휴머노이드 몸체는 개선됐지만, 많은 시연은 여전히 준비된 환경에서 이뤄진다. 관련된 모든 물체가 신중하게 배치된 상태에서도 시스템은 유능해 보일 수 있다.
상업적 배포에는 덜 연출된 능력이 필요하다. 유용한 로봇은 놓친 잡기 동작 뒤에 회복하고, 달라진 주변 환경을 해석하며, 더 안전한 대안을 선택해야 한다. 이러한 요구사항은 불확실성 아래의 예측을 시장의 핵심으로 만든다.
예측이 모방 우선 로봇에 도전하다
핵심 경쟁은 결과를 모델링하는 에이전트와 주로 시연에서 발견한 패턴을 재현하는 시스템 사이에서 벌어진다.
최근의 로봇 학습 상당수는 비전-언어-행동 모델을 기반으로 한다. VLA 모델은 이미지와 지시를 물리적 행동에 연결한다. 훈련에는 사람이거나 다른 시스템이 과제를 완료한 방식을 보여주는 시연이 흔히 활용된다.
이 접근법에는 분명한 장점이 있다. 시연은 로봇이 모든 것을 독립적으로 발견하도록 강요하지 않으면서 유용한 행동을 제공한다. 대규모 사전학습 모델은 시각 인식, 언어 이해, 폭넓은 개념 지식에도 기여할 수 있다.
그러나 시연은 기록된 상황에서 일어난 일을 설명한다. 이것만으로 환경이 어떻게 작동하는지를 자동으로 설명하지는 않는다. 로봇은 서로 다른 선택의 결과에 대해서는 거의 배우지 못한 채 이미지와 행동을 연관지을 수 있다.
월드 모델 에이전트는 이러한 결과를 중심에 둔다. 예측 모델은 후보 행동 아래의 미래 상태를 추정한다. 액터는 행동을 제안하고, 크리틱은 상상된 결과 중 어떤 것이 목표를 가장 잘 뒷받침하는지 추정한다.
DreamerV3는 이러한 액터, 크리틱, 월드 모델 구조를 사용한다. 월드 모델은 결과를 예측하고, 크리틱은 이를 평가하며, 액터는 행동을 선택한다. 구성 요소들은 수집된 경험으로부터 함께 학습한다.
이 메커니즘은 에이전트가 관찰한 정확한 궤적을 넘어 연습할 수 있는 방법을 제공한다. 알려진 상태에서 대안적 내부 롤아웃을 생성할 수 있다. 유용한 상상 경험은 또 다른 물리적 시도 없이도 행동을 형성한다.
이 차이를 명확한 기술적 분열로 과장해서는 안 된다. VLA 시스템도 계획, 피드백, 예측 구성 요소를 포함할 수 있다. 월드 모델 시스템도 시연, 언어, 비디오에서 학습할 수 있다.
실제 견해 차이는 강조점에 있다. 모방 우선 전략은 대규모 성공 행동 데이터 모음에서 출발한다. Hafner의 경로는 에이전트가 다음에 무슨 일이 일어나는지 평가하게 하는 동역학 학습에서 출발한다.
Google DeepMind의 경쟁 연구는 이러한 접근법들이 얼마나 빠르게 수렴하고 있는지를 보여준다. Gemini Robotics 2 시스템은 언어, 시각 이해, 계획, 운동 제어를 결합한다.
Google은 이 모델이 발끝부터 손끝까지 휴머노이드를 제어하고, 물체를 조작하며, 여러 로봇을 조율할 수 있다고 말한다. 또한 몇 시간 안에 새로운 로봇 몸체에 적응할 수 있다고 주장한다. 이러한 설명은 Google 측의 주장으로, 더 폭넓은 독립적 평가가 필요하다.
Gemini Robotics는 파운데이션 모델의 지식과 Google의 연구 인프라를 활용한다. Hafner의 스타트업은 예측 모델을 통한 강화학습에 집중된 전문성을 제공한다. 두 접근법 모두 상황이 사전에 짠 각본과 달라질 때 적응하는 기계를 목표로 한다.
Skild AI는 또 다른 변주를 제시한다. 이 회사는 서로 다른 로봇 몸체와 작업 전반에서 작동하는 단일 범용 로봇 두뇌를 목표로 한다고 설명한다. 그 전략은 폭넓은 데이터 수집과 대규모 사전학습에 크게 의존한다.
Physical Intelligence는 다양한 작업과 로봇 형태에 걸쳐 학습된 범용 로봇 정책을 추구해 왔다. 이 회사의 시스템은 시각 및 언어 입력을 연속적인 행동으로 연결한다. 시연에서는 서로 다른 물리적 플랫폼 간 전이 능력을 강조한다.
이러한 경쟁사들은 Embo에 두 방향에서 압박을 가한다. 더 많은 데이터를 수집하고 더 많은 하드웨어를 배치할 수 있다. 또한 계획 수립과 사전학습 모델을 결합해, 순수한 세계 모델 정체성이 지닌 개념적 우위를 좁힐 수도 있다.
따라서 Embo는 우아한 아키텍처 이상을 보여줘야 한다. 상상 기반 훈련이 실제 로봇의 적응성, 안전성 또는 데이터 효율성을 개선한다는 증거가 필요하다. 이러한 이점은 강력한 기준선과 비교해도 분명하게 드러나야 한다.
결정적인 평가는 훈련 이후 변화를 도입하는 방식이 될 것이다. 연구자들은 물체를 옮기고, 방의 배치를 바꾸고, 도구를 교체하거나, 작업을 중단할 수 있다. 이 시험은 로봇이 광범위한 재훈련 없이 다시 계획을 세우는지 측정하게 된다.
성공에는 회복 능력도 포함돼야 한다. 준비된 시험은 완료하지만 한 번의 물체 잡기 실패 뒤 멈춰 버리는 로봇은 예기치 못한 상황을 숙달한 것이 아니다. 첫 번째 예측이 틀렸을 때 계획 수립은 가치를 갖는다.
이 요구 사항은 Hafner의 전략을 로봇에게 모든 것을 예측하도록 가르치는 것보다 더 야심 찬 것으로 만든다. 어떤 모델도 모든 물리적 사건을 열거할 수는 없다. 실질적인 목표는 예측 오류를 인식하고, 오류가 누적되기 전에 행동을 수정하는 것이다.
세계 모델은 틀릴 수 있다
부정확한 모델 안에서 계획하는 에이전트는 몸이 실제 실수를 저지르기도 전에 확신에 찬 오판에 빠질 수 있다.
세계 모델은 경험을 압축한다. 압축은 예측을 효율적으로 만들지만, 정보도 버린다. 훈련 중에는 중요하지 않아 보였던 세부 사항이 낯선 환경에서는 결정적일 수 있다.
로봇이 유리잔을 테이블 쪽으로 옮기는 상황을 생각해 보자. 모델은 표면이 물체를 지탱할 것이라고 예측할 수 있다. 투명한 판, 젖은 부분, 느슨한 덮개 또는 특이한 모서리는 이 예측을 무효화할 수 있다.
긴 상상 기반 롤아웃은 작은 오류를 증폭시킨다. 첫 번째 예측이 약간만 틀려도 다음 예측에 사용되는 상태가 바뀐다. 여러 단계를 거치면 내부 궤적은 물리적 세계에서 크게 벗어날 수 있다.
이 문제는 흔히 모델 편향이라고 불린다. 정책은 모델 내부에는 있지만 현실에는 존재하지 않는 패턴을 활용하는 법을 배운다. 가상 전략은 높은 예측 보상을 얻을 수 있지만 실제 실행에서는 실패할 수 있다.
Dreamer의 액터는 완벽하게 정확한 시뮬레이터 안에서 탐색하지 않는다. 이전 관찰을 바탕으로 구축된 학습 모델에 맞서 훈련한다. 따라서 이러한 관찰의 품질과 다양성은 에이전트가 무엇을 신뢰성 있게 상상할 수 있는지를 제한한다.
예기치 못한 상황은 그 경계를 드러낸다. 에이전트가 특정 상호작용을 한 번도 관찰하지 못했다면, 그 예측에는 관련 물리 법칙이 빠져 있을 수 있다. 불확실성을 추정할 수는 있지만, 불확실성 추정치 역시 보정이 부정확할 수 있다.
물리 시스템에는 여러 방어 장치가 필요하다. 예측을 새로운 센서 데이터와 비교하고, 신뢰도가 떨어질 때 계획을 짧게 하며, 더 안전한 메커니즘에 제어를 넘겨야 한다. 탐색 중 고위험 행동을 막는 제약도 필요하다.
Hafner의 이전 성과는 연구 벤치마크에서의 성능을 입증한다. 그러나 가정 내 안전성, 산업 현장의 신뢰성 또는 사람과의 안정적인 상호작용을 입증하지는 않는다. Embo는 그러한 결론에 필요한 증거를 공개적으로 내놓지 않았다.
벤치마크의 다양성과 환경의 개방성도 다르다. DreamerV3는 여러 작업에 하나의 구성을 사용해 도메인별 튜닝을 줄였다. 하지만 각 벤치마크는 여전히 규칙, 행동 공간 및 평가 절차를 제공했다.
가정과 작업장은 그처럼 깔끔한 인터페이스를 제공하지 않는다. 문이 뻑뻑하게 열릴 수 있고, 사람이 작업을 중단시킬 수 있으며, 물체가 파손될 수도 있다. 로봇이 움직임에 대한 책임을 지는 동안 센서가 가려질 수 있다.
휴머노이드 형태는 추가적인 복잡성을 더한다. 두 발로 걷는 몸체는 행동 공간이 크고 넘어질 수 있다. 손에는 많은 관절이 있으며, 조작 과정에서 접촉 역학은 빠르게 변한다.
잘못된 예측의 비용도 상황마다 다르다. 부드러운 장난감을 떨어뜨리는 일과 칼을 떨어뜨리는 일은 다르다. 계획 시스템은 배치 전에 이러한 경우를 구분하는 위험 민감형 목표를 갖춰야 한다.
Google DeepMind는 로보틱스 자료에서 이처럼 더 넓은 과제를 인정한다. 이 회사는 충돌 회피, 힘 제한, 저수준 컨트롤러를 포함한 계층형 안전 체계를 설명한다. 고수준 추론만으로는 이러한 보호 장치를 대체할 수 없다.
Embo에도 비슷한 수준의 명확성이 필요하다. 이 스타트업은 에이전트가 어떻게 행동을 제약하고, 불확실성을 추정하며, 모델 실패에서 회복하는지 공개하지 않았다. 첫 번째 상업 환경도 밝히지 않았다.
이러한 미공개 사항은 스텔스 기업에는 일반적이지만, 의미 있는 평가를 제한한다. 외부 휴머노이드 플랫폼은 실험을 가속할 수 있다. 그러나 그것만으로는 회사가 일반화, 신뢰성 또는 단위 경제성을 해결했는지 알 수 없다.
가장 설득력 있는 증거는 익숙하지 않은 환경 전반에서 반복한 시험에서 나올 것이다. 평가자는 실패율, 개입률, 회복 행동 및 필요한 추가 훈련량을 명시해야 한다.
세련된 시연은 더 약한 증거를 제공한다. 팀은 성공한 시도만 고르고 유리한 조건을 준비할 수 있다. 지속적인 운용은 짧은 영상이 숨기기 쉬운 드문 오류를 드러낸다.
데이터 효율성도 신중하게 계산해야 한다. 상상 기반 훈련은 일부 물리적 상호작용을 줄이지만, 세계 모델에는 여전히 실제 경험이 필요하다. 컴퓨팅, 센서 보정, 재설정 및 하드웨어 유지보수는 모두 총비용의 일부로 남는다.
Dreamer 4의 오프라인 Minecraft 결과는 예측 모델 내부에서 행동을 학습하는 방식의 연구적 근거를 강화한다. 그러나 오프라인 로봇 데이터가 안전한 배치에 필요한 물리적 변화를 포괄하는지는 아직 결론나지 않았다.
따라서 핵심 위험은 핵심 장점과 분리할 수 없다. 에이전트는 물리적 행동을 취하지 않고도 많은 미래를 리허설할 수 있다. 하지만 모든 리허설은 이를 생성한 모델의 맹점을 물려받는다.
앞을 내다보는 계획에는 더 긴 계획 이상의 것이 필요하다
예기치 못한 상황을 처리하는 능력은 로봇이 움직이기 전 완벽한 하나의 순서를 예측하는 데 있지 않고, 지속적인 재계획에 달려 있다.
“앞을 내다보는 계획”이라는 표현은 고정된 체크리스트를 연상시킬 수 있다. Hafner의 연구는 더 역동적인 순환을 가리킨다. 에이전트는 결과를 예측하고, 짧게 행동하며, 현실을 관찰한 뒤 내부 상태를 수정한다.
이 구분은 모든 예기치 못한 사건을 미리 예측할 수 없기 때문에 중요하다. 로봇은 가능한 모든 방해 요소에 대한 완전한 예측을 거의 필요로 하지 않는다. 현재 계획을 무효화하는 방해가 발생했을 때 유용하게 대응할 수 있으면 된다.
로봇이 식탁을 정리하는 상황을 상상해 보자. 접시, 컵, 식기, 용기가 보인다. 초기 계획은 각 물체의 목적지를 정하고 처리 순서를 선택한다.
그런데 누군가 컵 옆에 휴대전화를 놓는다. 로봇은 장면이 바뀌었음을 인식해야 한다. 휴대전화를 보호하고, 물체를 잡는 경로를 재검토하며, 더 큰 정리 목표를 유지해야 한다.
순수 반응형 컨트롤러는 즉각적인 충돌을 피할 수 있다. 언어 모델은 어떤 일이 일어났는지 설명할 수 있다. 유능한 세계 모델 에이전트는 이 변화를 미래의 물리적 결과와 연결해야 한다.
컵을 먼저 들어 올리면 휴대전화를 건드릴 위험이 있다고 예측할 수 있다. 휴대전화를 옮기거나, 다른 방향에서 접근하거나, 도움을 요청할 수 있다. 각각의 선택은 남은 작업을 바꾼다.
여기서 시간적 추상화가 중요해진다. 이 기법은 긴 작업을 고수준 하위 목표와 저수준 행동으로 나눈다. 에이전트는 모든 모터 명령을 다시 만들지 않고도 하나의 하위 목표를 수정할 수 있다.
Hafner는 세계 모델과 함께 이 문제를 연구해 왔다. 그의 공개 연구 개요는 시간적 추상화를 추상적 계획을 지원하는 하위 목표로 긴 작업을 나누는 방식으로 설명한다.
창고 로봇의 고수준 목표는 소포를 적재 구역으로 옮기는 일일 수 있다. 저수준 정책은 걷기, 균형 잡기, 물체 잡기 및 장애물 회피를 처리한다. 경로가 바뀌었다고 해서 전체 목표가 사라져서는 안 된다.
언어는 목표와 제약을 표현하는 방식으로 기여할 수 있다. 빨간 용기에 깨지기 쉬운 재료가 들어 있다고 로봇에 알려줄 수 있다. 예측 모델은 그 물리적 물체에 후보 행동이 어떤 영향을 미치는지 추정한다.
이 조합은 세계 모델과 VLA가 고립된 범주로 남기보다 결합될 가능성이 큰 이유를 설명한다. 언어는 일반 지식과 지시 이행 능력을 제공한다. 세계 모델은 관찰된 환경에 연결된 행동 조건부 예측을 제공한다.
메모리는 또 다른 실용적 요구 사항이다. 에이전트는 긴 작업 전반에 걸쳐 관련 관찰을 유지하되, 모든 세부 사항을 똑같이 중요하게 취급해서는 안 된다. 비슷한 조건이 나타날 때 과거의 실패를 불러올 수도 있어야 한다.
이 과제는 디지털 에이전트가 직면하는 컨텍스트 문제와 닮아 있다. 개발자들은 구조화된 기록과 AI 지식 베이스를 활용해 한 번의 모델 응답을 넘어 증거를 보존한다. 물리적 에이전트에는 메모리와 현재 인식 사이에 훨씬 더 긴밀한 연결이 필요하다.
그러나 저장된 경험이 검증을 대체해서는 안 된다. 로봇은 어제의 방 배치가 오늘도 그대로라고 가정해서는 안 된다. 현재 센서 데이터가 오래된 기억을 수정해야 한다.
같은 규칙은 상상한 미래에도 적용된다. 예측은 다음에 무엇이 일어날지에 대한 가설이지 사실이 아니다. 효과적인 에이전트는 그 가설을 세계와 계속 대조해야 한다.
이는 Embo를 판단하는 유용한 기준을 만든다. 회사가 결코 놀라지 않는 로봇을 보여줄 필요는 없다. 놀라움을 조기에 감지하고 위험한 즉흥 대응 없이 회복하는 로봇을 보여줘야 한다.
회복 행동에는 멈추는 것도 포함될 수 있다. 불확실한 행동을 거부하는 것이 과업을 완료하는 것보다 더 지능적일 때도 있다. 상업 시스템에는 인간의 도움을 요청하기 위한 보정된 기준값이 필요하다.
가장 어려운 사례는 장기 목표와 즉각적인 안전을 결합한다. 로봇은 다음으로 유용한 행동을 알고 있을 수 있지만, 접촉이 불확실하거나 시야가 좋지 않을 수 있다. 목표를 포기하지 않으면서 진행을 늦춰야 한다.
이 균형은 계획 수립이 실제 운용 역량이 될지, 그저 인상적인 예측에 그칠지를 결정할 것이다. 로봇은 내부 리허설이 변화하는 조건 속에서 실제 의사결정을 개선할 때 성공한다.
Embo의 베팅이 통할지 보여줄 세 가지 신호
다음 증거는 세계 모델 연구를 준비된 시연 밖에서도 반복 가능한 로봇 성능과 연결해야 한다.
첫 번째 신호는 낯선 물리적 작업에 대한 공개 기술 평가다. Embo는 훈련과 시험 사이에 무엇이 바뀌었는지 정의해야 한다. 새로운 배치, 물체, 방해 요소 및 로봇 몸체는 의미 있는 스트레스 테스트가 될 것이다.
결과에는 실패한 시도도 포함돼야 한다. 개입률, 회복 시간 및 안전 정지는 완료한 작업만큼 중요하다. Embo가 이러한 측정치를 공개한다면, 예기치 못한 사건에 관한 주장은 검증 가능해진다.
강력한 결과는 Hafner의 핵심 주장을 뒷받침할 것이다. 상상 기반 훈련이 게임과 제한적인 로봇 실험을 넘어 전이된다는 점을 보여줄 것이다. 약하거나 선택적으로 보고된 결과는 핵심 질문을 미해결 상태로 남길 것이다.
두 번째 신호는 서로 다른 몸체 간 전이의 증거다. Embo의 사무실에는 여러 휴머노이드 디자인이 있는 것으로 전해지며, 이는 회사가 하나의 기계에 묶인 지능을 원하지 않는다는 점을 시사한다.
범용 제어 시스템은 카메라, 팔다리, 관절 한계 또는 비율이 바뀌어도 유용한 기술을 유지해야 한다. 어느 정도의 적응은 여전히 필요할 것이다. 중요한 지표는 각 기체에 얼마나 많은 신규 데이터와 엔지니어링이 필요한가다.
빠른 전이는 하나의 하드웨어 스택이나 엄선된 시연 데이터에 의존하는 기업들의 모델에 도전이 될 것이다. 대규모 재학습이 필요하다면 Embo가 일반적인 물리 구조를 학습했다는 주장은 약해진다.
Google DeepMind는 이미 서로 다른 신체 형태를 아우르는 제어를 주요 목표로 제시하고 있다. Skild AI도 유사한 범용성 주장을 한다. Embo는 아키텍처의 이점과 마케팅 문구를 구분할 수 있는 직접 비교를 제시해야 한다.
세 번째 신호는 신뢰할 만한 배포 범위다. Embo는 궁극적으로 자사 시스템이 반복적으로 작동할 수 있는 환경을 명시해야 한다. 가정, 창고, 실험실, 공장은 각각 서로 다른 물체, 위험 및 경제적 요건을 제시한다.
집중된 배포가 더 폭넓은 연구 비전을 약화시키는 것은 아니다. 오히려 이를 개선하는 데 필요한 운영 데이터를 만들 수 있다. 실제 고객은 내부 벤치마크가 놓치는 실패 패턴도 드러낸다.
시장 선택은 Embo의 안전 전략을 보여줄 것이다. 산업 현장에서는 접근을 제한하고 절차를 표준화할 수 있다. 가정은 더 다양한 환경을 제공하지만, 더 어려운 사회적·물리적 위험을 수반한다.
독자들은 이 스타트업이 기술 논문, 모델 문서 또는 재현 가능한 벤치마크를 공개하는지도 지켜봐야 한다. Hafner의 이전 연구는 주요 Dreamer 시스템의 코드 공개를 포함해 이례적으로 개방적이었다. 상업 기업은 이러한 패턴을 바꿀 수 있다.
투명성은 독립 연구자들이 월드 모델 접근법을 검증하는 데 도움이 될 것이다. 폐쇄적인 시연은 시장이 회사가 선택한 증거를 통해서만 성능을 판단하게 만든다. 어느 쪽도 성공을 증명하지는 않지만, 신뢰 수준에는 매우 다른 영향을 준다.
Embo의 더 넓은 중요성은 당장 휴머노이드 시장에서 승리하는 데 달려 있지 않다. 이 회사는 특정한 기술적 가설을 검증대에 올려놓는다. 에이전트가 익숙한 스크립트를 넘어 행동하기를 기대받는다면, 결과에 대한 내부 모델이 필요하다.
이 가설은 로보틱스를 넘어 디지털 에이전트에도 적용된다. 디지털 에이전트는 변경된 인터페이스, 누락된 파일, 상충하는 지시, 불완전한 정보를 마주한다. 이들 역시 결과를 예측하고 예상치 못한 피드백 뒤에 계획을 수정함으로써 이점을 얻는다.
물리 기계에서는 실수가 현실 세계로 이어지기 때문에 기준이 더 엄격해진다. 계획 오류는 하드웨어를 손상시키거나 사람을 위험에 빠뜨릴 수 있다. 따라서 신뢰성은 자율성과 함께 성장해야 한다.
Hafner의 이력은 Embo에 탄탄한 기반을 제공한다. Dreamer는 게임과 제어 과제 전반에서 상상된 경험을 통한 학습을 보여줬다. DayDreamer는 이 방법을 물리적 로봇에 적용했다. Dreamer 4는 매우 긴 행동 시퀀스 전반으로 오프라인 상상 학습을 확장했다.
이제 이 스타트업은 결정적인 전환 과제에 직면해 있다. 연구 벤치마크는 성공을 명확히 정의하고 실험을 저렴하게 반복할 수 있다. 휴머노이드 로봇은 단순화와 완전한 열거 모두를 거부하는 환경을 마주한다.
그렇기에 Embo는 또 하나의 스텔스 로보틱스 기업 이상의 의미를 갖는다. 에이전트가 세계에 대한 유용한 내부 설명을 구축하고, 그 설명이 실패하는 순간을 인식하며, 피해가 발생하기 전에 조정할 수 있는지를 시험한다.
향후 몇 달 안에는 낯선 작업, 서로 다른 기체 간 전이, 초기 배포 환경에 관한 증거가 나와야 한다. 이러한 신호는 Danijar Hafner의 월드 모델 에이전트가 상상한 미래를 신뢰할 수 있는 물리적 행동으로 바꿀 수 있는지를 보여줄 것이다.
그때까지 가장 정직한 결론은 조건부일 수밖에 없다. Embo는 일관된 메커니즘과 매우 관련성 높은 연구 이력을 보유하고 있다. 그러나 자사 휴머노이드가 상업적 규모에서 예기치 못한 상황을 관리할 수 있음을 아직 보여주지는 못했다.
따라서 개발자와 AI 구매자에게 던져지는 질문은 구체적이다. Embo는 반복 가능한 실패 및 복구 데이터를 공개할 것인가, 아니면 신중하게 준비된 성공 사례만 제시할 것인가? 그 증거가 월드 모델을 통한 계획이 신뢰할 수 있는 에이전트 아키텍처가 될지, 혹은 설득력 있는 실험실 결과로 남을지를 결정할 것이다.


