top of page

HiPHI 휴머노이드 모션 데이터셋, 로봇 학습의 비디오 우선 접근법에 도전

13시간 전
11분 분량

HiPHI가 617.5시간 분량의 휴머노이드 모션 데이터셋을 공개했다. 이 데이터셋은 로봇 학습의 핵심 가정에 의문을 제기한다. 더 많은 비디오가 자동으로 더 나은 물리 훈련 데이터를 뜻하지는 않는다는 것이다. 이번 공개 자료는 정밀한 전신 움직임과 추적 객체, 의미론적 라벨, 실제 휴머노이드 테스트를 결합했다. 이들이 내건 핵심은 로봇에 필요한 것이 방대한 시각 관측치만이 아니라 측정된 물리 상태라는 점이다.

이 주장은 HiPHI 휴머노이드 모션 데이터셋을 두 가지 기존 접근법 사이에 놓는다. 인터넷 비디오는 탁월한 행동 다양성을 제공하지만, 신뢰할 수 있는 관절·접촉·객체 상태가 부족하다. 실험실 모션 캡처는 이러한 상태를 제공하지만, 기존 컬렉션 다수는 행동 범위가 좁거나 동기화된 객체 정보를 생략한다.

HiPHI는 단순한 원시 데이터 규모가 아니라 구조화된 수집 방식을 통해 이 간극을 메우려 한다. 연구진은 사건 의미를 정리하는 언어 체계인 FrameNet을 활용해 모션 계열을 정의하고 변형을 생성했다. 이후 이 데이터로 강화학습 정책을 훈련하고, 선택된 행동을 Unitree G1 로봇으로 전이했다.

HiPHI 휴머노이드 모션 데이터셋이 훈련 기록을 확장하다

HiPHI는 규모, 물리적 정밀도, 객체 인식 모션을 하나의 공개 연구 자료에 결합해 활용 가능한 훈련 기반을 바꾼다.

이 프로젝트는 2026년 8월 17일 arXiv에 제출됐고 9월 8일 수정됐다. 해당 연구 기록에 따르면 논문은 Conference on Robot Learning 2026에 채택됐다.

공개 데이터셋은 617.5시간의 모션과 약 2억 10만 프레임을 담고 있다. 연구진은 광학식 모션 캡처 시스템으로 132명의 수행자로부터 초당 90프레임으로 원본 자료를 수집했다. 연구팀은 마커 추적 정확도가 1밀리미터 미만이라고 보고했다.

다만 대표적으로 제시된 시간에는 맥락이 필요하다. 이번 공개 자료는 308.7시간의 원본 캡처에 좌우 반전을 적용해 보고된 617.5시간을 산출했다. 미러링은 적절한 좌우 모션 요소를 교환해 유효한 대응 동작을 만들기 때문에, 두 번째 독립 캡처라기보다 유용한 데이터 증강에 해당한다.

전체 데이터는 신체 단독 움직임 371.8시간과 인간-객체 상호작용 245.7시간으로 나뉜다. 상호작용 부분은 공개 자료의 39.8%를 차지한다. 여기에는 추적된 물리 객체를 활용한 운반, 밀기, 당기기, 기대기, 앉기 등의 동작이 포함된다.

인간 모션은 표준화된 55관절 BVH 계층 구조를 사용한다. BVH는 골격 구조와 시간에 따른 움직임을 저장하는 일반적인 파일 형식이다. 모든 상호작용 패키지는 신체 기록을 동기화된 객체 궤적 및 고해상도 객체 메시와 연결한다.

공개 데이터셋 문서는 정식 객체 메시 40개와 그 미러링 변형을 명시한다. 객체 트랙은 해당 신체 파일과 타임스탬프를 공유해, 실험 전 필요한 정렬 작업을 줄인다.

데이터는 12개 범주에 걸친 실제 객체 40개를 다룬다. 객체는 가구와 용기부터 청소 도구, 스포츠 장비까지 다양하다. 보고된 질량은 0.45~6.25킬로그램이다.

이 질량 범위는 가벼운 용기를 드는 일과 무거운 물체를 옮기는 일에 서로 다른 균형 전략이 필요하다는 점에서 중요하다. 눈에 보이는 팔의 궤적이 비슷하더라도 발, 몸통, 질량 중심의 움직임은 달라질 수 있다.

HiPHI는 클립에 자연어 설명과 의미론적 식별자도 부여한다. 그 결과물은 모션 검색, 모방 학습, 리타기팅, 모션 생성, 객체 인식 제어 연구를 지원한다.

이는 단순히 더 큰 애니메이션 아카이브가 아니다. 이번 공개 자료는 구체적인 질문을 중심으로 설계됐다. 모션 컬렉션이 로봇 정책이 실행할 수 있을 만큼 충분한 물리 구조를 유지하면서도 다양성을 확보할 수 있는가라는 질문이다.

인터넷 비디오가 남기는 물리 데이터의 공백

비디오는 행동의 외형을 포착하지만, 휴머노이드 제어는 픽셀만으로는 대개 간접적으로만 드러나는 물리 상태에 의존한다.

대규모 비디오 컬렉션은 분명한 매력이 있다. 가정, 직장, 거리, 낯선 환경에서 사람들이 수행하는 수많은 작업을 담고 있다. 이러한 다양성은 모션 캡처 스튜디오 안에서 재현하기 어렵다.

하지만 비디오는 일반적으로 완전한 물리 상태가 아니라 외관을 기록한다. 학습 시스템은 깊이, 관절 위치, 가려진 팔다리, 접촉, 객체 움직임을 추정해야 한다. 이러한 추정 오차는 로봇 정책 훈련이 시작되기도 전에 누적될 수 있다.

짐이 실린 여행가방을 끄는 사람을 생각해 보자. 카메라는 사람과 여행가방을 기록하지만, 힘, 마찰, 정확한 접촉 기하, 정제된 골격 궤적을 직접 제공하지는 않는다. 의복은 관절을 가릴 수 있고, 원근법은 깊이를 불확실하게 만든다.

모션 캡처는 신체 움직임을 정밀하게 측정해 이 문제의 일부를 해결한다. AMASS와 같은 전통적 컬렉션은 애니메이션과 휴머노이드 제어에 중요한 자원이 됐다. 그러나 다수는 객체 제약이 있는 로봇 학습이 아니라 모션 합성, 재구성, 그래픽을 위해 구축됐다.

누락된 객체는 그 외에는 현실적인 클립을 물리적으로 불완전하게 만들 수 있다. 사람이 앉는 것처럼 보여도 신체 데이터에는 의자 상태가 함께 제공되지 않는다. 수행자가 앞으로 기울어도 지지 표면과 접촉 관계는 빠져 있다.

그런 신체 궤적에서 훈련된 정책은 움직임을 안정적으로 만든 제약을 이해하지 못한 채 자세만 모방할 수 있다. 이것이 시각적 그럴듯함과 실행 가능한 제어의 차이다.

실제 로봇 시연은 더 직접적인 지도 신호를 제공한다. 이미 기계의 관절, 센서, 한계를 반영한다. 약점은 수집 비용이며, 생성되는 데이터는 종종 하나의 로봇 구성에 묶여 있다.

따라서 HiPHI는 중간 위치를 차지한다. 인간 수행자는 행동 범위를 제공하고, 광학식 캡처는 정확한 모션 상태를 제공한다. 동기화된 객체 기록은 신체 단독 데이터셋이 버리는 상호작용 구조의 일부를 보존한다.

모든 상황에서의 비교가 비디오 대 모션 캡처인 것은 아니다. 비디오는 여전히 의미론적 맥락, 시각 인식, 자연환경에서의 행동에 가치가 있다. 모션 캡처 역시 스튜디오, 마커, 계획된 세션이라는 제약을 받는다.

실질적인 쟁점은 어떤 데이터가 실행 가능한 모션 사전 지식으로 쓰여야 하는가다. 모션 사전 지식은 신체가 일반적으로 어떻게 움직이는지 학습한 모델이다. 휴머노이드 제어에서 그 참조 데이터는 인간 신체에서 서로 다른 비율과 구동기를 가진 로봇으로의 리타기팅을 견뎌야 한다.

HiPHI 연구진은 현 단계에서 정밀도와 물리적 기반에 더 큰 비중을 둘 필요가 있다고 주장한다. 이들의 벤치마크는 여러 소스를 공통 신체 표현으로 변환하고 일관된 평가 절차를 적용한 뒤 데이터를 비교한다.

이 접근법은 주로 재구성된 인터넷 비디오에 의존하는 팀에 압박을 가한다. 더 큰 시각 데이터셋은 더 많은 상황을 설명할 수 있지만, 추론된 물리 상태가 측정된 궤적과 경쟁할 만큼 정확해져야 한다.

이는 기존 모션 캡처 프로젝트에도 압박을 준다. 수행자가 익숙한 좁은 행동 집합만 반복한다면 높은 정밀도만으로는 충분하지 않다. 더 어려운 목표는 의도적으로 설계된 모션 공간 전반에서 정밀한 커버리지를 확보하는 것이다.

FrameNet이 언어를 모션 수집 계획으로 바꾸다

HiPHI의 핵심 메커니즘은 카메라 시스템이 아니라 어떤 움직임을 캡처할 가치가 있는지 결정하기 위해 언어 구조를 활용하는 방식이다.

대부분의 모션 데이터셋은 활동 목록에서 출발한다. 설계자는 걷기, 달리기, 앉기, 손 흔들기, 들어 올리기를 요청한 뒤 새 요구가 생길 때마다 스크립트를 추가할 수 있다. 이 방식은 이해하기 쉬운 클립을 만들지만, 무엇이 여전히 빠져 있는지 신뢰할 수 있는 척도를 제공하지는 않는다.

서로 다른 이야기가 거의 동일한 움직임을 만들어낼 수 있다. 이마의 땀을 닦는 행동과 햇빛으로부터 눈을 가리는 행동은 유사한 관절 궤적을 사용할 수 있다. 이를 별개의 활동으로 모두 계산하면 물리적 커버리지를 과장할 수 있다.

반대 문제도 발생한다. “걷기” 같은 한 단어는 속도, 경로, 보폭, 회전 반경, 자세, 방향에 따라 많은 움직임을 만들어낼 수 있다. 하나의 활동 라벨은 상당한 운동학적 다양성을 감출 수 있다.

HiPHI는 이러한 불일치를 다루는 틀로 Berkeley FrameNet을 사용한다. FrameNet은 사건, 상황, 그리고 이를 환기하는 단어 의미를 중심으로 언어를 구성한다. “프레임”은 사건 유형을 나타내며, 어휘 단위는 단어의 특정 의미를 해당 프레임에 연결한다.

예를 들어 “run”은 인간의 이동을 뜻할 수도 있고 회사를 경영하는 것을 뜻할 수도 있다. Frame-LU 쌍은 이러한 의미를 분리한다. HiPHI는 물리적 움직임과 연결된 쌍을 선택해 캡처 지침의 씨앗으로 전환한다.

컬렉션은 22개 FrameNet 프레임과 214개 Frame-LU 모션 단위로 구성된다. 이 단위들은 이동, 자세 변화, 신체 부위 움직임, 객체 작동, 전달 및 관련 상호작용 패턴을 포괄한다.

각 의미론적 시드는 관찰 가능한 물리적 차원을 따라 확장된다. 수행자는 방향, 속도, 진폭, 자세, 리듬, 신체 부위 개입, 접촉 위치, 하중, 객체 궤적을 바꾼다.

밀기 시드는 여러 객체, 하중, 접촉점, 방향을 만들어낼 수 있다. 걷기 시드는 경로, 속도, 회전 방식, 보폭, 신체 높이를 바꿀 수 있다. 이러한 변화는 설명만 바꾸는 것이 아니라 모션 자체를 바꾼다.

이는 WordNet이 ImageNet을 구조화하는 데 했던 역할과 닮았다. 분류 체계가 데이터를 직접 생성하지는 않는다. 대신 무엇을 수집하고 어느 부분의 커버리지가 부족한지 판단할 수 있는 정리된 지도를 제공한다.

그 결과 분포에는 일반적인 행동과 의도적으로 구성된 긴 꼬리 분포가 함께 포함된다. 가장 빈번한 Frame-LU 라벨 50개가 공개된 전체 시간의 53.7%를 차지한다. 나머지 46.3%는 이러한 일반 단위 밖에 위치한다.

수행자 다양성도 라벨 내에서 나타난다. HiPHI는 Frame-LU당 수행자 중앙값이 24명이며, 154개 단위에는 최소 10명의 수행자가 포함된다고 보고했다. 이는 모션 범주가 단지 한 사람의 스타일을 반영할 가능성을 낮춘다.

HiPHI 프로젝트 벤치마크는 공통의 비지도 모션 인코더로 커버리지를 측정한다. 연구진은 데이터셋을 공통 23개 키포인트 표현으로 정규화하고 초당 30프레임으로 리샘플링한 뒤 균형 잡힌 표본을 비교했다.

이 절차에서 HiPHI는 투영된 모션 공간의 1,620개 셀을 차지했다. 가장 가까운 대규모 기준선인 BONES-SEED는 1,438개를 차지했다. HiPHI는 유효 점유도도 1,443으로 보고했으며, BONES-SEED의 수치는 1,114였다.

유효 점유도는 표본이 커버된 영역을 얼마나 고르게 채우는지 반영한다. HiPHI가 보고한 우위는 이 컬렉션이 먼 영역에 소수의 이상치만 배치해 더 넓은 커버리지를 달성한 것은 아니라는 점을 시사한다.

긴 꼬리 비중은 HiPHI에서 14.1%에 달했으며, BONES-SEED는 10.7%였다. 연구진은 여러 무작위 시드, 투영 설정, 그리드 해상도에서 분석을 반복했으며, 테스트된 모든 구성에서 양의 커버리지 차이를 보고했다.

이 결과는 여전히 선택된 표현과 평가 설계에 의존한다. 2차원 투영만으로는 복잡한 모션 매니폴드를 완전히 설명할 수 없다. 그러나 균형 잡힌 샘플링은 단순한 총 시간보다 더 유의미한 비교를 가능하게 한다.

객체 궤적이 상호작용 데이터를 물리적으로 유용하게 만들다

로봇은 신체 모션만으로 운반, 밀기, 당기기를 학습할 수 없다. 객체가 로봇이 실행해야 하는 움직임 자체를 바꾸기 때문이다.

HiPHI는 수행자의 스켈레톤과 함께 물체의 위치와 방향을 기록합니다. 각 트랙에는 신체 동작 프레임마다 하나의 항목이 포함되며, 메시(mesh)는 공유 좌표계에서 물체의 형태를 제공합니다.

이로써 사람과 물체가 연결된 표현이 만들어집니다. 신체는 단순히 상자를 드는 동작을 흉내 내는 데 그치지 않습니다. 데이터셋은 수행자가 자세를 바꾸고, 잡는 높이를 조정하거나, 체중을 옮길 때 상자가 어떻게 움직이는지 기록합니다.

이 차이는 전신 제어에서 중요합니다. 무거운 물체를 밀려면 상체를 앞으로 기울이고, 더 넓은 자세를 취하며, 발 위치를 달리해야 할 수 있습니다. 여행 가방을 당길 때는 저항이 변함에 따라 몸통과 지지 다리의 위치가 달라질 수 있습니다.

물체 메시 역시 기하학적 특성을 명확히 합니다. 의자의 표면은 앉을 때 접촉이 일어나야 하는 위치를 결정합니다. 용기의 크기는 손 위치, 팔 간격, 그리고 몸통을 굽혀야 하는지 여부에 영향을 줍니다.

HiPHI는 두 가지 지표로 이러한 정렬을 평가합니다. 비충돌률은 샘플링된 인간 스켈레톤이 물체를 관통하지 않는지 확인합니다. 근표면 접지성은 상호작용이 그럴듯할 만큼 사람이 물체에 충분히 가까이 머무르는지를 측정합니다.

데이터셋은 98.1%의 비충돌률과 95.7%의 근표면 접지성을 보고합니다. HIMO는 각각 97.6%와 79.0%를 기록했습니다. OMOMO는 90.6%와 50.4%를 기록했습니다.

이 수치는 선택된 기하학적 테스트에서 HiPHI에 유리하지만, 접촉의 모든 측면을 측정하지는 않습니다. 손은 현실적인 힘을 가하지 않고도 물체 가까이에 머무를 수 있습니다. 이 지표는 마찰, 촉각 반응, 또는 파지 안정성도 검증하지 않습니다.

규모는 여전히 눈에 띄는 차이입니다. HiPHI는 245.7시간의 상호작용 데이터를 보고합니다. 논문은 이를 HIMO에서 평가된 21.6시간의 물체 트랙과 OMOMO의 9.8시간과 비교합니다.

팀은 동작의 매끄러움과 일반적인 접촉 아티팩트도 평가했습니다. 비교 가능한 바닥 규약을 사용하는 데이터셋 가운데 HiPHI는 선택된 다섯 가지 측정값 전반에서 가장 낮은 값을 보고했습니다.

HiPHI의 95백분위 지면 관통 깊이는 8밀리미터로, BONES-SEED의 18밀리미터 및 AMASS의 111밀리미터와 비교됩니다. 지지 없이 떠 있는 상태는 평가 시간의 0.015%를 차지했고, 지지점 드리프트는 초당 64밀리미터로 측정됐습니다.

이는 데이터셋 수준의 측정값이지 모든 클립에 대한 보장은 아닙니다. 그럼에도 이는 정책 최적화 과정에서 중요한 오류를 겨냥합니다. 발이 미끄러지거나 바닥 접촉이 일관되지 않으면, 물리 법칙상 허용되지 않는 참조 동작을 제어기가 추종하도록 학습시킬 수 있습니다.

상호작용 벤치마크는 이후 리타게팅 후의 차기, 운반, 밀기, 기대기 시퀀스를 테스트합니다. HiPHI는 여러 비교에서 더 낮은 신체 추적 오류를 달성했지만, 모든 비교에서 그렇지는 않았습니다.

밀기 결과는 왜 신중한 해석이 필요한지를 보여줍니다. HiPHI는 밀기에서 99.20밀리미터의 신체 MPJPE를 기록해 OMOMO의 66.09보다 나빴습니다. MPJPE는 대응하는 관절 사이의 평균 위치 차이를 측정합니다.

동시에 HiPHI는 해당 범주에서 물체 위치 및 방향 오류를 상당히 낮췄습니다. 이 결과는 물체의 움직임을 맞추는 일과 인간의 자세를 맞추는 일이 상충하는 요구를 만들 수 있음을 시사합니다.

운반에서는 또 다른 혼합된 결과가 나왔습니다. HiPHI의 신체 오류는 두 비교 결과보다 낮았지만, 물체 위치 오류는 더 높았습니다. 이러한 차이는 한 데이터셋이 모든 다운스트림 작업에서 우세하다고 단순하게 주장할 수 없게 합니다.

HiPHI가 추가하는 것은 이러한 트레이드오프를 검토할 수 있는 훨씬 큰 테스트 기반입니다. 연구자는 신체 추적, 물체 추적, 물리적 안정성이 언제 함께 정렬되고, 하나를 최적화할 때 다른 하나가 언제 악화되는지 살펴볼 수 있습니다.

강화학습이 HiPHI 동작을 Unitree G1으로 전이한다

HiPHI가 중요한 이유는 연구진이 정적인 데이터셋 통계를 넘어, 학습된 정책이 실제 하드웨어에서 선택된 동작을 실행할 수 있는지 검증했기 때문입니다.

팀은 인간의 움직임을 비율과 구동 한계가 다른 휴머노이드 Unitree G1에 리타게팅했습니다. 리타게팅은 소스 스켈레톤의 동작을 대상 로봇에 맞는 참조 동작으로 변환합니다.

신체 전용 테스트에서 연구진은 DeepMimic 스타일의 강화학습 파이프라인으로 정책을 훈련했습니다. DeepMimic research는 참조 동작으로부터 물리 기반 기술을 학습하는 널리 사용되는 접근법을 정립했습니다.

이 벤치마크는 동일한 데이터 예산 조건에서 HiPHI를 AMASS, LAFAN1, Motion-X++, BONES-SEED와 비교합니다. 각 소스는 동일한 리타게팅 및 정책 훈련 과정을 거쳤습니다.

보고에 따르면 HiPHI는 3시간 및 20시간 훈련 설정 모두에서 가장 높은 성공률과 가장 빠른 수렴을 달성했습니다. 비교는 독립적인 다섯 번의 훈련 실행을 사용했으며, 훈련 중 실패율을 측정했습니다.

별도의 스케일링 실험에서는 미러링하지 않은 HiPHI 훈련 데이터를 3시간에서 300시간으로 늘렸습니다. 결과 정책은 다른 네 데이터셋에서 보류된 동작으로 평가됐습니다.

논문에 따르면 HiPHI 훈련 세트가 커질수록 교차 데이터셋 관절 위치 오류는 일관되게 감소했습니다. 이 실험은 10회 반복됐으며, 결과는 평균 곡선과 분산 밴드로 보고됐습니다.

이 패턴은 프로젝트의 핵심 주장을 뒷받침합니다. 추가된 구조화 동작 데이터는 일반적인 행동을 단순히 반복하는 데 그치지 않고 일반화 성능을 계속 향상시킨다는 것입니다. 또한 데이터셋 규모를 실제 제어 지표와 연결합니다.

마지막 단계에서는 정책을 실제 G1에 적용했습니다. 로봇은 달리기, 앉기, 기어가기, 상자 운반, 뒤집기, 여행 가방 당기기를 수행했습니다. 이 시험은 정책을 구동기 한계, 센싱 노이즈, 시뮬레이션과 현실 간 차이에 노출했습니다.

많은 동작 데이터셋이 복원 품질이나 시뮬레이션에서 멈춘다는 점에서 이러한 시연은 의미가 있습니다. 실제 하드웨어 배치는 최소한 선택된 참조 동작이 리타게팅과 하드웨어 제약을 견딜 수 있다는 더 강한 증거를 제공합니다.

다만 “실세계 전이”라는 표현을 범용 자율성으로 해석해서는 안 됩니다. 보고된 시험은 통제된 조건에서 선택된 행동을 다룹니다. 로봇이 낯선 물체를 독립적으로 인식하거나, 작업을 계획하거나, 개방형 작업 환경에 적응하는 모습을 보여주지는 않습니다.

추적 정책은 완전한 로봇 에이전트보다 더 좁은 문제를 해결합니다. 물리적 안정성을 유지하면서 참조 동작을 따릅니다. 반드시 어떤 행동을 수행할지 결정하거나 사람이 왜 그 행동을 했는지를 이해하는 것은 아닙니다.

따라서 G1 시연은 완전한 작업 지능이 아니라 실행 가능성을 검증합니다. 물리 AI 기업들이 인상적인 동작 영상을 유용한 노동에 대한 더 광범위한 주장과 점점 더 연결하고 있는 상황에서 이 구분은 중요합니다.

HiPHI의 가장 강력한 기여는 기술 스택의 더 하위 계층에 있습니다. 정책이 협응, 균형, 물체 조건부 움직임을 학습하도록 도울 수 있는 참조 데이터를 제공합니다. 이후 계획 및 인식 시스템이 이러한 역량을 기반으로 구축될 수 있습니다.

실무 워크플로도 까다롭습니다. 연구자는 BVH 파일을 리타게팅하고, 로봇의 관절 한계를 고려하며, 시뮬레이션에서 훈련하고, 실제 배치 전에 안전성을 검증해야 합니다.

프로젝트 문서는 동작이 선택한 구현체에 맞는 리타게팅과 검증을 필요로 한다고 명시적으로 경고합니다. G1에서 작동하는 참조 동작이 모든 휴머노이드에 변경 없이 전이되지는 않습니다.

엔지니어링 팀에는 데이터셋 검사와 실험 추적이 필수적입니다. 검색 가능한 engineering knowledge base는 기반 로보틱스 워크플로를 바꾸지 않고도 동작 식별자, 훈련 구성, 실패 사례, 하드웨어 관찰 결과를 연결하는 데 도움이 될 수 있습니다.

HiPHI 결과가 여전히 측정하지 못하는 것

HiPHI는 동작 데이터의 격차를 줄이지만, 범용 휴머노이드 행동에 필요한 완전한 물리, 인식 또는 사회적 맥락을 포착하지는 못합니다.

첫 번째 한계는 환경의 다양성입니다. 모든 원본 동작은 스튜디오에서 수집됐습니다. 이러한 환경은 정밀한 측정을 지원하지만, 통제된 시설 밖에서 발견되는 혼잡함, 조명 변화, 고르지 않은 표면, 예기치 않은 장애물을 제거합니다.

인터넷 동영상은 정반대의 특성을 가집니다. 정확한 물리 상태를 희생하는 대신 복잡한 환경 변화를 제공합니다. HiPHI는 이 트레이드오프를 없애기보다 한쪽 측면을 강화합니다.

두 번째 한계는 힘과 관련됩니다. 이 릴리스는 운동학, 즉 신체와 물체가 어떻게 움직이는지를 기록합니다. 접촉력이나 촉각 신호를 직접 측정하지는 않습니다.

이 누락은 조작 작업에서 중요합니다. 두 클립은 유사한 궤적을 보여도 서로 다른 그립 압력, 마찰 또는 저항을 수반할 수 있습니다. 제어기는 깨지기 쉽거나 변형 가능하거나 미끄러운 물체를 다루기 위해 이러한 숨겨진 양이 필요할 수 있습니다.

세 번째 한계는 사회적 상호작용입니다. HiPHI는 현재 한 사람의 동작을 다룹니다. 다인 행동과 직접적인 사람 간 접촉은 제외합니다.

사람 주변에서 작업하는 휴머노이드는 결국 물건 전달, 공동 운반, 협력적 움직임, 충돌 회피를 모델링해야 합니다. 이러한 작업에는 두 신체와 그 변화하는 의도를 표현하는 데이터가 필요합니다.

네 번째 쟁점은 증강입니다. 보고된 릴리스 시간의 거의 절반은 좌우 미러링에서 나옵니다. 이는 특히 일측성 행동의 유용한 범위를 늘리지만, 새로운 수행자나 촬영 세션을 추가하지는 않습니다.

따라서 독자는 공개된 시간과 독립적으로 기록된 시간을 구분해야 합니다. 두 수치는 서로 다른 목적에 유효하지만, 서로 다른 질문에 답합니다.

다섯 번째 우려는 벤치마크의 독립성입니다. 대부분의 공개된 비교 및 배치 증거는 데이터셋 제작자로부터 나옵니다. CoRL 채택은 동료 심사를 더하지만, 더 넓은 신뢰를 얻으려면 외부 팀이 결과를 재현해야 합니다.

독립 연구자들은 서로 다른 리타게터, 정책 아키텍처, 로봇 신체, 평가 지표 아래에서도 HiPHI가 우위를 유지하는지 시험해야 합니다. 더 작은 플랫폼이나 관절 배치가 다른 기계에서의 결과는 특히 유익할 것입니다.

라이선스 역시 실질적인 도입에 영향을 줍니다. 데이터셋은 CC BY-NC 4.0 라이선스를 사용하며, 이는 출처 표시를 조건으로 연구 사용을 허용하지만 상업적 사용은 제한합니다. 기업은 파일을 제품 훈련에 통합하기 전에 이 제한을 평가해야 합니다.

공개 패키지의 개인정보 노출은 제한적인 것으로 보입니다. 릴리스에는 동작, 궤적, 메시, 익명화된 수행자 특성이 포함됩니다. 촬영된 RGB 동영상, 오디오, 얼굴 이미지, 음성 녹음은 제외됩니다.

그러나 동작 자체도 개인적 패턴을 담을 수 있습니다. 저자들은 숫자형 액터 식별자와 일반화된 인구통계 메타데이터를 사용해 직접 식별 위험을 줄이면서 분석을 지원합니다.

마지막으로 물리적으로 실행 가능한 모방은 성공적인 작업 완료와 같지 않습니다. 로봇은 올바른 상자를 인식하거나, 목적지를 선택하거나, 누군가가 경로를 막았을 때 복구하지 못한 채 운반 동작을 재현할 수 있습니다.

HiPHI는 동작 인프라로 평가되어야 합니다. 이는 휴머노이드가 다양하고 접지된 움직임 참조를 획득하는 방법을 다룹니다. 인식, 언어 조건부 계획, 안전 인증, 개방 세계 자율성을 해결한다고 주장하지는 않습니다.

이처럼 더 좁은 틀은 작업의 신뢰도를 높입니다. 열린 질문은 이 데이터셋이 여러 연구 그룹에서 재사용 가능한 기반이 될지, 아니면 제작자의 평가 스택과 밀접하게 결합된 상태로 남을지입니다.

HiPHI가 휴머노이드 학습을 바꾸는지 보여줄 세 가지 신호

다음 시험은 도입입니다. 독립적 재현, 더 폭넓은 구현체 전이, 그리고 더 풍부한 물리 센싱이 HiPHI의 지속적인 가치를 결정할 것입니다.

첫 번째 신호는 독립적인 벤치마크 재현입니다. 연구 그룹은 릴리스를 내려받아 비교 가능한 정책을 다시 훈련하고, 문서화된 조건에서 결과를 보고해야 합니다.

재현은 HiPHI의 범위와 정밀도가 성능을 이끈다는 주장을 강화할 것입니다. 큰 차이가 발생한다면 훈련 선택, 리타게팅 또는 공개되지 않은 운영 세부 사항이 데이터셋 자체보다 더 크게 기여했음을 시사할 수 있습니다.

두 번째 신호는 Unitree G1을 넘어선 전이 능력이다. HiPHI에서 도출한 정책은 신체 비율, 관절 가동 범위, 액추에이터 강도, 제어 주파수가 서로 다른 휴머노이드에서 평가되어야 한다.

다중 로봇 전이가 성공한다면, 이 공개 데이터가 재사용 가능한 인간 동작 구조를 포착했다는 견해를 뒷받침할 수 있다. 반대로 전이 성능이 약하다면, 기체 특화 적응이 여전히 가장 큰 병목이라는 점을 보여줄 것이다.

세 번째 신호는 보완적 센싱이다. 향후 데이터셋이나 확장판은 정밀한 동작 데이터를 힘, 촉각, 1인칭 시각 맥락과 연결해야 한다.

이러한 모달리티는 HiPHI의 가장 분명한 사각지대를 보완할 수 있다. 힘 데이터는 가벼운 접촉과 체중을 지지하는 동작을 구분할 수 있으며, 자기중심 영상은 움직임을 수행자가 실제로 본 장면과 연결할 수 있다.

가장 유망한 경로는 데이터 소스를 대체하기보다 결합하는 방식일 수 있다. 고정밀 모션 캡처는 실행 가능한 물리적 기준을 제공할 수 있다. 인터넷 영상은 환경과 행동 측면의 폭을 제공할 수 있다. 로봇 시연은 이 둘을 특정 하드웨어에 맞춰 정렬할 수 있다.

HiPHI는 구조화되고 검색 가능한 동작 레이어를 제공하기 때문에 이러한 하이브리드 방향을 더 쉽게 평가할 수 있게 한다. Frame-LU 시스템은 여러 소스에 걸친 관련 사례를 샘플링하거나 연결할 수 있는 의미론적 핸들도 제공한다.

연구자들은 이제 구체적인 질문을 던져야 한다. 롱테일 동작으로 훈련한 정책은 외란에서 더 잘 회복하는가? 동기화된 객체 기록은 캡처 스튜디오 밖에서의 작업 성공률을 높이는가? 이 데이터셋의 의미 구조는 모델이 언어 명령으로부터 동작을 선택하는 데 도움이 되는가?

HiPHI 휴머노이드 동작 데이터셋은 영상 규모와 물리적 정밀성 사이의 논쟁을 끝내지는 않는다. 대신 수집 설계, 측정 가능한 데이터 품질, 정책 훈련, 실제 로봇 실행을 연결함으로써 그 논쟁의 기준을 높인다.

다음으로 유용한 단계는 직접 실험하는 것이다. 일부 하위 집합을 내려받아 미러링된 시퀀스와 원본 시퀀스를 점검하고, 여러 상호작용 범주를 리타기팅하며, 성공적인 시연과 함께 실패 사례도 공개해야 한다. 이러한 결과는 구조화된 인간 동작이 물리적 AI를 위한 공동 인프라가 될지, 아니면 로봇이 낯선 환경으로 옮겨가기 어려운 또 하나의 인상적인 벤치마크에 그칠지를 보여줄 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page