top of page

NVIDIA 로봇 추론은 이제 로봇의 한계를 넘어섰다

1시간 전
15분 분량

Jetson Thor가 40~130와트 전력 범위 안에서 2,070 FP4 테라플롭스를 제공하지만, NVIDIA 로봇 추론은 이제 뚜렷한 갈림길에 놓여 있다. 빠른 제어는 여전히 로봇 탑재형으로 처리해야 한다. 그러나 가장 큰 추론 모델은 점점 더 데이터센터 GPU, 공유 메모리, 그리고 이동형 로봇이 감당할 수 없는 냉각 설비를 요구한다.

이러한 분리는 로보틱스의 핵심 질문을 바꾼다. 더는 로컬 추론과 원격 추론 중 어느 쪽이 모든 환경에서 우세한지가 문제는 아니다. 어떤 판단이 기계 내부에 남아야 하고, 어떤 판단이 기계의 신뢰성을 해치지 않으면서 네트워크를 넘을 수 있는지가 핵심이다.

9월 14일 SemiAnalysis가 공개한 로봇 추론 분석은 이 경제성을 유난히 구체적으로 제시한다. 재구성한 벤치마크에 따르면 B300 한 대는 500밀리초 액션 청크 마감 시간 내에 로봇 12대를 지원할 수 있다. 다만 이러한 절감 효과는 배치 처리, 높은 활용률, 예측 가능한 트래픽, 그리고 대부분의 건물에는 갖춰져 있지 않은 무선 인프라에 달려 있다.

Boston Dynamics는 이 분할 구조의 한쪽 사례를 보여준다. 보도된 아키텍처는 Atlas의 모션 제어를 Jetson Thor에서 처리하는 한편, 상위 수준 계획은 Orbit 플랫폼을 통해 Google 인프라로 보낸다. 다른 개발사들은 무선 연결 의존성을 피하기 위해 더 작은 모델을 수용하면서, 인지부터 행동까지의 전체 스택을 로컬에서 유지한다.

결과적으로 이는 단순한 엣지 대 클라우드 경쟁이 아니다. 집중된 지능과 운영상의 확실성 간의 경쟁이다. 데이터센터는 플릿 전체에서 더 큰 모델을 경제적으로 만들 수 있다. 그러나 연결이 지연될 때도 로봇은 안전하게 작동해야 한다.

로봇 지능은 두 개의 시스템으로 분리되고 있다

중요한 변화는 아키텍처에 있다. 로봇의 추론과 로봇의 움직임은 더 이상 같은 장소에서 실행될 필요가 없다.

범용 로봇은 매우 다른 속도로 여러 종류의 연산을 수행한다. 저수준 안전 및 서보 루프는 상태를 추정하고, 균형을 유지하며, 액추에이터 명령을 내린다. 이 루프는 매초 수백 번 실행될 수 있다.

100헤르츠에서는 다음 출력이 10밀리초 안에 도착해야 한다. 일반적인 무선 왕복 통신만으로도 추론이 시작되기 전에 그 시간을 모두 소모할 수 있다. 따라서 저수준 제어는 원격 GPU에 의존할 수 없다.

행동 계층에도 엄격한 타이밍 요건이 있다. 비전·언어·행동 모델, 즉 VLA는 이미지와 짧은 지시를 물리적 움직임으로 변환한다. 언어 응답이 늦으면 불편할 뿐이지만, 장면이 바뀌는 동안 늦게 도착한 모터 명령은 이미 무의미해질 수 있다.

계획은 더 느린 주기로 작동한다. 계획기는 작업 지시를 해석하고, 이를 하위 작업으로 나눈 뒤, 모션 정책에 간결한 지시를 보낼 수 있다. 5헤르츠로 작동한다면 각 판단에는 200밀리초의 시간이 주어진다.

이 더 넓은 예산은 로봇 외부 추론의 여지를 만든다. 로컬 정책이 즉각적인 움직임을 처리하는 동안 계획기는 더 큰 모델, 더 깊은 컨텍스트, 데이터센터급 메모리를 활용할 수 있다. 상위 수준의 추론에 더 오래 걸리더라도 로봇은 물리적으로 반응성을 유지한다.

SemiAnalysis에 따르면 Boston Dynamics는 Atlas에 이 계층형 패턴을 적용한다. System 1 계층은 Jetson Thor에서 시각운동 제어를 처리한다. System 2는 Orbit 및 Google 인프라를 통해 원격으로 계획을 수행한다.

제조 작업 지시는 Atlas에게 작업을 완료하고 결과물을 특정 재고 보관함에 넣으라고 지시할 수 있다. System 2는 이 추상적 요청을 System 1이 실행할 수 있는 더 작은 지시로 변환한다.

이 변환에는 시각적 안내가 포함될 수 있다. 원격 계획기는 로봇 시야 속 마커를 통해 올바른 보관함을 식별할 수 있다. 그러면 로컬 VLA는 눈에 보이는 대상에 연결된 구체적인 지시를 받는다.

보고서에 따르면 System 2는 실행 과정도 감독한다. 진행 상황을 관찰하고 저수준 정책이 잘못 작동하는 시점을 감지한다. 이 역할은 가끔씩 작업을 요청하는 것보다 더 빈번한 통신을 필요로 한다.

SemiAnalysis는 작동 가정이 10초마다 한 번의 쿼리에서 매초 한두 번의 쿼리까지 이를 수 있다고 말한다. 이 빈도에서는 네트워크가 운영 워크플로 내부에 직접 들어오게 된다.

이 아키텍처는 실용적인 절충안이다. Atlas는 최첨단 추론과 임베디드 효율성을 모두 결합한 단일 모델을 기다리지 않는다. Boston Dynamics는 결정론적 루프를 로컬에 유지하면서 더 강력한 원격 계획 기능에 접근할 수 있다.

이 절충안은 기사 핵심 갈등도 드러낸다. 원격 판단이 하나 추가될 때마다 로봇의 지능은 확장되지만, 동시에 연결성이 유용한 작업을 중단시킬 수 있는 순간도 하나 더 늘어난다.

대안은 완전한 로컬 실행이다. 더 제한적인 창고, 제조 또는 가정용 작업을 추구하는 기업은 제약된 환경에 맞춰 더 작은 정책을 학습시킬 수 있다. 이들 시스템은 실행 경로에서 원격 추론을 제거하는 대신 일부 범용성을 포기한다.

어느 방식도 네트워크를 완전히 없애지는 않는다. 로컬 지능을 갖춘 로봇도 학습 데이터를 업로드하고, 소프트웨어 업데이트를 받고, 플릿 텔레메트리를 보고하거나, 원격 조작을 요청한다. 차이는 네트워크 장애가 현재 행동을 중단시키는지 여부다.

이 차이는 벤치마크 점수보다 중요하다. 이는 잠시 플릿 서비스를 잃는 로봇과 뇌의 일부에 대한 접근을 잠시 잃는 로봇을 구분한다.

NVIDIA 로봇 추론은 메모리 한계에 부딪히고 있다

Jetson Thor는 임베디드 성능의 상한을 높이지만, 모델 성장은 이동형 플랫폼이 수용할 수 있는 속도보다 더 빠르게 진행되고 있다.

NVIDIA는 Jetson Thor를 피지컬 AI를 위한 주력 플랫폼으로 포지셔닝한다. 공개된 Jetson Thor 사양에는 128GB 메모리, 초당 273GB의 메모리 대역폭, 2,070 FP4 테라플롭스가 기재돼 있다.

이 모듈은 40~130와트에서 작동할 수 있다. NVIDIA는 AGX Orin 대비 성능은 7.5배, 에너지 효율은 3.5배라고 밝힌다. 이는 독립적인 배포 결과가 아니라 회사 측 비교다.

로봇에서 이 전력 범위는 중요하다. 이동형 플랫폼은 배터리를 이동, 센서, 액추에이터, 통신, 연산 사이에 나눠야 한다. 냉각 하드웨어 역시 공간과 에너지를 소비한다.

데이터센터 B300은 다른 물리적 범주에 속한다. 고용량 메모리, 고밀도 전력 공급, 액체 냉각을 갖춘 랙 장착 시스템을 위해 설계됐다. 보행 기계가 겪는 무게, 진동, 열적 한계에 직면하지 않는다.

차이는 단순히 원시 연산 성능에 있지 않다. 대형 모델은 파라미터와 중간 데이터를 메모리로 반복적으로 이동시킨다. 메모리 용량은 모델이 탑재 가능한지를 결정하고, 대역폭은 답을 얼마나 빨리 만들 수 있는지를 좌우한다.

Jetson Thor는 이전 세대보다 더 많은 메모리를 탑재한다. Xavier는 32GB를 사용했고 AGX Orin은 64GB에 도달했다. Thor는 이를 128GB로 두 배 늘렸다.

로봇 모델은 가장 큰 언어 모델보다 여전히 훨씬 작지만, 규모는 커지고 있다. SemiAnalysis는 약 30억~140억 파라미터 범위의 범용 정책을 언급한다. 아키텍처, 정밀도, 컨텍스트, 런타임 설계 때문에 파라미터 수는 완벽한 비교 기준이 아니다.

일부 최신 시스템은 이미 임베디드 모듈의 실용적 범위를 넘어섰다. NVIDIA의 DreamZero는 비디오 확산을 기반으로 구축된 140억 파라미터 월드 액션 모델이다. SemiAnalysis는 실시간 작동을 위해 로봇 외부에 GB200 GPU 두 대가 필요하다고 보고한다.

NVIDIA의 또 다른 프로젝트 RoboTTT는 반대 방향을 보여준다. 이는 작동 중 임시 가중치를 업데이트하는 테스트 타임 트레이닝을 갖춘 더 작은 정책을 사용한다. 이 설계는 탑재형 배포가 가능할 만큼 작게 유지하면서 더 긴 사용 가능 컨텍스트를 제공하는 것으로 전해진다.

이 상반된 프로젝트들은 NVIDIA 로봇 추론을 하나의 로드맵으로 축소할 수 없는 이유를 보여준다. 더 나은 실리콘은 개발자들이 더 많은 지능을 로컬로 옮기도록 유도한다. 더 큰 모델은 이러한 이득을 소진하고 오프로딩의 필요성을 다시 강화한다.

이 압력은 반도체 공급망에도 미친다. Jetson 제품과 데이터센터 가속기는 점점 더 선도 제조 노드에 의존한다. 전용 고성능 연산 장치를 탑재한 로봇 한 대는 실리콘과 메모리를 한 기계에 영구적으로 할당한다.

공유 데이터센터 추론은 이 할당을 바꾼다. 동일한 가속기가 서로 다른 시간에 도착하는 여러 로봇의 요청을 처리할 수 있다. 개별 기계가 가장 큰 모델을 호출하지 않은 채 오랫동안 대기하거나 이동할 때 이러한 풀링은 특히 매력적이다.

SemiAnalysis는 공유 GPU 한 대당 약 7대의 로봇에서 실리콘 효율성 역전점이 나타난다고 추정한다. 메모리 추정치는 GPU 한 대당 약 5대의 로봇에서 교차한다. 이 수치는 모델, 워크로드, 하드웨어 가정에 따라 달라진다.

정확한 역전점보다 방향성이 더 중요하다. 전용 연산 장치는 예측 가능한 소유권을 제공하는 반면, 공유 연산은 비싼 실리콘에서 더 많은 작업을 끌어낸다. 플릿 규모는 이 차이를 증폭시킨다.

임베디드 하드웨어도 가혹한 환경에서 작동한다. 진동과 충격을 흡수하고, 먼지에 노출되며, 때로는 액체나 온도 변화가 있는 환경에서 작동한다. 데이터센터 가속기는 특수 유지보수가 가능한 통제된 랙에 놓인다.

탑재형 장치 교체는 연산 예산 이상의 영향을 미친다. 모듈을 정비하려면 로봇 전체를 운영에서 제외해야 할 수 있다. 서버 GPU가 고장 나면 다른 장비는 남은 클러스터를 계속 사용하는 동안 해당 GPU를 격리할 수 있다.

그렇다고 데이터센터가 로컬 하드웨어를 없애는 것은 아니다. 모든 로봇은 여전히 인지, 안전, 폴백 동작을 위한 충분한 연산 능력을 필요로 한다. 오프로딩은 용량 목표를 바꿀 뿐, 로봇을 원격 제어 셸로 바꾸지는 않는다.

이 때문에 Jetson Thor와 B300은 직접적인 대체재가 아니다. Thor는 이동형 전력 범위 안에서 제한된 로컬 자율성을 제공한다. B300은 워크로드와 네트워크가 허용할 때 풀링된 추론 용량을 제공한다.

B300 경제성은 바쁜 플릿에 달려 있다

공유 B300이 매력적인 이유는 단지 칩이 더 빠르기 때문이 아니라, 많은 로봇이 이를 계속 바쁘게 만들기 때문이다.

SemiAnalysis는 공개 코드와 모델 가중치를 사용할 수 없었기 때문에 NVIDIA의 RoboTTT와 유사한 워크로드를 재구성했다. 이 재구성은 작업 정확도가 아니라 논문의 연산 및 메모리 프로필에 맞췄다.

이 단서는 필수적이다. 이 벤치마크는 대표적 워크로드를 제공하는 비용을 측정한다. 재구성된 시스템이 공개되지 않은 모델만큼 로봇 작업을 잘 수행한다는 사실을 입증하지는 않는다.

테스트는 32개 액션 헤드 블록 전반에 16개 테스트 타임 트레이닝 모듈을 삽입했다. 각 로봇은 151MB의 임시 빠른 가중치 상태도 보유했다. 서버는 배치 호출 전후로 이 상태를 수집하고 재분배해야 했다.

이 조건에서 B300 한 대는 500밀리초 청크 마감 시간 내에 로봇 12대를 지속적으로 지원한 것으로 전해진다. RTX 6000 Pro Server Edition은 4대를 지원했다. 비교에는 평균보다 느린 응답이 더 중요한 고백분위 지연 시간 기준이 사용됐다.

SemiAnalysis는 이어 로봇 96대를 지원하는 세 가지 배포 모델을 구성했다. 하나는 데이터센터에 B300 용량을 배치했고, 다른 하나는 RTX 서버를 사용했으며, 세 번째는 모든 로봇에 Jetson Thor 하드웨어를 설치했다.

활용률 조정 전에는 Jetson Thor도 경쟁력을 유지했다. 이 분석은 고밀도 FP4 연산 단위당 시간당 비용이 Thor와 B300에서 거의 비슷하다고 계산했다. RTX 하드웨어는 해당 워크로드에서 상대적으로 불리하게 평가됐다.

활용률이 결과를 바꿨다. 서버는 플릿 전체의 수요를 풀링하고 하루 동안 여러 로봇의 작업을 처리할 수 있다. 탑재형 모듈은 로봇이 충전 중이거나 대기 중이거나 가벼운 작업을 수행하는 동안에도 한 기계에 묶여 있다.

이 모델은 B300 활용률을 약 90%, 탑재형 Thor 모듈의 활용률을 약 40%로 가정했다. 이 조정 후, 고밀도 FP4 연산 단위당 B300 비용은 Thor 수치의 약 46%까지 떨어졌다.

가정 내 배치 사례는 모델링된 차이를 더 크게 만들었다. SemiAnalysis는 한 기업의 가정용 로봇이 현재 하루에 한두 시간만 작동한다고 보고한다. 이는 하루 시간의 약 4~8%에 해당한다.

해당 기업은 기능이 개선되면 사용 시간이 하루 4~5시간 수준으로 늘어날 것으로 예상하는 것으로 전해진다. 그러나 그 경우에도 가사에는 자연스러운 한계가 있다. 로봇에게는 처리해야 할 가정 업무가 끊임없이 이어지지 않는다.

산업용 로봇은 더 오래 작동할 수 있다. SemiAnalysis는 Figure의 BMW 배치 사례에서 약 11개월 동안 약 1,250시간의 운영 시간이 기록됐다고 인용한다. 해당 기계들은 약 40%의 가동률로 하루 약 10시간 일한 것으로 전해진다.

이러한 관찰은 풀링의 이점을 설명한다. 데이터센터 GPU는 교대 근무, 사업장, 시간대를 넘나들며 로봇을 지원할 수 있다. 한 배치에서 남는 유휴 용량은 다른 배치의 수요를 흡수할 수 있다.

모델은 GPU당 산업용 로봇 약 5대부터 B300의 경제성이 앞서기 시작한다고 분석했다. 그보다 적은 수준에서는 전용 서버가 또 하나의 저활용 자본 자산이 될 위험이 있다.

이것이 Jetson Thor와 B300의 총소유비용 비교에 붙는 핵심 조건이다. B300은 단지 서버실에 놓여 있다고 해서 경제성이 생기지 않는다. 랙, 네트워크, 전력, 지원 시스템의 비용을 상각할 만큼 충분히 조율된 수요가 필요하다.

클라우드 임대는 소규모 배치의 위험을 줄일 수 있지만, 별도의 변수를 수반한다. 운영자는 제공업체 마진, 지역별 용량, 데이터 이동, 서비스 가용성을 고려해야 한다. SemiAnalysis는 일반적인 클라우드 임대 계약이 아니라 소유자-운영자 경제성을 모델링했다.

고밀도 FP4 연산 역시 불완전한 비즈니스 지표다. 로봇 구매자는 성공적인 작업, 예측 가능한 교대 운영, 복구 가능한 실패를 위해 비용을 지불한다. 네트워크 중단이 처리량을 낮추거나 사람의 개입을 요구한다면 저렴한 연산의 가치는 제한적이다.

같은 경고는 로컬 추론에도 적용된다. 완전히 활용되는 온보드 모듈은 문서상 효율적으로 보일 수 있지만, 유의미한 움직임에 필요한 배터리 용량을 소모할 수 있다. 더 큰 배터리는 무게를 늘리고, 이는 이동에 필요한 에너지를 증가시킬 수 있다.

따라서 플릿 운영자에게는 워크로드 수준의 비교가 필요하다. 관련 단위는 완료된 피킹 작업, 성공한 조립 단계 또는 자율 운영 시간일 수 있다. 하드웨어 처리량은 하나의 입력값일 뿐이다.

B300의 경제성은 범용 플릿을 구축하는 로보틱스 기업에 압박을 가한다. 배치가 충분한 밀도에 도달하면 로컬 전용 아키텍처는 간헐적으로 사용되는 기계 안에 값비싼 연산 자원을 묶어둘 수 있다.

반대 방향의 압박은 원격 우선 개발자에게 가해진다. 이들은 풀링으로 절감한 비용이 실제 건물, 실제 무선 간섭, 높은 백분위 지연 속에서도 유지된다는 점을 입증해야 한다. 그렇지 않으면 이론적 가동률은 운영 중단으로 바뀐다.

네트워크 장벽은 테일 레이턴시 문제다

평균 네트워크 속도는 양호해 보일 수 있지만, 드문 지연은 원격 로봇 추론을 위험하거나 사용할 수 없게 만들 수 있다.

고정된 지연은 대체로 관리할 수 있다. 시스템은 장면이 어떻게 바뀔지를 추정하고 미리 계획할 수 있다. 일반적으로 지터라고 불리는 가변 지연은 로봇이 다음 업데이트가 언제 도착할지 알지 못하게 만든다.

가장 큰 피해를 주는 사건은 가끔 발생하는 1초짜리 급증일 수 있다. 대시보드는 이를 견딜 수 있다. 하지만 부품을 들고 있거나, 사람에게 다가가거나, 균형을 회복하는 로봇은 이를 무해한 일로 취급할 수 없다.

Microsoft Research는 2026년 로보틱스 오프로딩 연구에서 비슷한 결론에 도달했다. 연구진은 온보드, 엣지, 클라우드 GPU 플랫폼 전반에서 모바일 매니퓰레이션 워크로드를 테스트했다.

이 연구는 소형 온보드 GPU가 전체 워크로드 스택을 실행할 수 없다는 점을 발견했다. 대형 온보드 GPU는 배터리 수명을 몇 시간 단축했다. 오프로딩은 이러한 제약을 완화했지만, 추가 네트워크 지연은 작업 정확도를 낮췄다.

대역폭은 또 다른 장벽을 만들었다. 로봇 관측 데이터를 원격 모델로 전송하려면 지속적인 업링크 전송이 필요할 수 있다. 이 트래픽 패턴은 비교적 고정된 기기에서의 다운로드를 우선하는 소비자 인터넷 서비스와 다르다.

로봇은 카메라 스트림과 센서 데이터를 업로드하면서 움직인다. 금속 본체는 무선 신호를 차단하거나 반사할 수 있다. 모터와 주변 장비는 전자기 잡음을 만들며, 자세 변화는 안테나 형상을 계속 바꾼다.

공장에는 밀집된 랙, 이동하는 재고, 기계류, 다수의 액세스 포인트가 추가된다. 설치 당시에는 작동했던 연결도 장비가 이동하거나 다른 기계가 가동되면 성능이 저하될 수 있다.

가정은 다른 종류의 불확실성을 제공한다. 벽은 약전파 구역을 만들고, 소비자용 라우터는 고르지 않은 커버리지를 제공하며, 이웃 사용자들은 공유 용량을 두고 경쟁한다. 가정용 로봇은 다른 방으로 들어가는 것만으로도 음영 지역에 도달할 수 있다.

액세스 포인트 간 핸드오프는 특히 위험하다. SemiAnalysis는 일반적인 라우터가 전환 중 100밀리초에서 수초 동안 트래픽을 중단시킬 수 있다고 말한다. 복구에는 추가 시간이 필요할 수 있다.

이러한 실패는 단순 평균으로 포착되지 않는다. 99개 요청에 빠르게 응답하는 네트워크라도, 100번째 요청이 로봇의 마감 시간 이후에 도착한다면 허용될 수 없다.

따라서 높은 백분위의 지연 시간은 모든 배치 검토에서 모델 정확도 및 하드웨어 처리량과 함께 다뤄져야 한다. 개발자는 중앙값 성능뿐 아니라 운영상 의미 있는 가장 느린 응답도 측정해야 한다.

Microsoft 측정 논문은 모든 시나리오에 통하는 단일 배치 전략은 없다고 결론짓는다. 성능, 대역폭, 에너지, 지연 시간, 비용, 공유 자원 경합이 상호작용한다.

이 증거는 로보틱스가 데이터센터로 전면 이전될 것이라는 주장을 약화한다. 원격 추론은 네트워크 변동을 감당할 수 있는 마감 시간을 가진 워크로드에서만 실현 가능해진다. 안전에 중요한 루프에는 여전히 로컬 실행과 정의된 폴백 동작이 필요하다.

원격 계획은 데이터 거버넌스 문제도 제기할 수 있다. 로봇 카메라는 생산 방식, 직원, 고객 자산 또는 가정 내부 활동을 포착할 수 있다. 이 프레임을 외부로 전송하면 보안 경계가 확대된다.

SemiAnalysis는 Boston Dynamics가 고객에게 공유 데이터에 대한 세분화된 제어권을 제공한다고 보고한다. Orbit는 SOC 2 Type 2 인증을 보유하고 있으며, Google 인프라가 원격 추론 계층을 지원한다.

인증과 계약상 통제는 거버넌스 문제를 다루지만, 모든 배치 환경의 요구를 충족할 수는 없다. 군사 시설, 원자력 부지 및 기타 제한 환경은 기술적 안전장치와 관계없이 외부 데이터 이동을 금지할 수 있다.

이러한 한계는 온프레미스 엣지 클러스터에 지속적인 시장을 만든다. 인근 서버는 데이터를 시설 내부에 유지하면서도 로봇보다 더 큰 용량을 제공할 수 있다. 네트워크 경로는 짧아지지만, 여전히 로컬 무선 연결의 신뢰성에 의존한다.

개발자는 모델을 더 정교하게 분할할 수도 있다. 로봇은 이미지를 압축하거나, 관련 프레임을 선택하거나, 연속적인 원시 비디오 대신 중간 특징을 전송할 수 있다. 각각의 기술은 대역폭을 줄이는 대신 로컬 연산과 시스템 복잡도를 추가한다.

이중화 연결은 또 다른 선택지다. 로봇은 여러 Wi-Fi 대역을 사용하거나 Wi-Fi와 사설 5G를 결합할 수 있다. 중복 전송은 신뢰성을 높이지만, 추가 무선 장치는 전력을 소모하고 조율된 스케줄링을 요구한다.

회의적인 결론은 명확하다. 데이터센터 추론에는 신뢰할 만한 경제성과 기능적 이점이 있지만, 일반적인 네트워크가 필요한 신뢰성을 어디서나 제공할 수 있다는 공개 벤치마크는 없다.

배치 사례가 실패 분포, 개입률, 완료 작업 지표를 공개하기 전까지 TCO 비교는 조건부로 남는다. 네트워크는 별도의 유틸리티가 아니라 추론 시스템의 일부다.

로봇 네트워크는 업링크 트래픽을 중심으로 설계돼야 한다

오프디바이스 추론에는 로봇의 카메라에서 데이터센터 GPU까지 이어지는 목적 맞춤형 스케줄링이 필요하다.

대부분의 무선 인프라는 사용자가 업로드하는 정보보다 더 많은 정보를 다운로드한다고 가정한다. 로봇 추론은 이 패턴을 뒤집는다. 카메라는 모델이 응답하기 전에 업스트림으로 이동해야 하는 관측 데이터를 지속적으로 생성한다.

표면적인 대역폭을 늘린다고 문제가 모두 해결되지는 않는다. 여러 로봇이 같은 순간 전송할 수 있어 대기열과 충돌이 생긴다. 고용량 채널도 접속 제어와 예측 가능한 스케줄링 없이는 지터를 만들어낸다.

로봇 인식 액세스 포인트는 각 기계에 반복적인 업링크 슬롯을 예약할 수 있다. 로봇은 전파 사용 시간을 두고 경쟁하는 대신, 정해진 주기에 따라 관측 데이터를 전송하게 된다. 다른 트래픽은 남은 용량을 사용한다.

이 일정은 모델의 타이밍을 이해해야 한다. 수초마다 한 번 호출되는 원격 플래너는 매초 여러 프레임을 처리하는 정책과 다른 예약을 필요로 한다. 네트워크 구성과 추론 설계는 서로 결합된다.

위치 인식 빔포밍은 이동하는 기계 주변의 무선 커버리지를 미리 준비할 수 있다. 네트워크는 위치와 계획된 움직임을 활용해 신호를 조향하거나, 기존 연결이 저하되기 전에 핸드오프를 시작한다.

중앙 타이밍도 중요하다. 배치 처리가 데이터센터 절감 효과를 내려면 여러 로봇의 요청이 함께 실행될 만큼 가까운 시점에 도착해야 한다. 무작위 도착 시간은 서버가 기다리거나 더 작은 배치를 처리하도록 만든다.

공유 시계는 캡처, 인코딩, 전송, 추론을 조율할 수 있다. 서버는 다음 관측 그룹이 언제 도착해야 하는지 파악하고 이를 위해 GPU 용량을 예약할 수 있다.

지연된 관측 데이터는 일반 대기열에 무기한 머물러서는 안 된다. 다음 배치에 포함해야 할 수도 있고, 로컬 시스템이 이를 폐기해야 할 수도 있다. 오래된 프레임은 누락된 프레임보다 더 위험할 수 있다.

NVIDIA의 데이터센터 플랫폼은 서버 측이 얼마나 발전했는지를 보여준다. GB300 NVL72 시스템은 수랭식 랙 안에 72개의 Blackwell Ultra GPU와 36개의 Grace CPU를 결합한다.

NVIDIA는 총 GPU 메모리 20 TB와 초당 130 TB의 NVLink 대역폭을 제시한다. ConnectX-8 설계는 각 GPU에 광범위한 네트워크 용량을 제공한다. 이 수치는 일반적인 엣지 어플라이언스가 아니라 통합형 AI 팩토리를 설명한다.

따라서 랙 내부의 데이터센터 네트워킹은 경로의 한 부분일 뿐이다. 로봇 트래픽은 가속기에 도달하기 전에 여전히 무선망, 액세스 포인트, 시설 네트워크, 광역 연결, 제공업체 경계를 통과해야 한다.

각 경계는 또 다른 대기열 또는 장애 도메인을 추가한다. 운영자에게는 개별 하드웨어 주장보다 엔드투엔드 서비스 수준이 필요하다. 빠른 GPU도 예측 불가능한 업링크에서 이미 잃은 시간을 되돌릴 수 없다.

사설 5G는 야외 경로 또는 대규모 산업 현장에서 도움이 될 수 있다. Wi-Fi는 가정과 많은 공장에서 높은 로컬 용량을 제공한다. 어느 기술도 자동으로 결정론적 동작을 제공하지는 않는다.

가장 강력한 아키텍처는 여러 연결을 결합할 가능성이 높다. 스케줄러는 로컬 환경이 좋을 때 Wi-Fi를 선택하고, 셀룰러로 장애 조치하며, 그 전 과정에서 최소한의 로컬 정책을 활성 상태로 유지할 수 있다.

인식 변화는 트래픽을 더욱 줄일 수 있다. 로봇은 관련 영역을 잘라내고, 안정된 기간에는 프레임 속도를 낮추거나, 작업별 특징을 인코딩할 수 있다. 목표는 가능한 모든 픽셀이 아니라 유용한 정보를 전송하는 것이다.

이러한 최적화는 자체적인 위험을 수반한다. 로컬 필터가 중요한 것을 버리면 원격 모델은 이를 보지 못한다. 개발자는 압축 및 선택 방식을 드문 물체, 조명, 가림, 실패 사례에 맞춰 검증해야 한다.

모델은 요청 빈도도 조정할 수 있다. 단순한 행동은 전적으로 온보드에서 실행하고, 낯선 장면에서는 원격 지원을 호출할 수 있다. 이러한 캐스케이드는 가장 큰 이점을 제공하는 지점에 고비용 추론을 집중한다.

이러한 시스템은 온디바이스와 데이터센터 추론의 경계를 흐린다. 배치는 영구적인 것이 아니라 동적이 된다. 로봇은 위험도, 사용 가능한 대역폭, 모델 신뢰도, 작업 복잡도에 따라 경로를 선택한다.

그 유연성은 매력적이지만, 검증은 더 어려워진다. 엔지니어는 더 많은 운영 모드와 전환 상황을 테스트해야 한다. 원격 요청이 성공적으로 시작됐지만 완료되기 전에 연결이 끊기는 경우에도 시스템은 명확하게 동작해야 한다.

로컬 폴백은 전체 기능을 그대로 유지하는 척하지 않으면서도 안전성을 보장해야 한다. 로봇은 멈추거나, 물체를 안전하게 내려놓거나, 후퇴하거나, 사람의 도움을 요청할 수 있다. 오래된 원격 지침을 계속 따르는 것은 또 다른 위험을 만든다.

따라서 네트워크 장벽은 엔지니어링과 제품 차원의 경계다. 이를 해결한 개발자는 공유형 지능에 접근할 수 있다. 고객은 그 혜택을 얻기 위해 어느 정도의 인프라를 구축할지 결정해야 한다.

배포 환경은 범용 로봇과 전문 로봇을 가르고 있다

작업이 다양할수록 원격 추론의 필요성이 커지며, 제약된 작업에는 더 작은 로컬 정책이 유리하다.

공장에는 예측 가능한 반복 작업과 쉽게 사라지지 않는 변동성이 공존한다. 환경, 부품, 동작이 안정적으로 유지될 때는 기존 자동화가 잘 작동한다. 하지만 제품 구성과 작업 지침이 자주 바뀌면 비용이 급격히 늘어난다.

SemiAnalysis는 차량 한 대에 수만 개의 부품이 들어갈 수 있다고 지적한다. 하나의 생산 라인은 다양한 색상의 5~10개 모델을 처리할 수 있다. 연식 변경은 추가적인 재구성을 요구한다.

범용 휴머노이드는 하나의 고정된 궤적을 반복 재생하는 대신, 이러한 변화하는 조건을 해석해야 한다. 이 요구는 대규모 계획 모델, 긴 컨텍스트, 중앙집중식 업데이트의 가치를 높인다.

Boston Dynamics는 더 폭넓은 기능을 위해 네트워크 의존성을 감수할 의향이 있는 것으로 보인다. 로컬 System 1은 이동을 담당하고, 원격 System 2는 지시 해석, 번역, 감독을 맡는다.

전문 배포 환경은 다른 선택을 한다. 창고 피킹, 포장, 또는 제한적인 조립 작업은 수십억 개 파라미터 규모의 모델로도 충분히 좁은 범위로 제한될 수 있다. 그러면 완전한 실행 정책을 Jetson급 또는 워크스테이션 기반 하드웨어에 탑재할 수 있다.

로컬 실행은 개인정보 보호와 장애 격리를 개선한다. 또한 고객의 네트워크 부담을 줄인다. 외부 서비스에 접근할 수 없어도 배포 시스템은 계속 작동할 수 있다.

그러나 전문 모델은 기능의 한계에 부딪힐 수 있다. 하나의 제품군에서 개방형 작업으로 확장하려면 추가 모델, 재학습 또는 더 많은 원격 지원이 필요할 수 있다. 로컬의 확실성은 일반화의 한계가 될 수 있다.

가정용 로봇은 이례적인 조합의 조건에 놓인다. 집안일은 다양하기 때문에 더 큰 추론 모델에 유리하다. 반면 네트워크와 물리적 배치는 통제되지 않기 때문에 온보드 추론이 유리하다.

서비스 제공업체는 모든 고객의 라우터 위치를 다시 설계할 수 없다. 또한 사용자가 사설 셀룰러 인프라를 설치할 것이라고 가정할 수도 없다. 기계는 음영 지역, 혼잡, 공유 광대역 환경에 적응해야 한다.

자율주행차는 가장 분명한 로컬 우선 범주에 속한다. 통제되지 않는 무선 환경과 엄격한 응답 기한 속에서 매우 넓은 지역을 이동한다. 안전이 핵심인 인지와 제어는 데이터센터 추론을 기다릴 수 없다.

원격 서비스는 여전히 지도 제작, 플릿 분석, 학습, 소프트웨어 배포를 지원한다. 이러한 기능은 즉각적인 인지-행동 루프 밖에서 작동한다. 연결성은 안전한 제어의 유일한 원천이 되지 않으면서 제품을 개선한다.

이 패턴은 NVIDIA 로봇 추론이 여러 계층으로 확산될 것임을 시사한다. Jetson급 모듈은 실시간 자율성을 보호할 것이다. 로컬 엣지 서버는 민감하거나 현장 특화된 추론을 처리할 것이다. 대규모 데이터센터는 가장 무거운 공유 모델을 제공할 것이다.

상업적 경쟁은 칩만큼이나 오케스트레이션을 둘러싸고 전개될 것이다. 누군가는 각 요청을 라우팅하고, 지연 시간을 모니터링하고, 플릿을 동기화하고, 데이터를 보호하며, 로컬 기능만으로 충분한 시점을 결정해야 한다.

로봇 제조업체가 그 전체 계층을 소유할 수도 있다. 클라우드 제공업체는 이를 관리형 인프라로 판매할 수 있다. 네트워킹 공급업체는 로봇 인지형 스케줄링을 액세스 포인트와 사설 셀룰러 시스템에 내장할 수 있다.

NVIDIA는 임베디드와 데이터센터 하드웨어를 모두 공급한다는 점에서도 우위가 있다. 공통 소프트웨어 스택은 개발자가 모든 구성 요소를 다시 만들지 않고도 Thor, 워크스테이션 GPU, B300 서버 사이에서 워크로드를 이동할 수 있게 해준다.

이 우위가 자동으로 확보되는 것은 아니다. 서로 다른 하드웨어 대상은 여전히 양자화, 메모리, 발열, 스케줄링 제약을 부과한다. 서버에서 검증된 정책도 임베디드 장치에 맞게 최적화한 뒤에는 다르게 동작할 수 있다.

따라서 경쟁은 배포 근거를 중심으로 전개될 것이다. 구매자는 고립된 모델 시연이 아니라 현실적인 부하에서의 작업 성공률을 확인해야 한다. 또한 연결성이 저하될 때의 투명한 동작 방식도 필요하다.

가장 신뢰할 수 있는 제공업체는 개입률, 네트워크 장애 복구, 생산적 운영 시간, 에너지 소비량, 완료 작업 수를 보고할 것이다. 이러한 측정치는 모델 지능을 비즈니스 가치와 연결한다.

바로 이 지점에서 범용 로봇과 전문 로봇의 구분이 실용적인 문제가 된다. 범용 로봇은 여러 전용 시스템을 대체할 수 있다면 더 많은 인프라를 정당화한다. 전문 로봇은 하나의 가치 있는 작업을 안정적으로 수행한다면 로컬의 단순성을 정당화한다.

승리하는 아키텍처는 현장마다 다를 수 있다. 수십 대의 로봇이 있는 통제된 공장은 강력한 자원 공유 경제성을 제공한다. 연결성이 약한 원격 작업 현장은 더 작은 모델을 쓰더라도 완전한 로컬 실행을 선호할 수 있다.

로봇의 사고 위치를 결정할 세 가지 신호

다음 단계는 또 다른 최고 연산 성능 발표가 아니라 배포 근거, 플릿 활용률, 네트워크 신뢰성에 의해 결정될 것이다.

첫 번째 신호는 실제 운영 플릿에서 나오는 독립적인 지연 시간 데이터다. 공급업체는 전체 교대 근무에 걸쳐 높은 백분위 응답 시간, 핸드오프 중단, 요청 손실률, 복구 동작을 공개해야 한다.

일관된 꼬리 지연 시간은 원격 계획의 근거를 강화할 것이다. 평균 응답 시간과 서버 처리량이 뛰어나더라도 잦은 멈춤이나 사람의 개입은 그 근거를 약화할 것이다.

두 번째 신호는 여러 로봇 플릿에 걸친 실제 B300 활용률이다. SemiAnalysis는 약 90%의 서버 활용률을 모델링했으며, 이는 예상되는 경제적 우위의 상당 부분을 이끈다.

운영자는 수요를 실제로 그 수준까지 통합할 수 있는지 보여줘야 한다. 로봇 요청은 지나치게 동시에 발생할 수 있고, 작업별로 달라질 수 있으며, 초기 배포 단계에서는 너무 드물 수 있다.

안정적인 작업 지연 시간과 함께 지속적인 활용률이 유지된다면 공유 데이터센터 가설을 뒷받침할 것이다. 활용되지 않는 클러스터는 경제성의 손익분기점을 로컬 추론과 더 작은 현장 서버 쪽으로 옮길 것이다.

세 번째 신호는 Jetson Thor의 제약 범위 안에서의 모델 성능이다. RoboTTT는 아키텍처와 테스트 시점 적응을 통해 거대한 모델에 의존하지 않고도 더 긴 컨텍스트를 만들 수 있음을 시사한다.

더 작은 로컬 정책이 원격 추론의 품질에 근접한다면 네트워크 의존성은 정당화하기 더 어려워진다. 반대로 성능이 계속 모델 크기와 메모리를 따라간다면 더 많은 계획 작업이 공유 가속기로 이동할 것이다.

구매자는 공급업체에 경계를 명확히 정의하도록 요구해야 한다. 어떤 루프가 로컬에 남는가? 어떤 요청이 현장을 벗어나는가? 연결이 느려지면 어떤 일이 일어나며, 로봇은 얼마나 오래 안전하게 계속 작동할 수 있는가?

또한 워크로드 기반의 경제성을 요구해야 한다. 이론적 연산량 단위당 비용은 작업 완료, 배터리 영향, 개입, 다운타임을 보여주지 않는다. 생산적인 자율 운영 시간은 더 유용한 기준이 된다.

개발자도 관련된 설계 선택에 직면한다. 부족한 엔지니어링 역량을 모델 축소에 투입할 수도 있고, 신뢰할 수 있는 분산 추론 시스템을 구축할 수도 있다. 대부분의 팀은 결국 두 가지 모두를 어느 정도 수행하게 될 것이다.

NVIDIA 로봇 추론은 이제 이 선택지 전체에 걸쳐 있다. Jetson Thor는 정교한 로컬 제어를 현실적인 선택으로 만들고, B300는 플릿 규모에서 공유형 추론을 매력적으로 만든다. 아직 해결되지 않은 요소는 둘을 연결하는 경로다.

새롭게 떠오르는 해답은 절대적인 선택이 아니라 계층적 구조다. 안전, 이동, 폴백 정책은 기계에 유지한다. 네트워크와 데이터 규칙이 허용할 때는 더 느리고 복잡한 추론을 외부로 보낸다.

이 설계가 트레이드오프를 없애지는 않는다. 대신 그것을 가시화하고 책임을 배정할 수 있게 만든다. 모든 원격 기능에는 기한, 폴백 동작, 데이터 경계, 측정 가능한 경제적 이점이 필요하다.

피지컬 AI를 평가하는 팀에게 당장의 질문은 단순히 추론이 어디서 실행되는지가 아니다. 가장 큰 두뇌가 일시적으로 접근 불가능해져도 모든 계층이 여전히 유용한가가 핵심이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page