top of page

Skild AI S1, 하나의 영상으로 로봇 작업을 학습하지만 신뢰성이 여전히 관건

1시간 전
11분 분량

Skild AI S1은 하나의 영상을 보고, 해당 작업이 10분간 이어지더라도 재학습 없이 처음 보는 로봇 작업을 시도할 수 있다고 알려졌다. 지금까지 산업용 로봇을 새로운 작업에 적응시키려면 대개 새로운 시연, 작업별 학습, 그리고 추가 검증 주기가 필요했다. Skild는 그 과정의 상당 부분을 시각적 프롬프트로 대체하려 한다.

회사는 S1이 화분 심기, 팬케이크 조리, 커피 추출, 키트 조립을 포함한 다단계 활동을 완료했다고 밝혔다. 이는 통제된 시연이지만, 컵을 집는 것과 같은 단일 동작보다 더 어려운 목표를 제시한다. 각 작업에서 로봇은 의도를 파악하고, 진행 상황을 기억하며, 여러 동작을 조율하고, 상황 변화가 생겼을 때 복구해야 한다.

이 차이는 생산 환경의 모든 변경을 또 하나의 엔지니어링 프로젝트로 취급하는 기존 로봇 배치 방식에 부담을 준다. 또한 Skild는 Generalist AI, Google DeepMind, Physical Intelligence, 그리고 NVIDIA 자체 로봇 모델 프로그램과 나란히 경쟁하게 된다. 모든 그룹이 더 유연한 기계를 추구하고 있지만, Skild는 특히 직접적인 주장을 내놓는다. 영상은 새로운 학습 데이터셋이 아니라 프롬프트처럼 작동해야 한다는 것이다.

Skild AI S1, 하나의 영상을 로봇 프롬프트로 전환하다

중요한 변화는 로봇이 영상을 따라 했다는 데 있지 않다. S1이 모델 가중치를 바꾸지 않고 그렇게 했다고 알려졌다는 점이다.

Skild는 S1을 로봇 조작을 위한 인컨텍스트 학습 시스템으로 소개했다. 인컨텍스트 학습은 모델이 기본 파라미터를 업데이트하지 않고 작동 중에 제공된 정보를 활용한다는 뜻이다. 이 기술은 언어 모델이 프롬프트 안에 포함된 예시를 따라가는 방식과 닮아 있다.

작업자는 사람의 시점에서 원하는 작업을 기록하고 그 영상을 S1에 제공한다. 이후 모델은 의도한 결과, 관련 물체, 동작 순서, 작업 진행 상황을 해석한다. 그리고 이 맥락을 현재 장면에서 작동하는 로봇을 위한 명령으로 변환한다.

공개된 S1 robot model 설명에 따르면, 시연된 모든 사례는 동일한 모델 가중치로 생성됐다. Skild는 시스템이 새로운 활동을 시도하기 전에 작업별 미세 조정이나 사후 학습을 전혀 받지 않았다고 밝혔다.

시연된 작업은 최대 10분간 이어졌으며 수십 개의 조작 단계를 포함했다. 한 시퀀스에서는 작은 식물을 심고, 흙을 옮기고, 식물을 배치한 뒤 물을 추가해야 했다. 다른 시연에서는 팬케이크 준비, 핸드드립 커피 만들기, 키트 조립이 포함됐다.

이 사례들이 중요한 이유는 긴 작업일수록 오류가 누적되기 때문이다. 개별 단계에서 각각 90%의 성공률을 보이는 로봇은 서로 독립적인 10개 단계를 모두 완료할 확률이 약 35%에 불과하다. 실제 단계들은 독립적이지 않지만, 이 계산은 장기 작업 성능이 왜 빠르게 저하되는지를 보여준다.

Skild는 화분 심기 테스트가 기록부터 자율 실행까지 11분이 걸렸다고 보고했다. 기록은 오후 9시 16분에 시작됐고, 시연은 오후 9시 22분에 끝났으며, S1은 오후 9시 27분에 작동을 시작했다. 기존의 대부분의 적응 프로젝트는 데이터 수집, 학습, 평가, 배포를 거치기 때문에 더 오래 걸린다.

이 시스템은 실행 중 제한적인 변화도 처리한 것으로 알려졌다. Skild는 물체를 옮기고, 조명을 바꾸며, 비슷한 기능을 가진 물품으로 대체했다. 다른 사례에서는 로봇이 실패한 동작을 다시 시도하거나, 시연에 나온 물뿌리개가 없을 때 컵을 사용했다.

이러한 행동은 S1이 단순히 외워 둔 좌표를 재생한 것은 아님을 시사한다. 시스템은 시연된 목표를 자체 카메라 시야, 몸체, 사용 가능한 물체와 연결해야 했다. 다만 공개된 모든 결과와 해석은 Skild 또는 인프라 파트너인 NVIDIA에서 나왔다.

따라서 이번 발표는 명확한 검증 과제를 남긴다. 외부 평가에서 이러한 역량이 재현된다면, 시각적 프롬프팅은 로봇 팀이 데이터를 수집하고 정책을 재학습하는 빈도를 바꿀 수 있다. 성능이 선별된 환경 밖에서 저하된다면, S1은 새로운 배치 모델이 아니라 인상적인 연구 시연에 머물게 된다.

공장 변화가 프로그래밍된 로봇의 한계를 드러내는 이유

S1은 한 번 작업을 수행할 수 있는 로봇과 작업 환경이 바뀐 뒤에도 계속 작동하는 시스템 사이의 비용 부담이 큰 간극을 겨냥한다.

전통적인 자동화는 엔지니어가 환경을 제한할 수 있을 때 좋은 성능을 낸다. 로봇은 수개월 동안 하나의 용접을 반복하거나, 동일한 부품을 옮기거나, 같은 조립품을 체결할 수 있다. 고정 장치, 안전 장벽, 보정된 도구, 예측 가능한 타이밍이 그 반복을 안정적으로 만든다.

현대 생산 환경은 완전히 고정된 상태로 유지되는 일이 드물다. 공급업체는 부품을 바꾸고, 제조업체는 신제품을 도입하며, 창고 운영자는 작업장을 재배치한다. 작은 변경도 물체 위치, 필요한 힘, 동작 순서, 사이클 타임에 영향을 미칠 수 있다.

기존 시스템은 이런 조건이 바뀔 때 새로운 프로그래밍이나 시연이 필요한 경우가 많다. 이후 엔지니어는 업데이트된 행동을 테스트하고 안전 및 품질 요건을 충족하는지 확인해야 한다. 이 과정은 안정적인 대량 생산 작업에는 정당화될 수 있지만, 자주 바뀌는 작업 전반에서 유지하기는 더 어렵다.

Skild는 상업적 경험이 회사를 인컨텍스트 학습으로 이끌었다고 말한다. 회사는 9월 9일 업데이트에서 제조, 물류, 검사, 보안, 식품 준비, 공장, 데이터 센터 전반에 걸쳐 60곳 이상의 유료 고객 또는 배치 파트너를 확보했다고 주장했다.

또한 회사는 첫 상업 배치 후 10개월 만에 연간 매출 런레이트 1억 달러를 기록했다고 보고했다. 매출 런레이트는 현재 사업 성과를 연간 기준으로 환산한 것이므로, 완료된 한 해 동안 이미 수금한 매출을 반드시 의미하지는 않는다. Skild는 이 수치를 뒷받침하는 감사된 재무제표를 공개하지 않았다.

그럼에도 함께 공개된 deployment claims는 S1에 연구실 벤치마크보다 더 구체적인 적용 환경을 제공한다. Skild, NVIDIA, Foxconn은 Blackwell 시스템 조립을 위해 양팔 로봇에 Skild Brain을 배치하고 있다. 설명된 한 작업 흐름에서는 버스바와 리미트 블록을 설치한 뒤 나사 16개를 체결한다.

Skild는 Sumitomo Wiring Systems와 와이어 하네스 생산 분야에서도 협력하고 있다고 밝혔다. 유연한 전선은 변형되고 겹치며 섬세한 취급이 필요하기 때문에 이 분야는 자동화에 저항해 왔다. 회사는 Mitsui와 함께 상업용 주방에서 범용 로봇을 별도로 시범 운영하고 있다.

이러한 환경은 단순한 조작 능력 이상을 드러낸다. 공장 구매자는 사이클 타임, 오류 복구, 장비 가동 시간, 제품 품질, 작업자 안전, 통합 비용, 유지보수를 중요하게 본다. 로봇이 요구된 모든 동작을 완료하더라도 너무 느리게 작동하면 상업적으로 사용할 수 없을 수 있다.

Skild 역시 이러한 차이를 인정한다. 회사는 기본 시스템의 성공률이 5%이든 99%이든 성공적인 시연은 동일하게 보일 수 있다고 말한다. 창업자들은 또한 신뢰할 수 있는 성능의 마지막 몇 퍼센트포인트를 끌어올리려면 불균형적으로 큰 노력이 필요하다고 주장한다.

이 인정은 S1의 이야기를 더욱 선명하게 만든다. 회사는 시각적 프롬프팅이 배치 엔지니어링을 없앤다고 주장하지 않는다. 대신 프롬프트가 작업 변경 때마다 요구되는 반복적인 데이터 수집과 학습을 줄일 수 있다고 주장한다.

이 구분은 구매자에게 중요하다. 영상 프롬프트는 초기 적응 시간을 단축할 수 있지만, 안전 검토, 툴링, 보정, 공정 승인은 그대로 남을 수 있다. 남는 단계들은 행정적 마찰이 아니다. 이는 제품 손상, 생산 라인 중단, 사람 주변에서의 위험한 움직임을 막는다.

따라서 단기적 기회는 적응 과정에서 비용이 큰 한 층을 줄이는 데 있다. S1은 산업 자동화를 둘러싼 물리적 요건을 제거하지 않는다. 그 요건이 바뀔 때 모델이 작업 지시를 받는 방식을 바꾼다.

이 메커니즘은 재학습을 맥락으로 대체한다

S1은 작업 적응을 학습 파이프라인에서 로봇의 작동 맥락으로 옮기지만, 광범위한 사전 학습이 여전히 보이지 않는 대부분의 작업을 담당한다.

“하나의 영상”이라는 표현은 S1이 관련 경험 없이 시작한다는 인상을 줄 수 있다. 하지만 시스템은 그렇게 작동하지 않는다. 모델은 먼저 로봇 궤적, 시뮬레이션, 인간 영상, 기타 행동 데이터 전반에 걸쳐 광범위한 사전 학습을 거친다.

이 사전 학습은 재사용 가능한 기술과 물리적 패턴을 제공한다. 영상 프롬프트는 S1에 어떤 기술이 중요한지, 어떤 순서로 배치해야 하는지, 작업자가 어떤 결과를 기대하는지를 알려준다. 따라서 새로운 작업은 익숙한 능력을 조합하면서도 학습에 없던 동작이나 시퀀스를 도입할 수 있다.

Skild는 이 과정을 내부 루프와 외부 루프로 설명한다. 사전 학습은 외부 루프를 형성하며, 정책이 시연을 해석하는 방법을 가르친다. 작동 중에는 영상이 모델 가중치를 수정하지 않고 내부 루프의 예시를 제공한다.

이 구분은 S1을 작업별 미세 조정과 차별화한다. 미세 조정은 목표 행동을 위해 수집한 새로운 데이터를 사용해 모델을 변경한다. 반면 S1은 하나의 파라미터 세트를 유지하고, 현재 맥락에 담긴 시연에 따라 행동을 조건화한다.

Skild는 NVIDIA 인프라를 사용해 모델을 학습하고 평가했다. NVIDIA Cosmos 모델은 변형을 생성하고 영상을 구조화된 설명으로 변환하는 데 도움을 준다. Cosmos Curator는 데이터를 정리하고 필터링하며, Isaac Sim은 물리적 배치 전에 행동을 테스트할 가상 환경을 제공한다.

Isaac Lab은 시뮬레이션 경험이 더 나은 결과와 연관된 행동으로 정책을 유도하는 강화 학습을 지원한다. Newton 물리 엔진은 접촉, 힘, 충돌 및 기타 물리적 상호작용을 모델링한다. 이러한 도구들은 물리적 로봇 플릿이 경제적으로 수집할 수 있는 것보다 더 많은 상황에 정책을 노출하는 데 도움을 준다.

이 데이터 혼합은 로보틱스의 핵심 문제를 다룬다. 원격 조작 로봇 데이터는 실제 배치 하드웨어와 매우 유사하지만 수집이 느리다. 인간 영상은 훨씬 더 큰 다양성을 제공하지만, 사람의 손과 로봇 그리퍼는 서로 다르게 움직인다. 시뮬레이션은 효율적으로 확장되지만, 시뮬레이션 물리는 모든 실제 표면, 물체, 실패 상황과 일치하지는 않는다.

Skild는 규모, 다양성, 하드웨어 유사성을 모두 이상적으로 제공하는 데이터 소스는 없기 때문에 이러한 소스를 결합한다고 말한다. 이후 영상 프롬프트는 모델의 사전 학습과 배치 시 제시된 작업을 잇는 다리 역할을 한다.

회사의 in-context learning results는 S1을 언어 조건형 vision-language-action 모델과 비교한다. vision-language-action 모델, 즉 VLA는 시각적 관찰과 지시를 물리적 행동으로 변환한다.

두 시스템은 작업 프롬프트를 임베딩하는 방식을 제외하면 동일한 데이터, 아키텍처, 컴퓨팅 자원을 사용한 것으로 알려졌다. 학습 데이터셋은 1,000시간에서 100,000시간 범위였다. Skild는 익숙한 작업과 처음 보는 작업을 아우르며 4~8분간 지속되는 내부 평가 세트에서 이를 평가했다.

가장 큰 테스트 데이터 규모에서 처음 보는 작업에 대해 S1은 누적 단계별 성공률 66%에 도달했다. 언어 프롬프트 기반 기준 모델은 9%를 기록했다. Skild는 이 결과를 7배의 향상으로 설명했다.

익숙한 작업에서는 비교가 그만큼 일방적이지 않았다. 학습 시간 1,000시간에서 언어 조건형 시스템은 53%를 기록했고, 인컨텍스트 학습은 43%였다. Skild는 사전 학습이 확대되면서 S1이 결국 약 96%에 도달했다고 말한다.

회사는 또한 하나의 프롬프트 시연과 기존 정책의 사후 학습을 비교했다. 하나의 S1 영상이 약 380개의 작업별 시연과 비슷한 성능을 냈다고 추정했다. 이러한 긴 시연을 수집하는 데는 원격 조작 기준으로 50~100시간이 필요했다고 알려졌다.

그 비교가 하나의 동영상이 언제나 380개의 예시를 대체한다는 뜻은 아니다. Skild는 내부 곡선에서 해당 수치를 보간했으며, 결과는 자사가 선택한 모델, 작업, 채점 방식에 적용된다. 사후 학습된 정책은 결국 2,000개의 시연으로 86%에 도달해 S1의 66%를 넘어섰다.

따라서 실제 메커니즘은 준비와 적응 사이의 절충이다. Skild는 폭넓은 사전 학습에 크게 투자해 고객이 이후 제공해야 하는 작업별 데이터를 줄인다. 이 절충의 성패는 사전 학습된 능력이 얼마나 폭넓게 전이되는지에 달려 있다.

범용 경쟁사들도 같은 목표를 추구한다

Skild는 모든 작업마다 재학습하는 워크플로와 경쟁하고 있지만, 다른 파운데이션 모델 개발사들도 서로 다른 방식으로 같은 한계에 도전하고 있다.

Generalist AI는 S1 직전에 GEN-1.5를 발표했다. 이 회사 역시 자사 모델이 그래디언트 업데이트 없이 하나 또는 소수의 시연만으로 로봇 작업을 학습한다고 말한다. 또한 조합적 행동, 인간에서 로봇으로의 전이, 낯선 도구, 물리적 조건 변화에 대응하는 능력을 강조한다.

Skild는 S1이 이 접근법을 최대 10분 동안 이어지는 미지의 작업으로 확장한다고 주장한다. 자사 게시물은 동시대 시스템들이 주로 더 짧은 활동이나 학습 분포에 가까운 행동에 초점을 맞춘다고 설명한다. 그러나 Generalist 역시 자사 시스템을 폭넓은 원샷 학습기로 제시한다.

경쟁사의 GEN-1.5 결과는 “최초”라는 주장이 신중한 경계 설정을 필요로 하는 이유를 보여준다. 두 회사 모두 신규성, 작업 길이, 물리적 변이, 성공을 자체 평가 방식으로 정의한다. 공통 벤치마크가 없다면, 이들의 동영상은 명확한 순위를 입증하지 못한다.

Google DeepMind는 Gemini Robotics를 통해 다른 경로를 택한다. 이 시스템들은 다양한 로봇 몸체 전반에서 멀티모달 추론과 로봇 행동 생성을 결합한다. Gemini Robotics 2는 손재주, 전신 제어, 로봇 간 협업을 강조한다.

2026년 7월 Gemini Robotics 2 출시 발표 역시 서로 다른 몸체 간 기술 전이가 여전히 어렵다는 점을 인정한다. Google은 일부 로보틱스 시스템을 제한된 테스터에게만 제공하고 있어 폭넓은 외부 비교에는 한계가 있다.

이전 DeepMind 프로젝트는 데이터 요구량이 얼마나 빠르게 줄었는지 보여준다. RoboCat은 수백 개의 시연을 사용해 작업에 적응했지만, 최신 시스템들은 퓨샷 또는 원샷 행동을 추구한다. 이 분야는 작업별 학습에서 경험을 재사용하는 일반 모델로 이동하고 있다.

Physical Intelligence는 로봇 데이터, 웹 지식, 고수준 의미 계획을 결합하는 범용 VLA에 집중해 왔다. 이 회사의 π0.5 연구는 낯선 주방과 침실 청소 같은 장기 작업을 다룬다. 이 시스템은 계층적 안내를 활용해 새로운 환경에서 복잡한 순서를 완료한다.

NVIDIA는 Skild의 공급업체이자 모델 개발사이기도 하다. 이 회사의 GR00T N1 연구는 로봇 궤적, 인간 동영상, 합성 데이터로 학습한 오픈 파운데이션 모델을 설명한다. GR00T는 휴머노이드 제어를 위해 비전-언어 구성요소와 확산 기반 행동 시스템을 결합한다.

이러한 위치는 NVIDIA에 피지컬 AI로 진입할 여러 경로를 제공한다. NVIDIA는 GPU, 시뮬레이션, 데이터 도구, 배포 하드웨어, 자체 레퍼런스 모델을 제공할 수 있다. Skild는 이 인프라에 접근할 수 있고, NVIDIA는 고객이 S1, GR00T 또는 자사 스택 위에 구축된 다른 모델을 선택하는지와 관계없이 혜택을 얻는다.

NVIDIA의 Cosmos Policy는 한 회사가 경쟁하는 기술 접근법들을 지원할 수 있음을 다시 보여준다. Cosmos Policy는 대상 로봇의 시연을 바탕으로 한 사후 학습을 통해 사전 학습된 비디오 모델을 적응시킨다. 이 시스템은 계획을 위해 행동, 예측된 미래 상태, 예상 보상을 생성한다.

S1은 배포 이후 작업별 사후 학습을 피하고자 한다. 반면 Cosmos Policy는 비디오 생성 지식을 행동 정책으로 전환하기 위해 사후 학습을 사용한다. 두 접근법 모두 폭넓은 비디오 사전지식에 의존하지만, 적응을 배치하는 시점은 다르다.

이 경쟁은 로봇 구매자에게 도움이 될 가능성이 크지만, 구매 결정은 더 복잡해진다. 잘 다듬어진 모델 시연은 통합 노력, 지원 하드웨어, 오류 처리, 서비스 책임에 대해 거의 알려주지 않는다. 구매자는 추론 모델만이 아니라 완전한 운영 시스템을 평가해야 한다.

따라서 결정적인 경쟁은 Skild와 특정 스타트업 한 곳 사이의 대결이 아니다. 상황적 적응과 반복적인 작업별 엔지니어링의 대결이다. 환경, 하드웨어, 운영 제약이 시연과 달라진 뒤에도 하나의 동영상이 계속 유용할 때에만 S1은 앞선다.

시연은 아직 공장 환경의 증거가 아니다

S1이 보고한 성과 개선은 상당하지만, 증거는 여전히 회사 주도로 수행됐고 개입의 도움을 받았으며 독립 시스템과 비교하기 어렵다.

Skild의 벤치마크는 완전하고 보조 없는 작업 완료 대신 단계별 누적 성공률을 사용한다. 각 정책이 남은 단계를 계속 진행할 수 있도록 실패 후 인간 운영자가 개입했다. Skild는 언어 조건부 기준선의 경우 그렇지 않으면 미지의 작업을 완료하지 못했기 때문에 이 방식이 특히 필요했다고 말한다.

이 방법은 긴 순서 전반에서 오류가 발생하는 지점을 드러낼 수 있다. 그러나 배포된 로봇이 도움 없이 전체 작업을 얼마나 자주 완료하는지에는 직접 답하지 않는다. 복구되지 않은 한 번의 실패만으로도 작업 스테이션이 멈출 수 있으므로, 공장 운영자는 두 측정치를 모두 필요로 한다.

66%라는 수치 역시 평가된 각 단계의 성공을 뜻하며, 66%의 엔드투엔드 완료율을 의미하지는 않는다. 독자는 이 값들을 서로 바꿔 해석해서는 안 된다. 상호 의존적인 행동이 많은 긴 작업은 전체 성공 확률이 훨씬 낮을 수 있다.

Skild는 S1에 관한 완전한 기술 논문, 모델 카드, 공개 체크포인트, 독립적으로 재현된 벤치마크를 아직 공개하지 않았다. 초기 게시물은 후속 출판물에서 학습 과정을 더 깊이 설명할 것이라고 밝힌다. 모델 규모, 학습 구성, 평가 횟수, 하드웨어 적용 범위, 실패 범주에 관한 중요한 세부 사항은 공개되지 않은 상태다.

기준선 설계도 면밀히 살펴볼 필요가 있다. Skild는 대부분의 다른 구성요소를 동일하게 유지한 채 시각적 시연 프롬프팅과 언어 프롬프팅을 비교한다. 이는 자사 설정 내에서 시연 맥락의 가치를 분리해 보여주지만, 경쟁하는 모든 VLA나 적응 방식을 포괄하지는 않는다.

프롬프트를 기록하는 과정에서도 운영자는 성능에 영향을 미친다. 카메라 각도, 속도, 물체 가시성, 손의 위치, 작업의 명확성은 모델이 관찰하는 내용을 바꿀 수 있다. 고객은 무엇이 유효한 시연을 구성하는지, S1이 부실한 예시에 얼마나 민감한지에 관한 지침을 필요로 할 것이다.

분포 변화도 또 다른 한계로 남는다. Skild는 물체 이동, 대체, 조명 변화, 반대쪽 팔 실행을 시험했다. 프롬프트가 실질적으로 다른 실행 계획을 암시할 때 성능 저하가 더 컸다고 보고했다.

이는 논리적인 결과다. 시연은 의도와 순서를 명시할 수 있지만 기계적 제약을 없앨 수는 없다. 다른 그리퍼, 작업 반경, 적재 용량, 카메라 위치, 제어 주파수를 가진 로봇은 예시를 실행 가능한 움직임으로 변환해야 한다.

물리적 안전은 시각적 그럴듯함보다 더 높은 기준을 요구한다. 언어 모델은 주변 장비를 손상시키지 않고도 좋지 않은 답변을 생성할 수 있다. 로봇은 부품을 압착하거나, 뜨거운 액체를 쏟거나, 작업자와 충돌하거나, 과도한 힘을 가할 수 있다.

따라서 산업 도입에는 불확실성 주변에서 행동을 제한하는 체계가 필요하다. 시스템은 프롬프트가 모호한 때, 물체가 없는 때, 작업이 자신의 능력을 초과하는 때를 인식해야 한다. 그 후 안전하지 않게 즉흥 대응하는 대신 멈추거나 지원을 요청해야 한다.

S1의 뚜렷한 오류 복구 능력은 고무적이지만, 복구 자체가 위험을 만들 수도 있다. 부드러운 물체를 다룰 때 실패한 잡기를 반복하는 것은 합리적일 수 있다. 같은 재시도 정책은 커넥터를 손상시키거나, 식품을 오염시키거나, 체결부를 과도하게 조일 수 있다.

상업 데이터 역시 독립적인 확인이 필요하다. Skild가 보고한 매출 런레이트와 고객 수는 수요를 나타내지만, 계약 기간, 생산 활용도, 갱신율, 매출총이익률은 보여주지 않는다. 파일럿과 파트너십은 운영 측면의 깊이에서 크게 다를 수 있다.

Foxconn 배포는 Blackwell 조립이 정밀도와 순서 추적을 요구하기 때문에 의미 있는 시험 무대를 제공한다. 그러나 공개 자료는 처리량, 개입 빈도, 불량률, 가동 시간을 공개하지 않는다. 이러한 지표가 상황적 학습이 생산 현장의 압박을 견뎌내는지 결정할 것이다.

그러므로 S1은 불완전한 검증을 동반한 신뢰할 만한 기술적 주장으로 이해해야 한다. 시연은 새로운 작업마다 또 다른 학습 실행이 필요하다는 가정에 도전한다. 하지만 하나의 동영상이 어떤 산업 작업이든 어떤 로봇에 안전하게 구성할 수 있다는 점을 입증하지는 않는다.

S1의 가치를 결정할 세 가지 신호

다음 단계는 측정 가능하다. S1에는 투명한 평가, 지속적인 생산 결과, 일반 운영자가 시각적 프롬프트를 안전하게 사용할 수 있다는 증거가 필요하다.

첫 번째 신호는 상세한 기술 공개다. Skild는 S1의 학습 방식을 설명하는 추가 게시물을 약속했다. 유용한 공개 자료에는 평가 시행 횟수, 전체 작업 성공률, 개입 규칙, 실패 범주, 지연 시간, 지원 하드웨어, 더 강력한 외부 기준선과의 비교가 포함돼야 한다.

독립적인 접근은 증거를 한층 강화할 것이다. 연구자나 고객은 낯선 배치와 물체 아래에서 작업을 재현할 수 있어야 한다. 특히 접촉, 섬세한 부품, 긴 순서가 포함된 작업에서는 성공한 실행뿐 아니라 실패한 실행도 결과로 보고해야 한다.

두 번째 신호는 생산 성능이다. Foxconn 프로젝트는 S1이 품질을 유지하면서 실제 사이클 타임 안에서 작동할 수 있는지를 보여줘야 한다. 유용한 측정 항목으로는 가동 시간, 교대조당 인간 개입 횟수, 작업 변경 준비 시간, 불량률, 부품 변이에 대한 복구 능력 등이 있다.

Sumitomo의 와이어 하니스 작업에서 나온 증거는 다른 능력을 시험할 것이다. 유연한 소재는 예측하기 어려운 형상을 만들며 정교한 접촉 제어를 요구한다. 그 환경에서 일관되게 작동한다면 폭넓은 사전 학습이 테이블 위 시연을 넘어 전이된다는 Skild의 주장을 뒷받침할 수 있다.

상업용 주방 파일럿은 또 다른 까다로운 환경을 제공한다. 식재료는 달라지고, 도구는 움직이며, 표면은 더러워지고, 사람들이 주변에서 작업한다. 성공적인 배포에는 올바른 작업 순서뿐 아니라 인식, 위생 제어, 안전한 움직임, 신뢰할 수 있는 취급이 필요하다.

세 번째 신호는 경쟁사들의 대응 방식이다. Generalist AI, Google DeepMind, Physical Intelligence, NVIDIA는 모두 로봇 적응에 필요한 데이터를 줄이고 있다. 공통 시험은 동일한 조건에서 비디오 프롬프팅이 언어 지시, 퓨샷 미세 조정, 계층적 계획보다 우수한지 보여줄 수 있다.

경쟁사가 장기 작업에서 S1과 맞먹는다면 이 접근법이 무효화되는 것은 아니다. 이는 문맥 내 시연이 로봇 파운데이션 모델 전반에서 표준 역량이 되고 있음을 시사할 것이다. 반대로 작업별 사후 학습에서 더 강한 결과가 나온다면 시각적 프롬프팅이 속도를 위해 너무 많은 신뢰성을 희생한다는 점을 보여줄 수 있다.

기업 구매자는 인간 워크플로도 지켜봐야 한다. Skild의 가장 강력한 약속은 운영의 단순성이다. 즉, 작업자가 작업을 기록하고, 동영상을 제공한 뒤, 몇 분 안에 테스트를 시작하는 것이다. 이 과정은 Skild 연구팀 외부의 기술자에게도 작동해야 한다.

가장 좋은 증거는 모델별 코칭 없이 운영자가 프롬프트를 만드는 사례일 것이다. 그 결과는 교대조, 현장, 로봇 몸체 전반에서 일관되게 유지돼야 한다. 시스템은 실행 전에 부적절한 시연을 식별하고, 진행할 수 없는 이유를 설명해야 한다.

Skild AI S1이 중요한 이유는 작업이 바뀌는 순간에 적응을 배치하기 때문이다. 바로 그 지점에서 기존 자동화는 엔지니어링 비용과 지연을 축적한다. 하나의 동영상 프롬프팅은 의미 있는 내부 결과와 초기 상업 프로젝트가 뒷받침하는, 그 부담을 줄일 수 있는 그럴듯한 방법을 제시한다.

남은 질문은 S1이 인상적인 시연을 만들어낼 수 있는지 여부가 아니다. Skild는 이미 이를 보여줬다. 핵심은 공장이 문서화된 안전 한도 내에서, 실제 운용 속도로 동일한 동작을 반복적으로 구현할 수 있느냐이다.

Skild AI S1을 평가하는 독자는 영상 클립보다 측정 지표를 따라야 한다. 전체 실행 성공률, 개입 비율, 사이클 타임, 예기치 못한 변경 이후의 성능을 살펴봐야 한다. 이러한 신호는 하나의 영상이 실용적인 로봇 인터페이스로 발전했는지, 아니면 여전히 유망한 연구 프롬프트에 머물러 있는지를 보여줄 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page