top of page

Vidu S2 실시간 비디오, 아바타를 넘어 라이브 편집으로 확장

3시간 전
12분 분량

Vidu는 두 가지 Vidu S2 실시간 비디오 모델을 출시하며 대화형 아바타를 넘어 라이브 편집으로 영역을 넓히는 한편, 공간 비디오로 향하는 경로도 미리 선보였다. 이번 출시는 세션이 진행 중인 동안 프레임을 생성하거나 변환하도록 설계된 Vidu S2-Avatar와 Vidu S2-Editing을 함께 제공한다.

이는 대부분의 생성형 비디오 제품이 여전히 요청 후 대기하는 워크플로를 중심으로 만들어졌기 때문에 중요하다. 사용자는 프롬프트를 제출하고, 완성된 클립을 기다린 뒤, 결과를 검토하고 다시 생성을 시작한다. 반면 Vidu S2는 사람들이 말하고, 움직이고, 새로운 시각 레퍼런스를 제시하는 동안에도 반응할 수 있는 지속형 인터페이스로 비디오를 다룬다.

이번 출시는 Vidu를 Runway, PixVerse, Odyssey 및 인터랙티브 비디오를 추구하는 다른 개발사들과의 확대되는 경쟁에 놓이게 한다. 핵심 차이는 단순히 어느 시스템이 가장 매력적인 데모를 만들어 내는가에 있지 않다. 실시간 생성이 지속적으로 사용되는 상황에서도 제어 가능하고, 일관되며, 합리적인 비용을 유지하고, 안전하게 작동할 수 있는지가 관건이다.

Vidu의 기술 논문은 초당 25~42프레임의 720p 아바타 생성 등 상당한 개선을 보고한다. 또한 라이브 스타일 전환, 가상 피팅, 캐릭터 교체, 배경 교체도 설명한다. 다만 저자들이 평가의 상당 부분을 직접 수행하거나 선정했다.

공간 비디오 작업은 이보다도 초기 단계다. Vidu는 이를 편안함 연구나 독립적인 스테레오 품질 테스트로 뒷받침된 성숙한 제품이 아니라 VR 헤드셋을 위한 실현 가능성 탐색으로 제시한다. 야심 찬 인터페이스와 불완전한 실제 검증 사이의 이러한 간극이 이번 출시를 규정한다.

Vidu S2 실시간 비디오는 두 가지 모델로 나뉜다

Vidu S2는 제품을 하나의 인터랙티브 아바타 시스템에서 더 폭넓은 라이브 비디오 스택으로 전환한다.

Vidu는 관련 기술 논문을 2026년 9월 10일에 공개한 뒤, 2026년 9월 16일 출시를 발표했다. 이 논문은 두 작업을 하나의 공개 인터페이스에 억지로 넣는 대신 시스템을 Vidu S2-Avatar와 Vidu S2-Editing으로 나눈다.

Vidu S2-Avatar는 정체성 이미지, 음성, 지시사항을 바탕으로 디지털 캐릭터를 생성한다. 고정된 토킹 헤드 클립과 달리, 캐릭터는 지속되는 세션 내내 반응할 수 있다. 사용자는 스트림이 시작된 뒤에도 새로운 레퍼런스 이미지를 추가할 수 있다.

이 동적 레퍼런스는 물체, 의상 또는 배경을 나타낼 수 있다. 사용자는 캐릭터에게 재킷을 보여주고 그 아이템을 착용하라고 요청할 수 있다. 또 다른 레퍼런스는 캐릭터를 다른 배경이나 시각적 맥락으로 이끌 수 있다.

이전 Vidu S1은 토킹 헤드 상호작용에 더 좁게 집중했다. Vidu S2 paper에 따르면 S1은 540p 비디오를 생성했으며 더 큰 신체 움직임에 어려움을 겪었다. 또한 스트림이 시작된 후에는 기준 레퍼런스가 고정된 상태로 유지됐다.

S2-Avatar는 보고된 초당 25~42프레임 범위를 유지하면서 명시된 출력 해상도를 720p로 높였다. Vidu는 이 모델이 춤을 포함한 더 넓은 신체 움직임과 관련된 지시도 따른다고 말한다.

두 번째 모델은 다른 입력을 다룬다. Vidu S2-Editing은 기존 비디오 스트림을 받아 소스의 움직임과 타이밍을 보존하면서 외형을 바꾼다. 아바타 지시를 기반으로 모든 동작을 생성하는 방식은 아니다.

Vidu는 네 가지 편집 범주를 제시한다. 시스템은 시각적 스타일을 전환하고, 의상을 교체하며, 사람 또는 캐릭터를 교체하고, 배경을 변경할 수 있다. 지시에는 텍스트와 요청된 외형을 보여주는 선택적 레퍼런스 이미지가 포함될 수 있다.

이 차이는 제품을 가상 프레젠터 이상의 영역으로 확장한다. 라이브스트림 진행자는 여러 버전을 녹화하지 않고도 의상을 미리 볼 수 있다. 퍼포머는 원본 움직임의 타이밍을 유지하면서 가상의 캐릭터로 등장할 수 있다.

같은 시스템은 카메라 피드에 일관된 일러스트 스타일을 적용할 수도 있다. 또한 전통적인 그린스크린 워크플로 없이 피사체를 다른 환경에 배치할 수도 있다. 이는 여전히 제품 활용 시나리오일 뿐, 제작 환경에서의 신뢰성을 입증하는 근거는 아니다.

Vidu의 공개 모델 문서는 두 가지 분기가 더 큰 서비스에 어떻게 결합되는지 보여준다. 아바타 에디션은 캐릭터 이미지, 오디오, 모션 지시, 라이브 커뮤니케이션 채널의 조합을 받는다. 편집 에디션은 소스 비디오 스트림과 교체 소재를 받는다.

문서는 또한 긴밀히 통합된 배포 방식과 컴포넌트 기반 배포 방식을 구분한다. 관리형 에디션은 커뮤니케이션, 음성, 언어, 보이스 스택의 더 많은 부분을 제공한다. 컴포넌트 에디션은 고객이 자체 실시간 커뮤니케이션 및 음성 시스템을 연결하도록 한다.

이 아키텍처는 발표의 의미 있는 부분이다. Vidu는 연구 모델이나 선별된 데모만 제시하는 것이 아니다. 개발자가 고객 서비스, 교육, 커머스, 게임, 엔터테인먼트 제품 안에 배치할 수 있는 인프라로 라이브 생성형 비디오를 포지셔닝하고 있다.

다만 이번 출시를 범용 월드 시뮬레이터로 혼동해서는 안 된다. S2-Avatar는 여전히 생성된 캐릭터를 중심으로 하며, S2-Editing은 입력 스트림을 따른다. 공간 확장은 스테레오 표현을 더하지만, 지속적인 3차원 이해를 확립하지는 않는다.

진정한 변화는 렌더링에서 지속적인 제어로의 전환이다

핵심 메커니즘은 스트림의 알려지지 않은 미래를 보지 않고 다음 세그먼트를 생성하는 인과적 생성이다.

전통적인 확산 비디오 시스템은 반복적인 노이즈 제거 단계를 거쳐 전체 클립을 처리하는 경우가 많다. 이 접근 방식은 모델이 고정된 시퀀스 전반에서 프레임을 조율하는 데 도움이 된다. 하지만 시스템이 클립 완료를 기다리기 때문에 즉각적인 상호작용은 어려워진다.

라이브 모델은 반대의 제약에 직면한다. 이미 이용 가능한 레퍼런스, 지시사항, 이력만 사용해 다음 프레임을 생성해야 한다. 아직 발생하지 않은 동작이나 카메라 움직임은 살펴볼 수 없다.

이 인과적 과정은 누적 오류를 초래한다. 정체성, 비율, 움직임 또는 배경의 작은 변화가 한 세그먼트에서 다음 세그먼트로 전달될 수 있다. 설득력 있는 시작 장면도 더 긴 대화가 진행되는 동안 점차 불안정해질 수 있다.

Vidu는 이 훈련 대응 방식을 Self-Replay Forcing이라고 부른다. 시스템은 먼저 더 긴 자기회귀 롤아웃을 생성하는데, 이는 이전 출력에 부분적으로 기반해 세그먼트를 생성한다는 의미다. 이후 생성된 이력에 노이즈를 추가하고 훈련 중 궤적을 재생한다.

이 재생은 그래디언트 기반 학습을 위해 세그먼트를 연결된 상태로 유지한다. 더 간단히 말하면, 시퀀스 후반에 나타나는 오류가 이전 세그먼트가 수정되는 방식에 영향을 미칠 수 있다. Vidu는 이것이 실제 스트림 중 모델이 마주하는 상황을 더 잘 반영한다고 주장한다.

이 접근 방식은 깨끗한 과거 프레임 또는 노이즈가 있는 생성 상태를 사용해 모델을 훈련한 기존 방법을 확장한다. Vidu는 이러한 방법이 최적화 중 긴 생성 궤적을 완전히 연결하지 못했다고 말한다. 재생 단계는 효율성과 장시간 세션 안정성을 높이기 위한 것이다.

해상도는 또 다른 제약을 제시한다. 메인 생성 모델에서 모든 프레임을 720p로 생성하려면 더 많은 연산이 필요하고 지연 시간도 늘어난다. 이에 Vidu는 더 낮은 해상도의 출력을 높이는 가벼운 원스텝 리파이너를 설명한다.

이를 통해 인과적 백본은 움직임과 연속성에 집중할 수 있다. 별도의 정제 단계가 프레임이 시청자에게 도달하기 전에 세부 정보를 복원한다. 이 설계는 빠른 시간적 생성과 경량 슈퍼해상도 간의 역할 분담과 닮아 있다.

Vidu는 캐릭터 움직임에 사용되는 훈련 데이터도 바꿨다. 팀은 솔로 댄스 자료와 2차원 및 3차원 애니메이션을 추가했다. 움직이는 카메라 영상은 해당 샘플을 폐기하는 대신 배경을 안정화해 더 많이 유지했다.

캡션은 이벤트 순서에 따라 구성됐다. 스트리밍 지시사항은 시간에 따라 전개되므로 이 선택은 중요하다. 시간적으로 정렬된 설명은 어떤 움직임이 먼저 발생해야 하는지에 대해 모델에 더 명확한 정보를 제공한다.

Vidu는 인간 선호도 강화가 자연스러운 움직임, 표정, 지시 이행을 더욱 개선했다고 말한다. 그러나 논문은 각 훈련 변경이 기여한 정도를 분리해 보여주지 않는다. 최종 결과는 새로운 데이터, 재생 훈련, 정제, 선호도 최적화, 서빙 개선을 결합한다.

Vidu S2-Editing은 프레임 정렬 어텐션이라는 또 다른 메커니즘을 도입한다. 생성된 각 타깃 프레임은 같은 시점의 소스 프레임을 참조한다. 레퍼런스 이미지는 편집된 시퀀스 전체에서 접근 가능한 상태로 유지된다.

이 제약은 원본 움직임과 타이밍을 보존하는 데 도움이 된다. 소스 스트림에서 사람이 팔을 들면, 교체 캐릭터도 그 순간 팔을 들어야 한다. 시스템은 관련 없는 움직임 일정을 새로 만들어 내지 않고 외형을 바꾼다.

이후 소스 프레임은 일치하는 타깃 프레임을 생성한 뒤 활성 캐시에서 제거된다. 이는 지속되는 스트림에서 메모리 증가를 제한한다. 이런 제한이 없다면 세션이 길어질수록 처리 요구량이 증가할 수 있다.

이러한 메커니즘은 이번 출시가 단순한 기능 묶음 이상의 의미를 갖는 이유를 설명한다. Vidu는 확산 기반 비디오를 지속적인 컴퓨팅 표면으로 전환하려 한다. 모든 상호작용은 세션을 멈추지 않고 모델이 해석해야 하는 또 하나의 상태를 만든다.

이 설계는 더 엄격한 성공 기준도 만든다. 사전 녹화된 비디오는 진행 표시줄 뒤에 생성 지연을 숨길 수 있다. 라이브 캐릭터는 지연, 드리프트, 누락된 지시, 시각적 불안정을 즉시 드러낸다.

Runway와 PixVerse는 이미 같은 인터페이스에 압박을 가하고 있다

Vidu는 완성된 클립을 반응형 비디오 세션으로 대체하려는 활발한 경쟁에 뛰어들고 있다.

Runway는 2025년 12월 월드, 캐릭터, 로보틱스를 위한 실시간 모델 제품군으로 GWM-1을 출시했다. 캐릭터 시스템은 레퍼런스 이미지에서 대화형 인물을 생성한다. 월드 모델은 탐색 가능한 환경과 행동 조건부 시뮬레이션을 강조한다.

Runway는 이후 Characters를 표정, 눈 움직임, 립싱크, 제스처를 생성할 수 있는 비디오 에이전트 API로 설명했다. 회사는 초당 24프레임과 화자가 말을 멈춘 뒤의 서버 측 응답을 보고했다.

이 수치는 Vidu가 보고한 프레임률과 직접 비교할 수 없다. 초당 프레임은 출력 처리량을 측정하는 반면, 대화 전환 시간은 응답 지연을 측정한다. 모델은 부드러운 비디오를 렌더링하면서도 새 지시에 느리게 반응할 수 있다.

Runway의 최신 interactive worlds는 연속적인 카메라 제어, 텍스트 지시형 동작, 생성된 오디오를 추가한다. 이 시스템은 캐릭터와 스트림 편집이라는 Vidu의 더 좁은 조합보다는 탐색 가능한 환경을 겨냥한다.

PixVerse R1은 더욱 광범위한 주장을 내놓는다. PixVerse는 R1을 연속적인 1080p 비디오를 생성하고 멀티모달 입력에 반응하는 실시간 월드 모델로 설명한다. 명시된 활용 사례에는 게임, 라이브 엔터테인먼트, 훈련 시뮬레이션, 커머스가 포함된다.

PixVerse R1 launch는 지속적인 시청각 월드를 강조한다. Vidu S2는 기존 라이브 비디오 중 캐릭터, 의상, 시각적 스타일, 배경을 바꾸는 데 더 큰 비중을 둔다.

Odyssey는 다른 경로를 따른다. 이 회사의 모델은 사용자가 동작을 통해 탐색하는 개방형 환경을 생성한다. 회사는 제품을 아바타나 라이브 카메라 편집 서비스가 아니라 월드 시뮬레이터로 규정한다.

이러한 차이는 핵심 경쟁 구도를 만든다. Runway, PixVerse, Odyssey는 시뮬레이션된 월드의 각기 다른 버전을 판매하고 있다. Vidu는 반응형 캐릭터와 편집 가능한 비디오 스트림을 중심으로 인터페이스를 구축하고, 이후 이러한 스트림을 스테레오 디스플레이로 확장하고 있다.

그처럼 더 좁은 초점은 상업적으로 유용할 수 있다. 튜터링 캐릭터, 쇼핑 호스트, 게임 캐릭터 또는 인터랙티브 퍼포머를 구축하는 개발자에게 항상 완전한 시뮬레이션 세계가 필요한 것은 아니다. 이들에게 필요한 것은 안정적인 정체성, 동기화된 음성, 예측 가능한 제스처, 그리고 관리 가능한 지연 시간이다.

Vidu S2-Editing은 실용적인 경쟁 구도도 제시한다. 많은 실시간 비디오 제품은 장면을 내부적으로 생성한다. 외부 카메라나 업로드된 스트림을 편집하면 사용자의 실제 타이밍, 신체 움직임, 퍼포먼스를 보존할 수 있다.

라이브 커머스 진행자를 생각해 보자. 완전히 합성된 호스트를 생성하려면 모델이 음성, 표정, 자세, 제품과의 상호작용을 제어해야 한다. 진행자의 실제 피드를 편집하면 사람은 움직임을 제공하고 모델은 의상이나 주변 환경을 바꿀 수 있다.

이러한 분업은 일부 제어 문제를 줄일 수 있다. 동시에 제품 주변에서 손이 일관성을 유지하는지, 움직이는 동안 의상이 올바르게 반응하는지 등 다른 문제를 야기한다. Vidu의 논문에는 선별된 사례가 포함되어 있지만, 이 사례들이 모든 자세나 물체 상호작용을 대표할 수는 없다.

같은 상충 관계는 엔터테인먼트에도 적용된다. 캐릭터 교체는 기존 모션 캡처 준비 없이도 퍼포머가 애니메이션 캐릭터를 조종하게 할 수 있다. 그러나 제작팀은 경계 깜빡임, 정체성 누출, 빠른 움직임 이후의 복구 성능을 중요하게 볼 것이다.

Vidu가 보고한 720p 출력은 PixVerse가 주장하는 1080p 해상도에도 못 미친다. 특히 회사별 주장이 서로 다른 하드웨어와 테스트 조건을 사용하는 경우 해상도만으로 품질이 결정되지는 않는다. 지연 시간, 일관성, 지시 대응, 운영 비용도 그만큼 중요하다.

기업들은 “실시간”도 서로 다르게 정의한다. 일부는 모델 처리 속도를 보고하고, 일부는 표시된 프레임을 보고하며, 다른 일부는 사용자가 체감하는 반응을 설명한다. 공통 지연 시간 프로토콜이 없다면 헤드라인 사양은 잘못된 비교를 만들 수 있다.

이 때문에 개발자 접근성이 중요하다. 공개 데모는 명백한 시각적 결함을 드러내지만, API는 네트워크 조건과 세션 길이에 걸쳐 반복 가능한 테스트를 가능하게 한다. 기업 구매자는 자체 언어, 캐릭터, 카메라 입력, 안전 요구 사항을 테스트해야 한다.

Vidu의 모델 맵은 예상 활용 사례로 소셜 동반자, 교육, 커머스, 게임 캐릭터, 비디오 제작, 라이브스트림 편집을 열거한다. 이 폭넓은 범위는 사업 기회를 보여 준다. 동시에 하나의 잘 다듬어진 데모만으로는 전체 제품 영역을 검증할 수 없다는 뜻이기도 하다.

Vidu의 벤치마크는 유망하지만 독립적이지는 않다

논문은 강력한 수치를 제시하지만, 대부분의 결론은 여전히 회사가 수행한 평가와 선별된 비교에 의존한다.

Vidu는 S2-Editing이 StreamAV-Bench에서 종합 점수 3.74를 달성했다고 보고한다. 또한 지시 이행, 전경 움직임, 배경 역동성, 시각적 품질 부문에서 선도적인 점수를 기록했다고 보고한다.

OpenVE와 RefVIE를 결합한 평가에서 Vidu는 Joint Overall 점수 4.26을 보고한다. 보고된 설정에서 가장 강력한 오프라인 기준선인 Bernini-R 14B는 3.92점을 기록했다. 차이는 0.34점이었다.

모델의 보고된 RefVIE 종합 점수는 3.78이었다. 이는 스트리밍 Decart-Lucy2.5 결과를 0.07점 웃도는 수치다. 모델 버전과 평가자 설정이 결과에 영향을 줄 수 있는 만큼, 이처럼 작은 차이는 불확실성 분석이 필요하다.

가상 피팅의 경우, 논문은 ViViD 테스트 세트에서 VFID 점수 9.9515를 보고한다. 이 분포 거리 측정에서는 낮을수록 좋다. 같은 표에서 CatV²TON은 19.5131점, ViViD는 21.8032점을 기록했다.

이 결과는 논문이 선택한 설정에서 잠재적으로 상당한 우위를 시사한다. 하지만 실제 라이브 리테일 영상에서도 동등한 성능을 보인다는 증거는 아니다. 통제되지 않은 조명, 여러 겹의 의상, 빠른 회전, 거울, 손 가림은 서로 다른 실패 양상을 만들 수 있다.

아바타 평가는 공개 시스템과 상용 제품을 포함한다. Vidu는 전체 품질에서 Runway Character GWM-1 대비 최대 85.7%의 선호도를 기록했다고 보고한다. 또한 PixVerse 및 HeyGen과의 일부 비교에서는 만장일치 선호를 보고한다.

백분율은 분모를 보여 주지 않으면 단정적으로 들릴 수 있다. 85.7%라는 결과는 일반적으로 소수의 쌍대 판단 또는 제한된 사례에서 도출된 비율을 반영한다. 논문은 표본 설계를 염두에 두고 읽어야 한다.

내부 편집 벤치마크는 150개의 쌍대 사례로 구성되어 있다. Vidu는 시간적 일관성 점수 3.56을 보고했으며, Decart-Lucy2.5는 2.59, XMax-X2.0은 1.67이었다. 저자들은 일치하는 원본 비디오, 참조 자료, 프롬프트, 시간 샘플링을 사용했다.

이 통제된 설정은 테스트 내 공정성을 높인다. 그렇다고 벤치마크가 독립적인 것은 아니다. 여전히 회사가 사례를 선택하고, 시스템을 구성하고, 분석 결과를 보고했다.

Vidu의 정성적 사례는 목표로 삼은 실패 모드를 이해하는 데 유용하다. 움직이는 동안의 의상 교체, 캐릭터 대체, 배경 변경, 수채화 스타일 렌더링을 보여 준다. 비교 결과는 경쟁 출력에서 추가 인물, 부정확한 의상, 흐림, 정체성 드리프트를 부각한다.

독자는 이러한 그림을 선별된 조건에서 모델이 할 수 있는 일을 보여 주는 시연으로 받아들여야 한다. 이는 실패율 추정치가 아니다. 논문은 제한 없는 라이브 세션 전반에서 시스템이 유사한 아티팩트를 얼마나 자주 생성하는지 보고하지 않는다.

지연 시간 보고 역시 또 다른 공백으로 남아 있다. 초당 25~42프레임이라는 제시 범위는 생성 처리량을 설명한다. 이는 지시부터 프레임 표시까지의 지연, 네트워크 오버헤드, 스트림 초기화, 연결 문제 이후의 복구를 완전히 설명하지는 않는다.

비교하자면 Runway는 자사 캐릭터 시스템의 프레임 속도와 서버 왕복 시간 수치를 모두 공개한 바 있다. 그 수치조차 완전한 벤더 간 벤치마크를 제공하지는 않는다. 하드웨어, 지역, 입력 길이, 서비스 부하는 여전히 다르다.

오디오 처리도 명확히 할 필요가 있다. Vidu S2-Avatar는 오디오 기반 상호작용을 중심으로 구축되었지만, 편집 모델은 주로 시각적 변환에 초점을 맞춘다. 논문은 편집된 스트림이 음성, 주변 소리, 립싱크를 어떻게 보존하는지 충분히 설명하지 않는다.

모더레이션은 또 다른 운영상의 문제를 만든다. Vidu의 개발자 문서에는 모더레이션 옵션이 포함되어 있지만, 제품팀에는 금지된 정체성, 사칭 통제, 생체정보 동의, 사고 검토에 관한 더 많은 세부 정보가 필요하다.

캐릭터와 의상 교체는 정당한 창작 작업을 지원할 수 있다. 같은 기능은 사칭이나 기만적인 라이브스트림에도 사용될 수 있다. 기업 배포에는 녹화가 완료된 후에만 작동하는 것이 아니라 스트리밍 속도에 맞춰 작동하는 통제가 필요하다.

따라서 증거에 대한 가장 강한 해석은 신중해야 한다. Vidu는 여러 테스트에서 경쟁력 있는 결과를 보인 상당한 기술 시스템을 공개했다. 독립 평가자들은 여전히 지연 시간, 일관성, 선호도 주장을 재현해야 한다.

Spatial Video는 완성된 VR 플랫폼이 아니라 실현 가능성 연구다

Vidu의 spatial-video 파이프라인은 비전을 확장하지만, 논문은 아바타와 편집보다 몰입감에 관한 증거를 적게 제시한다.

Spatial video는 시청자의 왼쪽 눈과 오른쪽 눈에 각각 별도의 뷰를 제공한다. 작은 시점 차이는 호환되는 헤드셋 안에서 깊이감을 만든다. 설득력 있는 스트림은 불안정한 기하 구조를 만들지 않으면서 이러한 차이를 보존해야 한다.

Vidu는 이 출력을 생성하는 두 가지 경로를 설명한다. 아바타 경로는 단안으로 생성된 스트림에서 시작한다. 시스템은 각 프레임의 깊이를 추정하고 해당 스트림을 동기화된 왼쪽 눈 및 오른쪽 눈 뷰로 변환한다.

편집 경로는 단안 또는 입체 입력을 받을 수 있다. 단안 비디오의 경우 S2-Editing은 입체 변환 전에 스트림을 변환한다. 기존 입체 입력의 경우 시스템은 처리하기 위해 쌍을 이루는 뷰를 결합하고 이후 다시 분리한다.

이러한 출력은 VR 헤드셋으로 스트리밍할 수 있다. 원칙적으로 사용자는 눈에 보이는 깊이를 갖춘 장면을 차지하는 것처럼 보이는 생성 캐릭터와 대화할 수 있다. 또한 몰입형 스트림에 스타일 또는 캐릭터 변경을 적용할 수도 있다.

여기서 “탐색”이라는 단어가 중요하다. 논문은 정성적인 spatial-video 사례를 보여 주지만, 헤드셋 기반 사용자 연구는 보고하지 않는다. 또한 입체 시차 정확도와 좌우 시간적 일관성에 대한 정량적 측정도 부족하다.

이는 사소한 누락이 아니다. 평면 비디오는 물리적 반응을 일으키지 않고도 어느 정도 깊이 오류를 허용할 수 있다. 충돌하는 입체 단서는 헤드셋에서 눈의 피로, 불편함, 또는 약한 현존감을 유발할 수 있다.

모션-투-포톤 지연 시간도 중요하다. 이 측정치는 사용자의 움직임과 그에 대응하는 표시 업데이트 사이의 지연을 포괄한다. Vidu의 비디오 프레임 속도는 허용 가능한 모션-투-포톤 성능을 입증하지 않는다.

시스템은 머리카락, 손, 투명한 물체, 움직이는 경계 주변에서도 안정적인 깊이를 유지해야 한다. 깊이 오류는 전경과 배경 사이에 잘못된 분리를 만들 수 있다. 입체 변환은 일반 디스플레이에서는 크지 않아 보이는 아티팩트를 증폭할 수 있다.

더 깊은 질문은 장면 표현 방식에 관한 것이다. 단안 스트림을 두 개의 뷰로 변환하는 것은 지속적인 3차원 세계를 유지하는 것과 동등하지 않다. 모든 물체 주변의 자유로운 이동을 지원하지 않고도 입체 깊이를 만들 수 있다.

Runway와 Odyssey는 탐색 가능한 환경을 핵심 목표로 강조한다. Vidu의 spatial 작업은 아바타 생성 및 편집의 입체 표현을 강조한다. 이러한 접근 방식은 겹치는 부분이 있지만 서로 다른 문제를 해결한다.

그렇다고 Vidu의 경로가 가치 없다는 뜻은 아니다. 많은 몰입형 애플리케이션은 앉아 있거나 정면을 향한 시점을 사용한다. 훈련용 캐릭터, 안내형 리테일 세션, 공연, 소셜 상호작용에는 항상 제한 없는 탐색이 필요한 것은 아니다.

실시간 편집은 기존 spatial 카메라에도 유용해질 수 있다. 쌍을 이루는 뷰 전반에서 의상이나 배경을 안정적으로 변경하는 시스템은 상당한 후반 작업을 줄일 수 있다. 이 워크플로가 성공하려면 양쪽 눈이 일치하는 편집 결과를 받아야 한다.

Vidu의 현재 증거는 그 수준의 신뢰성을 입증하지 않는다. 논문은 대표적인 왼쪽 눈과 오른쪽 눈 출력을 보여 주지만, 광범위한 입체 벤치마크는 제공하지 않는다. 또한 다양한 움직임에 걸친 지속적인 헤드셋 테스트도 생략한다.

상용 उपलब्ध성 역시 불분명하다. Vidu는 플레이 가능한 아바타와 편집 경험을 출시했지만, spatial-video 섹션은 연구 방향처럼 읽힌다. 구매자는 세 부분 모두에서 동일한 성숙도를 가정해서는 안 된다.

따라서 spatial 작업은 전략적 신호로 기능한다. Vidu는 자사의 스트리밍 아키텍처가 브라우저 캐릭터와 카메라 효과를 넘어 확장되기를 원한다. 몰입형 디스플레이를 위한 실시간 생성 레이어가 되겠다는 야심을 시사하고 있다.

이 야심은 새로운 증거가 있어야만 신뢰를 얻을 수 있다. 유용한 테스트에는 입체 일관성, 종단 간 지연 시간, 헤드셋 착용 편안함, 깊이 안정성, 장시간 세션 중 성능이 포함될 것이다. 전용 spatial-video 시스템과의 독립적인 비교도 도움이 될 것이다.

Vidu S2가 데모를 넘어설지 결정할 세 가지 신호

다음 단계는 재현 가능한 지연 시간, 지속적인 개발자 사용, 검증된 spatial 성능에 달려 있다.

첫 번째 신호는 표준화된 지연 시간 보고다. Vidu는 초당 프레임 수와 함께 지시부터 화면에 보이는 반응까지의 시간을 공개해야 한다. 결과에는 하드웨어, 네트워크 지역, 해상도, 세션 길이, 백분위 지연 시간이 명시되어야 한다.

이것은 캐릭터가 단지 부드럽게 재생되는지, 아니면 실제로 빠르게 반응하는지를 드러낼 것이다. 또한 동적인 참조 자료가 반응 시간에 어떤 영향을 주는지도 보여 줄 것이다. 새 의상이나 배경은 일반적인 음성 턴보다 더 많은 처리가 필요할 수 있다.

독립 테스트는 콜드 스타트 시간과 장시간 세션 동작을 측정해야 한다. 또한 빠른 지시, 상충하는 참조 자료, 네트워크 중단 이후의 복구를 추적해야 한다. 안정적인 평균 성능은 심각한 테일 지연 문제를 감출 수 있다.

이 결과가 계속 강력하게 유지된다면, Vidu의 메커니즘 기반 주장은 더욱 설득력을 얻게 된다. 반대로 매끄러운 출력이 느린 상호작용을 가린다면, 이 제품은 데모와 가벼운 인터랙티브 경험에 더 적합한 상태로 남을 것이다.

두 번째 신호는 Vidu API를 통한 실제 개발자 도입이다. 제품 팀은 S2가 외부 음성 인식, 언어 모델, 음성 시스템, 실시간 커뮤니케이션 제공업체와 연동되는지 공개해야 한다.

성공적인 통합은 컴포넌트 에디션이 단순한 구성 옵션 이상을 제공한다는 점을 보여줄 것이다. 또한 개발자가 타이밍, 정체성 일관성, 모더레이션 범위를 잃지 않고 파이프라인을 제어할 수 있음을 증명할 것이다.

가장 유의미한 배포 사례는 홍보용 클립이 아니라 반복 세션을 포함할 것이다. 교육, 커머스, 게임, 고객 지원은 서로 다른 요구를 만든다. 이들은 억양, 중단, 신체 움직임, 제품 취급, 예측하기 어려운 사용자 지시를 드러낸다.

이러한 배포를 평가하는 팀은 프롬프트, 관찰 결과, 실패 사례를 검색 가능한 지식 베이스에 보존해야 한다. 이 기록은 고립된 데모의 인상에 의존하는 대신 모델 업데이트를 비교하기 쉽게 만든다.

지속적인 사용의 증거는 Runway Characters 및 PixVerse R1에 맞선 Vidu의 입지를 강화할 것이다. 강도 높은 감독이 필요한 제한적 파일럿은 운영 신뢰성이 아직 완성되지 않았음을 시사할 것이다.

세 번째 신호는 정량적 공간 비디오 출시다. Vidu에는 나란히 놓은 스테레오 샘플만으로는 부족하다. 깊이 정확도, 양안 간 일관성, 모션-투-포톤 지연 시간, 호환 헤드셋에서의 편안함 결과를 보고해야 한다.

공개 공간 데모는 연구자들이 빠른 움직임, 미세한 경계, 반사 물체, 혼잡한 장면을 시험할 수 있게 해줄 것이다. 또한 시스템이 고정 시점 경험만 지원하는지, 더 유연한 몰입형 상호작용도 지원하는지를 분명히 할 것이다.

강력한 헤드셋 결과는 Vidu S2 실시간 비디오의 의미를 확장할 것이다. 이 시스템은 생성형 캐릭터, 라이브 편집, 몰입형 디스플레이를 잇는 신뢰할 만한 가교가 될 수 있다. 결과가 약하다면 공간 비디오는 여전히 지향점에 가까운 확장 기능으로 남을 것이다.

경쟁사의 대응은 유용한 맥락을 제공할 것이다. Runway는 제어 가능한 오디오-비디오 월드로 나아가고 있으며, PixVerse와 Odyssey는 지속형 시뮬레이션을 강조한다. Vidu는 라이브 편집과 동적 레퍼런스가 방어 가능한 이점을 제공한다는 점을 보여야 한다.

개발자에게 실질적인 질문은 이미 명확하다. 애플리케이션에 생성된 월드, 대화형 캐릭터, 혹은 실제 퍼포먼스의 변환 중 무엇이 필요한가? Vidu S2는 세 번째 범주와 그 범주가 아바타와 겹치는 영역에서 가장 차별화된다.

엔터프라이즈 구매자에게 평가는 해상도보다 지연 시간과 일관성에서 시작해야 한다. 프로덕션에서 예상되는 가장 어려운 신체 움직임, 레퍼런스, 의상, 배경을 테스트해야 한다. 식별 가능한 인물을 도입하기 전에 안전성 검토도 포함해야 한다.

Vidu는 스트리밍 시스템을 고정 아바타 레퍼런스 너머로 확장하고, 매력적인 편집 분야를 추가했다. 이번 출시는 연속적인 제어를 핵심 제품 개념으로 삼으며, 공간 비디오는 그 개념을 VR로 확장한다.

증거는 유망하지만 고르지는 않다. 아바타 및 편집 관련 주장은 벤치마크, 아키텍처 세부 사항, 접근 가능한 인터페이스를 동반한다. 공간 비디오 주장은 아직 중요한 측정치가 빠진 초기 기술 방향에 머물러 있다.

향후 1~3개월은 Vidu가 비교 가능한 지연 시간 데이터를 공개하고, 반복적인 API 통합을 유치하며, 의미 있는 테스트를 위해 공간 파이프라인을 개방하는지를 보여줄 것이다. 이 신호들이 S2가 인프라가 될지, 인상적인 데모로 남을지를 결정할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page