d-Matrix NVLink Fusion 계약, NVIDIA 랙 전략에 Raptor를 편입하다
d-Matrix는 기존 GPU 설계의 대안을 목표로 하는 추론 가속기를 개발하면서도 Raptor에 NVIDIA NVLink Fusion을 채택했다. 이 계약은 미래형 프로세서를 NVIDIA의 랙 아키텍처, 네트워킹, CPU 및 인프라 공급망에 연결한다. 동시에 d-Matrix NVLink Fusion 파트너십의 핵심적인 긴장 관계도 드러낸다.
특화 가속기는 NVIDIA의 컴퓨팅 실리콘에 도전하면서도 플랫폼의 나머지 부분까지 대체하지는 않을 수 있다. d-Matrix에는 야심 찬 칩 설계에서 실제 배포 가능한 인프라로 더 빠르게 나아갈 수 있는 경로가 된다. NVIDIA에는 NVLink를 통해 연결되는 새로운 XPU 하나하나가 랙을 중심으로 한 자사의 입지를 강화한다.
이번 결정은 Raptor가 상용 제품이 되기 전에 나왔다. d-Matrix는 2026년 말 이전 칩 테이프아웃을 예상하며, 통합 MGX 시스템은 2027년 4분기에 처음 제공될 것으로 보고 있다. 이 일정은 이번 발표가 로드맵 발표일 뿐, 양산 성능의 증거는 아니라는 의미다.
이는 또한 d-Matrix를 특화 프로세서에 NVIDIA 인프라를 활용하는 확대되는 기업군에 합류시킨다. 이 파트너들에는 기존 실리콘 공급업체, 클라우드 제공업체 및 추론 전문 기업이 포함된다. 대안 경로는 AMD의 Helios 아키텍처, UALink, Ultra Ethernet 같은 기술을 중심으로 구성한 개방형 랙이다.
d-Matrix NVLink Fusion 계약이 바꾸는 것
d-Matrix는 더 이상 Raptor를 독립형 가속기 카드로 설계하지 않는다. NVIDIA가 정의한 랙의 일부로 이 프로세서를 설계하고 있다.
양사는 2026년 9월 10일 협업을 발표했다. Raptor 발표에 따르면, 이 협력은 단일 상호운용성 테스트가 아니라 다년간의 제품 로드맵을 포함한다.
Raptor는 긴밀하게 연결된 시스템 내부의 스케일업 통신을 위해 NVLink 스위치에 연결된다. 스케일업 네트워킹은 여러 가속기가 일반적인 데이터센터 네트워킹보다 낮은 통신 지연으로 하나의 대형 컴퓨팅 리소스처럼 작동하도록 한다.
랙은 시스템 간 스케일아웃 네트워킹에 Spectrum-X Ethernet도 사용한다. 이 계층은 분산 AI 워크로드와 관련된 혼잡 및 트래픽 패턴을 처리하면서 별도의 랙 또는 클러스터를 연결한다.
제안된 설계에는 NVIDIA Vera CPU, BlueField-4 데이터 처리 장치, ConnectX-9 SuperNIC가 포함된다. 또한 물리적 트레이, 전력 공급, 냉각 및 시스템 통합을 포괄하는 모듈형 레퍼런스 아키텍처인 NVIDIA MGX를 사용한다.
Astera Labs는 시스템 전반의 고처리량 데이터 이동을 유지하기 위한 연결 기술을 제공한다. d-Matrix는 이 랙이 기존 MGX 제조 생태계의 모듈형 케이블리스 트레이를 사용할 것이라고 밝혔다.
이 범위가 중요한 이유는 프로세서 하나만으로는 사용할 수 있는 AI 서비스가 되지 않기 때문이다. 구매자는 서버, 펌웨어, 네트워킹, 오케스트레이션, 냉각, 수리 절차 및 안정적인 교체 부품 공급을 필요로 한다.
스타트업은 일반적으로 이러한 요소를 직접 구축하거나 파트너가 이를 구축하도록 설득해야 한다. 이후 예기치 못한 다운타임을 감당할 수 없는 고객을 위해 완전한 시스템을 검증해야 한다.
NVLink Fusion은 이 순서를 바꾼다. NVIDIA는 자사 스케일업 패브릭과 랙 설계의 일부 요소에 대한 접근을 제공해 다른 기업의 XPU가 동일한 인프라 프레임워크에 진입하도록 한다.
XPU라는 용어는 범용 CPU에 적합하지 않은 워크로드에 최적화된 특화 프로세서를 폭넓게 가리킨다. Raptor의 경우 대상은 생성형 AI 추론, 특히 지연 시간에 민감한 토큰 생성이다.
d-Matrix Raptor XPU는 Vera Rubin NVL72를 포함한 NVIDIA GPU 시스템과 함께 작동할 수도 있다. NVIDIA는 서로 다른 프로세서가 서빙 작업의 각기 다른 단계나 유형을 처리하는 이 구성을 분리형 추론이라고 설명한다.
이 공존이 이 이야기의 반전을 만든다. d-Matrix는 추론 배포에서 성과를 내기 위해 데이터센터 전체에서 NVIDIA를 대체할 필요가 없다. 자사 칩 주변의 NVIDIA 구성요소에 의존하면서도 선택된 워크로드를 두고 경쟁할 수 있다.
NVIDIA도 그에 못지않게 중요한 것을 얻는다. 주변 시스템 아키텍처에 대한 통제권을 포기하지 않고 맞춤형 가속기를 수용할 수 있다. 경쟁의 경계가 칩에서 랙으로 이동하는 셈이다.
따라서 이 계약은 단순한 호환성 인증 이상의 의미를 지닌다. 타사 가속기가 NVIDIA GPU와 경쟁하더라도 NVIDIA 인프라 수요를 늘리도록 만들 수 있는지를 시험한다.
랙 통합이 실질적인 장벽이 된 이유
이제 희소한 역량은 인상적인 가속기를 설계하는 일이 아니다. 그 실리콘을 고객이 예측 가능하게 배포할 수 있는 인프라로 전환하는 일이다.
AI 추론은 모델 학습과 다른 하드웨어 요구를 제시한다. 학습은 다수의 가속기에 걸친 대규모 병렬 연산을 강조한다. 추론은 응답 시간, 동시 사용자, 모델 메모리 및 예측하기 어려운 요청 흐름도 관리해야 한다.
추론 모델은 답변을 반환하기 전에 훨씬 더 많은 토큰을 생성할 수 있어 이러한 압박을 강화한다. 긴 컨텍스트 애플리케이션도 토큰 생성 중 필요한 정보를 저장하는 대규모 키-값 캐시를 유지한다.
이런 워크로드는 메모리 이동을 핵심 제약으로 만든다. 가속기는 풍부한 연산 용량을 제공하면서도 모델 가중치나 캐시된 컨텍스트를 기다리게 해 컴퓨팅 유닛을 유휴 상태로 둘 수 있다.
d-Matrix는 메모리 중심 컴퓨팅을 통해 이 문제를 공략한다. 이 아키텍처는 매트릭스 연산을 저장된 데이터에 더 가깝게 배치해 추론 중 정보가 이동하는 거리를 줄인다.
하지만 프로세서 내부의 메모리 병목을 해결한다고 해서 그 외부의 배포 문제가 해결되는 것은 아니다. 랙 규모 시스템은 실제 운영 조건에서 가속기, 호스트, 스토리지, 네트워킹, 전력 및 냉각을 조율해야 한다.
각 구성요소는 검증 작업을 추가한다. 엔지니어는 신호 무결성, 열 특성, 펌웨어 호환성, 집단 통신, 장애 복구 및 서비스 절차를 검증해야 한다.
액체 냉각 랙은 또 다른 운영 계층을 더한다. 신규 공급업체는 고객이 하나의 프로세서를 위해 전력과 냉각 설비를 재구축하지 않아도 되도록 기존 시설 설계에 맞춰야 한다.
NVIDIA의 초기 NVLink Fusion 출시는 이 문제를 직접 다뤘다. 이 회사는 2025년 5월 외부 CPU와 XPU를 활용하는 세미 커스텀 AI 인프라용 플랫폼을 도입했다.
초기 파트너 목록은 설계 체인의 여러 부분을 포괄했다. MediaTek, Marvell, Alchip, Astera Labs, Synopsys 및 Cadence는 맞춤형 실리콘, 연결성 또는 지식재산을 지원했다.
Fujitsu와 Qualcomm은 NVIDIA GPU와 함께 작동할 수 있는 맞춤형 CPU를 계획했다. 이후 협업은 플랫폼을 추가 프로세서와 클라우드 설계로 확장했다.
이처럼 확대되는 명단은 모든 독립 가속기 공급업체에 압박을 가한다. 칩 제조사는 확립된 랙 생태계에 참여하거나, 동등한 시스템을 독자적으로 구축하거나, 경쟁하는 개방형 표준에 맞출 수 있다.
첫 번째 경로는 통합 위험을 줄이지만 전략적 의존성을 만든다. 두 번째는 더 많은 통제권을 유지하지만 자본, 시간 및 고객 신뢰를 요구한다. 세 번째는 다른 생태계가 비슷한 수준의 성숙도에 도달하는 데 달려 있다.
d-Matrix는 Raptor를 위해 속도와 배포 가능성을 선택했다. Sid Sheth 최고경영자는 추론 수요는 증가하는 반면 자본, 시간 및 에너지는 여전히 한정돼 있다는 점을 명확히 짚었다.
회사의 결정은 개발 단계도 반영한다. d-Matrix는 Raptor를 선보이기 전에 Corsair 플랫폼 출하를 시작했지만, 도전하려는 인프라 공급업체들보다 규모는 여전히 훨씬 작다.
새로운 메모리 아키텍처와 함께 새로운 랙 플랫폼을 구축하면 실행 위험은 배가된다. MGX를 활용하면 회사는 프로세서, 컴파일러 및 추론 소프트웨어에 더 많은 엔지니어링 자원을 집중할 수 있다.
이 선택이 검증 작업을 없애지는 않는다. Raptor는 여전히 NVLink를 올바르게 구현하고, NVIDIA의 다른 장치와 함께 작동하며, 시스템 수준의 성능 및 신뢰성 목표를 충족해야 한다.
다만 고객이 한 번에 받아들여야 하는 새로운 요소의 수는 줄어든다. 익숙한 랙은 인프라 팀이 낯선 가속기를 평가하기 쉽게 만들 수 있다.
그 결과는 GPU 공급업체만큼이나 경쟁 가속기 기업에도 압박을 가한다. 빠른 칩만 제공하는 스타트업은 이제 검증되고 유지보수가 가능한 랙 설계 안에 담긴 프로세서와 경쟁하게 된다.
Raptor를 중심으로 NVLink Fusion이 작동하는 방식
NVLink Fusion은 프로세서 선택과 랙 구축을 분리하지만, 시스템의 중심에는 NVIDIA 인터커넥트를 유지한다.
이 아키텍처에는 두 가지 네트워킹 계층이 있다. NVLink는 스케일업 도메인 내에서 가속기를 연결하고, Spectrum-X는 더 큰 스케일아웃 클러스터 전반에서 트래픽을 전달한다.
랙 내부에서 NVLink 스위치는 Raptor 장치들 사이에 고대역폭·저지연 통신을 제공한다. 모델 또는 그 작업 데이터가 하나의 가속기에 머물 수 없을 때 이 연결은 중요하다.
이 도메인 외부에서는 ConnectX SuperNIC와 Spectrum-X Ethernet이 데이터센터 전반의 시스템을 연결한다. BlueField DPU는 네트워킹, 격리 및 데이터 이동 같은 인프라 작업을 처리할 수 있다.
Vera CPU는 호스트 프로세서 역할을 한다. MGX는 이러한 요소를 배포 가능한 트레이와 랙으로 패키징하는 기계적·전기적 프레임워크를 정의한다.
NVLink Fusion의 작동 방식을 이해하려면 접근성과 표준화를 구분해야 한다. NVIDIA는 승인된 타사 실리콘에 자사 패브릭을 개방하고 있지만, NVLink는 여전히 NVIDIA가 통제하는 기술이다.
따라서 이 설계는 수평적으로 포용적이지만 공급업체 중립적이지는 않다. 파트너는 플랫폼에 접근할 수 있지만, NVIDIA는 인터페이스, 검증, 로드맵 및 주변 구성요소에 대한 영향력을 유지한다.
이 모델은 실질적인 장점을 제공한다. 공유 랙은 운영자가 프로세서마다 별도의 물리적 설계를 만들지 않아도 다양한 가속기 유형을 지원할 수 있다.
데이터센터 구축업체는 바닥 공간, 냉각 연결, 전력 분배 및 유지보수 관행을 표준화할 수 있다. 이후 컴퓨팅 용량은 워크로드 요구사항에 따라 달라질 수 있다.
NVIDIA는 확립된 제조 네트워크도 보유하고 있다. 기존 장비 제조업체와 설계 제조업체는 이미 MGX 및 NVIDIA의 랙 규모 GPU 플랫폼에서 파생된 시스템을 생산하고 있다.
회사의 기술 설명은 NVLink 인터페이스, 칩렛, 스위치, 케이블링 및 랙 기술에 대한 접근을 설명한다. 전력 및 액체 냉각 설계도 포함한다.
d-Matrix에 이 인프라는 순수한 가속기 벤치마크로는 포착할 수 없는 문제를 해결한다. 추론 용량을 구매하는 고객은 초당 토큰 수와 함께 배포 일정, 유지보수성, 활용도 및 운영 위험을 평가한다.
늦게 출시되거나 고유한 랙을 요구하는 프로세서는 실험실 결과가 유리하더라도 경쟁에서 밀릴 수 있다. 인프라 일관성은 제한적인 성능 우위를 능가할 수 있다.
이 접근법은 고객이 특화 추론과 GPU 기반 워크로드를 혼합할 수 있게 한다. NVIDIA는 Raptor 랙이 Vera Rubin NVL72 시스템을 대체하는 대신 그 옆에서 함께 작동할 수 있다고 말한다.
가능한 배포 방식 중 하나는 지연 시간에 민감한 토큰 생성을 Raptor로 보내는 한편, 다른 모델 단계는 GPU에 유지하는 것이다. 양사는 이 워크플로를 입증하는 완전한 프로덕션 구성을 아직 공개하지 않았다.
소프트웨어는 이러한 분리 구조에서도 필수적이다. 모델 런타임은 작업을 적절히 배치하고, 메모리를 관리하며, 특수 하드웨어의 이점을 상쇄하지 않도록 데이터를 이동해야 한다.
d-Matrix는 Corsair와 Raptor를 위한 자체 소프트웨어 스택을 개발했다. 더 광범위한 NVIDIA 환경과의 통합이 구매자에게 하나의 관리 가능한 플랫폼을 제공할지, 아니면 인접한 두 시스템을 제공할지를 결정할 것이다.
이 구분은 개발자에게 중요하다. 하드웨어 이기종성은 워크로드를 더 적합하게 매칭할 수 있게 하지만, 별도의 컴파일러, 모니터링 도구, 성능 프로파일, 디버깅 경로를 도입할 수 있다.
NVLink는 장치 간 통신 마찰을 줄인다. 그렇다고 이들의 프로그래밍 모델이 자동으로 동일해지는 것은 아니다.
따라서 이 파트너십의 가치는 물리적 링크 위의 조율에 달려 있다. 양사는 호환 가능한 구성 요소를 클라우드 운영자가 서비스로 제공할 수 있는 반복 가능한 배포 패턴으로 전환해야 한다.
Raptor의 메모리 설계는 랙 내부의 승부수다
NVIDIA가 시스템 기반을 제공하지만, Raptor는 여전히 고객이 또 다른 추론 프로세서를 필요로 하는 이유를 입증해야 한다.
Raptor는 d-Matrix의 이전 Corsair 플랫폼에 사용된 메모리 중심 접근 방식을 확장한다. 핵심 특징은 커스텀 DRAM 바로 위에 컴퓨트 다이를 배치하는 3차원 패키지다.
DRAM은 Corsair에서 광범위하게 사용된 더 빠른 메모리인 SRAM보다 높은 밀도를 제공한다. 그러나 기존 DRAM은 컴퓨트에서 더 멀리 떨어져 있으며, 일반적으로 비트당 이동에 더 많은 에너지가 필요하다.
d-Matrix의 설계는 고밀도 수직 연결을 통해 많은 소형 메모리 뱅크를 컴퓨트 엔진에 직접 노출한다. 목표는 DRAM 용량과 훨씬 더 높은 로컬 대역폭을 결합하는 것이다.
Hot Chips 2026에서 이 회사는 커스텀 DRAM 다이 위에 TSMC 4나노미터 컴퓨트 다이를 접합한 패키지를 발표했다. 인터페이스는 36마이크론 연결 피치를 사용한다.
시연된 설계는 카드당 32GB와 초당 100테라바이트의 내부 대역폭을 표방한다. 이 수치는 별도 가속기 간 네트워크 대역폭이 아니라 패키지 내부 데이터 이동을 설명한다.
3D DRAM 설계에 대한 독립 보도 역시 중요한 단서를 강조했다. 공개된 성능 결과 중 상당수는 초기 실리콘에 기반한 추정치다.
d-Matrix는 수직 인터페이스의 에너지를 비트당 0.37피코줄로 측정했다. 회사는 이 수치를 HBM4 베이스 다이로 데이터를 이동할 때의 약 2.4피코줄과 비교했다.
관련 연구 논문은 HBM 기반 설계보다 카드당 처리량이 약 4.7배 높을 것으로 예측했다. 그러나 예측치나 인터페이스 측정치만으로는 완전한 프로덕션 시스템 성능을 입증할 수 없다.
열 관리도 또 다른 과제다. 로직 다이는 콜드 플레이트가 직접 접촉할 수 있도록 상단에 배치되며, 그 아래의 DRAM은 인터포저 역할도 한다.
완성된 패키지의 공개 전력 예산은 422와트다. 수직 메모리 인터페이스는 최대 용량으로 작동할 때 296와트를 차지한다.
열은 DRAM 리텐션에 영향을 미치며, 이는 리프레시 전에 메모리 셀이 데이터를 유지하는 시간을 결정한다. 명시된 작동 온도에서 이 설계는 훨씬 더 빈번한 리프레시 작업을 필요로 한다.
d-Matrix는 더 작은 메모리 뱅크가 그에 따른 대역폭 비용을 제한한다고 말한다. 또한 안정적인 동작 유지를 위해 예비 뱅크, 오류 정정, 이중화 기능을 포함한다.
이러한 세부 사항은 성숙한 액체 냉각 랙과의 통합이 중요한 이유를 설명한다. Raptor의 아키텍처는 단순히 커넥터만 필요로 하는 것이 아니다. 이례적인 패키지를 중심으로 설계된 전력, 냉각, 검증이 필요하다.
이 기술은 토큰 생성 단계를 겨냥한다. 이 단계는 바이트당 비교적 적은 연산을 수행하면서 모델 가중치를 반복적으로 이동시키는 경우가 많다. 더 높은 로컬 메모리 대역폭은 컴퓨트 유닛을 계속 가동할 수 있다.
입력 프롬프트를 처리하는 프리필은 다른 성능 프로파일을 보인다. 더 많은 연산을 요구할 수 있으며, 다른 가속기 구성을 선호할 수 있다.
이 차이는 분리형 추론 논거를 뒷받침한다. 소프트웨어와 네트워킹이 핸드오프를 효율적으로 유지한다면, 운영자는 프리필과 디코딩에 별도의 프로세서를 할당할 수 있다.
그러나 Raptor의 가치는 대역폭만으로 추론할 수 없다. 유용한 성능은 모델 지원, 수치 형식, 스케줄링, 배치 크기, 컨텍스트 길이, 허용 가능한 응답 지연 시간에 달려 있다.
메모리 용량도 중요하다. 32GB 카드는 모든 대형 모델을 독립적으로 담을 수 없으므로, 더 큰 워크로드는 여러 장치에 걸쳐 분할해야 한다.
이 요구 사항은 NVLink 스케일업 도메인을 더 중요하게 만든다. Raptor의 내부 메모리 설계와 NVIDIA의 외부 패브릭은 새로운 병목을 만들지 않고 함께 작동해야 한다.
따라서 d-Matrix Raptor XPU는 복합적인 승부수다. 3D 패키지는 양산 수율에서 작동해야 하며, 랙은 그 패키지를 신뢰할 수 있는 애플리케이션 성능으로 전환해야 한다.
NVIDIA의 개방형 플랫폼에도 경계는 있다
핵심 경쟁은 d-Matrix와 NVIDIA GPU 간의 대결이 아니다. NVIDIA가 통제하는 통합과 벤더 중립적 랙 인프라 간의 경쟁이다.
NVIDIA는 자사의 AI 플랫폼을 수직적으로 통합되고 수평적으로 개방된 구조라고 설명한다. 이 표현은 회사의 전략을 포착하지만, 구매자는 각 부분이 의미하는 바를 살펴봐야 한다.
수직 통합은 NVIDIA 프로세서, 스위치, 네트워크 어댑터, DPU, 소프트웨어, 랙 설계, 공급 관계를 결합한다. 수평적 개방성은 선택된 외부 CPU와 XPU가 그 환경에 참여할 수 있도록 한다.
이 구조는 핵심 패브릭이 NVIDIA의 통제하에 있는 시스템 내에서 프로세서 선택지를 확장한다. GPU 전용 랙보다는 개방적이지만, 업계가 관리하는 인터커넥트보다는 중립성이 낮다.
이 경계는 NVIDIA에 상업적으로 유용하다. 커스텀 가속기가 점유율을 높여도, 회사는 그 주변에 고부가가치 네트워킹 및 인프라 구성 요소를 계속 공급할 수 있다.
또한 AI 시스템이 서버에서 랙 규모 컴퓨터로 전환되는 과정에서 NVLink를 중심에 둘 수 있다. 랙이 제품이 되고, 개별 프로세서는 구성 가능한 요소가 된다.
d-Matrix는 이미 NVIDIA 장비를 위해 시설을 준비 중인 구매자에게 접근할 수 있다는 이점을 얻는다. 이 파트너십은 덜 익숙한 프로세서를 시험하는 데 드는 조직적 비용을 낮춘다.
하지만 d-Matrix는 NVIDIA의 인증 절차와 인프라 로드맵에 대한 의존성도 함께 갖게 된다. 스위치, CPU, 소프트웨어 또는 상업 조건의 변화는 회사의 시스템 계획에 영향을 줄 수 있다.
양사는 파트너십의 재무 구조를 공개하지 않았다. 또한 어떤 소프트웨어 계층을 공유할지, 고객이 완성된 랙을 어떻게 조달하고 지원받을지도 상세히 밝히지 않았다.
이 미해결 질문들은 개방성에 여러 차원이 있기 때문에 중요하다. 하드웨어는 물리적으로 상호운용 가능할 수 있지만, 조달, 관리, 개발은 여전히 한 벤더에 긴밀히 결합될 수 있다.
경쟁 모델은 개방형 업계 인터페이스를 강조한다. AMD의 Helios 랙 설계는 OCP Open Rack Wide, 스케일업 연결을 위한 UALink, 더 큰 클러스터를 위한 Ultra Ethernet을 사용한다.
Helios는 AMD Instinct 가속기, EPYC 프로세서, Pensando 네트워킹을 결합한다. 공개된 설계에는 72개의 가속기가 포함되어 있어, 고밀도 랙 규모 시스템으로 향하는 업계의 움직임과 궤를 같이한다.
UALink는 여러 벤더가 공유 사양을 통해 가속기를 연결할 수 있도록 하는 것을 목표로 한다. 이 접근 방식은 더 넓은 이식성을 약속하지만, 개방형 사양이 제품 성숙도나 배포 규모의 동등성을 보장하지는 않는다.
NVIDIA의 장점은 NVLink가 이미 여러 세대의 출하 시스템에서 작동하고 있다는 점이다. 제조 파트너들도 고밀도 액체 냉각 랙에 대한 실무 경험을 보유하고 있다.
개방형 경로는 이론적으로 더 큰 독립성을 제공한다. NVIDIA 경로는 한 회사의 아키텍처 방향 아래 확립된 통합 경로를 제공한다.
어느 선택도 완전히 종속을 없애지는 않는다. Raptor를 채택하는 구매자는 d-Matrix 소프트웨어, 3D 메모리 공급망, 그리고 향후 제품을 지원할 스타트업의 역량에도 의존하게 된다.
더 넓은 경쟁 구도에는 Groq, Cerebras, AMD, Intel 및 하이퍼스케일러가 설계한 가속기가 포함된다. 추론 시장 개요는 이전에 이들 회사를 GPU가 지배하는 워크로드를 겨냥한 대안으로 지목했다.
이들 중 몇 곳은 이후 완전한 시스템 제공에 더 가까워졌다. 예를 들어 Groq도 NVIDIA의 확장 중인 추론 인프라 전략에 합류했다.
이러한 패턴은 NVIDIA가 특화 기술을 저항하기보다 흡수하려 한다는 점을 시사한다. 성공적인 XPU는 NVIDIA 네트워킹과 랙 기술을 채택해야 할 또 다른 이유가 될 수 있다.
d-Matrix에 이 플랫폼 합류는 실용적인 선택이다. 동시에 이는 회사의 NVIDIA 도전이 단순한 경쟁 칩 서사가 시사하는 것보다 더 좁다는 의미이기도 하다.
이 파트너십은 어떤 프로세서가 추론을 수행할지를 두고 경쟁한다. 주변 인프라의 상당 부분을 누가 정의하는지를 두고 경쟁하지는 않는다.
결과는 출시, 벤치마크, 고객이 결정할 것이다
이 발표는 아키텍처적 의도를 보여 준다. 제조 준비 상태, 상업적 수요, 양산 성능을 입증하지는 않는다.
첫 번째 관찰 지점은 2026년 말 이전으로 예정된 Raptor의 테이프아웃이다. 테이프아웃은 칩 설계가 제조를 위해 확정되는 시점이다.
이 이정표를 달성하면 현재 일정에 힘이 실린다. 이를 놓치면 2027년 말 이전에 제조, 패키징, 테스트, 소프트웨어 작업, 랙 인증을 수행할 시간이 줄어든다.
두 번째 신호는 독립적으로 재현 가능한 시스템 성능이다. 구매자에게 필요한 것은 고립된 대역폭 수치나 예상 모델 실행 결과가 아니라 완전한 Raptor 랙의 결과다.
이러한 평가는 모델, 컨텍스트 길이, 배치 크기, 지연 시간 목표, 정확도 설정, 전력 소비량을 공개해야 한다. 이런 조건이 없는 초당 토큰 수는 중요한 트레이드오프를 숨길 수 있다.
회사의 프리미엄 토큰 서비스 전략에서는 사용자당 성능이 특히 중요하다. 개별 요청이 대규모 배치에서 대기한다면 높은 총처리량의 의미는 줄어든다.
에너지 측정은 랙 전체를 포괄해야 한다. 패키지 수준의 효율은 CPU, 스위치, 냉각 장비, 네트워킹, 유휴 용량으로 인해 희석될 수 있다.
세 번째 신호는 실명 고객 배포다. d-Matrix는 Raptor가 하이퍼스케일러와 프런티어 연구소에서 평가 중이라고 말하지만, 해당 조직을 밝히지는 않았다.
확정된 클라우드 인스턴스, 관리형 추론 서비스 또는 발표된 프로덕션 클러스터는 이 파트너십의 상업적 근거를 강화할 것이다. 평가만으로는 구매 의도를 보여 주지 못한다.
초기 공급은 2027년 4분기로 예정되어 있다. 이 긴 기간은 경쟁 시스템이 메모리, 네트워킹, 추론 소프트웨어를 개선할 시간을 제공한다.
이는 d-Matrix를 제조 불확실성에도 노출한다. 회사는 커스텀 DRAM 다이를 생산하고, 이를 첨단 로직에 접합하며, 수용 가능한 수율을 달성하고, 지속적인 열 환경에서 패키지를 검증해야 한다.
100건이 넘는 특허 보유 주장은 이러한 생산 문제를 해결하지 못한다. 특허는 기술적 아이디어를 보호하지만, 고객에게 필요한 것은 신뢰할 수 있는 물량과 예측 가능한 서비스다.
NVIDIA에도 완료해야 할 일이 있다. 관련 Vera, BlueField, ConnectX, Spectrum-X, NVLink 구성 요소는 호환 가능한 일정에 따라 요구되는 성숙도에 도달해야 한다.
Astera Labs는 통합 설계의 일부로 연결성 구성 요소를 공급해야 한다. 이후 랙 제조업체는 케이블 없는 트레이, 냉각, 펌웨어, 시스템 관리를 인증해야 한다.
소프트웨어도 병행 일정으로 진행된다. d-Matrix는 Raptor 출하 시점에 설계 기간에 उपलब्ध했던 모델뿐 아니라 최신 모델과 프레임워크도 지원해야 한다.
모델 아키텍처는 빠르게 변할 수 있다. 희소 전문가 혼합, 더 긴 컨텍스트 윈도우, 멀티모달 워크로드, 새로운 디코딩 기법은 메모리와 통신 패턴을 바꾼다.
특화 프로세서가 성공하려면 이러한 변화 속에서도 아키텍처의 유용성이 유지되어야 한다. 또한 널리 쓰이는 모델의 발전 속도를 따라갈 만큼 빠르게 컴파일러를 업데이트할 필요가 있다.
NVIDIA의 플랫폼은 물리적 배포 위험을 낮출 수 있지만, 소프트웨어 채택을 보장할 수는 없다. 개발자와 클라우드 운영자는 여전히 워크로드를 Raptor로 향하게 할 이유가 필요하다.
가장 설득력 있는 사례는 사용자당 낮은 지연 시간, 경쟁력 있는 에너지 사용량, 간편한 모델 온보딩을 결합하는 것이다. 어느 한 영역에서라도 약점이 있으면 활용률이 제한될 수 있다.
구매자는 NVIDIA가 Raptor를 자사 GPU 및 다른 추론 제품과 함께 어떻게 포지셔닝하는지도 주시해야 한다. 동등한 기술적 접근성이 반드시 동등한 상업적 가시성으로 이어지는 것은 아니다.
마지막 우려는 플랫폼 집중도다. 외부 XPU를 지원하면 고객의 프로세서 선택지는 늘어나지만, 더 많은 랙 관련 의사결정이 NVIDIA의 영향력 아래로 들어가게 된다.
이 결과는 순수한 개방성도, 단순한 배제도 아니다. 경쟁은 점점 더 보편화되는 인프라 경계 안에서 지속되는 다층적 시장이다.
d-Matrix와의 NVLink Fusion 협업은 Raptor가 이 경계를 넘어 실제 출하되고, 측정 가능하며, 널리 이용할 수 있는 서비스가 될 때 중요해질 것이다. 그전까지 그 의미는 전략에 있다.
d-Matrix는 신뢰할 수 있는 랙 없이는 더 나은 추론 칩만으로 충분하지 않다는 점을 받아들였다. NVIDIA는 특화 프로세서가 자사의 인프라 입지를 약화시키지 않고도 플랫폼에 진입할 수 있음을 받아들였다.
향후 몇 달 동안에는 테이프아웃, 완성형 시스템 벤치마크, 실명이 공개된 배포 사례를 그 순서대로 지켜봐야 한다. 각 이정표는 이 로드맵이 제품으로 구체화되고 있는지를 보여줄 것이다.
인프라 구매자에게 유용한 질문은 Raptor가 모든 GPU를 이기는지가 아니다. 수용하기 어려운 운영 복잡성을 더하지 않으면서 가치 있는 추론 프로파일을 제공하는지 물어야 한다. 그 증거가 NVIDIA의 랙이 가속기 선택을 위한 발판이 될지, 아니면 또 하나의 지속적인 종속 지점이 될지를 결정할 것이다.



