Panmnesia CXL AI 데이터 센터, 확장성 경쟁을 GPU 너머로 옮기다
- Aisha Washington

- 8시간 전
- 11분 분량
Panmnesia는 하나의 일관된 실행 도메인 안에서 최대 960개의 가속기를 조율하는 CXL AI 데이터 센터 아키텍처를 제안했다. Meta 연구진과 함께 개발한 이 설계는 랙 전반의 리소스가 하나의 거대한 칩 내부 구성 요소처럼 작동하도록 만드는 것을 목표로 한다.
이 주장은 익숙한 AI 인프라 논쟁의 틀을 바꾼다. 핵심 질문은 더 이상 어느 기업이 가장 빠른 GPU를 만들 수 있는지에만 있지 않다. 수백 개의 가속기, 메모리 장치, 프로세서가 하나의 머신처럼 작동할 만큼 예측 가능하게 통신할 수 있는지가 관건이다.
Panmnesia CXL AI 데이터 센터는 공개적으로 문서화된 완전한 규모의 상용 배포 사례가 아니라 아키텍처 제안에 머물러 있다. 다만 일반적인 콘셉트 발표보다 더 높은 신뢰도를 갖고 등장했다. 이 설계는 초청받은 동료 심사 리뷰에 실렸으며, Meta는 별도로 자체 CXL 메모리 인프라의 운영 결과를 보고했다.
이 제안은 현행 데이터 센터 모델의 까다로운 부분에 Compute Express Link, 즉 CXL을 적용한다. CXL은 프로세서, 가속기, 메모리 간 일관된 통신을 지원하는 개방형 인터커넥트 표준이다. 기존 네트워크 및 소프트웨어 계층보다 더 직접적인 리소스 접근을 제공할 수 있다.
Panmnesia와 Meta는 CXL이 모든 Ethernet 또는 InfiniBand 연결을 대체해야 한다고 주장하지 않는다. 이들의 주장은 더 좁은 범위이지만 영향은 더 크다. 긴밀히 동기화된 실행이 필요한 워크로드에는 범용 네트워킹이 일반적으로 제공하는 것보다 랙 간 더욱 예측 가능한 경로가 필요하다는 것이다.
이 제안은 데이터 센터를 하나의 실행 단위로 본다
Panmnesia와 Meta는 칩 수준의 조율을 개별 서버와 랙 너머로 확장하려 한다.
대규모 AI 워크로드는 여러 가속기에 계산을 분산한다. 이들 가속기는 학습 또는 추론 작업 전반에 걸쳐 모델 파라미터, 중간 결과, 동기화 메시지를 교환해야 한다.
지연된 참여자 하나가 해당 그룹의 다른 모든 장치를 기다리게 만들 수 있다. 엔지니어들은 이런 지연된 참여자를 흔히 스트래글러(straggler)라고 부른다. 시스템 규모가 커질수록 가장 빠른 통신 경로와 가장 느린 통신 경로 간 차이는 점점 더 큰 비용을 초래한다.
새 아키텍처는 이러한 지연 시간 편차를 줄이는 데 초점을 맞춘다. 평균 지연 시간도 중요하지만, 수백 개 장치가 동일한 동기화 작업을 완료해야 하는 환경에서는 예측 가능한 도착 시간도 똑같이 중요해진다.
공개된 one-chip 제안에 따르면, 이 설계는 CPU, 가속기, 메모리를 계층형 CXL 도메인 안에 배치한다. 제안은 통신 경로를 제어하기 위해 세 가지 주요 하드웨어 요소를 사용한다.
첫 번째는 고팬아웃(high-fan-out) 비차단 스위치다. 고팬아웃은 하나의 스위칭 계층이 많은 장치를 연결할 수 있음을 뜻한다. 비차단 설계는 관련 없는 연결이 서로 불필요하게 간섭하지 않도록 하는 것을 목표로 한다.
두 번째 구성 요소는 링크 가속 유닛이다. 이 하드웨어는 그렇지 않으면 더 많은 소프트웨어 처리나 프로토콜 전환이 필요할 통신 기능을 처리한다.
세 번째는 패브릭 컨트롤러다. 연결된 리소스의 더 큰 집합을 관리하고 장치가 어떻게 구성되고, 접근되며, 격리되는지를 결정한다.
이 요소들은 함께 패브릭 전반의 통신을 더욱 결정론적으로 만들기 위한 것이다. 장치들은 여전히 서로 다른 보드, 서버, 랙에 위치하지만, 상호작용은 제어된 하드웨어 경로를 따른다.
발표에서 설명한 참조 시스템은 CPU 한 개와 가속기 두 개를 연결한다. 제안된 설계에서는 CPU 한 개가 가속기 16개를 조율하며, 이는 8배 증가한 수치다.
더 큰 계층형 도메인에는 최대 960개의 가속기가 포함될 수 있다. 발표는 이 수치가 참조 플랫폼 규모의 약 13배라고 설명한다.
이 제안은 또한 기존 네트워크를 통해서는 마이크로초가 걸릴 경로에서 수백 나노초 수준의 왕복 통신 지연 시간을 목표로 한다. 이는 모델링된 비교 기준에서 최대 한 자릿수 배수의 감소에 해당한다.
이 수치는 리뷰에서 제시된 아키텍처를 설명한다. 960개 가속기로 구성된 실제 운영 환경에서 독립적으로 검증된 결과로 해석해서는 안 된다.
이 구분은 중요하다. 리뷰 논문은 기존 증거, 설계 원칙, 미래 아키텍처를 결합할 수 있다. 그렇다고 모든 구성 요소가 제안된 최대 규모에서 함께 작동했음이 자동으로 입증되는 것은 아니다.
그럼에도 이 출판물은 분명한 기술적 방향을 제시한다. Panmnesia는 서버가 아닌 전체 데이터 센터를 하드웨어 설계의 단위로 다루고 있다.
AI 확장이 통신 문제가 된 이유
가속기를 추가하면 이론적 컴퓨팅 성능은 늘어나지만, 동기화된 워크로드는 필요한 교환 중 가장 느린 작업만큼만 빠르게 움직인다.
AI 인프라 공급업체들은 수년간 가속기 성능, 메모리 대역폭, 랙 밀도를 높여 왔다. 이러한 개선은 여전히 중요하다. 그러나 대형 모델은 하나의 장치에서 고립된 계산 순서로 실행되는 경우가 드물다.
학습은 모델 계층과 데이터를 여러 가속기에 분산한다. 추론 시스템 역시 대형 모델, 검색 인덱스, 추천 테이블을 여러 리소스에 분할한다.
모든 분할은 통신을 만들어 낸다. 장치는 작업의 나머지 부분과 동기화를 유지하면서 활성화값, 그래디언트, 파라미터, 캐시 데이터를 이동해야 한다.
문제는 단순한 장치 수보다 더 빠르게 커진다. 가속기 하나를 추가하면 참여자가 늘어날 뿐 아니라 통신 관계도 더 많아지고, 또 하나의 잠재적 지연 원인이 생길 수 있다.
범용 네트워크는 다양한 트래픽과 유연한 라우팅을 지원하도록 설계된다. 이러한 유연성은 네트워크 인터페이스, 버퍼링, 프로토콜 처리, 혼잡 관리, 소프트웨어 조율을 수반한다.
이 기능들은 Ethernet과 InfiniBand를 대규모 시설 전반에서 유용하게 만든다. 동시에 긴밀히 동기화된 AI 작업이 감당해야 하는 시간 변동성도 만든다.
현대적인 가속기 랙 내부에서 공급업체들은 이미 이러한 손실을 줄이기 위해 특수한 스케일업 링크를 사용한다. Nvidia는 지원 시스템 내에서 NVLink와 NVLink Switch를 사용한다. 업계는 또한 가속기를 위한 개방형 스케일업 연결로 UALink를 개발하고 있다.
이 기술들은 제한된 물리적 도메인 안에서 장치를 긴밀하게 결합하는 데 초점을 맞춘다. CXL은 메모리 확장, 풀링, 공유를 포함해 프로세서, 가속기, 메모리 간 일관된 연결을 중심으로 발전해 왔다.
Panmnesia 설계는 이 일관된 모델을 더 멀리 확장한다. 주요 상대는 특정 칩 기업 하나가 아니다. 긴밀하게 결합된 작업이 랙 경계를 넘을 때 사용되는, 소프트웨어로 조율되는 네트워크 기반 스케일아웃 경로다.
그렇다고 Ethernet이 시대에 뒤처지는 것은 아니다. 스케일아웃 네트워크는 스토리지, 시설 전체 연결, 서비스 간 통신, 더 느슨한 동기화를 허용하는 워크로드에 여전히 필수적이다.
쟁점은 계산 경로에 있다. Panmnesia는 하나의 긴밀하게 동기화된 작업에 참여하는 장치 사이에 반복적인 데이터 복사와 소프트웨어 개입이 놓여서는 안 된다고 주장한다.
Meta의 운영 경험은 이 주장에 실질적인 맥락을 제공한다. 이 회사는 실리콘, 펌웨어, 운영체제 지원, 플릿 배포를 아우르는 맞춤형 CXL 메모리 확장 플랫폼 Vistara를 개발했다.
Meta는 Vistara가 분산 머신러닝 추론, 데이터베이스, 캐시, 빅데이터 처리, 빌드 시스템을 포함한 운영 서비스 전반에서 작동해 왔다고 말한다. CXL Consortium의 Vistara 배포 요약은 분리형 추론에서 서버 수를 최대 25% 줄였다고 보고한다.
같은 요약은 분산 캐시의 평균 지연 시간이 29% 감소했다고 보고한다. 이는 Meta가 보고한 운영 결과이며, Panmnesia의 완전한 960가속기 설계에 대한 벤치마크는 아니다.
그럼에도 이 결과는 CXL이 실험실 수준의 논의를 넘어선 이유를 보여 준다. 하이퍼스케일러들은 이제 일관된 메모리 확장이 서버 수와 서비스 지연 시간에 영향을 줄 수 있다는 증거를 확보하고 있다.
상업적 압박은 여러 집단에 가해진다. 가속기 공급업체는 시스템이 고가 장치를 효율적으로 활용한다는 점을 입증해야 한다. 클라우드 운영업체는 유휴 메모리와 컴퓨팅 용량을 줄여야 한다. 인터커넥트 공급업체는 경직된 독점적 섬을 만들지 않으면서 예측 가능한 통신을 제공해야 한다.
기업 구매자에게 이 문제는 궁극적으로 용량 계획으로 이어진다. 메모리를 가속기와 독립적으로 할당하는 시스템은 하나의 리소스가 한계에 도달했다는 이유만으로 완전한 서버를 추가 구매해야 하는 필요를 줄일 수 있다.
Panmnesia CXL AI 데이터 센터가 지연 시간을 제어하는 방식
CXL은 일관된 통신을 제공하지만, Panmnesia의 방식은 이 표준을 둘러싼 경로, 버퍼, 계층 구조를 제어하는 데 달려 있다.
CXL은 PCI Express 물리 기반 위에서 작동하면서 일관된 메모리 및 캐시 접근을 위한 프로토콜을 추가한다. 일관성은 연결된 구성 요소가 공유 데이터에 대해 일관된 관점을 유지하도록 한다.
이 기능은 하나의 칩과 같은 실행에 필요하지만 충분조건은 아니다. 표준은 장치가 통신하는 방식을 정의할 수 있지만, 가능한 모든 시스템 설계에서 동일한 지연 시간을 보장하지는 않는다.
대규모 패브릭에는 스위치, 큐, 컨트롤러, 트래픽 충돌, 길이가 서로 다른 경로가 포함된다. 각 요소는 평균 지연 시간을 늘리거나 개별 요청 간 차이를 확대할 수 있다.
따라서 Panmnesia의 제안은 제한된 지연 시간 변동성을 강조한다. 아키텍처는 동기화된 워크로드가 통신을 기다리기 전에 경로와 하드웨어 동작을 예측 가능하게 만들려 한다.
고팬아웃 스위치는 직접적으로 구성되는 장치 수를 확장한다. 비차단 스위칭 구조는 트래픽 패턴이 허용될 때 동시 경로를 유지하는 것을 목표로 한다.
링크 가속 유닛은 선택된 통신 작업을 하드웨어로 옮긴다. 이는 운영체제 개입을 줄이고 소프트웨어 관리 버퍼 간의 일부 반복 전송을 피할 수 있다.
패브릭 컨트롤러는 리소스를 계층형 그룹으로 구성한다. 모든 장치를 동일하게 멀리 떨어진 엔드포인트로 취급하는 대신, 설계는 칩 내부 블록과 유사한 배치 원칙을 적용한다.
자주 통신하는 구성 요소는 가까운 논리 영역에 배치될 수 있다. 더 넓은 연결은 이후 이 영역들을 하나의 더 큰 도메인으로 결합한다.
이 계층 구조가 중요한 이유는 물리적 거리가 결과를 낳기 때문이다. 전기 링크는 더 긴 경로에서 신호 품질이 떨어지며, 리타이머 또는 추가 스위칭 단계는 지연을 더할 수 있다.
리뷰는 패브릭 일부 사이의 더 긴 연결 거리에 광 연결을 제안한다. CXL-over-optics는 일반적인 전기 배선이나 케이블이 허용하는 거리보다 더 멀리 신호를 전달하면서 CXL 통신 모델을 유지한다.
광 전송이 큐잉, 혼잡, 장애, 컨트롤러 오버헤드를 없애지는 않는다. 이는 물리적 도달 거리와 신호 전송을 다루며, 예측 가능한 실행의 나머지 책임은 아키텍처에 남긴다.
업계 표준도 발전하고 있다. 공식 CXL 4.0 specification은 데이터 전송률을 128 GT/s로 두 배 높이고, 번들 포트를 지원하며, 메모리 신뢰성 기능을 추가한다.
사양의 발전은 구현업체에 더 많은 대역폭과 설계 유연성을 제공한다. 그렇다고 서로 다른 공급업체의 제품이 동일한 지연 시간을 달성하거나 데이터 센터 규모에서 완벽하게 상호 운용된다는 보장은 아니다.
Panmnesia는 자사의 주장을 검증하는 데 필요한 하위 계층을 구축해 왔다. 이 회사는 ISCA 2026에서 실리콘 기반 CXL 컨트롤러와 포트 기반 라우팅 스위치를 공개했다.
포트 기반 라우팅은 디바이스 포트 식별자에 따라 트래픽을 전송한다. 이는 PCIe 및 초기 CXL 구현과 연관된 트리형 계층 라우팅보다 더 유연한 토폴로지를 지원한다.
Panmnesia는 최적화된 컨트롤러와 스위치가 수십 대의 서버로 연결을 확장하면서도 메모리 액세스를 유사한 지연 시간 등급 내에 유지했다고 밝혔다. 회사가 공개한 실리콘 결과는 6월 29일 ISCA 산업 트랙에서 발표됐다.
이 결과는 더 큰 아키텍처를 구성하는 개별 메커니즘을 뒷받침한다. 다만 전체 데이터센터 설계가 상용화 준비 단계에 도달했음을 입증하지는 않는다.
그럼에도 이러한 계층적 증거는 주목할 만하다. 많은 인프라 발표는 도식에서 곧바로 광범위한 배포 주장으로 넘어간다. Panmnesia는 컨트롤러 실리콘, 스위치 구현, 이전의 전체 시스템 프레임워크, 그리고 Meta의 별도 운영 경험을 근거로 제시할 수 있다.
남은 단계는 발표된 규모에서의 통합이다. 하드웨어, 펌웨어, 운영체제, 오케스트레이션 소프트웨어, 광 링크, 장애 관리가 모두 지속 부하 환경에서 함께 작동해야 한다.
CXL은 네트워크 지연 시간뿐 아니라 고정된 서버 비율의 문제도 해결한다
이 아키텍처는 컴퓨팅과 메모리를 고정된 서버 번들로 구매하면서 발생하는 자원 낭비도 겨냥한다.
AI 서버에는 특정 비율의 CPU, 가속기, 로컬 메모리, 네트워킹이 탑재된다. 이 구성은 모든 워크로드에 완벽히 맞을 수 없다.
어떤 서비스는 대규모 가속기 연산 성능이 필요하지만 용량 수요는 크지 않을 수 있다. 다른 서비스는 상대적으로 적은 연산량만 사용하면서도 방대한 임베딩 테이블이나 검색 인덱스를 보유할 수 있다.
운영자는 메모리 부족에 대응하기 위해 또 다른 완전한 서버나 가속기를 추가하는 경우가 많다. 새 장비는 메모리를 제공하지만, 워크로드에 필요하지 않은 컴퓨팅 용량도 함께 도입한다.
CXL 메모리 풀링은 이러한 구매 결정을 분리한다. 하나의 메모리 풀은 여러 호스트에 서비스를 제공할 수 있으며, 소프트웨어는 변화하는 수요에 따라 용량을 할당한다.
Panmnesia는 이전 CXL 애플리케이션 작업에서 이 모델을 탐구해 왔다. 이 회사의 전체 시스템 프레임워크는 CXL CPU, GPU, 메모리 확장기, 스위치 시스템을 연결했다.
회사가 보고한 CXL 애플리케이션 테스트에서 Panmnesia는 대규모 메모리 풀에 검색 데이터베이스를 배치하고 GPU 자원에서 언어 모델 추론을 실행했다. 회사는 SSD 기반 비교 구성 대비 6배 이상의 성능을 기록했다고 밝혔다.
이 결과는 특정 구성에서 나온 벤더 벤치마크다. 모든 검색 시스템, 스토리지 장치, CXL 제품으로 일반화해서는 안 된다.
그럼에도 이 사용 사례는 구체적이다. 검색 증강 생성, 즉 RAG는 언어 모델이 답변을 생성하기 전에 관련 문서를 검색한다. 대규모 벡터 인덱스는 하나의 가속기가 제공하는 것보다 훨씬 더 많은 용량을 소모할 수 있다.
인덱스를 풀링된 메모리에 배치하면 더 느린 스토리지 액세스를 줄일 수 있다. 또한 여러 컴퓨팅 자원이 중앙에서 관리되는 용량 계층을 이용하도록 할 수 있다.
같은 논리는 추천 시스템에도 적용된다. 대규모 임베딩 테이블에는 상당한 메모리가 필요할 수 있지만, 항상 고정된 비율로 GPU를 추가해야 할 이유는 없다.
Meta의 Vistara 작업은 또 다른 변형을 보여 준다. 이 회사는 CXL을 사용해 기존 DDR4 메모리와 DDR5 프로세서 기반의 최신 서버를 연결한다.
메모리 재사용은 하드웨어 교체 압력을 줄이고 기존 구성 요소의 유효 수명을 연장할 수 있다. 동시에 안정성, 성능 계층, 펌웨어, 플릿 관리와 관련된 엔지니어링 과제도 제기한다.
더 큰 변화는 서버 구성에서 자원 구성으로의 전환이다. 운영자는 하나의 장비에 내장된 비율을 받아들이는 대신, 워크로드에 필요한 컴퓨팅, 메모리, 가속 성능의 양을 선택한다.
이 모델이 여러 벤더에 걸쳐 작동한다면 구매자는 더 큰 협상력을 얻는다. 메모리, 프로세서, 가속기는 각기 다른 교체 주기에 따라 발전할 수 있다.
반대로 이것이 독점 구현에 한정된다면, 하이퍼스케일러는 이점을 얻는 반면 일반 기업은 또 다른 호환되지 않는 플랫폼 집합에 직면할 수 있다.
따라서 CXL이 개방형 표준이라는 점은 중요하다. 이는 프로세서, 메모리 장치, 스위치, 관리 소프트웨어를 위한 공통 기술 기반을 만든다.
프로토콜 수준의 개방성이 자동으로 경쟁적인 제품 시장을 만드는 것은 아니다. 구매자에게는 검증된 장치, 일관된 관리 인터페이스, 보안 제어, 신뢰할 수 있는 상호운용성이 여전히 필요하다.
바로 이 지점에서 Panmnesia의 위치가 흥미로워진다. 이 회사는 순수 연산 성능을 두고 Nvidia, AMD, 또는 하이퍼스케일러의 맞춤형 가속기와 직접 경쟁하려는 것이 아니다.
회사가 판매하는 것은 이들 장치가 함께 얼마나 효율적으로 작동하는지를 결정하는 연결 계층이다. 구매자가 가속기를 혼용하고 더 큰 메모리 풀을 연결하며 더 높은 활용률을 요구할수록 이 계층의 가치는 커진다.
가장 큰 주장에는 여전히 시스템 수준의 증명이 필요하다
공개된 아키텍처와 작동하는 실리콘은 기술적 불확실성을 줄이지만, 안정성, 보안, 배포 경제성을 해결해 주지는 않는다.
첫 번째 불확실성은 규모다. Panmnesia는 핵심 구성 요소를 구현하고 검증한 뒤 상용 공급을 준비했다고 밝혔다.
회사는 960개 가속기가 지속적인 고객 워크로드 환경에서 하나의 일관된 도메인으로 작동하는 프로덕션 설치 사례를 공개적으로 문서화하지 않았다. 독자는 아키텍처의 최대 구성과 실제 관측된 배포를 구분해야 한다.
두 번째 불확실성은 장애 격리다. 더 큰 실행 도메인은 자원 공유를 개선할 수 있지만, 인프라 소프트웨어가 모니터링해야 할 관계도 늘어난다.
이 제안은 전체 서버를 교체하는 대신 디바이스 수준에서 장애 하드웨어를 교체할 수 있다고 설명한다. 더 세밀한 교체 단위는 낭비를 줄이고 유지보수성을 높일 수 있다.
그러나 운영자에게는 하나의 디바이스 장애가 공유 상태를 손상시키거나 패브릭의 훨씬 큰 부분을 멈추게 하지 않는다는 증거도 필요하다. 복구 동작은 정상 경로 지연 시간만큼 중요하다.
세 번째 불확실성은 혼잡이다. 논블로킹 스위치 설계는 특정 충돌을 줄이지만, 실제 AI 워크로드는 트래픽이 집중되는 패턴을 만들 수 있다.
많은 가속기가 동일한 메모리 영역을 요청하거나 같은 동기화 단계에서 통신할 수 있다. 통제된 조건에서 수백 나노초가 나온다고 해서 피크 경합 상황에서도 같은 결과가 보장되는 것은 아니다.
네 번째 문제는 메모리 계층이다. 원격 풀링 메모리는 더 큰 용량을 제공할 수 있지만, 로컬 고대역폭 메모리의 모든 특성을 갖추지는 못한다.
HBM은 가속기 가까이에 위치하며 집약적인 모델 계산에 적합한 대역폭을 제공한다. CXL 메모리는 특히 용량 집약적 데이터에 대해 이 계층을 보완할 수 있지만, 모든 작업에서 HBM을 단순히 대체할 수는 없다.
따라서 이 아키텍처에는 지능적인 배치가 필요하다. 빈번히 액세스되고 지연 시간에 민감한 데이터는 가속기 가까이에 남아야 한다. 더 크거나 시간 민감도가 낮은 데이터는 풀링된 용량을 사용할 수 있다.
소프트웨어는 이러한 차이를 이해해야 한다. 그렇지 않으면 이론적으로 더 큰 메모리 공간이 일관성 없는 애플리케이션 성능을 낳을 수 있다.
다섯 번째 불확실성은 보안이다. 랙 전반으로 일관성 있는 액세스를 확장하면 격리, 접근 제어, 암호화, 패브릭 관리의 중요성이 커진다.
기존 네트워크의 구성 실수는 하나의 서비스를 노출할 수 있다. 공유 메모리 패브릭에서의 실수는 여러 디바이스가 사용하는 데이터에 대한 직접 액세스에 영향을 미칠 수 있다.
CXL에는 보안 및 안정성 기능이 포함되어 있으며, 최신 리비전은 이를 계속 개선하고 있다. 프로덕션 구매자는 실리콘, 펌웨어, 관리 소프트웨어, 운영 절차 전반에 걸친 검증을 여전히 요구할 것이다.
전력도 또 다른 미해결 질문이다. 더 효율적인 자원 풀은 불필요한 서버를 줄이고 하드웨어 활용률을 개선할 수 있다.
하지만 스위치, 리타이머, 광 모듈, 컨트롤러, 더 큰 메모리 시스템은 에너지를 소비한다. 관련 측정 기준은 하나의 구성 요소 전력 등급이 아니라 완료된 워크로드당 총 에너지다.
마지막 불확실성은 경제성이다. Panmnesia의 아키텍처는 유휴 자원 감소와 더 세밀한 교체를 약속한다.
이러한 절감 효과는 새 스위치, 컨트롤러, 광학 장비, 통합, 검증, 운영 교육 비용보다 커야 한다. 하이퍼스케일러는 막대한 플릿 전반에 맞춤형 엔지니어링 비용을 분산할 수 있지만, 소규모 운영자는 다른 기준점에 직면한다.
그렇기 때문에 Meta의 참여는 포괄적 보증으로 기능하지 않으면서도 중요하다. Meta는 방대한 인프라 전반에 배포된 시스템에서 얻은 경험을 제공한다.
그 증거는 CXL 메모리 확장이 프로덕션 가치를 만들 수 있음을 보여 준다. 그러나 Panmnesia가 제안한 랙 간 도메인의 모든 요소가 같은 성숙도에 도달할 것임을 입증하지는 않는다.
책임 있는 해석은 기각도 수용도 아니다. Panmnesia는 신뢰할 수 있는 문제, 개방형 표준, 구현된 구성 요소, 하이퍼스케일 운영 증거를 하나의 아키텍처로 연결했다.
남은 과제는 이 구성 요소들이 최대 규모로 결합됐을 때도 장점을 유지한다는 점을 보여 주는 것이다.
아키텍처의 배포 가능성을 보여 줄 세 가지 신호
다음 단계에서는 아키텍처 최대치를 반복 가능한 워크로드, 상호운용성, 고객 증거로 대체해야 한다.
첫 번째 신호는 공인된 AI 워크로드를 실행하는 전체 랙 또는 멀티랙 시연이다. Panmnesia는 가속기 수, 토폴로지, 메모리 구성, 소프트웨어 스택, 트래픽 조건을 공개해야 한다.
가장 유용한 결과에는 테일 지연 시간, 처리량, 활용률, 전력 소비, 복구 시간이 포함될 것이다. 평균 지연 시간만으로는 예측 가능한 실행이라는 제안의 핵심 약속을 검증할 수 없다.
제안된 960가속기 도메인에 근접한 시연은 하나의 칩과 같은 구조라는 주장을 강하게 뒷받침할 것이다. 훨씬 작은 시연도 회사가 결과의 확장 방식을 설명한다면 여전히 도움이 된다.
두 번째 신호는 벤더 간 상호운용성이다. 개방형 CXL 아키텍처는 서로 다른 공급업체의 프로세서, 가속기, 메모리 장치, 스위치, 관리 도구가 함께 작동할 때 상업적 의미를 갖는다.
테스트에는 장기간 운영, 오류 주입, 펌웨어 업데이트, 디바이스 교체, 보안 격리가 포함되어야 한다. 성공적인 혼합 벤더 배포는 독점적 인프라 섬에 맞서는 Panmnesia의 주장을 강화할 것이다.
지속적인 호환성 문제는 이를 약화할 것이다. 구매자는 유난히 취약한 인증 절차를 대가로 자원 유연성을 얻고 싶어 하지 않는다.
세 번째 신호는 실명이 공개된 프로덕션 고객 또는 개념 검증 배포다. Panmnesia는 핵심 구성 요소가 상용 공급 단계로 이동하고 있다고 밝혔다.
고객 시험은 풀링된 자원이 실제 서비스에 필요한 총 서버 또는 가속기 수를 줄이는지 보여줘야 한다. 또한 운영 비용 절감이 추가 패브릭 비용 이후에도 유지되는지를 보여줘야 한다.
SK Telecom은 관련된 하나의 시험 사례다. 두 회사는 이전에 실제 모델을 사용해 CXL 기반 AI 랙을 개발하고 검증하기로 합의했으며, GPU 활용률, 메모리 활용률, 지연 시간, 처리량을 측정할 계획이었다.
이 작업의 결과는 Panmnesia의 구성 요소 작업을 데이터센터 구축자의 운영 요건과 연결할 것이다. 공개 측정값은 또 하나의 아키텍처 도식보다 더 큰 무게를 가질 것이다.
이 신호들은 CXL이 Ethernet, InfiniBand, NVLink, UALink와 함께 어느 위치에 놓일지도 분명히 할 것이다. 가장 가능성 높은 결과는 하나의 범용 연결이 아니라 계층형 인프라다.
로컬 가속기 링크는 대역폭 민감도가 가장 높은 통신을 처리할 수 있다. CXL은 일관성 있는 메모리와 스케일업 자원을 구성할 수 있다. Ethernet 또는 InfiniBand는 더 광범위한 스케일아웃 트래픽을 계속 처리할 수 있다.
Panmnesia의 기여는 코히어런트 계층이 오늘날보다 훨씬 더 멀리 확장되어야 한다는 주장에 있다. 이는 예측 가능성에 대한 기술적·상업적 베팅이다.
개발자에게는 그 결과가 대규모 모델과 검색 시스템이 메모리를 할당하는 방식을 바꿀 수 있다. 애플리케이션은 용량을 서버별로 고정된 경계가 아니라 관리 가능한 패브릭 리소스로 다루게 될 수 있다.
엔터프라이즈 구매자에게는 더 높은 활용률과 더 독립적인 업그레이드 주기가 가치로 이어질 수 있다. 다만 이러한 이점은 관리 도구가 추가된 토폴로지를 이해하기 쉽게 만들어야 한다는 조건이 남아 있다.
엔지니어링 팀은 이러한 시스템이 발전하는 과정에서 벤치마크 결과, 구성 결정, 장애 기록, 호환성 조사 결과를 보존해야 한다. 검색 가능한 지식 기반은 팀이 로컬 기술 문서 전반에 흩어진 이러한 운영 증거를 연결하는 데 도움이 될 수 있다.
Panmnesia의 CXL AI 데이터센터 제안이 주목할 만한 이유는 확장성 논의를 구성 요소의 속도에서 시스템 조율로 옮겨 놓기 때문이다. 또한 이 제안은 자체 성공을 판단할 수 있는 측정 가능한 기준도 제시한다.
멀티랙 워크로드 테스트, 여러 벤더 간 상호운용성, 그리고 명시된 프로덕션 배포 사례를 지켜볼 필요가 있다. 이 세 가지가 모두 재현 가능한 데이터와 함께 제시된다면, 데이터센터는 기계들의 네트워크라기보다 정교하게 구성된 하나의 컴퓨터처럼 작동하기 시작할 수 있다.


