top of page

Blocks Files가 Prometheus를 조명하며 Majestic Labs, GPU 메모리 한계에 도전

Majestic Labs는 부족한 HBM 용량 대신 128TB의 공유 메모리를 중심으로 설계한 서버 Prometheus로 GPU 중심의 기존 질서에 도전하고 있다. Blocks Files의 보도는 이 충돌에 주목한다. Majestic는 현재 AI 인프라에 값비싼 컴퓨팅 성능은 지나치게 많고, 접근 가능한 메모리는 너무 적다고 본다.

이 스타트업은 GPU를 조금 더 빠르게 만들겠다고 약속하는 것이 아니다. 메모리 용량을 컴퓨팅 성능과 분리하고, 각 자원을 독립적으로 확장하려 한다. 이 접근 방식은 프로세서가 모델 가중치, 캐시된 토큰 또는 기타 데이터를 기다리며 자주 멈추는 추론 워크로드를 겨냥한다.

Nvidia와 AMD는 더 큰 HBM 시스템, 더 빠른 인터커넥트, 긴밀하게 통합된 랙을 통해 같은 압력에 대응하고 있다. Majestic는 반대 경로를 택한다. 하나의 서버 안에 대규모 범용 메모리 풀, 맞춤형 인터페이스 칩렛, 프로그래밍 가능한 AI 프로세서를 사용한다.

이 차이로 Prometheus는 단순한 또 하나의 가속기 발표를 넘어선다. 미래 AI 시스템에 더 많은 연산 능력이 필요한지, 아니면 프로세서와 메모리의 관계 자체를 바꿔야 하는지를 시험하는 직접적인 시도다.

Majestic는 야심 찬 용량, 성능, 에너지 관련 주장을 공개했다. 그러나 이 회사의 프로세서는 아직 고객에게 공급되지 않았고, 독립적인 벤치마크 결과도 공개되지 않았다. 이 아이디어는 주목을 끌 만큼 신뢰할 만하지만, 약속한 우위는 여전히 하드웨어, 소프트웨어, 제조 실행력에 달려 있다.

Blocks Files 보고서가 드러낸 또 다른 GPU 과제

Majestic Labs는 업계가 워크로드가 추가 컴퓨팅 성능을 충분히 활용하지 못하는 경우에도, 메모리를 확보하기 위해 추가 GPU를 구매해 왔다고 주장한다.

7월 23일 메모리 우선 서버 보도는 표준적인 GPU와 고대역폭 메모리 조합을 거부하는 회사의 접근 방식을 설명한다. HBM은 빠른 수직 적층 메모리를 가속기 가까이에 배치한다. 근접성은 높은 대역폭을 제공하지만 총용량은 제한한다.

Majestic에 따르면, 대형 프로세서를 둘러싼 물리적 가장자리는 효율적으로 연결할 수 있는 HBM 스택 수를 제한한다. 스택 높이를 늘리는 일도 기술적·제조상 복잡성을 초래한다. 따라서 최신 시스템은 하나의 장치에 충분한 메모리가 없을 때 여러 가속기를 결합한다.

이 해법은 더 많은 메모리를 제공하지만 통신 오버헤드를 유발한다. 데이터는 GPU 링크, 스위치 또는 호스트 메모리 계층을 거쳐 이동해야 한다. 개발자는 모델 가중치, 활성화값, 키-값 캐시를 어디에 둘지 결정해야 한다.

키-값 캐시는 모델이 전체 대화를 다시 계산하지 않도록 이전에 처리한 토큰의 정보를 저장한다. 장문 컨텍스트 추론에서 상당한 메모리를 차지할 수 있다. 활성 요청마다 자체 상태를 유지하므로 사용자 수가 늘어나면 이 압력도 커진다.

Majestic는 기존 시스템이 새 메모리 블록마다 또 다른 값비싼 프로세서를 함께 추가한다고 말한다. 일부 워크로드는 추가 용량이 필요하다는 이유만으로 활용할 수 있는 수준보다 더 많은 컴퓨팅 성능을 받는다.

Prometheus는 이 결합을 끊으려 한다. 계획된 서버는 최대 12개의 맞춤형 AI 프로세서를 하나의 평면형 메모리 풀에 연결한다. 회사에 따르면 각 프로세서는 일관된 접근 특성을 지닌 동일한 주소 공간을 보게 된다.

메모리 집적 칩렛, 즉 MAC는 보드에 장착된 메모리 구성 요소 가까이에 위치한다. 이들은 다수의 메모리 칩에서 발생하는 트래픽을 모아 짧은 구리 케이블을 통해 컴퓨팅 시스템에 연결한다. Blocks Files는 이러한 연결의 길이가 약 1미터까지 늘어날 수 있다고 보도했다.

이 거리는 HBM이 프로세서 패키지에 매우 가까이 있어야 한다는 점에서 중요하다. Majestic의 접근 방식은 모든 구성 요소가 중앙 컴퓨팅 다이를 둘러쌀 필요 없이 시스템 설계자에게 메모리를 위한 더 많은 물리적 공간을 제공한다.

회사는 자사 프로세서를 Ignite라고 부르며, AIU, 즉 인공지능 유닛으로 설명한다. 이 칩은 신경망 계산에 사용되는 프로그래밍 가능한 코어와 행렬 가속 기능을 결합한다.

Prometheus는 Ignite, 인터페이스 칩렛, 메모리 모듈, 지원 소프트웨어를 중심으로 구성된 완전한 서버다. Majestic가 공개한 Prometheus 사양은 하나의 시스템에서 최대 128TB의 공유 고대역폭 메모리를 주장한다.

비교하자면, 현재 가속기 서버의 직접 연결 메모리는 수십 TB가 하나의 서버에 들어가는 것이 아니라 전체 랙에 걸쳐 TB 단위로 측정된다. 이 용량 격차가 Prometheus의 핵심 약속을 이룬다.

따라서 Blocks Files 기사는 아키텍처를 둘러싼 이견을 부각한다. Nvidia의 모델은 고성능 GPU에서 출발해 바깥으로 확장한다. Majestic는 AI 애플리케이션이 유지해야 하는 작업 세트에서 시작한 뒤, 이를 처리할 만큼의 컴퓨팅 성능을 배정한다.

AI 추론이 메모리에 가하는 압력은 커지고 있다

추론은 대형 모델, 더 긴 컨텍스트, 다수의 동시 사용자를 결합하기 때문에 메모리 문제를 더욱 어렵게 만들고 있다.

AI 인프라 논의에서는 학습이 많은 관심을 받는다. 그러나 사용자를 위해 학습된 모델을 실행하는 과정인 추론은 메모리와 연산 사이에 다른 균형을 만든다.

모델의 파라미터는 출력을 생성하는 동안 계속 사용 가능해야 한다. 생성 단계마다 모델 가중치를 읽고 현재 상태를 처리한다. 연산 장치가 메모리가 데이터를 공급하는 속도보다 빨리 작업을 마치면, 컴퓨팅 성능을 추가해도 이점은 제한적이다.

이 상태는 일반적으로 메모리 바운드 성능이라고 불린다. 프로세서에는 사용 가능한 연산 능력이 있지만, 실제 완료 속도는 데이터 이동이 좌우한다.

더 긴 컨텍스트 윈도우는 이러한 불균형을 심화한다. 짧은 프롬프트를 처리하는 모델은 더 적은 대화 상태를 유지한다. 긴 문서, 소프트웨어 저장소, 연구 자료 모음 또는 장시간의 에이전트 세션을 처리하는 모델은 훨씬 더 많은 정보를 보존해야 한다.

에이전틱 시스템은 또 다른 수요를 더한다. 에이전트는 도구를 호출하고, 결과를 검토하고, 계획을 수정한 뒤, 이 과정을 반복할 수 있다. 각 단계는 세션을 연장하고 활성 메모리 사용량을 늘릴 수 있다.

전문가 혼합 모델은 관련된 과제를 만든다. 이 시스템은 여러 전문화된 파라미터 그룹을 포함하며, 각 토큰에 대해 선택된 그룹을 활성화한다. 연산 작업은 줄이지만, 더 넓은 파라미터 집합은 여전히 접근 가능한 저장 공간이 필요하다.

Majestic 공동창업자 Sha Rabii는 EE Times에 컴퓨팅 용량이 메모리 대역폭보다 빠르게 증가하고 있다고 말했다. 그는 대형 모델 추론의 대부분이 이미 메모리 이동에 의해 제한된다고 밝혔다. 상세한 메모리 풀링 설계는 가속기 환경당 100TB가 넘는 표준 저전력 DRAM을 목표로 한다.

저전력 더블 데이터 레이트 메모리, 즉 LPDDR은 서로 다른 대역폭 및 지연 시간 특성에서 HBM보다 훨씬 큰 용량을 제공한다. Majestic의 기술적 과제는 이 용량을 빠른 가속기 메모리 시스템처럼 작동하게 만드는 것이다.

회사는 기존 서버 버스를 통해 일반 메모리를 연결하는 방식만으로는 성공할 수 없다. 그렇게 하면 여러 AI 프로세서에 데이터를 공급하는 데 필요한 처리량 없이 용량만 확보하게 된다.

대신 Majestic는 물리 인터페이스, 통신 프로토콜, 흐름 제어, 신뢰성 메커니즘, 소프트웨어를 함께 개발하고 있다. 이 회사의 칩렛은 대역폭을 높고 지연을 예측 가능하게 유지하면서 다수의 메모리 장치에 요청을 분산해야 한다.

회사는 또한 데이터를 풀 전체에 스트라이핑할 계획이다. 스트라이핑은 정보를 여러 메모리 장치에 분산해, 많은 구성 요소가 요청을 병렬로 처리할 수 있게 한다.

이 시스템이 설명된 대로 작동한다면, 운영자는 더 큰 모델과 캐시를 하나의 일관된 도메인 안에 유지할 수 있다. 로컬 가속기 메모리, 원격 가속기, 호스트 메모리 사이의 전송도 줄일 수 있다.

이는 검색, 문서 분석, 코딩 에이전트 또는 장시간 대화를 운영하는 기업에 중요하다. 이런 애플리케이션은 프로세서의 이론적 연산 최고치보다 전력 단위당 완료 토큰 수를 더 중시하는 경우가 많다.

Majestic는 자사 설계가 서버당 훨씬 더 많은 동시 사용자를 지원할 수 있다고 말한다. 이 주장은 독립적인 검증을 받지 않았다. 그럼에도 구매자가 점점 더 주시하는 경제적 지표를 짚어낸다.

데이터센터에는 전력, 냉각, 바닥 공간, 네트워크 용량에 한계가 있다. 워크로드가 해당 GPU를 계속 가동할 수 있을 때에만 GPU를 추가하는 것이 도움이 된다. 유휴 연산 장치는 비례하는 출력을 만들지 못하면서도 계속 자원을 소비한다.

Blocks Files의 프레이밍은 관심을 초당 최고 연산 횟수에서 벗어나게 한다는 점에서 유용하다. 실제 경쟁은 전체 시스템이 전력 및 메모리 한계 안에서 얼마나 많은 유의미한 작업을 완료하는가에 관한 것이다.

Prometheus는 GPU 랙을 공유 메모리 풀로 대체한다

Prometheus는 메모리를 시스템의 중심으로 취급하고, 프로세서는 공통 데이터 자원을 소비하는 역할을 맡긴다.

Majestic는 Ofer Shacham, Sha Rabii, Masumi Reynders가 2023년에 창업했다. 세 사람은 이전에 Google과 Meta의 맞춤형 실리콘 조직에서 일했다.

이들의 경력은 프로세서, 시스템, 출시된 소비자 하드웨어를 아우른다. Majestic는 더 넓은 팀이 120개가 넘는 특허를 보유하고 수억 개의 맞춤형 칩 개발에 기여했다고 말한다.

회사는 1억 달러가 넘는 자금을 조달하며 공개적으로 등장했다. Bow Wave Capital은 Series A를 주도했고, Lux Capital은 이전 시드 라운드를 이끌었다. SBI, Upfront, Grove Ventures, Hetz Ventures, QP Ventures, Aidenlair Global, TAL Ventures도 참여했다.

투자 발표는 선도적인 GPU보다 프로세서당 1,000배 많은 메모리를 제공한다고 주장하는 시스템을 소개했다. 또한 하나의 서버가 여러 첨단 랙과 연관된 메모리 용량 및 대역폭을 통합할 수 있다고 주장했다.

이는 공개된 독립 결과가 아닌 회사의 전망치다. 어떤 하드웨어를 비교 대상으로 삼는지, 어떤 워크로드를 실행하는지, 벤치마크가 유의미한 출력을 어떻게 측정하는지에 따라 달라진다.

그럼에도 공개된 메커니즘은 구체적이다. Prometheus에는 두 가지 주요 맞춤형 실리콘 요소가 있다. 하나는 Ignite 프로세서이고, 다른 하나는 컴퓨팅을 풀링된 LPDDR과 연결하는 메모리 인터페이스 칩렛이다.

최대 12개의 Ignite 장치가 연속적인 메모리 공간에 접근할 수 있다. Majestic는 이 공간을 평면형이라고 설명하며, 소프트웨어가 눈에 띄게 다른 여러 메모리 계층을 관리할 필요가 없어야 한다고 말한다.

이 프로그래밍 모델은 멀티 GPU 배포의 중요한 약점을 겨냥한다. 현재 개발자는 로컬 HBM, 다른 GPU에 연결된 메모리, CPU 메모리, 스토리지를 모두 고려해야 한다. 각 계층은 용량, 대역폭, 지연 시간이 다르다.

프레임워크는 이러한 제약에 맞추기 위해 모델을 장치 간에 분할한다. 또한 가속기 간 통신을 조정한다. 선택한 분할 방식이 과도한 전송이나 불균형한 작업을 유발하면 성능이 저하될 수 있다.

Prometheus는 이러한 결정 일부를 없애는 것을 목표로 한다. 회사에 따르면, 모든 Ignite 프로세서는 공유 풀의 모든 위치에 유사한 지연 시간과 대역폭으로 도달할 수 있다.

이 설계는 기존 공유 메모리 CPU의 모든 동작을 재현하는 대신 느슨한 일관성을 사용한다. 일관성은 프로세서가 공통 데이터를 읽거나 변경할 때 어떻게 일관된 관점을 유지하는지를 정의한다.

Majestic은 외부인이 모든 트레이드오프를 평가할 수 있을 만큼 충분한 구현 세부 정보를 공개하지 않았다. 독자적인 흐름 제어와 원자적 연산 메커니즘이 경합과 동기화를 얼마나 잘 처리할지를 좌우할 것이다.

프로세서 아키텍처도 중요하다. 보도에 따르면 Majestic은 Arm 지식재산, RISC-V 요소, 자체 설계를 결합한다. 매트릭스 엔진은 AI 모델에서 흔한 고밀도 연산을 가속한다.

이 회사는 널리 쓰이는 머신러닝 프레임워크 PyTorch와 최적화된 가속기 커널을 위한 프로그래밍 언어 Triton을 지원할 계획이다. Nvidia의 우위는 실리콘을 훨씬 넘어선 영역에까지 미치기 때문에 소프트웨어 호환성은 필수적이다.

CUDA는 Nvidia 고객에게 성숙한 라이브러리, 컴파일러, 디버깅 도구, 성능 가이드, 그리고 숙련된 개발자를 제공한다. 새로운 하드웨어는 매력적인 사양을 제시할 수 있지만, 애플리케이션에 대대적인 재작성 작업이 필요하다면 여전히 어려움을 겪을 수 있다.

Rabii는 서버의 성공이 개발자가 얼마나 빨리 이를 활용할 수 있는지, 그리고 도구가 얼마나 신뢰성 있게 자리 잡는지에 크게 좌우된다고 인정했다. 이 발언은 Majestic이 해결해야 할 과제의 나머지 절반을 드러낸다.

하드웨어는 데이터를 효율적으로 이동시켜야 한다. 또한 소프트웨어는 기존 애플리케이션이 이점을 누릴 수 있을 만큼 그 이동을 충분히 보이지 않게 만들어야 한다.

Nvidia와 AMD는 HBM을 포기하지 않고 확장하고 있다

Majestic이 HBM 중심 확장 모델에 맞서 베팅하는 동안, 최대 가속기 공급업체들은 계속해서 그 모델에 대규모 투자를 하고 있다.

Nvidia의 랙 스케일 시스템은 NVLink 및 관련 네트워킹 기술을 통해 다수의 GPU를 연결한다. 이 접근 방식은 각 가속기 가까이에 초고속 메모리를 유지하면서 더 큰 컴퓨팅 도메인을 만든다.

AMD는 Instinct 가속기와 Helios 랙 설계로 유사한 방향을 따르고 있다. 최근 세부 사항이 공개된 MI455X는 HBM4를 사용하며 GPU당 432GB 메모리와 초당 23.3TB의 대역폭을 제공한다.

72개의 가속기 전반에서 MI455X architecture는 하나의 랙 안에 31.1TB의 HBM을 제공한다. AMD는 Helios가 이 메모리를 일관된 도메인으로 결합한다고 말한다.

이들 시스템은 Majestic이 지적한 동일한 문제를 인정한다. Nvidia와 AMD는 메모리 용량, 메모리 속도, 캐시 대역폭, 인터커넥트 성능, 랙 수준 조정 기능을 확대하고 있다.

견해 차이는 이 전략이 경제적으로 어디까지 확장될 수 있느냐에 관한 것이다. Majestic은 모든 고성능 컴퓨팅 장치에 고가의 HBM을 붙이는 방식이 용량과 연산 자원 간의 불리한 비율을 유지한다고 주장한다.

기존 공급업체들은 여러 방식으로 이 우려에 대응할 수 있다. HBM 밀도를 높이고, 패키징을 개선하며, 모델 데이터를 압축하고, 캐싱을 정교화하거나, 워크로드를 더 효율적으로 분할할 수 있다.

더 빠른 네트워킹을 사용해 원격 메모리의 비용을 낮출 수도 있다. 양자화 같은 소프트웨어 개선은 각 파라미터에 필요한 비트 수를 줄인다. 추측적 디코딩은 모델이 여러 제안 토큰을 함께 검증하도록 해 출력량을 높일 수 있다.

이러한 방법은 GPU 아키텍처를 대체하지 않고도 부담을 줄인다. 또한 고객이 이미 운영하는 성숙한 환경 안에서 작동한다.

Majestic의 가장 큰 기회는 용량이 지배적인 워크로드에 있다. 매우 큰 희소 모델, 그래프 신경망, 장시간 실행 에이전트, 극단적으로 긴 컨텍스트 윈도우는 연산량보다 더 많은 메모리를 요구할 수 있다.

반대로 고밀도 행렬 연산을 완전히 활용하면서 로컬 HBM 안에 무리 없이 들어가는 작업에서는 더 약한 위치에 있다. 기존 GPU는 이런 워크로드에 여전히 적합하다.

학습은 더 어려운 경쟁 구도를 만든다. 학습은 대규모 행렬 연산을 반복 수행하고 여러 장치에 걸쳐 업데이트를 동기화한다. 막대한 메모리를 사용할 수 있지만, 동시에 가능한 최고 수준의 연산 및 인터커넥트 성능으로부터도 이점을 얻는다.

Majestic은 Prometheus가 학습을 지원할 수 있다고 말한다. 그러나 초기 초점은 여전히 추론과 에이전트 워크로드에 맞춰져 있다. 이 집중 전략은 회사에 더 좁고 검증하기 쉬운 목표를 제공한다.

Qualcomm은 또 다른 메모리 중심 경로를 추구하고 있다. 이 회사의 near-memory approach는 기존 HBM 패키징에 의존하는 대신 DRAM 스택 아래에 가속기 로직을 배치한다.

Qualcomm은 HBM 대비 와트당 대역폭이 6배 더 높고 온칩 SRAM 용량의 200배 이상이라고 주장한다. 다만 아키텍처의 절대 대역폭은 공개하지 않아 중요한 비교는 여전히 미해결 상태다.

여러 접근 방식이 존재한다는 사실은 Majestic의 진단을 강화하지만, 반드시 그 제품 주장을 뒷받침하는 것은 아니다. 주요 칩 설계업체들은 분명 데이터 이동을 핵심 제약 요인으로 보고 있다.

따라서 시장은 메모리 장벽을 인식하는 기업과 이를 무시하는 기업 사이에서 선택하는 것이 아니다. 그 장벽을 극복하는 서로 다른 방법들 가운데 선택하고 있다.

blocks files의 기사는 Majestic의 가장 공격적인 입장을 포착한다. GPU-HBM 결합은 막다른 길에 이르렀다는 것이다. Nvidia, AMD 및 이들의 메모리 공급업체들은 그 반대를 입증하기 위해 막대한 자금을 투입하고 있다.

검증되지 않은 주장은 아키텍처만큼 중요하다

Prometheus는 여전히 개발 단계 시스템이므로, 핵심 용량 수치만으로는 애플리케이션 성능, 효율성 또는 상업적 신뢰성을 아직 입증할 수 없다.

Majestic의 프로세서와 메모리 인터페이스 칩렛은 2026년 중 테이프아웃이 예상된다. 테이프아웃은 제조 시작 전 칩 설계가 완료되는 시점을 뜻한다. 이는 곧바로 작동하는 양산 실리콘을 사용할 수 있다는 의미는 아니다.

회사는 2027년부터 서버가 주요 고객에게 공급되기 시작할 것으로 예상한다. 다른 보도는 더 광범위한 도입 시점을 그해 중반 무렵으로 본다.

이 일정은 현재 아키텍처와 배포 가능한 제품 사이에 여러 단계를 남긴다. 제조, 패키징, 보드 검증, 펌웨어, 컴파일러 개발, 열 테스트, 시스템 통합은 각각 문제를 드러낼 수 있다.

메모리 인터페이스가 가장 큰 기술적 의문점이다. LPDDR은 높은 용량과 유리한 전력 특성을 제공하지만, 개별 장치는 HBM의 대역폭에 미치지 못한다.

Majestic은 혼잡을 만들지 않으면서 많은 메모리 채널을 결합해야 한다. MAC 칩렛, 구리 링크, 프로토콜, 스트라이핑 시스템은 처리량과 예측 가능한 접근 시간을 모두 제공해야 한다.

대규모 메모리 풀은 장애 관리 문제도 만든다. 구성 요소가 많을수록 가능한 장애도 늘어난다. 양산 시스템은 오류를 감지하고, 장애를 격리하며, 모델 상태를 손상시키지 않고 계속 작동해야 한다.

Prometheus는 소프트웨어에 단순한 메모리 모델을 제공하면서도 이를 달성해야 한다. 편의성은 경합 상황에서 예측할 수 없는 지연이나 성능 붕괴를 초래하는 동작을 가릴 수 없다.

벤치마크 정의도 또 다른 우려를 낳는다. Majestic은 일부 시나리오에서 50배 이상의 성능과 메가와트당 10~50배 더 많은 토큰을 주장해 왔다.

이 수치들은 신중한 해석이 필요하다. 모델 아키텍처, 정밀도, 배치 크기, 컨텍스트 길이, 출력 길이, 지연시간 목표, 동시 사용자 수는 추론 결과를 크게 바꿀 수 있다.

대규모 배치에 최적화된 시스템은 많은 토큰을 생성할 수 있지만, 대화형 서비스에는 지나치게 느리게 응답할 수 있다. 뛰어난 용량을 갖춘 시스템도 더 작고 연산 집약적인 모델에서는 성능이 떨어질 수 있다.

비교 결과는 선택한 Nvidia 또는 AMD 기준선에도 좌우된다. 단일 GPU, 구형 랙, 최신 랙 스케일 시스템은 매우 다른 비율을 만들어 낸다.

독립 연구소는 양산 Prometheus 하드웨어를 사용한 애플리케이션 벤치마크를 아직 공개하지 않았다. Majestic은 완전한 지연시간, 대역폭, 전력 또는 소프트웨어 호환성 결과를 공개하지 않았다.

보도된 고객 주문도 이 검증 공백을 해소하지 못한다. 초기 약정은 강한 수요를 시사할 수 있지만, 고객은 신흥 하드웨어 구매에 기술적 마일스톤과 납품 조건을 붙이는 경우가 많다.

소프트웨어 채택도 또 다른 위험이다. PyTorch와 Triton 지원은 필요한 출발점이다. 그렇다고 CUDA 라이브러리의 범위나 성숙도를 자동으로 재현하는 것은 아니다.

운영자는 최적화된 커널, 분산 실행 도구, 관측성, 보안 제어, 배포 자동화, 안정적인 업데이트를 필요로 한다. 또한 선별된 시연이 아닌 실제 모델 전반에서 예측 가능한 동작을 필요로 한다.

5월 EE Times 프로필에 따르면 Majestic은 California와 Israel에 나뉜 약 40명의 직원을 두고 있다. 칩, 서버, 메모리, 컴파일러, 양산 작업을 동시에 수행하기에는 소규모 팀이다.

창업자들은 관련 경험을 갖추고 있으며, 자금 조달은 프로젝트 개발에 여유를 제공한다. 그러나 Nvidia와 AMD는 여전히 훨씬 더 큰 엔지니어링 조직, 공급업체 관계, 구축된 고객 기반을 보유하고 있다.

회의적인 결론은 간단하다. Majestic은 실제 제약을 식별하고 일관된 메커니즘을 제안했다. 하지만 Prometheus가 내부 예측 밖에서도 주장한 비율을 제공할 수 있다는 점은 아직 보여주지 못했다.

이 구분은 구매자가 blocks files의 보도를 읽는 방식에 영향을 줘야 한다. 아키텍처는 주목할 가치가 있지만, 주목이 곧 검증은 아니다.

Majestic의 실현 가능성을 보여줄 세 가지 신호

다음 단계는 작동하는 실리콘, 재현 가능한 애플리케이션 벤치마크, 그리고 기존 AI 소프트웨어가 대대적인 재구성 없이 이전될 수 있다는 증거에 달려 있다.

첫 번째 신호는 성공적인 실리콘 검증이다. Majestic은 Ignite와 메모리 인터페이스 칩렛 모두가 2026년에 테이프아웃될 것이라고 밝혔다.

테이프아웃 완료는 일정을 유지하게 해 줄 것이다. 예상한 클록, 전력, 링크 목표를 달성하는 작동 샘플은 훨씬 더 강력한 증거를 제공할 것이다.

어떤 지연이든 2027년 고객 출하 전망을 약화시킬 것이다. 메모리 패브릭이 회사의 핵심 차별화 요소이므로 인터페이스 문제는 특히 중요하다.

두 번째 신호는 전체 워크로드 구성을 공개하는 벤치마크다. 유용한 결과는 모델, 수치 정밀도, 배치 크기, 입력 길이, 출력 길이, 지연시간 목표, 시스템 전력을 명시해야 한다.

테스트는 단일 가속기나 구식 플랫폼이 아니라 최신 Nvidia 및 AMD 랙과 Prometheus를 비교해야 한다. 또한 첫 토큰까지 걸리는 시간과 이후 토큰 생성 시간을 분리해야 한다.

긴 컨텍스트 추론은 특히 많은 것을 드러내는 테스트가 될 것이다. 모델과 그 캐시가 기존 GPU 메모리의 실질적인 용량을 넘을 때 Prometheus는 우위를 보여야 한다.

더 작고 연산 집약적인 모델은 반대편 검증을 제공한다. Prometheus가 그 환경에서도 경쟁력 있는 결과를 유지한다면 시장은 특수한 메모리 집약적 배포를 넘어 확장될 수 있다.

세 번째 신호는 소프트웨어 이전이다. Majestic은 실제 PyTorch 모델이 제한적인 코드 변경만으로 Prometheus로 옮겨질 수 있음을 보여줘야 한다.

시연에는 컴파일, 최적화된 커널, 모니터링, 장애 복구가 포함돼야 한다. 또한 CUDA 의존 구성 요소 중 어떤 부분을 대체해야 하는지도 밝혀야 한다.

주요 고객 배포는 일반적인 호환성 설명보다 더 중요할 것이다. 신뢰할 수 있는 고객은 워크로드, 운영 목표, 메모리 우선 시스템을 선택한 이유를 설명해야 한다.

이 신호들은 Majestic의 핵심 판단을 강화하거나 약화시킬 것이다. 성공적인 실리콘, 투명한 벤치마크, 관리 가능한 이전 과정은 메모리 풀링이 GPU 랙에 도전할 수 있음을 보여줄 것이다.

낮은 대역폭, 제한적인 벤치마크 조건 또는 대규모 소프트웨어 재작성은 기존 공급업체의 전략을 뒷받침할 것이다. 구매자들은 성숙한 도구와 검증된 성능을 얻는 대가로 제한된 HBM 용량을 계속 받아들일 것이다.

가장 중요한 질문은 AI에 더 많은 메모리가 필요한지 여부가 아니다. 모든 주요 가속기 로드맵은 이미 더 큰 메모리 시스템으로 그 질문에 답하고 있다.

문제는 메모리가 각 고급 프로세서에 계속 결합되어 있어야 하는지, 아니면 독립적으로 확장 가능한 시스템 리소스가 되어야 하는지다. Majestic은 전체 아키텍처를 후자의 답에 걸었다.

개발자와 인프라 구매자에게 실질적인 다음 단계는 어느 쪽의 주장도 받아들이기 전에 워크로드 트레이스를 검토하는 것이다. 실제 수요 환경에서 가속기 활용률, 캐시 증가, 데이터 전송, 지연 시간, 전력을 측정해야 한다. 그런 다음 다음 blocks files 업데이트가 또 다른 용량 주장 대신 실제 운영 측정치를 제시하는지 지켜봐야 한다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page