top of page

Positron AI 자금 조달, Nvidia에 대한 메모리 우선 도전을 뒷받침

7일 전
12분 분량

Positron AI는 9월 10일 8억 7,500만 달러를 조달하며, Nvidia 중심 시스템이 AI 추론을 처리하는 방식에 도전할 새로운 자본을 확보했다. 자금 조달 발표에 따르면 이번 투자로 Positron의 기업가치는 50억 달러로 평가됐다. 그러나 이 가치평가의 기반인 Asimov 프로세서는 아직 생산 단계에 진입하지 않았다.

이 간극이 이 이야기의 핵심이다. Positron은 단순히 컴퓨팅 코어 구성만 달리한 또 하나의 가속기를 제시하는 것이 아니다. 이 회사는 생성형 AI 추론이 더 많은 연산 능력을 겨루는 문제가 아니라, 메모리 이동의 문제가 됐다고 주장한다.

회사는 일반적으로 모바일 기기와 연관되는 저전력 메모리 기술인 LPDDR5X를 중심으로 Asimov를 설계했다. 반면 Nvidia의 주요 데이터센터 가속기는 빠른 데이터 접근을 위해 프로세서 가까이에 배치한 고대역폭 메모리(HBM)를 사용한다.

Positron은 이러한 메모리 우선 아키텍처가 대형 모델에 더 많은 실사용 가능 용량과 더 나은 에너지 경제성을 제공할 것이라고 말한다. 또한 이 설계가 일부 HBM 공급 및 패키징 제약을 피할 수 있다고 주장한다.

이러한 약속은 생산 실리콘에서 아직 검증되지 않았다. 완성된 설계를 제조용으로 보내는 과정인 Asimov의 테이프아웃은 2026년 말에 예정돼 있다. 생산 목표 시점은 2027년 하반기다.

따라서 실제 경쟁은 메모리 우선 AI 칩과 HBM 기반으로 구축된 기존 GPU 시스템 간의 대결이다. Positron은 그 경쟁에 뛰어들 자본을 확보했지만, 결론을 내릴 수 있는 생산 수준의 증거는 아직 제시하지 못했다.

Positron AI 자금 조달, 아키텍처 가설을 제조 베팅으로 전환하다

이번 라운드는 Asimov를 기술 설계에서 제조된 실리콘과 상용 시스템으로 옮기는 구체적인 전환을 지원한다.

이번 자금 조달은 두 단계로 이뤄졌다. Positron은 투자 전 기업가치 35억 달러 기준으로 3억 7,500만 달러 규모의 Series C를 유치했다고 밝혔다. 이어 최대 5억 달러 규모의 Series C-1이 진행되면서 발표된 총액은 8억 7,500만 달러에 달했다.

NEA, Atreides Management, Valor Equity Partners, Andra Capital, SemiAnalysis Capital, Jim Clark이 이번 라운드의 주요 투자자에 포함됐다. Qatar Investment Authority, Cisco Investments, Naver Ventures, Hudson River Trading도 참여했다.

회사의 이사회에는 여러 투자자를 대표하는 인사도 새로 합류했다. 이러한 변화는 자금 조달을 다음 제조 및 상용화 단계와 직접 연결한다.

Positron은 이 자금이 Asimov의 테이프아웃과 계획 중인 추론 서버 Titan의 생산 확대를 지원할 것이라고 밝혔다. 또한 회사 하드웨어 포트폴리오 전반의 제조 역량도 확장할 계획이다.

이 회사는 앞서 2026년 2월, 10억 달러를 넘는 기업가치로 2억 3,000만 달러를 조달했다. Reuters는 PitchBook이 당시 기업가치를 약 10억 6,000만 달러로 산정했다고 보도했다. 이에 따라 최신 라운드는 7개월 만에 Positron의 기업가치를 여러 배 끌어올린 셈이다.

이러한 움직임은 투자자들이 추론 인프라의 잠재적 가치를 얼마나 높게 평가하는지를 보여준다. Asimov가 광고한 성능을 낸다는 점을 입증하는 것은 아니다.

Positron은 이미 Atlas라는 1세대 시스템을 보유하고 있다. 회사는 Oracle Cloud Infrastructure에 50개가 넘는 Atlas 랙을 배포 중이라고 말한다. Parasail은 이 용량을 추론 서비스에 사용하고 있으며, Jump Trading과 i3d.net도 프로덕션 고객으로 언급된다.

Atlas는 Asimov가 출시되기 전에 Positron에 운영 경험을 제공한다는 점에서 중요하다. 그러나 Atlas가 새로운 맞춤형 프로세서, 메모리 서브시스템, 인터커넥트, 컴파일러, 서버 플랫폼에 수반되는 실행 위험을 제거하는 것은 아니다.

Asimov는 훨씬 더 큰 기술적 투자를 의미한다. Positron은 첨단 제조 공정을 사용해 이 칩을 만들고, 이를 4칩 또는 8칩 Titan 서버에 통합할 계획이다.

성공적인 테이프아웃은 한 단계의 완료에 불과하다. 이후 실리콘은 실제 워크로드에서 주파수, 전력, 수율, 메모리, 네트워킹, 소프트웨어 목표를 충족해야 한다.

Positron은 상업적 규모로 시스템을 공급할 수 있을 만큼 충분한 부품과 제조 역량도 확보해야 한다. 첨단 칩은 아키텍처 아이디어가 타당해 보여도 지연에 직면할 수 있다.

따라서 투자자들은 연결된 두 가지 가설에 자금을 대고 있다. 첫째, 추론 수요가 새로운 하드웨어 범주를 정당화할 것이라는 점이다. 둘째, 기존 플랫폼이 다시 발전하기 전에 Positron이 메모리 가설을 신뢰할 수 있는 장비로 전환할 수 있다는 점이다.

더 어려운 것은 두 번째 가설이다. Positron이 설계에서 제조로 이동하는 동안 Nvidia는 계속해서 GPU 로드맵을 발전시킬 것이다.

이번 라운드의 규모는 Positron이 엔지니어링 차질을 흡수할 여지를 더 크게 제공한다. 하지만 반도체 개발을 예측 가능하게 만들 수는 없다.

메모리가 추론 병목이 된 이유

Positron의 핵심 주장은 많은 생성형 AI 워크로드가 모델 데이터를 이동하는 데 너무 많은 시간을 쓰고, 이용 가능한 컴퓨팅 자원을 충분히 활용하지 못한다는 것이다.

AI 추론은 이미 학습된 모델을 실행해 답변, 이미지, 예측 또는 행동을 생성하는 과정이다. 이는 방대한 데이터셋과 반복 계산을 통해 모델을 조정하는 학습과 다르다.

대규모 언어 모델 추론에는 일반적으로 두 단계가 있다. 첫 단계는 사용자의 입력을 처리하고, 두 번째 단계는 출력 토큰을 하나씩 생성한다.

이 토큰 생성 단계는 메모리 대역폭에 크게 의존하는 경우가 많다. 가속기는 모델이 학습한 내용을 담는 수치 값인 모델 가중치를 반복적으로 가져온다.

칩이 상당한 연산 능력을 갖추고 있어도 이러한 값이 충분히 빨리 도착하지 않으면 일부는 유휴 상태로 남을 수 있다. 이론적 컴퓨팅 성능을 늘린다고 해서 데이터 이동 문제가 자동으로 해결되지는 않는다.

더 긴 프롬프트는 또 다른 압박 요인이다. 추론 시스템은 이전 토큰의 중간 어텐션 데이터를 저장하는 키-값 캐시, 흔히 KV 캐시라고 부르는 구조를 유지한다.

이 캐시는 대화, 문서, 에이전트 이력이 길어질수록 커진다. 동시에 많은 사용자를 처리할 때 상당한 메모리를 소비할 수 있다.

Positron은 용량과 실사용 가능한 대역폭을 모두 고려해 Asimov 아키텍처를 설계했다. 회사는 칩당 288기가바이트에서 2.3테라바이트에 이르는 LPDDR5X 메모리 구성을 제시한다.

회사는 초당 2.76테라바이트의 실현 가능한 메모리 대역폭과 약 400와트의 열 설계 전력을 주장한다. 열 설계 전력은 냉각 시스템이 처리할 준비가 되어야 하는 열 수준을 뜻한다.

Positron은 또한 Asimov가 트랜스포머 워크로드에서 가용 메모리 대역폭의 90% 이상을 활용할 수 있다고 주장한다. 이는 동일한 모델을 실행하는 GPU의 30% 미만과 비교되는 수치다.

이 비율은 독립적인 프로덕션 벤치마크가 아니라 Positron이 제시한 것이다. 외부 테스터가 제조된 칩을 평가할 수 있기 전까지는 설계 주장으로 읽어야 한다.

LPDDR5X 선택은 이 접근 방식의 핵심이다. LPDDR은 저전력 더블 데이터 레이트 메모리를 뜻하며, 데이터를 효율적으로 전송하면서 에너지 사용을 줄이도록 설계된 기술이다.

HBM은 가속기 가까이에 배치한 수직 적층 메모리를 통해 매우 높은 피크 대역폭을 제공한다. 이는 선도적 AI GPU에 필수적인 요소가 됐지만, 특수 제조와 첨단 패키징이 필요하다.

LPDDR5X는 하나의 일반적인 메모리 패키지에서 동일한 수준의 피크 대역폭을 제공하지 않는다. Positron의 해법은 많은 메모리 채널을 사용하고, 실현할 것으로 예상하는 대역폭에 맞춰 주변 컴퓨팅 자원을 균형 있게 구성하는 것이다.

이는 단순히 더 저렴한 메모리로 대체하는 문제가 아니다. 프로세서, 메모리 컨트롤러, 물리적 레이아웃, 인터커넥트, 소프트웨어가 하나의 아키텍처로 작동해야 한다.

Asimov에는 Positron이 헤미스피어라고 부르는 두 개의 운영 영역이 있다. 각각 자체 메모리 서브시스템을 갖추며, 별도 작업을 처리하거나 더 큰 워크로드에 함께 참여할 수 있다.

이 칩에는 규칙적인 파이프라인을 통해 계산을 이동시키는 처리 요소 격자인 구성 가능한 시스토릭 어레이도 포함된다. Positron은 이 어레이가 서로 다른 트랜스포머 연산에 맞춰 방향을 바꿀 수 있다고 말한다.

전용 하드웨어는 정규화, softmax, 위치 인코딩을 비롯한 기능을 처리한다. 이러한 연산은 트랜스포머 추론 전반에서 수행되며, 범용 실행 경로로 반복 전송될 경우 오버헤드를 유발할 수 있다.

Arm 기반 프로세서 코어는 예측하기 어려운 연산을 처리할 경로를 제공한다. 이 조합은 프로세서를 완전히 경직시키지 않으면서 일반적인 작업을 특화 하드웨어에서 처리하는 것을 목표로 한다.

이 메커니즘은 주목할 만큼 충분히 신뢰할 수 있다. 데이터 이동은 시간과 에너지를 소비하며, 모델 크기와 컨텍스트 요구사항은 계속 증가하고 있다.

그럼에도 아키텍처 효율은 워크로드 동작에 따라 달라진다. 메모리 제약형 토큰 생성에 최적화된 시스템은 연산 집약적인 입력 처리나 다른 모델 유형에서는 이점이 더 작을 수 있다.

Positron은 서로 다른 가속기가 서로 다른 추론 단계에 특화될 수 있음을 인정한다. 이 회사의 주장이 GPU가 보편적으로 쓸모없어져야 성립하는 것은 아니다.

구매자가 또 다른 하드웨어 및 소프트웨어 플랫폼을 받아들일 만큼 메모리 우선 AI 칩이 충분한 고가치 워크로드에서 승리해야 한다는 뜻이다.

Asimov와 Titan, GPU 메모리에 부담을 주는 모델을 겨냥하다

Positron은 모든 추론 워크로드가 아니라 대형 모델, 확장된 컨텍스트, 높은 사용자 동시성을 겨냥하고 있다.

계획 중인 Titan 서버는 4개 또는 8개의 Asimov 프로세서를 결합한다. Positron의 Titan 사양은 최대 18.4테라바이트의 가속기 메모리와 최대 6테라바이트의 호스트 메모리를 제시한다.

회사는 하나의 서버가 최대 32조 개의 파라미터를 포함한 모델을 지원할 수 있다고 말한다. 또한 1,000만 토큰을 넘는 컨텍스트 윈도우도 내세운다.

이는 용량에 관한 주장이지, 이러한 한계의 모든 모델이 허용 가능한 속도나 정확도를 제공한다는 증거는 아니다. 파라미터 수만으로는 시스템의 실질적 성능을 설명할 수 없다.

모델 아키텍처, 수치 정밀도, 배치 처리, 캐시 요구사항, 네트워크 트래픽, 소프트웨어 최적화가 모두 결과에 영향을 미친다. 희소한 mixture-of-experts 모델은 전체 파라미터 수가 같은 밀집형 모델과도 다르게 작동한다.

그럼에도 목표 사용 사례는 분명하다. 긴 문서 처리, 지속형 AI 에이전트, 멀티모달 시스템, 영상 생성은 가속기 메모리에 큰 부담을 줄 수 있다.

AI 코딩 에이전트는 리포지토리 파일, 도구 결과, 이전 의사결정, 확장된 상호작용 이력을 필요로 할 수 있다. 기업용 리서치 어시스턴트는 긴 세션 전반에서 근거를 유지하면서 수천 개의 문서를 처리할 수 있다.

영상 모델은 개별 텍스트 토큰이 아니라 시간적 시퀀스 전반에서 작동해야 한다. 이는 추론 시스템이 유지하고 이동해야 하는 중간 데이터의 양을 늘릴 수 있다.

대용량 메모리는 모델을 다수의 장치에 분할해야 할 필요성을 줄일 수 있다. 분할 수가 줄어들면 통신이 단순해지고 일부 네트워크 오버헤드를 피할 수 있다.

Positron은 각 Asimov 프로세서가 초당 16테라비트의 직접 칩 간 대역폭을 제공할 것이라고 말한다. 제안된 클러스터는 여러 네트워크 레이아웃을 통해 최대 16,384개의 칩을 연결할 수 있다.

서버 수준에서 회사는 PCI Express 6 및 Compute Express Link 지원을 제시한다. Compute Express Link, 즉 CXL은 프로세서와 가속기가 공유 프로토콜을 통해 연결된 메모리에 접근할 수 있도록 한다.

이러한 인터페이스가 중요한 이유는 추론이 가속기 내부에서만 이뤄지지 않기 때문이다. 호스트는 토큰화, 스케줄링, 샘플링, 요청, 캐시 관리와 같은 작업을 처리한다.

대규모 메모리 풀은 하나의 거대한 모델을 탑재하는 것 이상의 운영상 가치를 제공한다. 공급업체는 여러 모델을 로드하고, 더 많은 사용자를 지원하거나, 스토리지에서 데이터를 자주 옮기지 않고도 더 큰 캐시를 유지할 수 있다.

하지만 용량은 소프트웨어가 이를 효율적으로 할당할 수 있을 때에만 가치가 생긴다. 컴파일러, 모델 런타임, 스케줄링 시스템, 관측성 도구, 장애 복구 체계가 운영자가 하드웨어를 안정적으로 활용할 수 있는지를 결정한다.

Nvidia의 강점은 칩 사양을 넘어선다. CUDA, 최적화된 라이브러리, 검증된 배포 도구, 대규모 개발자 커뮤니티는 새로운 모델을 실행하는 데 필요한 작업량을 줄인다.

Positron은 호환 가능한 프레임워크와 신뢰할 수 있는 도구를 제공해야 한다. 구매자는 와트당 토큰 수뿐 아니라 워크로드를 배포하고 유지하는 데 걸리는 시간도 비교할 것이다.

이 스타트업은 자사 소프트웨어가 널리 사용되는 모델 인터페이스를 지원할 것이라고 주장한다. 실질적인 시험대는 외부 엔지니어들이 Positron 팀의 직접적인 도움 없이 대표적인 애플리케이션을 포팅할 때가 될 것이다.

Titan은 공랭식과 수랭식 설치 환경 모두를 위해 설계됐다. 이러한 유연성은 신규 냉각 인프라에 대한 접근이 제한적인 데이터센터 운영자의 현실적인 제약을 해소한다.

그러나 명목상 400와트 칩이 서버나 랙 전체를 의미하지는 않는다. 메모리, 호스트 프로세서, 네트워킹, 전력 변환, 팬, 냉각 장비 모두가 시설의 전력 소비에 기여한다.

따라서 가장 유의미한 비교는 완성된 시스템 단위에서 이뤄질 것이다. 구매자에게는 동일한 워크로드와 서비스 목표 아래 측정된 처리량, 지연 시간, 활용률, 에너지, 운영 비용이 필요하다.

좁은 범위의 가속기 벤치마크만으로는 이러한 질문에 답할 수 없다. 이론적인 메모리 대역폭 수치도 마찬가지다.

진정한 경쟁자는 Nvidia의 HBM 중심 플랫폼이다

Positron은 단순히 하나의 벤치마크에서 비효율적인 일부 영역을 드러내는 데 그치지 않고, 완전한 GPU 플랫폼을 능가해야 한다.

Nvidia의 데이터센터 GPU는 광범위한 연산 능력에 HBM과 고속 인터커넥트를 결합한다. 이 회사는 프로세서, 네트워킹, 소프트웨어, 냉각을 통합한 랙 규모 시스템도 판매한다.

이러한 통합은 고객에게 하나의 책임 주체가 있는 플랫폼을 제공한다. 또한 인프라 팀은 여러 워크로드에서 익숙한 프로그래밍 도구를 재사용할 수 있다.

Positron은 목표 시장 부문에서 정반대의 아키텍처적 입장을 취한다. 생성형 추론의 메모리 요구 사항에서 출발해, 해당 메모리를 생산적으로 활용할 수 있을 만큼의 연산 능력을 더한다.

이 차이는 단순한 스타트업 대 기존 강자 구도보다 더 선명한 비교를 만든다. 즉, 목적 특화 추론 하드웨어가 GPU의 유연성과 소프트웨어 성숙도를 극복할 수 있는지를 묻는다.

Nvidia 시스템은 학습, 입력 처리, 토큰 생성, 과학 워크로드 및 기타 가속 애플리케이션을 실행할 수 있다. 이러한 유연성은 수요 변화에 따라 운영자가 고가의 인프라를 계속 가동하는 데 도움이 된다.

Asimov는 더 전문화되어 있다. 전문화는 효율성을 높일 수 있지만, 고객 우선순위가 바뀔 때 활용 가능한 워크로드를 제한할 수도 있다.

HBM 문제는 또 다른 차원을 더한다. HBM은 높은 대역폭을 제공하지만, 공급은 제한된 메모리 생산업체 그룹과 복잡한 패키징 역량에 의존한다.

Positron은 LPDDR5X가 더 낮은 전력 요구 사항과 함께 더 폭넓은 메모리 공급망에 접근할 수 있게 해준다고 주장한다. Qatar Investment Authority는 자사의 투자 발표문에서 공급이 제약된 HBM과 첨단 패키징에 대한 의존도 감소를 언급했다.

이 공급망 주장은 전략적으로 중요하다. 희소한 부품을 피하는 가속기는 모든 성능 범주에서 승리하지 못하더라도 제조와 확장이 더 쉬울 수 있다.

그러나 대규모 배포 이후에는 어떤 대체 메모리에 대한 수요도 변할 수 있다. Positron은 적절한 LPDDR5X 물량을 확보하고, 다수 채널에 걸쳐 신호 무결성을 유지하며, 전체 설계를 검증해야 한다.

HBM 기술 역시 제자리에 머물지 않을 것이다. 메모리 공급업체들은 용량, 대역폭, 에너지 효율을 계속 개선하고 있으며, Nvidia는 아키텍처와 시스템 구성을 조정할 수 있다.

Nvidia는 규모를 통한 영향력도 보유하고 있다. 공급업체와의 관계, 생산 약정, 고객 도달 범위는 더 작은 기업이 직접 관리해야 하는 위험을 낮출 수 있다.

다른 추론 전문업체들은 또 다른 방향에서 압박을 가한다. Groq은 결정론적 실행과 저지연 토큰 생성을 강조한다. Cerebras는 대규모 온칩 메모리와 광범위한 내부 대역폭을 갖춘 웨이퍼 규모 프로세서를 사용한다.

SambaNova는 자체 데이터플로 아키텍처를 기반으로 한 통합 시스템을 제공한다. 클라우드 공급업체들도 Google의 tensor processing units와 Amazon의 Inferentia 칩을 포함한 자체 가속기를 배포하고 있다.

이러한 대안은 범용 GPU 경제성에 대한 불만이 Positron만의 문제는 아니라는 점을 보여준다. 동시에 고객이 여러 전문화된 선택지를 갖고 있기 때문에 시장 경쟁을 더욱 어렵게 만든다.

Positron의 창업자들은 관련 운영 경험을 보유하고 있다. CEO Mitesh Agrawal은 이전에 Lambda의 최고운영책임자를 지냈고, 공동 창업자 Thomas Sohmers는 Groq와 Lambda에서 근무했다.

이러한 배경은 칩 설계를 인프라 배포의 현실과 연결한다. 그렇다고 고객이 또 다른 독점 플랫폼을 채택할 것이라는 보장은 없다.

Positron AI의 투자 라운드는 회사에 첨단 반도체 프로그램에 기대되는 수준에 가까운 자원을 제공한다. 50억 달러의 기업가치는 निर्ण정적인 제품이 나오기 전부터 기대치를 높인다.

투자자들은 사실상 성공적인 제조, 경쟁력 있는 성능, 고객 수요, 생산 확장을 가격에 반영했다. 이 이정표 가운데 하나라도 놓치면 기업가치를 뒷받침하는 논리는 약화될 것이다.

Nvidia는 모든 벤치마크에서 Asimov를 이길 필요가 없다. 더 낮은 이전 위험과 더 폭넓은 워크로드 범위를 바탕으로 충분한 효율성을 제공하면 고객을 유지할 수 있다.

Positron의 과제는 더 까다롭다. 소프트웨어 변경, 조달 위험, 더 젊은 공급업체에 대한 의존을 정당화할 만큼 큰 이점을 제공해야 한다.

Positron의 성능 주장이 아직 입증하지 못한 것

가장 큰 불확실성은 메모리가 중요한지 여부가 아니라, Asimov의 시뮬레이션상 우위가 제조와 고객 배포 과정에서도 유지되는지다.

Positron이 공개한 Titan 비교 자료는 중요한 한계를 보여준다. 회사는 Asimov 성능이 물리적 실리콘이 존재하기 전에 칩 동작을 모델링하는 사이클 정확도 시뮬레이션에 기반한다고 말한다.

이러한 시뮬레이션은 반도체 개발 과정에서 일반적이다. 엔지니어들은 고비용 테이프아웃 전에 아키텍처를 시험하고, 성능을 추정하며, 설계 문제를 찾기 위해 이를 사용한다.

이는 제작된 칩에서 얻는 측정값과 동등하지 않다. 실제 장치는 클록 변동, 열, 전력 공급, 메모리 동작, 제조 결함, 예상치 못한 소프트웨어 병목 현상에 직면한다.

Positron은 시뮬레이션된 Asimov 결과를 SemiAnalysis InferenceX의 Nvidia GPU 데이터와 비교한다. 이 프레임워크는 세부적인 워크로드 모델링을 제공할 수 있지만, 해당 비교는 신중하게 해석할 필요가 있다.

SemiAnalysis Capital은 Positron의 자금 조달을 공동 주도했으며, 창업자 Dylan Patel은 회사 이사회에 합류했다. 이 관계가 데이터를 무효화하는 것은 아니지만, 독자는 이러한 연관성을 인지해야 한다.

독립적인 평가는 문서화된 모델, 정밀도, 프롬프트 길이, 출력 길이, 배치 정책, 지연 시간 요건을 사용해 비교를 재현해야 한다.

시스템이 대규모 배치를 처리할 때 초당 토큰 수는 인상적으로 보일 수 있다. 대화형 애플리케이션은 첫 토큰이 나오기까지의 지연과 일관된 사용자별 지연 시간을 우선시할 수 있다.

와트당 토큰 수 역시 시스템 경계를 숨길 수 있다. 가속기에 한정된 비교는 호스트, 메모리, 네트워킹, 냉각 장비를 제외할 수 있다.

달러당 토큰 수는 도입 비용, 활용률, 전기료, 금융 비용, 유지보수, 시스템 수명에 관한 가정을 요구한다. 동일한 하드웨어라도 가정이 다르면 결과가 달라질 수 있다.

모델 품질은 또 다른 변수다. 더 낮은 수치 정밀도는 속도를 높이고 메모리 요구량을 줄일 수 있지만, 애플리케이션은 출력이 여전히 허용 가능한지 확인해야 한다.

소프트웨어 성숙도는 별도의 위험이다. 새로운 가속기는 일부 모델에서 좋은 성능을 낼 수 있지만, 드문 연산, 빠른 아키텍처 변화, 맞춤형 엔터프라이즈 코드에서는 어려움을 겪을 수 있다.

Positron은 지원되지 않는 연산을 위한 우회 경로로 범용 Arm 코어를 포함한다. 이는 호환성을 높일 수 있지만, 빈번한 폴백은 예상 성능 우위를 낮출 수 있다.

신뢰성 역시 대규모 클러스터 전반에서 입증돼야 한다. Positron은 수천 개 칩에 이르는 구성을 제안하며, 이 규모에서는 부품 고장과 네트워크 동작이 일상적인 운영 문제가 된다.

고객은 체크포인팅, 상태 모니터링, 워크로드 격리, 보안 제어, 예측 가능한 복구를 기대할 것이다. 이러한 기능은 헤드라인 벤치마크 결과에 거의 나타나지 않는다.

배포 일정은 타이밍 위험을 만든다. Asimov는 2026년 말 테이프아웃 후 2027년 하반기에 생산될 것으로 예상된다.

첫 번째 테이프아웃이 항상 양산 준비가 된 실리콘을 만들어내는 것은 아니다. 심각한 문제가 발견되면 수정 설계와 또 다른 제조 주기가 필요할 수 있다.

그 사이 경쟁업체들은 새 하드웨어와 소프트웨어를 출시할 것이다. 한 GPU 세대와 비교했을 때 유리해 보이는 성능 목표도 제품 출시 시점에는 설득력이 떨어질 수 있다.

현재 Atlas 배포는 Positron에 실제 고객 피드백을 제공한다. 그럼에도 Asimov는 스택의 상당 부분을 바꾸기 때문에 Atlas 채택만으로 최종 성능을 검증할 수는 없다.

회사는 Atlas가 Oracle Cloud Infrastructure에서 50개 이상의 랙을 통해 하이퍼스케일러 규모로 운영되고 있다고 말한다. 활용률, 워크로드 구성, 서비스 수준, 경제성에 관한 외부 세부 정보는 여전히 제한적이다.

이러한 정보는 구매자가 물리적 배포와 지속적인 프로덕션 수요를 구분하는 데 도움이 될 것이다. 랙 수만으로는 시스템이 얼마나 많은 트래픽을 처리하는지 보여줄 수 없다.

이러한 불확실성 중 어느 것도 메모리 우선 접근법을 반증하지는 않는다. 이는 아직 부족한 증거가 무엇인지 정의한다.

Positron은 자사 아키텍처가 어떻게 작동해야 하는지 설명했다. 다음 단계에서는 회사의 모델과 선별된 배포 환경 밖에서 그것이 어떻게 작동하는지를 보여줘야 한다.

메모리 우선 베팅의 성패를 가를 세 가지 신호

테이프아웃 품질, 독립 벤치마크, 반복적인 고객 배포가 이번 라운드가 지속 가능한 Nvidia 대안에 자금을 댄 것인지 결정할 것이다.

첫 번째 신호는 Asimov의 테이프아웃과 초기 실리콘이다. Positron은 2026년 말 테이프아웃 후 2027년 하반기 생산을 목표로 하고 있다.

중요한 업데이트는 의례적인 설계 완료가 아닐 것이다. 구매자는 초기 칩이 부팅되고, 목표 모델을 실행하며, 발표된 주파수와 전력 범위에 근접하는지를 지켜봐야 한다.

성공적인 첫 실리콘 결과는 Positron의 실행 역량을 뒷받침할 것이다. 재설계나 일정 지연은 경쟁 플랫폼이 발전하기 전에 확보할 수 있는 시간을 줄일 것이다.

두 번째 신호는 독립적으로 재현 가능한 벤치마크다. 동일한 모델, 컨텍스트 길이, 배치 규칙, 지연 시간 목표 아래 완전한 Asimov 및 GPU 시스템을 비교해야 한다.

결과에는 첫 토큰까지의 시간, 생성 속도, 메모리 활용률, 전체 시스템 전력, 지속 처리량이 포함돼야 한다. 또한 수치 정밀도와 소프트웨어 버전도 공개해야 한다.

여러 워크로드 유형에 걸친 유리한 결과는 Asimov 추론 칩 논지를 뒷받침할 것이다. 신중하게 선택된 하나의 시나리오에서만 강한 결과가 나온다면 더 좁은 시장을 시사할 것이다.

세 번째 신호는 반복적인 프로덕션 수요다. 가장 유용한 증거는 실제 서비스 조건에서 Positron 하드웨어를 운영한 뒤 파일럿을 넘어 확장하는 추가 고객이 될 것이다.

구매자는 워크로드 세부 정보, 활용률, 서비스 신뢰성, 배포 확대를 살펴봐야 한다. 실명 고객은 최초 발표 이후에도 사용이 지속될 때 더 큰 의미를 가진다.

Oracle의 Atlas 설치는 Positron에 신뢰할 만한 출발점을 제공한다. 이 50랙 배포는 회사가 스케줄링, 냉각, 유지보수, 소프트웨어 통합에 관해 학습할 수 있는 환경도 마련한다.

가장 강력한 검증은 이 경험이 Titan 채택으로 이어지는 것이다. 기존 고객이 Asimov 시스템을 선택한다면 Positron이 운영 측면의 신뢰를 새로운 아키텍처에 대한 수요로 전환했음을 보여줄 수 있다.

경쟁사의 대응도 추가적인 맥락을 제공할 것이다. Nvidia는 새로운 GPU, 소프트웨어 업데이트, 저정밀 형식, 특화된 시스템 구성 등을 통해 추론 효율을 개선할 수 있다.

클라우드 제공업체 역시 고객을 자체 가속기로 유도할 수 있다. 다른 스타트업들은 서로 다른 기술적 절충안을 바탕으로 동일한 메모리 및 지연 시간 병목을 공략할 수 있다.

이러한 압력은 Positron에 경쟁 없는 활주로가 없다는 뜻이다. 기회의 창은 회사가 찾아낸 격차가 더 좁아지기 전에 제품을 제공할 수 있는지에 달려 있다.

개발자에게 실질적인 질문은 이식성이다. 프레임워크 지원, 모델 커버리지, 디버깅 도구, 배포 노력은 Asimov가 전문 팀을 넘어 접근 가능한지 보여줄 것이다.

인프라 구매자에게 결정적인 지표는 완전한 서비스 경제성이다. 하드웨어 효율은 수용 가능한 운영 비용으로 신뢰할 수 있는 용량을 제공할 때에만 의미가 있다.

AI 제품 팀에게 더 큰 메모리 용량은 더 긴 에이전트 이력, 더 큰 검색 컨텍스트, 그리고 더 까다로운 멀티모달 애플리케이션을 가능하게 할 수 있다. 이러한 이점은 여전히 그 용량을 효과적으로 활용하는 모델을 필요로 한다.

Positron AI의 8억 7,500만 달러 투자 라운드는 기술적 주장을 자금이 충분히 뒷받침된 제조 프로그램으로 바꿨다. 그러나 시뮬레이션을 실리콘으로, 전망을 고객 성과로 바꾸지는 못했다.

첫 번째 칩, 첫 번째 독립 측정치, 그리고 첫 번째 반복 주문을 지켜봐야 한다. 세 가지가 모두 일정대로 나온다면 메모리 우선 추론은 진지한 조달 옵션이 될 것이다. 하나라도 실패한다면 Nvidia의 통합 GPU 플랫폼은 여전히 대체하기 어려울 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page