MI355X가 비용 대비 성능에서 B300을 앞서며 Kimi K3가 Hacker News를 달군 이유
- Sophie Larsen

- 8월 3일
- 12분 분량
Wafer가 AMD MI355X GPU 8대로 Kimi K3를 초당 약 952개의 출력 토큰 속도로 서비스했다고 발표한 뒤, Kimi K3는 Hacker News에서 화제가 됐다. 이 시스템의 총 처리량은 Nvidia B300 GPU 8대 노드보다 낮았다. 그러나 Wafer의 임대 비용 가정에서는 AMD가 더 나은 비용 대비 성능을 기록했다.
이 차이는 Kimi K3가 유난히 까다로운 모델이기 때문에 중요하다. Moonshot AI의 오픈 웨이트 모델은 약 2조 8,000억 개의 파라미터를 포함하며, 토큰당 약 1,040억 개의 파라미터가 활성화된다. 서빙 시스템이 런타임 상태와 긴 프롬프트를 위한 메모리를 확보하기 전에도 체크포인트는 1.5TB 이상을 차지한다.
표준 B200 GPU 8대 노드에는 해당 구성의 배포를 여유 있게 담기 어렵다. 이에 Wafer는 MI355X 노드 1대, B300 노드 1대, B200 2노드 구성을 비교했다. 이 결과는 좁지만 상업적으로 중요한 질문을 통해 Nvidia의 우위에 도전한다. 어느 플랫폼이 가장 낮은 인프라 비용으로 충분한 Kimi K3 추론 성능을 제공하는가?
Hacker News의 주장은 절대적인 속도 우위가 아니라 경제성에 관한 것이다
Wafer는 MI355X가 B300보다 빨랐다고 보고하지 않았다. MI355X가 시간당 인프라 지출 단위당 더 높은 처리량을 냈다고 보고했다.
이 차이는 헤드라인에서 쉽게 사라진다. Wafer의 벤치마크 게시물에 따르면, GPU 8대의 MI355X 노드는 총 초당 952개의 출력 토큰에 도달했다. 같은 테스트에서 GPU 8대의 B300 구성은 초당 1,568개 토큰을 기록했다.
이는 Nvidia가 원시 처리량에서 상당한 우위를 가졌음을 의미한다. B300 노드는 단일 스트림에서 초당 172개 토큰을 제공했으며, MI355X의 118개보다 높았다. 한 노드에서 최대 출력을 내는 데만 집중하는 구매자라면, 이 결과에서는 여전히 B300을 선호할 것이다.
Wafer는 시간당 임대 비용 추정치를 적용한 뒤 다른 결론에 도달했다. 계산 결과 MI355X는 지출 단위당 총 처리량에서 앞섰다. 이 회사는 AMD 가속기를 전체 성능의 승자가 아니라 비용 대비 성능의 승자로 설명했다.
이 벤치마크는 1,024개의 입력 토큰을 포함한 프롬프트를 사용하고 400개의 출력 토큰을 요청했다. 이 워크로드는 장문 컨텍스트 스트레스 테스트가 되지 않으면서 일반적인 텍스트 생성 동작을 포착한다는 점에서 유용하다. 다만 모든 프로덕션 워크로드를 대표하지는 않는다.
B200 비교에는 또 다른 층위가 더해진다. Wafer 구성에서 Kimi K3는 2개 노드에 걸친 B200 GPU 16대를 필요로 했다. 이 배포는 총 초당 498개 토큰, 즉 노드당 약 249개를 생산했다.
GPU들이 네트워크를 통해 모델 실행을 조율해야 했기 때문에 노드 간 통신은 페널티를 부과했다. Wafer에 따르면 이 연결은 CPU 개입을 최소화한 채 시스템 간 데이터를 직접 전송하는 이더넷 기반 프로토콜인 RoCE v2를 사용했다.
따라서 불리한 B200 결과는 실리콘뿐 아니라 토폴로지도 반영한다. Wafer가 요구한 메모리 할당으로는 모델이 B200 GPU 8대 단일 노드에 들어가지 않았다. 이를 2개 노드로 분할하면서 디코드 경로에 통신이 추가됐다.
이 제약은 이 이야기의 핵심이다. Kimi K3는 소프트웨어 튜닝이 시작되기도 전에 메모리 용량을 아키텍처적 우위로 바꾼다. MI355X와 B300 모두 GPU당 288GB의 고대역폭 메모리를 제공해, GPU 8대 단일 노드 구성을 실현 가능하게 만든다.
hacker news에서의 논의는 이 결과가 Nvidia의 소프트웨어 해자를 약화시키는지에 집중됐다. 단일 공급업체의 벤치마크만으로 이보다 광범위한 질문에 답할 수는 없다. 다만 특정 모델에서는 메모리 용량과 임대 경제성이 기존 GPU 순위를 뒤집을 수 있음을 보여준다.
이는 구매자가 가속기 비교를 해석하는 방식도 바꾼다. 최고 연산 성능은 중요하지만, 하나의 입력일 뿐이다. 모델 크기, 양자화, 메모리 배치, 프레임워크 지원, 동시성, 지연 시간, 네트워킹, 활용률이 실제 비용을 결정할 수 있다.
Kimi K3에서 첫 번째 승리는 어색한 멀티 노드 분할 없이 모델을 담을 수 있는 플랫폼의 몫이다. AMD는 MI355X 노드 1대로 이 기준을 충족한다. Nvidia는 B300으로 충족하지만, B200은 이 특정 구성에서 매력이 떨어진다.
따라서 이 결과는 AMD가 Nvidia를 따라잡았다는 포괄적인 선언보다 더 제한적이면서도 유용하다. AMD의 설계 선택이 재정적으로 의미를 갖는 하나의 워크로드를 짚어낸다.
Kimi K3는 메모리 용량을 결정적 제약으로 만든다
Kimi K3는 가속기 메모리를 구매자가 부차적으로 취급할 수 있는 사양이 아니라 배포 요건으로 만든다.
Moonshot AI는 Kimi K3를 2조 8,000억 파라미터 규모의 전문가 혼합 모델로 설명한다. 전문가 혼합 모델은 각 토큰을 네트워크의 일부만 통과시키므로, 훨씬 큰 학습 파라미터 풀을 유지하면서 활성 연산량을 줄인다.
K3 기술 논문에 따르면 이 모델은 토큰당 약 1,040억 개의 파라미터를 활성화한다. 896개의 전문가 풀에서 16개의 라우팅 전문가를 선택한다. 이 희소성은 연산량을 제한하지만, 전체 전문가 웨이트를 저장할 필요까지 없애지는 않는다.
각 요청은 토큰을 서로 다른 전문가로 라우팅할 수 있다. 따라서 서빙 시스템은 더 넓은 체크포인트에 GPU 그룹 전반에서 접근할 수 있도록 유지해야 한다. 이 체크포인트가 Wafer의 비교를 규정하는 메모리 요구 사항을 만든다.
AMD의 자체 배포 가이드는 로더 인지형 체크포인트 크기를 약 1.56TB로 추정한다. 8방향 텐서 병렬화에서 각 MI355X는 약 191GiB의 모델 웨이트를 보유한다.
텐서 병렬화는 대규모 모델 연산을 여러 GPU에 분할한다. 각 가속기는 일부를 계산한 뒤 중간 결과를 다른 GPU와 교환한다. 일반적으로 8개 GPU를 하나의 서버에 유지하면 여러 머신에 걸치는 경우보다 통신 페널티를 줄일 수 있다.
AMD는 모델의 최대 컨텍스트에서 하나의 시퀀스에 필요한 알려진 런타임 상태가 GPU당 약 14.4GiB를 추가한다고 추정한다. 알려진 할당량의 합계는 약 205.4GiB에 달하며, 다른 오버헤드 전 각 MI355X에 약 82.6GiB가 남는다.
이 남은 메모리는 통신 버퍼, 임시 작업 공간, 할당기 단편화, 프레임워크 상태 및 기타 프로덕션 비용을 수용해야 한다. 또한 GPU가 더 유용한 작업을 함께 수행하도록 요청을 묶는 배칭도 지원할 수 있다.
Moonshot은 Kimi K3에 100만 토큰 컨텍스트 윈도우를 제공한다. 컨텍스트 윈도우는 모델이 한 번의 상호작용에서 고려할 수 있는 텍스트 및 기타 토큰화 입력의 최대량이다. 이론적 최대치를 지원하려면 짧은 프롬프트를 서비스하는 것보다 더 많은 메모리가 필요하다.
Kimi Delta Attention은 이러한 증가를 억제하는 데 도움을 준다. 이는 모든 곳에서 기존 키-값 캐시를 유지하는 대신, 많은 레이어에 고정 크기의 순환 상태를 사용한다. 키-값 캐시는 모델이 생성되는 토큰마다 전체 시퀀스를 다시 계산하지 않도록 이전 어텐션 데이터를 저장한다.
Kimi K3에는 여전히 토큰 의존적 캐시 상태를 유지하는 레이어가 있다. 따라서 긴 프롬프트는 계속해서 상당한 메모리를 소비한다. 이 아키텍처는 부담을 줄이지만, 긴 컨텍스트를 공짜로 만들지는 않는다.
AMD의 MI355X와 Nvidia의 B300은 모두 표준 GPU 8대 플랫폼에서 GPU당 288GB의 HBM을 제공한다. Nvidia의 B300 아키텍처는 노드 전체에 걸쳐 2.3TB의 메모리를 명시하며, AMD 플랫폼과 대체로 같은 용량 등급에 해당한다.
B200은 GPU당 메모리가 더 적다. 8개 장치는 많은 모델에 충분할 수 있지만, Wafer는 해당 구성이 의도한 장문 컨텍스트 메모리 풀을 갖춘 Kimi K3를 수용할 수 없었다고 말한다. 16개 GPU로 늘리면 용량 문제는 해결되지만 네트워킹 비용과 운영 복잡성이 더해진다.
이것이 Hacker News의 관심을 이끈 더 깊은 반전이다. Nvidia의 B200은 여전히 고급 가속기지만, Kimi K3는 칩의 익숙한 시장 지위보다 주변 시스템 토폴로지를 더 중요하게 만들 수 있다.
같은 원칙은 이 모델을 넘어 적용된다. 오픈 웨이트 모델은 운영자가 자체 하드웨어, 서빙 프레임워크, 양자화 및 요청 스케줄러를 선택하게 한다. 체크포인트가 커질수록 이러한 선택은 메모리 용량에 더욱 의존하게 된다.
사내 코딩 에이전트, 문서 분석 또는 연구 자동화를 계획하는 기업은 긴 프롬프트와 지속적인 생성을 예상할 수 있다. 이러한 팀은 가속기 처리량을 비교하기 전에 메모리 수요를 모델링해야 한다.
검색 가능한 엔지니어링 지식 베이스를 유지하면 이러한 평가를 더 쉽게 재현할 수도 있다. 그렇지 않으면 구성 메모, 프로파일링 결과, 배포 변경 사항 및 장애 보고서가 로컬 문서와 채팅 스레드에 흩어진다.
Kimi K3가 메모리가 유일한 해자임을 증명하는 것은 아니다. 메모리가 애초에 어떤 플랫폼이 경쟁에 참여할 수 있는지를 결정할 수 있음을 보여준다.
사변적 디코딩이 AMD의 소프트웨어 격차를 좁혔다
Wafer는 핵심 디코드 개선을 위해 새 GPU 커널을 작성할 필요는 없었지만, MI355X 결과는 소프트웨어 보완과 서빙 최적화에 의존했다.
Wafer는 AMD의 Kimi K3 출시 첫날 지원을 기반으로 시작했다. 이 기준 구성은 이미 MI355X GPU 8대에 모델을 로드하고 호환되는 추론 서버를 통해 제공했다. 기능하는 배포에서 경쟁력 있는 처리량으로 나아가려면 여전히 엔지니어링 작업이 필요했다.
가장 큰 디코드 개선은 사변적 디코딩에서 나왔다. 이 기술은 더 작은 드래프트 모델을 사용해 여러 미래 토큰을 예측한다. 이후 메인 모델이 이 후보들을 함께 검증해, 비용이 큰 순차적 디코딩 단계 수를 줄인다.
Kimi K3는 프런티어 모델에 일반적으로 통합되는 사변적 방법을 위한 자체 드래프트 텐서를 제공하지 않았다. Wafer는 대신 RadixArk가 공개한 외부 블록 확산 드래프트 모델인 Kimi-K3-DSpark를 사용했다.
CUDA 버전은 같은 중단 없이 실행된 것으로 전해진다. GPU 컴퓨팅을 위한 AMD의 소프트웨어 플랫폼인 ROCm에서는 첫 프로덕션 요청이 SGLang의 토큰 검증 경로 내부에서 누락된 함수 오류를 일으켰다.
SGLang은 모델 요청을 스케줄링하고, 메모리를 관리하며, 최적화된 커널을 실행하는 오픈소스 서빙 프레임워크다. CUDA 빌드는 top-k 확률 재정규화 함수를 가져왔다. ROCm 브랜치는 테스트된 경로에 해당하는 정의를 제공하지 않았다.
Top-k 샘플링은 다음 출력을 선택하기 전에 가장 가능성 높은 토큰 후보만 남긴다. 재정규화는 남은 확률의 합이 1이 되도록 값을 다시 조정한다. 누락된 연산은 수학적으로 단순했지만, 그 부재는 요청 스케줄러를 중단시켰다.
Wafer는 표준 PyTorch 프리미티브로 이 연산을 구현했다. 이 함수는 확률을 정렬하고, 가장 높은 순위의 후보를 유지하고, 나머지를 마스킹한 뒤, 남은 값을 다시 조정했다.
이 보완으로 단일 스트림 성능은 약 2.2배 증가한 것으로 전해진다. 중간 수준 부하에서는 스트림당 성능이 약 1.7배 향상됐다. 최대 총 처리량은 18% 상승했다.
이러한 향상은 하드웨어 사양이 프로덕션 추론을 직접 예측하지 못하는 이유를 보여준다. 가속기는 연산을 실행하지만, 서빙 스택은 요청이 효율적인 코드 경로에 도달하는지를 결정한다.
Nvidia의 CUDA 플랫폼은 수년간 축적된 프레임워크 통합과 개발자 관심의 혜택을 받는다. 새로운 추론 기술은 대개 그곳에 먼저 등장한다. 버그는 더 넓게 노출되고, 라이브러리는 다른 백엔드를 추가하기 전에 CUDA 동작을 전제로 하는 경향이 있다.
AMD는 ROCm과 이를 지원하는 라이브러리에 대규모 투자를 해왔다. Kimi K3 배포 사례는, 부족했던 기능을 수개월간의 저수준 커널 작업이 아니라 비교적 작은 소프트웨어 수정으로 해결했다는 점에서 진전을 보여준다.
하지만 이 버그는 여전히 중요하다. 실제 트래픽 환경에서 요청 경로가 충돌하는 문제는 사소한 불편이 아니다. 이는 인프라 팀이 배포 결정을 내릴 때 비용으로 반영해야 하는 테스트, 유지보수, 운영상의 위험을 뜻한다.
Wafer의 결과는 높은 동시성 확보에도 의존했다. 동시성은 서버가 한 번에 처리하는 시퀀스 수를 의미한다. 더 많은 동시 요청은 가속기를 유용한 작업으로 채워 전체 처리량을 높일 수 있다.
Speculative decoding은 시스템의 최대 처리량이 더 높은 동시성 설정에서 나타나도록 바꿨다. 이는 많은 요청을 받는 공유 서비스에 적합한 결과다. 즉각적인 단일 응답이 필요한 애플리케이션에서는 중요도가 낮을 수 있다.
이 차이는 총 처리량과 상호작용성을 구분한다. 총 처리량은 모든 사용자에게 생성된 토큰의 합계를 측정한다. 상호작용성은 각 개별 스트림이 얼마나 빠르게 진행되는지를 측정한다.
MI355X 노드의 총 952토큰 결과는 바쁜 서비스에 가치가 있다. 그러나 단일 스트림 118토큰은 다른 이야기를 들려준다. B300은 단일 스트림과 노드 전체 모두에서 더 빨랐다.
따라서 이 메커니즘은 보편적 결론이 아니라 실용적 결론을 뒷받침한다. Wafer가 프레임워크의 공백을 보완하고 외부 draft model을 중심으로 speculative decoding을 구성한 뒤, AMD 하드웨어는 유리한 경제성을 제공했다.
다른 팀들은 자신들이 그 스택을 재현할 수 있는지 판단해야 한다. 호환되는 프레임워크 버전, 동일한 모델 표현 방식, 안정적인 샘플링 동작, 충분한 요청량이 필요하다.
백엔드별 장애를 진단할 수 있는 엔지니어도 필요하다. 누군가 원인을 파악한 뒤에는 누락된 함수를 쉽게 고칠 수 있다. 하지만 프로덕션 부하에서 정확한 장애를 찾아내는 일은 훨씬 오래 걸릴 수 있다.
이 때문에 hacker news의 주장을 단순한 하드웨어 점수로 축소해서는 안 된다. 이는 AMD의 소프트웨어 열세가 때로는 범위를 한정하고 보완할 수 있음을 보여주는 증거다. 그 열세가 사라졌다는 뜻은 아니다.
지연 시간과 집적도가 가장 중요한 곳에서는 여전히 B300이 앞선다
인프라 효율성에서 최대 처리량 또는 최소 대기 시간으로 목표가 옮겨가면 Nvidia의 B300은 여전히 더 강력한 선택지였다.
Wafer는 B300 노드에서 초당 총 출력 토큰 1,568개를 측정했다. 이는 테스트 설정에서 MI355X 노드의 952토큰 결과보다 약 65% 높았다.
B300은 단일 스트림에서도 초당 172토큰에 도달했다. MI355X는 118토큰이었다. 대화형 코딩, 실시간 에이전트, 고객 대상 채팅에서는 이 차이가 제품의 반응성 체감에 영향을 줄 수 있다.
prefill 단계에서는 비교가 더 까다로워진다. Prefill은 모델이 첫 출력 토큰을 생성하기 전에 사용자의 기존 프롬프트를 처리하는 단계다. 긴 문서와 대규모 코드 저장소에서는 이 단계가 특히 중요하다.
Wafer는 약 172,000토큰으로 구성된 동일한 콜드 프롬프트를 테스트했다. MI355X 구성은 초기 처리에 약 51초가 필요했던 반면, B300에서는 약 23초가 걸렸다.
이 격차는 일반적인 decoding에서 관찰된 차이보다 크다. 텍스트가 생성되기 시작한 뒤 스트림이 다소 느린 것은 사용자가 받아들일 수 있다. 그러나 첫 토큰 전까지 훨씬 오래 기다리게 하면 애플리케이션이 멈춘 것처럼 느껴질 수 있다.
Wafer는 AMD prefill 격차의 대부분을 attention-kernel fallback으로 설명했다. Kimi K3는 8-way tensor parallelism 환경에서 GPU당 12개의 attention head를 할당했다. AMD의 더 빠른 AITER kernel은 다른 head-count 형태를 지원했기 때문에, 프레임워크는 더 느린 범용 Triton 코드를 선택했다.
AITER는 최적화된 AI 연산자를 모은 AMD의 라이브러리다. Triton은 이식 가능한 GPU 커널을 작성하는 데 쓰이는 언어이자 컴파일러다. 범용 Triton 경로는 호환성을 단순화할 수 있지만, 하드웨어별 어셈블리 구현과 같은 성능을 내지 못할 수 있다.
Wafer는 12-head 입력을 16 heads로 패딩한 뒤 최적화된 커널을 실행하고, 이후 인위적으로 생성된 출력을 제거했다. 이 형태 조정은 정상 상태 prefill 처리량을 초당 약 13,000토큰까지 높인 것으로 알려졌다.
이전 fallback의 처리량은 초당 약 4,000~7,000토큰이었다. Wafer는 이 수정으로 prefill 성능이 2~3배 개선됐다고 설명했다.
중요하게도 이 최적화는 헤드라인 decode 결과를 높이지 않았다. 이는 생성 시작 전 사용자가 기다리는 시간을 측정하는 TTFT, 즉 time to first token을 겨냥했다.
이 사례는 AMD의 위치가 지닌 양면을 보여준다. 하드웨어에는 훨씬 더 나은 성능을 낼 수 있는 효율적인 커널이 있었다. 그러나 Kimi K3가 지원되지 않는 형태를 생성했기 때문에 프레임워크는 이를 선택하지 못했다.
이런 불일치가 이미 CUDA 라이브러리에서 예상되고 처리된 경우 Nvidia는 이점을 얻는다. 개발자가 새 커널을 설계하지 않고도 기존 커널을 조정할 수 있을 때 AMD도 이점을 얻는다. 구매자는 자신이 감당할 수 있는 통합 작업의 수준을 결정해야 한다.
Wafer의 테스트에서 B300은 GPU당 총 성능도 더 높게 나타났다. 이 집적도는 랙 공간, 전력 공급, 네트워킹 포트 또는 데이터센터 가용성이 배포를 제약하는 환경에서 중요할 수 있다.
저비용 GPU가 서비스 수준에서 자동으로 더 저렴한 것은 아니다. 운영자는 서버 활용도, 전력, 네트워킹, 엔지니어링 시간, 예비 용량, 장애 복구, 소프트웨어 유지보수를 포함해야 한다.
B300 노드 하나가 더 많은 AMD 노드가 필요한 트래픽을 처리할 수 있다면, 주변 인프라 비용은 초기 성능 대비 달러 우위의 격차를 줄일 수 있다. 반대로 지연 시간 요구가 중간 수준인 애플리케이션은 AMD의 낮은 최대 성능을 감수함으로써 더 많이 절감할 수 있다.
올바른 비교 기준은 칩 수준의 구호가 아니라 서비스 수준 목표다. 서비스 수준 목표는 시스템이 일관되게 제공해야 하는 지연 시간, 가용성, 처리량을 정의한다.
팀은 같은 목표 상호작용성에서 두 플랫폼을 비교해야 한다. 또한 동일한 프롬프트 길이, 출력 길이, 캐시 동작, 동시성, 양자화, 가동 시간 기대치를 측정해야 한다.
각 플랫폼에서 독립적으로 최적화한 벤치마크는 전문가 튜닝 후 어떤 시스템이 가장 좋은 성능을 내는지 답할 수 있다. 동일한 소프트웨어를 사용하는 벤치마크는 스택의 이식성이 어느 정도인지 답할 수 있다. 이는 서로 다른 질문이다.
Wafer의 테스트는 첫 번째에 가깝다. MI355X 경로를 튜닝하고 그 결과로 나온 서비스를 Nvidia 배포 환경과 비교했다. 이는 운영자가 최선의 경제성을 추구하는 방식을 반영하지만, 엄격한 아키텍처 귀속 분석은 복잡하게 만든다.
공개된 수치에서 B300은 여전히 더 빠른 플랫폼이다. MI355X가 주목받는 이유는 Wafer가 선택한 워크로드에서는 더 낮은 임대 비용 가정이 그 성능 차이를 충분히 상쇄했기 때문이다.
이는 의미 있는 경쟁 결과다. Nvidia의 성능 왕관이 넘어갔다는 뜻은 아니다.
이 벤치마크가 입증하지 못하는 것
공개된 결과는 방법론적 세부 정보가 제한적이고 헤드라인 주장에 독립 재현 결과가 첨부되지 않은, 회사 자체 실행 스냅샷으로 남아 있다.
Wafer는 GPU 최적화 및 추론 제품을 개발한다. 호스팅 모델 액세스도 제공한다. 이 회사는 분명한 전문성을 갖고 있지만, 소프트웨어 작업이 Nvidia의 대안을 열어줄 수 있음을 보여줄 상업적 이해관계도 있다.
그렇다고 벤치마크가 무효가 되는 것은 아니다. 이는 독자가 해당 측정치를 중립적인 업계 인증이 아니라 운영자가 보고한 결과로 받아들여야 한다는 의미다.
벤치마크 게시물은 프롬프트 길이, 요청 출력량, 하드웨어 구성, 처리량, 선택된 최적화 작업을 명시한다. 그러나 기사 내에 완전한 재현성 패키지를 제공하지는 않는다.
중요한 세부 사항은 여전히 불분명하다. 게시물은 모든 소프트웨어 리비전, 워밍업 절차, 요청 분포, 측정 기간, 출력 검증 단계, 전력 측정을 완전히 명시하지 않는다.
Wafer의 비교 라벨에 따르면 B300 구성은 disaggregated context processing도 사용했다. Disaggregation은 프롬프트 처리와 토큰 생성을 분리해 각 단계에서 적합한 자원을 사용할 수 있도록 한다. 이는 성능과 시스템 설계 모두에 영향을 줄 수 있다.
MI355X 항목은 8-way tensor parallelism을 사용했다. B200 배포는 두 노드에 걸친 16개 GPU를 사용했다. B300 항목은 8-way tensor parallelism과 disaggregated processing을 결합했다.
이는 실용적인 배포 방식이지만 완벽하게 대칭적인 구성은 아니다. 각 플랫폼은 서로 다른 메모리와 토폴로지 제약에 직면했다. 이러한 비대칭성은 어느 정도 핵심이지만, 칩 아키텍처만을 두고 내릴 수 있는 결론에는 한계를 둔다.
성능 대비 달러 결과는 임대 비용 가정에도 의존한다. GPU 시장은 클라우드 제공업체, 계약 기간, 지역, 가용성, 예약 모델에 따라 달라진다. 할인된 Nvidia 용량을 확보한 구매자는 다른 결론에 도달할 수 있다.
공통 작성 규칙상 여기에서 구체적인 상업 가격을 나열할 수는 없다. 중요한 사실은 Wafer가 MI355X 용량의 GPU 시간당 비용이 B300보다 실질적으로 낮다고 가정했다는 점이다. 이 경제성 판단은 그 전제에서 직접 나온다.
가용성도 중요하다. 이론적으로 매력적인 가속기라도 팀이 필요한 지역에서 충분한 노드를 예약할 수 없다면 절감 효과를 제공하지 못한다. Nvidia의 더 넓은 클라우드 제공 범위는 조달 마찰을 줄일 수 있다.
모델 동작은 또 다른 불확실성을 제시한다. Speculative decoding은 draft model이 main model이 수용하는 토큰을 예측할 때만 생성을 가속한다. 수용률은 코딩, 산문, 수학, 언어, 샘플링 설정에 따라 달라질 수 있다.
따라서 Wafer의 단문 입력 벤치마크는 대규모 저장소를 처리하는 에이전트와는 다른 이득을 낼 수 있다. 장문 컨텍스트 연구, 고객 지원, 배치 추출은 각각 prefill과 decode 사이의 균형을 바꿀 수 있다.
모델 자체도 새롭다. Moonshot은 Wafer가 7월 31일 측정치를 공개하기 불과 며칠 전인 2026년 7월 27일 Kimi K3의 가중치를 공개했다. 프레임워크, 양자화, 최적화 커널은 여전히 초기 단계다.
AMD의 초기 가이드는 의도적으로 신중했다. 8개의 MI355X GPU에서 로딩과 기본 정확성을 검증했지만, 최대 처리량, 토큰 지연 시간, 커널 효율성을 주장하지는 않았다.
Wafer는 그 다음 단계의 성능 작업을 제공했다. 이제 독립 팀은 공개 스크립트와 명확히 정의된 서비스 목표를 바탕으로 결과를 재현해야 한다.
비교 대상은 B300을 넘어 확장되어야 한다. Nvidia의 최신 시스템, 미래 AMD 가속기, 특화 추론 하드웨어는 선택지를 바꿀 것이다. 소프트웨어 릴리스는 어떤 칩도 교체하지 않고 오늘의 순위를 바꿀 수 있다.
품질 문제도 있다. 저정밀 형식과 speculative 방식은 정의된 허용 범위 안에서 출력 동작을 보존해야 한다. 속도 결과에는 정확성 검사가 필요하며, 특히 샘플링 변경이 미묘한 차이를 숨길 수 있을 때 더욱 그렇다.
Moonshot의 모델은 메모리 및 연산 요구를 줄이기 위해 혼합 저정밀 표현을 사용한다. 이러한 선택은 의도된 아키텍처의 일부다. 그럼에도 구현체는 각 백엔드가 대표적인 작업 전반에서 허용 가능한 결과를 내는지 확인해야 한다.
가장 방어 가능한 해석은 조건부다. Wafer의 워크로드, 소프트웨어 스택, 임대 비용 가정 아래에서 MI355X는 더 뛰어난 성능 대비 달러 결과를 제공했다.
가장 방어하기 어려운 해석은 AMD가 AI 추론에서 Nvidia를 전반적으로 이겼다는 것이다. 공개된 증거는 그 결론을 뒷받침하지 않는다.
AMD가 승리를 재현할 수 있을지를 결정할 세 가지 신호
AMD의 Kimi K3 결과가 전략적으로 중요해지려면 독립 테스트, 더 폭넓은 워크로드, 일상적인 프레임워크 릴리스를 견뎌내야 한다.
첫 번째 신호는 재현성이다. 독립 운영자는 공개된 구성, 동일한 프롬프트, 검증된 출력, 일치하는 지연 시간 목표로 MI355X와 B300에서 Kimi K3를 실행해야 한다.
반복된 성능 대비 달러 우위는 Wafer의 주장을 강화할 것이다. 팀마다 큰 차이가 나타난다면, 그 결과가 특수한 튜닝이나 유리한 인프라 조건에 크게 의존한다는 점을 시사할 것이다.
재현은 단순한 최대 총처리량을 넘어 더 폭넓게 이뤄져야 한다. 테스트에는 첫 토큰까지의 시간, 사용자별 디코딩 속도, 지속 동시성, 오류율, 메모리 사용량, 전력 사용량, 장시간 실행 안정성이 포함돼야 한다.
또한 하나의 공개 임대 스냅샷이 모든 구매자를 대표한다고 가정하지 말고, 전체 비용 모델을 제시해야 한다. 계약된 용량과 자체 보유 인프라는 계산을 바꿀 수 있다.
두 번째 신호는 ROCm 개선 사항이 표준 서빙 프레임워크에 반영되는지 여부다. Wafer의 top-k 복구와 패딩된 prefill 경로는 구체적인 문제를 해결했지만, 비공개 패치는 유지보수 부담을 만든다.
SGLang, AITER, vLLM 및 관련 프로젝트가 유사한 수정 사항을 흡수한다면, 더 많은 팀이 커스텀 브랜치를 유지하지 않고도 결과를 재현할 수 있다. 이는 한 운영자의 전문성을 더 넓은 생태계의 이득으로 전환할 수 있다.
신속한 업스트림 지원은 프레임워크 업데이트가 최적화된 경로를 깨뜨릴 위험도 줄인다. 프로덕션 시스템은 벤치마크 실행보다 훨씬 오래 운영되므로, 인프라 구매자는 재현성을 중시한다.
수정 사항이 계속 파편화된 상태로 남는다면 AMD 하드웨어가 유리해 보여도 Nvidia의 소프트웨어 우위는 유지된다. CUDA의 해자는 문서화, 디버깅 도구, 라이브러리 범위, 숙련된 개발자, 예측 가능한 프레임워크 동작까지 포함한다.
세 번째 신호는 실제 프로덕션 환경을 닮은 워크로드에서의 성능이다. Kimi K3의 100만 토큰 컨텍스트는 대규모 리포지토리, 문서 모음, 연구 이력, 장시간 에이전트 세션을 포함하는 작업을 가능하게 한다.
이러한 워크로드에서는 prefill, 캐시 관리, 요청 스케줄링, 메모리 단편화의 중요성이 커진다. Wafer는 최적화된 커널 경로가 활성화되기 전 AMD의 초기 콜드 prefill 결과가 B300에 뒤처졌음을 이미 보여줬다.
더 폭넓은 승리를 위해서는 MI355X가 짧은 채팅 프롬프트, 긴 문서, 코드 에이전트, 멀티모달 입력, 혼합 트래픽 전반에서 경쟁력을 유지해야 한다. 또한 노드가 많은 사용자를 처리하는 동안에도 허용 가능한 지연 시간을 유지해야 한다.
AMD가 이러한 조건 전반에서 좋은 성능을 보인다면 하드웨어 구매자는 실질적인 협상력을 얻는다. 신뢰할 만한 두 번째 플랫폼을 바탕으로 협상할 수 있고, 자동적으로 Nvidia 프리미엄을 감수하지 않고도 대규모 오픈 웨이트 모델을 배포할 수 있다.
짧은 입력 처리량 테스트를 벗어나면 이점이 사라진다면, MI355X는 워크로드 특화 옵션으로 남을 것이다. 그래도 가치 있는 배포 사례는 만들 수 있지만, Nvidia의 입지를 근본적으로 약화시키지는 못한다.
hacker news에서 얻을 수 있는 더 넓은 교훈은 오픈 웨이트 모델이 추론을 시스템 경쟁으로 바꾸고 있다는 점이다. 모델 개발자는 아키텍처를 정의하고, 칩 제조업체는 메모리와 연산 성능을 제공하며, 프레임워크 팀은 그 용량 중 얼마나 많은 부분을 실제로 활용할 수 있는지 결정한다.
Kimi K3는 체크포인트가 구매자에게 즉시 메모리 한계를 직면하게 한다는 점에서 이 경쟁을 격화한다. 또한 저정밀 연산, 효율적인 전문가 라우팅, 대규모 컨텍스트 상태를 지원할 수 있는 플랫폼에 보상한다.
개발자는 벤치마크 리포지토리와 프레임워크 릴리스 노트를 지켜봐야 한다. 인프라 팀은 단일 초당 토큰 수치에 의존하지 말고 자체 트래픽 트레이스를 실행해야 한다.
엔터프라이즈 구매자는 애플리케이션에 필요한 지연 시간 기준의 비교를 요구해야 한다. 또한 가속기 임대 가정과 함께 엔지니어링 인력과 운영 리스크를 포함해야 한다.
현재 증거는 AMD에는 신뢰할 만한 성과를, Nvidia에는 분명한 경고를 제시한다. B300은 여전히 더 빠르지만, Wafer의 Kimi K3 배포에서는 MI355X가 더 나은 경제성을 제공하는 것으로 알려졌다.
다음 질문은 이 이점이 일상적인 것이 되는지 여부다. 하나의 hacker news 결과를 지속적인 변화로 받아들이기 전에 독립 벤치마크, 업스트림 소프트웨어 지원, 긴 컨텍스트 기반의 프로덕션 테스트를 추적해야 한다.


