Miles Blackwell RL, BF16 일률성 대신 네이티브 MXFP8 및 NVFP4 채택
- Sophie Larsen

- 7월 30일
- 10분 분량
Miles Blackwell 지원은 이제 네이티브 저정밀 강화학습 레시피 두 가지를 포함하며, NVIDIA B200 GPU 8대에서 6개 구성으로 테스트됐다. 하나는 롤아웃과 학습 전반에 MXFP8을 사용한다. 다른 하나는 다른 영역의 고정밀도를 유지하면서 mixture-of-experts 가중치에 토큰별 NVFP4를 적용한다.
이 결과는 강화학습, 즉 RL에 관한 익숙한 가정에 도전한다. 낮은 정밀도가 반드시 눈에 띄게 약한 학습 곡선을 감수해야 함을 의미하지는 않는다. Miles의 Qwen3-30B-A3B 절제 실험에서 5개 저정밀 구성은 모두 BF16 기준선의 원시 보상을 밀접하게 따라갔다.
이 발견에는 중요한 단서가 따른다. 이 실험은 완전히 튜닝된 학습 벤치마크나 일반적 정확도 보장이 아니라, 통제된 레시피 절제 실험이었다. Miles는 민감한 레이어에 BF16을 유지하고 추가 BF16 가중치 사본을 보존했으며, 간헐적인 NVFP4 그래디언트 스파이크도 관찰했다.
따라서 실제 경쟁은 단순히 4비트와 16비트의 대결이 아니다. 일률적인 BF16 파이프라인과 일관되고 선택적인 정밀도 계약의 대결이다. Miles는 학습, 샘플링, 변환, 실시간 가중치 업데이트가 동일한 텐서를 동일한 방식으로 양자화할 때 Blackwell 네이티브 포맷이 유용해진다고 주장한다.
Miles Blackwell 지원, 이제 전체 RL 루프 포괄
Miles는 MXFP8과 NVFP4를 고립된 커널 수준에서 벗어나 전체 강화학습 경로에 걸쳐 연결했다.
Miles 팀은 2026년 7월 29일 레시피를 공개했다. 저정밀 결과는 체크포인트 변환, Megatron 학습, SGLang 롤아웃, 실시간 가중치 내보내기를 다룬다. 구현은 TransformerEngine, FlashInfer, cuDNN frontend 및 관련 프로젝트 전반에서 기여된 구성 요소에도 의존한다.
첫 번째 레시피는 주요 계산 경로 전반에 MXFP8을 사용한다. MXFP8은 32개 E4M3 값의 각 블록이 E8M0 스케일을 공유하는 8비트 마이크로스케일링 포맷이다. 롤아웃, 순전파, 가중치 그래디언트 행렬 곱셈, 데이터 그래디언트 곱셈 모두가 이를 사용할 수 있다.
이처럼 광범위한 적용 범위는 RL 시스템에 밀접하게 연결된 두 정책이 존재하기 때문에 중요하다. 학습 정책은 업데이트를 계산하고, 롤아웃 정책은 보상 계산에 사용되는 응답을 생성한다. 두 정책이 가중치를 서로 다르게 양자화하면 더 이상 정확히 동일한 모델을 나타내지 않는다.
Miles는 이전에 더 큰 스케일링 블록을 기반으로 하는 DeepSeek-V3 스타일 FP8 설계를 지원했다. 이 경로는 특히 Hopper 하드웨어에서 여전히 유효하다. 하지만 Blackwell의 네이티브 마이크로스케일링 하드웨어를 사용하는 대신 Tensor Core 경로 주변에서 소프트웨어로 스케일링을 적용한다.
두 번째 레시피는 더 선택적인 접근을 취한다. mixture-of-experts, 즉 MoE 레이어 내부에서 라우팅되는 전문가 가중치와 활성화에 NVFP4를 적용한다. NVFP4는 16개 값 블록마다 E4M3 스케일을 사용해 E2M1 값을 4비트로 저장한다.
두 번째 FP32 스케일은 더 넓은 범위를 포괄한다. Miles는 이 스케일을 텐서나 배치 전체가 공유하도록 하지 않고 토큰마다 별도로 계산한다. 이 세부 사항은 한 토큰의 표현이 배치 구성에 따라 변하는 것을 막기 위한 것이다.
NVFP4 모델의 나머지 부분은 구성 규칙이 다른 포맷을 선택하지 않는 한 BF16으로 유지된다. 이 설계는 MoE 모델이 가중치 데이터 대부분을 저장하는 영역에 4비트 연산을 집중한다. 또한 어텐션과 기타 민감한 구성 요소를 사용 가능한 가장 좁은 표현으로 강제하는 일을 피한다.
NVIDIA는 NVFP4 스케일링을 Blackwell Tensor Core를 위해 설계된 2단계 시스템으로 설명한다. 16개 값 블록은 32개 값 그룹을 사용하는 포맷보다 더 세밀한 로컬 적응을 제공한다. 텐서 수준 FP32 스케일은 사용할 수 있는 범위를 확장한다.
Miles는 더 큰 스케일의 범위를 텐서별에서 토큰별로 바꿨다. 이 선택은 RL 레시피를 단순한 추론 배포와 구분한다. 또한 안정적인 RL 시스템을 만들기에 FP4 데이터 유형 추가만으로는 충분하지 않은 이유를 보여준다.
두 레시피 모두 고정밀 및 역양자화된 역전파 모드를 지원한다. 고정밀 역전파는 역전파 행렬 곱셈에 원본 BF16 피연산자를 사용한다. 반면 역양자화된 역전파는 순전파에서 사용된 정확한 저정밀 값으로부터 BF16 피연산자를 재구성한다.
두 번째 옵션은 일부 수치적 세부 정보를 희생하지만 순전파 정책과 더 가까운 일치를 보존한다. 어느 NVFP4 모드도 역전파 행렬 곱셈을 FP4로 실행하지 않는다. 따라서 Miles는 보편적인 4비트 학습 루프를 주장하는 것이 아니라 선택적 저정밀도를 테스트하고 있다.
보상 곡선이 입증 책임을 바꾼다
가장 주목할 결과는 Tensor Core 최고 처리량이 아니라, 테스트된 워크로드에서 뚜렷한 보상 손실이 없었다는 점이다.
Miles는 dapo-math-17k 데이터셋에서 동기식 GRPO 스타일 RL로 Qwen3-30B-A3B를 평가했다. 시스템은 롤아웃과 학습에 균등하게 나눈 B200 GPU 8대를 사용했다. 각 프롬프트에는 롤아웃 샘플 8개가 할당됐으며, 응답은 8,192토큰으로 제한됐다.
연구는 BF16 기준선 하나와 저정밀 구성 5개를 비교했다. 여기에는 엔드투엔드 MXFP8과 각 저정밀 포맷별 두 가지 역전파 모드가 포함됐다. NVFP4 변형은 4비트 연산을 MoE 전문가 경로로 제한했다.
저정밀 구성 5개 모두의 원시 보상 곡선은 BF16 곡선을 밀접하게 추적했다. 이는 태스크, 시드 또는 더 긴 학습 실행 전반의 동등성을 확립하지는 않는다. 다만 이 특정 실험에서 저정밀 롤아웃이 학습 신호를 압도하지 않았음을 시사한다.
이는 RL에서 의미 있는 기준점이다. 지도 학습은 크고 비교적 안정적인 데이터셋 전반에서 최적화 신호를 평균화할 수 있다. RL은 더 잡음이 많은 보상과 더 작은 정책 업데이트를 다루는 경우가 많아, 추가 양자화 오차를 실제 학습과 구분하기가 더 어렵다.
Miles는 MXFP8과 NVFP4가 BF16 대비 롤아웃 시간을 줄였다고도 보고했다. 공개된 글은 비교를 그래프로 제시하지만, 보편적인 헤드라인에 적합한 단일 백분율은 제공하지 않는다. 결과의 방향성은 이식성보다 더 분명하다.
생성 작업이 강화학습 워크로드를 지배하는 경우가 많기 때문에 롤아웃 개선은 중요하다. 정책은 보상과 업데이트를 계산하기 전에 완전한 응답을 생성해야 한다. 긴 컨텍스트와 다수의 샘플은 이 단계를 특히 비싸게 만든다.
MXFP8은 측정된 설정에서 BF16 대비 학습 시간도 개선했다. NVFP4의 학습 측면은 반대 방향으로 움직였다. 두 NVFP4 역전파 오버라이드 변형은 더 빠른 롤아웃에도 불구하고 학습 중에는 BF16보다 느렸다.
Miles는 이 격차를 Blackwell의 FP4 Tensor Core가 아니라 현재 통합 방식에 기인한다고 설명한다. 측정된 TransformerEngine 경로는 토큰별 FP32 스케일링을 별도 PyTorch 연산으로 수행한다. 융합된 cuDNN frontend 커널은 존재하지만 TransformerEngine 통합은 아직 진행 중이다.
이처럼 엇갈린 결과는 분석을 현실에 맞게 유지한다. NVFP4는 값이 더 작다는 이유만으로 자동으로 더 빨라지지 않는다. 커널 융합, 데이터 레이아웃, 스케일링 연산, 프레임워크 경계가 이론적 처리량이 완전한 애플리케이션에 도달하는지를 결정한다.
저정밀 구성은 BF16보다 더 큰 학습-롤아웃 불일치도 보였다. NVFP4는 정책 분포를 비교하는 기준 KL 측정값이 더 높은 상태에서 시작했다. 그러나 Miles는 이 진단값을 BF16 Megatron 기준 모델에 대해 계산했다.
따라서 이 지표에는 처음부터 포맷 차이가 포함돼 있다. 계수는 0으로 설정됐으므로 최적화 패널티로 작동하지 않았다. Miles는 이 측정값을 단독으로 학습 실패의 신호로 간주하지 말라고 경고한다.
보상 곡선은 유용한 역전을 보여준다. 정밀도 불일치는 증가했지만, 절제 실험 기간 동안 관찰된 보상은 BF16과 실질적으로 차이나지 않았다. 이 조합은 추가 테스트를 뒷받침하는 한편 장기 안정성 문제는 열어 둔다.
공유 양자화기가 실제 메커니즘이다
Miles는 저정밀 RL을 단순히 더 작은 숫자를 요구하는 문제가 아니라 분산 일관성 문제로 다룬다.
RL 스택의 각 부분은 텐서를 독립적으로 양자화할 수 있다. Megatron은 학습을 담당하고, SGLang과 FlashInfer는 롤아웃 연산을 처리한다. 체크포인트 변환과 실시간 가중치 업데이트는 값이나 레이아웃이 달라질 수 있는 기회를 두 번 더 만든다.
작은 차이도 반복적인 정책 업데이트를 거치며 누적될 수 있다. 학습 워커는 하나의 양자화 표현을 최적화하는 반면, 롤아웃 워커는 다른 표현에서 샘플링할 수 있다. 그러면 보상은 옵티마이저가 정확히 보지 못하는 정책의 행동을 설명하게 된다.
Miles는 비트 정확 양자화기 계약으로 이 문제를 해결한다. FlashInfer 테스트는 TransformerEngine 스타일 기준과 바이트 단위로 출력을 비교한다. 테스트 입력에는 무작위 값, 경계 사례, 영 텐서, 표현 가능한 최댓값이 포함된다.
팀은 관련 FP4 양자화 경로에서 FlashInfer의 fast-math 옵션도 비활성화한다. 사소한 차이가 이후 가중치에 피드백되지 않는 일반 서빙에서는 근사 수학이 타당할 수 있다. RL에서는 이러한 차이가 학습 루프의 일부가 된다.
MXFP8은 또 다른 레이아웃 문제를 제시한다. Blackwell Tensor Core는 마이크로스케일링 블록이 행렬 축소 차원을 따르기를 기대한다. 순전파와 역전파 연산은 서로 다른 방향을 사용할 수 있으므로, 하나의 양자화된 사본이 항상 두 경로 모두에 올바르게 사용될 수는 없다.
MXFP8 문서는 TransformerEngine이 원본 고정밀 입력에서 행 방향 및 열 방향 사본을 만든다고 설명한다. 이는 더 많은 메모리를 소비하지만 기존 저정밀 사본을 역양자화하고 재양자화하는 일을 피한다.
Miles는 전체 MXFP8 경로에서 이 메모리 비용을 감수한다. 고정밀 및 역양자화된 역전파 대안은 두 번째 양자화 사본을 유지하지 않는다. 이 선택은 수치적 일치, 메모리 사용량, 역양자화 작업, 행렬 곱셈 속도 사이의 균형이 된다.
NVFP4는 다른 일관성 문제를 도입한다. 여러 토큰이 하나의 활성화 스케일을 공유하면 토큰의 양자화 값이 이웃 토큰에 따라 달라진다. 그러면 롤아웃 스케줄링, 시퀀스 길이, 배치 패킹의 변화가 정책 표현을 바꿀 수 있다.
Miles는 온라인으로 토큰마다 하나의 FP32 활성화 스케일을 계산한다. FlashInfer는 이 계산을 롤아웃 활성화 양자화 커널에 융합한다. 동일한 연산은 패킹된 FP4 활성화, 블록 스케일, 토큰 스케일을 생성한다.
학습과 롤아웃은 일치하는 전문가 텐서 병렬 분할도 사용해야 한다. 그렇지 않으면 각 시스템은 토큰별 스케일을 계산할 때 텐서의 서로 다른 부분을 보게 된다. 동일한 수식도 서로 다른 입력에서는 동일한 정책을 만들 수 없다.
SwiGLU 전문가 레이어는 또 다른 특수 사례를 추가한다. 게이트 및 업 프로젝션은 체크포인트에서 별도로 저장될 수 있지만 일반적으로 하나의 융합된 행렬 곱셈에 들어간다. Miles는 각 게이트-업 쌍을 함께 양자화해 둘 모두가 일관된 하나의 더 큰 스케일을 받도록 한다.
이러한 구현 세부 사항은 Miles Blackwell 작업이 여러 리포지터리에 걸쳐 있는 이유를 설명한다. 저장된 체크포인트와 생성된 롤아웃 사이의 모든 표현을 단일 라이브러리가 제어하지는 않는다. 정밀도 계약은 각 인계를 통과해 유지돼야 한다.
이 시스템 작업은 레시피를 학습 후 양자화와도 구분한다. 정적 추론 체크포인트는 한 번 보정한 뒤 반복적으로 서빙할 수 있다. 강화학습은 가중치를 계속 변경하므로, 모든 실시간 내보내기는 사실상 새로운 양자화 이벤트를 만든다.
유사한 시스템을 평가하는 팀에는 그러한 이벤트를 추적할 수 있는 근거가 필요하다. 내부 엔지니어링 지식 베이스는 구성, 커널 버전, 평가 곡선, 인시던트 메모를 연결할 수 있다. 이러한 기록은 수차례 업데이트 후 수치적 성능 저하가 나타날 때 중요해진다.
토큰별 NVFP4가 균일한 BF16 기본값에 가하는 압력
Miles Blackwell 접근법은 팀이 모든 곳에 BF16을 사용하는 이유를 정당화하도록 요구하는 한편, 선택적 BF16은 안정성 도구로 계속 활용한다.
BF16은 여전히 더 단순한 기준선이다. 더 넓은 수치 범위, 더 적은 양자화 제약, 그리고 학습과 롤아웃 전반에서 더 쉬운 비교를 제공한다. 단점은 모든 전문가 가중치와 활성화가 더 좁은 형식에서 요구되는 것보다 더 많은 메모리 대역폭을 소비한다는 점이다.
MoE 모델은 이 절충을 더 뚜렷하게 만든다. 전문가 파라미터는 많지만 각 토큰이 활성화하는 것은 그 일부뿐이다. 롤아웃 중 전문가 가중치를 메모리로 이동시키는 과정은 순수 연산 용량보다 더 큰 제약이 될 수 있다.
따라서 Miles는 먼저 전문가 경로를 겨냥한다. 이 전략은 4비트 학습에 대한 이념적 집착이라기보다 재무 예산에 가깝다. 안정성에 가장 큰 영향을 줄 가능성이 있는 텐서에는 정밀도를 투자하고, 가장 큰 반복 구조는 압축한다.
이 실험에서는 모든 저정밀 구성에서 모델 레이어의 마지막 15%를 BF16으로 유지했다. Miles는 이 선택이 학습-추론 불일치를 줄이고 그래디언트 안정성을 개선했다고 말한다. 초기 레이어를 BF16으로 유지해도 이와 비슷하게 의미 있는 감소는 나타나지 않았다.
공유 전문가는 더 높은 정밀도로 유지됐다. 라우팅되는 전문가와 달리 이들은 모든 토큰을 처리한다. 따라서 이들의 양자화 오류는 선택된 경로에만 영향을 미치는 것이 아니라 모든 MoE 블록을 통해 전파된다.
일부 멀티헤드 잠재 어텐션 프로젝션에도 BF16 예외가 적용됐다. 이들의 수축 축은 실행 모드에 따라 달라질 수 있는 반면, MXFP8은 1차원 스케일링 블록을 사용한다. 축이 바뀌면 서로 다른 스케일 아래에서 값들이 다시 그룹화될 수 있다.
이러한 예외는 부수적인 정리가 아니라 레시피의 핵심이다. 완전히 FP4로 구성된 모델이라는 헤드라인은 이 작업을 잘못 설명하게 된다. 대신 Miles는 변환, 학습, 롤아웃, 라이브 업데이트 전반에서 각 예외를 보존하는 세분화된 제어 기능을 구축했다.
이는 기존 BF16 파이프라인에 두 가지 방식으로 압력을 가한다. 첫째, 보상 절제 실험은 Blackwell에서 더 좁은 롤아웃 경로를 평가할 가치가 있음을 시사한다. 둘째, 구성 시스템은 모든 레이어에 하나의 형식을 선택하는 방식의 대안을 제공한다.
또한 Hopper 중심으로 설계된 기존 FP8 접근법에도 압력을 가한다. DeepSeek-V3는 가중치에 128x128 블록을, 활성화에 1x128 타일을 사용한다. Miles는 이 설계가 효과적이라고 설명하지만, Blackwell의 마이크로스케일링 하드웨어를 같은 방식으로 네이티브 활용할 수는 없다.
이 비교가 기존 방식을 쓸모없게 만드는 것은 아니다. Hopper 클러스터는 여전히 널리 배치되어 있으며, 블록 스케일 FP8은 더 긴 운영 기록을 보유한다. Blackwell 네이티브 형식은 여러 세대의 GPU를 함께 지원하는 팀에 호환성 경계를 만들기도 한다.
NVIDIA의 TransformerEngine 가이드는 이제 최적화된 빌딩 블록을 통해 FP8, MXFP8, NVFP4를 지원한다. 그러나 프레임워크 지원만으로 어떤 레이어가 각 형식을 사용해야 하는지는 결정되지 않는다. 모델 아키텍처와 워크로드 형태가 여전히 그 결정을 좌우한다.
가장 직접적인 수혜자는 Blackwell에서 대규모 MoE 강화학습 작업을 운영하는 조직이다. 모든 역전파 연산을 즉시 저정밀도로 옮기지 않고도 더 빠른 롤아웃을 시험할 수 있다. 이 단계적 경로는 근거를 수집하는 비용을 낮춘다.
소규모 팀은 다른 계산을 해야 한다. 이 구성을 재현하려면 8개의 B200 GPU, 여러 협업 라이브러리, 그리고 세심한 구성 일치가 필요하다. 적정 규모에서는 엔지니어링 부담이 롤아웃 절감 효과를 웃돌 수 있다.
따라서 핵심 경쟁 구도는 선택적 일관성과 균일한 단순성이다. Miles는 더 많은 제어와 더 낮은 메모리 트래픽으로 가는 경로를 제시한다. BF16은 눈에 띄지 않는 불일치가 학습 과정에 유입될 수 있는 접점을 더 적게 제공한다.
Qwen3 절제 실험이 입증하지 않는 것
공개된 실험은 유망한 레시피를 뒷받침하지만, 폭넓은 품질 동등성이나 완전한 4비트 효율성을 입증하지는 않는다.
가장 즉각적인 한계는 범위다. Miles는 하나의 모델, 하나의 수학 중심 데이터셋, 하나의 하드웨어 구성, 하나의 주요 워크로드 설정을 시험했다. 그 환경에서 보상이 밀접하게 추적된다고 해서 코딩, 도구 사용, 대화, 멀티에이전트 작업에서의 동작을 예측할 수는 없다.
고정된 구성은 동기식 RL과 롤아웃 및 학습 각각에 대한 4-GPU 분할을 사용했다. 비동기 시스템은 데이터 생성과 최적화 사이에 더 큰 정책 지연을 유발할 수 있다. 이 지연은 양자화 불일치와 다른 방식으로 상호작용할 수 있다.
공개된 보상 플롯 역시 완전히 튜닝된 학습 실행이 아니라 레시피 절제 실험을 다룬다. Miles도 이를 명시적으로 설명한다. 독자는 이 그래프를 최적화된 BF16 시스템에 대한 벤치마크 승리로 해석해서는 안 된다.
원시 보상은 행동 변화를 가릴 수 있다. 두 정책은 서로 다른 추론 패턴, 응답 길이, 실패 모드를 사용하면서도 유사한 점수에 도달할 수 있다. 더 강력한 검증에는 홀드아웃 평가, 여러 무작위 시드, 작업별 오류 분석이 포함될 것이다.
NVFP4의 간헐적인 그래디언트 스파이크도 또 다른 우려 사항이다. 고정밀 역전파 변형에서는 보고된 실행 중 스파이크가 나타났다. 역양자화된 역전파는 가장 큰 사례를 줄였지만 완전히 제거하지는 못했다.
이는 4비트 학습을 둘러싼 더 광범위한 우려와도 일치한다. NVFP4 이상치에 관한 연구는 특정 아키텍처 구성 요소에서 지속적인 민감성을 발견했다. 해당 연구는 Miles의 RL 레시피가 아니라 사전학습을 다루지만, 레이어 수준 모니터링의 필요성을 뒷받침한다.
현재의 메모리 이야기도 불완전하다. Megatron은 학습과 롤아웃을 저정밀 레시피로 실행하면서도 추가 BF16 가중치 사본을 유지한다. 이 사본은 시스템이 실제로 회수하는 모델 메모리의 양을 제한한다.
Blackwell 네이티브 저정밀 파라미터 수집도 아직 성숙 단계다. Miles는 관련 NVFP4 파라미터 수집 경로가 아직 1차원 1x16 가중치 레이아웃을 지원하지 않는다고 지적한다. BF16 사본을 제거하는 일은 부분적으로 이 인프라에 달려 있다.
NVFP4 학습 성능은 두 번째 미완성 영역이다. 롤아웃은 개선됐지만, 시험된 구현에서 학습은 더 느려졌다. 보류 중인 융합 TransformerEngine 통합은 NVFP4가 더 명확한 엔드투엔드 이점을 주장하기 전에 이 격차를 해소해야 한다.
라이브 가중치 이동도 여전히 복잡하다. 서빙 백엔드는 특정 커널에 최적화된 레이아웃으로 가중치를 패딩, 셔플 또는 스위즐하는 경우가 많다. 학습 시스템은 일반적으로 다른 표준 텐서 표현을 유지한다.
이러한 변환은 저지연 업데이트나 원격 직접 메모리 액세스를 방해할 수 있다. 백엔드별 레이아웃마다 검증 가능한 상태로 유지해야 하는 단계가 하나씩 추가된다. 모든 정책 업데이트가 비용이 큰 재패킹을 유발한다면 빠른 커널의 가치는 제한적이다.
하드웨어 특수성은 상업적 위험을 만든다. MXFP8과 NVFP4는 Blackwell에서 네이티브 가속을 받지만, 많은 조직은 여전히 Hopper 하드웨어를 운영한다. 새 레시피를 채택하면 여러 정밀도 경로에 걸쳐 인프라 지원이 분리될 수 있다.
공개된 근거에는 독립적인 재현도 없다. 결과는 레시피를 설계하고 구현한 팀에서 나왔다. 이는 초기 엔지니어링 보고서로서는 적절하지만, 제3자 재현은 신뢰를 강화할 것이다.
이러한 한계 중 어느 것도 관찰된 결과를 지우지는 않는다. 그것들은 결과의 의미를 규정한다. Miles는 세심하게 제어된 저정밀도가 하나의 까다로운 구성에서 BF16 보상을 따라가면서 롤아웃 시간을 줄일 수 있음을 보여줬다.
다음 기준은 더 어렵다. 레시피는 더 긴 실행, 다양한 작업, 비동기 업데이트, 더 큰 모델, 서로 다른 병렬화 레이아웃에서도 안정적으로 유지돼야 한다. 또한 모든 프레임워크 오버헤드가 측정에 포함된 뒤에도 이점을 보존해야 한다.
레시피의 확장성을 결정할 세 가지 신호
다음 세 가지 신호는 융합 NVFP4 학습, 독립적인 보상 재현, 그리고 추가 BF16 가중치 사본의 제거다.
첫째, 토큰별 NVFP4 스케일링을 위한 보류 중인 TransformerEngine 통합을 주시해야 한다. Miles는 이미 FlashInfer의 롤아웃 경로에서 융합 스케일링을 사용하지만, 측정된 학습 경로에서는 별도 연산을 수행한다. 통합은 NVFP4가 롤아웃 시간뿐 아니라 학습 시간도 개선할 수 있는지를 보여줄 것이다.
더 빠른 엔드투엔드 결과는 이 형식의 근거를 강화할 것이다. 학습 속도 저하가 계속된다면 그 매력은 롤아웃 비중이 큰 워크로드로 좁혀질 것이다. 어느 결과든 4비트 연산이 실질적 가치를 만들어내는 위치를 명확히 할 것이다.
둘째, 서로 다른 모델과 작업 전반에서 독립적인 재현이 나오는지 지켜봐야 한다. 가장 가치 있는 시험에는 코딩, 장문 컨텍스트 추론, 도구 사용, 비동기 RL이 포함될 것이다. 여러 시드는 형식의 동작과 일반적인 보상 분산을 구분하는 데 도움이 된다.
이러한 워크로드에서 유사한 보상 곡선이 나타난다면 Miles의 일관성 논지를 뒷받침할 것이다. 반대로 특정 레이어나 작업에서의 차이는 BF16 예외가 어디까지 확장돼야 하는지를 식별할 것이다. 어느 결과든 하나의 보편적 정밀도 규칙보다 더 유용할 것이다.
셋째, Megatron이 레시피의 가중치 레이아웃을 지원하면서 추가 BF16 가중치 사본을 제거할 수 있는지 지켜봐야 한다. 이 변화는 호환성 요구사항 때문에 현재 가려진 메모리 이점을 드러낼 것이다. 또한 저정밀 정책이 시스템의 주 저장 표현이 될 수 있는지도 시험하게 된다.
Miles Blackwell 작업은 중요한 엔지니어링 경계를 넘어섰다. MXFP8과 토큰별 NVFP4는 이제 고립된 추론 또는 학습 시험에만 등장하는 것이 아니라 하나로 연결된 RL 루프에 참여한다.
더 날카로운 질문은 더 이상 Blackwell이 4비트 및 8비트 연산을 실행할 수 있는지 여부가 아니다. 그 값들을 다루는 모든 시스템 전반에서 팀이 하나의 정책을 보존할 수 있는지가 핵심이다. Qwen3 곡선을 일반적 결과로 받아들이기 전에 통합, 재현, 메모리 변화를 추적해야 한다.


