Meta Engineering, 광고 모델 규모 확장 속 GEM 학습 효율 두 배 향상 발표
- Aisha Washington

- 50분 전
- 12분 분량
Meta Engineering은 새 기술 공개를 통해 각 학습 실행의 모델 연산량을 네 배로 늘리면서 GEM의 엔드투엔드 학습 효율을 두 배로 높였다고 밝혔다. GEM은 이제 수천 개의 현세대 GPU 전반에서 20%~25%의 Model FLOPs Utilization을 달성한다.
이 결과가 중요한 이유는 가속기를 추가하면 대개 새로운 병목이 생기기 때문이다. 통신량은 늘어나고, 장애의 영향은 더 커지며, 불균형한 워크로드 탓에 고가의 하드웨어가 대기하게 된다. Meta는 GEM의 학습 워크로드가 크게 커지는 과정에서도 효율을 높였다고 말한다.
따라서 이 경쟁 구도는 Meta와 다른 광고 기업 간의 대결이 아니다. 이는 시스템 엔지니어링과 무작정 GPU를 늘리는 방식의 대결이다. Meta의 GEM 학습 사례는 이 효율 향상을 모델 아키텍처, 데이터 이동, 병렬화, 커널, 안정성 전반의 조율된 결과로 제시한다.
Generative Ads Recommendation Model의 약자인 GEM은 Facebook과 Instagram의 광고 지면 전반에서 추천을 담당하는 기반 모델이다. 이는 더 작은 프로덕션 모델이 엄격한 지연 시간 제한 아래에서 광고 순위를 매길 때 활용할 수 있는 공통 패턴을 학습한다.
이 모델은 규모 면에서 대규모 언어 모델과 닮았지만, 워크로드는 다르다. 언어 모델은 비교적 규칙적인 토큰 시퀀스를 처리한다. 반면 광고 시스템은 불규칙한 행동 이력, 방대한 임베딩 테이블, 다양한 목표, 그리고 지속적으로 변하는 데이터를 결합한다.
Meta는 외부인이 새 결과를 재현할 만큼 충분한 정보를 공개하지 않았다. GEM의 정확한 GPU 수, 학습 기간, 에너지 소비량, 절대 비용도 밝히지 않았다. 따라서 보고된 20%~25% MFU는 유용하지만 완전한 효율성 감사 결과는 아니다.
그럼에도 이번 공개는 추천 엔지니어링의 중요한 변화를 보여준다. Meta는 광고 랭킹을 기반 모델 문제로 다루고, 그 결정에 맞춰 학습 시스템을 다시 구축하고 있다.
Meta Engineering, GEM을 새로운 학습 단계로 끌어올리다
핵심 변화는 단순히 GPU 클러스터가 커진 데 있지 않다. Meta는 GEM이 모델 연산을 네 배 더 수행하면서도 할당된 하드웨어를 약 두 배 더 효율적으로 사용한다고 밝혔다.
Model FLOPs Utilization, 즉 MFU는 모델이 정의한 수학 연산에 사용되는 이론적 가속기 처리량의 비율을 측정한다. 25% MFU가 GPU가 75%의 시간 동안 유휴 상태라는 뜻은 아니다. 일부 용량은 통신, 메모리 이동, 데이터 준비, 동기화 및 기타 필수 작업을 지원한다.
이 구분은 GEM 규모에서 중요하다. Meta는 수조 개의 희소 파라미터와 수십억 개의 밀집 파라미터를 포함하는 모델을 설명한다. 희소 파라미터에는 각 예시에서 관련 부분집합만 참여하는 대규모 임베딩 구조가 포함된다. 밀집 파라미터는 훨씬 더 일관되게 참여한다.
따라서 파라미터 수만으로는 학습 비용을 거의 알 수 없다. 총량이 비슷한 두 모델도 실제 연산량, 메모리 트래픽, 통신 패턴은 크게 다를 수 있다. GEM의 학습 FLOPs 네 배 증가는 Meta가 한 번의 실행에서 수행하는 작업을 확대했다는 점을 더 유용하게 보여준다.
Meta는 현재 시스템이 수천 개의 최신 세대 GPU에서 학습된다고 말한다. 이는 GEM의 분산 학습 문제를 소규모 클러스터에서 실행되는 기존 추천 작업보다 최첨단 언어 모델 인프라에 더 가깝게 만든다.
회사는 수년간 이 방향으로 나아가고 있다. 전통적인 딥러닝 추천 모델은 수작업으로 설계한 특성과 압축된 표현에 크게 의존했다. Meta의 이전 시퀀스 학습 연구는 완전한 행동 이벤트 스트림으로 관심을 옮겼다.
이 접근법은 사용자가 상호작용 전후에 무엇을 했는지에 관한 더 많은 정보를 보존한다. 행동을 고정된 요약 통계 집합으로 다루는 대신, 이벤트의 순서와 시점, 맥락을 포착할 수 있다.
하지만 더 길고 다양한 시퀀스는 연산 부담을 키운다. 사용자마다 이력 길이가 다르다. 어떤 예시는 다른 예시보다 훨씬 많은 처리가 필요해 배치 내부와 GPU 간 불균형을 만든다.
GEM은 여러 지면과 목표에 걸쳐서도 학습한다. Instagram 동영상 상호작용은 Facebook Feed 예측을 개선하는 정보를 제공할 수 있다. 광고주 목표는 인지도부터 클릭, 메시지, 구매 또는 기타 전환까지 다양하다.
이러한 공동 학습은 기반 모델 전략의 핵심이다. Meta는 각 랭킹 시스템을 고립된 지능으로 학습시키는 대신, GEM을 활용해 재사용 가능한 표현과 예측을 개발한다. 이후 더 작은 가치 모델은 특화된 프로덕션 작업을 위해 그 지식을 흡수할 수 있다.
Meta는 앞서 GEM의 아키텍처가 동일한 데이터와 컴퓨팅 자원에서 이전 랭킹 모델보다 네 배 높은 광고 성과 향상을 제공했다고 보고한 바 있다. 이는 모델 품질에 대한 주장이지, 최신 공개에서 언급된 학습 컴퓨팅 네 배 증가를 뜻하는 것은 아니다.
이 수치들을 분리해 이해하는 것이 중요하다. 하나는 학습 입력 단위당 주장되는 효과를 설명한다. 다른 하나는 새로운 학습 실행이 수행하는 수학적 작업의 양을 설명한다.
새 효율성 결과는 Meta가 인프라 오버헤드가 추가된 용량을 잠식하지 않도록 하면서 GEM을 확장했다고 말하는 것을 의미한다. 이것이 이번 사건의 진정한 기술적 의미다.
GPU를 늘리면 대개 효율이 떨어지는 이유
분산 학습은 연산 능력이 부족해지기 훨씬 전에 조정 문제에 부딪힌다. GPU를 하나 추가할 때마다 대기, 불균형, 장애가 발생할 기회도 늘어난다.
학습 단계에서는 가속기가 데이터를 처리하고, 중간 결과를 교환하며, 그래디언트를 결합하고, 모델 상태를 업데이트해야 한다. 한 워커가 뒤처지면 나머지 워커는 동기화 지점에 도달해 기다리게 될 수 있다.
이 문제는 불규칙한 추천 데이터에서 더 심각해진다. 사용자 이력은 길이가 제각각이고, 희소 특성 접근도 예시마다 다르다. 예시 수가 같다고 해서 작업량까지 같은 것은 아니다.
밀집 Transformer도 이미 신중한 병렬화가 필요하다. 추천 모델에는 밀집 레이어와 다른 통신 특성을 지닌 대규모 희소 구성 요소가 추가된다. 하나의 전략으로는 두 요소를 모두 효율적으로 분산할 수 없다.
Meta는 밀집 모델 구성 요소에 Hybrid Sharded Data Parallelism을 사용한다. HSDP는 GPU 그룹 내에서 모델 상태를 분할하면서, 선택한 상태는 그룹 간에 복제한다. 목표는 모든 통신 작업을 클러스터 전체로 보내지 않으면서 메모리 소비를 제어하는 것이다.
GEM의 희소 구성 요소에는 다른 구성이 필요하다. Meta는 동기화 비용과 메모리 지역성을 중심으로 조직된 데이터 병렬화와 모델 병렬화의 2차원 조합을 설명해 왔다.
데이터 병렬화는 모델 사본 또는 샤드를 유지하면서 워커에 서로 다른 예시를 제공한다. 모델 병렬화는 모델 자체를 여러 장치에 나눈다. 두 방식을 결합하면 충분한 병렬 작업을 유지하면서 대규모 임베딩 구조를 수용 가능한 위치에 배치할 수 있다.
이 설계에는 어려운 상충 관계가 따른다. 더 많은 샤딩은 각 가속기의 메모리 부담을 줄이지만 통신량을 늘린다. 더 많은 복제는 일부 통신을 줄일 수 있지만 부족한 고대역폭 메모리를 소비한다.
바로 여기서 무작정 규모를 키우는 방식이 한계에 부딪힌다. 클러스터를 두 배로 늘린다고 유효 연산량이 자동으로 두 배가 되지는 않는다. 더 큰 작업은 데이터를 교환하거나 지연 워커를 기다리거나, 장애 후 손실된 상태를 복구하는 데 더 많은 시간을 쓸 수 있다.
Google은 PaLM 연구에서 이 문제의 다른 측면을 보여줬다. 5,400억 파라미터 PaLM 시스템은 밀집 언어 모델 아키텍처와 고도로 최적화된 소프트웨어 스택을 사용해 6,144개의 TPU v4 칩에서 46.2% MFU를 보고했다.
이 수치가 PaLM 시스템이 GEM보다 우수하다는 뜻은 아니다. 아키텍처, 하드웨어, 데이터, MFU 계산 방식이 서로 다르다. GEM의 희소 추천 워크로드는 직접적인 순위 비교를 오도할 수 있는 통신 및 메모리 접근 패턴을 수반한다.
그럼에도 이 비교는 독자에게 유용한 기준점을 제공한다. MFU 결과는 그것을 만들어낸 워크로드의 맥락에서만 의미가 있다. 밀집 Transformer 벤치마크는 희소 광고 모델의 보편적인 목표가 될 수 없다.
Meta의 20%~25% 범위는 주장된 엔드투엔드 두 배 향상과 함께 볼 때 더 많은 정보를 제공한다. 핵심 결과는 학습 연산이 네 배로 늘어나는 동안 GEM의 이전 기준선에서 얼마나 개선됐는지에 있다.
엔드투엔드 효율성은 커널 속도를 넘어선다. 입력 파이프라인이 멈추거나, 체크포인팅이 클러스터를 멈추거나, 워커가 반복적으로 재시작하면 빠른 행렬 곱셈도 도움이 되지 않는다.
Meta는 이전에 GEM이 학습 레시피 전면 개편을 필요로 했다고 밝힌 바 있다. 이전 세대는 GPU를 16배 더 사용하면서 유효 학습 FLOPs를 23배 늘렸고, MFU도 1.43배 증가했다.
2026년 8월의 결과는 이 확장 프로그램의 또 다른 단계다. 이는 하드웨어 추가와 기본 병렬화에서 얻을 수 있는 비교적 쉬운 이점을 이미 확보한 뒤에도 회사가 추가적인 개선을 찾았음을 시사한다.
이는 모든 대형 추천 사업의 인프라 팀에 압박을 가한다. GPU 접근성은 여전히 중요하지만, 접근성만으로 이론적 처리량을 모델 발전으로 바꿀 수는 없다.
효율 향상은 모델-시스템 공동 설계에서 나왔다
Meta는 GEM의 효율을 두 배로 높인 단일 최적화를 지목하지 않았다. 이 성과는 모델과 학습 스택이 하나의 시스템처럼 작동하도록 만든 데서 나왔다.
추천 모델은 표준 언어 모델 커널이 항상 효율적으로 처리하지 못하는 작업을 만든다. 행동 이력은 길이가 가변적인 경우가 많으며, 이를 흔히 jagged sequence라고 부른다. 모든 시퀀스를 동일한 최대 길이로 패딩하면 빈 위치에 대한 연산이 낭비된다.
Meta는 이러한 불규칙한 입력을 위한 맞춤형 GPU 커널을 개발했다. 커널 융합은 여러 연산을 결합해 데이터가 가속기 메모리와 개별 처리 단계 사이를 이동하는 시간을 줄인다.
이 접근은 대규모 모델 학습의 폭넓은 교훈을 따른다. 최고 하드웨어 사양은 이상적인 산술 처리량을 설명하지만, 실제 작업은 메모리 대역폭, 실행 오버헤드 또는 통신에 의해 제한되는 경우가 많다.
GEM의 어텐션 메커니즘도 익숙한 Transformer 방식과 다르다. Generalized dot-product attention은 표준 softmax 연산을 서로 다른 특성 상호작용 작업에 적합한 대체 활성화 함수로 바꾼다.
공개된 어텐션 커널 설계는 GEM 내에서 사용되는 InterFormer 및 Kunlun 아키텍처 지원을 설명한다. 이는 추천 시스템이 표준 언어 모델 어텐션 커널보다 더 큰 유연성을 필요로 하는 이유를 보여준다.
InterFormer는 시퀀스 학습과 교차 특성 상호작용을 번갈아 수행한다. 이 구조를 통해 GEM은 세밀한 행동 시퀀스를 유지하면서 광고주, 사용자, 게재 위치, 크리에이티브 속성과 연결할 수 있다.
Kunlun은 비시퀀스 특성에 대한 상호작용 모델링을 확장한다. 이러한 특성에는 자연스럽게 시간순 스트림을 이루지 않는 사용자 또는 광고 속성이 포함될 수 있다.
이러한 아키텍처를 범용 커널로 지원하면 오버헤드가 발생한다. 각 변형을 서로 무관한 맞춤형 코드로 지원하면 유지보수 문제가 생긴다. 일반화된 커널은 최적화된 실행 패턴을 활용하면서도 유연성을 유지하는 중간 지점을 모색한다.
Meta는 GPU 통신의 변화도 설명했다. NVIDIA Collective Communications Library의 확장인 NCCLX는 Streaming Multiprocessor 리소스를 소모하지 않고 선택된 통신을 수행할 수 있다.
Streaming Multiprocessor, 즉 SM은 대부분의 GPU 연산을 실행한다. 통신 작업이 동일한 리소스를 놓고 경쟁하면 연산과 네트워킹의 중첩 효율은 떨어진다.
이러한 경합을 제거하면 모델의 일부가 계산을 수행하는 동안 다른 데이터는 디바이스 간에 이동할 수 있다. 하나의 작업이 수천 개의 가속기에 걸쳐 실행되고 각 단계에서 여러 지점의 정보를 교환할수록 그 이점은 커진다.
데이터 로딩은 또 다른 잠재적 병목이다. GEM은 학습 클러스터가 계속 가동되도록 충분한 속도로 변화하는 상호작용 데이터를 지속적으로 수집해야 한다. 더 빠른 GPU는 업스트림 지연을 오히려 더 부각할 뿐이다.
체크포인팅 역시 핵심적인 문제가 된다. 체크포인트는 중단 후 작업을 복구할 수 있도록 학습 상태를 저장한다. 더 큰 모델은 더 큰 상태 스냅샷을 만들고, 더 큰 클러스터는 하드웨어 또는 네트워크 장애가 발생할 누적 기회를 늘린다.
빈번한 체크포인트는 손실되는 작업량을 줄이지만 더 많은 시간과 스토리지 대역폭을 소모한다. 드문 체크포인트는 정상 상태 처리량을 높이지만 장애 후 다시 수행해야 하는 학습량을 늘린다.
완전한 효율성 프로그램은 두 결과의 균형을 맞춰야 한다. 가장 빠르게 중단 없이 실행되는 구간만 최적화하고 시작, 검증, 체크포인팅 또는 복구를 무시해서는 안 된다.
Meta는 앞서 트레이너 초기화, 데이터 리더, 체크포인팅 및 PyTorch 컴파일을 최적화한 뒤 GEM 작업 시작 시간을 5분의 1로 줄였다고 보고했다. 이러한 작업은 핵심 모델 아키텍처 밖에 있지만, 고비용 용량이 생산적인 작업을 얼마나 빨리 시작하는지를 결정한다.
이것이 새로운 주장이 엔드투엔드 효율성을 사용하는 이유를 설명한다. 이 표현은 고립된 커널 벤치마크보다 학습 프로세스의 더 넓은 범위를 아우르는 측정을 뜻한다.
이 결과는 Meta의 파운데이션 모델 전략과 인프라 전략이 분리될 수 없는 이유도 보여준다. 공유 모델은 그 표현이 여러 광고 지면에 혜택을 주기 때문에 더 큰 엔지니어링 투자를 정당화할 수 있다.
하나의 지면을 위한 소규모 랭킹 모델이라면 맞춤형 통신 라이브러리와 특수 커널을 정당화하기 어려울 수 있다. Facebook과 Instagram에 영향을 미치는 중앙 모델은 각각의 인프라 개선에서 더 큰 수익을 창출한다.
이 피드백 루프는 막대한 규모로 운영하는 기업에 유리하다. 더 많은 상호작용은 더 폭넓은 학습을 지원하고, 더 폭넓은 모델은 더 많은 제품 전반에서 효율성 투자를 유용하게 만든다.
같은 루프는 위험도 만든다. 학습을 중앙화하면 모델 오류나 데이터 편향이 여러 지면으로 확산될 수 있다. Meta는 공유 표현이 제품 간의 의미 있는 차이를 지우지 않도록 도메인별 목표를 유지해야 한다.
Meta의 아키텍처는 멀티도메인 학습과 특화된 다운스트림 모델을 통해 이러한 과제에 대응한다. 파운데이션 모델은 지식을 공유하는 반면, 프로덕션 시스템은 지면 수준의 제약과 목표를 유지한다.
이는 하나의 모델이 실시간으로 모든 광고를 직접 선택하는 방식이 아니다. GEM은 지연 시간에 민감한 시스템이 실제 운영 결정을 내리는 더 넓은 랭킹 및 전달 스택에 학습된 정보를 제공한다.
GEM이 무차별적 스케일링 전략을 압박한다
이 결과는 경쟁 우위가 주로 더 많은 가속기를 구매하는 데서 나온다는 가정을 약화시킨다. 이 규모에서는 조정의 품질이 하드웨어가 만들어내는 가치를 결정한다.
Meta는 매우 큰 GPU 클러스터를 운용할 여력이 있지만, 이를 효율적으로 사용할 강력한 이유도 있다. 광고는 사업 대부분의 자금을 뒷받침하며, 작은 개선도 막대한 수의 랭킹 결정 전반의 결과에 영향을 미칠 수 있다.
GEM의 역할은 인프라 지출을 이 수익 엔진과 연결한다. 더 나은 공유 표현은 참여, 전환 및 기타 광고주 성과를 예측하는 소형 모델을 개선할 수 있다.
파운데이션 모델 접근 방식은 모델 팀의 업무 방식도 바꾼다. 고립된 모델의 집합은 학습과 인프라를 중복할 수 있다. GEM은 다운스트림 팀이 조정할 수 있는 중앙 표현 소스를 제공한다.
Meta는 이러한 특화 시스템을 가치 모델이라고 부른다. 이들은 엄격한 응답 시간과 지면별 서로 다른 목표를 포함해 대형 파운데이션 모델이 직접 충족할 수 없는 프로덕션 제약 내에서 작동한다.
지식 증류는 더 큰 교사 모델의 동작을 더 작은 학생 모델로 이전한다. Meta는 자사의 최신 전이 프레임워크가 표준 증류보다 두 배 더 효과적이라고 말하지만, 외부인은 공개된 자료만으로 그 비교를 검증할 수 없다.
파라미터 공유는 또 다른 전이 경로를 제공한다. 다운스트림 모델은 전체 파운데이션 모델을 재현하는 대신 선택된 구성 요소를 재사용할 수 있다. 이는 특화된 실행을 유지하면서 중복을 줄인다.
이 아키텍처는 팀이 각 지면이나 목표별로 별도의 랭커를 계속 개선하는 더 분절된 방식과 경쟁한다. 분절화는 제어와 디버깅을 쉽게 만들 수 있지만, 공유 학습을 제한한다.
중앙 접근 방식은 한 지면의 증거를 다른 지면 개선에 사용할 수 있다. 또한 개별 모델이 의미 있는 결과를 너무 적게 보게 되는 희소한 목표 전반에서 학습할 수 있다.
다른 주요 플랫폼도 같은 전략적 질문에 직면해 있다. Google은 대규모 추천 연구를 광고 시스템과 결합하고 있으며, TikTok의 제품은 시퀀스 기반 추천에 크게 의존한다. 이들의 내부 측정치는 Meta의 GEM 공개 내용과 공개적으로 비교할 수 없다.
따라서 관련 압력은 단일 벤치마크보다 더 광범위하다. Meta는 LLM 규모 인프라 방식이 수익에 중요한 추천 학습으로 옮겨갈 수 있음을 보여주고 있다.
Meta의 적응형 랭킹 시스템은 이에 상응하는 서빙 문제를 다룬다. 프로덕션 시스템이 광고 지연 시간과 비용 제약 안에서 그 학습을 적용할 수 없다면 더 큰 모델을 학습하는 가치는 제한적이다.
Meta의 스택은 과제를 분할한다. GEM은 학습 중 비용이 큰 공유 학습을 수행한다. 특화된 랭킹 모델과 최적화된 런타임은 그 지능을 실시간 전달로 가져간다.
Andromeda는 파이프라인의 또 다른 부분을 담당한다. 이후 랭킹 단계가 더 면밀히 평가하기 전에 훨씬 큰 풀에서 더 작은 광고 후보 집합을 검색한다.
생성형 도구가 사용할 수 있는 광고 변형의 수를 늘리면서 이 구분은 중요해진다. 더 많은 크리에이티브 옵션은 후보 공간을 확장해 효과적인 검색과 랭킹의 가치를 높인다.
GEM은 광고주가 관련성 있는 제안과 신뢰할 수 있는 메시지를 만들어야 할 필요를 없애지 않는다. 더 나은 모델은 이용 가능한 옵션 중에서 선택할 수 있지만, 수요를 보장하거나 취약한 경제성을 해결할 수는 없다.
시스템은 해석하기도 더 어려워질 수 있다. 중앙 모델이 여러 지면에 걸친 패턴을 학습해 이를 다운스트림 모델로 전달하면, 하나의 전달 결과를 하나의 요인으로 추적하기 어려워진다.
광고주는 그에 상응하는 설명을 받지 못한 채 성과 변화를 경험할 수 있다. Meta는 내부적으로 집계된 개선을 측정할 수 있지만, 개별 구매자가 보는 결과는 예산, 잠재고객, 크리에이티브, 경쟁 및 어트리뷰션에 따라 달라진다.
이 정보 격차는 캠페인 영향에 관한 광범위한 주장을 완화해야 한다. 학습 효율성은 인프라 성과다. 모든 광고주에게 균일한 전환 개선을 보장하지는 않는다.
Meta의 20%~25% MFU가 보여주지 않는 것
Meta의 핵심 지표는 방향성 있는 진전을 보여주지만, GEM 학습의 전체 경제적 또는 환경적 비용을 드러내지는 않는다.
MFU는 이론적 최대 처리량 대비 모델 연산에 초점을 맞춘다. 하드웨어가 수행하는 모든 작업을 자동으로 포함하지는 않는다. 또한 작업이 시작되기 전 클러스터 가용성도 고려하지 않는다.
모델이 크게 커지면 시스템은 MFU를 개선하면서도 총에너지를 더 많이 소비할 수 있다. GEM의 학습 FLOPs는 4배 증가했으므로, 한 번의 실행에서 수행되는 절대 작업량은 훨씬 크다.
이러한 확장은 여전히 경제적으로 합리적일 수 있다. 더 큰 모델은 더 나은 예측을 제공할 수 있고, 활용도 향상은 일정한 연산량에 필요한 하드웨어를 줄일 수 있다.
하지만 Meta는 실행당 절대 에너지를 공개하지 않았다. 학습 FLOP당 비용 수치, 총 가속기 시간 또는 동일 하드웨어를 사용한 비교도 제공하지 않았다.
“최신 세대 GPU”라는 표현 역시 중요한 세부 사항을 밝히지 않는다. 가속기 모델, 수치 정밀도, 네트워크 토폴로지 및 전력 제한은 이론적 최대 성능과 측정된 MFU에 실질적인 영향을 줄 수 있다.
MFU 분모의 변화도 중요하다. 최신 GPU는 더 많은 이론적 FLOPs를 제공하지만, 애플리케이션이 항상 그 기능을 똑같이 활용하는 것은 아니다. 세대 간 백분율을 비교하려면 신중한 정규화가 필요하다.
시스템이 바뀌는 동안 모델 자체도 바뀌었다. 4배 더 많은 학습 FLOPs는 연산 크기, 배치 동작, 연산과 통신 간의 균형을 바꿀 수 있다.
더 큰 행렬 연산은 때때로 더 작은 연산보다 GPU를 더 효율적으로 사용한다. 따라서 MFU 향상의 일부는 보편적으로 재사용 가능한 소프트웨어 개선이 아니라 워크로드 형태에서 비롯될 수 있다.
Meta의 엔드투엔드 프레이밍은 도움이 되지만, 공개된 설명은 여전히 시스템을 운영하는 회사에서 나온 것이다. 독립적인 제3자가 GEM을 재현하거나 보고된 효율성을 감사한 것은 아니다.
이 한계가 수치를 무의미하게 만드는 것은 아니다. 내부 프로덕션 시스템에는 종종 독점 데이터와 아키텍처가 포함된다. 완전한 재현은 프라이버시, 보안 및 경쟁상의 우려를 제기할 수 있다.
다만 독자는 “두 배”를 Meta 자체의 이전 GEM 스택과 비교한 보고된 수치로 받아들여야 한다. 이는 GEM이 모든 경쟁 추천 모델보다 두 배 효율적이라는 증거는 아니다.
모델 품질 주장은 비슷한 주의가 필요하다. Meta는 앞서 고정된 데이터와 연산량에서 광고 성과 향상을 만들어내는 GEM의 효율성이 4배 높아졌다고 말했다. 회사는 경쟁 플랫폼을 포함하는 공개 벤치마크를 발표하지 않았다.
프로덕션 광고 성과도 시간에 따라 변한다. 경매 조건, 크리에이티브 공급, 사용자 행동, 프라이버시 규칙 및 측정 방법은 관측된 개선에 영향을 줄 수 있다.
중앙화는 운영상 위험도 도입한다. 여러 제품에서 사용되는 파운데이션 모델은 중요한 의존성이 된다. 학습 지연이나 결함 있는 업데이트는 고립된 단일 모델 내 문제보다 더 많은 팀에 영향을 미칠 수 있다.
Meta는 체크포인트, 검증, 특화된 가치 모델 및 통제된 지식 전이를 통해 이를 완화한다. 그럼에도 새로운 규모는 실수의 비용을 높인다.
프라이버시는 또 다른 경계다. GEM은 Meta의 애플리케이션 전반에서 광고 및 유기적 참여 신호를 학습한다. 시스템이 내부 통제를 중심으로 설계됐더라도, 더 광범위한 시퀀스 모델링은 행동에서 더 풍부한 패턴을 추출할 수 있다.
기술 공개는 새로운 프라이버시 정책 분석을 제공하지 않는다. 독자는 더 높은 학습 효율성이 Meta가 수집하는 데이터나 그 사용을 규율하는 보호 조치를 바꾼다고 추론해서는 안 된다.
엔지니어에게 주는 교훈은 더 좁고 구체적이다. MFU는 작업 완료율, 복구 시간, 데이터 처리량, 에너지 사용량 및 모델 품질 개선과 함께 여러 진단 지표 중 하나여야 한다.
복잡한 시스템을 문서화하는 팀은 이러한 차이를 검색 가능한 engineering knowledge base에 보존할 수 있습니다. 이러한 관행은 하나의 매력적인 지표가 전체 운영 상황을 대체하는 것을 막는 데 도움이 됩니다.
Meta Engineering 스토리를 시험할 세 가지 신호
다음 시험대는 GEM의 인프라 개선이 학습 비용이나 운영 리스크의 비례적 증가 없이 반복 가능한 모델 개선으로 이어지는지 여부입니다.
첫 번째 신호는 컴퓨팅 단위당 모델 품질에 관한 Meta의 다음 공개입니다. 학습 FLOPs가 4배 늘어난 것은 규모를, 더 높은 MFU는 더 나은 활용률을 보여 줍니다. 그러나 어느 하나만으로는 더 큰 학습 실행이 만들어 낸 한계 광고 가치를 알 수 없습니다.
향후 비교에서는 추가 데이터, 아키텍처 변경, 학습 기간, 하드웨어 개선에서 비롯된 이득을 분리해야 합니다. Meta가 통제된 컴퓨팅 예산 아래에서 더 나은 성과를 보고한다면, 파운데이션 모델의 근거는 더욱 강해질 것입니다.
컴퓨팅 사용량은 계속 늘어나는데 품질 향상이 둔화된다면, 효율성 성과는 더 방어적인 것으로 보일 것입니다. Meta는 하드웨어를 더 잘 활용하고 있겠지만, 추가 학습 단위마다 제공하는 사업 가치는 줄어들 수 있습니다.
두 번째 신호는 Facebook과 Instagram 전반의 영역에서 GEM 기반 학습이 더 폭넓게 배포되는지입니다. Meta는 GEM을 기존 시스템을 대체하는 모델이 아니라 프로덕션 시스템에 지식을 전이하는 중앙 모델로 제시해 왔습니다.
성공적인 확장은 더 많은 다운스트림 모델이 공유 구성 요소나 개선된 전이 방식을 채택하는 모습으로 나타나야 합니다. 동시에 서로 다른 게재 위치와 광고주 목표에 필요한 특화된 동작도 유지해야 합니다.
파운데이션 모델이 성장해도 배포가 안정적으로 유지된다는 증거를 주시해야 합니다. 팀이 결과를 충분히 빠르게 검증, 증류 또는 서빙할 수 없다면 더 빠른 학습은 가치를 잃습니다.
세 번째 신호는 Meta가 다음으로 공개할 인프라 병목 지점입니다. 2배의 효율 향상이 스케일링 문제를 끝내는 경우는 드뭅니다. 보통은 제약 요인을 다른 곳으로 옮길 뿐입니다.
그 제약은 네트워크 통신, 체크포인트 스토리지, 데이터 수집, 컴파일, 신뢰성 또는 프로덕션 추론에서 나타날 수 있습니다. Meta의 이전 작업은 이미 이러한 계층 대부분을 거쳐 왔습니다.
새로운 병목 지점이 현재의 성과를 무효화하는 것은 아닙니다. 이는 GEM이 완성된 플랫폼이 아니라 여전히 적극적으로 재구성되는 시스템임을 보여 줄 것입니다.
가장 강력한 확인은 세 가지 결과를 결합할 것입니다. 더 높은 광고 품질, 안정적인 다운스트림 배포, 그리고 유용한 개선 단위당 비용 증가세의 둔화입니다. 이 결과 중 하나라도 빠지면 더 큰 주장은 약화될 것입니다.
개발자들은 Meta가 기반 작업을 PyTorch 또는 관련 오픈 소스 인프라에 더 많이 기여하는지도 지켜봐야 합니다. 일반화된 어텐션 커널은 내부 요구사항이 재사용 가능한 엔지니어링으로 전환되는 한 사례입니다.
재사용 가능한 구성 요소는 대부분의 조직이 GEM의 클러스터를 그대로 복제할 수 없기 때문에 중요합니다. 그렇더라도 불규칙한 시퀀스 처리, 통신 오버랩, 융합 연산 또는 분산 체크포인트를 더 잘 활용하는 이점을 얻을 수 있습니다.
광고주에게 관련된 질문은 다릅니다. 특히 계정이 제한적인 과거 데이터를 제공할 때, 캠페인 성과가 게재 위치와 목표 전반에서 더 일관되게 나타나는지 지켜봐야 합니다.
인프라 리더에게 GEM은 더 즉각적인 과제를 제시합니다. 할당된 가속기 용량 중 얼마가 모델 발전에 기여하는지 측정한 뒤, 전체 학습 수명 주기에서 남아 있는 모든 손실을 추적해야 합니다.
Meta Engineering은 인상적인 수치를 제시했습니다. 엔드투엔드 효율을 2배로 높인 뒤 MFU 20%~25%를 달성했습니다. 더 깊은 메시지는 가속기 수가 이제 AI 역량을 측정하는 불완전한 척도가 되었다는 것입니다.
다음 우위는 구매한 컴퓨팅 자원을 더 많이 신뢰할 수 있는 학습으로 전환하는 데서 나올 것입니다. GEM은 이제 그러한 전환에 얼마나 많은 엔지니어링이 필요한지 보여 줍니다. 여러분의 학습 시스템 내부에서 가장 큰 손실을 드러낼 지표는 무엇이며, 다음 클러스터를 구매하기 전에 팀이 이를 측정할 수 있을까요?


