top of page

Dwarkesh Patel 사전학습 연구, 데이터가 모델 개선을 앞질렀다고 밝혀

9월 10일
13분 분량

Dwarkesh Patel은 Jerry Han과 함께 사전학습 연구를 발표했으며, 여기서 주목할 만한 결과가 나왔다. 데이터 개선은 컴퓨팅 효율을 12배 높인 반면, 동일한 실험 프레임워크에서 모델 레시피 개선은 3.7배의 향상에 그쳤다. 따라서 Dwarkesh Patel 사전학습 연구는 데이터에 기인한 효율성 진전이 약 3.24배 더 크다고 분석한다.

이 발견은 언어 모델 발전에 관한 익숙한 설명에 이의를 제기한다. 공개 논의는 흔히 아키텍처, 옵티마이저, 더 큰 클러스터, 새로운 어텐션 메커니즘에 초점을 맞춘다. 그러나 Patel과 Han은 검증 범위 내에서 더 나은 코퍼스가 더 큰 효율성 우위를 만들었다고 확인했다.

연구진은 GPT-2 시대 시스템부터 OLMo-2 시대 레시피까지, 공개 사전학습의 6년간 발전을 재구성했다. 대표적인 모델 설계와 대표적인 데이터셋을 결합하고, 여러 컴퓨팅 예산에서 해당 조합을 학습시켰다. 이는 더 나은 기계와 더 나은 재료라는 두 가지 설명을 직접 겨루게 한다.

이 결과가 OpenAI, Anthropic, Google DeepMind 또는 Meta 내부에서 실제로 어떤 일이 있었는지를 입증하는 것은 아니다. 이들 기업은 현재 학습 데이터에 관한 제한적인 정보만 공개한다. 다만 데이터 엔지니어링을 부차적인 문제로 여기는 사람들에게는 입증 책임의 기준을 바꾼다.

Dwarkesh Patel 사전학습 연구, 6년간의 진전을 재구성하다

Patel과 Han은 일반적으로 함께 변하는 두 변수, 즉 모델 레시피와 학습 코퍼스를 분리하려 했다.

이들의 사전학습 실험은 2026년 9월 8일 공개됐다. 연구는 2019년부터 2025년까지 출시된 대표적인 공개 모델 레시피와 공개 데이터셋을 다룬다. 저자들은 이 구성 요소들의 조합을 처음부터 학습했다.

모델 레시피에는 아키텍처, 옵티마이저, 초기화, 학습률 스케줄, 정규화 방식 및 기타 학습 선택이 포함된다. 코퍼스는 사전학습을 위해 토큰으로 변환된 텍스트의 집합이다. 대부분의 공개 모델 릴리스는 두 요소를 동시에 바꾸므로, 각각의 기여도를 분리하기 어렵다.

모델 축은 GPT-2 레시피에서 시작해 OLMo-2로 끝난다. 중간 변화에는 rotary position embeddings, RMSNorm, SwiGLU 활성화, 수정된 정규화 배치, QK 정규화, 더 정교한 초기화 방식이 포함된다. 각 개선은 모델이 정보를 표현하는 방식이나 학습 중 안정성을 유지하는 방식을 바꾼다.

데이터 축은 OpenWebText에서 시작한다. 이 2019년 코퍼스는 충분히 인기가 높은 Reddit 게시물에 연결된 웹페이지에서 수집한 약 90억 개 토큰을 포함했다. 이후 데이터셋은 더 폭넓은 웹 크롤링, 강화된 추출, 중복 제거, 그리고 점점 더 선별적인 품질 필터를 활용했다.

2025년의 종착점은 UltraFineWeb이었다. 이 파이프라인은 훨씬 더 큰 웹 문서 풀에 보다 정교한 필터링을 적용한다. 일부 최신 필터는 어떤 문서가 후속 모델 성능을 개선할지를 예측하도록 학습된 분류기를 사용한다.

Patel과 Han은 명목상 다섯 가지 컴퓨팅 예산을 테스트했다. 범위는 100경 FLOPs에서 10해 FLOPs까지이며, 1e17에서 1e19 FLOPs로 표기된다. FLOPs는 학습에 소모되는 산술 연산량을 측정한다.

각 예산에서 연구진은 모델 크기와 토큰 수를 모두 변화시켰다. 이 과정은 각 모델·코퍼스 조합에 대한 컴퓨팅 최적 조합을 추정할 수 있게 했다. 컴퓨팅 최적이란 정해진 학습 연산량 안에서 가장 강력한 측정 결과를 내는 것을 뜻한다.

연구진은 실험 전반에서 여러 다른 선택을 통제했다. 모든 실행은 50,257개 토큰 어휘를 가진 GPT-2 BPE 토크나이저를 사용했다. 또한 각각 2,048토큰 컨텍스트 길이와 262,144토큰을 포함한 배치를 사용했다.

연구진은 비교적 접근성이 높은 10개 벤치마크 모음인 OLMES를 통해 최종 역량을 평가했다. 대부분은 객관식 질의응답을 사용한다. 서로 다른 학습 데이터셋에서 크로스 엔트로피 손실을 비교하면 불균등한 시험이 되기 때문에 역량 평가를 선택했다.

이 선택은 중요하다. 학습 분포를 정의하는 데 사용된 동일한 코퍼스를 기준으로 평가한 모델은 인위적인 이점을 얻을 수 있다. 다운스트림 작업은 공통된 목표를 제공하지만, 더 많은 통계적 잡음을 유발한다.

팀은 컴퓨팅 스케일링 곡선에 대해 여러 독립 시드를 실행했다. 시드는 무작위 초기화와 데이터 순서를 바꾸어, 결과가 학습 변동 전반에서 지속되는지 확인하는 데 도움이 된다. 3.16e18 FLOPs에서의 더 큰 7x7 그리드는 조합당 하나의 시드를 사용했다.

1e19-FLOP 예산에서 최신 데이터는 2019년 데이터 기준선 대비 12배의 컴퓨팅 배수를 만들어 냈다. 최신 모델 레시피는 GPT-2 레시피 대비 3.7배의 배수를 보였다. 이 비율은 데이터의 3.24배 우위라는 핵심 수치로 이어졌다.

컴퓨팅 배수는 최신 구성 요소가 이전 구성 요소의 성능에 도달하기 위해 얼마나 적은 연산을 필요로 하는지 설명한다. 이는 모델이 12배 더 지능적으로 변했다는 뜻은 아니다. 선택한 성능 수준과 평가 모음에서의 효율성을 설명하는 지표다.

저자들은 또한 3.16e18 FLOPs에서 데이터와 모델의 이득이 대체로 독립적이라는 사실을 발견했다. 가산 통계 모델은 OLMES 점수 변동의 88%를 설명했다. 상호작용, 고차 효과 또는 평가 잡음에 남은 비중은 약 12%에 불과했다.

이 결과는 더 나은 데이터가 그 이점을 제공하기 위해 특정 아키텍처 하나를 필요로 하지 않았음을 시사한다. 마찬가지로 아키텍처 개선은 대체로 여러 코퍼스에서 유용성을 유지했다. 이러한 독립성은 데이터 기여도를 우연히 성공한 하나의 모델·데이터셋 조합으로 치부하기 어렵게 만든다.

데이터 엔지니어링이 효율성 경쟁에서 이겼다

이 실험에서 모델이 무엇을 읽었는지를 개선하는 일은 그것을 읽는 메커니즘을 개선하는 일보다 더 중요했다.

이 결과는 데이터 중심 언어 모델 연구가 축적해 온 흐름과 맞닿아 있다. 현대의 코퍼스는 단순히 더 큰 인터넷 텍스트 더미가 아니다. 구축자는 더 깨끗한 콘텐츠를 추출하고, 중복을 제거하며, 출처의 균형을 맞추고, 가치가 낮은 문서를 걸러내며, 오염을 통제한다.

중복 제거는 완전히 같거나 거의 동일한 자료를 없앤다. 이를 하지 않으면 자주 복제된 페이지가 학습을 지배해 코퍼스의 실질적인 다양성을 낮출 수 있다. 추출은 메뉴, 광고, 템플릿 문구, 손상된 마크업에서 의미 있는 텍스트를 분리한다.

그다음 필터링은 제한된 학습 연산을 받을 가치가 있는 문서를 결정한다. 초기 필터는 언어, 길이, 반복, 문장부호와 관련된 규칙에 크게 의존했다. 최신 파이프라인은 유용한 텍스트와 도움이 되지 않는 텍스트의 사례를 바탕으로 학습된 분류기를 점점 더 활용한다.

DataComp-LM은 통제된 데이터셋 경쟁을 통해 이 접근법을 측정 가능하게 만들었다. 연구진은 240조 토큰 규모의 Common Crawl 풀을 공개하고 참가자들의 학습 레시피를 고정했다. 이후 팀들은 모델을 바꾸는 대신 필터링과 데이터 혼합 전략으로 경쟁할 수 있었다.

DataComp-LM 결과는 모델 기반 필터링이 가장 강력한 기준선의 핵심이었다고 밝혔다. 70억 파라미터 모델은 2조6천억 토큰을 학습한 뒤 MMLU에서 5-shot 정확도 64%에 도달했다.

이 모델은 보고된 벤치마크에서 더 큰 공개 모델들과 비슷한 성능을 보였다. 저자들은 또한 MAP-Neo 대비 MMLU에서 6.6%포인트 우위를 기록하면서도 학습 컴퓨팅을 40% 적게 사용했다고 보고했다. 이는 별도의 실험이지만, 그 방향성은 Patel과 Han의 결과를 뒷받침한다.

DataComp-LM은 필터 설계가 예상보다 더 중요할 수 있다는 점도 보여줬다. 한 테스트 규모에서 필터링 모델을 바꾸자 5-shot MMLU 정확도는 35%에서 44%로 이동했다. 기초가 되는 원시 웹 풀은 모든 접근법에 동일하게 제공됐다.

놀랍게도 가장 좋은 성능을 보인 필터는 신중하게 선택한 긍정 및 부정 예시를 사용한 비교적 단순한 bigram 분류기였다. 문서 품질에 대한 인간의 판단은 이 실험에서 제한적인 가치를 보였다. 독자에게 세련돼 보이는 것이 항상 더 나은 학습 신호를 만드는 것은 아니다.

FineWeb 연구도 유사한 결론에 도달했다. 제작자들은 대규모 웹 코퍼스 전반에서 추출, 언어 필터링, 중복 제거, 품질 선택 방식을 비교했다. 이 작업은 데이터셋 생성을 단순한 정리 단계가 아닌 실증적 엔지니어링 분야로 다뤘다.

FineWeb 데이터셋은 학습된 분류기로 선택한 교육 중심 하위 집합도 만들었다. 이 전략은 양질의 교육 자료와 유사한 페이지를 강조했다. 이러한 필터는 토큰당 유용한 추론과 사실 정보 밀도를 높이는 것을 목표로 한다.

이러한 역사는 Dwarkesh Patel의 데이터 관련 발견을 설명한다. OpenWebText도 이미 웹을 필터링했지만, 광범위한 품질 신호로 Reddit 인기도를 활용했다. 이후 파이프라인은 실제 모델 성능을 기준으로 더 직접적인 신호를 테스트했다.

이는 일반적인 추천 목록을 측정된 교육 과정으로 대체하는 것과 비슷하다. 둘 다 읽을 수 있는 자료를 담고 있다. 그러나 두 번째 방식만이 학습자가 매 시간 얻는 것을 최적화한다.

이 사전학습 데이터 효율성은 모든 토큰이 연산을 소비하기 때문에 중요하다. 가치가 낮은 반복, 깨진 텍스트, 관련 없는 템플릿 문구는 고정된 예산 안에서 유용한 예시와 경쟁한다. 더 나은 선택은 동일한 가속기 시간으로 만들어지는 학습량을 늘린다.

경제적 결과는 한 번의 학습 실행을 넘어선다. 데이터셋 파이프라인은 반복 실험, 여러 세대의 모델, 특화 변형을 지원할 수 있다. 해당 파이프라인의 개선은 조직 전체 연구 프로그램에 걸쳐 누적될 수 있다.

데이터는 어떤 역량이 나타나는지도 형성한다. 코드가 풍부한 코퍼스는 대화형 산문이 지배적인 코퍼스와 다르게 작동한다. 과학 논문, 법률 텍스트, 다국어 문서, 합성 추론 트레이스는 각각 서로 다른 방향으로 학습을 이끈다.

이는 최전선 연구소에 압박을 가한다. 이들은 또 한 번의 하드웨어 주문이 취약한 코퍼스 설계를 보완할 것이라고 가정할 수 없다. 출처, 라이선스, 추출, 필터링, 혼합 설계, 평가, 지속적 갱신을 위한 더 강력한 시스템이 필요하다.

이 압박은 소규모 모델 개발자에게도 미친다. 가속기 접근성이 제한적인 팀은 지출 경쟁에서 정면승부를 펼칠 수 없다. 그러나 모든 학습 배치의 정보 밀도를 개선하고, 특정 역량을 겨냥해 코퍼스를 구성할 수는 있다.

그렇다고 이 연구가 모든 좁은 범위의 데이터셋이 더 낫다고 말하는 것은 아니다. 보고된 실험에서 The Pile은 OLMES에서 OpenWebText보다 낮은 성능을 보였다. The Pile에는 논문, 코드, 특허, 법률 문서 등 다양한 출처의 자료가 포함된다.

OLMES는 주로 영어 웹 스타일의 객관식 작업을 평가한다. 따라서 특화된 자료는 다른 곳에서 가치 있는 역량을 뒷받침하더라도 거의 인정받지 못할 수 있다. 데이터 품질에는 목표와 무관한 보편적 정의가 없다.

더 나은 모델은 여전히 더 큰 학습 실행을 가능하게 했다

12배 데이터 결과는 효율성을 측정하지만, 모델 연구는 유용한 학습이 가능한 규모 자체도 확장해 왔다.

Patel과 Han은 자신들의 핵심 결과를 가장 단순하게 해석하는 방식을 명시적으로 거부한다. 이 실험은 6년간의 모델 연구가 거의 기여하지 않았음을 보여주지 않는다. 비교적 작은 규모에서 특정 다운스트림 점수에 도달하는 데 필요한 연산량을 측정한다.

많은 모델 혁신은 다른 목적을 수행한다. 파라미터 수, 컨텍스트 윈도우, 데이터 규모, 가속기 클러스터가 커질 때 학습을 안정적으로 유지하는 것이다. 대규모 학습 실행의 붕괴를 막는 개선은 소규모 효율성 차트에서 두드러지지 않을 수 있다.

더 큰 학습 클러스터는 수많은 장애 지점을 만든다. 그래디언트는 폭주하거나 소실될 수 있다. 통신 대역폭은 병목이 될 수 있다. 메모리 압박은 시퀀스 길이, 배치 크기 또는 옵티마이저 상태를 제한할 수 있다.

정규화 변경은 안정성을 개선할 수 있다. 더 나은 초기화는 초기 발산을 방지할 수 있다. 커널 수준의 작업은 가속기가 메모리 이동을 기다리는 대신 계속 연산하도록 만들 수 있다.

FlashAttention은 중요한 역사적 사례를 제공한다. 이는 정확한 어텐션 계산을 메모리 접근 방식 중심으로 재구성해 서로 다른 메모리 계층 간의 비용이 큰 전송을 줄인다. 그 결과 기본 어텐션 결과를 바꾸지 않고도 실행 가능한 시퀀스 길이를 늘릴 수 있다.

Mixture-of-experts 모델은 또 다른 확장 제약을 다룬다. 각 토큰에 대해 네트워크 일부만 활성화함으로써 토큰당 연산량이 비례해 늘지 않으면서 전체 파라미터 용량을 키울 수 있다. 이러한 설계는 라우팅과 분산 학습을 복잡하게 만든다.

Grouped-query attention은 추론 중 캐시된 키와 값에 필요한 메모리를 줄일 수 있다. 모델이 수백만 개의 프롬프트를 처리할 때 이는 매우 중요하다. Patel과 Han은 이런 종류의 추론 개선이 자신들의 사전학습 컴퓨트 승수에는 포함되지 않는다고 지적한다.

토크나이저 개선 역시 실험 범위 밖에 남아 있다. 토크나이저는 텍스트를 모델이 읽을 수 있는 단위로 변환한다. 더 효율적인 토크나이징은 시퀀스 길이를 줄이거나 언어와 도메인을 아우르는 표현력을 개선할 수 있다.

따라서 핵심 대립은 데이터 작업자 대 모델 연구자가 아니라 데이터 효율성과 모델이 가능하게 하는 규모다. 더 나은 코퍼스는 고정된 예산에서 시스템이 더 많이 학습하도록 돕는다. 더 나은 모델 엔지니어링은 연구소가 불안정성이나 과도한 오버헤드 없이 더 큰 예산을 투입할 수 있게 한다.

Google DeepMind의 Chinchilla 연구는 이 변수들이 만나는 방식을 보여준다. 과거의 확장 관행은 종종 학습 데이터를 비례적으로 늘리지 않은 채 파라미터 수만 키웠다. 그 결과 모델은 충분히 학습되지 않은 상태에서 상당한 추론 자원을 소비했다.

DeepMind는 파라미터와 토큰 사이의 최적 배분을 추정하기 위해 400개가 넘는 모델을 학습했다. 이들의 컴퓨트 최적 연구는 시험한 조건에서 모델 크기와 토큰 수가 함께 증가해야 한다고 결론지었다.

Chinchilla는 700억 개 파라미터와 1조 4,000억 개의 학습 토큰을 사용했다. Gopher는 비슷한 컴퓨트 예산으로 2,800억 개의 파라미터를 사용했다. 더 작지만 더 광범위하게 학습된 Chinchilla는 보고된 평가 대부분에서 Gopher를 능가했다.

이 결과는 관심을 파라미터 수에서 학습 기간과 데이터셋 규모로 옮겼다. 그렇다고 아키텍처 연구의 중요성이 사라진 것은 아니다. 모델 크기만으로는 컴퓨테이션이 얼마나 효과적으로 활용되는지 제대로 설명할 수 없다는 점을 보여줬다.

Patel과 Han은 코퍼스의 세대와 레시피의 세대를 분리해 이 논의를 확장한다. Chinchilla는 컴퓨트 예산으로 얼마나 많은 파라미터와 토큰을 확보해야 하는지 물었다. 새 연구는 진전이 그릇에서 더 많이 나왔는지, 그 안의 내용물에서 더 많이 나왔는지를 묻는다.

이 규모에서 답은 내용물 쪽에 무게를 둔다. 하지만 그릇은 얼마나 많이 담을 수 있는지를 결정한다. Patel과 Han은 소형 모델을 범선에, 프런티어 시스템을 컨테이너선에 비유한다.

용량이 부족한 범선에서는 신중하게 고른 화물이 매우 중요하다. 컨테이너선은 훨씬 더 많은 물자를 싣고 거친 환경도 견딜 수 있다. 그 가치는 속도만이 아니라 규모와 신뢰성을 통해 드러난다.

AI 연구소에는 두 역량 모두 필수적이다. 깨끗한 코퍼스도 안정적인 소프트웨어와 하드웨어 없이는 학습될 수 없다. 효율적인 아키텍처도 학습 배치에 중복되거나 가치가 낮은 자료가 들어 있다면 컴퓨트를 낭비한다.

이 연구가 제시하는 유용한 관점 전환은 더 좁다. 아키텍처가 세대별 성능 향상 모두에 자동으로 공을 인정받아서는 안 된다. 데이터와 레시피가 모두 개선될 때는 통제된 제거 실험을 통해 어떤 변화가 관측된 향상을 일으켰는지 판단해야 한다.

12배 발견이 입증하지 않는 것

가장 강력한 결론은 동시에 엄격히 제한돼 있다. 데이터가 하나의 역량 평가군을 대상으로 한 공개 소규모 사전학습 실험 하나에서 우세했다는 것이다.

저자들은 이러한 한계를 거듭 강조한다. 최대 예산은 1e19 FLOPs로, 현대 프런티어 학습 실행보다 훨씬 작았다. 규모 의존적 기법은 소형 모델에서는 눈에 띄는 이점이 거의 없고 훨씬 나중에야 필수적이 될 수 있다.

소형 모델은 용량이 제한적이다. 모델이 모든 것을 흡수할 수 없기 때문에 가치가 낮은 토큰이 중요한 자료를 밀어낼 수 있다. 따라서 공격적인 선별은 훨씬 더 큰 표현 용량을 가진 시스템보다 소형 모델에 더 큰 도움이 될 수 있다.

대형 모델은 평균 문서 품질이 낮아지더라도 폭넓은 커버리지에서 이점을 얻을 수 있다. 더 큰 용량은 약한 신호와 잡음을 분리할 수 있다. 과도한 필터링은 희귀한 사실, 특이한 문체, 소수 언어 또는 틈새 기술 자료를 제거할 수 있다.

공격적인 필터링은 고유 코퍼스도 축소한다. 그러면 개발자는 더 많은 에포크에 걸쳐 남은 자료를 반복해야 하며, 이는 동일한 예시를 더 많이 다시 통과시키는 것을 뜻한다. 반복은 수익 체감이나 과적합을 초래할 수 있다.

데이터 제약 확장에 관한 연구는 반복된 데이터가 여전히 유용하지만 추가 통과가 늘수록 가치가 낮아진다는 사실을 발견했다. 이는 평균 품질, 전체 다양성, 반복 사이의 상충 관계를 만든다.

Patel과 Han은 더 큰 불확실성도 제기한다. 프런티어 모델은 더 작은 모델이 이후 추론 비용을 줄일 수 있기 때문에 고전적인 Chinchilla 최적 토큰 배분을 넘어 학습되는 경우가 많다. 이러한 전략에서는 큐레이션된 데이터셋을 광범위하게 반복해야 할 수 있다.

OLMES 평가는 또 다른 한계를 더한다. 10개 과제는 비교적 접근하기 쉽고 대부분 객관식 질의응답을 기반으로 한다. 다른 평가는 모델 레시피, 데이터셋 또는 둘 다의 순위를 바꿀 수 있다.

코딩 벤치마크는 리포지터리와 기술 문서를 더 높이 평가할 수 있다. 과학 벤치마크는 논문과 전문적인 설명에 유리할 수 있다. 다국어 테스트는 영어 중심 평가군이 놓칠 수 있는 언어적 커버리지에 가치를 둘 것이다.

저자들은 이 측정 문제와 일치하는 이상 현상을 관측했다. NeoX는 낮은 시험 예산에서는 GPT-2를 앞섰지만, OLMES에서 1e19 FLOPs 기준으로는 GPT-2보다 낮은 성능을 보였다. NeoX는 홀드아웃 FineWeb-Edu 손실에서는 더 나은 성능을 보였다.

The Pile의 폭넓은 혼합 데이터도 OLMES에서 OpenWebText보다 낮은 성능을 냈다. 이는 다양한 소스가 일반적으로 비효율적이라는 사실을 입증하지는 않는다. 평가가 이들 소스의 전문 지식에 제한적인 점수만 부여한다는 뜻일 수 있다.

일부 보고된 승수에는 외삽이 필요했다. NeoX와 Pile 곡선은 측정 범위 안에서 필요한 기준 성능에 항상 도달하지 못했다. 관측된 결과를 넘어 적합된 곡선을 연장하면 추가적인 불확실성이 생긴다.

하이퍼파라미터 튜닝도 또 다른 오차 원인이다. 최종 역량은 최고 학습률, 배치 크기, 초기화, 스케줄에 따라 달라질 수 있다. 연구진은 선택된 앵커 지점에서 학습률을 탐색했지만 가능한 모든 설정을 시험할 수는 없었다.

그들은 모델 레시피 승수의 불확실성이 표시된 통계적 오차 막대보다 크다고 본다. 이 막대는 추정 파이프라인에서의 변동을 포착한다. 제한된 하이퍼파라미터 최적화가 낳는 모든 결과를 포착하지는 않는다.

보고된 연간 효율성 비율 역시 신중함의 필요성을 강화한다. 모델 변경은 연간 1.24배의 승수를, 데이터 변경은 1.51배를 산출했다. 함께 적용했을 때 측정된 연간 향상은 1.57배였다.

이 수치는 연간 약 3배의 소프트웨어 효율성 향상이라는 이전 추정치보다 낮다. Patel과 Han은 규모 의존적 향상, 제외된 추론 최적화, 토크나이저 변경, 대표 레시피 선택 등을 포함한 여러 설명을 제시한다.

이 연구는 현대 역량 향상의 주요 원인들도 제외한다. 광범위한 코퍼스에서 모델이 일반 패턴을 학습하는 단계인 사전학습에 초점을 맞춘다. 강화학습, 사후학습, 도구 사용, 테스트 시점 컴퓨테이션은 분해하지 않는다.

Patel과 Han은 논문 발표 전 2년 동안 강화학습이 눈에 띄는 많은 향상을 이끌었다고 지적한다. 모델은 기본 사전학습 효율성을 바꾸지 않고도 추론이나 지시 이행 능력이 크게 개선될 수 있다.

합성 데이터 역시 또 하나의 큰 공백이다. 프런티어 연구소는 모델을 사용해 설명, 코드, 추론 추적, 과제 예시를 생성한다. 이 실험은 대체로 Common Crawl의 부분집합을 큐레이션한 공개 코퍼스를 검토했다.

저자들은 합성 생성이 고품질 정보의 제한된 공급을 확장할 수 있는지 시험하지 않았다. 또한 합성 확장과 원본 문서를 더 많은 에포크에 걸쳐 반복하는 방식을 비교하지 않았다.

마지막으로 이 연구는 비공개 프런티어 파이프라인을 재현하지 않는다. 주요 연구소는 완전한 데이터셋 구성, 필터링 분류기, 혼합 가중치 또는 오염 통제를 거의 공개하지 않는다. 이들의 내부 시스템은 공개 레시피와 크게 다를 수 있다.

적절한 해석은 신중하지만 의미 있다. 이 실험은 코퍼스의 진전이 더 많은 인과적 공로를 인정받아야 한다는 증거를 제공한다. 모든 모델, 규모, 벤치마크, 연구소에 적용되는 보편적인 12배 법칙을 제공하는 것은 아니다.

데이터 품질은 일급 확장 변수로 자리 잡고 있다

업계는 데이터 품질을 코퍼스의 비공식적 속성이 아니라 측정 가능한 확장 입력값으로 점점 더 다루고 있다.

전통적인 확장 법칙은 성능을 모델 크기, 학습 토큰, 컴퓨트와 연결한다. 이들은 흔히 하나의 토큰이 다른 토큰과 비교 가능하다고 가정한다. 실제 데이터셋은 잡음, 중복, 도메인 차이, 불균일한 정보 밀도로 인해 이 가정을 위반한다.

최근 연구는 품질을 직접 모델링하기 시작했다. 한 ICLR 2026 논문은 무차원 품질 매개변수를 도입하고 Chinchilla 스타일의 확장 법칙을 확장했다. 그 목표는 데이터 규모, 모델 크기, 데이터 품질을 함께 사용해 손실을 예측하는 것이었다.

품질 인식 모델은 오염과 데이터셋 결핍에 기반한 프록시를 사용한다. 통제된 실험에서는 더 높은 품질의 데이터가 목표 손실에 필요한 모델 크기와 컴퓨테이션을 줄일 수 있음을 확인했다.

이 접근법은 Patel과 Han의 정확한 승수를 검증하지는 않는다. 그러나 그들의 결과를 뒷받침하는 더 넓은 메커니즘을 지지한다. 토큰 수가 같은 두 코퍼스라도 실제로 제공하는 학습량은 매우 다를 수 있다.

이는 팀이 확장을 설명하는 방식을 바꾼다. 토큰 수는 여전히 필요하지만, 토큰이 고유한지, 관련성이 있는지, 정확한지 또는 교육적인지는 드러내지 못한다. 컴퓨트 수치만으로는 학습 배치가 유용한 신호를 담고 있는지도 알 수 없다.

이 원칙은 프런티어 아래의 영역에서도 중요하다. 자체 도메인에 맞춰 모델을 조정하는 기업은 어떤 문서가 신뢰할 수 있는 지식을 담고 있는지 결정해야 한다. 이용 가능한 모든 파일을 파이프라인에 넣으면 중복, 오래된 정책, 상충하는 지시사항이 증폭될 수 있다.

좋은 정보 인프라는 출처 이력을 보존하고 상충하는 자료를 눈에 띄게 만든다. 또한 사람들이 모델이 생성한 답변의 근거가 된 출처를 찾도록 돕는다. 검색 가능한 지식 베이스는 조직 규모에서 유사한 규율을 적용한다.

따라서 개발자는 세 가지 질문을 분리해야 한다. 첫째, 코퍼스에 목표 과제에 필요한 지식이 담겨 있는가? 둘째, 파이프라인이 그 지식을 깔끔하게 추출하고 표현할 수 있는가? 셋째, 평가가 의도한 역량에 보상하는가?

엔터프라이즈 구매자도 특화 모델을 평가할 때 관련된 질문을 던져야 한다. 공급업체의 파라미터 수는 도메인 커버리지나 소스의 최신성에 관해 거의 말해주지 않는다. 벤치마크 점수 역시 실제 워크플로에서는 실패하는 좁은 데이터 선택을 가릴 수 있다.

지식 노동자들도 같은 문제의 축소판에 직면한다. 더 많은 자료를 저장한다고 해서 검색이나 추론이 자동으로 개선되는 것은 아니다. 가치는 관련성, 구성, 최신성, 그리고 시스템이 근거를 연결하는 능력에 달려 있다.

프런티어 연구소에게 더 나은 데이터 파이프라인은 모델 코드에 버금가는 독점 자산이 될 수 있다. 공개 아키텍처는 종종 빠르게 복제된다. 고품질 혼합물에는 지속적인 접근성, 법적 검토, 실험, 그리고 학습 실행에서 얻는 피드백이 필요하다.

이는 덜 눈에 띄는 경쟁 격차를 만든다. 자금력이 풍부한 연구소는 라이선스 컬렉션, 전문가가 제작한 예시, 비공개 저장소, 합성 환경에 비용을 지불할 수 있다. 소규모 팀은 공개 웹 코퍼스와 재현 가능한 필터에 더 크게 의존한다.

이 변화는 거버넌스 관련 질문도 제기한다. 더 강력한 필터링에는 유용성의 정의가 필요하다. 그 정의는 방언, 소수 관점, 논쟁적인 자료, 또는 분류기가 선호하는 예시와 다른 지식을 배제할 수 있다.

최적화는 벤치마크를 지나치게 직접적으로 겨냥할 수도 있다. 평가 성능을 기준으로 학습된 필터는 알려진 테스트와 유사한 문서를 선택할 수 있다. 오염 통제가 없다면, 겉보기 데이터 품질은 숨겨진 벤치마크 노출이 될 수 있다.

따라서 데이터셋 엔지니어링에는 모델 설계에 적용되는 것과 같은 수준의 검증이 필요하다. 연구자에게는 절제 실험, 문서화된 출처, 홀드아웃 평가, 오염 테스트, 그리고 여러 도메인에 걸친 성능이 필요하다. 단일 종합 점수로는 모든 트레이드오프를 포착할 수 없다.

Patel과 Han의 연구는 데이터 빈티지를 독립적인 실험 축으로 삼음으로써 도움이 된다. 향후 연구는 이 설계를 언어, 도메인, 모델 크기, 합성 혼합물 전반으로 확장할 수 있다. 사실성, 코딩, 추론, 안전성, 장문 맥락 활용도 측정할 수 있다.

가장 중요한 운영상의 변화는 단순하다. 팀은 본격적인 작업이 시작되기 전에 선택되는 정적 입력으로 학습 데이터를 취급하는 일을 멈춰야 한다. 코퍼스 설계는 아키텍처 다이어그램 밖에 존재하더라도 모델의 일부다.

데이터 우선 가설을 검증할 세 가지 신호

다음 증거는 이 결과가 프런티어 규모, 합성 데이터 확장, 더 폭넓은 역량 테스트에서도 유지되는지를 보여줘야 한다.

첫 번째 신호는 더 큰 규모의 재현 연구다. Patel과 Han은 1e19 FLOPs에 도달했으며, 자신들의 실험이 극도로 작다고 설명한다. 후속 연구는 더 큰 모델과 상당히 높은 컴퓨팅 예산에 걸쳐 동일한 교차 설계를 확장해야 한다.

그 재현 연구는 핵심 분리를 유지해야 한다. 연구자에게는 여러 코퍼스 빈티지에서 대표적인 모델 레시피가 필요하며, 모든 변수가 함께 바뀌는 비교여서는 안 된다. 여러 시드와 그에 상응하는 하이퍼파라미터 탐색 노력도 중요하다.

더 높은 규모에서도 데이터 배수가 더 크게 유지된다면, 핵심 가설은 훨씬 강해진다. 프런티어 연구소는 큐레이션이 여전히 지배적인 효율성 레버라는 더 확실한 근거를 갖게 될 것이다. 배수가 줄어든다면 저자들의 컨테이너선 설명을 뒷받침하게 된다.

두 번째 신호는 통제된 합성 데이터 연구다. 연구자들은 제한적이지만 고품질인 코퍼스로 시작해 두 가지 전략을 비교해야 한다. 한 전략은 원본 자료를 반복하고, 다른 전략은 신중하게 생성된 합성 예시를 통해 이를 확장한다.

평가는 벤치마크 정확도 이상을 점검해야 한다. 새로움, 사실적 신뢰성, 다양성, 암기, 그리고 생성기가 가장 강한 도메인 밖에서의 성능을 측정해야 한다. 그렇지 않으면 합성 데이터 확장은 익숙한 패턴만 재생산할 수 있다.

강력한 합성 데이터의 이점은 고정된 데이터 장벽이 다가오고 있다는 생각을 약화시킬 것이다. 연구소는 제한된 인간 제작 자료를 훨씬 더 큰 커리큘럼으로 변환할 수 있다. 결과가 약하다면 라이선스 데이터와 전문가 생성 데이터의 전략적 가치는 더 커질 것이다.

세 번째 신호는 평가 범위다. 향후 재현 연구는 코딩, 수학, 다국어 능력, 사실 검색, 과학적 추론, 장문 맥락 작업을 테스트해야 한다. 또한 결과를 하나의 평균값에 숨기지 말고 별도로 보고해야 한다.

이 범주 전반에서 일관된 데이터 우위가 나타난다면 Dwarkesh Patel 사전학습 연구는 더 강해질 것이다. 범주별로 큰 차이가 난다면 코퍼스 품질이 선택한 목표에 크게 좌우된다는 점을 보여줄 것이다. 그러한 결과는 하나의 보편적 순위보다 특화된 혼합물을 지지하게 된다.

독자들은 공개 관행도 지켜봐야 한다. 오픈 모델 개발자들이 더 나은 데이터셋 카드, 혼합물 세부 정보, 필터링 실험을 공개한다면 독립 연구자들은 이 주장을 더 엄밀하게 검증할 수 있다. 계속되는 비밀주의는 공개 증거와 프런티어 현실 사이의 큰 격차를 유지할 것이다.

개발자에게 당장의 교훈은 아키텍처 작업을 포기하라는 것이 아니다. 데이터 파이프라인을 동등한 수준의 엄정함으로 측정하라는 것이다. 중복, 출처 기여도, 혼합 가중치, 최신성, 그리고 모든 필터링 결정에서 비롯된 성능 변화를 추적하라.

엔터프라이즈 팀에 주는 교훈은 모델 지식이 어디서 오며 어떻게 유지되는지 묻는 것이다. 더 큰 모델이 최신성, 관련성, 또는 추적 가능한 답변을 보장할 수는 없다. 정보 입력의 개선은 종종 모델 복잡성을 한 단계 더 높이기 전에 중요해진다.

지식 노동자에게도 실질적인 질문은 비슷하다. 제한된 주의를 기울일 가치가 있는 정보는 무엇인가? 더 나은 선택은 인간과 기계의 추론을 모두 개선할 수 있다. 구조 없이 모든 것을 수집하는 일은 필터링 문제를 다른 곳으로 옮길 뿐이다.

Dwarkesh Patel의 데이터 연구 결과는 한 가지 결론을 무시하기 어렵게 만든다. 공개 담론은 코퍼스 파이프라인보다 아키텍처의 이름을 붙이기 쉽기 때문에 눈에 보이는 모델 변화를 과도하게 강조해 왔다. 이제 통제된 증거는 더 조용한 변수에 훨씬 더 큰 역할을 부여한다.

다음 세 가지 테스트가 그 역할이 어디까지 확장되는지를 결정할 것이다. 더 높은 컴퓨팅 규모의 재현 연구, 합성 데이터와 반복 학습의 비교, 그리고 다양한 역량 평가를 주목하라. 이들은 함께 사전학습의 진전이 대부분 데이터에서 비롯됐다는 주장을 확인하거나 범위를 좁힐 수 있다.

그때까지 12배 결과는 보편적 상수가 아니라 강력한 실험 신호로 받아들여야 한다. 시스템에 공급되는 정보를 점검하고, 실제 작업을 기준으로 변화를 테스트하며, 각 결론의 근거가 되는 출처를 보존하라. 더 나은 모델은 여전히 중요하지만, 그 성능은 무엇을 학습하도록 허용받는가에서 시작된다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page