top of page

Badanie Dwarkesha Patela nad pretrainingiem wykazało, że dane przewyższyły ulepszenia modeli

10 wrz
15 minut(y) czytania

Dwarkesh Patel opublikował wraz z Jerrym Hanem badanie dotyczące pretrainingu, które przyniosło uderzający rezultat: ulepszenia danych zapewniły 12-krotny wzrost efektywności obliczeniowej. Ulepszenia receptury modelu przyniosły 3,7-krotny wzrost w tych samych ramach eksperymentalnych. Badanie Dwarkesha Patela nad pretrainingiem przypisuje zatem danym około 3,24 razy większy postęp w efektywności.

Wynik ten podważa znane wyjaśnienie postępu modeli językowych. Publiczna dyskusja często koncentruje się na architekturach, optymalizatorach, większych klastrach i nowych mechanizmach uwagi. Patel i Han stwierdzili natomiast, że to lepsze korpusy tekstowe zapewniały większą przewagę efektywności w badanym przez nich zakresie.

Badacze odtworzyli sześć lat otwartego postępu w pretrainingu — od systemów z ery GPT-2 po receptury z ery OLMo-2. Połączyli reprezentatywne projekty modeli z reprezentatywnymi zbiorami danych i trenowali te kombinacje przy kilku budżetach obliczeniowych. Tworzy to bezpośrednią rywalizację między dwoma wyjaśnieniami: lepszą maszynerią i lepszym materiałem.

Wynik nie dowodzi, co działo się wewnątrz OpenAI, Anthropic, Google DeepMind ani Meta. Firmy te ujawniają ograniczone informacje o swoich obecnych danych treningowych. Zmienia jednak ciężar dowodu dla każdego, kto traktuje inżynierię danych jako kwestię drugorzędną.

Badanie Dwarkesha Patela nad pretrainingiem odtworzyło sześć lat postępu

Patel i Han próbowali rozdzielić dwie zmienne, które zazwyczaj zmieniają się jednocześnie: recepturę modelu i korpus treningowy.

Ich eksperyment dotyczący pretrainingu opublikowano 8 września 2026 roku. Obejmuje on reprezentatywne receptury otwartych modeli i publiczne zbiory danych wydane od 2019 do 2025 roku. Autorzy trenowali kombinacje tych składników od podstaw.

Receptura modelu obejmuje architekturę, optymalizator, inicjalizację, harmonogram współczynnika uczenia, metodę normalizacji i inne decyzje treningowe. Korpus to zbiór tekstów przekształconych w tokeny na potrzeby pretrainingu. Większość publicznych wydań modeli zmienia oba komponenty jednocześnie, przez co trudno wyizolować ich indywidualny wkład.

Oś modeli zaczyna się od receptury GPT-2, a kończy na OLMo-2. Pośrednie zmiany obejmują rotary position embeddings, RMSNorm, aktywacje SwiGLU, zmienione umiejscowienie normalizacji, normalizację QK i czystsze metody inicjalizacji. Każde usprawnienie zmienia sposób, w jaki model reprezentuje informacje lub zachowuje stabilność podczas treningu.

Oś danych zaczyna się od OpenWebText. Ten korpus z 2019 roku zawierał około 9 miliardów tokenów ze stron internetowych, do których linkowały wystarczająco popularne posty na Reddicie. Późniejsze zbiory danych korzystały z szerszych indeksów sieci, lepszego ekstrakcji, deduplikacji i coraz bardziej selektywnych filtrów jakości.

Punktem końcowym z 2025 roku był UltraFineWeb. Jego pipeline stosuje bardziej zaawansowane filtrowanie do znacznie większej puli dokumentów internetowych. Niektóre nowoczesne filtry wykorzystują wytrenowane klasyfikatory do przewidywania, które dokumenty poprawią późniejszą wydajność modelu.

Patel i Han przetestowali pięć nominalnych budżetów obliczeniowych. Obejmowały one zakres od 100 biliardów FLOPs do 10 trylionów FLOPs, zapisywany jako 1e17 do 1e19 FLOPs. FLOPs mierzą operacje arytmetyczne zużywane podczas treningu.

Przy każdym budżecie badacze zmieniali rozmiar modelu i liczbę tokenów. Proces ten pozwolił im oszacować optymalną obliczeniowo kombinację dla każdej pary modelu i korpusu. Optymalność obliczeniowa oznacza uzyskanie najsilniejszego zmierzonego wyniku w ramach stałej ilości obliczeń treningowych.

W eksperymentach kontrolowali też kilka innych wyborów. Każde uruchomienie korzystało z tokenizera GPT-2 BPE ze słownikiem liczącym 50 257 tokenów. Każde używało również długości kontekstu 2 048 tokenów oraz batcha zawierającego 262 144 tokeny.

Badacze oceniali końcowe zdolności za pomocą OLMES, zbioru dziesięciu stosunkowo dostępnych benchmarków. Większość wykorzystuje pytania wielokrotnego wyboru. Wybrali ocenę zdolności, ponieważ porównywanie straty cross-entropy pomiędzy różnymi zbiorami danych treningowych tworzyłoby nierówny test.

Ten wybór ma znaczenie. Model oceniany względem tego samego korpusu, który zdefiniował jego rozkład treningowy, może uzyskać sztuczną przewagę. Zadania końcowe oferują wspólny cel, choć wprowadzają więcej szumu statystycznego.

Zespół uruchomił wiele niezależnych seedów dla krzywych skalowania obliczeniowego. Seed zmienia losową inicjalizację i kolejność danych, pomagając ustalić, czy wynik utrzymuje się mimo różnic w treningu. Większa siatka 7 na 7 przy 3.16e18 FLOPs korzystała z jednego seeda na kombinację.

Przy budżecie 1e19 FLOPs nowsze dane zapewniły 12-krotny mnożnik obliczeniowy względem bazowych danych z 2019 roku. Nowsze receptury modeli zapewniły 3,7-krotny mnożnik względem receptury GPT-2. Ich stosunek dał nagłaśnianą 3,24-krotną przewagę danych.

Mnożnik obliczeniowy opisuje, o ile mniej obliczeń potrzebuje nowszy składnik, aby osiągnąć wydajność starszego składnika. Nie oznacza to, że model stał się dwanaście razy inteligentniejszy. Opisuje efektywność na wybranym poziomie wydajności i w określonym zestawie ewaluacyjnym.

Autorzy stwierdzili również, że zyski z danych i modeli były w dużej mierze niezależne przy 3.16e18 FLOPs. Addytywny model statystyczny wyjaśniał 88 procent zmienności wyników OLMES. Tylko około 12 procent pozostawało na interakcje, efekty wyższego rzędu lub szum ewaluacyjny.

Wynik ten sugeruje, że lepsze dane nie wymagały jednej szczególnej architektury, by przynieść korzyści. Podobnie ulepszenia architektoniczne generalnie pozostawały użyteczne w różnych korpusach. Ta niezależność utrudnia odrzucenie wkładu danych jako pojedynczego szczęśliwego zestawienia modelu i zbioru danych.

Inżynieria danych wygrała rywalizację o efektywność

W ramach tego eksperymentu ulepszanie tego, co czytał model, miało większe znaczenie niż ulepszanie mechanizmu, który to odczytywał.

Wynik jest zgodny z rosnącym dorobkiem badań nad modelami językowymi skoncentrowanych na danych. Współczesne korpusy to nie po prostu większe stosy tekstu z internetu. Ich twórcy wydobywają czystszą treść, usuwają duplikaty, równoważą źródła, filtrują dokumenty o niskiej wartości i kontrolują zanieczyszczenia.

Deduplikacja usuwa materiał identyczny lub niemal identyczny. Bez niej często kopiowane strony mogą zdominować trening i ograniczyć efektywną różnorodność korpusu. Ekstrakcja oddziela znaczący tekst od menu, reklam, elementów szablonowych i uszkodzonego znacznika.

Filtrowanie następnie decyduje, które dokumenty zasługują na ograniczone zasoby obliczeniowe treningu. Wczesne filtry opierały się głównie na regułach dotyczących języka, długości, powtórzeń i interpunkcji. Nowsze pipeline'y coraz częściej stosują klasyfikatory trenowane na przykładach użytecznego i niepomocnego tekstu.

DataComp-LM uczynił to podejście mierzalnym dzięki kontrolowanym konkursom na zbiory danych. Jego badacze udostępnili pulę Common Crawl liczącą 240 bilionów tokenów i ustalili recepturę treningową dla uczestników. Zespoły mogły następnie rywalizować za pomocą strategii filtrowania i mieszania danych, zamiast zmieniać model.

Wyniki DataComp-LM wykazały, że filtrowanie oparte na modelach było kluczowe dla jego najsilniejszej wartości bazowej. Model o 7 miliardach parametrów osiągnął 64 procent dokładności five-shot w MMLU po treningu na 2,6 biliona tokenów.

Model ten osiągał porównywalne wyniki z większymi otwartymi modelami w raportowanych benchmarkach. Autorzy zgłosili również przewagę 6,6 punktu procentowego w MMLU nad MAP-Neo przy użyciu o 40 procent mniejszych zasobów obliczeniowych treningu. Są to odrębne eksperymenty, ale ich kierunek wspiera wynik Patela i Hana.

DataComp-LM ujawnił także, że projekt filtra może mieć większe znaczenie, niż oczekiwano. W jednej z testowanych skal zmiana modelu filtrującego przesunęła dokładność five-shot w MMLU z 35 procent do 44 procent. Bazowa pula surowych danych internetowych pozostawała dostępna dla każdego podejścia.

Co zaskakujące, najlepszy przetestowany filtr wykorzystywał stosunkowo prosty klasyfikator bigramowy ze starannie dobranymi przykładami pozytywnymi i negatywnymi. Oceny jakości dokumentów dokonywane przez ludzi miały ograniczoną wartość w tych eksperymentach. To, co dla czytelnika wygląda na dopracowane, nie zawsze tworzy lepszy sygnał uczenia.

Badania FineWeb doprowadziły do podobnego wniosku. Ich twórcy porównali wybory dotyczące ekstrakcji, filtrowania językowego, deduplikacji i selekcji jakości w dużych korpusach internetowych. Praca traktowała tworzenie zbiorów danych jako empiryczną dyscyplinę inżynieryjną, a nie etap porządkowania.

Zbiór FineWeb stworzył także podzbiór skoncentrowany na edukacji, wybrany przez wytrenowany klasyfikator. Strategia ta kładła nacisk na strony przypominające wysokiej jakości materiały edukacyjne. Takie filtry mają zwiększać gęstość użytecznego rozumowania i faktów na token.

Ta historia wyjaśnia ustalenia Dwarkesha Patela dotyczące danych. OpenWebText już filtrował internet, lecz wykorzystywał popularność na Reddicie jako szeroki sygnał jakości. Późniejsze pipeline'y testowały bardziej bezpośrednie sygnały względem faktycznej wydajności modelu.

Różnica przypomina zastąpienie ogólnej listy rekomendacji zmierzonym programem nauczania. Oba zawierają materiał nadający się do czytania. Tylko drugi optymalizuje to, co uczący się zyskuje z każdej godziny.

Ta efektywność danych pretrainingowych ma znaczenie, ponieważ każdy token zużywa obliczenia. Powtarzalne treści o niskiej wartości, uszkodzony tekst i nieistotne elementy szablonowe konkurują z użytecznymi przykładami w ramach stałego budżetu. Lepsza selekcja zwiększa ilość uczenia uzyskiwaną przy tym samym czasie pracy akceleratorów.

Konsekwencja ekonomiczna wykracza poza pojedyncze uruchomienie treningu. Pipeline zbioru danych może wspierać powtarzane eksperymenty, generacje modeli i wyspecjalizowane warianty. Ulepszenia tego pipeline'u mogą kumulować się w całym programie badawczym organizacji.

Dane kształtują także to, jakie zdolności się wyłaniają. Korpus bogaty w kod nie będzie zachowywał się jak korpus zdominowany przez prozę konwersacyjną. Artykuły naukowe, teksty prawne, dokumenty wielojęzyczne i syntetyczne ślady rozumowania kierują uczenie w różnych stronach.

Tworzy to presję na laboratoria pracujące nad modelami granicznymi. Nie mogą zakładać, że kolejne zamówienie sprzętowe zrekompensuje słaby projekt korpusu. Potrzebują silniejszych systemów do zarządzania pochodzeniem danych, licencjami, ekstrakcją, filtrowaniem, projektowaniem mieszanek, ewaluacją i ciągłym odświeżaniem.

Presja dotyczy również mniejszych twórców modeli. Zespoły z ograniczonym dostępem do akceleratorów nie mogą wygrać bezpośredniej rywalizacji wydatków. Mogą jednak poprawić gęstość informacji w każdym batchu treningowym i ukierunkować korpus na konkretne zdolności.

Badanie nie mówi jednak, że każdy wąski zbiór danych jest lepszy. The Pile w raportowanych eksperymentach wypadł gorzej niż OpenWebText w OLMES. The Pile zawiera zróżnicowany materiał ze źródeł takich jak artykuły, kod, patenty i dokumenty prawne.

OLMES ocenia głównie angielskie zadania wielokrotnego wyboru w stylu internetowym. Wyspecjalizowany materiał może więc otrzymywać niewielkie uznanie, nawet jeśli wspiera wartościowe zdolności w innych obszarach. Jakość danych nie ma uniwersalnej definicji poza określonym celem.

Lepsze modele wciąż umożliwiały większe treningi

12-krotny wynik dotyczący danych mierzy efektywność, lecz badania nad modelami rozszerzyły również skalę, przy której użyteczny trening pozostaje możliwy.

Patel i Han wyraźnie odrzucają najprostsze odczytanie swojego nagłaśnianego wyniku. Ich eksperyment nie pokazuje, że sześć lat badań nad modelami wniosło niewiele. Mierzy on obliczenia wymagane do osiągnięcia określonych wyników w zadaniach końcowych przy relatywnie małych skalach.

Wiele innowacji modelowych służy innemu celowi. Utrzymują stabilność treningu wraz ze wzrostem liczby parametrów, długości okien kontekstu, wolumenów danych i klastrów akceleratorów. Usprawnienie, które zapobiega załamaniu ogromnego treningu, może nie dominować na wykresie efektywności dla małej skali.

Większy klaster treningowy tworzy liczne punkty awarii. Gradienty mogą eksplodować lub zanikać. Przepustowość komunikacji może stać się wąskim gardłem. Presja na pamięć może ograniczać długość sekwencji, rozmiar wsadu lub stan optymalizatora.

Zmiany w normalizacji mogą poprawić stabilność. Lepsza inicjalizacja może zapobiec wczesnej rozbieżności. Praca na poziomie kerneli może utrzymywać akceleratory w działaniu, zamiast zmuszać je do oczekiwania na przenoszenie danych w pamięci.

FlashAttention stanowi ważny przykład historyczny. Reorganizuje dokładne obliczanie uwagi wokół dostępu do pamięci, ograniczając kosztowne transfery między różnymi poziomami pamięci. Może to zwiększyć możliwą długość sekwencji bez zmiany podstawowego wyniku mechanizmu uwagi.

Modele mixture-of-experts rozwiązują inne ograniczenie skalowania. Aktywują tylko część sieci dla każdego tokenu, umożliwiając wzrost łącznej liczby parametrów bez proporcjonalnego wzrostu obliczeń na token. Takie projekty komplikują routing i trening rozproszony.

Grouped-query attention może zmniejszyć pamięć wymaganą do przechowywania w pamięci podręcznej kluczy i wartości podczas inferencji. Ma to ogromne znaczenie, gdy model obsługuje miliony promptów. Patel i Han zauważają, że tego rodzaju poprawa inferencji nie pojawia się w ich mnożniku obliczeń pretreningowych.

Ulepszenia tokenizera również pozostają poza zakresem eksperymentu. Tokenizer określa, jak tekst jest przekształcany w jednostki czytelne dla modelu. Wydajniejsza tokenizacja może skracać sekwencje lub poprawiać reprezentację między językami i domenami.

Główne przeciwstawienie dotyczy zatem efektywności danych wobec skali umożliwianej przez model, a nie pracowników zajmujących się danymi wobec badaczy modeli. Lepsze korpusy pomagają systemowi nauczyć się więcej przy stałym budżecie. Lepsza inżynieria modeli pozwala laboratoriom wykorzystywać większe budżety bez niestabilności lub zaporowych narzutów.

Praca Google DeepMind nad Chinchilla pokazuje, jak te zmienne się łączą. Wcześniejsza praktyka skalowania często zwiększała liczbę parametrów bez proporcjonalnego zwiększania ilości danych treningowych. Powstałe modele zużywały znaczne zasoby inferencyjne, pozostając jednocześnie niedotrenowane.

DeepMind wytrenował ponad 400 modeli, aby oszacować optymalny podział między parametrami a tokenami. Badanie dotyczące optymalnego wykorzystania obliczeń wykazało, że w badanych warunkach rozmiar modelu i liczba tokenów powinny rosnąć razem.

Chinchilla wykorzystywała 70 miliardów parametrów i 1,4 biliona tokenów treningowych. Gopher wykorzystywał 280 miliardów parametrów przy porównywalnym budżecie obliczeniowym. Mniejsza, intensywniej trenowana Chinchilla przewyższała Gophera w większości raportowanych ewaluacji.

Wynik ten przesunął uwagę z liczby parametrów na czas treningu i objętość zbioru danych. Nie przekreślił badań nad architekturą. Pokazał, że sam rozmiar modelu słabo opisuje skuteczność wykorzystania obliczeń.

Patel i Han rozwijają tę dyskusję, oddzielając dojrzałość korpusu od dojrzałości receptury. Chinchilla pytała, ile parametrów i tokenów należy kupić za budżet obliczeniowy. Nowe badanie pyta, czy postęp wynikał bardziej z pojemnika, czy z jego zawartości.

Odpowiedź na tej skali faworyzuje zawartość. Jednak to pojemnik określa, ile można przewieźć. Patel i Han porównują małe modele do żaglówek, a systemy frontierowe do kontenerowców.

Starannie dobrany ładunek ma ogromne znaczenie na żaglówce, ponieważ jej pojemność jest ograniczona. Kontenerowiec może przewieźć znacznie więcej materiału i przetrwać trudniejsze warunki. Jego wartość przejawia się poprzez skalę i niezawodność, a nie wyłącznie prędkość.

Dla laboratoriów AI obie zdolności pozostają niezbędne. Czysty korpus nie może być trenowany bez stabilnego oprogramowania i sprzętu. Wydajna architektura nadal marnuje obliczenia, gdy jej wsady treningowe zawierają zduplikowane lub mało wartościowe materiały.

Użyteczne odwrócenie perspektywy w badaniu jest węższe. Architektura nie powinna już automatycznie otrzymywać uznania za każdy skok wydajności między generacjami. Gdy poprawiają się zarówno dane, jak i receptury, kontrolowane ablacje muszą ustalić, która zmiana spowodowała obserwowany wzrost.

Czego nie dowodzi ustalenie o 12-krotnej przewadze

Najsilniejszy wniosek jest jednocześnie ściśle ograniczony: dane zdominowały jeden otwarty eksperyment pretreningowy na małą skalę, obejmujący jeden zestaw zdolności.

Autorzy wielokrotnie podkreślają te ograniczenia. Ich maksymalny budżet wynosił 1e19 FLOPs, znacznie mniej niż w nowoczesnych treningach modeli frontierowych. Techniki zależne od skali mogą przynosić niewielkie widoczne korzyści w małych modelach, a stać się niezbędne dopiero znacznie później.

Małe modele mają ograniczoną pojemność. Tokeny o niskiej wartości mogą wypierać istotny materiał, ponieważ model nie jest w stanie przyswoić wszystkiego. Agresywna selekcja może więc pomagać małym modelom bardziej niż systemom o znacznie większej zdolności reprezentacyjnej.

Duże modele mogą korzystać z szerokiego pokrycia, nawet gdy średnia jakość dokumentów spada. Większa pojemność może oddzielać słabe sygnały od szumu. Nadmierne filtrowanie może usuwać rzadkie fakty, nietypowe style, języki mniejszościowe lub niszowy materiał techniczny.

Agresywne filtrowanie zmniejsza także unikalny korpus. Twórcy muszą następnie powtarzać pozostały materiał przez większą liczbę epok, czyli wykonywać więcej przejść przez te same przykłady. Powtarzanie może prowadzić do malejących korzyści lub przeuczenia.

Badania nad skalowaniem ograniczonym przez dane wykazały, że powtarzane dane pozostają użyteczne, ale z dodatkowymi przejściami stają się mniej wartościowe. Powstaje przez to kompromis między średnią jakością, całkowitą różnorodnością i powtarzalnością.

Patel i Han wskazują jeszcze większą niepewność. Modele frontierowe są często trenowane ponad klasyczne optymalne według Chinchilli alokacje tokenów, ponieważ mniejsze modele mogą obniżać późniejsze koszty inferencji. Kuratorowany zbiór danych może przy tej strategii wymagać intensywnego powtarzania.

Ewaluacja OLMES stanowi kolejne ograniczenie. Jej dziesięć zadań jest stosunkowo przystępnych i w dużej mierze opiera się na pytaniach wielokrotnego wyboru. Inne ewaluacje mogłyby zmienić ranking receptur modeli, zbiorów danych lub obu tych elementów.

Benchmark programistyczny mógłby premiować repozytoria i dokumentację techniczną. Benchmark naukowy mógłby faworyzować publikacje oraz specjalistyczne wyjaśnienia. Testy wielojęzyczne doceniłyby pokrycie językowe, które zestaw skoncentrowany na angielskim może pomijać.

Autorzy zaobserwowali anomalie zgodne z tym problemem pomiarowym. NeoX wypadał gorzej niż GPT-2 przy 1e19 FLOPs w OLMES, mimo że przewyższał go przy niższych badanych budżetach. NeoX osiągał także lepszy wynik straty na niewykorzystanym w treningu FineWeb-Edu.

Szeroka mieszanka The Pile również wypadała gorzej niż OpenWebText w OLMES. Nie dowodzi to, że różnorodne źródła są generalnie nieefektywne. Może wskazywać, że ewaluacja przyznaje ograniczone uznanie ich wyspecjalizowanej wiedzy.

Niektóre raportowane mnożniki wymagały ekstrapolacji. Krzywe NeoX i Pile nie zawsze osiągały niezbędną referencyjną wydajność w zmierzonym zakresie. Rozszerzanie dopasowanej krzywej poza zaobserwowane wyniki wprowadza dodatkową niepewność.

Strojenie hiperparametrów tworzy kolejne źródło błędu. Końcowe zdolności mogą zmieniać się wraz ze szczytową szybkością uczenia, rozmiarem wsadu, inicjalizacją i harmonogramem. Badacze przeszukiwali szybkości uczenia w wybranych punktach kotwiczących, ale nie mogli przetestować każdej możliwej konfiguracji.

Uważają, że niepewność mnożników receptur modeli przekracza przedstawione statystyczne paski błędów. Paski te odzwierciedlają zmienność ich procesu estymacji. Nie uwzględniają wszystkich konsekwencji ograniczonej optymalizacji hiperparametrów.

Raportowane roczne wskaźniki efektywności wzmacniają potrzebę ostrożności. Zmiany modeli przyniosły roczny mnożnik 1,24, podczas gdy zmiany danych — 1,51. Łącznie zmierzony roczny wzrost wyniósł 1,57 raza.

Wartości te są niższe od wcześniejszego szacunku około trzykrotnej rocznej poprawy efektywności oprogramowania. Patel i Han proponują kilka wyjaśnień, w tym korzyści zależne od skali, wyłączone optymalizacje inferencji, zmiany tokenizerów oraz wybór reprezentatywnych receptur.

Badanie pomija również główne źródła współczesnego postępu w zdolnościach. Koncentruje się na pretreningu, fazie, w której model uczy się ogólnych wzorców na szerokich korpusach. Nie rozdziela wpływu uczenia ze wzmocnieniem, post-treningu, użycia narzędzi ani obliczeń w czasie testu.

Patel i Han zauważają, że uczenie ze wzmocnieniem napędzało wiele widocznych postępów w ciągu dwóch lat przed publikacją. Model może znacznie poprawić rozumowanie lub wykonywanie instrukcji bez zmiany efektywności bazowego pretreningu.

Dane syntetyczne pozostają kolejną dużą luką. Laboratoria frontierowe wykorzystują modele do generowania wyjaśnień, kodu, śladów rozumowania i przykładów zadań. Eksperyment analizował publiczne korpusy, które w większości kuratorują podzbiory Common Crawl.

Autorzy nie testowali, czy generowanie syntetyczne może rozszerzyć niewielką podaż informacji wysokiej jakości. Nie porównali też syntetycznego rozszerzania z powtarzaniem oryginalnych dokumentów przez większą liczbę epok.

Wreszcie badanie nie odtwarza zamkniętych pipeline’ów frontierowych. Główne laboratoria rzadko ujawniają pełny skład zbiorów danych, klasyfikatory filtrujące, wagi mieszanek czy mechanizmy kontroli zanieczyszczenia. Ich wewnętrzne systemy mogą znacząco różnić się od publicznych receptur.

Właściwa interpretacja jest ostrożna, ale istotna. Eksperyment dostarcza dowodów, że postęp w korpusach zasługuje na większe uznanie przyczynowe. Nie stanowi uniwersalnego prawa 12-krotności dla każdego modelu, skali, benchmarku ani laboratorium.

Jakość danych staje się zmienną skalowania pierwszej klasy

Branża coraz częściej traktuje jakość danych jako mierzalny wkład w skalowanie, a nie nieformalną właściwość korpusu.

Tradycyjne prawa skalowania łączą wydajność z rozmiarem modelu, liczbą tokenów treningowych i obliczeniami. Często zakładają, że jeden token jest porównywalny z drugim. Rzeczywiste zbiory danych naruszają to założenie przez szum, duplikację, różnice domenowe i nierówną gęstość informacji.

Najnowsze badania zaczęły modelować jakość bezpośrednio. Artykuł z ICLR 2026 wprowadził bezwymiarowy parametr jakości i rozszerzył prawa skalowania w stylu Chinchilli. Jego celem było wspólne przewidywanie straty na podstawie objętości danych, rozmiaru modelu i jakości danych.

Model uwzględniający jakość wykorzystuje wskaźniki oparte na uszkodzeniu danych i niedostatkach zbioru. Kontrolowane eksperymenty wykazały, że dane wyższej jakości mogą zmniejszyć rozmiar modelu i ilość obliczeń wymaganą do osiągnięcia docelowej straty.

Podejście to nie potwierdza dokładnego mnożnika Patela i Hana. Wspiera jednak szerszy mechanizm stojący za ich wynikiem. Dwa korpusy o równej liczbie tokenów mogą dostarczać bardzo różne efektywne ilości nauki.

Zmienia to sposób, w jaki zespoły powinny opisywać skalowanie. Liczba tokenów pozostaje niezbędna, lecz nie ujawnia, czy tokeny są unikalne, istotne, dokładne lub edukacyjne. Same liczby obliczeniowe nie ujawniają, czy wsady treningowe niosą użyteczny sygnał.

Ta sama zasada ma znaczenie także poniżej granicy frontierowej. Firma dostosowująca model do własnej domeny musi zdecydować, które dokumenty reprezentują zaufaną wiedzę. Wprowadzenie każdego dostępnego pliku do pipeline’u może wzmacniać duplikację, nieaktualne polityki i sprzeczne instrukcje.

Dobra infrastruktura informacyjna zachowuje pochodzenie danych i uwidacznia sprzeczne materiały. Pomaga także ludziom odnajdywać źródła stojące za odpowiedziami generowanymi przez model. Przeszukiwalna baza wiedzy stosuje podobną dyscyplinę w skali organizacyjnej.

Dlatego twórcy powinni rozdzielić trzy pytania. Po pierwsze, czy korpus zawiera wiedzę potrzebną do docelowych zadań? Po drugie, czy pipeline potrafi tę wiedzę czysto wydobyć i reprezentować? Po trzecie, czy ewaluacja nagradza zamierzoną zdolność?

Nabywcy korporacyjni powinni zadawać powiązane pytania przy ocenie modeli specjalistycznych. Liczba parametrów podawana przez dostawcę niewiele mówi o pokryciu domenowym lub świeżości źródeł. Wyniki benchmarków mogą również ukrywać wąskie wybory danych, które zawodzą w rzeczywistych przepływach pracy.

Pracownicy wiedzy mierzą się z mniejszą wersją tego samego problemu. Większa ilość zapisanych materiałów nie przekłada się automatycznie na lepsze wyszukiwanie ani rozumowanie. Wartość zależy od trafności, organizacji, aktualności oraz zdolności systemu do łączenia dowodów.

Dla laboratoriów pracujących nad modelami granicznymi lepsze potoki danych mogą stać się zastrzeżonymi aktywami porównywalnymi z kodem modeli. Publiczne architektury są często szybko odtwarzane. Wysokiej jakości mieszanki wymagają stałego dostępu, analizy prawnej, eksperymentów i informacji zwrotnych z przebiegów treningowych.

Tworzy to mniej widoczny podział konkurencyjny. Dobrze finansowane laboratoria mogą płacić za licencjonowane zbiory, przykłady tworzone przez specjalistów, prywatne repozytoria i środowiska syntetyczne. Mniejsze zespoły w większym stopniu polegają na publicznych korpusach internetowych i odtwarzalnych filtrach.

Ta zmiana rodzi również pytania dotyczące zarządzania. Silniejsze filtrowanie wymaga zdefiniowania użyteczności. Taka definicja może tłumić dialekty, perspektywy mniejszości, kontrowersyjne materiały lub wiedzę różniącą się od preferowanych przykładów klasyfikatora.

Optymalizacja może też zbyt bezpośrednio celować w benchmarki. Filtr trenowany pod kątem wyników ewaluacji może wybierać dokumenty przypominające znane testy. Bez kontroli zanieczyszczenia pozorna jakość danych może stać się ukrytą ekspozycją na benchmarki.

Inżynieria zbiorów danych wymaga zatem takiej samej kontroli jak projektowanie modeli. Badacze potrzebują ablacjii, udokumentowanych źródeł, ewaluacji na zbiorach odłożonych, testów zanieczyszczenia oraz wyników w wielu domenach. Jeden zagregowany wynik nie jest w stanie uchwycić wszystkich kompromisów.

Praca Patel i Hana pomaga, ponieważ traktuje wersję czasową danych jako niezależną oś eksperymentalną. Przyszłe badania mogą rozszerzyć ten projekt na języki, domeny, rozmiary modeli i mieszanki syntetyczne. Mogą również mierzyć zgodność z faktami, programowanie, rozumowanie, bezpieczeństwo i wykorzystanie długiego kontekstu.

Najważniejsza zmiana operacyjna jest prosta. Zespoły powinny przestać traktować dane treningowe jako statyczny wkład wybierany przed rozpoczęciem poważnej pracy. Projekt korpusu jest częścią modelu, nawet jeśli znajduje się poza diagramem architektury.

Trzy sygnały sprawdzą tezę „najpierw dane”

Kolejne dowody muszą pokazać, czy wynik utrzymuje się przy skali granicznej, ekspansji syntetycznej i szerszym testowaniu zdolności.

Pierwszym sygnałem będzie większa replikacja. Patel i Han osiągnęli 1e19 FLOPs i opisują swój eksperyment jako niezwykle mały. Kontynuacja musi rozszerzyć ten sam krzyżowy projekt na większe modele i znacznie wyższe budżety obliczeniowe.

Taka replikacja powinna zachować kluczowy rozdział zmiennych. Badacze potrzebują reprezentatywnych konfiguracji modeli dla wielu wersji czasowych korpusu, a nie porównania, w którym każda zmienna zmienia się jednocześnie. Ważne będą również wielokrotne ziarna losowości i porównywalny nakład pracy nad hiperparametrami.

Jeśli mnożnik danych pozostanie większy przy wyższej skali, centralna teza stanie się znacznie mocniejsza. Laboratoria graniczne będą miały solidniejsze dowody, że kuracja danych nadal jest dominującą dźwignią efektywności. Malejący mnożnik wspierałby wyjaśnienie autorów o statkach kontenerowych.

Drugim sygnałem będzie kontrolowane badanie danych syntetycznych. Badacze powinni zacząć od ograniczonego korpusu wysokiej jakości i porównać dwie strategie. Jedna powtarza oryginalny materiał, druga natomiast rozszerza go za pomocą starannie wygenerowanych przykładów syntetycznych.

Ewaluacja musi sprawdzać więcej niż trafność benchmarków. Powinna mierzyć nowość, wiarygodność faktograficzną, różnorodność, zapamiętywanie i wyniki poza najsilniejszymi domenami generatora. W przeciwnym razie ekspansja syntetyczna może jedynie odtwarzać znane wzorce.

Silna przewaga syntetycznych danych osłabiłaby pogląd o zbliżającej się ścianie stałych zasobów danych. Laboratoria mogłyby przekształcać ograniczone materiały stworzone przez ludzi w znacznie większe programy nauczania. Słabe wyniki zwiększyłyby strategiczną wartość danych licencjonowanych i generowanych przez ekspertów.

Trzecim sygnałem będzie szerokość ewaluacji. Przyszłe replikacje powinny testować programowanie, matematykę, zdolności wielojęzyczne, wyszukiwanie faktów, rozumowanie naukowe i zadania z długim kontekstem. Powinny też raportować wyniki osobno, zamiast ukrywać je w jednej średniej.

Spójne przewagi danych w tych kategoriach wzmocniłyby badanie pretrainingu Dwarkesha Patela. Duże różnice między kategoriami pokazałyby, że jakość korpusu silnie zależy od wybranego celu. Taki wynik przemawiałby za wyspecjalizowanymi mieszankami zamiast jednego uniwersalnego rankingu.

Czytelnicy powinni również obserwować praktyki ujawniania informacji. Jeśli twórcy otwartych modeli będą publikować lepsze karty zbiorów danych, szczegóły mieszanek i eksperymenty filtrowania, niezależni badacze będą mogli rygorystyczniej testować tę tezę. Dalsza tajemniczość utrzyma dużą lukę między publicznymi dowodami a rzeczywistością laboratoriów granicznych.

Dla deweloperów bezpośrednia lekcja nie polega na porzuceniu pracy nad architekturą. Chodzi o mierzenie potoku danych z równą powagą. Śledź duplikację, wkład źródeł, wagi mieszanek, aktualność oraz zmiany wydajności wynikające z każdej decyzji filtrowania.

Dla zespołów korporacyjnych lekcją jest pytanie, skąd pochodzi wiedza modelu i jak jest utrzymywana. Większy model nie może zagwarantować aktualnych, trafnych ani możliwych do prześledzenia odpowiedzi. Lepsze wejścia informacyjne często mają znaczenie przed dodaniem kolejnej warstwy złożoności modelu.

Dla pracowników wiedzy praktyczne pytanie jest podobne: jakie informacje zasługują na ograniczoną uwagę? Lepsza selekcja może poprawić zarówno ludzkie, jak i maszynowe rozumowanie. Gromadzenie wszystkiego bez struktury jedynie przenosi problem filtrowania w inne miejsce.

Wnioski Dwarkesha Patela dotyczące danych utrudniają zignorowanie jednej konkluzji. Publiczne narracje nadmiernie podkreślały widoczne zmiany modeli, ponieważ architektury łatwiej nazwać niż potoki korpusów. Kontrolowane dowody dają teraz znacznie większą rolę cichszej zmiennej.

Kolejne trzy testy zdecydują, jak daleko sięga ta rola. Wypatruj replikacji przy większym nakładzie obliczeniowym, porównania danych syntetycznych z powtarzaniem materiału oraz zróżnicowanych ewaluacji zdolności. Razem mogą potwierdzić lub zawęzić twierdzenie, że postęp w pretrainingu wynikał głównie z danych.

Do tego czasu traktuj 12-krotny wynik jako silny sygnał eksperymentalny, a nie uniwersalną stałą. Audytuj informacje zasilające swoje systemy, testuj zmiany na rzeczywistych zadaniach i zachowuj źródła stojące za każdym wnioskiem. Lepsze modele nadal mają znaczenie, lecz ich wydajność zaczyna się od tego, czego wolno im się nauczyć.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page