top of page

Scraping sieci przez OpenAI ujawnił konflikt, którego Microsoft nie zdołał utrzymać w tajemnicy

6 dni temu
13 minut(y) czytania

Scraping sieci przez OpenAI mierzy się obecnie ze szkodliwą sprzecznością pochodzącą z wnętrza jego najbliższego partnera korporacyjnego. Dyrektor Microsoftu miał określić tę praktykę jako „największą kradzież pracy w historii ludzkości”.

To stwierdzenie nie padło ze strony krytyka protestującego poza branżą AI. Brent Hecht, Director of Applied Science w Microsoft, miał zawrzeć je w wewnętrznej notatce ze stycznia 2023 roku. Microsoft zainwestował w OpenAI i zintegrował jego modele w swoich produktach, w tym Copilot.

Odpieczętowane materiały z pozwu dotyczącego praw autorskich ujawniły teraz to prywatne ostrzeżenie. Dokumenty sugerują, że pracownicy Microsoftu i OpenAI rozumieli, iż produkty AI mogą osłabić wydawców dostarczających materiały wykorzystywane do ich trenowania.

Dowody te nie rozstrzygają, czy trenowanie modeli kwalifikuje się jako dozwolony użytek zgodnie z amerykańskim prawem autorskim. Wyostrzają jednak kluczowy konflikt, przed którym stoją OpenAI i Microsoft. Firmy opisują trenowanie jako transformacyjne, podczas gdy ich własni pracownicy mieli obawiać się, że powstałe w ten sposób produkty zastąpią dziennikarstwo i podważą jego ekonomiczne podstawy.

Co, według odpieczętowanych dokumentów, się wydarzyło

Nowy rozwój sytuacji nie jest po prostu kolejnym zarzutem, że OpenAI skopiowało artykuły. To dowód, że osoby wewnątrz firm dostrzegały wynikający z tego konflikt.

Materiały pojawiły się w ramach połączonego postępowania dotyczącego praw autorskich z udziałem The New York Times i innych wydawców. Times pierwotnie pozwał Microsoft i OpenAI w sądzie federalnym w grudniu 2023 roku.

Wydawcy twierdzą, że firmy kopiowały chronione prawem autorskim artykuły, aby tworzyć zbiory danych treningowych i komercyjne produkty AI. OpenAI i Microsoft utrzymują, że ich wykorzystanie ma charakter transformacyjny i jest chronione zasadą dozwolonego użytku.

Nowo ujawnione dokumenty wnoszą do tego sporu wewnętrzną komunikację, zeznania z przesłuchań i zgłaszane dane dotyczące zbiorów danych. Pozostaje jednak istotne ograniczenie. Wiele informacji pojawia się w streszczeniu wniosku wydawców o wydanie wyroku w trybie uproszczonym, podczas gdy część podstawowych załączników pozostaje zapieczętowana.

Oznacza to, że czytelnicy widzą cytaty wybrane i przedstawione przez jedną stronę trwającego postępowania. Te wypowiedzi są istotne, ale ich pełny kontekst nie zawsze jest dostępny.

Według raportu o scrapingu OpenAI, Hecht ostrzegał, że duże modele pochłaniają ludzką pracę na nadzwyczajną skalę. Inne relacje wskazują, że określił to jako „zdumiewającą kradzież o bezprecedensowych rozmiarach”.

Hecht miał napisać, że miliony ludzi uznałyby „odkurzanie” ich pracy przez modele za kradzież. Następnie opisał tę praktykę jako być może „największą kradzież pracy w historii ludzkości”.

To sformułowanie jest celowo szerokie i można je kwestionować z historycznego punktu widzenia. Jego znaczenie w tym przypadku wynika z tego, kto miał go użyć, a nie z uznania porównania za wyważony osąd historyczny.

Hecht pracował w Microsoft, firmie będącej najważniejszym partnerem technologicznym i komercyjnym OpenAI. Jego ostrzeżenie sugeruje, że zastrzeżenia etyczne i ekonomiczne nie ograniczały się do wydawców, autorów ani badaczy spoza firm.

Microsoft próbował zdystansować się od tego wniosku. Rzecznik firmy powiedział AFP, że komentarze Hechta przedstawiały indywidualną perspektywę jednego pracownika, a nie stanowisko Microsoftu.

Dokumenty mają opisywać ponad dziesięć milionów scrapowanych artykułów prasowych. Według relacji o kopiowaniu artykułów opartej na doniesieniach AFP, niemal jedna trzecia miała pochodzić z The New York Times.

Inna liczba dotyczy zbiorów danych wykorzystywanych w trakcie dalszego trenowania, czyli kolekcji służących do kontynuowania treningu modelu po jego początkowym opracowaniu. Zbiory te miały zawierać 91 692 kopie utworów z Times, Daily News i Center for Investigative Reporting.

Zbiór danych pochodzący z Common Crawl miał zawierać ponad dwa miliony dokumentów z nytimes.com. Common Crawl to organizacja non-profit, która okresowo gromadzi duże części publicznej sieci.

Wydawcy twierdzą również, że Microsoft przekazywał materiały OpenAI za pośrednictwem inicjatyw nazwanych Project Taxi i Project Mango. Project Mango miał stworzyć zbiór danych zawierający co najmniej 160 903 unikalne utwory należące do organizacji prasowych uczestniczących w postępowaniu.

Zarzuty wykraczają poza gromadzenie publicznie dostępnych stron. Dokument ma cytować pracownika OpenAI, który opisał metodę obchodzenia paywalla Times. Prezes OpenAI Greg Brockman miał odpowiedzieć: „ah nice”.

Ta wymiana będzie uważnie analizowana, ponieważ ograniczenia dostępu mogą wpływać zarówno na analizę prawną, jak i faktyczną. Kopiowanie otwarcie dostępnej strony i obchodzenie paywalla nie rodzą identycznych pytań.

Dokument zarzuca również, że podczas przygotowywania części zbiorów danych usuwano informacje o prawach autorskich, zanim dane trafiły do modelu. OpenAI nie przyznało, że praktyki te stanowią naruszenie, a cytowane wymiany wymagają poznania pełnego kontekstu.

Mimo to szczegóły te zmieniają charakter sporu. Sprawa nie jest już przedstawiana wyłącznie jako sytuacja, w której wydawcy wnioskują, w jaki sposób ich praca trafiła do ChatGPT.

Dokumenty przedstawiają zgłaszany obraz wewnętrznej wiedzy, technicznych metod pozyskiwania danych i obaw komercyjnych. Te kwestie mogą wpłynąć na ocenę przez sąd celu działania, skutków rynkowych i wiarygodności narracji każdej ze stron.

Dlaczego scraping sieci przez OpenAI stał się testem dozwolonego użytku

Scraping sieci przez OpenAI ma znaczenie prawne, ponieważ ta sama treść miała pomóc w budowie produktów, które mogą odpowiadać użytkownikom bez odsyłania ich z powrotem do wydawców.

Dozwolony użytek zezwala na niektóre nieobjęte licencją wykorzystania utworów chronionych prawem autorskim. Sądy zwykle analizują cel wykorzystania, charakter oryginalnego utworu, zakres skopiowanego materiału oraz wpływ na jego potencjalny rynek.

Żaden pojedynczy czynnik nie rozstrzyga każdej sprawy. Analiza zależy od konkretnych utworów, metod kopiowania, wyników i rynków.

OpenAI argumentuje, że trening modeli przekształca materiał źródłowy w reprezentacje statystyczne wykorzystywane do generowania nowych odpowiedzi. Twierdzi również, że fakty zawarte w relacjach prasowych nie są chronione prawem autorskim.

Wydawcy odpowiadają, że ich pozwy dotyczą chronionej formy wyrazu, a nie własności faktów. Argumentują, że OpenAI kopiowało kompletne artykuły na masową skalę i stworzyło produkty konkurujące o tych samych czytelników.

Niedawne decyzje w sprawach dotyczących praw autorskich i AI zapewniły deweloperom istotne wsparcie. Sądy w Kalifornii uznały niektóre wykorzystania książek do trenowania modeli za transformacyjne, choć stan faktyczny i pozostałe roszczenia różniły się.

OpenAI przywoływało te decyzje w swojej obronie. Times twierdzi, że jego spór przedstawia silniejsze dowody na zastępowanie rynku, ponieważ ChatGPT i Copilot mogą dostarczać aktualne informacje przypominające publikacje wydawcy.

To rozróżnienie czyni wewnętrzne wypowiedzi szczególnie istotnymi. Szef ChatGPT w OpenAI, Nick Turley, miał napisać, że produkty firmy są „w dużej mierze substytucyjne”.

Miał przewidywać, że wraz z poprawą jakości staną się jeszcze bardziej substytucyjne. Turley miał także opisać produkty AI jako „egzystencjalne zagrożenie” dla wydawców.

Dyrektor generalny Microsoftu Satya Nadella miał przyznać podczas przesłuchania, że rozmowy z chatbotami zastąpiły część wizyt na źródłowych stronach internetowych. Nie dowodzi to automatycznie prawnie rozpoznawalnej szkody rynkowej, ale wspiera faktyczną teorię wydawców.

Wewnętrzne pomiary Microsoftu mogą okazać się bardziej istotne. Dokumenty mają wskazywać, że silnik odpowiedzi Copilot obniżył współczynnik kliknięć do domeny Times nawet o 93 procent w porównaniu z tradycyjnym wyszukiwaniem Bing.

Współczynnik kliknięć mierzy, jak często użytkownicy podążają za wyświetlonym linkiem. Spadek może ograniczyć liczbę wyświetleń reklam, subskrypcje, rozpoznawalność marki i możliwość budowania bezpośredniej relacji z czytelnikiem.

Ta liczba wymaga ostrożnej interpretacji. Pochodzi z materiałów procesowych, a jej metodologia nie została w pełni zweryfikowana publicznie. Może odzwierciedlać konkretne zapytania, projekty interfejsu lub okresy pomiarowe, a nie cały ruch Copilot.

Mimo to wskazuje na pytanie leżące u podstaw sprawy. Czy odpowiedź AI tworzy nowe narzędzie, czy zastępuje rynek dla reportażu wykorzystanego do jej stworzenia?

Wewnętrzna prezentacja Microsoftu miała opisywać tę sytuację jako „pętlę zagłady”. Jeśli odpowiedzi AI ograniczają ruch u wydawców, wydawcy otrzymują mniejsze przychody. Niższe przychody oznaczają następnie mniej reporterów i mniej oryginalnych artykułów.

To pozostawia przyszłym modelom mniej wiarygodnych materiałów do przyswojenia. Usługa AI może zatem osłabić zasób informacji, od którego zależy jej jakość.

Problem jest szczególnie dotkliwy w przypadku reportaży wymagających kosztownej pracy ludzkiej. Śledztwa, relacje sądowe, korespondencje zagraniczne i dziennikarstwo dotyczące władz lokalnych nie mogą powstać wyłącznie z istniejącego tekstu.

Ktoś musi uczestniczyć w rozprawie, zweryfikować dokument, przeprowadzić wywiad ze źródłem i wziąć odpowiedzialność za publikację. Model może skompresować tę pracę po jej opublikowaniu, lecz kompresja nie finansuje jej powstania.

Sprawa weszła w decydującą fazę, gdy strony zwróciły się do sędziego Sądu Okręgowego USA Sidneya Steina o rozstrzygnięcie kwestii w drodze wyroku w trybie uproszczonym. Wyrok w trybie uproszczonym pozwala sądowi rozstrzygnąć roszczenia bez procesu, gdy żaden istotny spór faktyczny nie wymaga udziału ławy przysięgłych.

Przegląd sprawy dotyczącej praw autorskich i AI podał, że Stein ma rozstrzygnąć, czy istotne części sprawy powinny zmierzać ku procesowi. Ostatecznej decyzji nie oczekuje się natychmiast.

Departament Sprawiedliwości USA poparł stanowisko OpenAI w sprawie trenowania, podkreślając postęp naukowy, wzrost gospodarczy i bezpieczeństwo narodowe. Ta interwencja pokazuje, jak daleko spór wykracza poza jednego wydawcę.

Szeroka decyzja przeciwko twórcom modeli mogłaby podnieść koszt gromadzenia korpusów treningowych. Szeroka decyzja na korzyść twórców mogłaby znacząco ograniczyć kontrolę wydawców nad tym, jak modele komercyjne wykorzystują ich archiwa.

Microsoft i OpenAI muszą zmierzyć się z własnymi słowami

Główny konflikt zachodzi między publiczną obroną opartą na dozwolonym użytku a prywatnymi ostrzeżeniami, że systemy AI mogą zastąpić ich kluczowych dostawców treści.

OpenAI i Microsoft nie muszą udowadniać, że ich technologia nie narusza żadnego istniejącego rynku. Produkty transformacyjne często zmieniają branże, a sama zakłócenie rynku nie stanowi naruszenia praw autorskich.

Ich trudniejszy problem jest węższy. Wewnętrzne wypowiedzi miały przewidywać substytucję, spadający ruch odsyłający, pogorszenie ekonomiki wydawców i spadek jakości przyszłych treści.

Te obawy przypominają elementy sprawy wydawców. Komplikują również starania firm, by przedstawiać szkodliwe skutki rynkowe jako spekulatywne lub odległe.

Jeden z dokumentów Microsoftu miał zauważać, że produkt końcowy rzadko zagraża ekonomicznym fundamentom swoich kluczowych dostawców. Następnie miał stwierdzać, że Microsoft stworzył właśnie taką sytuację dla łańcucha dostaw treści wspierającego duże modele językowe.

Duży model językowy, czyli LLM, przewiduje i generuje tekst na podstawie wzorców poznanych podczas treningu. Jego „łańcuch dostaw treści” obejmuje osoby i organizacje tworzące materiały włączane do zbiorów danych lub systemów wyszukiwania.

Takie ujęcie traktuje dziennikarstwo jako wkład w rozwój AI. Uznaje też, że ten wkład nie pojawia się automatycznie.

Wydawcy zatrudniają reporterów, fotografów, redaktorów, projektantów, prawników i zespoły techniczne. Finansują wnioski o udostępnienie dokumentów, podróże, rozwijanie sieci źródeł, weryfikację faktów i korekty.

ChatGPT może oddzielić informacje od otaczającego je doświadczenia publikacyjnego. Użytkownik otrzymuje zsyntetyzowaną odpowiedź, niekoniecznie widząc proces reporterski, reklamy, ofertę subskrypcji czy relację ze źródłem.

Dla czytelników ta wygoda jest produktem. Dla wydawców ta sama wygoda może usuwać moment, w którym praca reporterska tworzy wartość ekonomiczną.

Napięcie staje się większe, gdy materiały za paywallem trafiają do treningu. Nadella miał zeznać, że każdy, kto wykorzystuje płatne informacje do ugruntowania odpowiedzi lub treningu, powinien uzyskać licencję.

Ugruntowanie odpowiedzi oznacza dostarczenie modelowi zewnętrznych informacji wspierających odpowiedź. Różni się od treningu tym, że informacje mogą zostać pobrane, gdy użytkownik zada pytanie.

Nadella miał powiedzieć, że skorzystałby z prawa Microsoft do zażądania ponownego treningu, gdyby wiedział, że OpenAI trenowało na materiałach znajdujących się za paywallem. To stwierdzenie nie dowodzi, że wiedział o takim kopiowaniu.

Ujawnia jednak rozróżnienie, które prezes Microsoft uznawał za istotne. Materiały chronione opłatami i kontrolą dostępu wiążą się z wyraźniejszym oczekiwaniem licencjonowanego wykorzystania komercyjnego.

Od czasu uruchomienia ChatGPT OpenAI zawarło umowy licencyjne z licznymi wydawcami. Associated Press, Axel Springer, News Corp i inne organizacje ogłosiły różne porozumienia dotyczące treści.

Umowy te wspierają dwie przeciwstawne interpretacje. OpenAI może twierdzić, że licencjonowanie odzwierciedla przyszłościowe dążenie do budowania trwałych partnerstw, a nie przyznanie się do wcześniejszych działań.

Wydawcy mogą argumentować, że porozumienia dowodzą istnienia działającego rynku licencjonowania. Jeśli porównywalne treści mają wartość licencyjną, nieuprawnione kopiowanie może wyglądać mniej jak abstrakcyjny proces techniczny.

Branża nie przyjęła jednego podejścia. Niektórzy wydawcy licencjonują archiwa, inni blokują crawlery AI, a jeszcze inni pozywają firmy. Kilku stosuje wszystkie trzy strategie w odniesieniu do różnych produktów i okresów.

Powstały rynek sprzyja firmom dysponującym siłą negocjacyjną. Duży międzynarodowy wydawca może negocjować wynagrodzenie, ekspozycję produktu i warunki przypisania źródła.

Mała lokalna redakcja ma mniejszą siłę przetargową. Jej materiały nadal mogą zawierać unikalne fakty, które stają się cenne dla silnika odpowiedzi, zwłaszcza w czasie kryzysów lub lokalnych sporów politycznych.

Ta nierównowaga pomaga wyjaśnić, dlaczego spór sądowy wykroczył poza „Times”. Szersza grupa obejmuje krajowe, wyspecjalizowane, śledcze i lokalne organizacje informacyjne.

Sędzia federalny zezwolił na dalsze prowadzenie głównych roszczeń dotyczących praw autorskich w 2025 roku. Wcześniejsze orzeczenie sądu oddaliło część roszczeń, lecz zachowało główny spór dotyczący kopiowania i rozwoju modeli.

OpenAI z zadowoleniem przyjęło oddalenie tych roszczeń i oświadczyło, że buduje modele na podstawie publicznie dostępnych danych w sposób oparty na zasadzie dozwolonego użytku. Microsoft odmówił komentarza na temat tego orzeczenia.

Rozróżnienie między publiczną dostępnością a zgodą pozostaje nierozstrzygnięte. To, że utwór można przeczytać online, nie oznacza koniecznie, że każda forma kopiowania jest zgodna z prawem.

Jednocześnie prawo autorskie nie daje wydawcom kontroli nad faktami ani zwykłym uczeniem się. Sąd musi rozstrzygnąć, gdzie trening obliczeniowy mieści się między tymi ugruntowanymi zasadami.

Dokumenty są szkodliwe, ale nie stanowią wyroku

Wewnętrzny język wzmacnia narrację wydawców, lecz samodzielnie nie rozstrzyga o naruszeniu, odszkodowaniu ani dozwolonym użytku.

Najbardziej dramatyczny cytat pochodzi od pracownika Microsoft, a nie z ustalenia sądu. Nazwanie działania „kradzieżą” w wewnętrznej notatce nie przesądza, czy spełnia ono prawne przesłanki naruszenia praw autorskich.

Pracownicy często używają języka moralnego, strategicznego lub retorycznego, który różni się od analizy prawnej. Sąd zbada zachowanie i dowody, zamiast traktować słownictwo jednej osoby jako obowiązujące prawo.

Microsoft podkreślił już tę kwestię, opisując komentarze Hechta jako indywidualną perspektywę. Firma może także argumentować, że wewnętrzna debata świadczy o odpowiedzialnej analizie ryzyka, a nie o korporacyjnej wiedzy o nieprawidłowościach.

Firmy rutynowo proszą pracowników o identyfikowanie najgorszych możliwych scenariuszy. Notatka dotycząca ryzyka może zawierać bezpośrednie ostrzeżenia właśnie dlatego, że decydenci chcą, aby potencjalne szkody zostały jasno przedstawione.

Z tego powodu znaczenie mają pełne załączniki. Bez otaczających wiadomości, odbiorców i odpowiedzi czytelnicy nie mogą wiedzieć, czy kierownictwo zaakceptowało, odrzuciło lub zbadało każde ostrzeżenie.

Pismo procesowe wydawców pełni również funkcję perswazyjną. Ich prawnicy wybrali dowody wspierające wniosek i uporządkowali je wokół swojej teorii prawnej.

OpenAI i Microsoft inaczej zinterpretują ten sam materiał. Mogą kwestionować znaczenie cytatów, reprezentatywność danych o ruchu oraz związek przyczynowy między odpowiedziami AI a stratami wydawców.

Mogą również argumentować, że trening i wynik działania produktu nie powinny być traktowane jako jedno działanie. Model może być trenowany na utworze, nie odtwarzając go użytkownikom.

Z drugiej strony produkt może wygenerować zastępczą odpowiedź przy użyciu licencjonowanych informacji, informacji z domeny publicznej lub informacji pobranych osobno. Sąd może potrzebować niezależnie ocenić różne zbiory danych, modele i funkcje.

Podawana liczba dziesięciu milionów artykułów również wymaga precyzji. Obecność artykułu w zbiorze danych nie pokazuje, jak często wpływał on na zachowanie modelu.

Skopiowany dokument nie musi też pozostawać możliwy do odzyskania jako przechowywany artykuł. Modele zazwyczaj kodują wyuczone zależności statystyczne, zamiast działać jak zwykłe przeszukiwalne archiwa.

Mimo to może dochodzić do zapamiętywania. Modele czasami odtwarzały rozpoznawalne fragmenty, zwłaszcza gdy materiały wielokrotnie pojawiały się w danych treningowych lub prompty zaprojektowano tak, by je wywołać.

Wydawcy argumentują, że takie wyniki ujawniają kopiowanie i konkurują z oryginalnym utworem. OpenAI twierdzi, że nietypowe prompty i odosobnione przykłady nie reprezentują normalnego użycia produktu.

Ten spór faktyczny ma znaczenie, ponieważ substytucja rynkowa nie jest po prostu kwestią tego, czy ktoś woli ChatGPT. Sądy zbadają, czy kwestionowane wykorzystanie szkodzi istniejącemu lub rozsądnie potencjalnemu rynkowi chronionemu prawem autorskim.

Podawany 93-procentowy spadek współczynnika kliknięć wydaje się istotny, ale sama liczba nie może odpowiedzieć na to pytanie. Porównanie musi uwzględniać typy zapytań, prezentację wyników, cytowania i intencję użytkownika.

Nawigacyjne wyszukiwanie konkretnego artykułu „Times” różni się od ogólnej prośby o podsumowanie pogody. Jedno poszukuje wydawcy, podczas gdy drugie poszukuje informacji, których może dostarczyć wiele źródeł.

Sformułowanie „największa kradzież pracy” może również odciągać uwagę od kwestii prawnych. Jego historyczna skala zachęca do emocjonalnej argumentacji, której żadna ze stron nie potrzebuje, aby wygrać sprawę.

Bardziej użyteczne pytanie dotyczy tego, co zostało skopiowane, na jakich warunkach dostępu, w jakim celu komercyjnym i z jakim mierzalnym skutkiem. Te pytania łączą proces techniczny z doktryną prawa autorskiego.

Czytelnicy powinni również odróżniać scraping internetowy OpenAI od każdej formy wyszukiwania wspomaganego przez AI. Trening, pobieranie na żywo, indeksowanie, buforowanie, streszczanie i dosłowne odtwarzanie to różne operacje.

Każda z nich może wiązać się z innymi uprawnieniami i decyzjami produktowymi. Traktowanie ich jako jednej, niezróżnicowanej praktyki utrudnia określenie wykonalnych zasad.

Dla pracowników wiedzy kontrowersja ta niesie praktyczne ostrzeżenie. Materiały umieszczone online mogą trafiać do zbiorów danych, indeksów i systemów odpowiedzi, które później trudno audytować.

Utrzymywanie możliwej do prześledzenia osobistej bazy wiedzy nie zapobiegnie zewnętrznemu scrapingowi. Może jednak zachować źródła, autorstwo i kontekst, gdy podsumowania generowane przez AI zacierają pochodzenie informacji.

Ta sama dyscyplina ma znaczenie wewnątrz firm. Zespoły wdrażające narzędzia AI powinny dokumentować, które źródła wspierają generowane twierdzenia oraz jakie licencje regulują te źródła.

Wymóg ten nie dotyczy wyłącznie unikania sporów sądowych. Pochodzenie informacji pomaga użytkownikom odróżnić oryginalne dowody od syntezy wygenerowanej przez model.

Co wydarzy się dalej w sprawie scrapingu OpenAI

Trzy sygnały pokażą, czy te ujawnienia zmienią wynik prawny, rynek licencjonowania czy projekt produktów AI udzielających odpowiedzi.

Pierwszym sygnałem będzie decyzja sędziego Steina w sprawie wyroku uproszczonego. Orzeczenie określi, które kwestie można rozstrzygnąć teraz, a które wymagają procesu.

Jeśli sąd zaakceptuje znaczące części argumentacji wydawców, wewnętrzne dowody dotyczące substytucji i paywalli staną się bardziej istotne. Proces mógłby ujawnić dodatkowe załączniki i zeznania opinii publicznej.

Jeśli sąd zapewni szeroką ochronę OpenAI i Microsoft, ujawnienia pozostaną szkodliwe reputacyjnie, nie powodując jednak zmiany prawnej, której chcą wydawcy. Taki wynik wzmocniłby stanowisko innych twórców modeli dotyczące dozwolonego użytku.

Możliwa jest również decyzja częściowo korzystna dla obu stron. Sędzia może odróżnić trening na dostępnych stronach od obchodzenia paywalli, konkretnych wyników lub określonych programów danych Microsoft.

Takie rozróżnienia miałyby większe znaczenie niż prosta etykieta zwycięzcy. Mogłyby ustanowić różne zasady dotyczące gromadzenia danych, treningu, pobierania informacji i generowanych odpowiedzi.

Drugim sygnałem będzie sposób, w jaki praktyki licencyjne zmienią się przed ostatecznym wyrokiem. OpenAI pokazało już, że w pewnych okolicznościach będzie negocjować z wydawcami.

Warto obserwować, czy umowy zaczną obejmować historyczny trening, pobieranie na żywo, cytowania przez model, podział przychodów lub wszystkie cztery elementy. Każdy warunek dotyczy innej części konfliktu.

Licencje na historyczny trening przypisywałyby wartość wcześniejszemu wykorzystaniu zbiorów danych. Umowy dotyczące pobierania regulowałyby bieżący dostęp, gdy odpowiedź wymaga najnowszych informacji.

Postanowienia dotyczące cytowań określałyby, jak wyraźnie użytkownicy widzą oryginalne źródła. Ustalenia dotyczące przychodów rozstrzygałyby, czy wydawcy uczestniczą w zyskach, gdy ich materiały reporterskie wspierają komercyjne odpowiedzi.

Kluczowe pytanie brzmi, czy mniejsze redakcje uzyskają dostęp do podobnych rynków. System licencjonowania obsługujący wyłącznie największych wydawców pozostawiłby nierozwiązany podstawowy problem podaży.

Licencjonowanie zbiorowe lub ujednolicone warunki w formacie odczytywalnym maszynowo mogłyby poszerzyć uczestnictwo. Systemy te nadal wymagałyby jednak przejrzystego rozliczania oraz sposobu identyfikacji treści, które wpłynęły na daną usługę.

Trzecim sygnałem będzie zachowanie produktu. Microsoft i OpenAI mogą zareagować bez czekania na sądy, zmieniając sposób, w jaki systemy odpowiedzi kierują uwagę użytkowników.

Same wyraźne linki mogą nie rozwiązać problemu. Jeden z inżynierów OpenAI miał przyznać, że użytkownicy mogą nie podążać za linkami niezależnie od ich umiejscowienia.

Lepszym testem jest mierzalna jakość przekierowań. Wydawcy potrzebują czytelników, którzy angażują się, subskrybują lub rozpoznają źródło, a nie jedynie cytatu pod kompletną odpowiedzią zastępującą oryginał.

Firmy AI mogłyby ograniczać podsumowania, gdy zapytanie dotyczy konkretnego chronionego artykułu. Mogłyby również odróżniać w interfejsie licencjonowane pobieranie informacji od ogólnej wiedzy modelu.

Tymczasem wydawcy będą nadal testować bariery techniczne i roszczenia prawne. Należy oczekiwać większej liczby sporów dotyczących kontroli crawlerów, paywalli, stron z pamięci podręcznej i treści dostarczanych przez indeksy wyszukiwarek.

Szersza branża musi zdecydować, czy oryginalne materiały reporterskie są jedynie kolejnym surowym wkładem, czy usługą wymagającą ciągłych inwestycji. Wewnętrzne ostrzeżenie Microsoft o „pętli zagłady” sprawia, że trudniej zignorować ten wybór.

Dla deweloperów sprawa powinna już teraz wpływać na zarządzanie danymi. Dokument dostępny technicznie nie jest automatycznie wolny od ryzyka kontraktowego, związanego z prawem autorskim ani reputacyjnego.

Dla nabywców korporacyjnych pochodzenie informacji powinno stać się wymogiem produktowym. Warto pytać dostawców, czy odpowiedzi pochodzą z pamięci treningowej, bieżącego wyszukiwania, licencjonowanych baz danych czy dokumentów kontrolowanych przez klienta.

Dla wydawców oczekiwanie na ostateczne rozstrzygnięcie również wiąże się z kosztami. Potrzebują dowodów pokazujących, jak interfejsy AI zmieniają ruch z poleceń, subskrypcje i zachowania czytelników.

Dla użytkowników wygoda pozostaje realną korzyścią. Chatboty potrafią szybko łączyć informacje i ułatwiać przyswajanie trudnych tematów.

Odpowiedzialna reakcja nie polega na udawaniu, że synteza sama tworzy dowody. Czytelnicy powinni otwierać źródła pierwotne, gdy liczy się dokładność, płatność lub rozliczalność.

Scraping stron internetowych przez OpenAI stał się czymś więcej niż sporem o to, w jaki sposób jeden model pozyskał tekst. To teraz sprawdzian tego, czy firmy AI mogą polegać na dziennikarstwie, jednocześnie odciągając uwagę, która je finansuje.

Sąd rozstrzygnie roszczenia prawne. Wydawcy, deweloperzy i użytkownicy zdecydują, czy gospodarka informacyjna wspierająca te systemy może przetrwać ich sukces.

Gdy następnym razem odpowiedź AI zastąpi wizytę u źródła, zadaj jedno praktyczne pytanie: kto sfinansował oryginalne reportażowe materiały i czy ta organizacja nadal będzie mogła sfinansować kolejną historię?

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page