top of page

Prognozowanie AI Mantic pozyskuje 25 mln dolarów po pokonaniu wszystkich ludzkich uczestników

5 dni temu
14 minut(y) czytania

Mantic AI Forecasting pozyskał 25 mln dolarów po tym, jak jego system prześcignął każdego ludzkiego uczestnika niedawnego turnieju prognostycznego. Wynik daje londyńskiemu startupowi mocny argument, ale nie oznacza uniwersalnego zwycięstwa nad ludzkim osądem.

Rundzie seed przewodził Radical Ventures, przy wsparciu M12 Microsoftu, Thinking Machines Lab, Balderton Capital i innych inwestorów. Mantic ma teraz kapitał, aby przekształcić wynik turniejowy w produkt dla firm, rządów i instytucji finansowych.

To przejście tworzy właściwe napięcie. Konkursy prognostyczne nagradzają dobrze skalibrowane prawdopodobieństwa dla jasno określonych pytań. Organizacje muszą jednak podejmować kosztowne decyzje przy niepełnych informacjach, zmieniających się celach i konsekwencjach, których ranking nie potrafi zmierzyć.

Najbliższym rywalem Mantic nie jest więc inny startup. Jest nim istniejący ludzki proces prognozowania, łączący analityków, ekspertów dziedzinowych, osąd kadry zarządzającej, a czasem także rynki predykcyjne.

Prognozowanie AI Mantic przekuwa zwycięstwo w turnieju w 25 mln dolarów

Mantic przekształcił mierzalny wynik prognozowania w jeden z najczytelniejszych dotąd komercyjnych zakładów na zautomatyzowany osąd.

Firma ogłosiła rundę seed 18 września 2026 roku. Finansowaniu przewodził Radical Ventures, a udział wzięły M12, Thinking Machines Lab, Balderton Capital i inni inwestorzy.

Firma nie ujawniła wyceny w komunikacie opisywanym przez Reuters. Wcześniejszy raport umieszczał oczekiwaną wycenę w pobliżu 90 mln dolarów, ale liczba ta została przypisana anonimowemu źródłu.

Mantic został założony w Londynie w 2024 roku przez prezesa Toby’ego Shevlane’a i dyrektora technicznego Bena Daya. Shevlane wcześniej pracował jako naukowiec badawczy w Google DeepMind, w tym nad badaniami związanymi ze zdolnościami AI i rozwojem sytuacji geopolitycznej.

Day ma doktorat z uczenia maszynowego na University of Cambridge. Jego wcześniejsza praca obejmowała optymalizację przemysłową i zastosowania AI w rozwoju leków, zgodnie z opublikowanymi przez Mantic informacjami o zespole.

Firma wcześniej pozyskała 4 mln dolarów w finansowaniu pre-seed. Tej rundzie przewodził Episode 1, przy udziale firmy tradingowej DRW oraz inwestorów-aniołów powiązanych z czołowymi laboratoriami AI.

Nowe finansowanie nastąpiło po występie Mantic w Summer 2026 Metaculus Cup. Metaculus organizuje turnieje, w których uczestnicy przypisują prawdopodobieństwa wynikom politycznym, gospodarczym, technologicznym i kulturowym.

Według opublikowanych szczegółów finansowania seed, Mantic zakończył rywalizację przed każdym ludzkim uczestnikiem. Wyższy wynik uzyskał tylko jeden automatyczny uczestnik, nazwany laertes.

To rozróżnienie ma znaczenie. Mantic nie pokonał każdego możliwego ludzkiego prognosty ani nie rozstrzygnął, czy maszyny mają lepszy osąd w każdych warunkach.

Pokonał ludzi, którzy wzięli udział w jednym ustrukturyzowanym konkursie, w ramach jego pytań, harmonogramu i systemu punktacji. To nadal istotny wynik, lecz jego granice zasługują na równie dużą uwagę.

Pytania obejmowały wydarzenia, których odpowiedzi stały się obserwowalne w trakcie turnieju. Uczestnicy musieli podawać prawdopodobieństwa zamiast formułować niejasne przewidywania, które można później reinterpretować.

Jeden z przykładów dotyczył wyborów prezydenckich w Kolumbii. Shevlane powiedział Reutersowi, że Mantic na początku turnieju przypisał Abelardo De La Esprielli około 40% prawdopodobieństwa zwycięstwa.

Dominująca prognoza była bliższa 30%, a De La Espriella ostatecznie wygrał. Przykład ten sugeruje, że system nie jedynie odtwarzał konsensus tłumu.

Inne pytanie dotyczyło tego, czy „Dai Dai” Shakiry wyprzedzi „Waka Waka” na Billboard Hot 100. Ludzcy uczestnicy zdecydowanie faworyzowali jeden wynik, podczas gdy Mantic miał mniejsze zaufanie do tego konsensusu.

Wystąpił mniej popularny wynik. Shevlane przedstawił to jako dowód, że system opierał się zachowaniom stadnym, choć jeden przykład nie może ustanowić ogólnej prawidłowości.

Finansowanie zamienia te wyniki w szerszą propozycję. Inwestorzy stawiają na to, że Mantic potrafi powtórzyć swoją skuteczność dla większej liczby pytań i połączyć prawdopodobieństwa z decyzjami o istotnych konsekwencjach.

Dlatego jest to więcej niż rutynowe ogłoszenie rundy seed. Mantic pozyskał finansowanie, ponieważ prognozowanie zapewnia wyjątkowo bezpośredni test rzeczywistego rozumowania systemu AI.

Prognoza w końcu się rozstrzyga. System można ocenić, porównać z ludzkim osądem i ulepszać na podstawie wyników, które były nieznane w chwili tworzenia przewidywania.

Trudniejsze pytanie pojawia się po otrzymaniu wyniku. Mantic musi pokazać, że trafne prawdopodobieństwa mogą poprawić decyzje w organizacjach, gdzie zachęty, czas i rozliczalność pozostają skomplikowane.

Dlaczego prognozowanie stało się teraz celem inwestycji w AI

Prognozowanie AI przyciąga kapitał, ponieważ nowsze systemy potrafią badać, aktualizować i oceniać przewidywania na skalę, której zespoły ludzkie nie są w stanie utrzymać.

Tradycyjne uczenie maszynowe sprawdza się dobrze, gdy organizacje mają obfite, ustrukturyzowane dane i stabilne relacje między danymi wejściowymi a wynikami. Prognozowanie oparte na osądzie stanowi inny problem.

Prognozowanie oparte na osądzie dotyczy wydarzeń wymagających rozumowania kontekstowego, a nie tylko powtarzalnych pomiarów. Do tej kategorii należą wybory, decyzje regulacyjne, konflikty zbrojne, odejścia członków kierownictwa i premiery produktów.

Wydarzenia te rzadko podążają za czystymi wzorcami historycznymi. Istotne dowody pojawiają się w doniesieniach prasowych, publicznych oświadczeniach, publikacjach gospodarczych, zachowaniach społecznych i analogicznych przypadkach.

Ludzcy prognostycy potrafią łączyć te sygnały. Dobrych prognostów jest jednak niewielu, a ich uwaga nie może objąć tysięcy nieustannie zmieniających się pytań.

Duże modele językowe tworzą potencjalną przewagę skali. Mogą gromadzić informacje, porównywać przypadki historyczne, generować konkurencyjne argumenty i aktualizować liczbowe prawdopodobieństwa za każdym razem, gdy pojawiają się nowe dowody.

Ta zdolność nie czyni AI automatycznie trafnym. Zmienia ekonomię testowania i iteracji, co pomaga wyjaśnić zainteresowanie inwestorów.

Ludzki prognosta może czekać miesiącami, zanim dowie się, czy dana technika zadziałała. Zautomatyzowany system można oceniać na dużych zbiorach pytań, które zostały już rozstrzygnięte.

Mantic twierdzi, że jego system obsługuje prognozy od jednego tygodnia do jednego roku naprzód. Wskazywane przez firmę obszary obejmują geopolitykę, biznes, politykę publiczną, technologię i kulturę.

Są to obszary, w których organizacje już płacą analitykom za interpretację słabych sygnałów. Są to także obszary, w których błędne założenie może przekierować kapitał, zatrudnienie, zapasy lub politykę.

Publiczny system prognozowania firmy kierowany jest do analityków finansowych, strategów korporacyjnych, zespołów ryzyka, badaczy i decydentów. Przykłady obejmują stopy procentowe, sankcje, spory sądowe, zmiany w kierownictwie i zakłócenia dostaw.

Dla funduszu hedgingowego lepsze prawdopodobieństwo może kształtować transakcję. Dla producenta może wpłynąć na decyzje dotyczące zapasów lub zaopatrzenia, zanim zakłócenie stanie się oczywiste.

Rządy mogłyby wykorzystywać prognozy do priorytetyzowania planowania awaryjnego. Zespół strategii korporacyjnej mógłby śledzić prawdopodobieństwo, że konkurent wprowadzi produkt w określonym czasie.

Partner Radical Ventures Aaron Rosenberg powiedział Reutersowi, że zainteresowanie wyraziły firmy i agencje rządowe. Stwierdził również, że niektóre organizacje zintegrowały AI Mantic, choć firma odmówiła wskazania klientów.

Brak nazwanych klientów ogranicza niezależną ocenę. Mimo to zakres zainteresowanych nabywców pokazuje, dlaczego prognozowanie może stać się komercyjną kategorią AI.

Produkt nie jest kolejnym interfejsem konwersacyjnym czekającym, aż użytkownik zada właściwe pytanie. Obiecuje trwałą warstwę prawdopodobieństw, która może monitorować ryzyka i szanse.

Ta obietnica pojawia się w czasie, gdy modele ogólnego przeznaczenia coraz lepiej radzą sobie z badaniami i wieloetapowym rozumowaniem. Systemy mogą obecnie pobierać aktualne dowody, porównywać źródła i powtarzać procesy bez ciągłego angażowania człowieka.

Wcześniejsze dowody były znacznie mniej korzystne dla maszyn. Badanie prognozowania w warunkach rzeczywistych wykazało, że GPT-4 był istotnie mniej trafny niż prognozy ludzkiego tłumu w turnieju na żywo.

Ważnym słowem jest „na żywo”. Gdy odpowiedzi pozostają nieznane, model nie może polegać na zapamiętanych rozwiązaniach ze znanego materiału benchmarkowego.

Nowy wynik Mantic sugeruje, że wyspecjalizowane systemy mogą zmniejszyć lub zniwelować tę lukę. Poprawa wydaje się wynikać z całego procesu prognozowania, a nie z jednego modelu bazowego działającego samodzielnie.

To rozróżnienie wyjaśnia także tezę inwestycyjną. Modele frontier stają się elementami wejściowymi, a startupy konkurują przez orkiestrację badań, dane ewaluacyjne, zasady aktualizacji, kalibrację i integrację z klientami.

Jeśli te warstwy zapewniają konsekwentnie lepsze prognozy, ich wartość może utrzymać się nawet wtedy, gdy bazowe modele staną się szeroko dostępne.

Celem inwestycji nie jest więc przewidywanie jako spektakl. Jest nim system operacyjny do ciągłego mierzenia niepewności wokół decyzji, które organizacje już muszą podejmować.

Rzeczywistym rywalem jest ludzki proces prognozowania

Mantic konkuruje z powolnym i rozproszonym procesem decyzyjnym, a nie z ludzką inteligencją w abstrakcji.

Organizacje rzadko polegają na jednym prognostyku. Łączą raporty, spotkania, arkusze kalkulacyjne, zewnętrznych konsultantów, opinie ekspertów i intuicję kadry zarządzającej.

Każdy wkład może zawierać wartościową wiedzę. Słabość polega na przekształcaniu tych informacji w spójne prawdopodobieństwa, które można śledzić i oceniać w czasie.

Analityk może opisać zatwierdzenie regulacyjne jako prawdopodobne. Inny może uznać je za możliwe. Trzeci może zalecić czekanie, nie podając żadnego prawdopodobieństwa.

Takie sformułowania trudno porównać. Pozwalają też ludziom reinterpretować wcześniejszą pewność siebie po poznaniu wyniku.

Platforma prognostyczna wymaga wyraźniejszego zobowiązania. Przewidywanie na poziomie 70% powinno sprawdzać się około siedmiu razy w dziesięciu porównywalnych przypadkach.

Ta właściwość nazywa się kalibracją, co oznacza, że deklarowane prawdopodobieństwo powinno odpowiadać obserwowanej częstości w wielu prognozach. Kalibracja zmienia pewność siebie w coś, co organizacja może audytować.

Ludzkie zespoły prognostyczne mogą robić to dobrze. Badania związane z Good Judgment Project pokazały, że przeszkoleni generalści mogą przewyższać konwencjonalne procesy eksperckie w pytaniach geopolitycznych.

Najlepsi prognostycy rozkładali problemy na części, korzystali z klas porównawczych, często aktualizowali oceny i opierali się pewności ideologicznej. Tych nawyków można nauczyć, lecz ich utrzymywanie w całym przedsiębiorstwie wymaga dyscypliny.

Przewagą Mantic jest powtarzalność. Oprogramowanie może stosować ten sam proces do każdego śledzonego pytania, aktualizować go według harmonogramu i zachowywać rejestr każdej zmiany prawdopodobieństwa.

System może także obejmować więcej pytań niż niewielka grupa analityków. Ta skala ma znaczenie, ponieważ decydenci często potrzebują szerokiego monitoringu, zanim zorientują się, która kwestia zasługuje na głębszą uwagę.

Na przykład firma mogłaby śledzić zmiany w kierownictwie na całym rynku. Następnie mogłaby przydzielać analityków tylko wtedy, gdy prawdopodobieństwo przekroczy wewnętrzny próg.

Taki podział pracy tworzy bardziej wiarygodną ścieżkę komercyjną niż całkowite zastąpienie analityków. Maszyny zapewniają szeroki zasięg i ciągłe aktualizacje, podczas gdy ludzie badają konsekwencje i decydują, jakie działania podjąć.

Mantic mimo to musi zmierzyć się z silnym obecnym liderem w postaci zbiorowego osądu ludzi. Tłum może łączyć niezależne informacje i niwelować część indywidualnych uprzedzeń.

Wcześniejsza analiza konkurencji wykazała, że społecznościowa prognoza Metaculus pozostawała jednym z najbardziej konsekwentnie osiągających dobre wyniki uczestników platformy. Ten agregat wcześniej wyprzedził Mantic w kwartalnym wydarzeniu.

Rynki predykcyjne oferują inną drogę. Platformy takie jak Kalshi i Polymarket wykorzystują zachęty finansowe oraz ceny rynkowe do zbierania rozproszonych przekonań.

Rynki mogą szybko aktualizować się, gdy uczestnicy napotykają nowe informacje. Zapewniają też przejrzyste prawdopodobieństwa, gdy występuje wystarczająca aktywność handlowa.

Ich słabością jest nierównomierny zakres. Traderzy koncentrują się na pytaniach przyciągających uwagę, płynność lub wartość rozrywkową, a nie na każdym pytaniu, na które organizacja potrzebuje odpowiedzi.

Firma może bardzo interesować się wąską regulacją dotyczącą dostawców. Takie pytanie może nigdy nie przyciągnąć wystarczającego udziału z zewnątrz, by powstała miarodajna cena rynkowa.

Ludzcy eksperci stanowią przeciwstawny kompromis. Oferują głęboki kontekst i potrafią rozumieć szczegóły instytucjonalne, lecz ich praca pozostaje kosztowna i trudna do skalowania.

Główny zakład Mantic polega na tym, że zautomatyzowany system może zająć miejsce między tymi podejściami. Może zapewniać dopasowany zakres, zachowując jednocześnie pewną głębię badań i dyscyplinę probabilistyczną.

To twierdzenie staje się użyteczne komercyjnie, jeszcze zanim system pokona najlepszych na świecie ludzkich prognostów. Dorównanie dobremu tłumowi w tysiącach wyspecjalizowanych pytań już zmieniłoby sposób pracy.

Nabywca korporacyjny powinien więc unikać ujmowania wdrożenia jako wyboru między człowiekiem a maszyną. Lepszy test porównuje kompletne procesy decyzyjne w tych samych warunkach.

Jedna grupa może korzystać z konwencjonalnej analizy. Druga może otrzymywać prawdopodobieństwa Mantic wraz z wyjaśnieniami i aktualizacjami. Obie grupy mierzyłyby się z równoważnymi decyzjami o mierzalnych wynikach.

Takie porównanie ujawniłoby, czy system poprawia moment podejmowania decyzji, pewność i alokację zasobów. Pokazałoby też, kiedy ludzcy eksperci wnoszą wartość wykraczającą poza prognozę liczbową.

Największa presja spada na procesy badawcze, które nie zachowują prognoz ani nie oceniają wcześniejszych wyników. Mantic sprawia, że niezmierzony osąd trudniej jest uzasadnić.

Wywiera też presję na analityków, by rozdzielali dwa zadania. Oszacowanie, co się wydarzy, różni się od decyzji, co organizacja powinna w związku z tym zrobić.

Nawet doskonale skalibrowana prognoza nie może wybrać tolerancji ryzyka organizacji. Nie może zdecydować, czy mało prawdopodobny rezultat zasługuje na przygotowanie, ponieważ jego konsekwencje byłyby poważne.

Mantic może podważyć warstwę prognozowania. Odpowiedzialność za działanie nadal spoczywa na ludziach i instytucjach.

Jak Mantic trenuje system prognostyczny

Mechanizm Mantic łączy modele frontierowe, historyczne backtesty, powtarzalne punktowanie oraz trening na wynikach, które ostatecznie stały się znane.

Firma nie twierdzi, że zbudowała model bazowy całkowicie od podstaw. Shevlane powiedział Reutersowi, że Mantic specjalizuje modele innych laboratoriów AI do zadań prognostycznych.

Proces zaczyna się od pytań z precyzyjnymi kryteriami rozstrzygnięcia. Zamiast pytać, czy gospodarka wygląda zdrowo, pytanie musi wskazywać mierzalne zdarzenie i termin.

System następnie bada dostępne dowody i przypisuje prawdopodobieństwa możliwym wynikom. Może ponownie oceniać te prawdopodobieństwa, gdy napływają nowe informacje.

Gdy zdarzenie zostanie rozstrzygnięte, prognoza otrzymuje wynik. Punktowanie probabilistyczne surowiej karze pewność wobec błędnych rezultatów niż ostrożną niepewność.

Powszechnym przykładem jest wynik Briera, który mierzy kwadrat różnicy między przewidywanym prawdopodobieństwem a rzeczywistym rezultatem. Niższe wyniki oznaczają lepsze prognozy.

Powtarzalne punktowanie dostarcza sygnału treningowego. System może uczyć się, które metody badawcze, typy dowodów, wzorce rozumowania i zasady aktualizacji korelują z lepszymi wynikami.

Mantic twierdzi, że może odtwarzać okresy historyczne, ograniczając informacje do materiałów dostępnych w symulowanej dacie. Pozwala to deweloperom testować strategie bez czekania miesięcy na nowe zdarzenia.

Firma podała, że zbudowała zbiór danych zawierający ponad 10 000 pytań prognostycznych z 2024 i 2025 roku. Poinformowała również o przeprowadzeniu backtestów na 348 pytaniach z drugiego kwartału 2025 roku.

Liczby te pochodzą z własnego wyjaśnienia technicznego Mantic. Nie zostały niezależnie zweryfikowane w materiałach przejrzanych na potrzeby tego artykułu.

Backtesting tworzy znaczącą przewagę szybkości. Deweloperzy mogą modyfikować system, ponownie uruchamiać pytania historyczne i porównywać wyniki bez czekania, aż każde zdarzenie zostanie ponownie rozstrzygnięte.

Mantic twierdzi również, że wykorzystuje uczenie ze wzmocnieniem, które dostosowuje zachowanie za pomocą nagród wynikających z rezultatów prognozowania. Celem nie jest elokwentna proza, lecz lepsza dokładność probabilistyczna.

Zmienia to sposób oceny rozumowania modelu językowego. Przekonujące wyjaśnienie nie otrzymuje szczególnego uznania, jeśli powiązane z nim prawdopodobieństwo wypada słabo.

System może także testować różne komponenty osobno. Jeden model może zbierać dowody, inny podważać założenia, a etap agregacji może łączyć kilka oszacowań.

Mantic nie ujawnił publicznie każdego komponentu swojej obecnej architektury produkcyjnej. Zewnętrzni odbiorcy nie powinni zakładać, że jeden model niezależnie tworzy każde końcowe prawdopodobieństwo.

Shevlane opisywał szersze podejście jako specjalizowanie modeli frontierowych. Możliwa trudna do obrony przewaga firmy może zatem tkwić w orkiestracji, zastrzeżonych danych ewaluacyjnych i metodach treningu.

Proces ma trzy atrakcyjne cechy dla inwestorów. Daje mierzalne wyniki, wspiera szybką iterację i może skalować się na wiele pytań.

Ma także nietypową pętlę sprzężenia zwrotnego. Każde rozstrzygnięte pytanie dodaje dowody dotyczące kalibracji systemu i zasad podejmowania decyzji.

Backtesting wymaga jednak starannych kontroli. Model mógł napotkać wynik lub powiązane relacje podczas swojego pierwotnego treningu.

Jeśli historyczne odpowiedzi przeciekają do testu, uzyskany wynik mierzy pamięć obok umiejętności prognostycznych. Problem staje się trudniejszy, gdy dane treningowe modelu bazowego pozostają nieujawnione.

Najnowsze badania nad przeciekami wskazują, że same wyniki backtestów nie mogą określić, w jakim stopniu ukryte informacje wpłynęły na rezultat. Badacze potrzebują zewnętrznych punktów odniesienia i wyraźnych założeń.

Turnieje na żywo ograniczają to konkretne ryzyko, ponieważ wyniki są nieznane w chwili prognozowania. To sprawia, że wynik Mantic z lata 2026 roku jest bardziej informacyjny niż prywatny retrospektywny benchmark.

Ewaluacja na żywo wprowadza inne komplikacje. Dobór pytań, częstotliwość aktualizacji, zasady uczestnictwa i formuły punktacji mogą wpływać na rankingi.

System, który nieustannie monitoruje wiadomości, ma naturalną przewagę zasięgu nad osobą prognozującą w ograniczonych godzinach. Ta przewaga jest użyteczna komercyjnie, nawet jeśli komplikuje porównania naukowe.

Tego rozróżnienia nie należy traktować jako wady. Firmy często chcą systemu działającego bez przerwy właśnie dlatego, że ludzie nie mogą aktualizować setek prawdopodobieństw co godzinę.

Ważnym wymogiem jest przejrzysta ewaluacja. Nabywcy potrzebują oddzielnych pomiarów dokładności, kalibracji, zasięgu, terminowości i wpływu na decyzje.

Pojedyncza pozycja turniejowa kompresuje te wymiary do jednego rezultatu. Wdrożenie produktu wymaga ich ponownego rozdzielenia.

Czego nie dowodzi określenie superludzki

„Superludzki” trafnie opisuje wynik jednego konkursu, lecz pozostaje zbyt szerokim twierdzeniem dotyczącym ogólnych zdolności Mantic.

Najsilniejsze zweryfikowane stwierdzenie jest wąskie. Mantic osiągnął lepszy wynik niż każdy ludzki uczestnik Summer 2026 Metaculus Cup i znalazł się za jednym innym systemem zautomatyzowanym.

Wynik ten ma znaczenie, ponieważ pytania były rozstrzygane na żywo. Nie ustanawia on przewagi we wszystkich dziedzinach, horyzontach czasowych, grupach użytkowników ani środowiskach decyzyjnych.

Uczestnicy turnieju różnią się także doświadczeniem i aktywnością. Niektórzy ludzie mogą odpowiadać na mniej pytań lub aktualizować je rzadziej niż zautomatyzowany uczestnik.

Wcześniejsze relacje o konkursach prognostycznych wskazywały, że punktacja może nagradzać zasięg. Systemy korzystają, gdy odpowiadają wcześnie, obejmują więcej pytań i regularnie się aktualizują.

Takie zachowania są wartościowe w praktyce. Jednak ranking łączący zasięg i dokładność nie może ujawnić, czy maszyna podejmowała lepsze osądy w każdej dopasowanej prognozie.

Znaczenie ma także klasa porównawcza. Pokonanie wszystkich uczestników turnieju nie jest tożsame z pokonaniem starannie dobranego zespołu zawodowych superprognostów.

System może dominować w pytaniach ogólnych, a jednocześnie mieć trudności z niszową polityką regionalną, regulacjami technicznymi lub decyzjami kształtowanymi przez prywatne informacje.

Organizacje zadają też pytania odmienne od tych z publicznych turniejów. Wewnętrzne prognozy mogą dotyczyć poufnych harmonogramów produktów, negocjacji, zachowań klientów lub awarii operacyjnych.

Mantic musi wykazać, że jego metody przenoszą się na sytuacje, w których publiczne badanie internetu dostarcza tylko części dowodów. Wdrożenia korporacyjne mogą wymagać bezpiecznego dostępu do dokumentów wewnętrznych i ustrukturyzowanych danych firmowych.

Ta integracja rodzi pytania dotyczące ładu. Prawdopodobieństwo może wpływać na zatrudnianie, alokację kapitału, ubezpieczenia, handel, politykę publiczną lub planowanie bezpieczeństwa.

Użytkownicy muszą wiedzieć, kiedy brakuje dowodów, kiedy źródła są sprzeczne i kiedy prognoza zmienia się dlatego, że do systemu trafił jeden niepewny raport.

Wyjaśnienia pomagają, lecz płynne wyjaśnienia mogą rodzić fałszywą pewność. Wiarygodna narracja nie gwarantuje, że leżące u podstaw prawdopodobieństwo jest skalibrowane.

Prognozy mogą także wpływać na opisywane przez siebie zdarzenia. Publiczna prognoza dotycząca banku, wyborów lub konfliktu może wpłynąć na zachowanie i zmienić rezultat.

Prywatne prognozy rodzą kolejną obawę. Klienci mogą działać na podstawie przewidywań, których zewnętrzni badacze nie mogą zbadać, co utrudnia niezależną ocenę wyników.

Nieujawniona lista klientów pozostawia kilka ważnych pytań bez odpowiedzi. Czytelnicy nie mogą jeszcze sprawdzić, jak organizacje wykorzystują Mantic ani czy system poprawił ich decyzje.

Dokładność sama w sobie nie jest równoznaczna z użytecznością. Prognoza musi nadejść wystarczająco wcześnie, aby zmienić działanie, a potencjalna korzyść musi przewyższać koszty wdrożenia.

Rozważmy zespół ds. łańcucha dostaw, który ocenia prawdopodobieństwo nowych ograniczeń eksportowych na 20%. To prawdopodobieństwo ma znaczenie tylko wtedy, gdy jest połączone z opcjami reakcji i ich kosztami.

Organizacja może zdywersyfikować dostawców, zwiększyć zapasy lub poczekać. Mantic może wspierać ten wybór, ale nie może dostarczyć firmie jej preferencji dotyczących ryzyka.

Istnieje również ryzyko uprzedzenia automatyzacyjnego. Osoby podejmujące decyzje mogą podporządkować się prognozie liczbowej, ponieważ wydaje się obiektywna, nawet gdy modelowi brakuje kluczowego kontekstu.

Możliwy pozostaje także problem przeciwny. Menedżerowie mogą ignorować skalibrowaną prognozę, gdy koliduje ona z intuicją lub polityką organizacyjną.

Żadna z tych porażek nie ma przede wszystkim charakteru technicznego. Dotyczą one tego, jak instytucje przydzielają uprawnienia, rejestrują decyzje i analizują błędy.

Własne przykłady Mantic wspierają wyważoną interpretację. Jego użyteczny wkład nie polega na pewności co do przyszłości, lecz na zdyscyplinowanych prawdopodobieństwach aktualizowanych wraz z dowodami.

Prognoza na poziomie 70% nadal zawodzi trzy razy na dziesięć, gdy jest prawidłowo skalibrowana. Użytkownicy, którzy traktują tę wartość jak gwarancję, błędnie zrozumieją produkt.

Ta sama zasada dotyczy rzadkich zdarzeń. System może odpowiedzialnie przypisać niskie prawdopodobieństwo, a mimo to zdarzenie może nastąpić i spowodować rozległe szkody.

Nabywcy powinni prosić o wyniki podzielone według dziedziny, horyzontu, typu pytania i dostępności informacji. Wyniki zbiorcze mogą ukrywać słabe kategorie.

Powinni także porównywać prognozy zamrożone z tymi stale aktualizowanymi. Precyzyjna aktualizacja w ostatniej chwili służy innemu celowi niż wczesne ostrzeżenie przekazane z wielomiesięcznym wyprzedzeniem.

Istotne są również przedziały ufności i wielkości próby. Seria trafnych prognoz może wynikać z umiejętności, korzystnego doboru pytań lub przypadku.

Finansowanie Mantic zapewnia firmie zasoby do zgromadzenia szerszych dowodów. Dopóki takie dowody się nie pojawią, „nadludzkie prognozowanie” powinno pozostać sprawdzalnym twierdzeniem dotyczącym produktu.

Trzy sygnały, które sprawdzą zakład Mantic

Kolejny etap rozwoju Mantic będzie oceniany na podstawie wyników na żywo, ujawnionego wdrożenia przez klientów oraz dowodów, że prognozy poprawiają decyzje poza turniejami.

Pierwszym sygnałem będą dalsze wyniki w konkursach prospektywnych. Prospektywne oznacza, że wynik pozostaje nieznany w momencie zapisania każdej prognozy.

Mantic musi osiągać dobre wyniki w kilku turniejach, zestawach pytań i horyzontach czasowych. Jedno zwycięstwo może przyciągnąć uwagę, lecz powtarzalne rezultaty budują wiarygodność.

Najbardziej użyteczne ujawnienia obejmowałyby surową trafność, kalibrację, pokrycie, częstotliwość aktualizacji oraz porównania z tymi samymi prognozami ludzi. Wyniki na poziomie poszczególnych domen pokazałyby, gdzie system napotyka trudności.

Obecny turniej Metaculus daje jedną z możliwości dalszej obserwacji. Przyszłe wyniki mogą wzmocnić lub osłabić twierdzenie, że letni rezultat był powtarzalny.

Ponowne zajęcie miejsca w ścisłej czołówce wsparłoby techniczną tezę Mantic. Gwałtowny spadek sugerowałby wrażliwość na dobór pytań, konkurentów lub warunki turnieju.

Drugim sygnałem będzie wskazane z nazwy wdrożenie u klientów z mierzalnymi procesami pracy. Mantic i jego inwestorzy twierdzą, że zainteresowanie wyraziły firmy oraz agencje rządowe.

Zainteresowanie nie jest tym samym co wdrożenie. Istotny przykład powinien wyjaśniać, jakie pytania śledził klient, jak prognozy trafiały do procesów decyzyjnych i co się zmieniło.

Instytucje finansowe są oczywistym wczesnym rynkiem, ponieważ poprawa prognoz probabilistycznych może wiązać się z mierzalnymi zwrotami. Jest też mało prawdopodobne, by ujawniały one zastrzeżone strategie.

Zespoły ds. ryzyka korporacyjnego mogłyby dostarczyć bardziej widocznych dowodów. Mogłyby raportować krótszy czas ostrzegania, szerszy zakres monitorowania lub mniej przeoczonych zmian bez ujawniania poufnych decyzji.

Wdrożenie przez administrację publiczną pokazałoby znaczenie dla geopolityki i polityki publicznej. Podniosłoby również wymagania dotyczące audytowalności, zamówień publicznych, bezpieczeństwa i odpowiedzialności.

Wdrożenie wskazujące klienta z nazwy wzmocniłoby argument biznesowy nawet bez ujawniania przychodów. Dalsza tajemnica pozostawiłaby osoby z zewnątrz zależne od deklaracji inwestorów.

Trzecim sygnałem będą dowody produktowe odróżniające jakość prognoz od jakości decyzji. Mantic musi pokazać więcej niż strumień prawdopodobieństw.

Użyteczne produkty powinny zachowywać historię prognoz, wyjaśniać istotne aktualizacje, wskazywać wpływowe dowody i pokazywać kalibrację dla porównywalnych pytań.

Powinny również wspierać progi decyzyjne. Klient może określić, jakie działanie należy podjąć, gdy ryzyko wzrośnie powyżej 30%, 50% lub 70%.

Takie połączenie uczyniłoby prognozy operacyjnymi, a nie jedynie dekoracyjnymi. Pozwoliłoby także organizacjom sprawdzać, czy użytkownicy działali konsekwentnie.

System Mantic może stać się najbardziej wartościowy jako narzędzie do alokacji uwagi. Mógłby analizować setki pytań, oznaczać istotne zmiany i kierować specjalistów ku pojawiającym się zagrożeniom.

Model ten zachowuje rolę ludzkiej wiedzy eksperckiej. Ludzie oceniają konsekwencje, kwestionują brakujący kontekst i wybierają działania, podczas gdy oprogramowanie utrzymuje szerokie pokrycie probabilistyczne.

Runda finansowania firmy na kwotę 25 mln USD daje jej przestrzeń do przetestowania tego modelu. Kapitał nie rozstrzyga jednak, czy zautomatyzowane prognozowanie zdobędzie trwałe zaufanie instytucjonalne.

Prognozowanie AI Mantic ma teraz zweryfikowany wynik turniejowy, znanych inwestorów i mechanizm zaprojektowany z myślą o szybkim doskonaleniu. Kolejne dowody muszą pochodzić z powtarzalnych testów na żywo i rzeczywistych decyzji.

Dla programistów lekcja jest taka, by oceniać cały proces prognozowania, w tym pozyskiwanie informacji, kalibrację, aktualizacje i mechanizmy kontroli wycieku danych. Zdolny model bazowy jest tylko jednym z elementów.

Nabywcy korporacyjni powinni zacząć od rejestrowanego pilotażu, a nie od szerokiej automatyzacji. Wybierzcie jasno określone pytania, zachowajcie ludzkie wartości bazowe, ustalcie progi decyzyjne i oceniajcie każdy rozstrzygnięty wynik.

Pracownicy wiedzy powinni traktować prawdopodobieństwa jako ustrukturyzowane dowody, a nie instrukcje. Zachowujcie źródła wspierające i założenia dostępne w przeszukiwalnej bazie wiedzy.

Decydujące pytanie nie brzmi, czy AI potrafi wygrać konkurs prognostyczny. Brzmi ono, czy wasza organizacja potrafi testować jego prognozy, działać odpowiednio i wyciągać wnioski z każdego wyniku.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page