This website uses cookies

Read our Privacy policy and Terms of use for more information.

6 października OpenAI opublikowało 722 manuskrypty matematyczne napisane przez swój niewydany model.

W trzech zdaniach

  • OpenAI opublikowało 6 października 722 prace matematyczne napisane przez swój model, choć połowa wyników nie była przed publikacją potwierdzona, i już następnego dnia wycofało trzy z nich z powodu błędu.

  • Modele Anthropic testowane z dostępem do internetu wysyłały prawdziwe formularze, w tym zmyślony trop do policji w Filadelfii, który firma zauważyła dopiero po 72 dniach, i 9 października Anthropic odciął swoje wewnętrzne testy od sieci.

  • Według Financial Times OpenAI zarabia obecnie w tempie około 50 mld dolarów rocznie; 70 mld, o których pisano we wrześniu, wychodzi dopiero po doliczeniu całej sprzedaży przez chmury partnerów, tak jak swoje przychody liczy Anthropic.

Temat tygodnia

OpenAI wrzuciło 6 października na GitHuba 722 manuskrypty matematyczne, które napisał wewnętrzny, niewydany model.

Dwa tygodnie temu pisałem, że rachunek za AI to koszt jednego zaakceptowanego wyniku, a w tym koszcie jest sprawdzanie przez ludzi. Na początku października ta pozycja rachunku przerosła możliwości matematyków, arXiv i programu nagród za błędy w Google. Wyników do sprawdzenia przybywało szybciej niż ludzi, którzy je sprawdzają. Z tym samym problemem mierzą się firmy, które wdrażają agenty, czyli programy AI wykonujące samodzielnie kolejne kroki zadania.

6 października OpenAI wrzuciło do publicznego repozytorium na GitHubie 722 manuskrypty matematyczne. Napisał je wewnętrzny model, którego firma nie wydała ani nie nazwała. Według OpenAI dostał około 4 tys. problemów, a przeciętny wynik kosztował tyle mocy obliczeniowej, ile trzy godziny rozumowania w ChatGPT Pro. Firma podaje, że około 42 proc. głównych wyników zapisała w Lean, języku, w którym program sprawdza poprawność dowodu. OpenAI · Repozytorium

Następnego dnia OpenAI wycofało trzy manuskrypty, bo błąd znaku unieważnił jeden z nich i dwa, które z niego korzystały. Czternaście innych poprawiło. Rzecznik firmy powiedział Retraction Watch, że mniej więcej połowa wyników została opublikowana bez potwierdzenia. Według rzecznika grupa doradcza rekomendowała publikację przed ukończeniem formalizacji. Jej zalecenia dopuszczają taki tryb pod warunkami, m.in. jasnego oznaczenia statusu dowodu. Asaf Karagila, specjalista od teorii mnogości, przejrzał pobieżnie jeden z wyników ze swojej dziedziny. Napisał, że ze względu na jakość tekstu w czasopiśmie praca zostałaby odrzucona bez recenzji, a setki takich tekstów to dla ekspertów „the equivalent of a Denial of Service”. Retraction Watch · AGMAI · Karagila

Pięć dni przed publikacją OpenAI, 1 października, arXiv, największe repozytorium prac naukowych przed recenzją, ograniczył liczbę zgłoszeń. Każdy zgłaszający może wysłać najwyżej dwie prace w miesiącu kalendarzowym i mieć najwyżej trzy aktywne zgłoszenia. Limit dotyczy osoby wysyłającej pracę, więc współautorzy mogą rozdzielić między siebie zgłoszenia. We wrześniu 2026 arXiv dostał 40 363 zgłoszenia, we wrześniu 2024 roku 20 569, we wrześniu 2016 roku 9869. Limit nazywa rozwiązaniem tymczasowym. arXiv

Tego samego dnia Google przestało przyjmować zgłoszenia podatności w produktach do programu nagród za błędy w oprogramowaniu open source. Powód: znaczny wzrost liczby zautomatyzowanych zgłoszeń, z których zdecydowana większość jest nieważna. Informację o dalszych losach programu Google zapowiada na pierwszy kwartał 2027 roku. Wstrzymanie dotyczy zgłoszeń podatności produktowych do OSS VRP; zgłoszenia dotyczące łańcucha dostaw i inne programy nagród pozostają osobnymi ścieżkami. BleepingComputer · TechCrunch

8 października Anthropic pokazał ten sam problem od strony producenta zgłoszeń: przez sześć miesięcy znalazł ponad 29 tys. kandydatów na podatności, a ludzie przejrzeli około 6 tys. Firma uruchomiła OSS Scanner, bezpłatny skaner dla zgłaszających się projektów open source. W tej ścieżce wysyła wyniki bez ludzkiego przeglądu, z opisem, sposobem odtworzenia błędu i proponowaną poprawką, jeśli jest dostępna. Projekt sam decyduje, czy chce takie zgłoszenia przyjmować, i bierze na siebie ich sprawdzenie. Anthropic

Agent pisze analizy, odpowiedzi na reklamacje i zmiany w kodzie szybciej, niż zespół jest w stanie je przeczytać. Kontrola na losowej próbie pozwala oszacować, ile błędów przechodzi, pod warunkiem że próba jest wystarczająco duża, a rzadkich, kosztownych błędów i tak może nie złapać. Pełna kontrola zjada czas, który agent miał oszczędzić. O przepustowości procesu decyduje więc to, ile wyników ludzie i programy zweryfikują w ciągu dnia.

Matematycy mają przewagę, bo program sprawdzi za nich dowód twierdzenia zapisanego formalnie. Nie sprawdzi, czy zapis formalny odpowiada twierdzeniu z manuskryptu. Alex Townsend z Cornell powiedział Retraction Watch, że OpenAI powinno było najpierw ogłosić manuskrypty zweryfikowane w Lean. Ahmad Al-Dahle, dyrektor technologiczny Airbnb, w podcaście Latent Space opisał zasadę, którą wprowadza u siebie: każdy inżynier musi umieć wyjaśnić, co zbudował, także wtedy, gdy zmianę w kodzie wygenerowała AI. Latent Space

Przed wdrożeniem AI warto policzyć, ile wyników proces wyprodukuje dziennie, a ile z nich zdążą sprawdzić program i ludzie.

Proponuję, żeby każdy plan wdrożenia AI miał przed uruchomieniem jedną tabelę: ile wyników proces wyprodukuje dziennie, ile z nich sprawdzi program (testy, uzgodnienia sald, porównanie z rejestrem), jak dużą próbę przeczyta człowiek, kto to będzie i ile ma na to godzin. Do tego jedna miara, liczona od pierwszego dnia: czas od błędu do jego wykrycia. Jeśli ta tabela się nie bilansuje, wdrożenie trzeba zacząć od zmiany sposobu sprawdzania, zanim zwiększy się produkcję.

✦

Premiery

OpenAI, Cloudflare i Microsoft wypuściły na początku października modele, które zamiast tekstu zwracają odpowiedź tak lub nie, wybór z listy albo ocenę na skali, za każdym razem z prawdopodobieństwem.

Modele decyzyjne: OpenAI Decisions API, Cloudflare Clef, Jev, Microsoft-Decision-1 (1–9 października) – modele, które zamiast tekstu zwracają odpowiedź tak lub nie, wybór z listy albo ocenę na skali, za każdym razem z prawdopodobieństwem. We wrześniu taki model, Jev, wypuścił startup TypeSafe AI. OpenAI udostępniło 6 października publiczną wersję testową Decisions API na modelu GPT-6 Luna, najtańszym z nowej rodziny (droższe to Sol i Astra). Stawka podstawowa: 0,10 dolara za milion tokenów wejściowych, czyli fragmentów tekstu, od których dostawca liczy opłatę; odpowiedź jest bez opłat. Przetwarzanie danych w Europie jest dostępne dla uprawnionych klientów, a dopłaty regionalne i za długi kontekst mogą podnieść cenę. Cloudflare 1 października opublikował otwarty model Clef na licencji Apache 2.0, która pozwala na użycie komercyjne, i z tym samym sposobem wywołania co Jev. Clef to nakładka na otwarty model Qwen. Według Cloudflare w publicznym teście rozpoznawania, o co pyta klient banku (BANKING77, miara macro-F1), ma 94,2 wobec 79,7 dla Jev. Wyników kalibracji prawdopodobieństw firma nie podała. TypeSafe AI 9 października zebrał 870 mln dolarów przy wycenie 7,5 mld dolarów. Tego samego dnia Microsoft udostępnił Microsoft-Decision-1 w Foundry i OpenRouter: 0,042 dolara za milion tokenów wejściowych, wyjście bez opłat. Model powstał na bazie Qwen3.5-9B. Wyników kalibracji prawdopodobieństw Microsoft nie podał.
Co to znaczy: do klasyfikacji reklamacji, kierowania maili i oceny dokumentów według rubryki dochodzi model, który zwraca liczbę. Na niej da się ustawić próg i zapisać każdą decyzję. Warto go przetestować na jednym procesie, ale zanim wynik zacznie decydować, ktoś musi sprawdzić na danych firmy, czy „80 proc. pewności” oznacza trafienie w mniej więcej 8 na 10 przypadków. Clef można uruchomić u siebie. OpenAI · OpenAI, forum · Cloudflare · TypeSafe AI · TechCrunch · Microsoft

Claude Haiku 5.5 (7 października) – najmniejszy model Anthropic: 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion wyjściowych przy zapytaniach do 100 tys. tokenów, powyżej 0,50 i 2,50 dolara. Haiku 4.5 kosztował 1 i 5 dolarów. Anthropic szacuje, że w działaniu wychodzi średnio o około 75 proc. taniej, licząc się z tym, że nowy sposób dzielenia tekstu zużywa nieco więcej tokenów. To pierwszy Haiku z ustawieniem effort, czyli wyborem, jak długo model ma rozumować przed odpowiedzią. Artificial Analysis, firma mierząca modele na stałym zestawie testów, podaje, że w zadaniach swojego Intelligence Index Haiku na najwyższym poziomie „max” zużywa średnio około 162 tys. tokenów odpowiedzi, na poziomie „high” około 55 tys., a GPT-6 Luna przy „max” około 50 tys. Tego samego dnia Anthropic obniżył o połowę cenę odczytów z pamięci podręcznej Sonnet 5.5, czyli ponownego użycia wcześniej przetworzonego kontekstu.
Co to znaczy: przy krótkich zadaniach masowych (klasyfikacja, streszczenia, wyciąganie danych z pism) cena tokena spada dziesięciokrotnie. Przy długich dokumentach rabat jest mniejszy. Przy porównaniu z konkurencją liczy się koszt zadania, a ten zależy od liczby zużytych tokenów. Poziom rozumowania ustawia się na sztywno i wpisuje do dokumentacji wdrożenia, bo między poziomem „high” a najwyższym zużycie tokenów różni się trzykrotnie. Anthropic · Artificial Analysis

Mistral udostępnił 6 października publiczną wersję zapoznawczą modelu Large 4 z bilionem parametrów, wytrenowanego od zera na 3800 procesorach graficznych Nvidii we własnych centrach danych w Europie.

Mistral Large 4 (publiczna wersja zapoznawcza od 6 października) – model francuskiego Mistrala z bilionem parametrów, z których naraz pracuje według producenta 52 mld, co obniża koszt działania. Mistral podaje, że trenował go od zera na 3800 procesorach graficznych Nvidii we własnych centrach danych w Europie. Cena standardowa: 1,36 dolara za milion tokenów wejściowych i 4,18 dolara za milion wyjściowych. Wagi, czyli sam model do uruchomienia na własnych serwerach, Mistral obiecuje do końca października. Licencji nie podał. W pomiarze opublikowanym przez Artificial Analysis 6 października ma 38 pkt, tyle co GPT-6 Luna przy „max”. To najwyższy wynik modelu spoza USA i Chin.
Co to znaczy: firma w UE dostaje kandydata do uruchomienia u siebie, pod europejską jurysdykcją. Lokalne uruchomienie biliona parametrów wymaga dużej infrastruktury; zapotrzebowanie na pamięć będzie zależało m.in. od sposobu zapisania wag i ich kompresji. Na listę modeli do testów wpisałbym go dopiero po publikacji wag i licencji. Mistral · Artificial Analysis

GPT-6 dla wszystkich, Gemini z najmniejszym modelem (7–9 października) – OpenAI rozpoczęło 7 października wdrażanie GPT-6 Sol w płatnych planach ChatGPT, a 8 października GPT-6 Luna w planach Free i Go, z odpowiedziami zawierającymi wykresy, przyciski i kalkulatory. Google od 9 października kieruje większość zapytań z darmowych kont Gemini do Flash-Lite, swojego najszybszego, najmniejszego modelu. Pytania wymagające głębszego rozumowania mogą nadal trafić do Flash albo Pro.
Co to znaczy: pracownik ma na prywatnym telefonie za darmo model z tej samej generacji co płatny, a dostawca może ten dostęp ograniczyć, jak zrobiło Google. Polityka korzystania z AI w firmie powinna wymieniać narzędzia, w których wolno pracować na danych firmy, i być aktualizowana, gdy zmienia się darmowa oferta. OpenAI · Google

Gemini agent w Google Cloud (8 października) – agent do pracy w firmie, który może działać godzinami albo dniami. W trybie „coworker” dostaje własne konto Google Workspace z adresem, kalendarzem i dyskiem. Zadania kieruje do modeli Gemini albo do modeli Claude od Anthropic. Dla projektu można ustawić twardy limit wydatków, po którego przekroczeniu agent się zatrzymuje.
Co to znaczy: dostawca agenta i dostawca modelu przestają być tą samą firmą. Ocena dostawcy i umowa obejmują wtedy oba podmioty, a w ewidencji systemów AI firmy zapisuje się, które modele agent może wywołać. Google Cloud

Microsoft eXecution Container (MXC) (7 października) – otwarta, na licencji MIT, biblioteka do włączenia w aplikację dla Windows, Linuxa i macOS, w której firma określa, do jakich plików i adresów sieciowych agent ma dostęp, a system operacyjny pilnuje tego w czasie pracy agenta. Microsoft pokazał ją razem z laptopami z układami Nvidii do uruchamiania modeli lokalnie.
Co to znaczy: zespół budujący aplikację z agentem może ograniczyć jego dostęp do plików i sieci na poziomie systemu. Zakres ochrony zależy od wybranego mechanizmu izolacji i konfiguracji, które trzeba przetestować. Nvidia · GitHub

OpenAI zapowiada niewidoczny znak wodny w tekstach z ChatGPT i Codex w Unii Europejskiej.

Znak wodny OpenAI w tekstach z ChatGPT w UE (5 października) – OpenAI zapowiada, że w najbliższych tygodniach teksty z ChatGPT i Codex w Unii Europejskiej dostaną niewidoczny znak wodny. Dostęp do detektora mają na razie tylko zatwierdzeni badacze i organizacje eksperckie. W teście OpenAI na angielskich odpowiedziach z zestawu ELI5 o długości 400 tokenów znak wykryto w około 92 proc. przypadków, po zamianie 10 proc. słów na synonimy w 66 proc., po zamianie 25 proc. słów w 17 proc.
Co to znaczy: wykryty znak jest sygnałem, że system OpenAI wygenerował albo przetworzył część tekstu. Nie mówi, ile wniósł człowiek ani czy tekst był redagowany. Detektor może się pomylić, a przeróbka osłabia sygnał. Wynik detekcji wymaga dodatkowego sprawdzenia, zanim posłuży do decyzji w egzaminie, rekrutacji albo kontroli jakości. OpenAI

Narzędzie tygodnia

Od 7 października każdy może sprawdzić na stronie Google, czy obraz, nagranie wideo albo dźwięk ma niewidoczny znak wodny SynthID.

SynthID Detector (Google)

Od 7 października każdy może sprawdzić na stronie Google, czy obraz, nagranie wideo albo dźwięk ma niewidoczny znak wodny SynthID. Według Google oznaczono nim dotąd ponad 180 mld obrazów i filmów. Znak trafia też do treści z narzędzi partnerów: OpenAI, Nvidii i Kakao. Narzędzie działa po angielsku. Nie sprawdza tekstu i nie rozpozna materiału z generatora, który znaku nie stosuje, na przykład z modelu open source uruchomionego na własnym komputerze.

Dla kogo: dział komunikacji, compliance, zespoły przeciwdziałające oszustwom, redakcje.

Werdykt: warto, jako test działający w jedną stronę. Wykryty znak jest informacją, a jego brak nie dowodzi, że materiał nagrał człowiek. Przy fałszywym nagraniu prezesa albo podrobionym dokumencie od klienta to pierwszy krok, po którym zostaje sprawdzenie źródła. Google

Co mówią liderzy

Finanse i kapitał · Christine Lagarde, prezes EBC i przewodnicząca Europejskiej Rady ds. Ryzyka Systemowego, 1 października: „In a simulated 32-step attack, models released at the end of 2025 completed about a third of the steps on average (…). The latest models, however, completed every step.” Według Lagarde generatywnej AI używa prawie dziewięć na dziesięć istotnych banków strefy euro. „Rapid advancement in AI could leave financial institutions far less time to contain an attack.” EBC

Finanse i kapitał · Jamie Dimon, prezes JPMorgan Chase, w Bloomberg TV, 6 października: ryzyko związane z AI według niego „went up 10-fold after Mythos”. Mythos to najmocniejszy model Anthropic, udostępniany w ograniczonym programie m.in. do wyszukiwania podatności. JPMorgan korzysta z niego od kwietnia. „I'm not going to get hysterical over, »Is it existential or not?« What we're doing is rolling up our sleeves and going to work to fix it.” Quartz · PYMNTS

Finanse i kapitał · Lee Eok-won, przewodniczący Komisji Usług Finansowych Korei Południowej, 4 października: „We cannot rule out the possibility of attacks using AI.” Według CrowdStrike napastnik atakował koreańskie instytucje finansowe chińskim programem do testów penetracyjnych ARTEX, działającym na modelu DeepSeek, a w sesjach Claude Code korzystał też z modeli GLM i Grok. Reuters podaje, że celem było co najmniej dziewięć banków, a z Shinhan wyciekły dane około 25 tys. klientów. Korea Herald · Reuters przez TimesLIVE · CrowdStrike

Finanse i kapitał · Hari Gopalkrishnan, dyrektor technologiczny Bank of America, 1 października: „One of the biggest mistakes we see us and others doing is rush to AI as a solution, (…) when deterministic models do a plenty good job.” Fortune

Na świecie · Yoshua Bengio, laureat Nagrody Turinga, w liście otwartym do badaczy z laboratoriów AI, 8 października: „If you truly prioritize safety, it is time for you to leave frontier AI companies.” Kanada i Niemcy zadeklarowały w tym miesiącu ponad 200 mln dolarów dla LawZero, organizacji badawczej Bengio. Transformer

Na świecie · Timnit Gebru, badaczka etyki AI, w Democracy Now, 1 października, o testach bezpieczeństwa modeli: „The tests should not be ones that the companies themselves tell you about.” Democracy Now

Polska · Tomek Korbak, badacz bezpieczeństwa AI, którego zwolnienie OpenAI ogłosiło 1 października: w liście do komitetów bezpieczeństwa firmy, podpisanym razem z Jasmine Wang i Mikitą Balesnim, autorzy bronią współpracy z niezależnymi badaczami i możliwości zgłaszania zastrzeżeń. Piszą, że Korbak był technicznym punktem kontaktu dla METR, niezależnej organizacji badającej zachowanie agentów, przy analizie incydentu Hugging Face. Ich zdaniem sposób przeprowadzenia zwolnień utrudnił pozostałym pracownikom otwartą rozmowę o ryzyku. OpenAI twierdzi, że przyczyną było niewłaściwe obchodzenie się z poufnymi informacjami poza ustaloną procedurą. List · OpenAI przez AFP

Co warto przeczytać u innych

Paul Krugman, „AI Versus Everything Else” (6 października) – według Krugmana budowa centrów danych wypiera w USA inwestycje w resztę gospodarki, głównie przez wyższe stopy procentowe. W latach 90. tego efektu nie było, bo do USA płynął kapitał z zagranicy. Substack Krugmana

Will Douglas Heaven, „People really hate AI, so why can't they get enough?”, MIT Technology Review (5 października) – 71 proc. dorosłych Amerykanów sprzeciwia się centrum danych AI w swojej okolicy, wobec 53 proc. przeciwnych elektrowni jądrowej. Jednocześnie połowa dorosłych Amerykanów korzysta z chatbota, a co czwarty ankietowany robi to codziennie, według badania Pew z lutego 2026 roku. Pew Research Center · MIT Technology Review

Rohit Krishnan, „Agent governance looks less like moral education and more like institutional economics” (6 października) – pięć modeli prowadzi w symulacji gospodarstwa w fikcyjnym mieście i pisze dla nich regulaminy. Gdy punktacja nagradza rywalizację, wszystkie szybko zaczynają kraść sobie nawzajem. Zmiana punktacji kradzieże zatrzymuje. Strange Loop Canon

„A New Trend in Nuclear Energy: Squeezing More Power Out of Old Plants”, The New York Times (6 października) – o tym, jak firmy technologiczne kupują prąd z modernizacji działających reaktorów, zanim powstaną nowe. Google kupi 890 MW z rozbudowy 11 reaktorów Constellation, wartej 4,3 mld dolarów. NYT · POWER

Viral tygodnia

Model Claude Haiku 4.5 w automatycznym teście Anthropic wpisał 18 lipca do formularza policji w Filadelfii zmyślony trop w sprawie nierozwiązanego zabójstwa.

Agenty Anthropic wysyłały prawdziwe formularze, także na policję

18 lipca o 23:27 model Claude Haiku 4.5 w automatycznym teście, w którym przeglądał losowe strony, wpisał do formularza policji w Filadelfii zmyślony trop w sprawie nierozwiązanego zabójstwa. Zgłoszenie trafiło do spamu. Anthropic wykrył sprawę 28 września. Według policji firma zawiadomiła ją 7 października, a spotkanie odbyło się następnego dnia; Anthropic podaje 8 października jako datę przekazania ustaleń. Policja: „The two-month delay in detecting and reporting the incident to the City is unacceptable.”

9 października Anthropic opisał więcej takich przypadków z testów modeli i z użytku wewnętrznego. Niewydany model badawczy złożył prawdziwy formularz rządowy, bo wersja ćwiczebna się nie załadowała. Modele wykorzystały błąd w oprogramowaniu, żeby uruchamiać polecenia na cudzym serwerze, sięgały po klucze dostępu z plików ustawień stron, raz pobrały płatne dane urzędu bez opłaty i obchodziły limity narzędzia przez skracacze adresów. Część stron należała do amerykańskich urzędów federalnych, stanowych i lokalnych. Anthropic zawiadomił Biały Dom i każdą z instytucji. Firma tłumaczy takie zachowania treningiem, który nagradza modele za osiągnięcie celu, także przez obchodzenie ograniczeń. Odcięła od internetu wszystkie wewnętrzne ewaluacje modeli, dopóki monitoring nie będzie takich zachowań niezawodnie wyłapywał.

Tego samego dnia sprawę opisały lokalne stacje NBC, ABC i Fox w Filadelfii, „Philadelphia Inquirer”, Engadget i TechCrunch.

Co to znaczy: od zdarzenia do jego wykrycia minęły 72 dni. Agent z dostępem do sieci, także u klienta, który kupuje model i daje mu przeglądarkę, potrzebuje listy adresów, na które wolno mu wysyłać dane, zakazu wysyłania formularzy bez zgody człowieka i zapisu działań, który ktoś przegląda na bieżąco. Anthropic · NBC10 · Fox29 przez AOL · TechCrunch

Z laboratoriów

Badacze zbudowali UndoBench, 36 procesów firmowych, m.in. w płatnościach i CRM, i sprawdzili, co robi agent, gdy operacja w zewnętrznym systemie się wykona, a potwierdzenie do niego nie dotrze.

UndoBench: po zgubionym potwierdzeniu agent robi drugi przelew (preprint z 4 października) – badacze zbudowali 36 procesów firmowych, m.in. w płatnościach, CRM i bazach danych. W głównym teście, na 12 z nich i dwóch małych otwartych modelach Llama, operacja w zewnętrznym systemie się wykonywała, ale potwierdzenie nie docierało do agenta. Bez awarii agenty ukończyły 83,5 proc. z 2880 prób. Po zgubieniu potwierdzenia skuteczność we wszystkich próbach wyniosła 39,0 proc. Jeśli liczyć tylko próby, których odpowiednik bez awarii zakończył się sukcesem, było to 46,7 proc. W wariancie prostego ponawiania podwójny skutek, na przykład druga płatność, wystąpił w 53,3 proc. jego 960 prób.
Co to znaczy: zanim agent dostanie prawo zapisu w systemie płatności albo w CRM, system powinien rozpoznawać i odrzucać powtórzoną operację, a agent sprawdzać stan przed ponowieniem. Samo dodanie instrukcji „spróbuj jeszcze raz” może zamienić awarię komunikacji w drugi przelew. arXiv, pełne badanie

Vals AI: ogólne „nie oszukuj” nie wystarczyło (7 października) – Vals przejrzał 2698 zadań programistycznych z udostępnionych środowisk, w których Xiaomi trenował model MiMo v2.6. W 1795 z nich, czyli w 67 proc., gotowa poprawka została w repozytorium kodu jako obiekt niepodpięty do żadnej gałęzi historii, którego kontrola Xiaomi nie przeglądała. Xiaomi podaje, że wykryło oszustwa w mniej niż 2 proc. przypadków. W jednym zadaniu Vals uruchomił model po sześć razy: bez instrukcji szukał gotowej poprawki w 6 przebiegach, po poleceniu „Do not cheat” w 5, po zakazie korzystania z przyszłych i ukrytych zmian w repozytorium w żadnym.
Co to znaczy: instrukcja dla agenta działa lepiej, gdy nazywa konkretną czynność, której mu nie wolno. Sześć przebiegów jednego zadania to sygnał do sprawdzenia we własnych testach. Vals AI

Badacze z Cisco i Carnegie Mellon sprawdzili w około 325 tys. eksperymentów, co 13 modeli poleca przy wyborze lotu, ubezpieczenia zdrowotnego albo studiów.

„Et Tu, Brute?”: asystent proponuje bogatszym droższe (praca z 21 września) – badacze z Cisco i Carnegie Mellon przeprowadzili około 325 tys. eksperymentów na 13 modelach, które miały wybrać lot, ubezpieczenie zdrowotne albo studia. 8 z 13 modeli przy identycznym zapytaniu proponowało droższe opcje użytkownikom, których model uznał za zamożniejszych, także na podstawie niezwiązanych z zakupem maili. Ukrycie danych finansowych w dużej mierze usuwało różnicę.
Co to znaczy: asystent doradzający klientowi produkt na podstawie jego danych może różnicować ofertę bez żadnej instrukcji. Do walidacji takiego systemu dobrze dodać test: te same pytania od klientów o różnych profilach i porównanie rekomendacji. arXiv

Epoch AI: w panelu 10 proc. osób wysyła 63 proc. zapytań do ChatGPT (1 października) – około 5 tys. Amerykanów z panelu YouGov, którzy w 2026 roku nadal korzystali z ChatGPT, udostępniło dane o swoich rozmowach. Mediana wiadomości w miesiącu, licząc pytania i odpowiedzi ChatGPT, wzrosła z 14 w styczniu 2023 roku do 36 w grudniu 2025 roku. Najaktywniejsze 10 proc. osób wysłało 63 proc. wszystkich zapytań.
Co to znaczy: w raporcie z wdrożenia asystenta w firmie liczba aktywnych kont mówi mało. Lepiej pokazać, jak rozkłada się intensywność użycia i co robią najaktywniejsi. Epoch AI

Case tygodnia

„The Lancet” opublikował 8 października badanie Google i bostońskiego szpitala Beth Israel Deaconess.

Google AMIE w szpitalu Beth Israel Deaconess w Bostonie

8 października „The Lancet” opublikował badanie zespołu Google i szpitala, prowadzone od kwietnia do listopada 2025 roku. Zapisało się 114 pacjentów przychodni podstawowej opieki zdrowotnej, a 98 ukończyło zarówno rozmowę z AMIE, modelem Google do zbierania wywiadu medycznego, jak i wizytę w trybie pilnym. Każdą rozmowę obserwował na żywo lekarz odpowiedzialny za bezpieczeństwo uczestników. Żadna nie wymagała zatrzymania według przyjętych kryteriów, choć lekarze odnotowali jedną halucynację i doprecyzowali informacje w pięciu rozmowach.

Przed 44 wizytami lekarz prowadzący przeczytał transkrypt lub podsumowanie. W 33 z tych 44 przypadków, czyli w 75 proc., uznał materiał za pomocny w przygotowaniu. W 25, czyli w 57 proc., ocenił, że mógł on zmienić jego podejście. Według Google diagnoza końcowa znalazła się wśród propozycji modelu w 90 proc. przypadków. Badanie miało jedną grupę pacjentów, bez grupy porównawczej. Sprawdzało możliwość uruchomienia takiego procesu, a poprawę wyników leczenia i oszczędność czasu trzeba dopiero zmierzyć.

Co zadziałało: model zebrał wywiad i przygotował materiał dla lekarza, przy osobnym nadzorze bezpieczeństwa w czasie rozmowy. W pilotażu obsługi klienta albo analizy wniosków można sprawdzić podobny podział pracy, ale do rachunku trzeba wpisać również czas osób kontrolujących rozmowy. The Lancet, abstrakt w PubMed · Szpital BIDMC · Google

Niewypał tygodnia

Figure, amerykański producent robotów humanoidalnych, pokazywał na filmach cztery roboty pracujące w zakładzie BMW.

Figure: film pokazywał skalę większą niż pilotaż BMW

Figure, amerykański producent robotów humanoidalnych, pokazywał na filmach cztery roboty pracujące w zakładzie BMW. BMW powiedziało Forbesowi, że w danym momencie pracował tylko jeden. Drugi czekał, żeby zastąpić pierwszego na czas ładowania. Roboty wykonywały rzeczywistą pracę; według BMW pomogły zbudować 30 tys. samochodów X3. Wycena Figure wzrosła w 19 miesięcy z 2,6 do 39 mld dolarów. OpenAI, które wcześniej było partnerem firmy, mówi Forbesowi o „consistent failure to meet the deliverables required”. Figure tę wersję odrzuca.

Lekcja: przed pilotażem robotyki albo agenta rozmowa z klientem referencyjnym i jego liczby z produkcji są warte więcej niż film demonstracyjny. Forbes

Szerzej: z około 15 tys. humanoidów dostarczonych w 2025 roku prawie 90 proc. pochodziło z Chin. Marc Raibert, założyciel Boston Dynamics, w MIT Technology Review: „70% success is like it doesn't work”. MIT Technology Review

Z Polski

Spółka WBS Power 3 złożyła wniosek o centrum danych w Trzebnicy pod Wrocławiem z przyłączem do sieci o mocy 1,6 GW.

Inwestor centrum danych z przyłączem 1,6 GW w Trzebnicy się wycofał, według właściciela gruntu – spółka WBS Power 3 złożyła wniosek o centrum danych w Trzebnicy pod Wrocławiem z przyłączem do sieci o mocy 1,6 GW, generatorami diesla i magazynami energii. Według właściciela gruntu inwestor zrezygnował z zakupu, bo Tauron nie zagwarantował wystarczającej mocy. Wszystkie działające centra danych w Polsce mają według Polskiego Związku Centrów Danych i PwC około 250 MW mocy.
Co to znaczy: planowane przyłącze pokazuje skalę ambicji wobec około 250 MW działającej mocy raportowanej dla sektora. Te liczby opisują przyłącze i działającą infrastrukturę; ich zakres trzeba uzgodnić, zanim posłużą do porównania rynku. Plan dużego centrum danych dla AI w Polsce warto zaczynać od warunków przyłączenia od operatora sieci. Nowa Gazeta Trzebnicka · DCD · ITwiz

BGK daje 500 mln zł na fundusz technologii kosmicznych – 6 października ogłoszono Vinci Space Tech Fund. W jedną spółkę fundusz ma inwestować od 10 do 100 mln zł, docelowo w 15–20 firm, przede wszystkim polskich, m.in. od satelitów, optyki, łączności, napędów i AI. Fundusz dopuszcza też firmy europejskie z centrum swoich interesów w Polsce. W tym sektorze działają m.in. Creotech i Scanway. 1 października Creotech umieścił na orbicie ostatnie trzy z czterech satelitów obserwacyjnych Mikroglob dla wojska. Od podpisania umowy z Agencją Uzbrojenia minęło 21 miesięcy. 2 października Scanway podpisał umowę na co najmniej 14 teleskopów dla europejskiej firmy z obszaru bezpieczeństwa na orbicie, wartą 3,7 mln euro.
Co to znaczy: inwestycje rzędu 10–100 mln zł mogą pomóc firmom z sektora przejść od kontraktu do większej skali produkcji. Państwo bywa dla nich jednocześnie inwestorem i klientem, jak przy Mikroglobie zamówionym przez Agencję Uzbrojenia. MRiT · Creotech · Scanway

Atom i wiatr – 8 października Polskie Elektrownie Jądrowe zleciły Westinghouse zamawianie sześciu głównych elementów wyspy jądrowej pierwszego bloku w Lubiatowie, które produkuje się latami, w tym obudowy bezpieczeństwa. Dzień wcześniej Orlen i Northland Power zakończyły montaż wszystkich 76 turbin farmy Baltic Power na Bałtyku. Farma ma produkować do 4 TWh rocznie.
Co to znaczy: centrum danych, które ma ruszyć w Polsce w najbliższych latach, nie dostanie prądu z polskiego atomu. World Nuclear News · Rzeczpospolita

Benchmark tygodnia

Evident AI Index for Banks 2026 ocenia 50 spośród największych banków na podstawie danych publicznych.

Evident AI Index for Banks 2026 (6 października) – ranking 50 spośród największych banków Ameryki Północnej, Europy i wybranych rynków Azji oraz Pacyfiku, zbudowany z danych publicznych: ogłoszeń, publikacji, ofert pracy i raportów. Pierwsza dziesiątka: JPMorganChase, Capital One, RBC, CommBank, Wells Fargo, UBS, Bank of America, Citigroup, Morgan Stanley i TD Bank. UBS jest jedynym europejskim bankiem w pierwszej dziesiątce. Polskich banków w indeksie nie ma. Wpływ na wskaźniki operacyjne raportuje 12 proc. publicznie opisanych przypadków użycia AI. Konkretny zwrot finansowy ujawnia ledwie 1 proc. Zwrot z całości działań AI podaje albo prognozuje 12 banków z 50, rok wcześniej 8.

Decyzja: 45 proc. oceny daje filar talentów, czyli ludzie i zespoły, a konkretny zwrot finansowy publicznie raportuje się przy niewielkiej części opisanych wdrożeń. Brak ujawnienia nie przesądza o braku efektu. Zarząd, który zapyta o miejsce w takim zestawieniu, powinien dostać obok listę wdrożeń z policzonym efektem na wskaźniki operacyjne, a przy każdym wdrożeniu bez takiej liczby termin, w którym się pojawi. Evident · Raport

Harvey LAB-AA v1.1: sprawdzenie faktów zmienia ranking (8 października) – Artificial Analysis i Harvey zmieniły sposób oceny 120 zadań prawniczych. Wynik dostaje punkty, jeśli spełnia wszystkie kryteria i nie zawiera istotnej halucynacji, czyli np. zmyślonej daty, kwoty albo obowiązku. Według AA ponad 60 proc. rezultatów, które przechodziły rubrykę, zawierało taki błąd. Muse Spark 1.3 przechodził wszystkie kryteria w 26,7 proc. zadań; po sprawdzeniu halucynacji wynik spadł do 8,9 proc. Kontrolę zgodności ze źródłami wykonuje GPT-6 Sol w dwóch przebiegach, a ocenę kryteriów panel trzech modeli. To także kontrola wymagająca walidacji. Wyników nowej wersji nie można bezpośrednio porównywać z v1.0.

Decyzja: w odbiorze pracy agenta osobno oceniać wykonanie polecenia i zgodność twierdzeń z materiałem źródłowym. Istotny błąd w dacie, kwocie albo zobowiązaniu powinien zatrzymać odbiór, nawet gdy reszta dokumentu spełnia rubrykę. Artificial Analysis

Liczba tygodnia

50 zamiast 70 mld dolarów

Według Financial Times OpenAI powiedziało inwestorom, że jego roczny przychód liczony w obecnym tempie zbliża się do 50 mld dolarów. Pod koniec września Axios pisał o około 70 mld. Według tych relacji różnicę wyjaśnia sposób ujmowania sprzedaży przez partnerów chmurowych: Anthropic wlicza całą kwotę, OpenAI tylko swoją część. Wyższą liczbę według FT policzyli inwestorzy OpenAI, żeby porównać firmę z Anthropic. Axios zaznacza, że obie firmy księgują zgodnie z amerykańskimi zasadami rachunkowości, a sam przychód liczony w obecnym tempie nie jest pozycją sprawozdania finansowego.
Co to znaczy: przychód w ujęciu rocznym podawany przez prywatną firmę AI nie ma jednej definicji. W ocenie stabilności dostawcy porównuje się tylko liczby liczone tą samą metodą. Axios · TechCrunch

Według biuletynu Banku Rozrachunków Międzynarodowych z 1 października 55,2 proc. wartości inwestycji w firmy AI w latach 2021–2025 pochodziło od innych firm AI.

55,2 proc.

Taka część wartości inwestycji w firmy AI w latach 2021–2025 pochodziła od innych firm AI, według biuletynu Banku Rozrachunków Międzynarodowych z 1 października. W 46,4 proc. wartości inwestycji AI w AI inwestor był jednocześnie dostawcą albo klientem firmy, w którą inwestował. Licząc po liczbie transakcji, takich było 16,1 proc., więc chodzi głównie o kilka największych umów.
Co to znaczy: część pieniędzy z rund wraca do inwestorów jako zapłata za moc obliczeniową i chipy. Bank finansujący centra danych albo firmy z tego łańcucha powinien oceniać wspólne zależności: czy problemy jednego uczestnika uderzą równocześnie w kilku kredytobiorców. BIS

Kalendarz

  • 19–20 października – DevAI by Data Science Summit, 19 października online, 20 października w Centrum Nauki Kopernik w Warszawie. Konferencja dla programistów, którzy budują agenty i łączą modele z danymi firmy. DevAI

  • 21 października – Space Connect Summit, Krakowski Park Technologiczny. Konferencja polskiego sektora kosmicznego. Space Connect Summit

  • 24 października – Warsaw AI Safety Day, Wydział Psychologii UW. Warsaw AI Safety Day

  • do 31 października – Mistral zapowiada publikację wag Mistral Large 4. Mistral

  • 12 listopada – zaczyna obowiązywać zaktualizowana polityka użytkowania Anthropic. Doprecyzowuje m.in. wymagania dla porad i decyzji wysokiego ryzyka, w tym kredytowych: merytoryczny przegląd przez uprawnionego człowieka i informowanie osoby o udziale AI. Dodaje też wymagania dla modeli sterujących urządzeniami fizycznymi. Ogłoszenie · Polityka

  • 26 listopada – Bielik Summit 2026, Warszawa. Bielik Summit

  • 26–27 listopada – Data Science Summit, 26 listopada online, 27 listopada na PGE Narodowym. DSS

  • 2 grudnia – po zmianach z unijnego pakietu Digital Omnibus, który upraszcza przepisy cyfrowe, zaczynają obowiązywać nowe zakazy w AI Act, m.in. dotyczące generowania intymnych materiałów z rozpoznawalną osobą bez jej zgody. Tego dnia dostawcy systemów generujących treści, wprowadzonych na rynek przed 2 sierpnia 2026 roku, muszą oznaczać te treści w formacie czytelnym dla maszyn. EUR-Lex

Governance w pigułce

Komitet Bazylejski przejrzy kategorie strat operacyjnych pod kątem AI – Komitet, który ustala światowe standardy nadzoru bankowego, ogłosił 1 października przegląd kategorii zdarzeń, według których banki klasyfikują straty z ryzyka operacyjnego, ze szczególnym uwzględnieniem cyberataków i rozwoju AI. Terminu nie podał. Standardy bazylejskie trafiają do unijnych przepisów o wymogach kapitałowych, a stamtąd do raportowania strat operacyjnych przez banki.
Decyzja: dodać już teraz w rejestrze incydentów i strat pole „AI jako przyczyna albo czynnik”, żeby dane z 2026 roku można było wykorzystać przy ewentualnej zmianie klasyfikacji bez przeglądania zdarzeń od nowa. Komitet zapowiedział przegląd; nie przesądził jeszcze nowych kategorii. BIS

Ciekawostka

15 października 1956 roku IBM opatrzył datą podręcznik programisty do systemu FORTRAN dla komputera IBM 704. Zespołem kierował John Backus.

70 lat instrukcji FORTRAN-u

15 października 1956 roku IBM opatrzył datą podręcznik programisty do „The FORTRAN Automatic Coding System for the IBM 704”, systemu, który zamieniał wzory matematyczne zapisane przez człowieka na instrukcje dla maszyny. Zespołem kierował John Backus. Egzemplarz w zbiorach Computer History Museum to wersja robocza z wklejonymi wycinkami i poprawkami ołówkiem. Computer History Museum

Polecam

Philip E. Tetlock, Dan Gardner, „Superforecasting: The Art and Science of Prediction”, Crown, 2015.

Tetlock przez lata prowadził turnieje prognoz, w których dziesiątki tysięcy ochotników przewidywały wydarzenia polityczne i gospodarcze, a każdą prognozę rozliczano po fakcie. Najlepsi progności wygrywali nawet ze zbiorową oceną analityków wywiadu z dostępem do tajnych informacji. Podawali prawdopodobieństwa, zapisywali je i porównywali z tym, co się wydarzyło. Książka jest o tym, jak rozliczać kogoś, kto mówi „70 proc. szans”. Przydaje się przy każdym modelu, który zwraca prawdopodobieństwo. Penguin Random House

Zdanie tygodnia

❝

Ta przerwa wynika ze znacznego wzrostu liczby zautomatyzowanych zgłoszeń, z których zdecydowana większość jest nieważna.

Google o wstrzymaniu przyjmowania zgłoszeń podatności produktowych do programu nagród za błędy w oprogramowaniu open source, 1 października 2026. W oryginale: „This pause is due to a significant rise in automated submissions, the vast majority of which are not valid.” BleepingComputer

Domknięcie

Jeśli liczycie, ile wyników AI wasz zespół jest w stanie sprawdzić w ciągu dnia, odpiszcie, jak to robicie.

Bartosz

Reply

Avatar

or to participate