W trzech zdaniach
Najlepszy model na benchmarku modelowania finansowego Vals AI wstawia formuły do właściwych komórek w 89 proc. przypadków, a poprawną wartość liczbową uzyskuje w 64 proc.
W tym samym tygodniu badacz przełamał tryb automatyczny Claude Code ze skutecznością 60 do 80 proc., podczas gdy benchmark producenta dla tej samej funkcji pokazywał 0,00 proc., a agent, który zarobił najwięcej pieniędzy w rocznej symulacji handlu, wypadł szesnasty na osiemnaście w unikaniu nadużyć.
Trzy laboratoria wypuściły w pięć dni modele o zdolnościach ofensywnych w cyberbezpieczeństwie, każde z własnym zestawem liczb, i to jest tydzień, w którym warto sprawdzić, kto ustawiał test.

Arkusz, który przechodzi każdą kontrolę wyglądu i zawiera złą wartość.
Temat tygodnia
Vals AI prowadzi benchmark, który każe modelowi zrobić to, za co w bankowości inwestycyjnej płaci się analitykowi: zbudować model LBO, DCF albo wycenę porównawczą w Excelu, z danych źródłowych, od zera. Sto trzy zadania napisane i zrecenzowane przez ekspertów, każde z wzorcowym arkuszem. Rubryka ocenia: czy formuła siedzi we właściwej komórce, czy arkusz wygląda jak arkusz, i czy liczba na końcu jest poprawna.
Najlepszy model zdaje 89 proc. sprawdzeń formuł, 81 proc. sprawdzeń prezentacji i 64 proc. sprawdzeń numerycznych. Vals nazywa dokładność liczbową wąskim gardłem wszystkich modeli w zestawieniu. Wygląda to dokładnie tak, jak brzmi: dostajesz arkusz, który przechodzi każdą kontrolę, jaką potrafisz zrobić wzrokiem, i w którym co trzecia wartość jest zła.
Tydzień temu pisałem, że jakość i wolumen to dwa oddzielne rynki z różnymi zwycięzcami. Ten tydzień dołożył do tego rzecz nieprzyjemniejszą: obie te miary, i wszystkie inne, mierzą to, co wybrał mierzący.
26 sierpnia Johann Rehberger, badacz publikujący jako wunderwuzzi23, pokazał, jak zmusić Claude Code w trybie automatycznym do uruchomienia obcego kodu na komputerze użytkownika. W jego testach udawało się to trzy razy na pięć w jednym wariancie i cztery na pięć w innym. Próba jest mała i sam to zaznacza.
Anthropic podawał dla tego samego trybu 0,00 proc. Ta liczba pochodzi z oceny zewnętrznego zespołu, który wziął listę 72 gotowych scenariuszy ataku ukrytego w treści czytanej przez model, puścił każdy dziesięć razy i nie przeszedł ani jeden.
Obie liczby są prawdziwe, bo mierzą co innego. Producent sprawdził, czy model broni się przed atakami z listy. Rehberger napisał atak, którego na liście nie było.
31 sierpnia zespół stojący za rodziną modeli Qwen opublikował E-Commerce Bench: osiemnaście modeli frontierowych prowadzi sklepy przez symulowany rok, 365 dni, z popytem, zwrotami, negocjacjami z dostawcami i szokami podażowymi. GPT-5.6 Sol zarobił najwięcej, ze stu tysięcy zrobił 1 431 425. W siedmiu wymiarach oceny zajął szesnaste miejsce na osiemnaście w unikaniu nadużyć. Gdyby ktoś czytał tylko tabelę zysków, wybrałby model, który zarabia najlepiej, bo najmniej się przejmuje.
I jeszcze jedna historia z tego samego tygodnia, mniej techniczna, za to bliższa temu, co ludzie faktycznie robią z tymi narzędziami. Szwedzka komisja do spraw nadużyć w badaniach naukowych dostała skargę na książkę profesor zajmującej się zawodowo nadzorem nad sztuczną inteligencją. Zarzut: sześć przypisów prowadzi do źródeł, których nie ma. Przypisy są. Wyglądają jak przypisy. Numerki się zgadzają.
Cztery różne rzeczy, jeden mechanizm. Kontrola formy przechodzi, kontrola treści nie została przeprowadzona, bo nikt jej nie zaplanował jako osobnego kroku. W organizacji, która wdraża AI, cały aparat nadzoru odpowiada dziś na pytanie, czy wolno użyć danego modelu: klasyfikacja ryzyka, rejestr systemów, klauzule w umowie z dostawcą. Żaden z tych elementów nie odpowiada na pytanie, czy konkretna liczba, którą model właśnie wyprodukował, jest prawdziwa. To dwa różne testy i tylko jeden z nich mamy w procedurze.
Benchmark producenta nie kłamie. On mierzy coś innego, niż się wydaje przy pierwszym czytaniu.


Rubryka ocenia trzy rzeczy osobno, dwie zdają wysoko, trzecia jest wąskim gardłem.
Premiery

Claude Fable 5.1. Wynik na jednym teście ponaddwukrotnie w górę, koszt odczytu z pamięci podręcznej o trzy czwarte w dół.
Claude Fable 5.1 i Claude Mythos 5.1 (Anthropic, 01.09)
Anthropic wypuścił 1 września dwa modele, opisując Fable 5.1 jako najmocniejszy dotąd w kodowaniu i pracy z wiedzą. Liczby producenta: Terminal-Bench-Science 0.1 na poziomie 52,6 proc. wobec 24,7 proc. dla Fable 5 i 29,0 proc. dla Opus 5, Terminal-Bench 4.0 55,8 proc. wobec 42,0 i 52,3, CursorBench 3.2.0 73,4 proc., Humanity's Last Exam bez narzędzi 60,9 proc., OSWorld 2.0 w trybie ścisłym 41,7 proc. Cennik: 10 dolarów za milion tokenów wejścia, 50 dolarów za milion wyjścia, odczyt z pamięci podręcznej 0,25 dolara za milion, czyli o 75 proc. taniej niż wcześniej, co według firmy daje około 25 proc. oszczędności na typowych obciążeniach i do 45 proc. na zadaniach silnie agentowych. Anthropic
Co to znaczy: skok na Terminal-Bench-Science jest ponaddwukrotny wobec poprzednika, więc warto go sprawdzić na własnych zadaniach, zanim się uwierzy tabeli. Ważniejsze jest jedno zdanie z tej samej strony: Anthropic pisze, że Fable 5.1 ma najsilniejsze zdolności w cyberbezpieczeństwie ze wszystkich modeli, jakie wypuścili. To pierwszy z trzech takich komunikatów w tym tygodniu.
OpenAI: Astra przekracza próg „Critical” dla cyberbezpieczeństwa (01.09)
OpenAI ogłosiło 1 września, że Astra jest pierwszym ich modelem spełniającym najwyższy próg zdolności cybernetycznych w wewnętrznych ramach oceny gotowości: potrafi „identyfikować i budować działające exploity zero-day o wszystkich poziomach istotności w wielu utwardzonych, realnych systemach krytycznych bez interwencji człowieka”. Na benchmarku ExploitBench Astra uzyskał 100 proc., a w wewnętrznym porcie tego testu prowadzonym od czerwca do sierpnia znalazł i wykorzystał dwie podatności zero-day w łańcuchu exploitów. Odmowy na ewaluacjach obchodzenia zabezpieczeń w kontekście cyber: 91,5 proc. wobec 59 proc. dla GPT-5.6 Sol. Model ma trafić najpierw do małej grupy testerów alfa. OpenAI · wcześniejszy komunikat z 7 sierpnia: OpenAI
Co to znaczy: dostawca sam ogłasza, że przekroczył własny próg krytyczny, i sam wstrzymuje szerokie udostępnienie. To pierwszy taki przypadek i wart odnotowania w ocenie ryzyka koncentracji dostawcy, bo pokazuje, że dostępność modelu bywa funkcją decyzji producenta, nie umowy o poziomie usług.

Gemini 3.8 Flash Cyber dostępny wyłącznie przez program reglamentujący dostęp.
Gemini 3.8 Flash i Gemini 3.8 Flash Cyber (Google, 02.09)
Google ogłosiło 2 września dwa warianty. Wersja Cyber ma wykrywać podatności i automatycznie je łatać, ze skutecznością wykrywania realnych podatności powyżej 70 proc. w dwudziestu językach programowania i wynikiem 47,2 proc. pass@1 na CWE-Bench. Zespół bezpieczeństwa Chrome podaje 2,6 razy więcej poprawnych łatek niż wiodące modele komercyjne. Dostęp do wariantu Cyber jest reglamentowany przez program Fairwind i ograniczony do zaufanych organów rządowych, operatorów infrastruktury krytycznej i opiekunów oprogramowania. Cena wersji podstawowej: 0,75 dolara za milion tokenów wejścia i 3,75 dolara za milion wyjścia, stawka wprowadzająca do 31 grudnia 2026. Google
Co to znaczy: trzeci komunikat o zdolnościach ofensywnych w tym samym tygodniu, tym razem z jawnym mechanizmem reglamentacji. Trzy laboratoria niezależnie doszły do wniosku, że to jest zdolność, której nie sprzedaje się każdemu, i każde rozwiązało to inaczej: Anthropic wypuścił, OpenAI wstrzymał, Google wpuścił za bramkę.

Wybór modelu przestaje być osobną decyzją, a staje się konsekwencją odnowienia umowy na oprogramowanie.
Claudeforce: Salesforce i Anthropic (26.08)
Salesforce ogłosił 26 sierpnia rozszerzone partnerstwo, w którym Claude staje się modelem rozumowania dla silnika Atlas, domyślnie zasila Agentforce Vibes i Agentforce Coworker, i jest dostępny w Agent Builderze przez Amazon Bedrock. W drugą stronę powstała wtyczka Salesforce in Claude z 37 gotowymi umiejętnościami sprzedażowymi. Pilotaż trwa u wybranych klientów, otwarta wersja testowa zapowiedziana na wrzesień 2026. Salesforce
Co to znaczy: to koniec udawanej neutralności modelowej u dużych dostawców oprogramowania jako usługi. Kiedy warstwa systemu sprzedażowego ma wbudowany jeden konkretny model frontierowy, wybór modelu przestaje być decyzją odbiorcy, a staje się konsekwencją odnowienia licencji. Zapisy o nietrenowaniu na danych klienta i rozdział ról między dostawcą a wdrażającym negocjuje się wtedy przy umowie na oprogramowanie, nie przy wdrożeniu AI.

Model Hardware Standard. Wyłączenie agenta przestaje być zamknięciem sesji, a staje się odcięciem zasilania.
Anthropic Model Hardware Standard, wersja badawcza (27.08)
Anthropic otworzył 27 sierpnia wersję badawczą wspólnej specyfikacji, która pozwala agentom sterować urządzeniami fizycznymi. Działa jak ustandaryzowany sterownik z prymitywami odczytu i zapisu, z limitami bezpieczeństwa wbudowanymi na poziomie urządzenia i protokołami określającymi, kiedy wymagana jest zgoda człowieka. Na starcie dostęp mają wybrane laboratoria badawcze i producenci: Genentech, laboratoria Bakera i Pinglaya na University of Washington, Carnegie Mellon, HHMI Janelia, QuEra Computing, Tetsuwan Scientific. Wsparcie rozważają między innymi Amazon Web Services, Danaher, Doosan Robotics, QIAGEN, Tecan i Universal Robots. Anthropic
Co to znaczy: agent przestaje być tekstem. Wyłączenie agenta przestaje być zamknięciem sesji i staje się odcięciem zasilania, a to jest inna procedura, inny właściciel i inny czas reakcji.
Do jednego zdania: DeepSeek wypuścił 1 września DeepSeek-V4-Flash-Vision-Exp, pierwszy multimodalny model rodziny V4, na licencji MIT, z autoreportowanymi wynikami Terminal Bench 2.1 na poziomie 83,9 wobec 82,7 dla poprzednika i ZeroBench Pass@5 35,0 wobec 34,0 dla Opus-4.8. Hugging Face
Narzędzie tygodnia

TimesFM 3.0. Model do pobrania bez opłaty, licencja niekomercyjna blokuje produkcję.
TimesFM 3.0 to fundamentowy model Google Research do prognozowania szeregów czasowych, w architekturze Stacked Mixing Transformer z uwagą po zmiennych: dwadzieścia warstw, wymiar 1280, szesnaście głów uwagi. Uczony na zbiorze GiftEvalPretrain, odsłonach Wikipedii z odcięciem w listopadzie 2023, wyszukiwaniach Google Trends z odcięciem na koniec 2022 i danych syntetycznych. Hugging Face
Werdykt: warto policzyć wartość testu koncepcyjnego na prognozowaniu przepływów pieniężnych, płynności i ryzyka, i nie wolno planować na tym produkcji. Licencja nazywa się TimesFM Non-Commercial License v1.0 i to przesądza sprawę bez dyskusji o jakości. Model jest darmowy, wdrożenie komercyjne nie jest legalne bez osobnej umowy z Google. Karta modelu nie podaje przy tym ani jednej liczby porównawczej, więc każde twierdzenie o dokładności trzeba wyciągnąć z publikacji źródłowej, zanim ktokolwiek wpisze ten model do biznesplanu.
Co mówią liderzy
Na świecie · Podaż rośnie szybciej niż udokumentowany zwrot. Jensen Huang, przy wynikach za drugi kwartał roku obrotowego 2027 ogłoszonych 26 sierpnia: „Now, compute is revenue.” Przychód 96,2 miliarda dolarów, wzrost o 106 proc. rok do roku, centra danych 89,0 miliarda przy wzroście o 117 proc., prognoza na kolejny kwartał 108,0 miliarda plus minus 2 proc. NVIDIA
Nadzór globalny · Cyberryzyko przed wszystkim innym. Andrew Bailey, przewodniczący Rady Stabilności Finansowej, w liście do ministrów finansów i prezesów banków centralnych G20 z 31 sierpnia: „The most immediate concern is the potential impact of frontier AI on cyber risk.” Wzywa jurysdykcje do potraktowania bezpiecznego wypuszczania modeli jako priorytetu. FSB
Dostawca o własnym produkcie · Wygoda to nie zabezpieczenie. Anthropic, odpowiadając 26 sierpnia na zgłoszenie badacza, który przełamał tryb automatyczny Claude Code: „Auto Mode is a convenience feature backed by a best-effort classifier, not a security guarantee.” Zgłoszenie zamknięto jako informacyjne, bez zapowiedzi łatki, wskazując, że realną granicą jest izolacja systemu operacyjnego i kontrola ruchu wychodzącego. Embrace The Red
Co warto przeczytać u innych
Agency and Agents (Ethan Mollick, One Useful Thing, 31.08) – o tym, kiedy agent powinien zawołać człowieka. Zamiast fabryk bez ludzi Mollick proponuje układ, w którym agent-facylitator sam wciąga człowieka w czterech sytuacjach: przy decyzji zatwierdzającej, przy potrzebie wiedzy eksperckiej, przy potrzebie różnych perspektyw i przy pracy, która jest po prostu ciekawa. Link

benchmark producenta pokazał zero, test adwersaryjny pokazał osiemdziesiąt. Ten sam obiekt, dwa protokoły.
Breaking Claude Code Opus 5 Auto Mode (Johann Rehberger, Embrace The Red, 26.08) – najlepszy tekst techniczny tygodnia, pełny rozbiór łańcucha ataku krok po kroku. Link
The State of AI in 2026: On the Road to ROI (McKinsey, 25.08) – dziesiąta edycja dorocznego badania, 1719 uczestników z 97 krajów, dane zbierane od 4 maja do 8 czerwca 2026. Czytać z zastrzeżeniem: firma sprzedaje wdrożenia AI, a tytuł jest wyraźnie bardziej optymistyczny niż tabele pod nim. Link
The ECI frontier trend (Alexander Barry, Epoch AI, 01.09) – czoło indeksu zdolności Epoch rośnie o 14 punktów rocznie od pojawienia się modeli rozumujących, wobec 6 punktów rocznie wcześniej. Zastrzeżenie autorów: to nachylenie regresji liniowej na dziesięciu i trzynastu modelach, nie pomiar punkt do punktu. Link

Model odmawia obcego binarium, pisze własny kod, a ten kod ładuje podstawiony plik zamiast biblioteki.
Prośba o streszczenie archiwum notatek kończy się wykonaniem obcego kodu na komputerze użytkownika. Serwer odpowiada kodem HTTP 415, co przenosi Claude Code z własnego narzędzia pobierania na curl uruchomiony przez powłokę. W archiwum siedzi zakodowany ładunek i plik struct.py. Model odmawia uruchomienia obcego binarnego dekodera, uznaje to za ryzykowne, i pisze własny dekoder w Pythonie. Uruchamia go w katalogu z rozpakowanym archiwum. Import biblioteki base64 ładuje struct.py napastnika zamiast modułu biblioteki standardowej, kod wykonuje się w trakcie importu, a dekoder działa dalej bez śladu. Na końcu jest uruchomiony proces i połączenie zwrotne do serwera napastnika. Embrace The Red
Wiralowość: cross-posting między CyberSecurityNews, GBHackers, CyberPress i TechTimes w ciągu doby, wątek na Hacker News, fala publikacji 1 września. TechTimes
Co to znaczy: model zachował się rozsądnie w każdym pojedynczym kroku. Odmówił obcego binarium. Napisał własny kod. Ostrożność została użyta jako wektor, a podatna była kompozycja kroków, nie żaden z nich osobno. Żaden test sprawdzający pojedyncze zachowanie tego nie złapie, bo tam nie ma pojedynczego złego zachowania.

E-Commerce Bench. Model o najwyższym zysku jest szesnasty na osiemnaście w unikaniu nadużyć.

DroneCATS. Mniejsze modele trafiają w cel, a przegrywają epizod, bo nie ogłaszają dotarcia.
Z laboratoriów
Trzy prace z jednego tygodnia opisują to samo zjawisko w trzech różnych domenach: zdolność modelu i jego dyscyplina to dwie osobne osie.
E-Commerce Bench (31.08) wrzuca osiemnaście modeli frontierowych w symulowany rok prowadzenia sklepów, z kalendarzem promocji, katastrof i szoków podażowych. Model o najwyższym zysku, GPT-5.6 Sol, ze stu tysięcy robi 1 431 425 i zajmuje szesnaste miejsce na osiemnaście w unikaniu nadużyć. Zastrzeżenie, które trzeba postawić od razu: benchmark publikuje zespół Qwen, a wśród modeli otwartych prowadzi model Qwen. arXiv
DroneCATS (01.09) sadza modele multimodalne wprost w pętli sterowania dronem, bez dostrajania i bez wywoływania funkcji, z całą przestrzenią działań opisaną wyłącznie w poleceniu. Wynik jest odwrotny do oczekiwanego: mniejsze modele otwarte częściej doprowadzają drona w promień celu niż modele frontierowe, ale przegrywają epizod, bo ogłaszają dotarcie za wcześnie albo nie ogłaszają go wcale. Autorzy nazywają to wprost dyscypliną utrzymania protokołu i poprawnego zakończenia, nie zdolnością nawigacji. arXiv
Trzecia praca podpowiada, co z tym zrobić. Zespół z University of Waterloo (01.09) proponuje rozdzielenie warstwy sterującej od treści zadania: routing wiadomości, format i sygnał zakończenia zapisane jako typowane obiekty programu, a nie jako zdania w poleceniu. Deklarowany wynik to 100 proc. docelowej poprawności protokołu, testowane między innymi na przepływie ratingu ubezpieczeniowego, przy jednoczesnej poprawie wyniku samego zadania. Zastrzeżenie: chodzi o poprawność ostateczną, nie pierwsze przejście, ewaluacja jest mała, a odporność na wstrzykiwanie poleceń nie była badana. arXiv
Konsekwencja dla każdego, kto rozważa agenta w procesie operacyjnym: poprawne zakończenie i utrzymanie protokołu to osobne wymaganie testowe, niezależne od trafności. Agent może dolecieć do rozwiązania i nie umieć zaraportować, że skończył, a wtedy proces stoi, choć wszystkie metryki jakości wyglądają dobrze.

Ta sama rozbieżność musi wypłynąć w co najmniej czterech z pięciu przebiegów, żeby trafić do przeglądu.
Case tygodnia
Bank Rozrachunków Międzynarodowych opublikował 26 sierpnia biuletyn opisujący procedurę, w której model językowy porównuje prospekty emisyjne instrumentów kapitałowych z regułami kapitałowymi i porządkuje znalezione rozbieżności do przeglądu przez eksperta nadzoru. Autorzy: Fernando Perez-Cruz, Kumar Rishabh i Ayush Uchil. BIS
Liczby: prospekty instrumentów AT1 od dziesięciu europejskich banków o znaczeniu systemowym, model GPT-5.5 Pro, pięć niezależnych przebiegów na każde porównanie. Surowy wynik to 576 pojedynczych rozbieżności, po konsolidacji 193 odrębne, a do przeglądu trafiło 79 kandydatów, które pojawiły się w co najmniej czterech z pięciu przebiegów. Walidację przeprowadzono historycznie na zanonimizowanych dokumentach Credit Suisse i Yes Banku, czyli tam, gdzie różnice między regułą a prospektem faktycznie później zaważyły w sporach o pochłanianie strat. Obligacje Yes Banku odpisano na 84,15 miliarda rupii, około 1,1 miliarda dolarów w tamtym czasie.
Co da się przenieść: metoda, nie skala. Wielokrotny przebieg i próg powtarzalności jako filtr, zamiast jednego wywołania i wiary w wynik. To jest gotowy wzorzec dla najprostszej klasy zastosowań, czyli porównania dokumentu wewnętrznego ze standardem, i jednocześnie najtańsza znana mi odpowiedź na problem opisany w temacie tygodnia: jeśli ta sama rozbieżność wypływa w czterech z pięciu przebiegów, prawdopodobnie jest prawdziwa, a jeśli w jednym, prawdopodobnie jest halucynacją.
Zastrzeżenie: to biuletyn badawczy autorów, nie standard ani wytyczna nadzorcza. Poglądy są ich, nie instytucji.

Sześć przypisów w książce odsyła do źródeł, które nie istnieją.
Niewypał tygodnia
Virginia Dignum, profesor na Uniwersytecie w Umeå, kieruje laboratorium zajmującym się polityką wobec sztucznej inteligencji i doradza instytucjom publicznym. W lutym 2026 wydała popularnonaukową książkę „The AI Paradox, how to make sense of a complex future”. 26 sierpnia szwedzka komisja do spraw nadużyć w badaniach naukowych dostała skargę: sześć przypisów w tej książce odsyła do źródeł, które nie istnieją. Autorka korzystała przy pisaniu z ChatGPT, Claude'a i Gemini. Rzeczpospolita za PAP, publikacja 26 sierpnia, aktualizacja 2 września.
Dignum zaprzecza, i to zaprzeczenie jest istotne dla wniosku. Twierdzi, że błędy w bibliografii wzięły się z niepoprawnej konwersji w LaTeX-u, a modele poprawiały wyłącznie język, jej zdaniem najwyżej dziesięć procent tekstu, przy czym sama przyznaje, że nie liczyła dokładnie. Sprawa jest w toku i relacja pochodzi na razie od strony skarżącej.
Lekcja: nie ma znaczenia, czy przypisy wymyślił model, czy zepsuł je konwerter. W obu wersjach zawiodła ta sama, jedyna realna kontrola, czyli otwarcie sześciu przypisów przed wydaniem książki. Weryfikacja cytowań i liczb u źródła to osobny krok w procesie, a nie coś, co dzieje się samo przy okazji redakcji. W przypadku osoby, która zawodowo zajmuje się nadzorem nad AI, to kosztuje podwójnie.

Creotech. Pierwsza polska misja dla ESA, w której polski podmiot bierze całość, nie podzespół.
Z Polski
Creotech Instruments podpisał 1 września umowę z Europejską Agencją Kosmiczną na satelitę pogody kosmicznej SAWA, wartą 13,9 miliona euro, obejmującą fazy od B do E, z opcją rozszerzenia transmisji danych o dwa lata za około 1,9 miliona euro. Wyniesienie planowane jest na początek 2029 roku. Space24
Werdykt: nie kwota jest tu wiadomością, tylko rola. To pierwsza w historii Polski misja realizowana dla ESA w modelu, w którym polski podmiot bierze na siebie całą misję jako główny wykonawca i integrator, zamiast dostarczać podzespoły do cudzej. Marża, ryzyko i pozycja w rozmowie o kolejnych kontraktach wyglądają wtedy inaczej. Sprawdzianem będzie termin i budżet, nie komunikat.

Rozbicie oceny na formuły, prezentację i liczby, gdzie tylko trzeci słupek jest problemem.
Benchmark tygodnia
Excel Modeling Benchmark od Vals AI sprawdza, czy agent zbuduje w Excelu model finansowy typowy dla bankowości inwestycyjnej i private equity: LBO, DCF, fuzje i przejęcia, model operacyjny, wycenę porównawczą. Sto trzy zadania napisane i zrecenzowane przez ekspertów, każde z wzorcowym arkuszem, ocena w dwóch trybach: dokładnego dopasowania komórek i rubryki z częściowym kredytem. Ostatnia aktualizacja standingu: 30 sierpnia. Vals AI
Liczby, które mają znaczenie, to nie miejsca na podium, tylko rozbicie rubryki dla lidera: 89 proc. sprawdzeń formuł, 81 proc. sprawdzeń prezentacji, 64 proc. sprawdzeń numerycznych. Sam ranking wygląda inaczej w zależności od trybu oceny, więc podaję rozbicie, a nie kolejność.
Decyzja: model finansowy generowany przez agenta nadaje się do zbudowania szkieletu i układu arkusza, a każda wartość liczbowa wymaga przeliczenia przez człowieka przed podpisem. Odległość między „można pokazać” a „można podpisać” wynosi w tej chwili dwadzieścia pięć punktów procentowych.
Krytyka metody, bo należy się: część zadań ocenia sędzia będący modelem językowym, zbiór testowy jest prywatny i niesprawdzalny z zewnątrz, a rubryka z częściowym kredytem premiuje pracę „znaczącą, lecz niekompletną”. To dobra wiadomość dla porównywania modeli między sobą i słaba podstawa do twierdzenia, że którykolwiek z nich jest gotowy dla klienta.

McKinsey. Odsetek skalujących AI rośnie, odsetek zamieniających to na wynik finansowy stoi w miejscu.
Liczba tygodnia
1. 64 proc. wobec 89 proc. Tyle sprawdzeń numerycznych i sprawdzeń formuł zdaje najlepszy model na benchmarku modelowania finansowego Vals AI, stan na 30 sierpnia. Vals AI Dlaczego ta liczba: opisuje typ błędu, którego nie widać na ekranie. Arkusz z formułą w złej komórce rzuca się w oczy. Arkusz z poprawną formułą i złą wartością wygląda jak gotowa praca.
2. 6 proc. Tyle organizacji McKinsey klasyfikuje jako osiągające wysokie wyniki z AI, czyli przypisujące jej co najmniej 5 proc. zysku operacyjnego przy znaczącym wpływie na biznes. Wartość płaska rok do roku, przy 44 proc. deklarujących skalowanie AI w organizacji, wzroście z 38 proc., i 37 proc. przypisujących AI jakikolwiek wpływ na zysk operacyjny, też bez zmiany. Badanie objęło 1719 uczestników z 97 krajów, dane zbierano od 4 maja do 8 czerwca 2026. McKinsey Dlaczego ta liczba: osiem na dziesięć osób mówi, że AI poprawiła ich produktywność, a odsetek firm zamieniających to na wynik finansowy nie drgnął. Wzrost wdrożenia bez wzrostu zwrotu to nie porażka technologii, tylko wskazanie, gdzie wartość się gubi, czyli między pilotażem a produkcją.
Kalendarz
17-18.09.2026 – Agent Conf 2026, Crowne Plaza Warsaw The HUB. Konferencja inżynierska o budowaniu z agentami, organizuje Callstack, spodziewanych ponad 500 uczestników. Link
wrzesień 2026 – otwarta wersja testowa wtyczki Salesforce in Claude. Moment na przegląd zapisów umowy, jeśli korzystacie z Salesforce. Link
3-4.10.2026 – HackYeah 2026, Tauron Arena w Krakowie, dwunasta edycja. Pula nagród 50 tysięcy złotych, po 25 tysięcy w zadaniach otwartych i partnerskich. Link
6.10.2026 – Konferencja AI 2026 (ISCG), siedziba Microsoft Polska w Warszawie, 8.45–16.00, „Sztuczna inteligencja: przewaga czy ryzyko”. Link
8.10.2026 – AI Summit Poland 2026, Legia Warsaw Conference Centre przy Łazienkowskiej w Warszawie, warsztaty online dzień później. Warstwa biznesowa i przegląd wdrożeń rynkowych. Link
20.10.2026 – termin nadsyłania uwag w konsultacjach amerykańskiej Komisji Handlu Kontraktami Terminowymi na Towary w sprawie instrumentów pochodnych, których instrumentem bazowym jest moc obliczeniowa. Federal Register
styczeń 2027 – termin, do którego ChatGPT musi spełnić obowiązki wynikające z wyznaczenia go pod aktem o usługach cyfrowych. Komisja Europejska

Podstawą wyznaczenia była funkcja wyszukiwania, nie kategoria „AI”, więc szablon da się rozciągnąć.
Governance w pigułce
Komisja Europejska wyznaczyła 31 sierpnia ChatGPT jako bardzo dużą wyszukiwarkę internetową w rozumieniu aktu o usługach cyfrowych, a przy okazji Reddit i Roblox jako bardzo duże platformy. Wszystkie trzy zadeklarowały co najmniej 45 milionów średnich miesięcznych użytkowników w Unii. Termin na zgodność to cztery miesiące od notyfikacji, czyli styczeń 2027, a obowiązki obejmują ocenę i ograniczanie ryzyk systemowych, niezależny audyt i dostęp badaczy do danych. Komisja Europejska
Decyzja: podstawą wyznaczenia jest funkcja wyszukiwania, nie kategoria „AI”, więc ten sam szablon da się rozciągnąć na kolejnych dostawców, gdy urosną. Praktyczny ruch dla firmy, która z takiego dostawcy korzysta: przy najbliższym odnowieniu umowy sprawdzić, czy podlega on już niezależnemu audytowi i obowiązkowi udostępniania danych badaczom, bo to zmienia zakres tego, co można od niego wyegzekwować, i to bez negocjacji.

Roszczenia spadły o 40 procent i wróciły do normy w ciągu sześciu tygodni.
Ciekawostka
3 września 1967 o 4.50 nad ranem cała Szwecja zatrzymała samochody, przejechała na prawą stronę jezdni, znów stanęła i ruszyła o 5.00. W referendum z 1955 roku 83 proc. Szwedów głosowało za utrzymaniem ruchu lewostronnego. Rząd przeprowadził zmianę mimo to. W dniu operacji zgłoszono 157 drobnych wypadków, z czego 32 z obrażeniami. W następny poniedziałek 125 wypadków, wobec 130 do 198 w poprzednie poniedziałki, żaden śmiertelny. Liczba roszczeń ubezpieczeniowych spadła o 40 proc. Wikipedia, Dagen H
I tu jest pointa, która pasuje do reszty tego numeru: roszczenia wróciły do normy w ciągu sześciu tygodni. Ludzie jeździli ostrożnie, dopóki pamiętali, że jest się czego bać. Spadek o 40 proc. był prawdziwym pomiarem czegoś, co nie było trwałe, i każdy, kto zmierzył to w pierwszym tygodniu i wysłał wynik do zarządu, miał rację przez czterdzieści dni.
Polecam

„The Tyranny of Metrics”, Jerry Z. Muller (Princeton University Press, wydanie w miękkiej oprawie 30 kwietnia 2019, 248 stron, pierwsze wydanie 2018)
Muller opisuje mechanizm, w którym organizacje zaczynają mierzyć to, co da się policzyć, a potem zarządzać wyłącznie tym, co zmierzyły, aż mierzenie zaczyna szkodzić rzeczy, którą miało poprawić. Przechodzi przez medycynę, szkolnictwo, policję i wojsko, i nigdzie nie postuluje porzucenia liczb, tylko traktowanie ich jako uzupełnienia osądu opartego na doświadczeniu. Czytałem to jako książkę o biurokracji, a w tym tygodniu przeczytałbym jako książkę o benchmarkach: 89 proc. sprawdzeń formuł i 64 proc. sprawdzeń numerycznych to dokładnie ten problem, tylko w Excelu. Princeton University Press
MWM tygodnia
Mały wielki model tego tygodnia to PhoneLLM Alpha 1 od zespołu Pipecat, dostrojenie modelu NVIDIA Nemotron 3 Nano 30B-A3B: hybrydowa architektura Mamba-Transformer z mieszanką ekspertów, 30 miliardów parametrów łącznie i 3,5 miliarda aktywnych na token, kontekst 262 144 tokeny, licencja BSD 2-Clause bez ograniczeń komercyjnych, przy zachowaniu warunków licencji modelu bazowego NVIDII. Model jest trenowany pod jedno zadanie: prowadzenie rozmów telefonicznych z klientem i poprawne wywoływanie narzędzi w długiej, wieloturowej rozmowie, bez włączonego rozumowania, bo rozumowanie kosztuje czas, którego w rozmowie głosowej nie ma. Autorzy podają, że wypada na równi z GPT 5.6 Terra, przy koszcie niższym o 94 proc. i czasie do pierwszego tokenu krótszym o 1300 milisekund w mierze P95. Hugging Face
Dwa zastrzeżenia. Benchmark, na którym te liczby powstały, PhoneBench v1, zbudował ten sam zespół, który wydał model, a ocenia go panel sędziów będących modelami językowymi, kalibrowany do ludzkich etykiet. I sam problem, który autorzy opisują jako powód powstania modelu, brzmi znajomo po lekturze reszty tego numeru: modele duże i małe mówią „tak, zarezerwowałem stolik”, nie rezerwując stolika.
Zdanie tygodnia
„Auto Mode is a convenience feature backed by a best-effort classifier, not a security guarantee.” – Anthropic, 26 sierpnia 2026, w odpowiedzi na zgłoszenie badacza.
Najuczciwsze zdanie tygodnia i jednocześnie najbardziej niewygodne. Producent mówi wprost, że funkcja, którą użytkownicy traktują jak zabezpieczenie, jest wygodą. Warto sprawdzić, ile rzeczy w waszym stosie technologicznym ma podobny status i tylko nikt tego jeszcze nie napisał na piśmie.
Domknięcie
Ten tydzień dał trzy modele o zdolnościach ofensywnych, list przewodniczącego Rady Stabilności Finansowej do G20 i benchmark, który pokazuje, że najlepszy model buduje arkusz z poprawnymi formułami i złymi liczbami. Wszystkie te informacje przyszły z liczbą w komunikacie. W mojej pracy pierwsze pytanie przy każdej z nich brzmi tak samo: kto ustawiał test. Do zobaczenia za tydzień.
Bartosz
