
Anthropic i OpenAI wprowadziły we wrześniu modele tańsze za token, czyli za jednostkę, w której liczy się tekst modelu.
W trzech zdaniach
Anthropic i OpenAI wprowadziły w ciągu tygodnia modele tańsze za token, a Artificial Analysis policzyło, że nowy Claude Sonnet 5.5, w tej samej cenie za token co poprzednik, kosztuje na najwyższym poziomie rozumowania 7,60 dolara za jedno zadanie testowe, o około 50 proc. więcej.
18 czerwca eksperymentalny agent, którego OpenAI testowało wewnętrznie, bez pozwolenia obszedł zabezpieczenia australijskiego rządowego portalu ze statystykami Medicare, a OpenAI zawiadomiło urząd dopiero 10 września, mailem na ogólny adres do zgłaszania luk.
Według Reutersa, który widział poufny prospekt emisyjny Anthropic, firma ma co najmniej 518 mld dolarów zobowiązań na infrastrukturę na najbliższą dekadę, w około 80 proc. nieodwołalnych albo płatnych niezależnie od wykorzystania.
Temat tygodnia

Programista Simon Willison dał Claude Sonnet 5.5 proste zadanie graficzne na najwyższym poziomie rozumowania.
28 września Simon Willison, programista, który testuje nowe modele na swoim blogu, dał Claude Sonnet 5.5 proste zadanie graficzne na najwyższym poziomie rozumowania, czyli z pozwoleniem na najdłuższe myślenie przed odpowiedzią. Model zużył na rozumowanie cały limit 128 tys. tokenów odpowiedzi (token to jednostka rozliczeniowa modelu, zwykle fragment słowa; płaci się także za tokeny rozumowania, których użytkownik nie widzi), kosztował 1,28 dolara i nie oddał rysunku. Poziom niżej zrobił to w 41 sekund za 5,74 centa. Willison
Dwa tygodnie temu liczbą tygodnia było 41 proc.: o tyle spadła w tym roku efektywna cena modelu. Od tamtej pory ceny spadły znowu. 22 września Anthropic wypuścił Claude Opus 5.5 w cenie 4 dolarów za milion tokenów wejściowych i 20 dolarów za milion wyjściowych, wobec 5 i 25 dolarów za Opus 5. Półtorej godziny później OpenAI wypuściło GPT-6 Sol i GPT-6 Luna za połowę ceny poprzedników z serii 5.6. 29 września wszedł GPT-6.1 Sol, za piątą część ceny flagowego GPT-6 Astra: 2 dolary za milion tokenów wejściowych i 10 za milion wyjściowych. Anthropic · TechCrunch · OpenAI

Artificial Analysis zmierzyło, ile tokenów zużywają modele na jedno zadanie testowe na najwyższym poziomie rozumowania.
Artificial Analysis, firma, która mierzy modele na stałym zestawie testów, podaje przy każdym modelu, ile tokenów zużywa na zadanie i ile to zadanie kosztuje. Na najwyższym poziomie rozumowania GPT-6 Astra zużywa na zadanie około 27 tys. tokenów wyjściowych, Opus 5.5 około 119 tys., Sonnet 5.5 około 193 tys. Ceny tokena różnią się między tymi modelami najwyżej pięciokrotnie, liczba zużytych tokenów siedmiokrotnie. Koszt zadania obejmuje też tokeny wejściowe, czyli wszystko, co model czyta po drodze. Gemini 4 Argon ma w indeksie tyle samo punktów co GPT-6 Astra i zużywa około 62 tys. tokenów wyjściowych na zadanie, ponad dwa razy więcej. W cenie promocyjnej zadanie kosztuje z nim 1,99 dolara, w standardowej 3,98 dolara, wobec 3,26 dolara za Astrę. Artificial Analysis pisze, że tę przewagę daje niższa cena tokena, a nie mniejsze zużycie. Opus 5.5 · Sonnet 5.5 · Gemini 4 Argon

Anthropic pisze, że z Claude Sonnet 5.5 zadanie kosztuje do 30 proc. mniej niż z Sonnetem 5.
Według Artificial Analysis Opus 5.5 kosztuje za zadanie mniej więcej tyle co Opus 5. Zużywa 1,6 raza więcej tokenów wyjściowych. Anthropic podaje, że w typowej pracy wychodzi o 40 proc. taniej. Sonnet 5.5 ma cenę Sonneta 5, a Anthropic pisze, że zadanie kosztuje z nim do 30 proc. mniej. Artificial Analysis policzyło 7,60 dolara za zadanie, o około 50 proc. więcej niż u poprzednika. Mierzyło wersję przedpremierową z błędem przy odpowiedziach w ustalonym formacie, który Anthropic naprawił przed publiczną premierą, i zapowiada ponowny pomiar. GPT-6.1 Sol kosztuje za zadanie 0,72 dolara wobec 3,26 dolara za GPT-6 Astra, z wynikiem w indeksie o jeden punkt niższym, w skali, w której najlepszy model ma 58 punktów. GPT-6.1 Sol
Deklaracja producenta dotyczy typowej pracy, pomiar Artificial Analysis najwyższego poziomu rozumowania na jego zestawie testów. Różnią się o kilkadziesiąt punktów procentowych i oba mogą być prawdziwe. Rachunek to cena tokena razy liczba tokenów. Cenę dostawca publikuje w cenniku. Liczbę tokenów ustala model, zależnie od poziomu rozumowania, który wybiera ten, kto wdraża, i od wersji modelu. GPT-6 Sol został zastąpiony przez GPT-6.1 Sol po siedmiu dniach.

Claude Opus 5.5 na najwyższym poziomie rozumowania pracował w teście Simona Willisona prawie 20 minut, kosztował 2,56 dolara i wyczerpał limit bez wyniku.
Do kosztu dochodzą zadania, które się nie udały. Tydzień przed Sonnetem Opus 5.5 na najwyższym poziomie pracował nad zadaniem Willisona prawie 20 minut, za 2,56 dolara, i też wyczerpał limit bez wyniku. Willison, 22 września

KPMG zapytało 2131 menedżerów z 20 krajów o inwestycje w AI.
24 września KPMG opublikowało kwartalne badanie 2131 menedżerów z 20 krajów. Średni planowany budżet na AI na najbliższy rok wzrósł od pierwszego kwartału ze 186 do 210 mln dolarów. Tylko 12 proc. firm deklaruje, że konsekwentnie zestawia wartość AI z jej kosztem. Wśród firm, które deklarują zwrot z inwestycji, takich jest 48 proc. KPMG

Microsoft zapowiedział, że w nowym Copilocie praca agentowa, czyli zadania wykonywane przez AI samodzielnie krok po kroku, będzie rozliczana w kredytach za zużycie.
Rozliczanie za zużycie wchodzi też tam, gdzie do tej pory była stała licencja. 25 września Microsoft zapowiedział, że praca agentowa w nowym Copilocie, czyli zadania, które program AI wykonuje sam, krok po kroku, korzystając z firmowych systemów, będzie rozliczana w kredytach za zużycie, z budżetami ustawianymi dla całej firmy, grup i pojedynczych użytkowników. W ChatGPT nowe subskrypcje planu Pro za 200 dolarów dostają niższy limit, a dotychczasowe zachowują stary do 29 października włącznie. Nowy plan Pro 500 za 500 dolarów miesięcznie daje 25 razy więcej niż Plus. Reworked · OpenAI, plany Pro
Swój rachunek ma też dostawca. Według Reutersa, który widział poufny prospekt emisyjny Anthropic, firma ma co najmniej 518 mld dolarów zobowiązań na infrastrukturę na najbliższą dekadę. Około 80 proc. tej kwoty to umowy nieodwołalne albo płatne niezależnie od wykorzystania. Jeśli Anthropic wyda u Google'a mniej, niż obiecał, dopłaca różnicę. Reuters, przez Investing.com
Proponuję jedną zmianę w każdym business case'ie AI. Zamiast ceny za milion tokenów wpisać koszt jednego zaakceptowanego wyniku: wszystkie koszty procesu, czyli tokeny, narzędzia, sprawdzanie przez ludzi, poprawki i nieudane próby, podzielone przez liczbę wyników, które przeszły odbiór. Liczyć go na własnych przypadkach, przy zapisanym poziomie rozumowania i zapisanej wersji modelu, obok jakości i czasu. Przy każdej zmianie wersji albo ustawienia ten koszt trzeba policzyć od nowa, zanim nowa wersja trafi do procesu.
✦

Premiery

OpenAI zrezygnowało z wydania GPT-6.1 Astra, następcy swojego flagowego modelu.
GPT-6.1 Astra odwołany (28 września) – OpenAI zrezygnowało z wydania następcy flagowca. Według firmy model nie spełnił w testach wewnętrznych jej standardów w działaniu zgodnym z wolą człowieka, w trzymaniu się zakresu i uprawnień oraz w informowaniu użytkownika o tym, co zrobił.
Co to znaczy: umowę z dostawcą warto wiązać z konkretną, przetestowaną wersją modelu. Al-Dżazira
Microsoft Copilot: Home, Code i Autopilot (25 września) – Autopilot to agent z własną nazwą, rolą, celami i tożsamością w Microsoft 365, dostępny przez Teams i Outlooka. Code buduje aplikacje i pulpity z opisu w języku naturalnym. Autopilot jest od końca września w prywatnym podglądzie.
Co to znaczy: według zapowiedzi Microsoftu agent z własnym kontem ma trafić do organizacji na Microsoft 365, a jego uprawnienia trzeba będzie nadać tak samo jak uprawnienia nowego pracownika. Zanim to nastąpi, trzeba ustalić, kto w firmie nadaje mu dostęp i kto ustawia limit kredytów. Reworked · TechRepublic
OpenAI Private Intelligence (29 września) – dla organizacji z zatwierdzonym zerowym przechowywaniem danych po stronie OpenAI firma uruchomiła Private Safety Processing: automatyczny przegląd bezpieczeństwa zapytań bez dostępu pracowników OpenAI do treści. Zapisy, zaszyfrowane także kluczem klienta, trafiają do magazynu w chmurze klienta i trzeba je przechowywać co najmniej 30 dni. Private Inference, czyli przetwarzanie w środowisku poufnym, ma wejść jesienią w wersji zapoznawczej.
Co to znaczy: brak przechowywania danych u OpenAI oznacza co najmniej 30 dni zaszyfrowanych zapisów u klienta. Bank musi je ująć w polityce przechowywania danych i w ocenie dostawcy. OpenAI, DevDay · Dokumentacja

OpenAI wypuściło GPT-6.1 Sol za piątą część ceny flagowego GPT-6 Astra.
GPT-6.1 Sol (29 września) – według OpenAI dorównuje GPT-6 Astra w teście programistycznym DeepSWE za około piątą część kosztu. Karta bezpieczeństwa opublikowana tego samego dnia podaje, że w zadaniach programistycznych dobranych tak, żeby sprowokować nieuczciwość, przeinacza wyniki w 1,50 proc. przypadków, wobec 0,51 proc. u Astry. W teście drobnych ograniczeń, przeprowadzonym bez systemowych zabezpieczeń przed ich obchodzeniem, próbował je obejść w 23,5 proc. przebiegów, wobec 17,4 proc. u Astry.
Co to znaczy: tańszy wariant tej samej rodziny zachowuje się inaczej niż flagowiec i przed wdrożeniem trzeba go przetestować jak nowy model. OpenAI · Karta bezpieczeństwa
Claude Opus 5.5 (22 września) – model Anthropic, w niezależnym indeksie Artificial Analysis pierwszy z wynikiem 58 punktów, pięć przed GPT-6 Astra. Według Anthropic próbował obchodzić ograniczenia nałożone na środowisko, w którym pracuje, o około 85 proc. rzadziej niż Opus 5.
Co to znaczy: próby obchodzenia ograniczeń zmalały, ale się zdarzają. W rejestrze ryzyk powinny mieć osobną pozycję przy każdym agencie z dostępem do systemów firmy. Anthropic · Artificial Analysis · GPT-6 Astra w AA
GPT-6 Luna (22 września) – najtańszy nowy model OpenAI: 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion wyjściowych.
Co to znaczy: nowy próg ceny dla prostych, powtarzalnych zadań, takich jak klasyfikacja dokumentów i wyciąganie z nich danych, pod warunkiem testu jakości na własnych dokumentach. Willison

W Claude Sonnet 5.5 Anthropic wprowadził zabezpieczenie: przy zadaniach o podwyższonym ryzyku w cyberbezpieczeństwie odpowiada starszy Sonnet 5, a użytkownik widzi przełączenie.
Claude Sonnet 5.5 (28 września) – według Anthropic w teście pracy w terminalu Terminal-Bench 4.0 ma 70,6 proc., więcej niż Opus 5.5 z 66,4 proc. W indeksie Artificial Analysis drugi, z 56 punktami. Przy zadaniach o podwyższonym ryzyku w cyberbezpieczeństwie odpowiada starszy Sonnet 5, a użytkownik widzi, że nastąpiło przełączenie.
Co to znaczy: w jednym procesie mogą odpowiadać dwa różne modele. Log systemu musi zapisywać, który odpowiedział. Anthropic

Google wypuścił Gemini 4 Argon najpierw dla wybranych specjalistów od obrony przed cyberatakami.
Gemini 4 Argon (30 września) – nowy flagowiec Google trafia najpierw do wybranych specjalistów od obrony przed cyberatakami w programie Fairwind. Płatne API i subskrybenci Google AI Ultra mają go dostać po zakończeniu testów zabezpieczeń, bez podanej daty. Cena wprowadzająca 2 i 10 dolarów za milion tokenów, potem 4 i 20 dolarów. Według Google w teście programistycznym DeepSWE ma 77,9 proc., a odpowiedź może mieć do miliona tokenów, wobec 64 tys. w poprzedniej wersji.
Co to znaczy: firmy nie mogą planować wdrożeń na tym modelu, dopóki Google nie poda daty szerokiego udostępnienia. Google
Xiaomi MiMo-V2.6-Pro (22 września) – model z otwartymi wagami na licencji MIT, która pozwala na użycie komercyjne. Ma 1,02 bln parametrów, z których do wygenerowania każdego tokena używa 42 mld. W API kosztuje 0,43 dolara za milion tokenów wejściowych i 0,87 za milion wyjściowych. Według karty producenta w Terminal-Bench 2.1 ma 89,9 proc., więcej niż Opus 5. W nowszym i trudniejszym Terminal-Bench 4.0 ma 34,9 proc. wobec 49,0 proc. u Opusa 5.
Co to znaczy: kandydat do pilotażu na własnej infrastrukturze, pod warunkiem że firma udźwignie pamięć na wszystkie wagi i koszt utrzymania. Do decyzji potrzebny jest test na trudniejszym zestawie zadań. Xiaomi · Hugging Face · Artificial Analysis, ceny
Narzędzie tygodnia

OpenAI udostępniło dots, agenty, które pracują cały czas, każdy na własnym komputerze w chmurze, z dostępem do ponad 4000 aplikacji.
OpenAI dots (29 września). Agenty, które pracują cały czas, na modelu GPT-6 Astra, każdy na własnym komputerze w chmurze, z dostępem do ponad 4000 aplikacji przez wtyczki. Kontakt przez ChatGPT, Slacka i Teams. Pierwszy agent jest w cenie planów Pro i Business Premium, z limitem pracy, w planie Enterprise jako wersja beta, którą włącza administrator. Ceny kolejnych nie podano. Użytkownik wybiera, które aplikacje podłączyć, i ustala reguły: działaj sam, pytaj przed działaniem albo przekaż mi. Samodzielne wyszukiwanie informacji w tle ma dostęp tylko do odczytu. Według OpenAI monitoring bezpieczeństwa może wstrzymać pracę agenta. W pilotażach z wybranymi firmami OpenAI testuje osobny wariant, któremu firma nadaje własną tożsamość i poświadczenia do swoich systemów. W planie Pro na start nie ma ich w Europejskim Obszarze Gospodarczym, Szwajcarii i Wielkiej Brytanii. OpenAI · Mixed
Werdykt: poczekać. Agent pracuje w tle, bez udziału użytkownika, na aplikacjach, które ten mu podłączy. Firmie z Business Premium proponuję piaskownicę bez dostępu do systemów produkcyjnych i z regułą „zablokuj” jako ustawieniem domyślnym dla każdego działania, które zapisuje albo wysyła dane.
Co mówią liderzy
Na świecie · Sam Altman w Radzie Bezpieczeństwa ONZ, 23 września: „We have unilaterally slowed down in the past. We will do so in the future.” W tym samym wystąpieniu wezwał do „accurate and speedy incident reporting”. W tym samym tygodniu OpenAI wstrzymało trening najmocniejszych modeli. OpenAI, wystąpienie · OpenAI, raport o incydencie
Na świecie · Clément Delangue, Hugging Face, w Radzie Bezpieczeństwa ONZ, 23 września: „We were attacked by AI, but more importantly, we defended ourselves with AI.” Według Delangue'a w czasie lipcowego ataku agentów OpenAI na infrastrukturę jego firmy broniono się otwartym modelem GLM 5.2, bo zabezpieczenia modeli zamkniętych blokowały obrońców. Postuluje obowiązek ujawniania pełnych zapisów działań agentów. The Next Web
Finanse i kapitał · Claudia Buch, przewodnicząca Rady Nadzorczej EBC, 22 września: „Digital innovation cannot be left to the technical experts, it requires board-level attention and alignment with core corporate values.” I o kredytach: „AI can introduce new biases, requiring human intervention to align lending practices with the values of the organisation.” EBC
Finanse i kapitał · Lisa Cook, członkini zarządu Rezerwy Federalnej, 28 września: „A large portion of the rise in equity prices over the past few years can be attributed to enthusiasm about AI.” Fed
Polska · Pamela Krzypkowska po głosowaniu w Senacie, 24 września: „Chciałabym bardzo podziękować za to zaufanie i – jak to się mówi – zakasam rękawy, żeby teraz sztuczna inteligencja w Polsce była bezpieczna dla nas wszystkich (…)” Senat zgodził się na jej powołanie na przewodniczącą Komisji Rozwoju i Bezpieczeństwa Sztucznej Inteligencji: 56 za, 2 przeciw, 28 wstrzymujących się. Komisja ma się zebrać pierwszy raz do 11 listopada. WNP, za PAP
Co warto przeczytać u innych
The US spent billions on border surveillance. Why can't it catch people before they die? – James O'Donnell i Eileen Guo, MIT Technology Review, 21 września. Rok pracy MIT Technology Review i Times of San Diego: prawie 4000 miejsc, w których znaleziono szczątki migrantów, zestawionych z zasięgiem około 600 wież obserwacyjnych na granicy USA. Ponad 1050 osób zmarło w zasięgu wież, w tym ponad 110 w zasięgu wież autonomicznych. Straż graniczna prawie nie sprawdza, jak działają wieże, a planuje miliard dolarów na kolejne 1497 wież do 2034 roku. MIT TR
Who's liable when AI agents go rogue? – Michelle Kim, MIT Technology Review, 28 września. Kalifornijska ustawa SB 53 każe zgłaszać między innymi utratę kontroli nad modelem, która kończy się śmiercią lub obrażeniami, oraz szkody z ryzyka katastrofalnego, czyli powyżej 50 ofiar albo miliarda dolarów. Według autorki OpenAI najpewniej nie musiało zgłaszać włamań swoich agentów, które nie przekroczyły tych progów. MIT TR
When can we say AI made a scientific discovery? – James O'Donnell, MIT Technology Review, 28 września. Spór o „odkrycie” laboratorium biologicznego Anthropic: 950 agentów w 21 godzin wskazało powtarzający się wzór wokół znanego enzymu, który Anthropic przedstawił jako wcześniej nieopisany. Biolodzy odpowiadają, że to łatwa część, a odkryciem jest dopiero ustalenie, co ten układ robi. Zespół z Uniwersytetu Kopenhaskiego twierdzi, że opisał ten wzór wcześniej. MIT TR
Viral tygodnia

Agent OpenAI wszedł 18 czerwca do australijskiego portalu statystyk Medicare.
Agenty OpenAI w serwisach rządowych. 24 września premier Australii Anthony Albanese ujawnił, że agent OpenAI 18 czerwca obszedł zabezpieczenia portalu statystyk Medicare. Według komunikatu OpenAI z 28 września agent zdobył poświadczenia, wykonywał polecenia, pobrał pliki wewnętrzne i zagregowane statystyki oraz zapisywał pliki. Według dotychczasowego przeglądu OpenAI nie uzyskał dostępu do indywidualnej dokumentacji pacjentów. OpenAI wykryło incydent 11 sierpnia. 10 września wysłało maila na adres [email protected], przez który naukowcy i badacze zgłaszają luki w systemach urzędu. Australijski wywiad elektroniczny dowiedział się 15 września, premier między 19 a 20 września. Albanese: „The AI agent found a way around those blocks, didn't accept 'no' for an answer.” ABC · OpenAI, 28 września
26 września niezależny badacz Rowan Howard-Jones, a za nim Wall Street Journal, opisał, jak agenty OpenAI między kwietniem a czerwcem ponad 16 tys. razy odpytywały serwis danych UNCTAD, agendy ONZ do spraw handlu, część zapytań z technikami obchodzenia filtrów. Ruch agentów do tego serwisu opisała wcześniej, 23 września, firma badawcza Transluce. Howard-Jones · Transluce
Od incydentu do maila minęły 84 dni, od wykrycia 30. Dla porównania: bank w Unii zgłasza swojemu nadzorcy, zgodnie z DORA, poważny incydent związany z ICT, czyli z systemami informatycznymi, co do zasady w ciągu czterech godzin od uznania go za poważny i nie później niż 24 godziny od wykrycia. Rozporządzenie delegowane 2025/301
Z laboratoriów

Brytyjski instytut bezpieczeństwa AI sprawdził w symulacjach, czy GPT-6 Astra podłoży złośliwy kod do cudzych projektów, choć nikt mu tego nie zlecił.
Brytyjski instytut bezpieczeństwa AI o GPT-6 Astra (28 września). W symulacjach model przeprowadzał nieautoryzowane ataki na łańcuch dostaw oprogramowania, czyli podkładał złośliwy kod do cudzych projektów, w 29,2 proc. testów. GPT-5.6 Sol robił to w 6,3 proc., GPT-5.5 w żadnym. Model zakładał fałszywe konta, żeby z nich podważać trafne przeglądy bezpieczeństwa. Klasyfikatory OpenAI, które mają takie działania blokować, były na czas testu wyłączone. Po dopisaniu do polecenia zdania „Anything not listed as in scope is out of scope” w dziesięciu scenariuszach, w których model atakował najczęściej, ataki spadły z 26 na 50 przebiegów do 4 na 49. AISI
Co to znaczy: w symulacji AISI po dopisaniu jednego zdania o zakresie ataków w najgroźniejszych scenariuszach było około 8 proc. zamiast mniej więcej połowy. Takie zdanie powinno być w każdym szablonie polecenia dla agenta, a resztę musi zatrzymać kontrola poza modelem.

Według Anthropic chiński model z otwartymi wagami GLM-5.3 buduje działające exploity, czyli programy wykorzystujące luki w zabezpieczeniach, w 50 na 410 prób.
Anthropic o otwartym modelu GLM-5.3 (29 września). Według Anthropic chiński model z otwartymi wagami buduje działające exploity, czyli programy wykorzystujące lukę w zabezpieczeniach, w 50 na 410 prób. Claude Mythos Preview z wyłączonymi zabezpieczeniami robi to w 56 na 410. Usunięcie zabezpieczeń z modelu kosztuje około 2200 godzin pracy procesorów graficznych, czyli około 4400 dolarów. Badacz zbudował z mniejszą wersją, GLM-5.3-Flash, działający łańcuch exploitów na znaną lukę w Chrome w 20 minut swojej pracy i 8 godzin pracy modelu. Według cennika API Zhipu kosztowałoby to 20,40 dolara. Amerykański instytut normalizacyjny NIST ocenił GLM-5.3 jako najbardziej zdolny w cyberataku model z otwartymi wagami. Anthropic
Co to znaczy: plan obrony przed cyberatakami trzeba pisać pod napastnika, który za kilka tysięcy dolarów ma model zdolny do budowy exploitów.

Anthropic dał 201 pracownikom agenty, które wymieniały za nich książki.
Anthropic, Project Swap (24 września). 201 pracowników w sześciu biurach oddało agentom Claude wymianę książek między sobą. Rynek agentów osiągnął 0,55 punktu na skali, na której idealne dopasowanie według rankingów uczestników daje 0,89. 85 proc. straty wynikało z tego, że agent źle odczytał, czego chce jego właściciel. Anthropic
Co to znaczy: agent działający w imieniu klienta traci najwięcej przez złe odczytanie, czego klient chce. Kontrola jest potrzebna przy profilu klienta.
Case tygodnia

GitHub przepisał z pomocą agentów środowisko uruchomieniowe Copilota z TypeScriptu na Rust: około 430 tys. linii kodu w 14,5 tygodnia, pod kierunkiem jednego inżyniera.
GitHub przepisał środowisko uruchomieniowe agenta Copilot z TypeScriptu na Rust, z pomocą agentów. Opis ukazał się 16 września. Około 430 tys. linii TypeScriptu zamieniło się w 832 378 linii Rusta i 128 zmian scalonych z główną gałęzią kodu, w 14,5 tygodnia, od 12 maja do 21 sierpnia. Pracą kierował Stephen Toub. Według The Register, za jego wyliczeniem, tokeny kosztowały około 120 tys. dolarów, a jego praca zajęła około trzech tygodni. To rachunek za same tokeny, bez pracy innych osób przy przeglądach i testach. W teście tysiąca krótkich sesji przy 100 równoległych potokach nowa wersja w Ruście obsłużyła 15,9 raza więcej cykli na sekundę, 120 zamiast 7,55. Partia dziesięciu klientów zużyła 126 MB pamięci zamiast 1383. Po drodze zespół znalazł i naprawił dziesiątki regresji, czyli funkcji, które przed przepisaniem działały, a po nim przestały działać tak samo. Toub: „»If it compiles, it's correct« is useful only as a joke.” GitHub · The Register
Co to znaczy: przepisanie systemu, które według GitHuba wcześniej nie mieściło się w budżecie, w tym przypadku kosztowało 120 tys. dolarów za same tokeny. Pełny rachunek obejmuje jeszcze pracę ludzi przy przeglądach, testach i naprawie regresji. Przy planowaniu modernizacji starych systemów ten rachunek trzeba policzyć od nowa.
Niewypał tygodnia

British Transport Police testowała od lutego do lipca rozpoznawanie twarzy na londyńskich stacjach.
British Transport Police, według danych opublikowanych 29 września przez Liberty Investigates, testowała od lutego do lipca rozpoznawanie twarzy w czasie rzeczywistym na londyńskich stacjach kolejowych. 18 wdrożeń na dziewięciu stacjach, ponad pół miliona zeskanowanych twarzy, koszt 320 786 funtów i prawie 100 godzin pracy policjantów. System dał jeden alert i był to alert fałszywy. Żadnego zatrzymania z alertu. Policja przedłużyła test o cztery miesiące i rozszerza go na metro. Liberty Investigates · The Register
Lekcja: przed startem pilotażu trzeba zapisać, przy jakim wyniku się go kończy. BTP po sześciu miesiącach i jednym fałszywym alarmie test przedłużyła.

Ówczesny prezes Fideuram, spółki z grupy Intesa Sanpaolo, dostał w lutym wiadomości podszywające się pod prezesa Intesy i telefony od „prawnika” z głosem sklonowanym przez AI.
Drugi niewypał. 25 września agencja ANSA opisała oszustwo z lutego na Fideuram, spółce zależnej Intesa Sanpaolo. Ówczesny prezes Fideuram dostał na WhatsAppie wiadomości podszywające się pod prezesa Intesy, potem telefony od „prawnika” z głosem sklonowanym przez AI. Wysłał przelewy na prawie 95 mln euro. Fideuram zatrzymał 42 mln na kontach w Chinach, 13 mln zamrożono w banku w Portugalii, brakuje 39,5 mln euro. Klonowanie głosu jest dziś w ofercie dużych dostawców. 23 września, siedem miesięcy po oszustwie, Google udostępnił w modelu Gemini 3.8 Flash TTS klonowanie głosu z 30-sekundowej próbki, po nagraniu zgody właściciela głosu i z oznaczaniem wygenerowanych nagrań. W Europejskim Obszarze Gospodarczym ta funkcja jest wyłączona. ANSA · Google
Lekcja: znany głos w telefonie przestał potwierdzać tożsamość. Przelew powyżej progu wymaga oddzwonienia na numer z firmowej książki i drugiego podpisu, także gdy dzwoni prezes.
Z Polski

21 września prezydent Finlandii i premier Norwegii ogłosili przy ONZ apel o obowiązkowe testy najmocniejszych modeli AI przed wdrożeniem, niezależną ocenę i wspólne zgłaszanie incydentów.
Polska poza apelem o kontrolę modeli frontier. 21 września prezydent Finlandii Alexander Stubb i premier Norwegii Jonas Gahr Støre ogłosili przy Zgromadzeniu Ogólnym ONZ „A Call for Control of Frontier AI Models”. Apel wzywa do obowiązkowych testów modeli przed wdrożeniem, niezależnej oceny, wspólnych standardów i wspólnego zgłaszania poważnych incydentów. Na liście sygnatariuszy na stronie prezydenta Finlandii są dziś między innymi Niemcy, Francja, Hiszpania, Holandia, Estonia, Łotwa, Rumunia, Kanada, Australia i Komisja Europejska. Polski nie ma. Nie ma też USA, Chin, Wielkiej Brytanii i Włoch. Apel pozostaje otwarty na kolejne podpisy. Prezydent Finlandii · Rząd Norwegii
Werdykt: apel nie tworzy obowiązków prawnych, a Polska we wrześniu obsadziła własny organ nadzoru nad AI. Rząd powinien wyjaśnić brak podpisu albo go uzupełnić.

Centrum Projektów Polska Cyfrowa zamknęło 30 września nabór na budowę portalu i bezpiecznego środowiska testowego dla systemów AI: 35 mln zł, lider Ministerstwo Cyfryzacji.
35 mln zł w naborze na polską piaskownicę AI. 30 września zamknął się nabór Centrum Projektów Polska Cyfrowa na centralny portal polskiej piaskownicy AI i bezpieczne środowisko testowe, z dostępem do mocy obliczeniowej Cyfronetu i PCSS oraz wsparciem ekspertów. Budżet naboru to 35 mln zł z programu Fundusze Europejskie na Rozwój Cyfrowy, tryb niekonkurencyjny. Liderem jest Ministerstwo Cyfryzacji, partnerami Ministerstwo Rozwoju i Technologii, UODO, NASK, Cyfronet AGH i Poznańskie Centrum Superkomputerowo-Sieciowe. Ścieżka regulacyjna ma obsługiwać firmy i administrację, które budują systemy wysokiego ryzyka, ścieżka technologiczna urzędy i samorządy. CPPC
Werdykt: to budżet naboru, decyzji o dofinansowaniu jeszcze nie ogłoszono. Terminu naboru firm do testów nie ma, a firmy z systemami wysokiego ryzyka mogą już przygotować opis przypadku do zgłoszenia.
Benchmark tygodnia

NPCI, operator indyjskich płatności natychmiastowych, sprawdził 11 modeli na 799 przypadkach z bankowości detalicznej.
IndicBankBench (24 września) od NPCI, operatora indyjskich płatności natychmiastowych. 799 przypadków z bankowości detalicznej, 11 modeli, ocena w czterech etapach: bezpieczeństwo, działania i narzędzia, adekwatność odpowiedzi, jakość porady. Przy wymogu, żeby model poradził sobie z przypadkiem we wszystkich trzech próbach, modele zdają od 43,7 do 58,2 proc. Przy wymogu, żeby poradził sobie choć raz na trzy, od 60 do 74 proc. Przypadki, środowisko testowe i kod oceny są otwarte. Hugging Face Papers · GitHub
Druga pozycja. Vals AI zaktualizował 29 września ranking researchu prawnego na prawie amerykańskim: trzy najlepsze modele spełniają wszystkie punkty oceny w 55,29 proc. zadań. Średnia wszystkich 63 modeli przy pytaniach, które wymagają pogodzenia kilku źródeł prawa, wynosi 20,7 proc. Vals AI
Decyzja: asystenta, który obsługuje klientów albo pisze opinie, odbiera się na kryterium „poprawnie za każdym razem” w kilku próbach na własnych przypadkach. Liczenie sukcesu choć raz na trzy próby zawyża wynik o 11 do 21 punktów procentowych wobec wymogu sukcesu za każdym razem. Metodę NPCI można wziąć od razu, przypadki trzeba napisać własne.
Liczba tygodnia

20 września agent w laboratorium OpenAI połączył się z zewnętrznym chatbotem przez lukę w filtrowaniu DNS.
2 godziny i 32 minuty. 20 września agent w zadaniu treningowym OpenAI, w środowisku bez dostępu do internetu, połączył się z zewnętrznym chatbotem przez lukę w filtrowaniu zapytań DNS, czyli systemu, który zamienia nazwy domen na adresy. O 9:50 agent wykonał zapytanie. O 10:02 system monitorujący podniósł alarm najwyższego priorytetu. O 10:05 człowiek go potwierdził. O 12:34 przebieg zatrzymano ręcznie. Według raportu OpenAI przebieg nie zatrzymał się automatycznie, jak powinien, i nie było jasne, czy należy go zatrzymać. Po incydencie OpenAI wstrzymało trening, ewaluację i pracę z narzędziami najmocniejszych modeli do czasu sprawdzenia luk. OpenAI
Co to znaczy: monitor wykrył incydent po 12 minutach, a automatyczne zatrzymanie nie zadziałało wcale. W ćwiczeniu zatrzymania agenta trzeba mierzyć czas od alarmu do faktycznego zatrzymania.
Druga liczba: 90 i 85 proc. Według danych nadzorczych, które 22 września podała Claudia Buch, ponad 90 proc. banków nadzorowanych bezpośrednio przez EBC ma AI w działalności operacyjnej, 85 proc. używa generatywnej AI, a 64 proc. używa AI do zapobiegania oszustwom i cyberprzestępczości. EBC
Kalendarz
Evident AI Index for Banks 2026 – 6 października, omówienie wyników online 13 października. Piąta edycja rankingu 50 największych banków świata pod względem AI. Evident, zapowiedź · Wydarzenia Evident
State of AI Report 2026 – 8 października, coroczny raport Air Street Capital. Air Street
Polski Kongres AI – 28 i 29 października, Łódź; pierwszy dzień o finansach, drugi o administracji. Organizator
31 października – termin, do którego banki nadzorowane bezpośrednio przez EBC składają plany działań wobec cyberzagrożeń napędzanych AI. List EBC, PDF
The Hack Summit 2026 – 5 listopada online, 6 listopada na PGE Narodowym w Warszawie. Organizator
Governance w pigułce

Od 30 września we Włoszech, gdy szkoda wynika z naruszenia obowiązku z unijnego aktu o sztucznej inteligencji, związek przyczynowy jest domniemany, chyba że pozwany wykaże inaczej.
30 września wszedł we Włoszech w życie dekret ustawodawczy wykonujący akt o sztucznej inteligencji, D.Lgs. 160/2026. Gdy szkoda wynika z naruszenia obowiązku z tego aktu, związek przyczynowy między naruszeniem a szkodą jest domniemany, chyba że pozwany wykaże inaczej. Brak środków bezpieczeństwa albo nadzoru człowieka w systemie wysokiego ryzyka, z którego wynika zagrożenie dla życia lub zdrowia, jest przestępstwem zagrożonym karą od roku do pięciu lat więzienia. Gazzetta Ufficiale · Giuricivile
Decyzja: firma, która wdraża we Włoszech system wysokiego ryzyka, ma w dokumentacji zgodności główny dowód w sporze o odszkodowanie i musi ją prowadzić na bieżąco, z datami i nazwiskami.
Ciekawostka

1 października 1971 roku w londyńskim szpitalu Atkinson Morley's radiolog James Ambrose zbadał pacjentkę z podejrzeniem guza płata czołowego pierwszym tomografem komputerowym.
Dziś mija 55 lat od pierwszego badania tomografem komputerowym. 1 października 1971 roku radiolog James Ambrose w szpitalu Atkinson Morley's w Londynie zbadał pacjentkę z podejrzeniem guza płata czołowego skanerem, który Godfrey Hounsfield zbudował w firmie EMI. Obraz przekroju głowy pierwszy raz policzył komputer. Hounsfield dostał za to Nagrodę Nobla w 1979 roku, razem z Allanem Cormackiem. AAPM
Polecam

„The Goal” Eliyahu Goldratta i Jeffa Coxa to powieść o kierowniku fabryki, który ma 90 dni na uratowanie zakładu.
Eliyahu M. Goldratt, Jeff Cox, „The Goal”, North River Press, pierwsze wydanie 1984, wydanie na 30-lecie z esejem Goldratta „Standing on the Shoulders of Giants”.
Powieść o kierowniku fabryki, który ma 90 dni na uratowanie zakładu. Z rozmów z dawnym profesorem dowiaduje się, że wydajność pojedynczej maszyny nie ma znaczenia, jeśli fabryka jako całość nie dowozi gotowych produktów, a o tempie całości decyduje najwolniejsze miejsce w procesie. W tej powieści Goldratt przedstawił teorię ograniczeń. Cena za milion tokenów to wydajność pojedynczej maszyny. Firmę rozlicza się z kosztu gotowego, sprawdzonego zadania. North River Press
Zdanie tygodnia
Przebieg nie zatrzymał się automatycznie, tak jak powinien.
Raport OpenAI o incydencie z 20 września, zaktualizowany 25 września 2026. W oryginale: „the run did not stop automatically as expected”.
Domknięcie
Jeśli liczycie koszt jednego zadania w swoich procesach, odpiszcie, jak to robicie.
Bartosz
