Zgodność z unijnym AI Act a AI do diagnozy medycznej: co naprawdę mówią przepisy
AI do diagnozy medycznej sprzedaje się szybciej, niż regulatorzy są w stanie je sprawdzić. Trzy niedawne badania wskazują na ten sam problem: modele trudno zweryfikować, trudno zabezpieczyć i trudno zmierzyć.

Pytanie regulacyjne nie brzmi, czy AI potrafi diagnozować. Brzmi, czy ktokolwiek potrafi dowieść, jak dobrze to robi. Dwie prace opublikowane w odstępie kilku miesięcy pokazują, jak bardzo ta luka się rozszerzyła.
24 czerwca 2026 roku zespół z Uniwersytetu Technicznego w Monachium opisał w Nature, że modele AI używane do diagnozy są podatne na ataki wnioskowania o członkostwie (MIA). To zapytania, które próbują ustalić, czy dokumentacja konkretnego pacjenta wchodziła w skład zbioru treningowego. The Register opisał tę pracę tego samego dnia. Badacze przetestowali siedem medycznych zbiorów danych AI: obrazy, zapisy EKG i ogólne elektroniczne dokumentacje zdrowotne. Wniosek: pojedynczych pacjentów można zidentyfikować z niemal doskonałym powodzeniem ataku, jak określili to autorzy.
To problem z prywatnością. To także problem z pomiarem. Standardowy protokół oceny mierzy powodzenie ataku zbiorczo, po wszystkich rekordach. Niemal doskonałych wskaźników dla pojedynczych pacjentów nie ujmuje należycie. Mówiąc wprost, audyt podający średnią może całkowicie pominąć przypadek jednostkowy.
Czego wymagają przepisy, a co im umyka
Unijny AI Act to rama najczęściej przywoływana w tej debacie, a materiały źródłowe są tu ubogie w szczegóły operacyjne. Źródła pokazują jednak lukę między językiem zgodności, którym posługują się dostawcy, a badaniami nad bezpieczeństwem publikowanymi w tym samym okresie.
Projekt na GitHubie, srta-ai-accountability, opisuje siebie jako pierwszy system odpowiadający na pytania „dlaczego” w wyjaśnialnej AI, ze 94% zgodności z unijnym AI Act. Jest wyraźnie oznaczony jako prototyp badawczy i architektura koncepcyjna. Taki jest stan przynajmniej części narzędzi rozliczalności: deklaracja 94% zgodności opublikowana w repozytorium kodu, bez organu regulacyjnego stojącego za tą liczbą.
Praca z Monachium wskazuje inny kierunek. Jej autorzy chcą zmiany standardów raportowania audytów prywatności AI, tak by liczyło się ryzyko na poziomie jednostki, a nie tylko ryzyko zbiorcze. Zalecają też ramy prywatności różnicowej, które mają matematycznie gwarantować anonimowość danych treningowych. Sugerują również, by dane treningowe kompilować tak, aby grupy niedostatecznie reprezentowane były reprezentowane lepiej.
Główny autor, Moritz Knolle, powiedział The Register, że ryzyko prywatności związane z MIA rośnie, gdy kohorta treningowa modelu staje się bardziej szczegółowa. Podał przykład członkostwa w zbiorze treningowym, które zdradza, że ktoś ma uśpioną chorobę genetyczną, taką jak choroba Huntingtona, depresję, albo że uczęszczał do konkretnej specjalistycznej kliniki leczenia.
Twierdzenia o dokładności, które regulatorzy będą musieli zważyć
Skuteczność diagnostyczna to druga połowa problemu regulacyjnego, a liczby są tu wyjątkowo nieuporządkowane.
Microsoft ogłosił swój AI Diagnostic Orchestrator (MAI-DxO) 30 czerwca 2025 roku. GeekWire podał, że narzędzie pokonało 21 doświadczonych lekarzy ze Stanów Zjednoczonych i Wielkiej Brytanii w złożonych przypadkach z New England Journal of Medicine, uzyskując 85,5% wobec 20% u lekarzy. WIRED, opisując tę samą pracę 1 lipca 2025 roku, podał 80% wobec 20% i stwierdził, że system obniżył koszty o 20% dzięki wybieraniu tańszych badań. Zestaw testowy zbudowano z 304 ostatnich przypadków NEJM.
Te liczby mają zastrzeżenie, które pojawia się w obu relacjach. Lekarze w badaniu nie mogli konsultować się z kolegami ani korzystać z zewnętrznych źródeł, co nie odpowiada temu, jak pracują klinicyści. Naukowiec z MIT David Sontag powiedział WIRED, że ustalenia Microsoftu należy traktować ostrożnie właśnie z tego powodu i że dopiero się okaże, czy system obniżyłby koszty w praktyce. Sam Microsoft stwierdził, że narzędzie wymagałoby testów klinicznych i zgody regulacyjnej przed wdrożeniem.
Jest jeszcze przypadek porażki. 15 kwietnia 2026 roku The Register opisał badanie w JAMA Network Open prowadzone przez studenta medycyny Harvardu Aryę Rao. Przetestowano w nim 21 wiodących gotowych modeli AI na 29 standaryzowanych winietach klinicznych. Modele odpowiadały poprawnie w 91% przypadków, gdy pytano o ostateczną diagnozę przy pełnych informacjach. Ale we wczesnej diagnozie różnicowej, na etapie, gdy klinicyści włączają i wykluczają schorzenia, zawodziły w ponad 8 na 10 przypadków.
Każdy testowany przez nas model zawiódł w zdecydowanej większości przypadków, powiedział Rao The Register. To etap, na którym niepewność liczy się najbardziej, i właśnie tu te systemy są najsłabsze.
Radiolog ze szpitala Massachusetts General Hospital, dr Marc Succi, współautor pracy, powiedział temu samemu pismu, że dzisiejszym gotowym modelom nie należy ufać w rozumowaniu diagnostycznym kierowanym do pacjenta bez ustrukturyzowanego, wszechstronnego przeglądu przez człowieka. Dodał też, że wyższe wskaźniki powodzenia w ostatecznej diagnozie nie powinny uspokajać, bo prawdziwe rozumowanie kliniczne zaczyna się wcześniej, gdy niejednoznaczność jest największa.
Co musiałby testować regulator
Zestaw trzy ustalenia obok siebie, a problem audytu staje się konkretny.
- Prywatność: pojedynczych pacjentów w zbiorze treningowym można zidentyfikować z wysokim powodzeniem, a grupy niedostatecznie reprezentowane łatwiej niż inne. Raportowanie zbiorcze to ukrywa.
- Skuteczność: ta sama klasa modelu może uzyskać 91% w ostatecznej diagnozie i zawieść w ponad 80% wczesnych przypadków różnicowych.
- Projekt testu: nagłówkowy wynik Microsoftu pochodzi z testu, w którym ludzcy lekarze pracowali bez zasobów, z których normalnie korzystają.
Nic z tego nie znaczy, że medycznej AI nie da się regulować. Znaczy, że obecne instrumenty mierzą niewłaściwą jednostkę. Zbiorczy wskaźnik prywatności, skuteczność ostatecznej odpowiedzi i test przeprowadzony w sztucznych warunkach łatwo opublikować, a trudno podważyć.
Knolle powiedział, że ma nadzieję, iż środowisko medycznej AI zacznie poważnie traktować ryzyko prywatności, a techniki jego ograniczania będą stosowane tam, gdzie są konieczne. Zauważył też, że w wielu sytuacjach udany MIA oznacza niewielkie lub pomijalne naruszenie prywatności, na przykład w modelach trenowanych na dużych, ogólnych populacjach.
Nierozstrzygnięte pozostaje, kto decyduje, w której z tych sytuacji znajduje się dany model. Zgodnie z unijnym AI Act ta decyzja należy do dostawcy i audytora, nie do autorów pracy i nie do repozytorium, które samo wystawia sobie ocenę 94%.
Źródła
5- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 05srta-ai-accountability: AI Accountability FrameworkEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.