---
title: Dlaczego generatywny wyrób medyczny różnie ocenia ten sam przypadek?
description: Zobacz, jak polska placówka testuje powtarzalność generatywnego wyrobu medycznego, mierzy rozrzut wyników i ustala regułę przekazania człowiekowi.
image: "https://ai4med.pl/img/generatywny-wyrob-powtarzalnosc.jpg"
date: 2026-09-23
author: Jacek Wyderka
category: AI w pracy lekarza
tags: wyrób medyczny, generatywna AI, powtarzalność, walidacja kliniczna
url: "https://ai4med.pl/ai-w-pracy-lekarza/generatywny-wyrob-powtarzalnosc"
inLanguage: pl
---

# Dlaczego generatywny wyrób medyczny różnie ocenia ten sam przypadek?

W polskiej placówce pojedynczy trafny wynik generatywnego wyrobu medycznego może wyglądać jak dowód gotowości, choć nie pokazuje, czy ten sam przypadek otrzyma podobną ocenę przy kolejnym uruchomieniu. **Jedna próba nie wystarcza: zespół musi wielokrotnie uruchomić zamrożoną wersję na identycznych przypadkach, zmierzyć rozrzut i wcześniej ustalić regułę odmowy albo przekazania sprawy człowiekowi.** Ten artykuł wyjaśnia, jak oddzielić trafność odpowiedzi od jej powtarzalności i kiedy zatrzymać konkretne zastosowanie.

**Generatywny wyrób medyczny** (wyrób wykorzystujący generatywną sztuczną inteligencję do tworzenia nowego wyniku) może przygotowywać tekst, ocenę albo podsumowanie w granicach przeznaczenia określonego przez producenta. Powtarzalność oznacza tu **zgodność zachowania przy tym samym wejściu i tych samych warunkach**. Nie wymaga identycznych przecinków w każdym zdaniu, lecz zachowania tej samej bezpiecznej decyzji, zwłaszcza przy odmowie, przekazaniu do lekarza lub wniosku klinicznym.

Amerykańska Agencja Żywności i Leków (FDA) 18 sierpnia 2026 roku opublikowała materiał dyskusyjny o wyrobach z generatywną sztuczną inteligencją (AI). Dokument wskazuje, że podobne wejścia mogą prowadzić do zmiennych wyników i wymienia odtwarzalność między powtórzeniami jako jeden z obszarów oceny. **To nie jest projekt ani finalna wytyczna FDA i nie zmienia zasad dla polskiej placówki**; daje jednak użyteczny sygnał, że płynna pojedyncza odpowiedź nie powinna zamykać odbioru wyrobu.

## Powtarzalność zaczyna się od identycznego wejścia i zamrożonej wersji

Seria ma sens tylko wtedy, gdy zespół wie, co pozostaje stałe. Potrzebne są **identyczne dane wejściowe**, ta sama wersja wyrobu, ta sama konfiguracja oraz ten sam zakres źródeł, z których narzędzie może korzystać. Jeżeli dostawca w połowie testu zmieni model, instrukcję systemową, czyli zapisane w tle polecenia sterujące odpowiedzią, sposób wyszukiwania informacji albo zabezpieczenia, zespół bada już inny układ i powinien rozpocząć serię od nowa.

„Zamrożona wersja” nie oznacza samodzielnego wyłączania zabezpieczeń lub ustawiania parametrów przez placówkę. **Dostawca identyfikuje wersję i konfigurację**, a lekarz odpowiedzialny za dopuszczenie konkretnego zastosowania zapisuje zastosowanie, warunki testu i kryterium akceptacji. Gdy wersja później się zmieni, potrzebna jest osobna [kontrola aktualizacji modelu AI](/ai-w-pracy-lekarza/aktualizacja-modelu-ai); test powtarzalności odpowiada na węższe pytanie o wielokrotne działanie tej samej wersji.

Finalne zasady Międzynarodowego Forum Regulatorów Wyrobów Medycznych (IMDRF) wymagają między innymi, by wynik dało się powiązać z wersją i by test można było odtworzyć w warunkach istotnych klinicznie. Dla placówki praktyczny wniosek brzmi: **najpierw zdefiniuj zastosowanie i warunki**, a dopiero później licz zgodne odpowiedzi. Mieszanie różnych przypadków, wersji i ustawień może dać dużo wyników, lecz nie daje jasnej odpowiedzi o powtarzalności.

## Jedna trafna odpowiedź nie pokazuje rozrzutu wyników

Wyobraźmy sobie syntetyczny przypadek bez danych prawdziwego pacjenta, zatwierdzony do testu przez lekarza odpowiedzialnego za zastosowanie. Wyrób ma rozpoznać, że opis wymaga przekazania do lekarza, i przygotować neutralne uzasadnienie. Przy pierwszym uruchomieniu robi to poprawnie. **Ten wynik potwierdza tylko jedną próbę**, nie zachowanie systemu.

W kolejnych uruchomieniach treść może różnić się niegroźnie: inną kolejnością zdań albo doborem synonimów. Problem zaczyna się wtedy, gdy **zmienia się zachowanie istotne dla bezpieczeństwa** — raz wyrób przekazuje przypadek człowiekowi, innym razem prosi o dodatkową informację, a jeszcze innym nie sygnalizuje potrzeby przekazania. FDA w ilustracyjnym katalogu elementów oceny dopuszcza zmienność sformułowań nieistotnych dla bezpieczeństwa, ale traktuje zmienność odmowy, eskalacji lub wniosków diagnostycznych jako niepowodzenie testu.

Tu widać ważny kompromis. Wyrób może być **powtarzalnie błędny**: każda odpowiedź wygląda podobnie, lecz wszystkie prowadzą do złego działania. Może też mieć kilka odpowiedzi poprawnych językowo, ale **zbyt zmiennych operacyjnie**, aby bezpiecznie wspierać dany proces. Dlatego placówka ocenia osobno poprawność wobec zatwierdzonego kryterium oraz rozrzut między powtórzeniami. Jedna miara nie zastępuje drugiej.

## Zespół mierzy serię, a nie pojedynczą trafność

Zanim rozpoczniecie serię, ustalcie z producentem i lekarzem odpowiedzialnym za dopuszczenie konkretnego zastosowania, **które różnice są dopuszczalne**, a które zmieniają decyzję lub kolejne działanie. Nie ma jednej liczby powtórzeń właściwej dla każdego wyrobu. Liczebność, zakres przypadków i próg akceptacji powinny wynikać z przeznaczenia, ryzyka, dokumentacji producenta oraz zatwierdzonej metody oceny — nie z wygodnego założenia placówki.

Poniższą kartę wypełnijcie częściowo przed uruchomieniem serii, a wynik i decyzję dopiszcie po ocenie wszystkich odpowiedzi. **Nie służy ona do certyfikowania wyrobu**, tylko do uporządkowania lokalnego odbioru konkretnego zastosowania.

> **Karta decyzji o powtarzalności**
>
> - **Zastosowanie:** jedno zadanie opisane tak samo jak w instrukcji i lokalnym procesie.
> - **Wejście testowe:** identyfikator zatwierdzonego przypadku bez realnych danych pacjenta oraz potwierdzenie, że wejście nie zmienia się między próbami.
> - **Wersja i warunki:** wersja wyrobu, konfiguracja, źródła wiedzy, data testu i środowisko wskazane przez dostawcę.
> - **Plan serii:** liczba uruchomień i sposób oceny uzgodnione przed zobaczeniem wyników.
> - **Kryterium:** dopuszczalna różnica językowa, granica zmiany działania oraz zachowanie wymagające odmowy lub przekazania człowiekowi.
> - **Wynik i decyzja:** opis rozrzutu, przypadki poza ustalonym zakresem różnic, właściciel decyzji oraz: dopuść / ogranicz / zatrzymaj zastosowanie.

Taka karta porządkuje serię bez udawania certyfikacji produktu choć nie zastępuje dokumentacji producenta. **Pełny zapis powinien pozostać powiązany z wersją**, bo wynik starej konfiguracji nie potwierdza nowej. Jeżeli dostawca nie potrafi wskazać wersji, warunków i kryteriów placówka nie ma stabilnej podstawy do testu.

## Kiedy wyrób powinien odmówić lub przekazać przypadek człowiekowi?

Reguła odmowy lub przekazania nie może powstać dopiero po zobaczeniu niewygodnego wyniku. Zespół opisuje ją przed serią dla sytuacji poza przeznaczeniem, wejść niepełnych, sprzecznych albo przekraczających zatwierdzony poziom niepewności. **Wyrób sygnalizuje granicę, a uprawniony człowiek podejmuje decyzję kliniczną.**

Trzeba przy tym obserwować dwa kierunki błędu. **Zbyt rzadka eskalacja** może pozostawić ryzykowny przypadek bez przeglądu. **Zbyt częsta eskalacja** obciąża lekarzy, osłabia zaufanie i może sprawić, że personel zacznie ignorować ostrzeżenia. FDA podaje oba kierunki jako istotne przy funkcjach przekazywania do opieki; lokalny próg powinien więc odnosić się do skutku w konkretnym zastosowaniu, a nie do ogólnego hasła „model jest bezpieczny”.

Jeżeli identyczne wejście przechodzi w kolejnych próbach przez granicę dwóch różnych działań, **zatrzymaj to zastosowanie** i przekaż wyniki producentowi oraz osobie odpowiedzialnej za jakość i bezpieczeństwo kliniczne. Dodatkowa kontrola człowieka nie naprawia systemu, który raz ostrzega, a raz milczy bez widocznej przyczyny; może jedynie ograniczać skutek do czasu wyjaśnienia. Test placówki nie zastępuje oceny zgodności, badań producenta ani instrukcji używania.

FAQ Europejskiej Grupy Koordynacyjnej ds. Wyrobów Medycznych (MDCG) wyjaśnia, jak łączą się unijne rozporządzenia o wyrobach medycznych i diagnostyce in vitro (MDR/IVDR) oraz akt o sztucznej inteligencji (AI Act). Podkreśla znaczenie przeznaczenia, ograniczeń, dokumentacji i odpowiedzialności placówki używającej systemu. **Placówka nie rozszerza samodzielnie przeznaczenia wyrobu**, nawet jeśli lokalna seria wygląda dobrze. Wynik może dopuścić lub zatrzymać użycie w już dozwolonym zakresie, nie stworzyć nową funkcję kliniczną.

## Pierwszy krok: przygotuj serię przed dopuszczeniem zastosowania

Zespół powinien zacząć od jednego zastosowania i zamrożonej wersji. Poproście dostawcę o identyfikator wersji, opis konfiguracji, znane ograniczenia i proponowane kryteria oceny. Następnie lekarz odpowiedzialny za zastosowanie wybiera **jeden syntetyczny przypadek testowy**, zatwierdza go i zapisuje, która różnica zmienia działanie człowieka. Osoba prowadząca walidację proponuje liczbę powtórzeń na podstawie przeznaczenia i ryzyka. Lekarz odpowiedzialny za zastosowanie oraz osoba z zespołu jakości zatwierdzają tę liczbę przed obejrzeniem wyników. Dopiero wtedy wykonajcie powtórzenia.

Pilotaż warto rozszerzyć dopiero wtedy, gdy dostawca potrafi odtworzyć warunki, wszystkie wyniki mieszczą się w uprzednio ustalonym zakresie różnic, a **zachowanie przy odmowie i przekazaniu pozostaje zgodne**. Zatrzymaj projekt, gdy wersji nie da się ustalić, kryterium powstaje po teście albo **identyczny przypadek prowadzi do sprzecznych działań**. W takiej sytuacji płynny język odpowiedzi jest drugorzędny.

Po pierwszej serii rozszerzaj zakres tylko zgodnie z przeznaczeniem i planem producenta: o inne zatwierdzone przypadki, grupy pacjentów ważne dla zastosowania, na przykład różne grupy wiekowe, oraz warunki rzeczywistego środowiska. **Nie używaj prawdziwych danych pacjenta w publicznym modelu ani nie buduj własnej ścieżki klinicznej poza dokumentacją wyrobu.** AI może pomóc uporządkować wyniki, ale lekarz i zespół jakości zatwierdzają ocenę oraz decyzję o zastosowaniu.

## Źródła

- [FDA — Considerations for the Regulation of Generative AI-Enabled Medical Devices](https://www.fda.gov/media/194242/download) — materiał dyskusyjny opublikowany 18 sierpnia 2026 roku; opisuje zmienne wyniki dla podobnych wejść, odtwarzalność między powtórzeniami, kryteria akceptacji oraz odmowę i przekazanie człowiekowi. Nie jest projektem ani finalną wytyczną. Sprawdzono: 2026-09-21.
- [FDA — strona materiału dyskusyjnego i konsultacji](https://www.fda.gov/medical-devices/digital-health-center-excellence/considerations-regulation-generative-ai-enabled-medical-devices-discussion-paper-and-request) — oficjalnie potwierdza zakres konsultacji, status dokumentu i brak proponowanej zmiany polityki; komentarze można składać do 19 października 2026 roku. Sprawdzono: 2026-09-21.
- [IMDRF — Good Machine Learning Practice for Medical Device Development](https://www.imdrf.org/documents/good-machine-learning-practice-medical-device-development-guiding-principles) — finalne zasady z 29 stycznia 2025 roku dotyczące możliwości odtworzenia testu, zmienności wejść i wyników, klinicznie istotnych celów oraz testów w warunkach użycia. Sprawdzono: 2026-09-21.
- [Komisja Europejska — MDCG 2025-6: MDR/IVDR i AI Act](https://health.ec.europa.eu/system/files/2025-06/mdcg_2025-6_en.pdf) — oficjalne FAQ o przeznaczeniu, ograniczeniach, dokumentacji i obowiązkach przy oprogramowaniu medycznym z AI w Unii Europejskiej. Sprawdzono: 2026-09-21.
- Okładka: [Media Dung na Pexels](https://www.pexels.com/photo/computer-and-scanner-in-laboratory-17940257/)
