Jak przeciek danych zmienia przeciętną AI w model wyglądający na kliniczny przełom

Jak przeciek danych zmienia przeciętną AI w model wyglądający na kliniczny przełom

Model może „rozpoznać pacjenta”, zamiast nauczyć się rozpoznawać chorobę. Jeżeli dane tej samej osoby trafiają do treningu i testu, wynik AI może być sztucznie wysoki; podział należy wykonywać na poziomie pacjenta i niezależnego ośrodka.

Punktem wyjścia jest Methods of Information in Medicine, DOI 10.1055/a-2938-1280. Protokół ewaluacyjny i audyt benchmarku DAIC-WOZ/DAIC dotyczący participant leakage. W medycznych zbiorach jedna osoba często ma wiele nagrań, obrazów, wizyt lub segmentów sygnału. Losowy podział plików może umieścić materiał tej samej osoby w treningu i teście, tworząc participant leakage.

Najważniejsze jest jednak rozdzielenie wyniku technicznego lub pośredniego od wyniku ważnego dla pacjenta. Model korzysta wtedy z cech tożsamości, urządzenia lub sesji, których nie będzie miał u nowego pacjenta. Rzetelna walidacja wymaga rozdzielenia pacjentów, zamrożonego zbioru testowego, audytu duplikatów i najlepiej zewnętrznego ośrodka.

Czego z tych danych nie wolno wywnioskować? Analiza dotyczy określonego benchmarku i protokołu, a nie wszystkich modeli klinicznych. Usunięcie leakage nie rozwiązuje innych problemów: driftu, biasu, jakości etykiet i braku użyteczności klinicznej. Dobra walidacja techniczna nadal nie zastępuje badania wpływu na opiekę. Nie powinno się porównywać wyników modeli bez sprawdzenia, jak zbudowano zbiory treningowe i testowe.

W praktyce oznacza to następujące postępowanie: Przy zakupie lub publikowaniu AI należy wymagać informacji o jednostce podziału danych, duplikatach, pacjentach z wielu wizyt, niezależnym teście i powiązaniu etykiet z praktyką kliniczną. W rozmowie warto nazwać oczekiwany efekt, alternatywy, koszt, ryzyko oraz to, po jakim czasie decyzja będzie ponownie oceniona.

Medycyna oparta na dowodach nie polega na odrzucaniu nowości. Polega na dopasowaniu siły komunikatu do siły danych. Zanim uwierzysz w rekordową metrykę, zapytaj: czy ten sam pacjent pojawił się po obu stronach podziału materiału badanego?

Źródło: Methods of Information in Medicine, DOI 10.1055/a-2938-1280

Autor: prof. dr hab. n. med. Krzysztof Łukaszuk