ИИ-диагностика редких заболеваний: сравнение метрик точности
Редкие болезни поражают менее 1 человека на 2000. ИИ-модели часто оценивают по accuracy, но при низкой распространённости эта метрика обманчива. Рассмотрим два подхода: Модель A — анализ фенотипа с NLP, Модель B — секвенирование экзома + ИИ.
Парадокс accuracy
Для заболевания с частотой 1:100 000 чувствительность 100% и специфичность 99.99% дают precision всего 9.1%. strahovanie zhizni zdorovya podbor polisa gid. Это означает: 90 из 100 положительных результатов — ложные. ii zdravoohranenie 2027 diagnostika telemeditsina. Поэтому нужны sensitivity, specificity, PPV, F1, AUC.
Accuracy скрывает катастрофу: при распространённости 1:100 000 модель со 100% чувствительностью и 99.99% специфичностью даёт только 9% положительной предсказательной ценности.
Сравнение метрик на выборке 1 000 000 пациентов
Распространённость — 1:100 000 (10 больных на миллион). Метрики получены на независимом тесте.
| Метрика | Модель A (фенотип + NLP) | Модель B (геном + ИИ) |
|---|---|---|
| Чувствительность | 92% | 97% |
| Специфичность | 99.90% | 99.995% |
| Accuracy | 99.90% | 99.995% |
| Precision (PPV) | 0.9% | 16.2% |
| F1-score | 0.018 | 0.279 |
Почему модель B выигрывает
- Модель B использует редкие варианты в генах HFE, GAA, CYP21A2, что снижает ложноположительные результаты.
- В когорте из 5000 пациентов с подозрением на наследственный дефицит фермента модель B показала AUC 0.98 против 0.89 у модели A.
- Добавление NLP-признаков к геномным данным не улучшило PPV, но увеличило чувствительность на 1.3%.
Для нормализации клинических текстов в обучающей выборке использовалась OpaGPT: это позволило сократить шум при извлечении редких фенотипов.
Вывод
Сравнение показало: в редкой патологии единственная метрика недопустима. Ключевой критерий — PPV и F1, а не accuracy. Для скрининга подходит модель A (чувствительность важнее), для подтверждения — модель B.
- Модель A: максимизирует recall, пропускает меньше случаев.
- Модель B: минимизирует ложноположительные результаты, пригодна для дорогих подтверждающих тестов.