В работах, где точность алгоритмов оценивали отдельно для разных фототипов, на темной коже снижались специфичность и общая диагностическая точность и увеличивалась частота ложноположительных результатов.
Большинство наборов данных для дерматологических систем искусственного интеллекта состояли преимущественно из изображений кожи I–III фототипов по Фитцпатрику, тогда как V–VI фототипы были представлены ограниченно. Среди исследований, в которых проводили анализ по подгруппам, алгоритмы показывали меньшую точность на более темной коже. Результаты исследования опубликованы в журнале «Исследования кожи и технологии» (Skin Research and Technology).
Авторы провели обзор исследований, опубликованных с января 2020 по ноябрь 2025 года. В анализ включали работы, в которых искусственный интеллект или глубокое обучение применяли для диагностики заболеваний кожи у людей и сообщали как минимум один показатель диагностической эффективности.
Из 550 найденных публикаций после удаления дубликатов осталось 508, 122 работы прошли полнотекстовую оценку, а окончательным критериям соответствовали 16 исследований. В них изучали алгоритмы для диагностики воспалительных заболеваний кожи, доброкачественных и злокачественных новообразований, меланоцитарных поражений, акне и других дерматологических состояний.
Информацию о фототипе или оттенке кожи приводили 13 из 16 исследований, однако способы классификации существенно различались. В большинстве наборов данных преобладали I–III фототипы по Фитцпатрику. V–VI фототипы включали значительно реже, иногда только в небольшие валидационные выборки.
Расу и этническую принадлежность участников указывали еще менее последовательно. В исследованиях использовали широкие категории, например «азиаты», «европеоиды» или «местное население». Только в одной работе отдельно были представлены чернокожие африканские пациенты с VI фототипом. Ни одно из 16 исследований не сообщало отдельно о пациентах, идентифицированных как Hispanic или Latino.
Диагностическую эффективность ИИ в зависимости от фототипа или демографической группы анализировали лишь в нескольких исследованиях. В этих работах на более темных фототипах отмечали снижение специфичности, увеличение числа ложноположительных результатов и более низкую общую диагностическую точность. Однако небольшое число исследований с таким анализом не позволило количественно оценить величину различий для дерматологических ИИ-систем в целом.
Авторы заключили, что недостаточное представительство темных фототипов и отсутствие стандартизированного описания демографических характеристик пока ограничивают возможность оценить точность и применимость дерматологических систем искусственного интеллекта для разных групп пациентов.