«Комічно погані» набори даних, що використовуються для навчання клінічних моделей інсульту та діабету

Гортаючи онлайн-базу даних зображень, Adrian Barnett, статистик з Технологічного університету Квінсленда в Австралії, звернув увагу на кілька знайомих обличь. Сильвестр Сталлоне в ролі Рембо, а потім знову на червоній доріжці. «Це просто смішно», – сказав Barnett. Джордж Клуні, Анджеліна Джолі та Деніел Крейг з’являються не один раз, часто з одним і тим самим зображенням.
Цей конкретний набір даних, зібраний у папці під назвою «droopy» та розміщений у репозиторії з відкритим кодом під назвою Kaggle, лежить в основі статті, опублікованої в Scientific Reports – не як гра в пошук знаменитостей, а як навчальний набір для прогностичної клінічної моделі раннього виявлення інсультів.
Ця стаття є найновішим прикладом набагато ширшої проблеми, яку Barnett та його аспірант Alexander Gibson задокументували за допомогою Kaggle. Дослідивши два інші набори даних Kaggle про інсульт та діабет, обидва з яких включали табличні дані пацієнтів, Гібсон і Барнетт простежили, як дані переміщуються через наукову літературу, а в деяких випадках і до клінічного використання. Їхня робота, описана в препринті, опублікованому на medRxiv у лютому 2026 року, вже призвела до кількох відкликань статей, що використовують ці сумнівні набори даних.
Джерело https://retractionwatch.com/2026/05/18/kaggle-dataset-clinical-models-stroke-diabetes/
Ще одна гучна справа зацікавила науковців. Прочитати зараз


