Image

«Комічно погані» набори даних, що використовуються для навчання клінічних моделей інсульту та діабету


Гортаючи онлайн-базу даних зображень, Adrian Barnett, статистик з Технологічного університету Квінсленда в Австралії, звернув увагу на кілька знайомих обличь. Сильвестр Сталлоне в ролі Рембо, а потім знову на червоній доріжці. «Це просто смішно», – сказав Barnett. Джордж Клуні, Анджеліна Джолі та Деніел Крейг з’являються не один раз, часто з одним і тим самим зображенням.

Цей конкретний набір даних, зібраний у папці під назвою «droopy» та розміщений у репозиторії з відкритим кодом під назвою Kaggle, лежить в основі статті, опублікованої в Scientific Reports – не як гра в пошук знаменитостей, а як навчальний набір для прогностичної клінічної моделі раннього виявлення інсультів.

Ця стаття є найновішим прикладом набагато ширшої проблеми, яку Barnett та його аспірант Alexander Gibson задокументували за допомогою Kaggle. Дослідивши два інші набори даних Kaggle про інсульт та діабет, обидва з яких включали табличні дані пацієнтів, Гібсон і Барнетт простежили, як дані переміщуються через наукову літературу, а в деяких випадках і до клінічного використання. Їхня робота, описана в препринті, опублікованому на medRxiv у лютому 2026 року, вже призвела до кількох відкликань статей, що використовують ці сумнівні набори даних.

Джерело https://retractionwatch.com/2026/05/18/kaggle-dataset-clinical-models-stroke-diabetes/

Ще одна гучна справа зацікавила науковців. Прочитати зараз

technology-center-pc_logo.png

вул. Шатилова дача, 4, оф. 702 (8 пов.),
м. Харків, Україна, 61165
ЄДРПОУ 31886700
ISNI: 0000 0005 1088 6447
Ringgold ID: 574078
ROR ID: https://ror.org/046wj6g23

+380 (57) 7508990
+380 (50) 3033801

Image
Image
Image
Image