Definizione
Un imbalanced dataset è un insieme di dati in cui le classi non sono distribuite equamente, ovvero una o più classi sono molto più rappresentate rispetto alle altre. Questo fenomeno è comune nei problemi di classificazione, dove una classe è dominante rispetto alle altre, portando a modelli di intelligenza artificiale che tendono a favorire la classe più rappresentata e trascurare quelle meno frequenti.
Uno squilibrio eccessivo può causare problemi come:
- Bias del modello: l’algoritmo apprende a predire quasi sempre la classe dominante.
- Bassa sensibilità sulle classi minoritarie: i casi rari vengono ignorati o predetti in modo errato.
- Scarsa generalizzazione: il modello può non adattarsi bene a nuovi dati reali.
Per affrontare un dataset sbilanciato, si possono usare tecniche come l’aumento artificiale della classe minoritaria, la riduzione dei dati della classe dominante o l’assegnazione di un peso maggiore agli esempi della classe minoritaria durante l’addestramento.
Applicazioni in Medicina
- Diagnosi di malattie rare: dataset con pochi casi di una patologia (es. tumori rari) rispetto alla popolazione sana.
- Predizione di eventi clinici: riconoscimento precoce di condizioni critiche come sepsi o arresto cardiaco, che si verificano raramente ma con conseguenze gravi.
- Screening di pazienti a rischio: sistemi predittivi per malattie come il diabete o l’Alzheimer, che devono individuare pochi casi tra migliaia di soggetti sani.