Definizione
L’apprendimento semi-supervisionato è una tecnica di machine learning che si colloca tra l’apprendimento supervisionato (che utilizza dati etichettati) e l’apprendimento non supervisionato (che si basa su dati non etichettati). Questo approccio sfrutta una piccola quantità di dati etichettati insieme a una grande quantità di dati non etichettati per migliorare la capacità del modello di apprendere schemi e realizzare previsioni più accurate.
L’idea alla base dell’apprendimento semi-supervisionato è che i dati non etichettati possono contenere informazioni strutturali utili che aiutano il modello a generalizzare meglio, riducendo la necessità di costose e laboriose etichettature manuali. Tecniche comuni includono:
- Self-training: Il modello viene addestrato inizialmente con dati etichettati, poi utilizza le proprie previsioni sui dati non etichettati per continuare l’apprendimento.
- Consistency regularization: L’algoritmo assume che piccole variazioni nei dati non debbano modificare significativamente la previsione del modello.
L’apprendimento semi-supervisionato è particolarmente utile nei contesti in cui ottenere dati etichettati è difficile o costoso, ma sono disponibili grandi quantità di dati grezzi.
Applicazioni in Medicina
- Scoperta di biomarcatori: L’apprendimento semi-supervisionato può aiutare a identificare nuovi biomarcatori per malattie rare analizzando grandi quantità di dati biologici con pochi esempi etichettati.
- Epidemiologia e sanità pubblica: L’apprendimento semi-supervisionato può essere utilizzato per analizzare dati epidemiologici in cui solo una parte della popolazione è stata testata o diagnosticata con certezza.