Imaging Technology & AI

Segmentazione automatica ecografica: il ruolo del deep learning

Un algoritmo di segmentazione ecografica può raggiungere un indice di sovrapposizione molto elevato e fallire comunque nel punto clinicamente rilevante. Il problema non è solo tracciare un contorno.

Segmentazione automatica ecografica: il ruolo del deep learning

È stabilire se quel contorno rappresenti davvero il margine anatomico, se l’errore sia stabile tra operatori diversi e se la prestazione rimanga accettabile quando cambiano sonda, acquisizione, paziente e livello di rumore.

Gli algoritmi di deep learning per la segmentazione automatica ecografica operano su un’immagine che non è mai completamente neutra. Lo speckle altera la tessitura. Le ombre acustiche interrompono i margini. La pressione della sonda modifica la geometria dei tessuti. La finestra di scansione può rendere invisibile una porzione della struttura. Una rete neurale non riceve un’anatomia completa: riceve una rappresentazione parziale, dipendente dalla fisica dell’ultrasuono e dalla mano che acquisisce il dato.

Per questo il valore di un modello non si misura soltanto con il punteggio finale. Servono architettura, qualità del riferimento annotato, distribuzione del dataset, stabilità inter-operatore e comportamento nei casi degradati. Il resto è sovrastima.

U-Net: la logica encoder-decoder applicata all’ecografia

La famiglia U-Net rimane il riferimento strutturale più riconoscibile per la segmentazione delle immagini ecografiche. La sua logica è semplice solo in apparenza. Il percorso di contrazione, cioè l’encoder, riduce progressivamente la risoluzione spaziale e aumenta la profondità delle caratteristiche estratte. Il percorso di espansione, cioè il decoder, ricostruisce una mappa densa assegnando un’etichetta a ciascun elemento dell’immagine.

Nella configurazione descritta per la segmentazione ecografica, l’encoder comprende cinque blocchi convoluzionali. A ogni livello la rete perde dettaglio locale e guadagna un campo recettivo più ampio. Questo consente di distinguere una struttura anatomica non soltanto dal bordo immediato, ma anche dalla relazione con il contesto circostante.

Il problema è noto: la riduzione della risoluzione elimina proprio le informazioni che servono per definire i margini. Una lesione piccola, una parete sottile o un’apice ventricolare poco contrastato possono essere rappresentati in modo insufficiente nello spazio profondo della rete.

Le skip connections riducono questa perdita. Collegano i livelli dell’encoder con quelli corrispondenti del decoder e trasferiscono caratteristiche spaziali ad alta risoluzione. Il decoder non deve ricostruire da zero la posizione dei bordi. Riceve una parte dell’informazione già estratta prima della compressione.

La skip connection non corregge l’informazione assente: impedisce soltanto che quella disponibile venga persa troppo presto.

In ecografia, questo dettaglio architetturale ha un peso superiore rispetto a quanto suggerisca la rappresentazione schematica della U. I margini sono spesso deboli, discontinui e contaminati da pattern di speckle. La rete deve combinare informazione locale e contesto anatomico senza trasformare ogni variazione di intensità in un confine.

Dice e IoU misurano la sovrapposizione, non la validità clinica

Le metriche più utilizzate sono il coefficiente di Dice e l’Intersection over Union, noto anche come indice di Jaccard. Entrambe confrontano la regione segmentata dal modello con quella annotata nel riferimento.

Il Dice tende a essere più indulgente quando le aree sono ampie e l’errore sul bordo è limitato. L’IoU penalizza maggiormente la differenza tra intersezione e unione. La relazione tra le due metriche è nota, ma il loro significato clinico non è intercambiabile con la qualità diagnostica.

Un modello può ottenere una buona sovrapposizione su una cavità ventricolare e produrre comunque un errore volumetrico significativo se il difetto è concentrato in una regione geometrica sensibile. La stessa quantità di pixel può avere un impatto minimo su una superficie regolare e alterare molto il volume di una struttura sottile o irregolare.

La valutazione deve quindi comprendere almeno:

  • qualità della segmentazione globale, attraverso Dice e IoU;
  • errore del contorno, soprattutto nei margini anatomici critici;
  • errore volumetrico assoluto e relativo;
  • variabilità tra acquisizioni, operatori e apparecchiature;
  • comportamento su immagini con ombra, rumore di speckle e perdita di contrasto;
  • stabilità della predizione quando la struttura è parzialmente fuori campo.

Questi parametri non sono accessori. Sono il passaggio che separa una dimostrazione su dataset da un sistema utilizzabile nel flusso clinico.

Il dataset CAMUS e il problema della quantificazione cardiaca

L’ecocardiografia è uno dei banchi di prova più severi per la segmentazione automatica. Il ventricolo sinistro cambia forma durante il ciclo cardiaco. L’endocardio può essere poco visibile. L’apice è soggetto a foreshortening. La qualità dell’immagine dipende dalla finestra acustica e dall’orientamento della sonda.

Il dataset CAMUS, pubblicato nel 2019, comprende acquisizioni ecocardiografiche nelle viste a due e quattro camere provenienti da 500 pazienti. È stato progettato per affrontare la segmentazione e la stima dei volumi del ventricolo sinistro in un contesto più vicino alla variabilità reale rispetto a raccolte limitate a pochi soggetti o a immagini selezionate.

Nei modelli encoder-decoder valutati su questo dataset, la correlazione media per i volumi ventricolari sinistri ha raggiunto 0,95, con un errore medio assoluto di 9,5 ml. Sono numeri utili. Non autorizzano però a confondere la correlazione con l’accuratezza assoluta.

Una correlazione elevata indica che il modello segue correttamente la variazione tra casi: volumi maggiori tendono a essere riconosciuti come maggiori, volumi inferiori come inferiori. Non dimostra che ogni volume sia stimato senza bias. Un sistema può mantenere una correlazione alta e sovrastimare o sottostimare in modo sistematico un sottogruppo di pazienti.

La frazione di eiezione aggiunge un ulteriore livello di sensibilità. È calcolata a partire dai volumi telediastolico e telesistolico; un errore contenuto su ciascun contorno può amplificarsi nella differenza relativa. Nei dati riportati per la segmentazione ecocardiografica, l’errore medio sulla frazione di eiezione è stato del 5,6%.

La conseguenza è pratica. La segmentazione automatica può ridurre il tempo necessario per delineare il ventricolo e rendere più riproducibile la misura, ma non elimina il controllo della qualità dell’acquisizione. Se l’apice non è incluso correttamente o l’endocardio è ambiguo, il modello lavora su un’informazione già compromessa.

AspettoSegmentazione manualeSegmentazione automatica
Tempo operativoDipende dall’esperienza e dalla complessità del casoPotenzialmente ridotto dopo l’acquisizione
VariabilitàElevata tra operatori e tra letture successiveDipende dal dataset e dalla stabilità del modello
Gestione dei margini deboliBasata su esperienza, contesto e revisione dinamicaBasata su pattern appresi e qualità dell’input
Errore tipicoIncoerenza del tracciamento o affaticamentoFalso positivo, perdita del bordo o segmentazione plausibile ma errata
Controllo clinicoDiretto durante la costruzione del contornoNecessario per accettare, correggere o rifiutare il risultato

La segmentazione automatica non sostituisce la decisione. Sposta il punto in cui l’operatore interviene: dalla costruzione completa del contorno alla revisione di una proposta. È un guadagno operativo soltanto se la proposta è sufficientemente affidabile e se la correzione resta più rapida del tracciamento manuale.

SAM nella diagnostica mammaria: trasferimento, non universalità

I modelli foundation hanno introdotto una promessa precisa: utilizzare una rappresentazione appresa su insiemi di immagini molto ampi e adattarla a compiti specifici con un fine-tuning più limitato. Il Segment Anything Model, indicato comunemente come SAM, appartiene a questa categoria.

Applicato alla segmentazione dei tumori mammari in ecografia, SAM può essere adattato mediante indicazioni basate su riquadro, cioè su una bounding box che delimita approssimativamente l’area di interesse. In una valutazione riportata nella letteratura, il fine-tuning con prompt di questo tipo ha raggiunto un IoU di 0,9311.

Il valore è alto. La procedura, però, contiene già un’informazione fornita dall’operatore o da un sistema preliminare: il riquadro che orienta il modello. Non si tratta quindi di una segmentazione completamente autonoma a partire da un’immagine non annotata. La differenza non è semantica. Cambia il flusso di lavoro, il tempo di interazione e il modo in cui va interpretato il benchmark.

Un riquadro ampio può includere tessuto sano, artefatti e strutture adiacenti. Un riquadro troppo stretto può escludere una porzione periferica della lesione. Il modello deve separare il bersaglio dal contesto, ma il prompt condiziona lo spazio della decisione. La qualità dell’input resta una variabile determinante.

In ecografia mammaria la difficoltà aumenta per la frequente irregolarità dei margini, l’attenuazione posteriore e la sovrapposizione tra caratteristiche della lesione e tessuto circostante. Un contorno plausibile può essere topograficamente corretto e biologicamente fuorviante. Il modello segmenta la rappresentazione visiva, non interpreta da solo l’istologia.

Il confronto con le reti convoluzionali specializzate

Un’architettura Inception U-Net, integrata con trasferimento dell’apprendimento da ImageNet, ha raggiunto un Dice di 0,8491 e un IoU di 0,7774 nella segmentazione di immagini ecografiche mammarie. Il confronto con il risultato ottenuto da SAM non può essere letto come una classifica lineare.

Le architetture differiscono per:

  • composizione del dataset;
  • definizione delle annotazioni;
  • modalità di addestramento;
  • presenza o assenza di prompt;
  • tipo di lesione e qualità delle immagini;
  • procedura di validazione;
  • soglia utilizzata per trasformare la probabilità in maschera.

Un IoU più basso non dimostra automaticamente che la rete sia clinicamente inferiore. Allo stesso modo, un IoU più alto non dimostra che il modello sia pronto per l’uso generalizzato. Il punteggio è legato al contesto sperimentale. Senza una validazione esterna e senza un’analisi degli errori per sottogruppo, il numero resta circoscritto al protocollo che lo ha prodotto.

Un benchmark non è una proprietà permanente dell’algoritmo. È il risultato di un incontro tra algoritmo, dataset, annotazioni e regole di valutazione.

L’Inception U-Net sfrutta filtri a scale differenti e una struttura encoder-decoder orientata alla segmentazione densa. Il trasferimento da ImageNet fornisce pesi iniziali appresi su immagini naturali, ma non elimina la distanza tra immagini fotografiche e dati ecografici. Texture, contrasto, rumore e semantica sono diversi. Il fine-tuning deve compensare questa distanza, e la sua efficacia dipende dalla quantità e dalla rappresentatività dei dati disponibili.

SAM, invece, offre una capacità di generalizzazione iniziale più ampia, ma può richiedere adattamenti specifici per gestire la modalità ecografica. La segmentazione di un oggetto visivamente definito non equivale alla delimitazione affidabile di una lesione con margini sfumati. Il modello può produrre maschere regolari e coerenti con il prompt, ma non necessariamente aderenti alla reale estensione patologica.

Rumore di speckle, ombre e dominio di acquisizione

La segmentazione automatica delle immagini ecografiche è esposta a un problema che le metriche aggregate tendono a comprimere: la dipendenza dal dominio. Un modello addestrato su immagini provenienti da una determinata apparecchiatura apprende, oltre all’anatomia, una parte della firma del sistema di acquisizione.

Questa firma comprende risposta della sonda, impostazioni di guadagno, profondità, frequenza, messa a fuoco, compressione dinamica e trattamento del segnale. Anche il comportamento dell’operatore contribuisce. Una rete può quindi perdere prestazione quando viene trasferita a un dispositivo diverso o a un protocollo di scansione non rappresentato nel dataset.

Lo speckle non è semplicemente rumore da rimuovere. In alcune condizioni contiene informazione sulla tessitura dei tessuti; in altre nasconde il margine e genera strutture granulari che la rete può interpretare come contorni. Un pre-processing aggressivo può migliorare l’uniformità visiva e cancellare proprio il dettaglio utile.

Le ombre acustiche pongono un limite ancora più netto. Dove il fascio non restituisce informazione sufficiente, la rete non può ricostruire l’anatomia con certezza fisica. Può formulare una stima basata sul contesto appreso. Questa stima può essere ragionevole, ma rimane una sovrapposizione inferenziale a un dato mancante.

Per valutare il comportamento in condizioni non ideali, il dataset dovrebbe includere almeno:

1. immagini con diversi livelli di qualità e profondità;

2. acquisizioni da apparecchiature e sonde differenti;

3. soggetti con morfologie e fenotipi non sottorappresentati;

4. casi con artefatti, ombre e margini incompleti;

5. annotazioni indipendenti di più operatori;

6. una validazione esterna separata dal centro che ha prodotto l’addestramento.

La presenza di più annotatori consente inoltre di distinguere l’errore del modello dall’ambiguità umana. Se due esperti tracciano contorni molto diversi, una maschera intermedia non è necessariamente un errore. Può essere la rappresentazione più coerente dell’incertezza presente nell’immagine.

Segmentazione semantica dei segnali RF e tecnologia REMS

La segmentazione non riguarda soltanto le immagini B-mode. Gli algoritmi semantici basati sul deep learning vengono applicati anche all’analisi dei segnali a radiofrequenza nella tecnologia REMS, Radiofrequency Echographic Multi Spectrometry, utilizzata per la profilazione ossea a livello della colonna lombare e del femore prossimale.

Qui il dato di partenza è diverso. Il sistema non lavora esclusivamente sulla distribuzione visiva dei pixel, ma su informazioni legate al segnale ecografico grezzo e alle sue caratteristiche spettrali. L’obiettivo è identificare porzioni e pattern associabili alla struttura ossea, separando i contributi utili dagli artefatti e dalle componenti non pertinenti.

La differenza rispetto alla segmentazione di una lesione è sostanziale. Nel caso B-mode, il modello deve delimitare una regione anatomica visibile. Nel segnale RF deve riconoscere configurazioni più indirette, legate alla propagazione e alla riflessione dell’onda. La qualità della stima dipende dalla corretta identificazione delle finestre informative e dalla capacità di distinguere il segnale osseo da interferenze e variazioni di acquisizione.

L’impiego di reti neurali in questo ambito può ridurre la variabilità dell’interpretazione e automatizzare una parte della selezione del segnale. Non cancella però il limite fisico della misura. Un algoritmo può migliorare la coerenza dell’estrazione delle caratteristiche; non può trasformare ogni acquisizione in una misura equivalente a una densitometria ottenuta con una modalità diversa.

Questo punto è spesso oscurato dal linguaggio commerciale. L’automazione della segmentazione è una componente della catena diagnostica, non la catena completa. Restano acquisizione, controllo di qualità, calibrazione, interpretazione e confronto con il contesto clinico.

Dal prototipo al flusso radiologico

Un modello con buone metriche offline deve ancora superare il problema dell’integrazione. La segmentazione deve essere restituita nel formato corretto, associata allo studio giusto e resa modificabile nel sistema di visualizzazione utilizzato dal radiologo o dall’ecografista.

Nel flusso reale entrano in gioco identificativi, serie, orientamento, sincronizzazione con il ciclo cardiaco, gestione delle immagini secondarie e compatibilità con i sistemi di archiviazione. Il risultato non può essere una maschera isolata senza contesto. Deve mantenere il legame con l’immagine originale e rendere trasparente il passaggio dall’output automatico alla revisione umana.

Anche l’interfaccia incide sulle prestazioni. Un contorno che richiede numerose correzioni locali può produrre un risparmio apparente. Se l’operatore deve controllare ogni centimetro perché non conosce il comportamento del modello nei casi difficili, il vantaggio temporale si riduce. La fiducia non si costruisce con un indicatore unico, ma con la prevedibilità dell’errore.

Un sistema utilizzabile dovrebbe mostrare almeno:

  • la maschera sovrapposta all’immagine originale;
  • la possibilità di correggere rapidamente il contorno;
  • un’indicazione dell’incertezza o dei casi a bassa confidenza;
  • la distinzione tra segmentazione automatica e revisione manuale;
  • la tracciabilità della versione del modello;
  • la registrazione delle modifiche effettuate dall’operatore.

La gestione dell’incertezza è il punto meno spettacolare e più utile. Un modello che sa produrre una maschera, ma non segnala quando l’immagine è fuori distribuzione, è più difficile da controllare. Il falso negativo può consistere nella mancata segmentazione. Il falso positivo più insidioso è una maschera liscia, plausibile, presentata senza avvertenze su un margine che il dato non consente di stabilire.

La valutazione pragmatica

La segmentazione automatica ecografica ha già dimostrato una capacità concreta di ridurre la variabilità del tracciamento e di supportare la quantificazione anatomica. U-Net e le sue varianti offrono una base robusta per la segmentazione densa. Il dataset CAMUS mostra che la stima volumetrica cardiaca può raggiungere una correlazione elevata con errori misurabili. SAM dimostra il potenziale dei modelli adattabili, purché il ruolo del prompt e il contesto di validazione siano dichiarati con precisione. Inception U-Net conferma che le reti convoluzionali specializzate restano competitive quando il trasferimento dell’apprendimento è ben calibrato.

Nessuno di questi risultati autorizza una generalizzazione illimitata. La prestazione dipende dalla qualità dell’immagine, dal distretto anatomico, dal dispositivo, dal protocollo, dalle annotazioni e dalla gestione dei casi ambigui. Le reti non eliminano lo speckle. Non ricostruiscono in modo certo un bordo oscurato da un’ombra. Non sostituiscono la valutazione dell’operatore.

Il criterio corretto non è chiedere se l’intelligenza artificiale segmenti meglio dell’essere umano in astratto. Occorre chiedere dove riduca il lavoro, in quali condizioni mantenga una prestazione stabile e quanto costi correggere i suoi errori. È una domanda meno adatta alla promozione, ma più vicina alla pratica.

La direzione più solida non passa dalla sostituzione del radiologo o dell’ecografista. Passa da sistemi capaci di proporre contorni, quantificare strutture, rendere visibile l’incertezza e fermarsi quando il dato non sostiene una decisione affidabile. Il limite fisico dell’immagine resta. Un buon algoritmo non lo nasconde: lo rende misurabile.

Domande frequenti

Perché le metriche Dice e IoU non bastano a valutare un modello di segmentazione?
Queste metriche misurano la sovrapposizione geometrica, ma non riflettono la validità clinica; un errore concentrato in una zona anatomica sensibile può causare un impatto volumetrico significativo anche se il punteggio globale appare elevato.
Qual è il ruolo delle skip connections nelle architetture U-Net?
Le skip connections collegano i livelli dell'encoder con quelli del decoder, permettendo di trasferire caratteristiche spaziali ad alta risoluzione che altrimenti andrebbero perse durante la compressione dei dati.
Il modello SAM può segmentare autonomamente le lesioni mammarie?
SAM richiede un prompt, come un riquadro che delimita l'area di interesse, il che significa che la segmentazione non è completamente autonoma ma dipende dall'input fornito dall'operatore.
In che modo il rumore di speckle influenza la segmentazione automatica?
Lo speckle può nascondere i margini anatomici o creare strutture granulari che l'algoritmo potrebbe interpretare erroneamente come contorni, rendendo difficile una segmentazione precisa.
Cosa si intende per dipendenza dal dominio negli algoritmi ecografici?
Si riferisce al fatto che un modello apprende non solo l'anatomia, ma anche le caratteristiche specifiche del sistema di acquisizione, perdendo prestazioni se applicato a sonde o apparecchiature diverse da quelle usate nell'addestramento.