Imaging Technology & AI

Denoising ecografico: algoritmi AI contro filtri spaziali

Un valore di PSNR pari a 34,11 dB e un SSIM di 0,8901 descrivono una ricostruzione numericamente convincente. Non dimostrano, da soli, che una lesione sia più visibile o che una diagnosi sia più corretta.

Denoising ecografico: algoritmi AI contro filtri spaziali

Questo è il primo limite da fissare quando si confrontano algoritmi di denoising basati su AI e filtri spaziali tradizionali nell’ecografia.

La riduzione del rumore speckle non è una semplice operazione estetica. L’immagine ecografica nasce da interferenze acustiche, riflessioni multiple, attenuazione e limiti del trasduttore. Il rumore, quindi, non è sempre separabile dal segnale anatomico con una soglia netta. Un filtro può attenuare lo speckle e, nello stesso passaggio, ridurre il contrasto di una parete, smussare un margine o cancellare una variazione tessutale sottile.

I metodi basati su reti neurali promettono una separazione più selettiva. I filtri classici rispondono a regole matematiche definite. Le reti apprendono una trasformazione dai dati. La differenza è sostanziale, ma non equivale a una superiorità automatica. Cambiano il modello del rumore, la dipendenza dal dataset e il rischio di sovrastima delle strutture.

Il problema non è eliminare lo speckle

Lo speckle è una componente fisica dell’ecografia. Deriva dall’interferenza delle onde ultrasonore riflesse dai microscatterer presenti nei tessuti. Può mascherare strutture, alterare la percezione del contrasto e rendere meno stabile la segmentazione. Ma non è un difetto indipendente dall’immagine. La sua distribuzione dipende dalla frequenza, dalla geometria del fascio, dalla profondità, dall’angolo d’incidenza e dalla composizione del tessuto.

Per questo l’idea di un’immagine ecografica in vivo completamente priva di speckle come riferimento assoluto è metodologicamente debole. Non esiste, nella pratica clinica, una versione perfettamente pulita della stessa acquisizione da usare come verità di base universale. I dataset devono ricorrere a immagini simulate, acquisizioni multiple, annotazioni esperte, immagini filtrate oppure bersagli pseudo-clean costruiti con procedure convenzionali.

Il denoising, quindi, non deve essere valutato soltanto in termini di quantità di rumore rimossa. Il punto è conservare l’informazione diagnostica durante la riduzione dello speckle. Una superficie più liscia può apparire più leggibile sul monitor e risultare meno fedele al segnale originale.

Un’immagine più pulita non è necessariamente un’immagine più informativa. Il limite è fisico prima ancora che algoritmico.

Filtri spaziali: semplici, rapidi, non innocui

I filtri spaziali operano direttamente sui pixel o sui voxel dell’immagine ricostruita. Sono presenti da anni nei sistemi ecografici e nei flussi di elaborazione digitale perché richiedono risorse relativamente contenute, sono prevedibili e possono essere eseguiti anche su piattaforme hardware limitate.

Il filtro mediano sostituisce il valore di un pixel con il valore mediano della sua finestra locale. È utile contro variazioni impulsive e componenti anomale isolate. Il problema emerge quando la finestra contiene contemporaneamente bordo anatomico e rumore: la mediana tende a regolarizzare il passaggio e può ridurre la definizione del margine.

Il filtro di Wiener introduce una stima locale della componente di segnale e di quella rumorosa. In condizioni favorevoli può adattare il livello di smoothing alla statistica della regione. Non possiede però una comprensione anatomica del contenuto. Dove la variazione locale viene interpretata come rumore, il filtro può attenuare una struttura reale.

L’algoritmo SRAD, basato sulla diffusione anisotropa speckle, cerca di limitare la diffusione attraverso i bordi e di ridurre la variabilità all’interno delle regioni omogenee. È più selettivo di uno smoothing uniforme, ma resta vincolato alla qualità del modello locale. Un bordo poco contrastato, già degradato dall’attenuazione o dall’angolo di scansione, può non essere riconosciuto come bordo.

La famiglia dei metodi tradizionali comprende anche:

  • filtri adattivi nel dominio spaziale, calibrati sulla statistica locale dell’immagine;
  • metodi basati su trasformata wavelet, che separano componenti a diverse scale;
  • logiche fuzzy, utili per gestire appartenenze non nette tra segnale e rumore;
  • tecniche non-local means, che cercano regioni simili anche lontane dal pixel analizzato;
  • varianti di diffusione anisotropa e filtri orientati alla conservazione dei contorni.

Il vantaggio comune è la bassa complessità relativa. Non devono essere addestrati. Non dipendono da un insieme di immagini annotato. Sono più facili da integrare in una catena di elaborazione deterministica.

Il costo è la perdita di dettaglio. La sfocatura dei bordi è il difetto ricorrente. Aumentando l’intensità del filtro, il rumore diminuisce ma anche la risoluzione spaziale percepita. Riducendo l’intensità, si conservano più dettagli ma resta una maggiore variabilità granulare. Non esiste una regolazione che elimini questo compromesso.

ResNet e U-Net: il vantaggio appreso dai dati

Le architetture di deep learning applicate al denoising ecografico trattano l’immagine come una distribuzione di strutture, texture e distorsioni. Una rete convoluzionale impara dai campioni quali trasformazioni sono associate al rumore e quali invece appartengono al contenuto anatomico.

Le reti residuali, come ResNet, lavorano spesso sulla differenza tra immagine degradata e immagine da ricostruire. Il principio è utile perché la rete non deve necessariamente generare ogni dettaglio da zero. Può apprendere la componente da correggere e mantenere una connessione diretta con il segnale di ingresso.

Un modello ResNet composto da 16 blocchi residui ha mostrato prestazioni di riduzione del rumore superiori ai filtri mediano e di Wiener in dataset di immagini ecografiche valutati tramite PSNR e RMSE. Il risultato è coerente con il comportamento atteso: una rete con capacità di modellazione maggiore può distinguere pattern complessi che un filtro locale tratta come semplice variazione.

Ma la parola decisiva è dataset. Una rete non apprende la fisica dell’ecografia in astratto. Apprende la distribuzione delle immagini che riceve durante l’addestramento. Se il dataset contiene soprattutto una determinata anatomia, una specifica frequenza del trasduttore o un certo livello di compressione, la rete può risultare meno affidabile quando cambia l’ambiente di acquisizione.

Le architetture U-Net introducono una struttura encoder-decoder con collegamenti tra livelli di risoluzione. Le connessioni laterali aiutano a trasferire dettagli locali dalle rappresentazioni ad alta risoluzione verso la ricostruzione finale. È un vantaggio evidente per la conservazione dei contorni, ma non elimina il problema dell’origine dei dettagli. Se l’informazione è già stata persa nell’acquisizione, la rete non può recuperarla in modo garantito. Può soltanto stimare una ricostruzione plausibile.

Qui entra il rischio più delicato: la sovrastima. Un modello può produrre una struttura visivamente coerente ma non realmente supportata dal segnale. Nel denoising, il falso positivo non è soltanto una classificazione sbagliata. Può essere una trama, una parete o una discontinuità che l’algoritmo rende più leggibile di quanto fosse nell’acquisizione originale.

Il confronto diretto tra filtri e AI

Il confronto tra metodi classici e reti neurali deve separare almeno quattro dimensioni: qualità numerica, conservazione dei bordi, costo computazionale e robustezza fuori distribuzione.

ParametroFiltri spaziali tradizionaliModelli basati su reti neurali
AddestramentoNon richiestoNecessario, con dataset rappresentativo
ComplessitàGeneralmente contenutaVariabile, spesso maggiore
Conservazione dei bordiLimitata dal livello di smoothingPotenzialmente superiore, ma dipendente dai dati
Adattamento al rumoreDefinito da regole statistiche e localiAppreso da esempi
Rischio principaleSfocatura e perdita di dettaglioArtefatti plausibili, sovrastima e deriva tra apparecchi
RiproducibilitàElevata con parametri fissiDipende da addestramento, versione e distribuzione dei dati
Uso su hardware limitatoPiù sempliceRichiede ottimizzazione e accelerazione
Interpretazione del comportamentoRelativamente trasparentePiù difficile da verificare a livello pixel

I filtri non sono obsoleti. Restano utili nei sistemi a basse risorse, nei prototipi, nei flussi in cui la latenza deve essere strettamente prevedibile e nelle situazioni in cui la tracciabilità della trasformazione è prioritaria.

I modelli neurali sono più interessanti quando la degradazione è complessa e quando il sistema dispone di dati sufficienti per rappresentare variabilità anatomica e strumentale. Il loro vantaggio non è una generica capacità di rendere l’immagine più gradevole. È la possibilità di modellare relazioni non lineari tra rumore, tessuto, profondità e struttura.

Questa distinzione è essenziale. Se la rete viene valutata solo sull’aspetto visivo, il confronto è fragile. Un’immagine con meno granulosità può ricevere una valutazione favorevole anche quando perde informazione. La qualità percettiva non coincide con la fedeltà diagnostica.

PSNR, SSIM e RMSE: numeri utili, ma incompleti

Il PSNR misura il rapporto tra la potenza del segnale e quella dell’errore ricostruito, espresso in decibel. Un valore più alto indica, in termini matematici, una minore differenza rispetto al riferimento utilizzato. Il problema è proprio il riferimento. Se l’immagine target è stata filtrata o costruita con una procedura pseudo-clean, il PSNR misura la vicinanza a quel target, non la correttezza clinica assoluta.

L’SSIM valuta la somiglianza strutturale considerando luminanza, contrasto e struttura locale. È più informativo di una semplice differenza pixel per pixel quando si analizzano immagini anatomiche. Anche questo indice, tuttavia, non sa se una struttura conservata sia diagnosticamente corretta o se un dettaglio attenuato fosse invece irrilevante.

L’RMSE quantifica l’errore quadratico medio. Penalizza maggiormente gli scarti elevati e può essere utile per confrontare versioni dello stesso modello. Non descrive però da solo la distribuzione dell’errore. Due immagini con RMSE simile possono avere un comportamento molto diverso sui bordi, nelle regioni profonde o vicino a una lesione.

Nel denoising ecografico è opportuno affiancare a PSNR, SSIM e RMSE altri indicatori, tra cui lo SSI, cioè un indice di soppressione dello speckle. Anche lo SSI non deve essere isolato dal contesto. Ridurre lo speckle in modo aggressivo può migliorare l’indice e peggiorare la lettura di un margine.

Un protocollo di valutazione più serio dovrebbe includere:

1. confronto tra regioni omogenee e regioni con contorni anatomici;

2. analisi separata per profondità e frequenza del trasduttore;

3. valutazione della risoluzione di contrasto, non soltanto della pulizia visiva;

4. test su apparecchi e operatori non presenti nel dataset di addestramento;

5. verifica dell’impatto sulle attività successive, come segmentazione e rilevamento assistito;

6. analisi degli errori nelle immagini patologiche, non solo nei campioni più semplici.

Il rapporto di suddivisione 8:1:1 tra addestramento, validazione e test è comune in molti studi. Non è però una garanzia di generalizzazione. Se le immagini dello stesso paziente, dello stesso esame o dello stesso dispositivo finiscono in gruppi diversi, il risultato può essere sovrastimato. La separazione deve avvenire a livello di paziente e, quando possibile, anche di centro e dispositivo.

PSNR e SSIM certificano la distanza da un riferimento. Non certificano la sicurezza diagnostica del riferimento.

Il problema del ground truth nell’ecografia reale

Nel denoising fotografico è relativamente semplice definire un’immagine pulita e aggiungere rumore artificiale. Nell’ecografia la situazione è diversa. Lo speckle non è sempre un disturbo aggiunto dopo l’acquisizione. È parte del processo di formazione dell’immagine.

Da qui nasce l’interesse per gli approcci autosupervisionati. Un modello autosupervisionato cerca di imparare senza richiedere una vera immagine pulita come bersaglio. L’algoritmo Speckle2Self appartiene a questa direzione: sfrutta la struttura statistica dei dati per stimare e ridurre componenti indesiderate senza imporre un’immagine priva di speckle come verità assoluta.

Il vantaggio metodologico è rilevante. Riduce la dipendenza da target artificiali e da immagini pseudo-clean prodotte da filtri convenzionali. Il limite resta nella qualità delle ipotesi statistiche. Se il modello presume indipendenze che non esistono nel segnale ecografico, può confondere informazione strutturale e rumore.

Un’altra strategia consiste nel costruire target pseudo-clean attraverso più filtri tradizionali. Uno studio su immagini ecografiche mammarie del dataset BUSI, basato su un’architettura UNet++, ha riportato un PSNR di 34,11 dB e un SSIM di 0,8901 utilizzando questo tipo di riferimento. Sono valori utili per descrivere il comportamento del modello nel protocollo specifico. Non dimostrano che l’immagine prodotta sia priva di alterazioni anatomiche.

Il problema non è una debolezza esclusiva dell’AI. Anche un filtro classico può modificare l’immagine. La differenza è che una rete può incorporare nel risultato una trasformazione più complessa e meno evidente. L’errore può non apparire come sfocatura. Può manifestarsi come struttura troppo regolare, texture ricostruita o contrasto localmente sovrastimato.

Dall’immagine ricostruita al segnale RF

Il denoising applicato all’immagine finale agisce dopo la scansione, il beamforming e la conversione nel formato visualizzato. Questo semplifica l’integrazione, ma significa che parte dell’informazione originaria è già stata compressa o persa.

Un approccio più ambizioso lavora direttamente sui segnali in radiofrequenza, prima del beamforming e della ricostruzione DAS. In questa posizione della catena, il modello può intervenire su speckle e artefatti di clutter prima che diventino una trama visibile nell’immagine. Il vantaggio teorico è maggiore controllo sul segnale. Il costo è una complessità tecnica molto più elevata.

Il dato RF è voluminoso, sensibile alla configurazione dell’array e strettamente legato alla sincronizzazione dei canali. Un modello che lo elabora deve rispettare vincoli di latenza, memoria e consumo energetico. Non basta ottenere una buona immagine su una scheda grafica da laboratorio. Il sistema deve mantenere prestazioni coerenti durante l’acquisizione in tempo reale, con una catena hardware che non introduca ritardi incompatibili con la scansione.

L’elaborazione RF pone inoltre un problema di interoperabilità. Trasduttori diversi, frequenze diverse, geometrie diverse e strategie di beamforming diverse producono distribuzioni del segnale non equivalenti. Una rete addestrata su un sistema può degradare su un altro. La portabilità del modello diventa una questione di validazione, non di semplice aggiornamento software.

Nel caso dei dispositivi portatili, il compromesso è ancora più netto. Il sistema deve contenere consumo, memoria e dissipazione termica. I modelli neurali possono essere ridotti, quantizzati o integrati in acceleratori dedicati, ma il costo computazionale esatto per fotogramma dipende dall’implementazione hardware. Non è corretto trasformare la disponibilità di un modello in una promessa generale di elaborazione istantanea su ogni trasduttore portatile.

Il rischio clinico: migliorare il contrasto e alterare la decisione

L’impatto dell’AI sulla risoluzione di contrasto è uno dei punti più delicati. Un modello può rendere più distinguibile una regione a bassa differenza di intensità rispetto allo sfondo. Questo è potenzialmente utile. Ma il contrasto non è soltanto una proprietà dell’immagine finale. Dipende dalla reale risposta acustica del tessuto, dalla profondità, dalla frequenza e dalle impostazioni di acquisizione.

Quando una rete aumenta la separazione visiva tra due regioni, bisogna chiedersi se stia recuperando informazione o imponendo una prior appresa. La distinzione è difficile da stabilire guardando una singola immagine. Servono confronti con il segnale originale, test su acquisizioni indipendenti e valutazioni condotte su compiti clinici specifici.

Un algoritmo di denoising può influenzare:

  • la percezione del margine di una massa;
  • la continuità apparente di una parete;
  • la visibilità di piccole calcificazioni;
  • la valutazione dell’ecogenicità;
  • la separazione tra lesione e parenchima;
  • la successiva segmentazione automatica;
  • la decisione dell’operatore davanti a un reperto ambiguo.

Il falso positivo e il falso negativo non sono distribuiti in modo uniforme. Un filtro aggressivo può cancellare segnali deboli. Un modello neurale può rendere più marcata una struttura incerta. La metrica migliore è quindi legata alla domanda clinica: che cosa deve essere riconosciuto, con quale risoluzione, in quale distretto e con quale margine di errore accettabile?

Dove i filtri restano preferibili

La superiorità dell’AI non è universale. Esistono scenari in cui un filtro tradizionale è la scelta più razionale.

Il primo è il sistema con risorse hardware limitate. Se l’elaborazione deve avvenire vicino al trasduttore, senza accesso a un acceleratore dedicato, la prevedibilità di un filtro mediano, Wiener o SRAD può essere più importante di un miglioramento teorico del PSNR.

Il secondo è il flusso in cui la trasformazione deve essere facilmente auditabile. Un parametro di smoothing può essere documentato e replicato. Il comportamento di una rete dipende invece da pesi, preprocessing, normalizzazione, versione del modello e distribuzione dei dati.

Il terzo è la fase di sviluppo iniziale. I filtri tradizionali possono fornire una linea di riferimento solida. Senza questo confronto, una rete neurale può sembrare efficace perché viene misurata contro una baseline debole o contro una procedura non ottimizzata.

Il quarto è la gestione di dati molto eterogenei ma poco numerosi. Una rete complessa può adattarsi eccessivamente al campione disponibile. Un metodo convenzionale, pur meno sofisticato, può mantenere un comportamento più stabile quando la quantità di dati non sostiene l’addestramento.

La domanda corretta non è se l’AI abbia sostituito i filtri spaziali. Non li ha sostituiti. La domanda è quale fase della catena benefici davvero da un modello appreso e quale possa essere gestita da un metodo deterministico con minore rischio operativo.

Una pipeline realistica per la validazione

Un confronto tecnico credibile dovrebbe procedere per livelli. Prima l’immagine. Poi il segnale. Infine il compito clinico.

Nella prima fase si misurano PSNR, SSIM, RMSE e SSI, mantenendo chiara la natura del riferimento. Si analizzano bordi, regioni omogenee, profondità e contrasto.

Nella seconda si verifica il comportamento su dati provenienti da apparecchi diversi. È il punto in cui emerge la deriva di dominio: un algoritmo addestrato su un determinato produttore o su una specifica impostazione può perdere prestazioni quando cambiano il trasduttore, la frequenza o la post-elaborazione.

Nella terza si valuta l’effetto su un compito concreto. Se il denoising è destinato alla rilevazione di lesioni mammarie, la metrica non può fermarsi alla qualità globale dell’immagine. Deve misurare sensibilità, specificità, falsi positivi, falsi negativi e accordo tra osservatori, secondo il disegno dello studio.

Anche la latenza deve essere valutata lungo l’intera catena. Un modello può essere rapido nell’inferenza ma rallentare il trasferimento, il preprocessing o la visualizzazione. Nell’elaborazione del segnale ecografico in tempo reale, il dato utile è il tempo complessivo per fotogramma, non il solo tempo dichiarato per la rete.

Infine, la valutazione deve includere versioni con e senza denoising. L’operatore deve poter riconoscere il grado di trasformazione applicato. Un’immagine filtrata non dovrebbe diventare l’unica rappresentazione disponibile quando l’algoritmo modifica il contrasto o la texture in modo sostanziale.

Valutazione finale: più capacità, più responsabilità

I filtri spaziali sono limitati. Sfocano i bordi, riducono dettagli fini e faticano davanti a una struttura anatomica complessa. Ma sono leggeri, riproducibili e comprensibili.

Le reti neurali hanno una capacità superiore di modellare il rumore e preservare il contrasto locale. I risultati ottenuti con ResNet, U-Net, UNet++ e approcci autosupervisionati mostrano un vantaggio concreto su diverse metriche quantitative. Il passaggio da un risultato numerico a un beneficio clinico, però, non è automatico.

La questione del ground truth rimane aperta. Lo speckle è legato alla fisica dell’acquisizione. I target pseudo-clean sono utili, ma non neutrali. Le metriche sono necessarie, ma non sufficienti. L’elaborazione RF pre-beamforming è promettente, ma impone vincoli hardware e problemi di generalizzazione più severi.

La scelta pragmatica è quindi ibrida. Filtri convenzionali come riferimento e controllo di base. Modelli AI quando esiste una reale evidenza di miglioramento, con validazione indipendente e compito clinico definito. Nessuna certificazione implicita fondata sulla sola pulizia dell’immagine.

Nel denoising ecografico, il progresso non consiste nel rimuovere più rumore possibile. Consiste nel rimuovere ciò che disturba senza trasformare l’incertezza del segnale in una certezza artificiale. È un limite fisico, prima ancora che una questione di architettura neurale.

Domande frequenti

Perché il denoising ecografico è più complesso di quello fotografico?
Lo speckle non è un disturbo aggiunto esternamente, ma una componente fisica intrinseca dell'interazione tra onde ultrasonore e tessuti, rendendo difficile separare il rumore dal segnale anatomico.
Quali sono i rischi principali dell'uso dell'intelligenza artificiale nel denoising?
Il rischio maggiore è la sovrastima, ovvero la creazione di strutture visivamente coerenti ma non supportate dal segnale originale, che possono portare a falsi positivi o alterazioni della texture.
I filtri spaziali tradizionali sono ormai obsoleti?
No, restano preferibili in sistemi con risorse hardware limitate, in flussi di lavoro che richiedono alta tracciabilità della trasformazione o quando la quantità di dati non è sufficiente per addestrare modelli complessi.
Cosa si intende per approccio autosupervisionato nel denoising?
È una tecnica, come l'algoritmo Speckle2Self, che permette al modello di apprendere e ridurre il rumore sfruttando la struttura statistica dei dati, senza necessitare di un'immagine 'pulita' di riferimento come target.
Perché lavorare sui segnali RF è considerato più ambizioso?
L'elaborazione dei segnali in radiofrequenza avviene prima del beamforming, permettendo di intervenire sul rumore prima che diventi una trama visibile, sebbene richieda una potenza di calcolo molto elevata.