Decodifica HTML
Converti le entità HTML nei rispettivi caratteri originali.
Un testo che mostra sequenze come & oppure ' segnala quasi sempre un errore nella gestione dei dati. Spesso una procedura applicativa ha convertito i caratteri due volte consecutive: decodificare la stringa permette di recuperare il messaggio effettivo.
Come decodificare stringhe HTML
- Incolla il testo che contiene le entità HTML nell’apposito campo.
- Clicca sul pulsante per avviare la decodifica sul server.
- Esamina la versione convertita in formato testuale pulito.
- Se compaiono ancora entità residue, ripeti l’operazione per gestire un eventuale doppio escape.
- Individua nel codice sorgente il passaggio che applica l’escape a valori già codificati.
Origine del problema del doppio escape HTML
Questo fenomeno si manifesta frequentemente quando un CMS memorizza il testo convertendo preventivamente i caratteri speciali nel database. Successivamente, il motore di rendering delle viste applica un nuovo livello di protezione prima della stampa a video: non sapendo che il contenuto è già codificato, trasforma la e commerciale originaria in &.
La presenza di sequenze come & rivela ben tre passaggi ripetuti. La soluzione corretta non consiste nel decodificare il testo a schermo per aggirare l’inghippo, poiché tale pratica riapre falle di sicurezza. È indispensabile intervenire a monte e correggere il livello che esegue la conversione prima del salvataggio.
Situazioni tipiche in cui serve decodificare HTML
- Pulizia di articoli importati da feed RSS esterni o migrati da un altro CMS.
- Ispezione di payload restituiti da API JSON che applicano l’escape alle stringhe.
- Revisione di titoli e descrizioni di catalogo dopo una migrazione di database.
- Analisi del codice sorgente di un’email per verificare il reale contenuto testuale.
- Controllo diagnostico su template che codificano porzioni di testo non necessarie.
Confronto tra formati di entità HTML
- Entità con nome — Utilizzano identificatori convenzionali come
<per rappresentare il simbolo minore, risultando molto semplici da riconoscere visivamente nel codice. - Riferimenti numerici — Impiegano codici specifici come
<per richiamare direttamente la posizione del carattere. Possono mappare qualsiasi punto di codice Unicode, inclusi simboli ed emoji privi di un nome standard.
Domande frequenti sulla decodifica HTML
Per quale motivo leggo & al posto del singolo carattere &?
Il testo ha subìto una doppia codifica: la prima conversione ha generato &, mentre la seconda ha codificato nuovamente il carattere iniziale creando &amp;, che a video viene mostrato come &.
Decodificare il codice HTML comporta rischi per la sicurezza?
Usare la decodifica come strumento di analisi non presenta problemi. Al contrario, inserire direttamente in un sito web testo decodificato proveniente da fonti non affidabili genera vulnerabilità di tipo cross-site scripting.
Quale differenza esiste tra entità numeriche ed entità con nome?
Il risultato finale è identico. Le entità nominate risultano più comprensibili alla lettura, mentre quelle numeriche coprono l’intero standard Unicode, inclusi i simboli senza etichetta testuale.
Come mai nei testi incollati da Word compare l’entità ?
I programmi di videoscrittura impiegano spesso spazi unificatori non interrompibili. Rappresentano caratteri validi, ma possono creare spaziatura irregolare nei layout web ed è preferibile sostituirli con spazi ordinari.
È opportuno decodificare un intero file HTML con questo strumento?
È sconsigliato perché convertirebbe tutti i tag di esempio in codice vivo, alterando la struttura del documento. Conviene limitarsi ai singoli frammenti di testo da esaminare.