Un sitemap XML non serve a nulla se contiene URL che Google non deve indicizzare. Osserviamo regolarmente file sitemap gonfiati da redirect 301, pagine in noindex o parametri URL duplicati, il che diluisce il budget di crawl invece di concentrarlo. Ottimizzare la navigazione di un sito tramite il suo sitemap significa prima di tutto pulire questo file per lasciare solo URL canoniche, indicizzabili e aggiornate.
Affidabilità di lastmod: l’unico segnale XML che Google sfrutta ancora
I tag <priority> e <changefreq> vengono ignorati da Google. Raccomandiamo di rimuoverli dal file per alleggerire la sua lettura. L’unico parametro XML che influenza realmente il comportamento del crawler è <lastmod> con una data di modifica reale.
Una data lastmod affidabile significa che corrisponde a una modifica significativa del contenuto, dei dati strutturati o dei link interni della pagina. Rigenerare automaticamente il sitemap ogni notte aggiornando tutte le date non costituisce un segnale pertinente. Google confronta la data annunciata con il contenuto reale della pagina: se nulla è cambiato, la fiducia nel file diminuisce complessivamente.
Bing va oltre e utilizza lastmod come segnale di freschezza nei suoi sistemi di ricerca, inclusi per le esperienze assistite da IA. Un sitemap le cui date sono affidabili migliora quindi la visibilità sui due motori principali. Per osservare come un sito struttura concretamente le sue URL in un file sitemap, la pagina sitemap di Soupir illustra bene un découpage per sezioni tematiche.
Sitemap XML e budget di crawl: cosa escludere

Il primo riflesso da adottare è incrociare il contenuto del sitemap con la copertura di indicizzazione in Google Search Console. Le URL che restituiscono errori (404, soft 404, redirect) o in stato “esplorata, non indicizzata” non hanno nulla a che fare con il file.
Ecco le categorie di URL da escludere sistematicamente:
- Pagine reindirizzate (301 o 302): il sitemap deve puntare alla destinazione finale, non all’URL sorgente del reindirizzamento
- URL con parametri di ordinamento, filtraggio o paginazione che generano contenuti duplicati senza un tag canonico corretto
- Pagine protette da un
noindexo bloccate nel robots.txt, poiché la loro presenza nel sitemap invia un segnale contraddittorio al crawler - Risorse obsolete (schede prodotto esaurite, articoli depubblicati) che non rimandano più a contenuti utili
Un sitemap deve contenere solo URL indicizzabili e aggiornate. Ogni voce superflua consuma budget di crawl senza ritorno. Su un sito di diverse migliaia di pagine, questa igiene fa una differenza misurabile sulla velocità di indicizzazione dei nuovi contenuti.
Sitemap index e segmentazione per tipo di contenuto
Oltre a un certo volume di pagine, un file unico diventa difficile da mantenere e analizzare. La specifica del protocollo sitemap consente file index che fanno riferimento a più sitemap figlie. Raccomandiamo di segmentare per tipo di contenuto piuttosto che per ordine alfabetico o per data di creazione.
Un découpage efficace separa le pagine editoriali (articoli, guide), le schede prodotto o servizio, le pagine categorie e i media (immagini, video). Questa segmentazione consente di identificare rapidamente quale sottoinsieme presenta problemi in Search Console. Se il tasso di indicizzazione delle schede prodotto diminuisce, la diagnosi avviene in pochi secondi invece di dover setacciare un file monolitico.
I sitemap specializzati per immagini e video meritano un’attenzione particolare. Un sitemap immagini arricchito con i tag <image:loc> e <image:title> facilita l’indicizzazione in Google Immagini. Per il video, i tag <video:thumbnail_loc>, <video:title> e <video:description> consentono di apparire nei risultati arricchiti. Questi sitemap specializzati sono sottoutilizzati nella maggior parte dei siti che auditiamo.

IndexNow e invio del sitemap: combinare le due approcci
Inviare il proprio sitemap tramite Google Search Console e Bing Webmaster Tools rimane il metodo di riferimento per la scoperta iniziale delle URL. La dichiarazione nel file robots.txt (Sitemap: https://example.com/sitemap.xml) assicura che qualsiasi crawler conforme al protocollo trovi il file senza configurazione aggiuntiva.
Per Bing, il protocollo IndexNow completa il sitemap durante cambiamenti puntuali. Invece di aspettare che il crawler visiti nuovamente il sitemap, IndexNow notifica il motore in tempo reale che un’URL è stata aggiunta, modificata o rimossa. Questa notifica non deve essere inviata in modo ripetitivo per pagine immutate, pena la perdita di credibilità presso il sistema.
La combinazione funziona così: il sitemap XML copre l’intero sito e funge da rete di sicurezza per la scoperta su larga scala, mentre IndexNow accelera la considerazione degli aggiornamenti urgenti. Google non ha adottato IndexNow, ma la sua API di indicizzazione offre un meccanismo simile per i tipi di contenuto idonei.
Sitemap HTML e collegamenti interni: due strumenti complementari
Un sitemap HTML visibile ai visitatori non sostituisce il file XML, ma rinforza il collegamento interno. Ogni link in un sitemap HTML trasmette PageRank verso le pagine profonde che la navigazione principale non copre sempre.
Affinché questa pagina sia utile e non un semplice elenco piatto, deve riflettere la gerarchia reale del sito. Raggruppare i link per categoria, con un livello di profondità limitato a due o tre livelli, offre al visitatore come al crawler una mappatura leggibile della struttura.
Un sitemap, sia esso XML o HTML, non è un documento statico. La frequenza di aggiornamento deve seguire il ritmo di pubblicazione del sito. Un file XML obsoleto che fa riferimento a URL morte degrada la fiducia del crawler nei confronti dell’intero dominio. Mantenere questa coerenza tra il sitemap e lo stato reale del sito rimane la condizione principale affinché lo strumento serva realmente la navigazione e l’indicizzazione.



