Vai al contenuto
RBlog

Prova n. 059 SEO

Robots.txt WordPress: esempi e configurazioni 2026

Robots.txt WordPress: esempi e configurazioni 2026

Il file robots.txt dice ai crawler quali parti del sito possono o non possono scansionare. Nel 2026 con la proliferazione di AI bot (GPTBot, ClaudeBot, PerplexityBot), configurare bene robots.txt è più importante che mai. Ti mostro esempi pronti per WordPress, blog, e-commerce, multilingua, e come gestire gli AI bot.

Cos’è robots.txt

File di testo nella root del sito (es: https://example.it/robots.txt) che fornisce istruzioni ai crawler. Sintassi base:

User-agent: Googlebot
Disallow: /private/
Allow: /

Sitemap: https://example.it/sitemap.xml

Esempio base per blog WordPress

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.it/sitemap_index.xml

Blocca admin e ricerca interna (che potrebbero generare URL infinite). Permette admin-ajax (serve a plugin caching e altri).

Esempio per e-commerce WooCommerce

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /?add-to-cart=
Disallow: /?orderby=
Disallow: /?filter_
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.it/sitemap_index.xml
Sitemap: https://example.it/product-sitemap.xml

Blocca pagine carrello/checkout (no indexing utility), parametri filter (evita duplicato), parametri sort.

Gestione AI bot nel 2026

I principali AI crawler:

  • GPTBot (OpenAI): training ChatGPT
  • Google-Extended: training Gemini
  • ClaudeBot (Anthropic): training Claude
  • Anthropic-AI: training Claude alternativo
  • PerplexityBot: indexing Perplexity
  • Applebot-Extended: training Apple Intelligence
  • CCBot (Common Crawl): dataset training generale

Strategia 1: permetti tutti gli AI bot (default 2026)

# AI bots — esplicitamente permessi
User-agent: GPTBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: CCBot
Allow: /

Pro: il tuo contenuto può essere citato da ChatGPT, Claude, Perplexity, Gemini. Brand awareness aumenta.

Contro: zero compensazione per il training. I tuoi dati alimentano modelli che competono con la tua audience.

Strategia 2: blocca tutti gli AI bot

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

Pro: i tuoi contenuti non vengono usati per training. Protezione IP.

Contro: gli LLM non ti citano mai. Mancano traffico futuro da AI Overviews/ChatGPT.

Strategia 3: bilanciata (consigliata 2026)

Permetti i bot che ti citano live (PerplexityBot, ChatGPT con browsing), blocca training-only:

# Citation/realtime — permetti
User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

# Training only — blocca
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Anthropic-AI
Disallow: /

Esempio multilingua (WPML/Polylang)

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/

Sitemap: https://example.it/sitemap.xml
Sitemap: https://example.it/en/sitemap.xml
Sitemap: https://example.it/fr/sitemap.xml

Una sitemap per lingua, tutte dichiarate.

Errori comuni nelle PMI italiane

1. Blocca l’intero sito per errore

User-agent: *
Disallow: /

Errore fatale: nessuno indicizza nulla. Capita quando si copia configurazione “sviluppo” in produzione.

Check: visita tuosito.it/robots.txt. Se vedi Disallow: / come prima riga, panico.

2. Blocca CSS/JS

Disallow: /wp-content/themes/
Disallow: /wp-content/plugins/

Errore comune in vecchi tutorial 2010-2015. Google non capisce il layout perché non può leggere CSS/JS. Penalizzazione.

Fix: rimuovi queste righe.

3. Sitemap dichiarata in robots ma URL sbagliato

Sitemap: https://example.it/sitemap.xml

Ma sitemap reale è su /sitemap_index.xml. Google non trova sitemap.

Fix: verifica URL sitemap esatta. Yoast usa sitemap_index.xml, RankMath sitemap_index.xml o sitemap.xml.

4. Robots.txt mancante completamente

WordPress default genera robots.txt virtuale base. Se hai installato sicurezza plugin che lo disattiva, problema.

Fix: visita /robots.txt. Se 404, crea file fisico nella root.

Come modificare robots.txt in WordPress

Opzione 1: plugin SEO

Yoast o Rank Math hanno editor robots.txt nel pannello admin. SEO > Tools > File editor.

Opzione 2: file fisico

Carica via FTP/SFTP robots.txt nella root del sito (stesso livello di wp-config.php).

Opzione 3: custom code

In functions.php:

add_filter('robots_txt', function($output, $public) {
    $output .= "Disallow: /private/\n";
    return $output;
}, 10, 2);

Validazione

Tool gratuiti:

  • Search Console > robots.txt Tester (legacy ma ancora utile)
  • Screaming Frog Free: check crawl rispetta robots
  • TechnicalSEO.com robots.txt checker: online gratuito

Test obbligatorio dopo ogni modifica. 30 secondi.

Per schema markup e altri SEO tools vedi anche la guida schema markup senza plugin.

FAQ robots.txt WordPress 2026

Devo bloccare AI bot per legge?

No, scelta volontaria. GDPR non impone blocco AI bot. Decisione strategic-marketing.

Robots.txt è sufficiente per privacy?

No. Per protezione vera serve noindex meta tag + autenticazione. Robots.txt è “soft block” che bot etici rispettano. I bot maligni lo ignorano.

Quanto spesso aggiornare robots.txt?

Audit ogni 6 mesi o dopo cambio struttura sito (migrazione, nuove sezioni, plugin nuovi).

Posso bloccare singole pagine via robots.txt?

Sì ma è meglio usare meta noindex nella pagina. Robots.txt previene crawl, ma pagine già indicizzate restano nei result.

Robots.txt impatta i Core Web Vitals?

No. Robots.txt è meta, non impatta performance frontend. Solo controlla cosa il crawler legge.

Cosa fare oggi

Apri tuosito.it/robots.txt nel browser. Verifica: 1) il file esiste, 2) non blocca tutto, 3) include sitemap, 4) ha direttive AI bot (allow o disallow a tua scelta). Se uno solo di questi punti fallisce, sistema in 10 minuti. Setup robots.txt corretto è 80% del lavoro SEO base.

Articoli correlati

Rafael Patron, Chief AI Officer, ritratto ufficiale

Scritto da

Rafael Patron

Chief AI Officer di Intarget DMCC e Presidente del Comitato Tecnico-Scientifico di AIPIA.

Chi sono rafaelpatron.com

Vuoi parlarne per la tua azienda? Parla con Rafael di AI e marketing

Altre prove in SEO

Tutta la categoria