Guide
AI-crawlers i robots.txt – ska du blockera GPTBot och ClaudeBot?
AI-crawlers i robots.txt
Frågan kommer nästan alltid i fel form: "ska vi blockera AI:n?" Det finns ingen AI att blockera. Det finns en handfull namngivna robotar med olika uppdrag, och beslutet ser olika ut för var och en.
Vem är vem
| GPTBot | OpenAI | Hämtar material som kan användas för modellträning | Ditt innehåll används inte som träningsdata. Påverkar inte omnämnanden i svar. |
| OAI-SearchBot | OpenAI | Indexerar för sökfunktionen i ChatGPT | Du kan inte längre dyka upp i ChatGPT:s sökbaserade svar. |
| ChatGPT-User | OpenAI | Hämtar en sida när en användare ber om just den | En användare som ber ChatGPT läsa din sida får ett nej. |
| ClaudeBot | Anthropic | Hämtar material för träning. Anthropic kör även separata robotar för användarutlösta hämtningar och sök | Ditt innehåll används inte som träningsdata – men kolla de övriga namnen separat innan du blockerar brett. |
| PerplexityBot | Perplexity | Indexerar för Perplexitys sökbaserade svar | Du kan inte längre citeras av Perplexity. |
| Google-Extended | Styr användning i Googles AI-produkter, ej Sök | Påverkar inte din ranking i Google Sök – men tar dig inte ur AI Overviews, se nedan. | |
| CCBot | Common Crawl | Bygger ett öppet arkiv som många använder | Ditt innehåll utesluts ur ett dataset många bygger vidare på. |
Den rad som orsakar mest oavsiktlig skada är den om OAI-SearchBot. Den som läst att man "bör blockera OpenAI" och skrivit in det generellt har i praktiken ofta stängt både träningshämtningen och sökhämtningen – alltså gett bort exakt den synlighet artikeln handlade om.
Avvägningen, ärligt beskriven
Det finns ett verkligt intresseglapp här och det är inte konstigt att branschen är kluven. Å ena sidan: ditt innehåll används för att träna kommersiella modeller utan ersättning, och för publicister vars affär är annonser på egna sidor är AI-svar som besvarar frågan utan klick ett direkt intäktstapp. Å andra sidan: för en verksamhet vars affär är bokningar är ett omnämnande i ett AI-svar ren marknadsföring, och att blockera sig ur den kanalen är att avstå exponering av principskäl.
Vilket som väger tyngst beror på hur du tjänar pengar. Ett hotell och en dagstidning har rakt motsatta intressen i samma fråga, och det finns inget branschgemensamt svar – de uppställningar som cirkulerar som "bästa praxis" är i regel någons avvägning, inte ett uppmätt resultat.
- Säljer du något på plats – boende, mat, upplevelser: omnämnande är värdefullt. Sökrobotarna bör släppas in.
- Är innehållet i sig produkten – nyheter, kurser, betalt material: du har mer att förlora och skäl att vara restriktiv.
- Har du unikt researcharbete du inte vill ska bli träningsdata: blockera träningsrobotarna, släpp in sökrobotarna. Det är fullt möjligt att göra båda.
- Är du osäker: gör ingenting. Standardläget är att robotarna släpps in, och det är för de flesta besöksnäringsföretag det gynnsammaste läget.
Google-Extended tar dig inte ur AI Overviews
En vanlig missuppfattning värd att reda ut, eftersom den kostar synlighet. Google-Extended styr om ditt innehåll får användas i Googles generativa AI-produkter. Den tar dig däremot inte ur AI Overviews – sammanfattningen överst i vanliga sökresultat – eftersom den serveras från Googles vanliga sökindex och hämtas av Googlebot.
Vill du begränsa hur ditt innehåll återges i AI Overviews är det utdragskontrollerna som gäller (`nosnippet`, `max-snippet`, `data-nosnippet`), och de slår mot dina vanliga sökresultatsutdrag samtidigt. Det finns ingen inställning som betyder "ja till Google Sök, nej till AI Overviews". Blockerar du Google-Extended i tron att du lämnat AI Overviews har du alltså avstått från Gemini utan att uppnå det du ville.
Två saker att veta innan du skriver raden
Det första: robots.txt är en instruktion, inte ett lås. Den bygger på frivillig efterlevnad. De stora aktörerna respekterar den, men filen hindrar ingen tekniskt från att hämta sidan. Vill du faktiskt spärra åtkomst krävs blockering på server- eller brandväggsnivå.
Det andra: en blockering du ångrar återställs inte omedelbart. Tar du bort raden måste roboten hinna hämta din robots.txt igen och sedan indexera om sidorna. Det är ingen knapp som slår om samma dag, så fatta beslutet med det i åtanke.
Kontrollera vad som redan står i din fil
Öppna din-domän.se/robots.txt i webbläsaren. Många sajter har fått rader tillagda av ett tillägg, ett tema eller en tidigare leverantör utan att någon fattat ett beslut om saken. Det är värt en minut att läsa igenom vad som faktiskt står där innan du diskuterar strategi.
Vanliga frågor
Om jag blockerar Google-Extended, tappar jag ranking i Google?
Nej. Google anger att Google-Extended styr användningen av innehållet i deras generativa AI-produkter och att det är skilt från Googlebot, som sköter indexering för Google Sök. Blockeringen påverkar alltså inte din ranking i sökresultatet.
Kan jag blockera träning men tillåta att jag citeras?
Ja, det är just därför robotarna har olika namn. Du kan neka de robotar som hämtar träningsmaterial och samtidigt tillåta dem som indexerar för sökbaserade AI-svar. Namnen ändras dock över tid, så uppställningen behöver ses över då och då.
Hindrar robots.txt att mitt innehåll används?
Inte tekniskt. Filen är en förfrågan som seriösa aktörer följer frivilligt. Den hindrar inte en robot som väljer att strunta i den, och den påverkar inte innehåll som redan hämtats tidigare eller som finns kopierat på andra sajter.
Vi har ingen robots.txt alls. Är det ett problem?
Nej. Saknas filen tolkas det som att allt får hämtas, vilket för de flesta besöksnäringsföretag är det läge man ändå vill ha. En robots.txt behövs först när du vill undanta något.