Ugrás a tartalomra
Ipponar

robots.txt és az AI-botok: mit engedj, mit tilts?

Publikálva:

Az AI-botok robots.txt-kezelésénél az a kulcs, hogy nem egyetlen bot van: külön botok gyűjtenek tanítóadatot, külön botok építik az AI-keresők találatait, és külön botok járnak el a felhasználó kérésére. Amit a tanító-botnak tiltasz, az a láthatóságodat nem érinti — amit a kereső-botnak, az igen.

Háromféle bot, háromféle tét

A tanító-botok a nyelvi modellek tanításához gyűjtenek tartalmat — a tiltásuk elvi vagy üzleti döntés, a keresési megjelenésed a szolgáltatók dokumentációja szerint nem függ tőlük. A kereső-botok az AI-keresők találatait építik: az ő tiltásuk közvetlen láthatóság-vesztés. A felhasználói botok pedig akkor indulnak, amikor egy konkrét ember kérdez — és náluk a robots.txt nem is mindig érvényesül.

A fontosabb botok névsora hivatalos forrásból

  • OpenAI: a GPTBot a modellek tanításához gyűjt; az OAI-SearchBot a ChatGPT keresési találatait építi — tiltása esetén az OpenAI szerint nem jelensz meg a keresési válaszokban, navigációs linkként még igen; a ChatGPT-User a felhasználó kérésére tölt le oldalt, és rá a robots.txt az OpenAI megfogalmazása szerint „nem feltétlenül érvényes".
  • Google: a Google-Extended nem bot, hanem robots-token: a Gemini-tanítást és a grounding-felhasználást szabályozza. A keresést és az AI-áttekintést nem — azt a Googlebot vezérli. Részletek: Google-Extended fogalommagyarázat.
  • Perplexity: a PerplexityBot a találatokhoz gyűjt és linkel — modell-tanításra a dokumentáció szerint nem; a Perplexity-User a felhasználó kérésére látogat, és a robots.txt-t „jellemzően figyelmen kívül hagyja".
  • Anthropic (Claude): a ClaudeBot a tanításhoz gyűjt; a Claude-SearchBot a keresési minőséget javítja; a Claude-User a felhasználói kérdésekhez tölt le oldalt.

Mit engedj, ha látszani akarsz

Az ökölszabály egyszerű: a kereső-botok tiltása közvetlen láthatóság-vesztés, a tanító-botok tiltása a vendor-dokumentációk szerint a keresési megjelenést nem érinti. Ha a cél a vevőszerzés, az OAI-SearchBot, a PerplexityBot és társaik beengedése az alap — a GPTBot vagy a Google-Extended sorsa pedig külön, elvi döntés.

Minden fenti állítás a szolgáltatók saját, hivatalos dokumentációján alapul — a szabályaik változhatnak, ezért évente érdemes újranézni őket. Hogy a ChatGPT a gyakorlatban hogyan használja a beengedett tartalmat, azt a ChatGPT-fogalommagyarázat mutatja be.

Fontos korlát: nem minden bot kérdez

A felhasználói botok kategóriája kilóg a sorból: mivel a lekérést egy konkrét ember kérdése indítja, ezek a botok a robots.txt-t nem feltétlenül tartják tiszteletben — az OpenAI szerint a szabályok „nem feltétlenül érvényesek", a Perplexity kimondja, hogy a Perplexity-User „jellemzően figyelmen kívül hagyja" őket.

A robots.txt tehát nem tűzfal, hanem irányítási eszköz a jóhiszemű botoknak. Aki valóban el akar zárni valamit a nyilvánosság elől, annak nem robots-szabály kell, hanem hozzáférés-védelem.

Példa robots.txt

Az alábbi minta illusztráció egy gyakori felálláshoz: a tanító-botok tiltva, a kereső-botok engedve. Nem ajánlás — a saját döntésedet tükrözze:

# Tanito botok tiltasa (pelda — sajat dontes kerdese)
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

# Kereso botok engedese (lathatosag)
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

A robots.txt mellett létezik egy másik, kifejezetten az AI-rendszereknek szánt jelzőfájl is — hogy mit ér és mit nem, arról az llms.txt-cikkünk szól. A Perplexity működését pedig a Perplexity-fogalommagyarázat veszi végig.

← Vissza a Tudástárba