AI crawlers și robots.txt: cum decizi ce boți lași să citească site-ul fără să pierzi vizibilitate SEO
Tot mai multe firme se întreabă dacă ar trebui să blocheze AI crawlers: GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot sau alte user-agents care apar în loguri și în ghiduri de AEO. Întrebarea pare tehnică, dar decizia este comercială. Dacă blochezi prea mult, poți limita descoperirea conținutului. Dacă permiți tot, poți lăsa conținutul să fie colectat pentru scopuri pe care nu le-ai ales explicit.
Răspunsul pragmatic este să separi trei lucruri: crawlere de search, crawlere de training și agenți care acționează la cererea unui utilizator. Nu toate au același rol, iar un robots.txt copiat dintr-un ghid generic poate crea probleme dacă nu știi ce blochează.
Keyword-uri și întrebări cu intenție bună
Subiectul este o oportunitate pentru departamentuldemarketing.ai pentru că site-ul avea mențiuni punctuale despre robots.txt și AI crawlers, dar nu un ghid separat despre decizia de business din spatele politicii de crawling.
Clusterul relevant include:
AI crawlersrobots.txt AIGPTBotOAI-SearchBotGooglebotChatGPT SearchAI Crawl Control
Întrebările potrivite pentru SEO și AEO sunt:
Ce AI crawlers ar trebui să permiți în robots.txt?Care este diferența dintre GPTBot și OAI-SearchBot?Dacă blochez AI crawlers pierd trafic SEO?robots.txt oprește indexarea?Cum controlezi conținutul în AI Overviews?
Răspuns rapid: ce boți blochezi și ce boți lași
Nu bloca automat toate crawlerele doar pentru că au legătură cu AI. Înainte de orice regulă, stabilește scopul:
- pentru vizibilitate în căutare și răspunsuri cu linkuri, ai interes să permiți crawlerele de search relevante;
- pentru training de modele, poți decide separat dacă permiți sau blochezi accesul;
- pentru agenți inițiați de utilizatori, decizia depinde de experiența pe care vrei să o oferi și de riscul de abuz;
- pentru pagini private, conținut confidențial sau zone fără valoare publică,
robots.txtnu este suficient; folosește autentificare,noindexsau control de acces.
În practică, politica bună nu este "allow all" sau "block all", ci o listă clară de reguli pe tipuri de boți și pe tipuri de pagini.
Ce este un AI crawler
Un AI crawler este un bot care accesează pagini web pentru un scop legat de sisteme AI. Acest scop poate fi foarte diferit de la un bot la altul:
- indexare pentru rezultate de căutare sau răspunsuri cu citări;
- colectare de date pentru antrenarea modelelor;
- acces la o pagină la cererea unui utilizator;
- verificare de conținut, audit sau securitate;
- analiză de trafic și clasificare.
De aceea, numele generic "AI bot" nu ajută suficient. Trebuie să vezi user-agentul, operatorul, scopul declarat și dacă există IP-uri publicate sau metode de verificare.
Diferența dintre Googlebot, OAI-SearchBot, GPTBot și ChatGPT-User
Googlebot
Google Search folosește Googlebot pentru crawling. Google explică în documentația despre Googlebot că există Googlebot Smartphone și Googlebot Desktop, dar ambele folosesc același token în robots.txt. Pentru majoritatea site-urilor, Google indexează în principal versiunea mobilă a conținutului.
Un detaliu important: blocarea Googlebot în robots.txt oprește crawlingul, dar nu este metoda potrivită dacă vrei doar să scoți o pagină din index. Pentru neindexare folosești noindex, nu doar robots.txt.
OAI-SearchBot
OpenAI descrie OAI-SearchBot ca bot folosit pentru search, astfel încât site-urile să poată apărea în funcțiile de search din ChatGPT. Documentația OpenAI spune că site-urile care se opun prin robots.txt pentru OAI-SearchBot nu vor fi afișate în răspunsurile ChatGPT Search, deși pot apărea în continuare ca linkuri navigaționale.
Pentru o firmă care vrea descoperire în ChatGPT Search, acesta este un bot care trebuie evaluat separat de boții de training.
GPTBot
OpenAI descrie GPTBot ca bot folosit pentru crawling de conținut care poate fi utilizat la antrenarea modelelor generative. În aceeași documentație, OpenAI spune că blocarea GPTBot indică faptul că site-ul nu dorește ca acel conținut să fie folosit pentru antrenarea modelelor generative.
Asta nu este aceeași decizie ca blocarea vizibilității în search.
ChatGPT-User
ChatGPT-User este folosit pentru anumite acțiuni inițiate de utilizatori în ChatGPT și Custom GPTs. OpenAI precizează că nu este folosit pentru crawling automat al webului și nu determină dacă un conținut poate apărea în Search. Pentru managementul opt-out-ului de Search, documentația indică OAI-SearchBot.
Pentru un site de servicii, diferența contează: un utilizator poate cere unui agent să citească pagina ta de prețuri sau contact. Blocarea unui agent user-initiated poate reduce utilitatea site-ului în unele fluxuri AI, dar poate fi justificată pentru pagini sensibile.
robots.txt nu este același lucru cu noindex
robots.txt controlează crawlingul pentru boții care îl respectă. Nu este o metodă de confidențialitate și nu garantează că o adresă URL nu va apărea niciodată în rezultate dacă este descoperită prin alte surse.
Google explică în documentația despre Googlebot că:
- pentru a preveni crawlingul, folosești
robots.txt; - pentru a nu afișa o pagină în Google, folosești
noindex; - pentru a bloca accesul real la conținut, folosești autentificare sau alte metode de protecție.
Pentru AI Overviews și AI Mode, Google indică și controale precum nosnippet, data-nosnippet și max-snippet. În documentația despre robots meta tags, Google precizează că nosnippet și max-snippet se aplică și formelor de rezultate precum AI Overviews și AI Mode.
Ce se schimbă în 2026 la controlul crawlerelor AI
Cloudflare a introdus setări mai granulare pentru boți clasificați pe comportamente. În documentația despre Block AI Bots, Cloudflare descrie trei categorii relevante:
- Search: crawlere care colectează sau indexează conținut pentru a răspunde ulterior la întrebări;
- Agent: activitate automată în timp real în numele unei persoane;
- Training: crawlere care colectează conținut pentru antrenarea sau ajustarea modelelor, inclusiv unele crawlere cu scop mixt.
Cloudflare anunță că pe 15 septembrie 2026 va seta noi valori implicite pentru domenii noi: Search rămâne permis, iar Training și Agent vor fi blocate pe paginile cu reclame. Pentru clienții existenți, setările pot fi schimbate din dashboard.
Pentru firmele din România, implicația este simplă: dacă folosești Cloudflare sau o soluție similară, nu te baza doar pe un fișier robots.txt. Verifică și politicile din CDN, WAF sau sistemul de bot management.
Cum faci o politică de crawler fără să pierzi vizibilitate
1. Inventariază paginile
Separă site-ul în categorii:
- pagini publice comerciale;
- articole și ghiduri;
- pagini de prețuri;
- pagini de contact;
- zone private;
- documente interne sau fișiere care nu trebuie indexate.
Nu toate paginile au nevoie de aceeași politică. Un articol public poate fi bun pentru search și AEO. Un document intern nu trebuie protejat prin robots.txt, ci prin acces restricționat.
2. Decide ce înseamnă vizibilitate pentru tine
Dacă vrei să apari în răspunsuri AI care trimit trafic sau citări, nu bloca automat boții de search. În schimb, poți evalua separat boții de training.
Pentru multe firme locale sau B2B, vizibilitatea în răspunsuri asistate de AI poate conta în faza de research. Un potențial client poate întreba "ce agenții SEO oferă consultanță locală în România" sau "cum compar un abonament SEO". Dacă paginile tale sunt inaccesibile pentru sistemele care alimentează răspunsurile, șansa de a fi menționat scade.
3. Verifică user-agentul și IP-urile
User-agentul poate fi falsificat. Pentru boți importanți, folosește surse oficiale:
- Google recomandă verificarea Googlebot prin reverse DNS sau IP ranges;
- OpenAI publică IP-uri pentru OAI-SearchBot, GPTBot și ChatGPT-User;
- Cloudflare listează crawlere AI cunoscute și oferă categorii de boți în AI Crawl Control.
Nu lua decizii doar după un șir din loguri.
4. Separă trainingul de search
O regulă orientativă poate fi:
- permiți boții de search dacă vrei vizibilitate în răspunsuri cu linkuri;
- blochezi boții de training dacă nu vrei folosirea conținutului pentru antrenare;
- permiți sau limitezi agenții user-initiated în funcție de pagini și risc;
- monitorizezi logurile după orice schimbare.
Această separare este mai bună decât un Disallow: / aplicat tuturor user-agents legați de AI.
Exemplu de gândire pentru robots.txt
Nu copia următorul exemplu fără verificare. Este doar o schemă de decizie:
# Permite crawlerul de search dacă vrei vizibilitate în ChatGPT Search
User-agent: OAI-SearchBot
Allow: /
# Blochează crawlerul de training dacă aceasta este politica firmei
User-agent: GPTBot
Disallow: /
# Reguli generale pentru zone fără valoare publică
User-agent: *
Disallow: /admin/
Disallow: /private/
Pentru Google, nu bloca Googlebot dacă vrei vizibilitate în Search, Discover, AI Overviews și AI Mode. Dacă ai o pagină publică dar nu vrei snippet, folosește controale de preview. Dacă ai o pagină care nu trebuie indexată, folosește noindex. Dacă nu trebuie accesată deloc, pune autentificare.
Ce verifici după schimbare
După ce modifici robots.txt sau setările din Cloudflare, verifică:
- fișierul este accesibil la
/robots.txt; - regulile sunt valabile pentru user-agentul corect;
- Search Console nu raportează pagini importante blocate accidental;
- logurile arată schimbarea așteptată;
- sitemapul nu include pagini blocate inutil;
- paginile comerciale rămân indexabile;
- setările CDN nu contrazic
robots.txt.
Un audit SEO tehnic poate prinde rapid blocări accidentale, dar decizia de business trebuie stabilită înainte de implementare.
Legătura cu SEO și AEO
Pentru SEO clasic, blocarea greșită poate reduce crawlingul și poate întârzia indexarea. Pentru AEO, problema este mai largă: sistemele de răspuns au nevoie de conținut accesibil, clar și verificabil. Google spune că pentru AI Overviews și AI Mode rămân relevante aceleași principii de bază: conținut util, crawling permis, linkuri interne, date structurate corecte și informații textuale accesibile.
De aceea, politica de crawlers trebuie legată de arhitectura de conținut. Dacă vrei să fii citat, paginile trebuie să răspundă concis la întrebări reale. Ghidurile despre copywriting SEO pentru leaduri, schema FAQ și structured data și pagini de servicii locale sunt mai importante decât o listă lungă de user-agents copiată fără context.
Decizia pragmatică
Pentru firme, întrebarea nu este "blocăm AI sau nu?". Întrebarea corectă este:
- ce conținut vrem să fie descoperit;
- ce conținut vrem să fie folosit doar în search, nu la training;
- ce pagini trebuie protejate prin acces real;
- ce boți aduc valoare prin citări, răspunsuri sau trafic;
- ce riscuri acceptăm.
O politică bună de AI crawlers protejează conținutul sensibil, păstrează vizibilitatea pentru paginile publice importante și evită blocările largi care taie din SEO fără să rezolve problema reală.
Surse folosite
- Google Search Central: Googlebot
- Google Search Central: AI features and your website
- Google Search Central: Robots meta tag specifications
- OpenAI: Overview of OpenAI Crawlers
- Cloudflare: Block AI Bots
- Cloudflare: Manage AI crawlers
Transparență AI: acest conținut poate fi redactat sau structurat cu ajutorul unor instrumente AI și este verificat editorial înainte de publicare. Imaginile generate sau modificate cu AI sunt folosite cu rol ilustrativ.
