Înapoi la Blog

Ar trebui să blochez crawlerele AI sau să le măsurez mai întâi valoarea? – Întrebați un SEO

Ar trebui să blochez crawlerele AI sau să le măsurez mai întâi valoarea? – Întrebați un SEO

🔥Cohorta Keystone:
Fii sursa citată de AI
Structura și schema de conținut
ÎNREGISTREAZĂ-TE ACUM
Întrebați un SEO
Întrebarea de astăzi privește dincolo de obiectivele tipice de generare a traficului ale vizibilității inteligenței artificiale la valoarea pe care acele modele mari de limbă o oferă proprietarului site-ului web și întreabă:
"Crawlerele AI îmi vizitează din ce în ce mai des site-ul, dar nu pot spune dacă oferă vreo valoare. Ar trebui să le permit, să le blochez sau să tratez diferit crawlerele AI? Cum pot măsura dacă activitatea lor duce la citări, trafic de recomandare sau conversii înainte de a lua această decizie?"
Mulți SEO nu își dau seama de costul ca roboții să le viziteze site-ul. Recent, odată cu proliferarea roboților AI, costurile de a permite oricui și tuturor să acceseze conținutul dvs. devin o afacere costisitoare.
Tipuri de crawlere AI
Mai întâi, să ne uităm la diferitele tipuri de roboți care vizitează un site web.
Boții obișnuiți care vor vizita un site web în mod regulat îi includ pe cei pe care vrem să avem acces la site-ul nostru, de exemplu, roboții pentru motoarele de căutare. Aceștia nu sunt singurii roboți, dar sunt adesea unii dintre cei mai prolifici consumatori de lățime de bandă. Pe lângă roboții de căutare, vor exista instrumente. Acestea pot include boți de la monitoare de funcționare, instrumente de căutare și analiză și scanere de securitate și vulnerabilitate.
În general, proprietarii de site-uri trebuie să decidă dacă roboții care le vizitează site-ul ar trebui să li se permită să continue sau dacă fac mai mult rău decât bine. Exemple de roboți pe care managerii de site-uri îi blochează adesea sunt cei care încearcă să curețe informații despre produs pentru a alimenta baza de date a altui site web sau roboții rău intenționați care caută vulnerabilități de conectare. Dacă blocați sau nu acești roboți este o decizie destul de ușoară – aceștia prezintă un risc pentru proprietatea intelectuală a mărcii sau pentru siguranța site-ului web.
Boții AI s-ar putea situa de fapt undeva între acești roboți „bune” și „răi”.
Boți de antrenament AI
Acești roboți, de exemplu, GPTBot de la OpenAI, caută pe web informații pentru a alimenta modelele de antrenament AI. Ele ajută la crearea bazei de cunoștințe de la care învață LLM, inclusiv entitățile și modul în care acestea se relaționează între ele.
Pentru mulți proprietari de site-uri web, acestea sunt cele mai controversate crawler-uri AI. Scopul lor principal nu este acela de a trimite traficul înapoi pe site-ul dvs., ci de a „citi” și de a colecta informații care pot fi folosite pentru a instrui și îmbunătăți modelele. În unele cazuri, acel conținut poate fi folosit ulterior pentru a răspunde la întrebările utilizatorilor fără a genera o vizită la sursa originală. Acest lucru face mai dificilă trasarea unei linii directe între activitatea crawler-ului și valoarea afacerii.
Căutare Bots de indexare
Acești roboți, OAI-SearchBot de la OpenAI, de exemplu, revizuiesc pagini și colectează informații pentru a afișa și a lega site-uri web în „rezultate de căutare” LLM, nu pentru a antrena modele de fundație.
Acestea sunt adesea mai ușor de justificat, deoarece scopul lor este mai apropiat de cel al unui motor de căutare tradițional. Dacă vă indexează conținutul astfel încât să poată fi citat în răspunsurile generate de AI , au o cale mai evidentă pentru a crea vizibilitate, trafic de recomandare și cunoaștere a mărcii.
Preluări declanșate de utilizator
Acești roboți, inclusiv ChatGPT-User de la OpenAI, preiau pagini la cerere atunci când utilizatorii întreabă despre anumite site-uri web sau documente, mai degrabă decât să se bazeze doar pe un index pre-construit sau pe o bază de cunoștințe.
Aceste preluari reprezintă interesul real al utilizatorilor pentru site-ul dvs. Ei caută în mod special informații suplimentare sau context despre conținutul, afacerea sau produsele dvs. Acesta este un indicator valoros al locului lor în canalul de cumpărare. Ei ți-au descoperit deja marca și acum se scufundă mai adânc în conținutul tău.
Cum să blocați AI Bots
OpenAI și-a actualizat documentația, astfel încât ChatGPT-User, programul de preluare declanșat de utilizator, să nu se mai angajeze să onoreze robots.txt al unui site web. Perplexity se comportă într-un mod similar, cu Perplexity-User. Așadar, robots.txt, pe care SEO-urile l-au folosit în mod fiabil de ani de zile pentru a controla roboții majori, acum blochează doar antrenamentul și crawlerele de căutare conforme. Pentru boții declanșați de utilizator și neconformi, aveți nevoie de blocare la nivel de server sau WAF.
Blocare la nivel WAF
Un WAF (firewall pentru aplicații web) se află în fața serverului unui site web și acționează ca un punct de control de inspecție. Un WAF poate fi configurat pentru a permite numai anumiți roboți sau pentru a permite toți roboții, cu excepția celor excluși. Acesta este un mod foarte robust de a preveni accesarea unui site web de către roboții nedoriți.
Deși acest lucru nu se află de obicei în domeniul SEO, este posibil să fiți familiarizat cu unele dintre mărcile care oferă blocare la nivel WAF, cum ar fi Cloudflare și AWS. Dacă știți pe ce stivă tehnologică rulează site-ul dvs. web, este posibil să puteți cerceta blocarea WAF înainte de a prezenta ideea echipei de infrastructură. Cu toate acestea, majoritatea companiilor mari vor avea deja o varietate de boți pe care îi blochează, așa că echipele de întreprindere vor avea probabil un proces în vigoare pentru adăugarea sau eliminarea boților din listele WAF.
Regulile serverului
Pot fi adăugate direct pe serverul dvs. reguli care examinează traficul care îl lovește și determină dacă acesta provine de la un bot nesigur. Serverul va verifica elemente precum dacă cererea provine de la o sursă care utilizează automatizare sau nu are anteturile adecvate. Dacă consideră că user-agentul este nesigur pe baza regulilor, nu va lăsa botul să acceseze site-ul.
Riscul de a bloca toți roboții AI
Aici se află dilema. Unii dintre roboții AI distrug proprietatea intelectuală a site-ului dvs. web. Cu toate acestea, dacă le blocați, asta înseamnă că este posibil să nu vă evidențieze marca sau produsele în răspunsurile lor, punându-vă într-un dezavantaj competitiv.
Riscul principal legat de blocarea roboților AI este că este posibil să găsiți site-ul dvs. să nu mai fie citat în răspunsurile LLM. Având în vedere volumul scăzut de trafic de referință pe care îl traversează LLM-urile, acesta poate părea un risc pe care ești dispus să-l asumi.
Cu toate acestea, ceea ce știm este că, deși LLM-urile nu trec același volum de trafic ca motoarele de căutare tradiționale, ele sunt utile în creșterea gradului de conștientizare a mărcii. Dacă marca dvs. nu este cea citată, înseamnă că este cea a unui concurent.
Cu tot ceea ce este legat de AI, trebuie să ne amintim că domeniul evoluează rapid. Este posibil ca LLM-urile să nu treacă mult trafic în acest moment, dar asta nu înseamnă că așa va fi întotdeauna.
Împiedicarea roboților AI să acceseze cu crawlere un site acum ar putea face site-ul invizibil funcțional în viitor, dacă LLM-urile devin metoda principală de descoperire.
În plus, blocarea tuturor roboților AI elimină capacitatea de a testa și de a învăța. Dacă împiedicați fiecare crawler AI să acceseze site-ul dvs., pierdeți oportunitatea de a înțelege ce platforme generează vizibilitate, care vă citează conținutul cu acuratețe și care au potențialul de a deveni surse de trafic semnificative în viitor.
Riscul de a permite toți roboții AI
Cu toate acestea, există, desigur, o amenințare foarte reală cu care se confruntă site-urile de la crawlerele AI astăzi. Cele mai mari două riscuri provin din ferocitatea cu care roboții se târăsc și consumă conținut.
Training privind proprietatea intelectuală
Mulți proprietari de site-uri web sunt incomod cu ideea că conținutul sau activele proprietare ar putea fi folosite pentru a îmbunătăți un model AI fără nicio compensație sau atribuire directă. Aceasta este una dintre cele mai puternice plângeri pe care le auzim de la SEO – îmi vizitați site-ul, îmi luați conținutul, dar nu primesc trafic în schimb.
Preocuparea este deosebit de mare pentru editorii și companiile al căror avantaj competitiv provine din informații sau active unice. Dacă acel conținut devine parte din datele de antrenament ale unui model, este mai puțin nevoie ca utilizatorii să viziteze site-ul web original.
Există, de asemenea, riscul ca roboții să elimine date sau conținut care de fapt face parte dintr-un produs sau serviciu. Pentru un LLM să reambaleze acele informații și să le servească drept răspuns sau generație poate fi devastator pentru companii. De exemplu, artiștii văd fotografii ale lucrării lor fiind ingerate de LLM și folosite pentru a genera imagini „în stilul” propriilor creații. Această utilizare a IP ar putea avea un impact direct asupra profiturilor unei afaceri.
Costuri cu crawlere
Crawlerele AI pot consuma resurse semnificative ale serverului. Site-urile mari raportează frecvent roboții AI care solicită pagini cu o frecvență mult mai mare decât crawlerele tradiționale ale motoarelor de căutare.
Acest cost nu este întotdeauna evident, deoarece este adesea absorbit în taxele generale de găzduire. Cu toate acestea, la scară, accesarea cu crawlere excesivă poate crește consumul de lățime de bandă și poate afecta experiența utilizatorilor reali dacă resursele devin constrânse.
Pentru unele organizații, costul financiar direct al deservirii crawlerelor AI este factorul principal din spatele deciziilor de restricționare sau blocare a acestora.
Cum să identifici ce roboți vizitează site-ul tău
Cel mai mare blocant pentru înțelegerea riscului și a recompensei pentru marca dvs. de la roboții AI este să știți care roboți chiar accesează cu crawlere site-ul dvs.
Aceste date nu sunt întotdeauna ușor de găsit. Să parcurgem câteva moduri prin care putem identifica dacă un bot are sau vă accesează cu crawlere site-ul.
Fișiere jurnal
Fișierele jurnal vor fi cea mai completă sursă de informații despre care roboții vă vizitează site-ul. Descărcarea unui eșantion de jurnalele din ultimele 30 de zile vă poate oferi o idee bună despre ce procent din roboții dvs. sunt conectați la AI.
Fișierele jurnal vor avea probabil tot felul de roboți în ele și ar putea fi nevoie de puțină cercetare pentru a identifica care dintre ei sunt crawler-uri AI. Odată ce ați tradus informațiile user-agent în ceva mai ușor de citit de om, va fi un caz simplu de a adăuga accesările fiecărui bot și de a afla ce procent din total este de la crawlerele AI.
Cu toate acestea, există o mulțime de instrumente disponibile care vor automatiza acest lucru. Există câteva tipuri care ar putea ajuta cu acest exercițiu - analizoare tradiționale de fișiere jurnal și instrumente de urmărire a vizibilității AI.
Analizatoarele de fișiere jurnal vor oferi o defalcare a roboților care provin din motoarele de căutare tradiționale și care provin din AI. Instrumentele de optimizare AI, care sunt în primul rând pentru urmărirea și analizarea vizibilității site-ului dvs. în LLM-uri, au adesea și o funcție de urmărire a agentului AI bazată pe fișierele dvs. jurnal.
Categorie Întrebați un SEO Tehnic SEO
Citiți biografia completă CONTRIBUTOR VIP Helen Pollitt Șefa SEO la Getty Images
#looop_parent
Sursa: Jurnalul motorului de căutare

Author Avatar

kiper

This is a short author bio. It can be stored in the 'users' table in the future. Lorem ipsum dolor sit amet, consectetur adipiscing elit.