Webul nu a fost niciodată doar al oamenilor. De când există site-uri, există și vizitatori automați: programe care accesează pagini într-un scop propriu. Cei mai cunoscuți sunt crawlerele motoarelor de căutare, iar majoritatea proprietarilor de site-uri se bucură să le vadă, pentru că așa ajungi să fii găsit. Traficul automat ține, pur și simplu, de viața oricărui site, iar cea mai mare parte a lui e fie utilă, fie inofensivă.
În ultima vreme a apărut tot mai des un nou tip de vizitator automat, aflat într-o zonă de mijloc interesantă. E vorba de crawlerele care adună conținut pentru inteligența artificială: unele colectează text pentru antrenarea modelelor, altele accesează pagini în timp real ca să răspundă la o întrebare pe care cineva a pus-o unui asistent. Nu sunt crawlerele de căutare pe care le-ai vrut dintotdeauna și nu sunt nici scraperele rău-intenționate pe care ai vrut dintotdeauna să le ții departe. Sunt altceva, iar dacă le primești sau nu e o alegere adevărată, nu un răspuns evident.
Părerea noastră e că decizia îi aparține proprietarului site-ului, nu nouă și nici crawlerului. Așa că o tratăm ca pe o setare: fiecare site își alege o poziție, iar noi o aplicăm acolo unde are cel mai mult efect, la marginea rețelei, înainte ca traficul să ajungă la site.
Un nou tip de vizitator
Merită lămurit ce fac de fapt aceste crawlere, pentru că nu sunt toate la fel. Unele adună cantități mari de text pentru antrenarea modelelor AI. Altele intră în scenă chiar când cineva pune o întrebare unui asistent: citesc o pagină sau două ca să găsească răspunsul și pot afișa conținutul tău sau pot pune un link către el. În primul caz e vorba de construirea unui sistem; al doilea seamănă mai degrabă cu o cale nouă prin care te pot descoperi oamenii.
Diferența asta e motivul pentru care nu există un singur răspuns corect. Un crawler care ți-ar putea trimite cititori interesați e cu totul altceva decât unul care citește tot ce ai publicat ca să ajute la construirea a ceva de pe urma căruia tu nu vei vedea niciodată nimic. Oameni perfect rezonabili se uită la aceleași două crawlere și ajung la concluzii opuse, și fiecare poate avea dreptate pentru site-ul lui.
De ce răspunsul nu e evident
Să luăm întâi argumentele pentru. Dacă asistenții devin un mod prin care oamenii găsesc informații, să poți fi citit de ei seamănă puțin cu ce însemna să fii indexat de motoarele de căutare acum douăzeci de ani. Poate vrei ca ideile tale să apară acolo, afacerea ta să fie menționată, paginile tale să fie citate ca sursă. Pentru multe organizații, vizibilitatea face mai mult decât orice le-ar costa un crawler.
Acum argumentele împotrivă. Conținutul tău e munca ta și poate nu vrei să fie absorbit într-un sistem care nu îți dă nimic înapoi. Nici accesările masive nu sunt gratuite: un crawler insistent care parcurge un site mare consumă resurse de server care ar trebui să fie ale vizitatorilor tăi. Pentru unii proprietari calculul e simplu, iar răspunsul e nu. Cei mai mulți sunt undeva la mijloc: vor să rămână deschiși, dar nu să fie aspirați cu totul. Tocmai zona asta de mijloc face ca o regulă unică pentru toți să nu ajute pe nimeni, pe când o alegere, da.
robots.txt și convențiile care prind contur
Webul are de mult o cale prin care un site le spune vizitatorilor automați ce vrea de la ei: un fișier numit robots.txt, aflat la rădăcina site-ului, care spune cine e binevenit și ce zone poate vizita. Crawlerele de bună-credință îl citesc și îl respectă, iar de zeci de ani el reglează discret felul în care motoarele de căutare parcurg site-urile.
Același mecanism se extinde acum și la crawlerele AI. Multe dintre ele publică numele sub care se identifică, așa că un site le poate numi în robots.txt și le poate spune da sau nu. Apar și convenții mai noi, care îi permit unui site să exprime preferințe mai precise despre felul în care îi poate fi folosit conținutul, iar lucrurile încă se așază. Le urmărim pe măsură ce evoluează, așa că un site aflat în grija noastră își declară preferințele exact în forma pe care o așteaptă convențiile actuale, nu într-una ghicită, pe care nu o recunoaște niciun crawler.
De ce o rugăminte politicoasă nu e de ajuns
Există o limită importantă în toată povestea asta. robots.txt e o rugăminte, nu o barieră. Un crawler cuminte îl citește și se conformează, și cele cuminți sunt majoritatea. Dar o rugăminte merge doar cu cei dispuși să o respecte, iar fișierul în sine nu oprește un crawler hotărât să îl ignore.
Așa că o preferință declarată are nevoie de ceva în spate pentru cazurile în care politețea nu mai ajunge. Dacă un proprietar de site a decis să țină departe un anumit tip de crawler, decizia trebuie să țină indiferent dacă acel crawler cooperează sau nu. Aici dorința exprimată trebuie dublată de puterea de a o impune, și tot aici alegerea devine reală, nu doar o recomandare.
Trei poziții, aplicate la marginea rețelei
În practică îi oferim unui proprietar de site trei poziții mari. Primire, adică aceste crawlere sunt tratate cam ca motoarele de căutare și lăsate să își facă treaba. Limitare, adică sunt permise, dar ținute într-un ritm măsurat, ca să poată citi site-ul fără să îl copleșească vreodată și fără să le ia locul vizitatorilor reali. Și blocare, adică sunt întoarse din drum. Un site le poate și combina, primind un tip de crawler și blocând altul, pentru că cele două sunt cu adevărat diferite.
Oricare ar fi alegerea, o aplicăm la marginea rețelei, în stratul care stă în fața site-ului. Asta contează dintr-un motiv practic. Dacă traficul automat e identificat și tratat acolo, trierea nu ajunge niciodată pe serverele care deservesc vizitatorii tăi, iar un om care îți citește site-ul nu e niciodată încetinit sau pus la verificare din cauza unei reguli gândite pentru mașini. Același strat de margine care ține în frâu traficul cu adevărat ostil e și locul unde se aplică aceste preferințe, calm și fără efecte colaterale.
Proprietarul decide
Nimic din toate astea nu e motiv de panică. Traficul automat, inclusiv soiul ăsta nou, face parte din normalitatea webului și poate fi ținut pe banda lui ca orice altceva. Ce s-a schimbat e că a apărut o decizie nouă, care acum câțiva ani nu exista, și că răspunsul corect depinde în întregime de rostul fiecărui site.
Noi îți dăm posibilitatea să iei decizia asta în cunoștință de cauză și să o faci să țină. Unele dintre site-urile aflate în grija noastră primesc crawlerele AI, unele le limitează, unele le țin la distanță, iar câteva tratează diferit crawlere diferite. Toate sunt corecte, pentru că reflectă ce vrea fiecare proprietar. Poziția o alegi tu; treaba noastră e să o facem respectată.
