
De 30 de ani, World Wide Web-ul funcționează pe baza unui contract social surprinzător de profund: majoritatea site-urilor permit motoarelor de căutare să le acceseze gratuit, dar, dacă le folosești conținutul, le acorzi credit oferind un link către sursă.
În ultima vreme, acest contract social a început să se destrame. Instrumentele bazate pe inteligență artificială (IA) accesează automat site-urile nu pentru a trimite utilizatorii către ele, ci pentru a antrena modele și pentru a genera răspunsuri, care pot fi sau nu corecte.
Atunci când cauți ceva, răspunsul oferit de ChatGPT sau de Google AI Overviews poate include în continuare linkuri către surse, dar acestea au devenit un fel de supliment opțional al răspunsului principal.
Această situație a declanșat o dinamică negativă pentru proprietarii site-urilor, pentru public și chiar pentru companiile de AI: pe măsură ce site-urile pierd trafic și venituri, multe dintre ele încep să blocheze instrumentele AI care le colectează conținutul. În consecință, rezultatele generate de IA ajung să depindă într-o măsură mai mare de site-uri de calitate scăzută, dintre care multe sunt, la rândul lor, generate de AI. Drept rezultat, informațiile bune pot deveni mai greu ca niciodată de găsit.
Cum am ajuns aici
În primii ani ai World Wide Web-ului, motoarele de căutare și creatorii de conținut au ajuns la o înțelegere privind „crawling-ul” – procesul prin care un sistem informatic examinează automat un site pentru a-l indexa, astfel încât acesta să poată fi afișat în rezultatele căutărilor. Creatorii de conținut ofereau acces gratuit la site-urile lor și chiar permiteau motoarelor de căutare să reproducă mici fragmente de text.
În schimb, motoarele de căutare furnizau linkuri către site-urile creatorilor de conținut, iar aceștia beneficiau de traficul web rezultat. Dacă creatorilor de conținut nu le convenea această înțelegere, puteau împiedica motoarele de căutare să le acceseze site-ul prin instrucțiuni introduse într-un fișier numit robots.txt.
Dar dacă instrumentele IA nu mai generează trafic către site-uri, creatorii de conținut sunt eliminați din circuitul economic. În plus, există și alte costuri asociate fiecărei accesări a unui site, astfel încât activitatea crawlerelor IA îi poate costa bani pe administratorii site-urilor fără ca aceștia să obțină veniturile din publicitate sau din alte surse care ar rezulta din traficul produs de utilizatori umani. În plus, crawlerele IA tind să exploreze site-urile mai profund și mai intens decât crawlerele web tradiționale, amplificând aceste costuri.
Această modificare a tiparelor de trafic nu este nici minoră, nici ipotetică. Cloudflare, companie care oferă servicii de infrastructură web și care gestionează 30% sau mai mult dintre primele 10.000 de site-uri ale internetului, estimează că mai mult de jumătate din întregul trafic web este produs în prezent de boți IA.
O parte din acest trafic provine, probabil, de la agenți IAaflați sub supravegherea directă a oamenilor, dar cea mai mare parte va proveni de la crawlere. Proprietarii site-urilor pot utiliza robots.txt pentru a solicita crawlerelor AI să nu le acceseze site-urile – însă unele companii IA pot ignora această solicitare politicoasă.
Dacă firmele de AI respectă însă solicitarea, poate apărea o altă problemă. Site-urile care conțin dezinformare sunt mult mai puțin predispuse să interzică crawlerele AI, ceea ce înseamnă că răspunsurile oferite de IA nu vor mai fi fundamentate într-o măsură la fel de mare pe surse de calitate.
Ce se întâmplă pe termen scurt: Google zero
La orizont se profilează un eveniment numit „Google Zero” – ziua în care traficul trimis de Google către alte site-uri va ajunge la zero. Deși unii veterani încăpățânați, cu părul cărunt – precum unul dintre autorii acestui articol – vor continua poate să dea clic pe surse pentru a verifica răspunsurile AI, acest tip de trafic scade rapid, tocmai ca urmare a rezumatelor generate de inteligența artificială.
Un studiu asupra Wikipedia confirmă acest fenomen, arătând că traficul versiunii în limba engleză a site-ului a scăzut rapid după introducerea rezumatelor IA în căutările Google în limba engleză și că același tipar a apărut și în alte limbi, pe măsură ce rezumatele AI au fost introduse. Faptul că nu mai este nevoie să dai clic pe un site pentru a obține un răspuns poate părea extraordinar pentru cei care caută informații, dar realitatea este mai complicată.
Numeroase site-uri blochează acum complet crawlerele IA. Proprietarii de site-uri care decid să blocheze aceste crawlere au șanse mai mici de a fi menționați prin link în răspunsurile Google AI Overviews, chiar și atunci când instrumentul AI poate continua să acceseze conținutul pentru a-și fundamenta răspunsurile, folosind o tehnică denumită generare augmentată prin recuperare – retrieval-augmented generation, RAG.
Au fost propuse și modele alternative de tip „plătești pentru a accesa automat conținutul”, ca modalitate de compensare a creatorilor de conținut, însă acestea nu au câștigat teren.
Începând cu 15 septembrie, site-urile care utilizează Cloudflare vor bloca în mod implicit crawlerele IA pe paginile care conțin publicitate – și, prin urmare, generează venituri pentru creatorii de conținut.
Aceasta înseamnă că până la 30% dintre cele mai importante site-uri ale lumii nu vor mai apărea în rezumatele Google AI Overviews. Înseamnă, de asemenea, că o mare parte din materialul pe baza căruia sunt antrenate sistemele AI va fi, la rândul său, text generat de AI.
Ce înseamnă acest lucru pentru tine
Așadar, ce înseamnă toate acestea atunci când cauți informații? Este probabil ca, cel puțin pe termen scurt, calitatea rezumatelor oferite de IA să scadă, până când noua economie a webului își va găsi un echilibru.
Acest lucru se va întâmpla din două motive. Primul este că materialele de calitate vor avea șanse mai mici să ajungă în aceste rezumate IA – un studiu recent a constatat că deja aproximativ una din șase surse utilizate de instrumentele de căutare bazate pe AI este ea însăși un site generat cu ajutorul inteligenței artificiale.
Al doilea motiv este că, pe măsură ce modelele AI sunt antrenate pe tot mai mult text generat de IA, calitatea rezultatelor lor ar putea să se degradeze, un fenomen cunoscut sub denumirea de „colaps al modelului”.
În consecință, motoarele de căutare care depind mai puțin de IA ar putea deveni mai fiabile. Problema este să găsești unul care nu utilizează un crawler bazat pe IA. Astfel de motoare există: ZDNet recomandă Mojeek, PCMag recomandă Brave, iar Ban the Bots enumeră mai multe alternative, inclusiv un motor de căutare dedicat în mod special conținutului produs de „micii creatori”, precum blogurile.
Deocamdată, indiferent de motorul de căutare pe care îl folosești, cel mai bun lucru pe care îl poți face este să derulezi pagina în jos și să dai clic pe câteva dintre rezultatele propriu-zise ale căutării. În acest fel îi ajuți pe creatorii de conținut și, în același timp, ai șanse mai mari să găsești informații mai corecte.
Traducere după AI is eating website traffic de Dana McKay, Associate Dean, Interaction, Technology and Information, RMIT University și Damiano Spina, Senior Lecturer, School of Computing Technologies, RMIT University.
