Il 98% del traffico web è costituito da crawler IA secondo la Linux Foundation

Scopri perché il 98% del traffico web è generato da crawler IA, i loro impatti su siti, costi e contenuti online, e come difendersi.

Il 98% del traffico web è costituito da
Lorenzo Pascucci 
Rimani aggiornato con WebMasterPoint
Fonte preferita Google X Instagram

Il traffico web è sempre più dominato dai crawler IA, come rivela la Linux Foundation: il 98% dei dati online è generato da sistemi automatici. Implicazioni, differenze coi bot tradizionali e possibili misure in esame.

Le analisi più recenti pubblicate dalla Linux Foundation mettono in evidenza un fenomeno che riguarda da vicino chi gestisce infrastrutture web e servizi digitali: una parte molto consistente delle richieste che arrivano ai siti è prodotta da sistemi automatici. Tra questi rientrano i cosiddetti crawler IA, impiegati per acquisire contenuti destinati all’analisi e all’addestramento di modelli linguistici.

Nel caso citato dalla Fondazione, piattaforme di rilievo come git.kernel.org avrebbero visto ridursi il traffico umano fino al 2%. Il restante 98% sarebbe riconducibile a sistemi automatizzati. È un dato riferito a uno specifico ambiente tecnico, non una fotografia dell’intero web. Proprio per questo va letto con attenzione.

La proporzione indicata apre comunque questioni difficili da ignorare. Quanto sono estesi questi flussi? Quale pressione esercitano su server, connessioni e bilanci dei gestori? E quali segnali permettono di separare le richieste generate da un crawler da quelle inviate da una persona?

Per rispondere servono dati e criteri di rilevazione coerenti, senza trasferire automaticamente le conclusioni di un singolo studio a tutto internet. Qui vengono esaminati il funzionamento dei crawler IA, i limiti dell’analisi della Linux Foundation, gli effetti sulle infrastrutture, le distorsioni nelle statistiche e le possibili misure di contenimento. Restano sullo sfondo anche le questioni normative legate all’accesso ai dati pubblici.

Cos’è un crawler IA e come opera

Un crawler IA è un software automatizzato capace di navigare il web e raccogliere dati. Viene configurato per visitare siti e servizi online, estrarre informazioni, catalogarle e utilizzarle nei processi di apprendimento automatico. La differenza rispetto ai crawler tradizionali non sta soltanto nella quantità delle richieste. I sistemi destinati ai modelli linguistici generativi possono impiegare tecniche di machine learning per modificare il proprio comportamento in base alla struttura delle pagine, agli ostacoli incontrati e agli obiettivi della raccolta.

Il funzionamento comprende diversi passaggi:

  • Accesso automatico e ricorsivo a gruppi di pagine web, spesso attraverso user agent riconoscibili;
  • Lettura di contenuti testuali, elementi multimediali e strutture delle pagine, così da individuare le informazioni utili;
  • Invio di richieste con frequenza elevata, con possibili ripercussioni sulle risorse dei server visitati;
  • Uso di algoritmi di apprendimento automatico per adattarsi a siti con architetture nuove o contenuti caricati dinamicamente;
  • Rispetto eventuale delle istruzioni contenute nei file robots.txt, che non è però sempre garantito.

I crawler tradizionali sono nati soprattutto per indicizzare le pagine dei motori di ricerca. Quelli associati all’intelligenza artificiale vengono invece usati da aziende, laboratori di ricerca e consorzi che devono alimentare sistemi di apprendimento automatico. Il loro lavoro può sostenere lo sviluppo di tecnologie linguistiche più avanzate, ma trasferisce costi e problemi pratici ai siti che ricevono le richieste: sostenibilità delle infrastrutture, tutela dei dati e gestione della privacy compresa.

Lo studio della Linux Foundation: che cosa misura e dove si ferma

Il dato che ha attirato l’attenzione, ovvero il 98% di traffico automatico su git.kernel.org, deriva da un’analisi interna della Linux Foundation. L’osservazione ha riguardato i log di accesso del portale utilizzato per lo sviluppo del kernel Linux. Non si tratta quindi di una misurazione indistinta del traffico globale, ma di una rilevazione condotta su una specifica infrastruttura.

Per classificare le richieste, la Fondazione ha fatto ricorso a sistemi di monitoraggio capaci di confrontare più segnali:

  • User agent, modalità di comportamento e sequenze temporali delle richieste, per riconoscere gli agenti automatici;
  • Ripetitività, intensità e tipologia delle connessioni dirette ai repository;
  • Confronto fra richieste attribuite a utenti umani e richieste meccanizzate, sulla base delle stime relative al periodo osservato.

Una classificazione di questo tipo non è priva di margini d’incertezza. I risultati riguardano un ambiente tecnico molto preciso e non possono essere estesi senza ulteriori verifiche a ogni sito o servizio online. Anche il riconoscimento automatico presenta difficoltà: un agente avanzato può imitare alcuni tratti della navigazione umana, mentre un traffico camuffato può sfuggire ai sistemi di identificazione.

  • Il campione non rappresenta l’intero internet e le proporzioni osservate possono dipendere dalle caratteristiche di git.kernel.org;
  • La distinzione tra crawler e utenti reali non è infallibile, soprattutto quando il software nasconde la propria identità;
  • Le abitudini dei sistemi IA cambiano e possono rendere incompleta una lettura basata su pattern statici;
  • Le richieste che si presentano come traffico umano non sono necessariamente intercettabili.

La Linux Foundation invita, di conseguenza, a non usare quel 98% come stima del traffico web mondiale. Il valore descrive il contesto e il periodo dell’analisi condotta dalla Fondazione.

Riconoscere le richieste automatiche rispetto a quelle umane

Per chi amministra una rete, capire chi o che cosa sta generando una richiesta è diventato più complicato. Nessun indicatore, preso da solo, offre una certezza assoluta. I log e i dati di sessione vengono quindi letti mettendo a confronto segnali diversi.

  • Ritmi anomali: un crawler può concentrare grandi volumi di richieste in pochi intervalli, anche lontano dalle ore di maggiore affluenza umana;
  • User agent dichiarato: gli agenti che rispettano gli standard indicano la propria natura, mentre altri provano a presentarsi come browser comuni;
  • Assenza di interazioni credibili: nessun movimento del mouse, nessuna compilazione di moduli e nessun clic con andamento irregolare possono costituire segnali utili;
  • Ripetizione delle operazioni: le richieste automatiche seguono spesso sequenze omogenee e ordinate di URL;
  • Mancanza di autenticazione: la maggior parte dei crawler non effettua login né svolge azioni personalizzate;
  • Fingerprinting: browser, risoluzione, plugin e altri parametri tecnici possono aiutare a riconoscere un agente automatizzato.

La distinzione si fa più incerta quando il software riproduce alcune dinamiche tipiche degli utenti. Le generazioni più sofisticate di crawler IA possono emulare comportamenti reali per aggirare i controlli, le limitazioni e i sistemi di tracciamento. Per questo l’analisi deve combinare log, tempi, caratteristiche tecniche e andamento delle sessioni. Un singolo user agent, da solo, non basta.

Le ragioni dell’elevato volume di richieste

La quantità di traffico associata ai crawler IA dipende dalle esigenze dei modelli linguistici. Per addestrarli e aggiornarli occorrono grandi masse di informazioni, spesso distribuite su un numero molto ampio di risorse.

  • Elaborazione di quantità enormi di dati, necessaria per aumentare qualità e varietà delle risposte generate;
  • Scansioni ripetute, utili a mantenere aggiornati i dataset quando cambiano le pagine e i contenuti;
  • Raccolta parallela di informazioni da molte risorse in tempi brevi;
  • Sovrapposizione tra richieste di operatori diversi, quando manca un coordinamento adeguato;
  • Difficoltà nel rispettare i limiti di crawl rate stabiliti dai siti.

La velocità con cui vengono sviluppati e aggiornati i sistemi di IA alimenta una domanda costante di contenuti nuovi. Una pagina può essere visitata più volte e da soggetti differenti, con richieste che si sommano senza un coordinamento visibile per il gestore del sito. Il risultato è una pressione crescente sulle infrastrutture pubbliche e private, anche quando il numero di visitatori umani rimane contenuto.

Prestazioni, spese e affidabilità delle infrastrutture

Un traffico automatico molto intenso ha effetti concreti. Server, banda e servizi di distribuzione devono sostenere richieste che non corrispondono necessariamente a utenti in grado di generare entrate commerciali o pubblicitarie.

  • Più banda e maggiore uso dell’hardware: i provider possono dover dimensionare i sistemi per carichi molto superiori a quelli prodotti dalle sole persone;
  • Costi più alti per hosting, CDN e cloud, legati a picchi di accesso che non portano un ritorno economico diretto;
  • Peggioramento della qualità del servizio, con tempi di risposta più lunghi o problemi di accessibilità per gli utenti reali;
  • Rischio di congestione e blocchi temporanei quando i crawler inviano richieste in modo particolarmente aggressivo;
  • Limitazioni o interruzioni del servizio, adottate come misura temporanea di autodifesa contro l’automazione.
ConseguenzaImpatto stimato
Consumo di bandaElevato, con costi aggiuntivi
Prestazioni dei serverDegrado progressivo
Esperienza degli utenti realiPossibile riduzione della qualità
Sicurezza del sistemaEsposizione a situazioni di overload

I crawler possono contribuire alla costruzione di tecnologie avanzate, ma il beneficio non elimina il problema dei costi sostenuti da chi mette a disposizione i contenuti. Quando mancano coordinamento e rispetto delle politiche di crawling, l’efficienza operativa dell’ecosistema digitale ne risente.

Accesso alle risorse e qualità dei contenuti disponibili

La pressione dei sistemi automatici può modificare anche il modo in cui i contenuti vengono pubblicati e resi accessibili. Un gestore che deve proteggere le prestazioni può scegliere di ridurre l’accesso pubblico ai dati oppure di introdurre barriere che coinvolgono ogni tipo di visitatore.

  • Limitazione dell’accesso pubblico alle risorse, per mantenere le prestazioni o impedire usi non autorizzati delle informazioni;
  • Ricorso più frequente a rate limit, CAPTCHA e sezioni protette, strumenti utili contro i crawler ma potenzialmente scomodi anche per le persone;
  • Difficoltà nel garantire che i contenuti restino aggiornati e accessibili in modo continuo, soprattutto quando il sito dispone di risorse tecniche limitate;
  • Ripercussioni sui dataset IA, qualora la raccolta venga rallentata o bloccata in parte.

Si crea così una tensione fra apertura dei dati e protezione delle infrastrutture. Le risposte non possono essere soltanto tecniche: entrano in gioco anche decisioni operative e regole sull’uso delle informazioni pubbliche. L’obiettivo resta trovare un punto di equilibrio tra la disponibilità dei contenuti e la necessità di evitare che l’automazione renda i servizi più costosi o meno accessibili.

Quando i crawler alterano le statistiche dei siti

Le richieste automatiche non pesano soltanto sui server. Possono rendere poco affidabili le metriche con cui un sito misura il proprio pubblico. Se non vengono filtrate, finiscono nelle statistiche insieme alle visite umane e producono una rappresentazione deformata del comportamento degli utenti.

  • Visite, pagine viste e durata media delle sessioni gonfiate artificialmente;
  • Problemi nel ricostruire il comportamento effettivo dell’utenza umana per orario, area geografica o argomento;
  • Discrepanze tra dati analitici e risultati commerciali o pubblicitari, con conseguenze sulle decisioni operative;
  • Uso meno efficace degli strumenti di marketing e web analytics, esposti a valutazioni errate delle prestazioni.

Fra le metriche più esposte ci sono il tasso di rimbalzo, la durata media delle sessioni, i percorsi di navigazione su più pagine e la provenienza geografica delle visite. Anche una statistica apparentemente semplice può quindi richiedere una fase di pulizia prima di essere utilizzata.

Filtrare, distinguere e normalizzare il traffico automatico è diventato un compito rilevante per i team di business intelligence e web analytics. Serve a leggere meglio i dati interni, ma anche a fornire informazioni trasparenti a partner commerciali e inserzionisti.

Crawler IA, bot tradizionali e traffico fraudolento

Non tutti i sistemi automatici hanno lo stesso scopo. Riunirli sotto un’unica etichetta può portare a blocchi sproporzionati o, al contrario, a controlli insufficienti.

  • Crawler IA: raccolgono dati su larga scala per sostenere l’addestramento e il miglioramento di modelli linguistici o conoscitivi; possono adottare tecniche sofisticate e modificare il proprio comportamento;
  • Bot tradizionali: vengono usati per indicizzare pagine, controllare prezzi, estrarre dati specifici o aggregare notizie. In rapporto alle IA generative sono, in genere, meno adattivi;
  • Traffico fraudolento: comprende bot impiegati per spam, sottrazione di dati, abuso delle risorse pubblicitarie o simulazione di clic, spesso con tecniche di camuffamento e aggiramento dei controlli.

La distinzione ha conseguenze tecniche e normative. Trattare ogni crawler IA come una minaccia fraudolenta può produrre policy eccessivamente restrittive e ridurre i vantaggi legati alla ricerca. Per amministratori e legislatori contano quindi la trasparenza dei software, user agent identificabili e la possibilità di ricostruire l’intenzione con cui vengono effettuate le richieste.

Misure disponibili per webmaster e gestori

Non esiste una contromisura adatta a ogni sito. La risposta dipende dal tipo di contenuti, dalle risorse disponibili e dal traffico che l’infrastruttura è in grado di sostenere. Alcuni interventi, però, possono ridurre il carico e rendere più leggibili le anomalie.

  • Definire regole selettive nel file robots.txt e controllare quali agenti le rispettano;
  • Applicare rate limiting e protezione DDoS attraverso firewall applicativi e servizi posti a protezione dell’infrastruttura;
  • Usare CAPTCHA, autenticazione a più fattori e accessi riservati agli utenti umani nelle aree più sensibili;
  • Controllare periodicamente i log, cercando variazioni e anomalie nei flussi di richieste;
  • Adottare sistemi di filtraggio comportamentale e fingerprinting per riconoscere agenti automatizzati più difficili da identificare;
  • Condividere informazioni con provider e community tecniche, così da aggiornare la mappatura dei crawler e le pratiche di gestione.

Ogni misura può avere effetti collaterali. Un filtro troppo severo rischia di impedire l’accesso a contenuti pubblici anche agli utenti reali; uno troppo permissivo lascia invece spazio a richieste che consumano risorse. La scelta deve quindi tenere insieme fruibilità dei dati, continuità del servizio e protezione dell’infrastruttura.

Il confronto fra gestori di siti, sviluppatori di sistemi IA e istituzioni resta necessario. Senza criteri condivisi, ogni operatore è costretto a difendersi in autonomia e il rapporto fra chi pubblica dati e chi li raccoglie rimane difficile da governare.

Scenari futuri per il traffico automatizzato

Il dato rilevato su git.kernel.org non descrive l’intero web, ma segnala un problema concreto: in alcune infrastrutture il traffico automatico può superare di gran lunga quello umano e incidere su costi, prestazioni e qualità delle statistiche.

Per gestire il fenomeno, webmaster e provider dovrebbero:

  • monitorare i log e distinguere, per quanto possibile, crawler dichiarati, bot tradizionali e traffico fraudolento;
  • definire limiti di frequenza proporzionati al tipo di risorsa e alla capacità dell’infrastruttura;
  • filtrare i bot dalle metriche di analytics prima di prendere decisioni commerciali o operative;
  • pubblicare regole chiare per l’accesso automatizzato e verificare il rispetto di robots.txt e delle altre policy;
  • valutare l’impatto di CAPTCHA, autenticazione e blocchi anche sugli utenti legittimi.

La crescita dei crawler IA renderà sempre più importante un rapporto trasparente fra chi pubblica dati e chi li raccoglie. Identificare gli agenti, contenere il carico e attribuire correttamente i costi sono condizioni necessarie per mantenere accessibili le risorse pubbliche senza compromettere la sostenibilità dei servizi.