“Denial of Wallet” come nuovo attacco DDoS contro gli agenti IA

Che cos’è la tokenomica e come il valore dei token di intelligenza artificiale è diventato un problema di sicurezza informatica.

Non molto tempo fa diverse aziende hanno iniziato a implementare attivamente gli agenti di IA in un’ampia varietà di flussi di lavoro. Molto rapidamente, il costo del loro utilizzo è diventato un problema urgente per le aziende. Inoltre, è un problema che riguarda non solo il dipartimento finanziario: oltre a problemi di budget, sono emersi problemi di affidabilità, stabilità operativa e persino sicurezza delle informazioni. Questo perché il costo dell’automazione di uno stesso processo varia in modo significativo da una distribuzione all’altra, è imprevedibile e potrebbe essere soggetto a influenze esterne.

Inoltre, per un utente malintenzionato che attacca un’organizzazione, qualsiasi processo automatizzato tramite l’IA e vulnerabile alle influenze esterne è, in sostanza, un comodo bersaglio per un “nuovo tipo di attacco DDoS”. Le segnalazioni di errori dell’applicazione, le recensioni dei prodotti o le richieste di assistenza tecnica possono (proprio come qualsiasi altro dato esterno elaborato da un’azienda tramite l’IA) fungere da strumento in un attacco volto ad aumentare il consumo di token (frammenti di parole che fungono da unità di base di input e output di un LLM).

Un anno di crescita esplosiva… in fatture

Nel 2026, per la prima volta le grandi aziende hanno speso in modo significativamente superiore i budget dei propri sistemi di IA. Uber aveva esaurito l’intero budget annuale entro aprile, mentre un’azienda anonima non è riuscita a stabilire limiti di spesa per Claude e ha speso 500 milioni di dollari in un solo mese. Sebbene i fornitori di IA annuncino regolarmente prezzi più bassi e modelli più efficienti, il passaggio dai chatbot ai sistemi di agenti che operano in modo continuo e autonomo aumenta il consumo di token di centinaia o migliaia di volte.  Allo stesso tempo, il modello “abbonamento fisso per 20 o 100 dollari” per le aziende sta diventando un ricordo del passato; tutti i principali fornitori stanno eseguendo la transizione dei clienti aziendali alla fatturazione con pagamento in base al consumo.

Di conseguenza, le aziende devono affrontare un problema fin troppo familiare ai settori dell’hosting nel cloud e delle comunicazioni cellulari. In assenza di sistemi di gestione e contabilità dei costi specializzati, un’organizzazione apprende quanto costerà un particolare processo o progetto solo dopo il completamento. Nei settori delle telecomunicazioni e del cloud, questo problema è stato infine risolto attraverso lo sviluppo di sofisticati sistemi di fatturazione e i loro clienti hanno persino adottato il termine specializzato FinOps. Per l’IA, questo processo è ancora agli inizi. Inoltre, la risoluzione del problema sarà complicata dalla natura probabilistica dell’IA generativa.

Consumo di token imprevedibile

Per capire perché i costi aumentano così rapidamente e sono così difficili da prevedere e controllare, è necessario ricordare come funziona un modello linguistico e cosa lo trasforma in un agente di intelligenza artificiale. Il modello è apolide; in altre parole, non mantiene alcuna informazione tra le interazioni. Ogni volta che l’agente esegue il passaggio successivo, l’intera cronologia del lavoro su un’attività specifica (il contesto) deve essere inviata nuovamente al modello: il prompt iniziale, il ragionamento precedente, il contenuto dei file che ha letto e le risposte di tutti gli strumenti. A ogni passaggio, questo “riepilogo” si allunga, soprattutto se l’attività prevede cicli iterativi. Se un passaggio non riesce, la risposta non è chiara o uno strumento restituisce un errore, l’agente semplicemente riprova, gonfiando ulteriormente le dimensioni del contesto. E se il compito è svolto non da uno, ma da più agenti, che si dividono il lavoro e si scambiano i risultati, questo volume viene moltiplicato per il loro numero. Di conseguenza, il consumo di token non aumenta gradualmente ma a scatti ed è quasi impossibile prevederlo all’inizio dell’attività.

Quando si eseguono due diverse sessioni di un’interazione tra un agente IA per risolvere esattamente la stessa attività (due ticket di assistenza tecnica, due attività di analisi e così via), il numero di token spesi per queste ultime può variare: la differenza può arrivare fino a 30 (!) volte. Questo dipende da quanti passaggi, errori e tentativi sono necessari per risolvere l’attività. L’aumento del consumo di risorse non dipende necessariamente dalla complessità dell’attività. Sono noti casi in cui l’IA è rimasta bloccata in un “ciclo di pensiero” e ha sprecato una quantità assurda di risorse in attività banali.

Tre generazioni di IA nei sistemi aziendali consumano risorse in modi completamente diversi:

  • Tecniche di machine learning (ML) classiche. Questo in genere funziona con dati ben strutturati e non richiede un’eccessiva intensità di elaborazione. Il consumo di risorse è prevedibile e basso. Questa è una voce di budget fissa;
  • Un chatbot o un altro assistente IA basato su tecniche di LLM. Consuma token, ma il ritmo è impostato da un essere umano: un dipendente avvia manualmente un’attività, quindi valuta il risultato e fa una pausa. Il costo aumenta grosso modo in proporzione al numero di utenti attivi e può essere stimato approssimativamente in base al numero di licenze;
  • Un agente di intelligenza artificiale autonomo. Una persona fissa un obiettivo e si allontana, quindi il sistema decide autonomamente cosa fare e quanti passaggi sono necessari. Il contatore continua a scorrere finché l’attività non viene considerata completata e non esiste un tetto dei costi prevedibile.

Tokenomica negli attacchi: Denial of Wallet come i nuovi DDoS

Poiché le chiamate LLM sono notevolmente più costose delle tipiche chiamate software standard, l’automazione delle attività aziendali di routine ha un costo insolitamente elevato. Ad esempio, Gartner stima che la risoluzione di una singola richiesta di assistenza clienti utilizzando un LLM costi circa 3 dollari. È facile immaginare come gli autori degli attacchi possano bombardare un’azienda con migliaia di richieste lunghe e sofisticate generate da un LLM poco costoso, causando ingenti danni finanziari. Dal momento che il processo è automatizzato, le anomalie potrebbero non essere rilevate immediatamente.

Se un utente malintenzionato sa quale sistema di agenti e quale LLM sono utilizzati in un processo aziendale, può eseguire un attacco più preciso e causare danni notevolmente maggiori. Gli autori dello studio GitInject hanno stimato che un utente malintenzionato in grado di creare problemi con GitHub all’interno di un’organizzazione che utilizza agenti di IA per l’analisi degli errori con un singolo attacco (prima che i meccanismi di difesa di GitHub intervengano) può causare danni fino a 111 dollari e consumare 400 minuti di GitHub Actions dall’account della vittima. Naturalmente, un attacco può essere ripetuto più volte, senza alcun costo per l’utente malintenzionato.

Il rischio più pericoloso, sebbene difficile da quantificare in termini monetari, deriva dagli attacchi che inducono gli LLM a ragionare eccessivamente. Nel documento OverThink, gli autori hanno dimostrato come un’attività formulata in modo innocuo, quando inserita in un modello linguistico, produce in definitiva un risultato corretto ma, durante il processo, consuma 46 (!) volte più token di quanto dovrebbe. Inoltre, tutte le attività testate dai ricercatori hanno superato i filtri di sicurezza esistenti.

Nella nuova versione della guida OWASP Top Risks for Language Models, questo problema ha assunto una priorità record: il consumo illimitato di token è ora designato come LLM06:2026 e, tra le sue varianti, l’attacco “Denial of Wallet”, che esaurisce il budget della vittima per gli LLM, viene esplicitamente evidenziato.

Come evitare di diventare una vittima dei “nuovi DDoS”

In primo luogo, è necessario abbandonare il principio “utilizzare l’IA solo per il gusto di utilizzare l’IA”. Non ha senso affidare ogni attività ad agenti autonomi. È consigliabile condurre periodicamente un’analisi costi-benefici dell’utilizzo dell’intelligenza artificiale.

È inoltre necessario limitare le autorizzazioni e il set di strumenti disponibili a un agente IA autonomo. Meno azioni sono accessibili al sistema, più efficacemente lavora su un’attività ristretta, minori sono le opportunità che ha di gonfiare i costi e meno è probabile che qualcuno riesca a “manipolare” l’operazione per ottenere una spesa simbolica non necessaria.

È inoltre consigliabile impostare limiti rigorosi per il consumo di token e configurare un sistema di notifiche per avvisare le persone quando vengono superati questi limiti. Ha senso implementare più limiti in parallelo: un limite per attività, un limite giornaliero e così via. Gli avvisi relativi al superamento dei limiti devono essere inviati immediatamente allo specialista responsabile del sistema, in modo che possa prendere una decisione informata se continuare o interrompere il processo.

Verificare rigorosamente i dati esterni non attendibili. Qualsiasi informazione elaborata dall’IA proveniente da fonti esterne (che si tratti di richieste, ricerche, messaggi o commenti o vari campi tecnici in grado di contenere testo arbitrario (record DNS, intestazioni HTTP, nomi di file) può non solo portare a una pronta iniezione, ma anche gonfiare deliberatamente il carico di lavoro. Sarà consigliabile limitarne le dimensioni e monitorare il carico che generano.

Calcolare il costo unitario del lavoro e confrontare le fatture fornitore con i propri dati. Il costo per analisi, per richiesta o per controllo è l’unico modo per capire per cosa si sta pagando e individuare gli errori nelle fatture.

Consigli