Dalle GPU alle CPU: come si costruisce l’infrastruttura agentica
Introduzione
L’infrastruttura per l’intelligenza artificiale agentica costringe le imprese a rivedere completamente il design dei propri data‑center. Non si tratta più di aggiungere semplicemente più potenza di calcolo, ma di orchestrare CPU, GPU e reti specializzate in un sistema end‑to‑end capace di sostenere crescita, sicurezza, efficienza e scalabilità.
Il mercato italiano dell’AI
Secondo l’Osservatorio sull’Intelligenza Artificiale del Politecnico di Milano, nel 2025 il mercato italiano dell’AI ha raggiunto 1,8 miliardi di euro, segnando una crescita del 50 % rispetto all’anno precedente. Tuttavia, il dato più significativo non è il valore economico, ma la trasformazione profonda che avviene “sotto la superficie”.
Lo stesso Osservatorio indica che i sistemi di orchestrazione diprocess e agentic AI rappresentano oggi appena il 4 % del mercato, ma stanno introducendo meccanismi di orchestrazione altamente intelligenti, basati sui Large Language Model (LLM). Questo è un salto qualitativo, non solo quantitativo.
Che cos’è l’AI agentica?
Gli agenti intelligenti non si limitano più a rispondere a un comando: interpretano le intenzioni, pianificano sequenze di azioni, interagiscono con strumenti esterni, eseguono codice in ambienti sandbox e determinano autonomamente il passo successivo. Ogni operazione presenta un profilo computazionale distinto, rendendo l’infrastruttura molto più complessa rispetto a un semplice carico di lavoro di inferenza.
Le sfide infrastrutturali
Le ragioni di questa complessità sono prevalentemente strutturali. Ogni fase di un flusso di lavoro “agentico” – dalla policy enforcement all’interrogazione di database, dal ragionamento su GPU al sandboxing del codice – richiede risorse diverse. Non si tratta più di un problema di scala, ma di architettura.
Le principali variabili da considerare sono:
- densità di core;
- frequenze di clock elevate;
- latenza prevedibile;
- dimensioni della memoria e larghezza di banda I/O;
- località dei dati;
- efficienza energetica;
- capacità di gestire numerosi servizi in esecuzione simultanea.
Nessun singolo profilo computazionale può soddisfare efficacemente tutti questi requisiti.
Un approccio basato su profili di carico
Con la diffusione dell’AI agentica, i team IT devono abbandonare l’idea di un “processore universale” e adottare un portafoglio di CPU su misura per l’intero spettro dei flussi di lavoro. La famiglia AMD EPYC è stata progettata proprio con questo principio in mente, offrendo componenti specializzati ottimizzati per classi di carico specifiche.
La famiglia AMD EPYC: dettagli tecnici
Orchestrazione, sandboxing ed esecuzione
Quando decine o centinaia di agenti operano in parallelo – eseguendo codice Python in sandbox, richiamando API o interrogando database – la densità dei core diventa il fattore critico, più importante della sola velocità di clock. Le CPU per server AMD EPYC di quinta generazione offrono fino a 192 core e 384 thread grazie al Simultaneous Multithreading. La prossima generazione, in codice “Venice”, porterà questi numeri a 256 core e 512 thread.
Integrazione con le applicazioni aziendali
Il valore di un agente si misura dalla capacità di interagire con gli strumenti e i sistemi esistenti. La famiglia AMD EPYC 9005 offre un equilibrio tra core e larghezza di banda di memoria: da 8 a 192 core, con fino a 640 GB/s di memoria. “Venice” aumenterà il numero di core e thread di 1,3 volte e la larghezza di banda di memoria di 2,5 volte rispetto alla generazione attuale.
Ruolo della CPU nell’alimentazione delle GPU
I Large Language Model su cui gli agenti fanno affidamento girano principalmente su GPU, ma la CPU del nodo host è fondamentale per garantire un’alimentazione costante degli acceleratori. Ciò richiede una combinazione di prestazioni per core, frequenze elevate e un bilanciamento ottimale tra core, memoria, I/O e rete. L’EPYC 9575F, con 64 core e frequenze fino a 5 GHz, è stato ottimizzato per questo ruolo; la linea “Venice” amplierà ulteriormente l’offerta ad alta frequenza.
Modelli di adozione enterprise
Le conversazioni con i clienti enterprise evidenziano due modelli ricorrenti.
Standardizzazione vs. flessibilità
Molte organizzazioni continuano ad acquistare CPU sulla base di configurazioni legacy (16‑32 core). I flussi di lavoro agentici, invece, richiedono alta densità di core per alcune fasi e alte frequenze per altre. La flessibilità di configurazione non è più opzionale: è necessario passare da una singola CPU standard a un portafoglio calibrato sull’intero workflow.
L’effetto moltiplicatore
Quando le imprese consentono ai dipendenti di creare e distribuire agenti, l’adozione cresce rapidamente, aumentando il carico su database, ERP, CRM, sistemi di BI, gestione identità e server di inferenza. La domanda cruciale per i team IT è: cosa succederà a questi sistemi quando i volumi di utilizzo degli agenti scaleranno in modo significativo?
Strategia di implementazione
Una strategia efficace parte dalla mappatura dettagliata di ciascun flusso di lavoro agentico e dall’assegnazione delle risorse più adatte a ogni fase. Ecco un esempio di sequenza tipica:
- Gateway di ingresso: applicazione di policy di sicurezza e governance.
- Pianificazione: modello AI leggero decide l’instradamento.
- Recupero contesto: interrogazione di database e knowledge base.
- Ragionamento intensivo: utilizzo di un cluster di GPU.
- Esecuzione di strumenti esterni e sandboxing del codice.
- Verifica risultato e decisione di ripetere il ciclo o procedere.
Ogni step può richiedere una tipologia di CPU diversa: densità di core per il sandboxing, alta frequenza per la pianificazione, ampia larghezza di banda per il recupero dati,