Marcus Chen, YuSMP Group
Marcus Chen Staff Engineer, Backend & Cloud, YuSMP Group · Infrastruttura cloud e deployment IA per prodotti US/UE
Corridoio di un data center moderno con file di rack di server GPU illuminati da strisce LED bianche, a rappresentare l'infrastruttura di inferenza IA aziendale

La risposta breve

IBM e Together AI hanno annunciato l'11 agosto 2026 un accordo pluriennale da 240 milioni di dollari per mettere in produzione su IBM Cloud un cluster di inferenza IA open source su larga scala alimentato da GPU di generazione Nvidia Blackwell. Il cluster — basato su sistemi Nvidia HGX B300 — sarà il primo del suo genere su IBM Cloud e punta alla disponibilità commerciale nel primo trimestre 2027.

Together AI elabora attualmente circa 400.000 miliardi di token al mese per oltre un milione di sviluppatori. L'accordo risponde direttamente alla domanda delle imprese di alternative aperte alle API IA proprietarie: costi inferiori, pesi trasparenti e un'infrastruttura non vincolata a un unico fornitore.

Cosa comporta davvero l'accordo

IBM e Together AI hanno firmato un accordo infrastrutturale pluriennale in cui IBM Cloud ospita la piattaforma di inferenza di Together AI su circa 2.000 chip Nvidia Blackwell 300. IBM presenta l'accordo come il primo cluster dedicato su larga scala costruito per l'inferenza su IBM Cloud con sistemi HGX B300 — una distinzione che conta, perché i carichi di inferenza hanno un profilo di risorse diverso dall'addestramento: richiedono throughput rapido a bassa latenza su larga scala, anziché un utilizzo elevato e prolungato come nel training.

Il CEO di Together AI, Vipul Ved Prakash, ha inquadrato il business case senza giri di parole: « Le imprese vogliono le prestazioni dei migliori modelli di frontiera senza il prezzo dei modelli chiusi, e questo funziona solo se l'infrastruttura sottostante è veloce e affidabile su larga scala. » Alan Peacock, general manager di IBM Cloud, ha descritto il cluster come supporto all'« IA agentica su larga scala per generare risultati di business reali ».

Nel luglio 2026 Together AI ha raccolto una Serie C da 800 milioni di dollari a una valutazione di 8,3 miliardi di dollari, che dà all'azienda il margine per sostenere impegni infrastrutturali pluriennali di questa portata. L'accordo IBM aggiunge un partner vicino agli hyperscaler e porta le relazioni commerciali enterprise di IBM sulla piattaforma tecnica di Together AI.

Perché l'inferenza open source conquista le imprese

L'argomento strategico a favore dell'inferenza open source è passato dal filosofico al pratico nell'ultimo anno. Tre fattori guidano il cambiamento all'interno delle organizzazioni di ingegneria.

Prevedibilità dei costi. Il prezzo delle API IA proprietarie è controllato dal fornitore e può cambiare — spesso al rialzo — man mano che i prodotti maturano. Un cluster di inferenza basato su modelli aperti consente ai team di negoziare contratti infrastrutturali a prezzo fisso, anziché subire tariffe a token decise da un fornitore di API. Con 400.000 miliardi di token al mese sulla piattaforma di Together AI, anche una frazione di centesimo di differenza per mille token rappresenta un impatto tangibile sul budget.

Trasparenza dei modelli e revisione di sicurezza. I pesi dei modelli aperti possono essere sottoposti ad audit, ispezionati e — per chi dispone dell'infrastruttura — ospitati interamente in un ambiente controllato. I modelli proprietari sono opachi per definizione: non è possibile verificare quali dati abbiano influenzato il modello, come gestisca input sensibili o se sia stato modificato dopo il rilascio iniziale. Per i team FinTech e HealthTech che trattano dati regolamentati, questo divario di trasparenza è un rischio di conformità, non solo una preferenza filosofica.

Diversificazione dei fornitori. Le imprese europee, in particolare, subiscono una pressione crescente per ridurre la dipendenza da un ristretto numero di hyperscaler statunitensi per le capacità IA. Il cluster IBM-Together AI offre una via di approvvigionamento aggiuntiva — che IBM può inserire nelle proprie relazioni enterprise esistenti e negli impegni di residenza dei dati.

Specifiche tecniche del cluster

Il cluster è basato su sistemi Nvidia HGX B300 — la configurazione GPU di generazione Blackwell ottimizzata per inferenza ad alto throughput e training distribuito. Dion Harris di Nvidia ha descritto questi sistemi come parte di un modello di « fabbriche di IA »: « Le fabbriche di IA stanno diventando infrastruttura aziendale essenziale — come l'elettricità e le telecomunicazioni. » Nvidia dichiara un miglioramento di 30× nell'output delle fabbriche di IA rispetto alle configurazioni hardware della generazione precedente.

Il tessuto di rete è Nvidia Spectrum-X Ethernet, ottimizzato per carichi IA in cui i tradizionali tessuti Ethernet da data center si congestionano sotto i pattern di comunicazione all-to-all a raffica dell'inferenza dei grandi modelli. Il deployment negli Stati Uniti significa che il cluster è inizialmente dimensionato per il mercato nordamericano.

La piattaforma di Together AI supporta training e reinforcement learning oltre all'inferenza, offrendo alle imprese che costruiscono modelli affinati un percorso single-vendor per l'intero ciclo di vita del modello — non solo il serving. È rilevante per i team che realizzano deployment IA cloud-native, dove addestrare una variante specializzata di un modello aperto e poi servirla su larga scala richiede un'infrastruttura coerente.

Cosa significa per i team italiani & UE

L'accordo IBM-Together AI è un segnale, non una soluzione. Non cambia immediatamente il costo o le capacità dell'inferenza IA open source per la maggior parte dei team — la disponibilità nel primo trimestre 2027 lascia margine prima che questo cluster diventi un'opzione operativa. Ma sposta il panorama competitivo in modi che contano per i team che oggi decidono la propria infrastruttura IA.

Per i team statunitensi: l'accordo convalida l'inferenza open source come percorso enterprise praticabile accanto — e non al posto — delle API proprietarie. I team che valutavano la piattaforma di Together AI su infrastruttura condivisa avranno, entro il primo trimestre 2027, accesso a capacità Nvidia Blackwell dedicata con gli SLA di IBM Cloud. È rilevante per startup e organizzazioni di ingegneria mid-market che oggi accettano GPU condivise perché non possono permettersi contratti hardware dedicati.

Per i team italiani e UE: essendo il cluster negli Stati Uniti, non risolve direttamente i requisiti di residenza dei dati del GDPR. Ma l'architettura open source consente ai team UE di eseguire configurazioni equivalenti nelle region UE di IBM Cloud — o su altra infrastruttura conforme — con gli stessi pesi dei modelli. L'accordo riduce inoltre il rischio di concentrazione del mercato segnalato dai regolatori europei e crea, sotto l'EU Data Act e il futuro regolamento sulla portabilità del cloud, una vera alternativa ad Azure OpenAI, AWS Bedrock e Google Vertex AI.

La domanda pratica per la leadership tecnica: se la spesa in API IA del tuo team cresce più rapidamente del budget di ingegneria e una quota rilevante riguarda l'inferenza anziché il training, le alternative open source su infrastruttura di livello enterprise meritano una valutazione strutturata ora — prima che la discussione sul budget diventi urgente.

Domande frequenti

Che cos'è l'accordo da 240 M$ tra IBM e Together AI?

IBM e Together AI hanno firmato un accordo pluriennale da 240 milioni di dollari, annunciato l'11 agosto 2026, per costruire un cluster di inferenza IA su larga scala su IBM Cloud. Il cluster utilizza sistemi Nvidia HGX B300 — GPU di architettura Blackwell — abbinati alla rete Nvidia Spectrum-X Ethernet. È il primo cluster dedicato su larga scala per l'inferenza su IBM Cloud con questa generazione di hardware. La disponibilità commerciale è prevista per il primo trimestre 2027.

Quali modelli IA open source gireranno sul cluster?

La piattaforma di Together AI supporta un ampio catalogo di modelli aperti. Gli esempi attuali includono modelli DeepSeek, MiniMax e Kimi. Together AI elabora circa 400.000 miliardi di token al mese per oltre un milione di sviluppatori nel mondo; il nuovo cluster IBM Cloud punta ad ampliare la capacità per l'inferenza in produzione e i carichi di reinforcement learning.

Quando sarà disponibile il cluster IBM-Together AI?

Secondo IBM, il cluster dovrebbe raggiungere la disponibilità commerciale nel primo trimestre 2027. La costruzione dell'infrastruttura è già in corso, con circa 2.000 chip Nvidia Blackwell 300 installati in una struttura negli Stati Uniti.

Come si confronta l'inferenza open source in termini di costo con le API IA proprietarie?

Su larga scala l'inferenza open source offre in genere un costo per token inferiore rispetto alle API proprietarie, con un divario che dipende dalla dimensione del modello e dal caso d'uso. Il vantaggio strategico sta nella prevedibilità dei prezzi e nella possibilità di negoziare contratti infrastrutturali anziché subire prezzi delle API controllati dal fornitore. Il CEO di Together AI ha osservato che le imprese « vogliono le prestazioni dei migliori modelli di frontiera senza il prezzo dei modelli chiusi ».

Cosa significa l'accordo per i team italiani con requisiti di sovranità?

Il cluster IBM-Together AI è negli Stati Uniti e quindi non risolve direttamente i requisiti di residenza dei dati del GDPR né la qualificazione ACN/AgID per la PA. I pesi dei modelli aperti possono però essere distribuiti su infrastruttura conforme — region UE di IBM Cloud o ambienti qualificati nel perimetro del Polo Strategico Nazionale — con gli stessi modelli. L'accordo riduce inoltre il lock-in a un unico hyperscaler statunitense, aspetto rilevante sotto l'EU Data Act e il futuro regolamento sulla portabilità del cloud.

Fonti

IBM Newsroom — IBM and Together AI Sign Multi-Year Agreement to Scale Open-Source AI Inference, August 11, 2026
BNN Bloomberg — IBM, Together AI ink $240 million deal for Nvidia-powered AI inference cluster, August 11, 2026
The Next Web — IBM bets $240m on cheap, open-source inference to take on the hyperscalers, August 2026