La réponse courte
IBM et Together AI ont annoncé le 11 août 2026 un accord pluriannuel de 240 millions de dollars pour déployer sur IBM Cloud un cluster d'inférence IA open source à grande échelle propulsé par des GPU de génération Nvidia Blackwell. Le cluster — bâti sur des systèmes Nvidia HGX B300 — sera le premier du genre sur IBM Cloud et vise une disponibilité commerciale au premier trimestre 2027.
Together AI traite actuellement environ 400 000 milliards de tokens par mois pour plus d'un million de développeurs. L'accord répond directement à la demande des entreprises pour des alternatives ouvertes aux API IA propriétaires : coûts moindres, poids transparents et infrastructure non verrouillée à un seul fournisseur.
Ce que l'accord implique réellement
IBM et Together AI ont signé un accord d'infrastructure pluriannuel dans lequel IBM Cloud héberge la plateforme d'inférence de Together AI sur environ 2 000 puces Nvidia Blackwell 300. IBM présente l'accord comme le premier cluster dédié à grande échelle bâti pour l'inférence sur IBM Cloud avec des systèmes HGX B300 — une distinction qui compte, car les charges d'inférence ont un profil de ressources différent de l'entraînement : elles exigent un débit rapide à faible latence à grande échelle, plutôt qu'une utilisation soutenue et élevée comme lors de l'entraînement.
Le PDG de Together AI, Vipul Ved Prakash, a résumé l'argument commercial sans détour : « Les entreprises veulent la performance des meilleurs modèles de pointe sans le prix des modèles fermés, et cela ne fonctionne que si l'infrastructure sous-jacente est rapide et fiable à l'échelle. » Alan Peacock, directeur général d'IBM Cloud, a décrit le cluster comme un soutien à « l'IA agentique à grande échelle pour produire de vrais résultats business ».
Together AI a levé une série C de 800 millions de dollars sur une valorisation de 8,3 milliards de dollars en juillet 2026, ce qui donne à l'entreprise la marge pour honorer des engagements d'infrastructure pluriannuels de cette ampleur. L'accord IBM ajoute un partenaire proche des hyperscalers et apporte les relations commerciales entreprise d'IBM à la plateforme technique de Together AI.
Pourquoi l'inférence open source séduit les entreprises
L'argument stratégique en faveur de l'inférence open source est passé du philosophique au pratique au cours de l'année écoulée. Trois facteurs animent ce basculement au sein des organisations d'ingénierie.
Prévisibilité des coûts. Le tarif des API IA propriétaires est fixé par le fournisseur et peut évoluer — souvent à la hausse — à mesure que les produits mûrissent. Un cluster d'inférence bâti sur des modèles ouverts permet aux équipes de négocier des contrats d'infrastructure à prix fixe plutôt que de subir des tarifs au token décidés par un fournisseur d'API. À 400 000 milliards de tokens par mois sur la plateforme de Together AI, une fraction de centime d'écart pour mille tokens représente déjà un impact budgétaire tangible.
Transparence des modèles et revue de sécurité. Les poids de modèles ouverts peuvent être audités, inspectés et — pour qui dispose de l'infrastructure — hébergés entièrement dans un environnement maîtrisé. Les modèles propriétaires sont opaques par nature : impossible de vérifier quelles données ont influencé le modèle, comment il traite les entrées sensibles ou s'il a été modifié après sa publication initiale. Pour les équipes FinTech et HealthTech qui manipulent des données réglementées, cet écart de transparence est un risque de conformité, pas une simple préférence philosophique.
Diversification des fournisseurs. Les entreprises européennes, en particulier, subissent une pression croissante pour réduire leur dépendance à une poignée d'hyperscalers américains pour leurs capacités IA. Le cluster IBM-Together AI offre une voie d'approvisionnement supplémentaire — une voie qu'IBM peut inscrire dans ses relations entreprise existantes et ses engagements de résidence des données.
Spécifications techniques du cluster
Le cluster repose sur des systèmes Nvidia HGX B300 — la configuration GPU de génération Blackwell optimisée pour l'inférence à haut débit et l'entraînement distribué. Dion Harris, de Nvidia, a décrit ces systèmes comme relevant d'un modèle d'« usines à IA » : « Les usines à IA deviennent une infrastructure d'entreprise essentielle — comme l'électricité et les télécommunications. » Nvidia revendique une amélioration de 30× du débit des usines à IA par rapport aux configurations matérielles de génération précédente.
Le tissu réseau est Nvidia Spectrum-X Ethernet, optimisé pour les charges IA où les tissus Ethernet classiques de datacenter congestionnent sous les motifs de communication tous-à-tous en rafale de l'inférence des grands modèles. Le déploiement basé aux États-Unis signifie que le cluster est d'abord dimensionné pour le marché nord-américain.
La plateforme de Together AI prend en charge l'entraînement et l'apprentissage par renforcement en plus de l'inférence, offrant aux entreprises qui construisent des modèles affinés une voie mono-fournisseur pour tout le cycle de vie du modèle — pas seulement le service. C'est pertinent pour les équipes menant des déploiements IA cloud-native, où entraîner une variante spécialisée d'un modèle ouvert puis la servir à grande échelle exige une infrastructure cohérente.
Ce que cela signifie pour les équipes françaises & UE
L'accord IBM-Together AI est un signal, pas une solution. Il ne change pas immédiatement le coût ou les capacités de l'inférence IA open source pour la plupart des équipes — la disponibilité au premier trimestre 2027 laisse du temps avant que ce cluster ne devienne une option opérationnelle. Mais il déplace le paysage concurrentiel d'une manière qui compte pour les équipes décidant aujourd'hui de leur infrastructure IA.
Pour les équipes américaines : l'accord valide l'inférence open source comme voie entreprise viable aux côtés — et non à la place — des API propriétaires. Les équipes qui évaluaient la plateforme de Together AI sur infrastructure mutualisée auront, d'ici le premier trimestre 2027, accès à une capacité Nvidia Blackwell dédiée adossée aux SLA d'IBM Cloud. C'est pertinent pour les start-ups et les organisations d'ingénierie mid-market qui acceptent aujourd'hui des GPU mutualisés faute de pouvoir financer des contrats matériels dédiés.
Pour les équipes françaises et UE : le cluster étant aux États-Unis, il ne résout pas directement les exigences de résidence des données du RGPD. Mais l'architecture open source permet aux équipes UE d'exécuter des configurations équivalentes dans les régions UE d'IBM Cloud — ou sur une autre infrastructure conforme — avec les mêmes poids de modèles. L'accord réduit aussi le risque de concentration du marché pointé par les régulateurs européens et crée, sous l'EU Data Act et le futur règlement sur la portabilité cloud, une vraie alternative à Azure OpenAI, AWS Bedrock et Google Vertex AI.
La question pratique pour la direction technique : si les dépenses d'API IA de votre équipe croissent plus vite que le budget d'ingénierie, et qu'une part significative porte sur l'inférence plutôt que l'entraînement, les alternatives open source sur infrastructure de qualité entreprise méritent une évaluation structurée dès maintenant — avant que la discussion budgétaire ne devienne urgente.
Questions fréquentes
Qu'est-ce que l'accord à 240 M$ entre IBM et Together AI ?
IBM et Together AI ont signé un accord pluriannuel de 240 millions de dollars, annoncé le 11 août 2026, pour bâtir un cluster d'inférence IA à grande échelle sur IBM Cloud. Le cluster utilise des systèmes Nvidia HGX B300 — des GPU d'architecture Blackwell — associés au réseau Nvidia Spectrum-X Ethernet. C'est le premier cluster dédié à grande échelle pour l'inférence sur IBM Cloud avec cette génération de matériel. La disponibilité commerciale est visée au premier trimestre 2027.
Quels modèles IA open source tourneront sur le cluster ?
La plateforme de Together AI prend en charge un large catalogue de modèles ouverts. Les exemples actuels incluent des modèles DeepSeek, MiniMax et Kimi. Together AI traite environ 400 000 milliards de tokens par mois pour plus d'un million de développeurs dans le monde ; le nouveau cluster IBM Cloud vise à étendre la capacité pour l'inférence en production et les charges d'apprentissage par renforcement.
Quand le cluster IBM-Together AI sera-t-il disponible ?
Selon IBM, le cluster devrait atteindre la disponibilité commerciale au premier trimestre 2027. La construction de l'infrastructure est déjà en cours, avec environ 2 000 puces Nvidia Blackwell 300 déployées dans une installation basée aux États-Unis.
Comment l'inférence open source se compare-t-elle en coût aux API IA propriétaires ?
À grande échelle, l'inférence open source offre généralement un coût par token inférieur à celui des API propriétaires, l'écart dépendant de la taille du modèle et de l'usage. L'avantage stratégique tient à la prévisibilité des prix et à la possibilité de négocier des contrats d'infrastructure plutôt que de subir des tarifs d'API contrôlés par le fournisseur. Le PDG de Together AI a noté que les entreprises « veulent la performance des meilleurs modèles de pointe sans le prix des modèles fermés ».
Que signifie l'accord pour les équipes françaises soumises à des exigences de souveraineté ?
Le cluster IBM-Together AI est basé aux États-Unis et ne résout donc pas directement les exigences de résidence des données du RGPD ni la qualification SecNumCloud de l'ANSSI. Les poids de modèles ouverts peuvent toutefois être déployés sur une infrastructure conforme — régions UE d'IBM Cloud ou acteurs souverains français comme OVHcloud et Numspot — avec les mêmes modèles. L'accord réduit aussi le verrouillage à un unique hyperscaler américain, ce qui compte sous l'EU Data Act et le futur règlement sur la portabilité cloud.
Sources
IBM Newsroom — IBM and Together AI Sign Multi-Year Agreement to Scale Open-Source AI Inference, August 11, 2026
BNN Bloomberg — IBM, Together AI ink $240 million deal for Nvidia-powered AI inference cluster, August 11, 2026
The Next Web — IBM bets $240m on cheap, open-source inference to take on the hyperscalers, August 2026