Die kurze Antwort
IBM und Together AI kündigten am 11. August 2026 einen mehrjährigen Deal über 240 Millionen US-Dollar an, um auf IBM Cloud einen großmaßstäblichen Open-Source-KI-Inferenz-Cluster mit GPUs der Nvidia-Blackwell-Generation zu betreiben. Der Cluster — aufgebaut auf Nvidia-HGX-B300-Systemen — ist der erste seiner Art auf IBM Cloud und soll ab dem ersten Quartal 2027 kommerziell verfügbar sein.
Together AI verarbeitet derzeit rund 400 Billionen Tokens pro Monat für mehr als 1 Million Entwickler. Der Deal ist eine direkte Antwort auf die Enterprise-Nachfrage nach offenen Modellalternativen zu proprietären KI-APIs: geringere Kosten, transparente Gewichte und eine Infrastruktur, die nicht an einen einzigen Anbieter gebunden ist.
Was der Deal konkret umfasst
IBM und Together AI unterzeichneten eine mehrjährige Infrastrukturvereinbarung, bei der IBM Cloud die Inferenz-Plattform von Together AI auf rund 2.000 Nvidia-Blackwell-300-Chips hostet. IBM positioniert den Deal als ersten dedizierten Großcluster für Inferenz auf IBM Cloud mit HGX-B300-Systemen — eine Unterscheidung, die zählt, weil Inferenz-Workloads andere Ressourcenprofile haben als Training: Sie brauchen schnellen Durchsatz mit niedriger Latenz im großen Maßstab statt anhaltend hoher Auslastung wie beim Training.
Together AIs CEO Vipul Ved Prakash formulierte den Business Case direkt: „Unternehmen wollen die Leistung der besten Frontier-Modelle ohne den Preis geschlossener Modelle — und das funktioniert nur, wenn die darunterliegende Infrastruktur schnell und zuverlässig skaliert.“ IBM-Cloud-General-Manager Alan Peacock beschrieb den Cluster als Unterstützung für „agentische KI im großen Maßstab, die echte Geschäftsergebnisse liefert“.
Together AI sammelte im Juli 2026 eine Series C über 800 Millionen US-Dollar bei einer Bewertung von 8,3 Milliarden US-Dollar ein — das gibt dem Unternehmen den Spielraum, mehrjährige Infrastruktur-Verpflichtungen dieser Größenordnung zu stemmen. Der IBM-Deal fügt einen Hyperscaler-nahen Partner hinzu und bringt IBMs Enterprise-Vertriebsbeziehungen auf die technische Plattform von Together AI.
Warum Open-Source-Inferenz Enterprise-Interesse gewinnt
Das strategische Argument für Open-Source-Inferenz hat sich im vergangenen Jahr vom Philosophischen zum Praktischen verschoben. Drei Faktoren treiben den Wandel in den Engineering-Organisationen von Unternehmen.
Kostenplanbarkeit. Die Preise proprietärer KI-APIs werden vom Anbieter kontrolliert und können sich — oft nach oben — ändern, sobald die Produkte reifen. Ein Inferenz-Cluster auf Basis offener Modelle erlaubt es Engineering-Teams, Infrastrukturverträge mit festen Preisen zu verhandeln, statt Token-Tarife hinzunehmen, die ein API-Anbieter festlegt. Bei 400 Billionen Tokens pro Monat über die Plattform von Together AI bedeutet schon ein Bruchteil eines Cents Kostenunterschied pro tausend Tokens eine spürbare Budgetwirkung.
Modelltransparenz und Sicherheitsprüfung. Offene Modellgewichte lassen sich auditieren, inspizieren und — bei entsprechender Infrastruktur — vollständig in einer kontrollierten Umgebung hosten. Proprietäre Modelle sind per Definition intransparent: Sie können nicht überprüfen, welche Daten das Modell beeinflusst haben, wie es mit sensiblen Eingaben umgeht oder ob es nach der ersten Veröffentlichung verändert wurde. Für FinTech- und HealthTech-Teams, die regulierte Daten verarbeiten, ist diese Transparenzlücke ein Compliance-Risiko, nicht nur eine philosophische Präferenz.
Anbieter-Diversifizierung. Gerade europäische Unternehmen stehen unter wachsendem Druck, ihre Abhängigkeit von wenigen US-Hyperscalern für KI-Fähigkeiten zu verringern. Der IBM-Together-AI-Cluster bietet einen zusätzlichen Beschaffungsweg — einen, den IBM in seine bestehenden Enterprise-Beziehungen und Datenresidenz-Zusagen einbetten kann.
Technische Spezifikationen des Clusters
Nvidia-HGX-B300-Systeme bilden die Basis des Clusters — die GPU-Konfiguration der Blackwell-Generation, optimiert für Hochdurchsatz-Inferenz und verteiltes Training. Nvidias Dion Harris beschrieb diese Systeme als Teil eines „AI-Factories“-Modells: „KI-Fabriken werden zu essenzieller Unternehmensinfrastruktur — wie Strom und Telekommunikation.“ Nvidia gibt eine 30-fache Verbesserung des Outputs von KI-Fabriken gegenüber Hardwarekonfigurationen der Vorgängergeneration an.
Als Netzwerk-Fabric dient Nvidia Spectrum-X Ethernet, optimiert für KI-Workloads, bei denen klassische Rechenzentrums-Ethernet-Fabrics unter den stoßartigen All-to-All-Kommunikationsmustern der Inferenz großer Modelle zu Staus neigen. Die Bereitstellung in den USA bedeutet, dass der Cluster zunächst auf den nordamerikanischen Markt zugeschnitten ist.
Together AIs Plattform unterstützt neben Inferenz auch Training und Reinforcement Learning und gibt Unternehmen, die feinabgestimmte Modelle bauen, einen Single-Vendor-Pfad für den gesamten Modell-Lebenszyklus — nicht nur das Serving. Das ist relevant für Teams mit cloud-nativen KI-Deployments, bei denen das Training einer domänenspezifischen Variante eines offenen Modells und dessen anschließendes Serving im großen Maßstab eine zusammenhängende Infrastruktur erfordert.
Was das für Software-Teams in DACH & EU bedeutet
Der IBM-Together-AI-Deal ist ein Signal, keine Lösung. Er verändert Kosten oder Leistungsfähigkeit von Open-Source-KI-Inferenz für die meisten Teams nicht sofort — die Verfügbarkeit im ersten Quartal 2027 heißt, dass bis zum operativen Einsatz Zeit bleibt. Aber er verschiebt das Wettbewerbsumfeld auf eine Weise, die für Teams zählt, die heute Entscheidungen über KI-Infrastruktur treffen.
Für US-Teams: Der Deal bestätigt Open-Source-Inferenz als tragfähigen Enterprise-Weg neben — nicht anstelle von — proprietären APIs. Teams, die Together AIs Plattform auf geteilter Infrastruktur evaluiert haben, erhalten bis zum ersten Quartal 2027 Zugang zu dedizierter Nvidia-Blackwell-Kapazität mit IBM-Cloud-SLAs. Das ist relevant für Start-ups und Mittelstands-Engineering-Organisationen, die derzeit geteilte GPU-Ressourcen akzeptieren, weil sie sich keine dedizierten Hardwareverträge leisten können.
Für DACH- und EU-Teams: Der Cluster steht in den USA und löst DSGVO-Datenresidenz-Anforderungen nicht direkt. Die Open-Source-Architektur bedeutet jedoch, dass EU-Teams gleichwertige Konfigurationen in EU-Regionen von IBM Cloud — oder auf anderer konformer Infrastruktur — mit denselben Modellgewichten betreiben können. Der Deal verringert außerdem das Marktkonzentrationsrisiko, das europäische Regulierer angemahnt haben, und schafft unter dem EU Data Act und der kommenden Cloud-Switching-Regulierung eine echte Alternative zu Azure OpenAI, AWS Bedrock und Google Vertex AI.
Die praktische Frage für die Engineering-Führung: Wenn die KI-API-Ausgaben Ihres Teams schneller wachsen als das Engineering-Budget und ein wesentlicher Teil davon auf Inferenz statt Training entfällt, verdienen Open-Source-Alternativen auf Enterprise-tauglicher Infrastruktur jetzt eine strukturierte Bewertung — bevor das Budgetgespräch dringend wird.
Häufig gestellte Fragen
Was ist der 240-Mio.-Dollar-Deal von IBM und Together AI?
IBM und Together AI unterzeichneten eine mehrjährige Vereinbarung über 240 Millionen US-Dollar, angekündigt am 11. August 2026, um auf IBM Cloud einen großmaßstäblichen KI-Inferenz-Cluster aufzubauen. Der Cluster nutzt Nvidia-HGX-B300-Systeme — GPUs der Blackwell-Architektur — kombiniert mit Nvidia-Spectrum-X-Ethernet-Netzwerk. Es ist der erste dedizierte Großcluster für Inferenz auf IBM Cloud mit dieser Hardwaregeneration. Die kommerzielle Verfügbarkeit ist für das erste Quartal 2027 angepeilt.
Welche Open-Source-KI-Modelle laufen auf dem Cluster?
Die Plattform von Together AI unterstützt einen breiten Katalog offener Modelle. Aktuelle Beispiele sind Modelle von DeepSeek, MiniMax und Kimi. Together AI verarbeitet rund 400 Billionen Tokens pro Monat für mehr als 1 Million Entwickler weltweit; der neue IBM-Cloud-Cluster soll die Kapazität für produktive Inferenz und Reinforcement-Learning-Workloads erweitern.
Wann ist der IBM-Together-AI-Cluster verfügbar?
IBM zufolge soll der Cluster im ersten Quartal 2027 kommerziell verfügbar sein. Der Infrastrukturaufbau läuft bereits, mit rund 2.000 Nvidia-Blackwell-300-Chips in einer Anlage in den USA.
Wie schneidet Open-Source-Inferenz kostenseitig gegenüber proprietären KI-APIs ab?
Open-Source-Inferenz bietet im großen Maßstab typischerweise niedrigere Kosten pro Token als proprietäre APIs, wobei der Abstand von Modellgröße und Anwendungsfall abhängt. Der strategische Vorteil liegt in planbaren Preisen und der Möglichkeit, Infrastrukturverträge zu verhandeln, statt anbieterkontrollierten API-Preisen ausgeliefert zu sein. Der CEO von Together AI merkte an, Unternehmen „wollen die Leistung der besten Frontier-Modelle ohne den Preis geschlossener Modelle“.
Was bedeutet der Deal für DACH-Teams mit Anforderungen an digitale Souveränität?
Der IBM-Together-AI-Cluster steht in den USA und löst EU-Datenresidenz-Anforderungen unter der DSGVO nicht direkt. Offene Modellgewichte lassen sich jedoch auf konformer Infrastruktur betreiben — EU-Regionen von IBM Cloud, Gaia-X-orientierten Umgebungen oder souveränen Cloud-Alternativen — mit denselben Modellen. Für BaFin-beaufsichtigte Institute erleichtern auditierbare Gewichte zudem den DORA-Nachweis von Kontrollen über IKT-Drittdienstleister. Der Deal verringert außerdem die Bindung an einen einzelnen US-Hyperscaler, relevant unter dem EU Data Act und der kommenden Cloud-Switching-Regulierung.
Quellen
IBM Newsroom — IBM and Together AI Sign Multi-Year Agreement to Scale Open-Source AI Inference, August 11, 2026
BNN Bloomberg — IBM, Together AI ink $240 million deal for Nvidia-powered AI inference cluster, August 11, 2026
The Next Web — IBM bets $240m on cheap, open-source inference to take on the hyperscalers, August 2026