Die kurze Antwort
Cornelis Networks sammelte 205 Mio. $ und liefert ein Netzwerk, das rechnet statt nur Bytes zu bewegen — gezielt für die GPUs, die untätig auf Daten warten. Angekündigt am 14. September 2026 und angeführt von IAG Capital Partners, unterlegt die Runde Active Compute Fabric, das programmierbare RISC-V-Kerne in Netzwerkkarten und Switches einbettet. Cornelis, 2020 aus Intel ausgegründet, sagt, KI-Cluster betrieben GPUs häufig nur bei 42–54 % Auslastung, und Arbeit im Netzwerk könne das um fünf bis zehn Punkte anheben.
Das größere Signal: Der Interconnect ist nun ein erstrangiger Teil von KI-Leistung und -Kosten, und ein offenes, GPU-unabhängiges Fabric entsteht als Alternative zu Nvidias eng integriertem Stack. Für Teams, die auf Cloud und DevOps setzen, rückt das eine Frage in den Fokus, die die meisten ausgelagert hatten — wie Ihre Beschleuniger miteinander sprechen, entscheidet zunehmend, wie viel Sie tatsächlich aus ihnen herausholen.
Was Cornelis angekündigt hat
Cornelis Networks, ein Unternehmen aus Pennsylvania, das 2020 aus Intel ausgegründet wurde, nutzte die TechCrunch Disrupt, um eine Finanzierungsrunde über 205 Mio. $ unter Führung von IAG Capital Partners offenzulegen und zu starten, was es Active Compute Fabric nennt. Geld und Produkt zielen auf dasselbe: die wachsende Lücke zwischen der Zahl gekaufter GPUs und der Menge nützlicher Arbeit, die diese GPUs tatsächlich leisten. Cornelis sagt, Beschleuniger in realen KI-Clustern liefen häufig nur bei 42–54 % Auslastung und stünden untätig, während sie auf Daten von anderen Knoten warten.
Statt das Netzwerk als stumme Verrohrung zu behandeln, die nur Bytes zwischen Endpunkten pendelt, legt Active Compute Fabric programmierbare Rechenleistung — von Dritten lizenzierte RISC-V-Kerne — direkt in die Netzwerkkarten und Switches. So können einige Operationen ablaufen, während Daten in Bewegung sind. „Wir geben Ihnen Ihre GPUs zurück“, sagte CEO Lisa Spelman zu dem Ansatz und argumentierte, ein Netzwerk mit Compute darin könne „die GPU-Auslastung um fünf Punkte, zehn Punkte treiben“. Auf einem Cluster, wo jeder Beschleuniger zehntausende Dollar kostet, sind ein paar Punkte zurückgewonnener Auslastung echtes Geld und echter Durchsatz.
Der Start baut auf Hardware auf, die Cornelis bereits liefert. Die erste Generation, die Plattform CN5000, wurde 2025 ausgeliefert, und die neue CN6000 ist eine 800-Gigabit-SuperNIC, die in zwei Modi läuft — das firmeneigene, aus dem HPC stammende Omni-Path und Standard-RoCEv2-Ethernet — und sich mit Broadcom-Tomahawk-Switches oder Cornelis’ eigenen kombinieren lässt. Dieses Multimode-, GPU-unabhängige Design ist der strategische Kern: eine Wette darauf, dass Käufer einen offenen Interconnect wollen, den sie mit einer Reihe von Beschleunigern nutzen können, und nicht den durchgängigen Stack eines einzelnen Anbieters.
Wie Compute im Netzwerk funktioniert
Die Idee des In-Network-Computings ist im Hochleistungsrechnen alt, aber für KI neu dringlich. In einem normalen Cluster reist jedes Byte, das eine GPU braucht, über das Netzwerk zum Beschleuniger, wird verarbeitet und reist zurück. Wenn tausende GPUs ein Modell trainieren, verbringen sie einen großen Anteil ihrer Zeit mit kollektiven Operationen — All-Reduce, All-Gather und ähnlichem —, bei denen jeder Knoten Teilergebnisse austauschen und zusammenführen muss, bevor der nächste Schritt folgt. Während dieses Austauschs stehen die GPUs still. Dieser Stillstand ist ein großer Grund, warum die gemessene Auslastung eher in den 40ern und 50ern landet als nahe 100 %.
Active Compute Fabric geht den Stillstand an, indem es einen Teil dieser Arbeit im Netzwerk erledigt. Weil die NICs und Switches jetzt programmierbare Kerne tragen, lassen sich Operationen wie das Zusammenführen von Teilergebnissen, das Verschieben des Key-Value-Caches zwischen Knoten für die Inferenz und das Routing von Tokens für Mixture-of-Experts-Modelle im Transit abwickeln, statt zur GPU zurückzupendeln. Cornelis rahmt die Inferenz — wo Speicherbewegung und Routing dominieren — als primäre Chance, wobei dieselben Offloads auch große Trainingsläufe unterstützen. Der Nettoeffekt, den das Unternehmen behauptet, sind weniger untätige Zyklen: Halte die Beschleuniger ausgelastet, und die effektive Auslastung steigt.
Die Wettbewerbslogik zählt ebenso wie der Mechanismus. Nvidia verkauft einen vertikal integrierten Stack — GPUs, NVLink für Scale-up im Rack und InfiniBand oder Spectrum-X-Ethernet für Scale-out —, alles auf die eigene Software optimiert, was den Gesamt-Stack leicht einführbar und schwer verlassbar macht. Cornelis wirbt für das Gegenteil: ein offenes Fabric, ausgerichtet auf entstehende Standards wie UALink und ESUN, sodass Organisationen Beschleuniger mischen und Single-Vendor-Lock-in vermeiden können. Es reiht sich in eine Welle von Infrastrukturunternehmen ein — von Custom-Silizium bis zu offenen Ethernet-Konsortien —, die Nvidias Dominanz Schicht für Schicht aufzubrechen versuchen.
Was das für DACH-Softwareteams bedeutet
Für die meisten Teams lautet die direkte Lehre nicht „kauft Cornelis“. Sie lautet: Das Netzwerk ist jetzt eine erstrangige Variable von KI-Leistung und -Kosten, und es als Nebensache zu behandeln verschwendet still Budget. Wer einen Cluster besitzt oder least, für den ist der Unterschied zwischen 45 % und 65 % Auslastung der Unterschied zwischen einem weiteren teuren Knoten und keinem. Bevor Sie mehr Hardware freigeben, lohnt die Prüfung, ob Ihre GPUs wirklich rechenbegrenzt sind oder schlicht durch Kommunikation und Datenbewegung ausgehungert werden — eine Unterscheidung, die verändert, wofür Sie ausgeben sollten.
Wenn Sie GPUs über einen Cloud-Anbieter beziehen, wählen Sie das Fabric nicht, aber Sie erben seine Wirtschaftlichkeit. In einer Kapazitätsknappheit schlägt alles, was mehr nützliche Arbeit aus demselben Silizium presst, auf Token-Preise und Instanzverfügbarkeit durch. Es bedeutet auch, dass Ihre eigenen Architekturentscheidungen — Datenlokalität, wie kommunikationslastig Ihr Trainingsmuster ist, welche Instanzfamilie und welchen Interconnect Sie wählen — zunehmend den realen Durchsatz bestimmen. Das GPU-Modell auf der Rechnung ist nicht mehr die ganze Geschichte, und Anbieter, die Interconnect- und Kollektivleistungsdaten veröffentlichen, verdienen mehr Aufmerksamkeit als früher.
Es gibt auch einen Portabilitätsaspekt, und der fällt so aus, wie ihn EU- und DACH-Käufer schätzen sollten. Ein offenes, standardbasiertes Fabric ist eine Absicherung gegen Lock-in: Je mehr Ihres Stacks auf UALink, Ethernet und anbieterneutralen Abstraktionen fährt, desto mehr Freiheit behalten Sie, Beschleuniger zu wechseln, wenn sich Preis, Verfügbarkeit und Souveränitätsanforderungen verschieben. Diese Flexibilität lässt sich am leichtesten bewahren, wenn sie von Anfang an mitgedacht ist — im Schreiben von kollektivem Code, in der Wahl von Frameworks und im Aufbau von Deployments —, statt sie nachzurüsten, nachdem der Stack eines einzelnen Anbieters still tragend geworden ist.
Was jetzt zu tun ist
- Messen Sie die reale GPU-Auslastung. Instrumentieren Sie Ihre Trainings- und Inferenz-Jobs und finden Sie heraus, ob die Beschleuniger rechenbegrenzt sind oder auf Kommunikation und I/O warten. Einen Engpass, den Sie nicht gemessen haben, können Sie weder beheben noch Ausgaben dafür rechtfertigen.
- Beheben Sie Software vor dem Hardwarekauf. Besseres Batching, Datenpipelines und Kommunikationsmuster holen oft mehr Auslastung zurück als neue Knoten, zu einem Bruchteil der Kosten. Schöpfen Sie das zuerst aus.
- Fragen Sie nach dem Interconnect. Fragen Sie bei der Bewertung von Cloud-Instanzen oder eines On-Prem-Clusters nach Bandbreite, kollektiver Leistung und etwaigem In-Network-Offload — nicht nur nach GPU-Typ und -Anzahl.
- Bevorzugen Sie offene Standards, wo es geht. Bevorzugen Sie Beschleuniger, Fabrics und Frameworks, die sich an offenen Interconnect-Standards ausrichten, damit Sie die Freiheit behalten, später den Anbieter zu wechseln.
- Verfolgen Sie die Fabric-Schicht, nicht nur die Modelle. Interconnect und Compute im Netzwerk werden entscheidend für die KI-Wirtschaftlichkeit. Nehmen Sie sie in Ihre Infrastrukturplanung auf, so wie Sie GPU-Roadmaps bereits verfolgen.
Häufig gestellte Fragen
Was hat Cornelis Networks am 14. September 2026 angekündigt?
Eine Finanzierungsrunde über 205 Mio. $ unter Führung von IAG Capital Partners, offengelegt auf der TechCrunch Disrupt, zusammen mit dem Start von Active Compute Fabric — einer Netzwerkarchitektur, die programmierbare RISC-V-Rechenkerne in Netzwerkkarten und Switches einbettet, sodass ein Teil der Arbeit erledigt wird, während Daten durch das Netzwerk laufen, statt nur auf GPUs. Cornelis wurde 2020 aus Intel ausgegründet und liefert bereits Produkte der ersten Generation (CN5000).
Was ist In-Network-Computing und warum steigert es die GPU-Auslastung?
Es führt bestimmte Operationen auf programmierbarem Silizium in NICs und Switches aus, während die Daten unterwegs sind, statt jedes Byte zur GPU zurückzupendeln. Cornelis sagt, KI-GPUs liefen oft nur bei 42–54 % Auslastung, weil sie auf Daten von anderen Knoten warten. Aufgaben wie kollektive Kommunikation, Mixture-of-Experts-Routing und das Verschieben des Key-Value-Caches im Fabric halten die GPUs ausgelastet und können die Auslastung laut CEO Lisa Spelman um fünf bis zehn Punkte heben — ein direkter Kosten- und Durchsatzgewinn auf einem großen Cluster.
Wie unterscheidet sich Cornelis von Nvidias Netzwerktechnik?
Nvidia verkauft einen integrierten Stack — GPUs, NVLink für Scale-up sowie InfiniBand oder Spectrum-Ethernet für Scale-out —, abgestimmt auf die eigene Software. Cornelis ist GPU-unabhängig und offen: Die Multimode-SuperNIC CN6000 mit 800 Gigabit betreibt sowohl proprietäres Omni-Path als auch Standard-RoCEv2-Ethernet, arbeitet mit Broadcom-Tomahawk-Switches und zielt auf offene Scale-up-Standards wie UALink und ESUN. Nvidias optimierte Software macht den Gesamt-Stack leichter einführbar; ein offenes Fabric gibt Käufern Hardware-Auswahl und weniger Lock-in.
Ist das relevant, wenn wir GPUs in der Cloud mieten?
Ja, indirekt. Sie wählen das Fabric Ihres Anbieters nicht, aber seine Wirtschaftlichkeit erreicht Sie. Hebt In-Network-Compute die effektive GPU-Auslastung, holen Anbieter in einer Kapazitätsknappheit mehr nutzbare Arbeit aus demselben Silizium, was Token-Preise und Instanzverfügbarkeit beeinflusst. Es bestätigt zudem eine breitere Verschiebung: Das Netzwerk ist nun ein aktiver Teil der KI-Leistung, sodass Datenlokalität, kommunikationslastige Trainingsmuster und Anbieterwahl zunehmend den realen Durchsatz bestimmen — nicht nur das GPU-Modell auf der Rechnung.
Was sollten Engineering-Teams jetzt damit tun?
Behandeln Sie das Netzwerk als Leistungsvariable erster Klasse. Profilieren Sie, wo Jobs tatsächlich Zeit verbringen, und prüfen Sie, ob GPUs eher durch Kommunikation als durch Rechenlast ausgehungert werden. Fragen Sie bei der Bewertung von Instanzen oder Clustern nach Interconnect-Bandbreite, kollektiver Leistung und In-Network-Offload, nicht nur nach GPU-Typ und -Anzahl. Halten Sie den Stack portabel, indem Sie offene Standards bevorzugen. Für die meisten Teams liegen die wirkungsvollsten Gewinne weiter in der Software: besseres Batching, Datenpipelines und Kommunikationsmuster, die teure Beschleuniger beschäftigt halten.
Quellen
TechCrunch — AI infrastructure company Cornelis raises $205M to chip away at Nvidia's dominance (14. September 2026)
Network World — Cornelis lands $205M to make AI networks compute, not just connect