Enterprise AI

Souveräne Rechenleistung kostet ein Drittel mehr. Lässt sich ein Drittel einsparen?

Souveräne Rechenleistung kostet ein Drittel mehr. Lässt sich ein Drittel einsparen?

Dr. Anoj Winston Gladius

Dr. Anoj Winston Gladius

·

14

Min. Lesezeit

Effizienz ist die neue Souveränität

aufsatz

Bild: KI generiert mit neuland.ai HUB

Vier Zahlen, die 2026 veröffentlicht wurden, erzählen zusammen eine Geschichte, die keine von ihnen allein erzählt. Europäische Rechenzentren liegen bei den Betriebskosten 20 bis 30 Prozent über dem amerikanischen Niveau, getrieben von Energiepreisen, Baugenehmigungen und Netzzugang, mit Vorlaufzeiten für Netzanschlüsse von bis zu zehn Jahren in den wichtigsten Märkten. Als Cedrik Neike, der bei Siemens Digital Industries leitet, auf der VivaTech sein Publikum fragte, wie viel mehr es für europäische Rechenleistung zahlen würde, lautete die Antwort: fünf bis zehn Prozent. Der Strompreis für energieintensive Industrie in der EU lag laut der Internationalen Energieagentur im Durchschnitt bei mehr als dem Doppelten des amerikanischen Preises, und CBRE erwartet, dass die Kosten für Rechenzentrumskapazität in Frankfurt, London, Amsterdam, Dublin und Paris 2026 um rund 12 Prozent steigen. Am 22. September veröffentlichte Anthropic Claude Opus 5.5 zu einem Preis, der 20 Prozent unter dem des Vorgängers liegt. Am 28. September setzte das EU Institute for Security Studies die Teile zusammen: In einem Brief argumentierte es, dass Energie zur Voraussetzung für KI-Stärke geworden sei. Die Vereinigten Staaten, China und die Golfstaaten verbinden technologischen Ehrgeiz mit reichlich verfügbarer, bezahlbarer Energie, während Europa mit hohen Preisen, überlasteten Netzen und Importabhängigkeit zu kämpfen hat. Zusammengelesen sind das keine vier unabhängigen Geschichten. Die billigste Intelligenz der Welt wird billiger, die souveräne Version wird teurer, und die Käufer haben klar gesagt, dass sie die Differenz nicht zahlen werden. Für europäische Unternehmen bleibt eine Frage, die schwerer wiegt als die anderen: Wenn souveräne Rechenleistung ein Drittel mehr kostet - lässt sich ein Drittel einsparen?

Dies ist der fünfundzwanzigste Beitrag einer Serie, die ich für neuland.ai schreibe. Jeder einzelne hat dasselbe Grundargument weitergetrieben: Der Wert, das Risiko und der Burggraben in Enterprise AI liegen nicht im Modell. Sie liegen in der Schicht darüber und darum herum. [¹] Frühere Beiträge dieser Serie haben argumentiert, dass Standort-Souveränität bald zur Massenware wird, während Kontroll-Souveränität nicht käuflich ist, und dass Rechenleistung - nicht Modellqualität - zum bindenden Engpass geworden ist. Dieser Beitrag folgt beiden Argumenten dorthin, wo sie auf das Budget treffen.

Souveränität ist ein Effizienzproblem, bevor sie ein Beschaffungsproblem ist. Und diese vier Zahlen sind der klarste Beleg dafür, den ich bisher gesehen habe.

Erste Zahl: Europäische Rechenleistung kostet mehr und wird weiter mehr kosten

Die Kostenlücke ist strukturell, nicht konjunkturell. Europäische Rechenzentren zahlen mehr für Strom, warten länger auf Netzanschlüsse und stecken länger in Genehmigungsverfahren als ihre amerikanischen Pendants, und die Differenz summiert sich auf 20 bis 30 Prozent bei den Betriebskosten. [²] Der EU-Industriestrompreis lag im Schnitt bei mehr als dem Doppelten des US-Preises, und der Energiepreisschock von 2026, ausgelöst durch den Konflikt am Golf, hat die Lücke vergrößert statt verkleinert. Das europäische Rechenzentrumsforschungsteam von CBRE erwartet, dass die Kosten für die Sicherung von Kapazität in den fünf größten europäischen Märkten 2026 im Durchschnitt um rund 12 Prozent steigen, und ist deutlich, wohin das führt: Die Anbieter geben diese Kosten zunehmend an die Kunden weiter. [³]

Die Nachfrage wartet nicht, bis sich die Preise beruhigen. Die Internationale Energieagentur berichtet, dass der weltweite Stromverbrauch von Rechenzentren 2025 um 17 Prozent auf 485 TWh gestiegen ist und dass KI-fokussierte Einrichtungen innerhalb eines Jahres um die Hälfte gewachsen sind. [⁴] Nicht ganz Europa ist gleich - die nordischen Märkte und Frankreich haben deutlich günstigeren Strom als der europäische Durchschnitt, weshalb Mistral einen großen Teil seiner Rechenzentrumsinvestitionen nach Schweden verlagert hat. Aber für die meisten europäischen Unternehmen steht die Rechenleistung, die sie gern souverän nennen würden, in Märkten, in denen der Preis steigt.

Zweite Zahl: Die Käufer haben bereits gesagt, was sie zahlen

Auf der VivaTech 2026 fragte Cedrik Neike von Siemens einen Saal voller Technologieeinkäufer, welchen Aufpreis sie für europäische Rechenleistung akzeptieren würden. Für mehr als zehn Prozent gingen kaum Hände hoch. Seine Zusammenfassung war präzise: "5 to 10%, that's the maximum somebody's willing to pay for European compute." [Übersetzung: 5 bis 10 Prozent, das ist das Maximum, das jemand bereit ist, für europäische Rechenleistung zu zahlen. [²]

Das ist die Zahl, an der sich jede Souveränitätsstrategie messen lassen muss, und sie liegt weit unter 20 bis 30. Sie kommt zudem auf Budgets obendrauf, die ohnehin unter Druck stehen. McKinseys State-of-AI-Umfrage vom August ergab, dass ein Fünftel der Organisationen sagt, die KI-Betriebskosten einschließlich Token-Kosten schränkten ihre Nutzung von KI bereits ein. [⁵] Kein Beschaffungsgremium genehmigt einen 30-Prozent-Aufpreis auf eine wachsende Kostenposition, weil ein Strategiepapier sagt, dass Souveränität wichtig ist. In der Praxis gewinnt die günstigere Option - leise, Workload für Workload.

Dritte Zahl: Die Frontier wird immer billiger

Auf der anderen Seite des Atlantiks bewegt sich der Preis in die entgegengesetzte Richtung. Als Anthropic Claude Opus 5.5 veröffentlichte, lag der Preis 20 Prozent unter dem von Claude Opus 5. [⁶] OpenAI und Google sind bei ihren jüngsten Releases demselben Muster gefolgt. Frontier-Tokens werden billiger, weil sie in enormem Maßstab produziert werden, an Standorten mit billigem Strom, auf Hardware, die über die größten Kundenstämme der Welt amortisiert wird.

Europa wird das nicht überbieten. Stanfords AI Index beziffert die privaten KI-Investitionen 2025 auf rund 286 Milliarden Dollar in den Vereinigten Staaten gegenüber rund 21 Milliarden in Europa. [⁴] Was auch immer in den nächsten fünf Jahren an europäischer Rechenleistung gebaut wird, wird mit einem Kostennachteil gebaut, von einem Markt mit einem Bruchteil des Kapitals.

Was die Zahlen verbindet

Es wäre verlockend, diese Zahlen als eine Energiegeschichte, eine Beschaffungsgeschichte und eine Preisgeschichte zu lesen. Es ist eine Geschichte. Die billigste Intelligenz, die einem europäischen Unternehmen zur Verfügung steht, wird billiger, und sie ist nicht souverän. Die souveräne Version wird teurer. Der Abstand zwischen beiden ist der Preis der Kontrolle, und er wächst.

Der EUISS-Brief hat recht, dass Energiegeografie, Netzreform und Standortanreize wichtig sind und dass Europa die KI-Nachfrage dorthin lenken sollte, wo und wann erneuerbarer Überschussstrom verfügbar ist. [⁷] All das sollte geschehen. Nichts davon wird eine 20- bis 30-Prozent-Lücke innerhalb des Planungshorizonts eines CIO schließen, der im nächsten Quartal eine Vertragsverlängerung unterschreiben muss. Eine zehnjährige Netzanschluss-Warteschlange ist keine Beschaffungsoption.

Wenn also der Aufpreis weder gezahlt noch rechtzeitig wegsubventioniert wird, bleibt eine Variable, die ein europäisches Unternehmen tatsächlich kontrolliert.

Der Punkt, der mehr zählt als der Energiepreis

Hier ist der Teil, den ich in der europäischen Souveränitätsdebatte noch nicht klar genug aufgeschrieben gesehen habe. Den Preis einer Kilowattstunde in Frankfurt kann man nicht ändern. Wie viele davon man pro Antwort ausgibt, pro abgeglichenem Dokument, pro abgeschlossenem Engineering-Check - das schon.

Die Rechnung lohnt sich einmal. Z.ais GLM-5.3-Flash, im August unter einer MIT-Lizenz veröffentlicht, kostet ungefähr ein Zehntel seines größeren Geschwistermodells GLM-5.3 bei vergleichbarer Leistung über ein breites Spektrum von Unternehmensaufgaben. [⁸] Ein Workload von einem zum anderen umzurouten verändert die Kosten dieses Workloads um rund neunzig Prozent. Ein 30-Prozent-Energieaufpreis ist klein neben einem zehnfachen Unterschied darin, wie viel Rechenleistung die Arbeit tatsächlich verbraucht.

Und die meisten Enterprise-AI-Stacks sind weit von Effizienz entfernt, weil sie entworfen wurden, als Tokens faktisch subventioniert waren und niemand gemessen hat. Dort liegt der eigentliche Spielraum.

Wo die Rechenleistung tatsächlich hingeht

In unseren Projekten sehen wir immer wieder dieselben sieben Quellen der Verschwendung. Keine davon braucht einen Forschungsdurchbruch.

  1. Jede Anfrage geht an das größte Modell

    Der Großteil des Unternehmens-Traffics ist Extraktion, Klassifikation, Entwurf und Fragebeantwortung über die eigenen Dokumente des Unternehmens. Für diese Arbeit erreicht ein domänenspezifisch trainiertes Open-Weight-Modell auf Hardware, die der Kunde kontrolliert, häufig ein Frontier-Modell und übertrifft es manchmal, weil es das Vokabular und die Dokumente des Unternehmens gesehen hat. [⁹] Frontier-Kapazität sollte eine Routing-Entscheidung für die Arbeit sein, die sie braucht, nicht der Standard für alles.


  2. Der gesamte Korpus geht in den Prompt

    Sehr große Kontextfenster sind auf eine Weise teuer, die schneller wächst als der Kontext selbst, und die Antwortqualität sinkt, wenn das Fenster sich füllt. [¹⁰] Der erste Beitrag dieser Serie argumentierte, dass man immer erst reduzieren sollte, bevor man schlussfolgert. Gezielt abrufen, das System den Korpus während des Schlussfolgerns abfragen lassen statt alles vorab zu laden - und eine Aufgabe, die nach einer Million Tokens aussah, braucht oft ein paar tausend relevante.


  3. Jede Session bekommt eine Maschine

    Ein gängiges Agenten-Design provisioniert eine Ausführungsumgebung für jede Session, für den Fall, dass der Agent Code ausführen muss. Die meisten Agenten-Turns führen nichts aus - sie rufen ab, lesen, planen und schreiben. Erst beim ersten tatsächlichen Bedarf zu provisionieren statt bei Ankunft beseitigt einen großen Anteil an Infrastruktur, die sonst im Leerlauf steht.


  4. Agenten im Leerlauf halten an allem fest

    Wenn jede Konversation ihr eigener Prozess ist, der seinen Zustand im Speicher hält, kostet ein Agent im Leerlauf fast so viel wie ein beschäftigter - und die meisten Agenten sind die meiste Zeit im Leerlauf. Wenn eine Session ihren Zustand stattdessen in einem persistenten Protokoll hält und zwischen Turns nichts behält, kann sie bei Bedarf neu aufgebaut werden, viele Sessions können sich einen Prozess teilen, und Leerlauf wird fast kostenlos.


  5. Alle Arbeit wird als dringend behandelt

    Hier wird die EUISS-Empfehlung praktisch. KI-Nachfrage mit billigem und erneuerbarem Strom abzugleichen ist nur möglich, wenn die Architektur Arbeit trennt, die in Sekunden antworten muss, von Arbeit, die warten kann. Batch-Verarbeitung, Embedding, Re-Indexierung, Evaluierungsläufe und Batch-Analysen können an günstigere Standorte und zu günstigeren Zeiten wandern. Interaktives Schlussfolgern bleibt nah beim Nutzer. Eine Plattform, die alles als interaktiv behandelt, kann billigen Strom nicht nutzen, selbst wenn er verfügbar ist.


  6. Der Computer auf jedem Schreibtisch tut nichts

    Apple, Qualcomm, Intel und AMD liefern mittlerweile Neuronalprozessoren in praktisch jedem Business-Laptop, und fast nichts davon wird für Enterprise AI genutzt. Ein früherer Beitrag dieser Serie argumentierte, dass der Endpunkt die Rechenleistungsstufe ist, die niemand bepreist. [¹¹] Er kann weder den Korpus noch das Berechtigungsmodell halten, Retrieval bleibt also auf dem Server - aber Reasoning-Schritte können auf Hardware laufen, die bereits bezahlt ist, bereits innerhalb des Perimeters liegt und bereits unter europäischer Jurisdiktion steht.


  7. Niemand misst Kosten pro Ergebnis

    Kosten pro Token und Kosten pro Turn führen beide in die Irre, weil die Reasoning-Länge enorm variiert und ein billiger Turn, der scheitert, mehr kostet als ein teurer, der gelingt. Die Zahl, die zeigt, ob ein Stack effizient ist, sind die Kosten pro abgeschlossener Arbeitseinheit: pro abgeglichenem Dokument, pro verifiziertem Befund, pro geschlossenem Fall. Ich würde jeden CIO, der das hier liest, ermutigen, diese Zahl vor der nächsten Verlängerung von seinen Anbietern zu verlangen. Wenn eine Plattform sie nicht ausweisen kann, kann niemand sagen, ob sie effizient ist - auch der Anbieter nicht.

Was Effizienz nicht leisten kann

Drei Grenzen gehören in die Argumentation. Effizienz bringt kein Frontier-Training nach Europa; die größten Modelle werden weiterhin dort trainiert, wo Energie billig ist, und manche Aufgaben werden sie tatsächlich brauchen. Das ist in Ordnung, wenn der Zugriff eine bewusste Routing-Entscheidung mit Jurisdiktion als einer ihrer Variablen ist, und nicht in Ordnung, wenn er der Standard ist. Effizienz ist auch nicht gratis: Routing, Distillation, Retrieval-Disziplin und eine Laufzeitumgebung, die nur bei Bedarf provisioniert, sind echte Ingenieurarbeit. Und sie verschafft Europa keinen Vorsprung gegenüber irgendwem, weil ein amerikanisches Unternehmen dieselben Verbesserungen vornehmen kann. Sie beseitigt einen Nachteil. Angesichts der Größe des Nachteils reicht das.

Wo neuland.ai steht

Der neuland.ai HUB ist eine souveräne KI-Management- und Orchestrierungsplattform, und Effizienz ist einer der Gründe, warum er so gebaut ist, wie er ist. Jeder Workload wird nach Fähigkeit, Kosten, Standort und Policy geroutet: Open-Weight-Modelle, die wir hosten - GLM, Mistral Large 3, Qwen, DeepSeek und andere - tragen den Großteil der Arbeit, und proprietäre Endpunkte wie Claude und GPT werden dort eingesetzt, wo die Aufgabe es rechtfertigt und die Policy des Kunden es erlaubt. Weil wir kein Modell verkaufen, ist die günstigste ausreichende Antwort ein normales Ergebnis und keine Bedrohung für unsere Marge. Retrieval verengt den Kontext, bevor das Modell schlussfolgert, wobei die Berechtigungen des Nutzers zuerst angewendet werden. Der HUB läuft auf der Infrastruktur, die der Kunde wählt - On-Premises, in einer europäischen Sovereign Cloud wie STACKIT oder in einer Hyperscaler-Region, wo der Workload es erlaubt. Und die Agent-Laufzeitumgebung unter der Plattform wird um zwei Entscheidungen herum gebaut: Ausführung wird erst beim ersten Bedarf provisioniert, und Sessions halten zwischen Turns nichts. Endpoint-Inferenz ist eine erklärte Richtung, keine ausgelieferte Fähigkeit.  [¹²]

Das ist auch die Antwort auf eine Frage, die ich von CFOs öfter höre als von CIOs: Ist souveräne KI nicht einfach teurer? Pro Token, ehrlich gesagt, ja - und das wird noch eine Weile so bleiben. Pro abgeschlossener Arbeitseinheit muss das nicht so sein. Nach unserer Erfahrung zahlen die Kunden, die am Ende mehr für Souveränität zahlen, fast immer für Verschwendung, die sie überall gehabt hätten.

Persönliche Einordnung

Ich möchte mit der Rahmung hier vorsichtig sein. Dieser Beitrag ist kein Argument gegen europäische Rechenzentren, und er ist kein Argument gegen die Energie- und Netzreformen, die der EUISS-Brief empfiehlt. Beides ist nötig, und Europa wird eigene Rechenleistung brauchen, unabhängig davon, wie effizient seine Software wird.

Wogegen ich mich wehre, ist die Vorstellung, Souveränität sei etwas, das ein europäisches Unternehmen kauft - ein Zertifikat, eine Region, ein Aufpreis auf einer Rechnung. Die europäische KI-Debatte wurde bislang fast vollständig in Investitionsausgaben geführt: wie viele Gigawatt, wie viele Beschleuniger, welche Gigafactory. Das ist ein Wettlauf, den Europa konstruktionsbedingt verliert, und die Investitionszahlen belegen das. Den Wettlauf, den Europa gewinnen kann, misst Output pro Kilowattstunde. Die europäische Industrie hat sich jahrzehntelang über Effizienz statt über billige Energie behauptet, und es gibt keinen Grund, warum Enterprise AI die Ausnahme sein sollte.

Die regulatorische Richtung weist denselben Weg. Der EU AI Act gilt seit dem 2. August 2026 in der Breite; der Digital Omnibus verschiebt die Hochrisiko-Verpflichtungen aus Anhang III auf den 2. Dezember 2027 und Anhang I auf den 2. August 2028. [¹³] Im Rahmen des Bewertungsschemas der Union für die Energieeffizienz von Rechenzentren wird Effizienz zudem zu etwas, das Betreiber berichten, statt zu etwas, das sie behaupten. Unternehmen, die jetzt anfangen, Kosten pro Arbeitseinheit zu messen, werden sich in beiden Gesprächen deutlich leichter tun.

Wir bei neuland.ai geben das Geld unserer Kunden lieber für weniger, besser gewählte Tokens aus als für einen Aufpreis auf Tokens, die sie nie gebraucht haben. Souveräne Rechenleistung kostet ein Drittel mehr. Die meisten Unternehmen können heute weit mehr als ein Drittel von dem einsparen, was sie verbrauchen.


  1. Serienartikel verfügbar unter neuland.ai/en/resources/insights.

  2. Cedrik Neike (Mitglied des Vorstands, Siemens AG; CEO Digital Industries), Bemerkungen auf der VivaTech 2026, berichtet von DIGITIMES, "Europe's AI infrastructure: the cost gap that policy cannot paper over", Juni 2026. Betriebskosten europäischer Rechenzentren 20 bis 30 Prozent über US-Niveau, getrieben durch Energiepreise, Baugenehmigungen und Netzengpässe; Vorlaufzeiten von bis zu zehn Jahren in den wichtigsten Märkten.

  3. Internationale Energieagentur, Electricity 2026: EU-Strompreise für energieintensive Industrie im Durchschnitt mehr als doppelt so hoch wie in den USA. CBRE European Data Centre Research, 2026: durchschnittlich 12 Prozent Anstieg der Kosten für die Sicherung von Rechenzentrumskapazität in Frankfurt, London, Amsterdam, Dublin und Paris; Zitat Kevin Restivo, Director, European Data Centre Research, CBRE, berichtet von OilPrice.com, Mai 2026. Zum Energiepreisschock 2026 und dem relativen Kostenvorteil der nordischen Märkte und Frankreichs siehe CNBC, "High energy prices could derail Europe's AI race with U.S. and China", 18. Mai 2026.

  4. Internationale Energieagentur, Key Questions on Energy and AI, 2026: weltweiter Stromverbrauch von Rechenzentren 2025 um 17 Prozent auf 485 TWh gestiegen, KI-fokussierte Einrichtungen um 50 Prozent gewachsen. Stanford HAI, AI Index 2026: private KI-Investitionen 2025 von rund 285,9 Milliarden US-Dollar in den Vereinigten Staaten und rund 20,9 Milliarden US-Dollar in Europa.

  5. McKinsey, The State of AI, veröffentlicht 25. August 2026: 20 Prozent der Befragten berichten, dass KI-Betriebskosten einschließlich Token-Kosten ihre Nutzung von KI einschränken.

  6. Anthropic, Claude Opus 5.5, veröffentlicht 22. September 2026, Preis 20 Prozent unter Claude Opus 5.

  7. European Union Institute for Security Studies, "Feeding the beast: Energy security as a precondition for the EU's AI power", Brief, 28. September 2026, herausgegeben von Clotilde Bômont und Caspar Hobhouse.

  8. Z.ai, GLM-5.3-Flash, veröffentlicht 26. August 2026 unter der MIT-Lizenz; Listenpreis 0,15 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens, gegenüber 1,40 und 4,40 US-Dollar für GLM-5.3. Siehe auch den früheren Beitrag dieser Serie zur Blindbewertung.

  9. Siehe den früheren Beitrag dieser Serie zu Distillation und kundenspezifischen kleinen Modellen.

  10. Hong, Troynikov und Huber, "Context rot: how context degradation affects LLM performance", Chroma Technical Report, Juli 2025. Zum Prinzip erst reduzieren, dann schlussfolgern siehe den ersten Beitrag dieser Serie, "Control Panels, Execution Surfaces und das Ende der Prompt-First-Automatisierung".

  11. Siehe den früheren Beitrag dieser Serie zum Rechenleistungs-Engpass und dem Endpunkt als unbepreister Stufe.

  12. neuland.ai HUB: Routing pro Workload nach Fähigkeit, Kosten, Standort und kundenspezifischer Policy über selbst gehostete Open-Weight- und proprietäre Modelle; berechtigungsgesteuertes Retrieval vor dem Schlussfolgern; Betrieb On-Premises, in einer europäischen Sovereign Cloud oder in einer Hyperscaler-Region, einschließlich Air-Gapped-Betrieb. Die beschriebenen Laufzeitprinzipien spiegeln die aktuelle Engineering-Richtung wider; Endpoint-Inferenz ist eine erklärte architektonische Richtung, keine ausgelieferte Fähigkeit. neuland.ai AG behält die Verantwortung für Inhaltsqualität und saubere Ergebnislieferung über alle Kundenprojekte hinweg.

  13. Verordnung (EU) 2024/1689 (AI Act), seit dem 2. August 2026 in der Breite anwendbar. Rat der EU und Europäisches Parlament, vorläufige politische Einigung zum Digital Omnibus on AI, 7. Mai 2026: Hochrisiko-Verpflichtungen aus Anhang III verschoben auf den 2. Dezember 2027; Anhang-I-Verpflichtungen verschoben auf den 2. August 2028. Delegierte Verordnung (EU) 2024/1364 der Kommission zur ersten Phase eines gemeinsamen Bewertungsschemas der Union für Rechenzentren im Rahmen der Energieeffizienzrichtlinie.

Vier Zahlen, die 2026 veröffentlicht wurden, erzählen zusammen eine Geschichte, die keine von ihnen allein erzählt. Europäische Rechenzentren liegen bei den Betriebskosten 20 bis 30 Prozent über dem amerikanischen Niveau, getrieben von Energiepreisen, Baugenehmigungen und Netzzugang, mit Vorlaufzeiten für Netzanschlüsse von bis zu zehn Jahren in den wichtigsten Märkten. Als Cedrik Neike, der bei Siemens Digital Industries leitet, auf der VivaTech sein Publikum fragte, wie viel mehr es für europäische Rechenleistung zahlen würde, lautete die Antwort: fünf bis zehn Prozent. Der Strompreis für energieintensive Industrie in der EU lag laut der Internationalen Energieagentur im Durchschnitt bei mehr als dem Doppelten des amerikanischen Preises, und CBRE erwartet, dass die Kosten für Rechenzentrumskapazität in Frankfurt, London, Amsterdam, Dublin und Paris 2026 um rund 12 Prozent steigen. Am 22. September veröffentlichte Anthropic Claude Opus 5.5 zu einem Preis, der 20 Prozent unter dem des Vorgängers liegt. Am 28. September setzte das EU Institute for Security Studies die Teile zusammen: In einem Brief argumentierte es, dass Energie zur Voraussetzung für KI-Stärke geworden sei. Die Vereinigten Staaten, China und die Golfstaaten verbinden technologischen Ehrgeiz mit reichlich verfügbarer, bezahlbarer Energie, während Europa mit hohen Preisen, überlasteten Netzen und Importabhängigkeit zu kämpfen hat. Zusammengelesen sind das keine vier unabhängigen Geschichten. Die billigste Intelligenz der Welt wird billiger, die souveräne Version wird teurer, und die Käufer haben klar gesagt, dass sie die Differenz nicht zahlen werden. Für europäische Unternehmen bleibt eine Frage, die schwerer wiegt als die anderen: Wenn souveräne Rechenleistung ein Drittel mehr kostet - lässt sich ein Drittel einsparen?

Dies ist der fünfundzwanzigste Beitrag einer Serie, die ich für neuland.ai schreibe. Jeder einzelne hat dasselbe Grundargument weitergetrieben: Der Wert, das Risiko und der Burggraben in Enterprise AI liegen nicht im Modell. Sie liegen in der Schicht darüber und darum herum. [¹] Frühere Beiträge dieser Serie haben argumentiert, dass Standort-Souveränität bald zur Massenware wird, während Kontroll-Souveränität nicht käuflich ist, und dass Rechenleistung - nicht Modellqualität - zum bindenden Engpass geworden ist. Dieser Beitrag folgt beiden Argumenten dorthin, wo sie auf das Budget treffen.

Souveränität ist ein Effizienzproblem, bevor sie ein Beschaffungsproblem ist. Und diese vier Zahlen sind der klarste Beleg dafür, den ich bisher gesehen habe.

Erste Zahl: Europäische Rechenleistung kostet mehr und wird weiter mehr kosten

Die Kostenlücke ist strukturell, nicht konjunkturell. Europäische Rechenzentren zahlen mehr für Strom, warten länger auf Netzanschlüsse und stecken länger in Genehmigungsverfahren als ihre amerikanischen Pendants, und die Differenz summiert sich auf 20 bis 30 Prozent bei den Betriebskosten. [²] Der EU-Industriestrompreis lag im Schnitt bei mehr als dem Doppelten des US-Preises, und der Energiepreisschock von 2026, ausgelöst durch den Konflikt am Golf, hat die Lücke vergrößert statt verkleinert. Das europäische Rechenzentrumsforschungsteam von CBRE erwartet, dass die Kosten für die Sicherung von Kapazität in den fünf größten europäischen Märkten 2026 im Durchschnitt um rund 12 Prozent steigen, und ist deutlich, wohin das führt: Die Anbieter geben diese Kosten zunehmend an die Kunden weiter. [³]

Die Nachfrage wartet nicht, bis sich die Preise beruhigen. Die Internationale Energieagentur berichtet, dass der weltweite Stromverbrauch von Rechenzentren 2025 um 17 Prozent auf 485 TWh gestiegen ist und dass KI-fokussierte Einrichtungen innerhalb eines Jahres um die Hälfte gewachsen sind. [⁴] Nicht ganz Europa ist gleich - die nordischen Märkte und Frankreich haben deutlich günstigeren Strom als der europäische Durchschnitt, weshalb Mistral einen großen Teil seiner Rechenzentrumsinvestitionen nach Schweden verlagert hat. Aber für die meisten europäischen Unternehmen steht die Rechenleistung, die sie gern souverän nennen würden, in Märkten, in denen der Preis steigt.

Zweite Zahl: Die Käufer haben bereits gesagt, was sie zahlen

Auf der VivaTech 2026 fragte Cedrik Neike von Siemens einen Saal voller Technologieeinkäufer, welchen Aufpreis sie für europäische Rechenleistung akzeptieren würden. Für mehr als zehn Prozent gingen kaum Hände hoch. Seine Zusammenfassung war präzise: "5 to 10%, that's the maximum somebody's willing to pay for European compute." [Übersetzung: 5 bis 10 Prozent, das ist das Maximum, das jemand bereit ist, für europäische Rechenleistung zu zahlen. [²]

Das ist die Zahl, an der sich jede Souveränitätsstrategie messen lassen muss, und sie liegt weit unter 20 bis 30. Sie kommt zudem auf Budgets obendrauf, die ohnehin unter Druck stehen. McKinseys State-of-AI-Umfrage vom August ergab, dass ein Fünftel der Organisationen sagt, die KI-Betriebskosten einschließlich Token-Kosten schränkten ihre Nutzung von KI bereits ein. [⁵] Kein Beschaffungsgremium genehmigt einen 30-Prozent-Aufpreis auf eine wachsende Kostenposition, weil ein Strategiepapier sagt, dass Souveränität wichtig ist. In der Praxis gewinnt die günstigere Option - leise, Workload für Workload.

Dritte Zahl: Die Frontier wird immer billiger

Auf der anderen Seite des Atlantiks bewegt sich der Preis in die entgegengesetzte Richtung. Als Anthropic Claude Opus 5.5 veröffentlichte, lag der Preis 20 Prozent unter dem von Claude Opus 5. [⁶] OpenAI und Google sind bei ihren jüngsten Releases demselben Muster gefolgt. Frontier-Tokens werden billiger, weil sie in enormem Maßstab produziert werden, an Standorten mit billigem Strom, auf Hardware, die über die größten Kundenstämme der Welt amortisiert wird.

Europa wird das nicht überbieten. Stanfords AI Index beziffert die privaten KI-Investitionen 2025 auf rund 286 Milliarden Dollar in den Vereinigten Staaten gegenüber rund 21 Milliarden in Europa. [⁴] Was auch immer in den nächsten fünf Jahren an europäischer Rechenleistung gebaut wird, wird mit einem Kostennachteil gebaut, von einem Markt mit einem Bruchteil des Kapitals.

Was die Zahlen verbindet

Es wäre verlockend, diese Zahlen als eine Energiegeschichte, eine Beschaffungsgeschichte und eine Preisgeschichte zu lesen. Es ist eine Geschichte. Die billigste Intelligenz, die einem europäischen Unternehmen zur Verfügung steht, wird billiger, und sie ist nicht souverän. Die souveräne Version wird teurer. Der Abstand zwischen beiden ist der Preis der Kontrolle, und er wächst.

Der EUISS-Brief hat recht, dass Energiegeografie, Netzreform und Standortanreize wichtig sind und dass Europa die KI-Nachfrage dorthin lenken sollte, wo und wann erneuerbarer Überschussstrom verfügbar ist. [⁷] All das sollte geschehen. Nichts davon wird eine 20- bis 30-Prozent-Lücke innerhalb des Planungshorizonts eines CIO schließen, der im nächsten Quartal eine Vertragsverlängerung unterschreiben muss. Eine zehnjährige Netzanschluss-Warteschlange ist keine Beschaffungsoption.

Wenn also der Aufpreis weder gezahlt noch rechtzeitig wegsubventioniert wird, bleibt eine Variable, die ein europäisches Unternehmen tatsächlich kontrolliert.

Der Punkt, der mehr zählt als der Energiepreis

Hier ist der Teil, den ich in der europäischen Souveränitätsdebatte noch nicht klar genug aufgeschrieben gesehen habe. Den Preis einer Kilowattstunde in Frankfurt kann man nicht ändern. Wie viele davon man pro Antwort ausgibt, pro abgeglichenem Dokument, pro abgeschlossenem Engineering-Check - das schon.

Die Rechnung lohnt sich einmal. Z.ais GLM-5.3-Flash, im August unter einer MIT-Lizenz veröffentlicht, kostet ungefähr ein Zehntel seines größeren Geschwistermodells GLM-5.3 bei vergleichbarer Leistung über ein breites Spektrum von Unternehmensaufgaben. [⁸] Ein Workload von einem zum anderen umzurouten verändert die Kosten dieses Workloads um rund neunzig Prozent. Ein 30-Prozent-Energieaufpreis ist klein neben einem zehnfachen Unterschied darin, wie viel Rechenleistung die Arbeit tatsächlich verbraucht.

Und die meisten Enterprise-AI-Stacks sind weit von Effizienz entfernt, weil sie entworfen wurden, als Tokens faktisch subventioniert waren und niemand gemessen hat. Dort liegt der eigentliche Spielraum.

Wo die Rechenleistung tatsächlich hingeht

In unseren Projekten sehen wir immer wieder dieselben sieben Quellen der Verschwendung. Keine davon braucht einen Forschungsdurchbruch.

  1. Jede Anfrage geht an das größte Modell

    Der Großteil des Unternehmens-Traffics ist Extraktion, Klassifikation, Entwurf und Fragebeantwortung über die eigenen Dokumente des Unternehmens. Für diese Arbeit erreicht ein domänenspezifisch trainiertes Open-Weight-Modell auf Hardware, die der Kunde kontrolliert, häufig ein Frontier-Modell und übertrifft es manchmal, weil es das Vokabular und die Dokumente des Unternehmens gesehen hat. [⁹] Frontier-Kapazität sollte eine Routing-Entscheidung für die Arbeit sein, die sie braucht, nicht der Standard für alles.


  2. Der gesamte Korpus geht in den Prompt

    Sehr große Kontextfenster sind auf eine Weise teuer, die schneller wächst als der Kontext selbst, und die Antwortqualität sinkt, wenn das Fenster sich füllt. [¹⁰] Der erste Beitrag dieser Serie argumentierte, dass man immer erst reduzieren sollte, bevor man schlussfolgert. Gezielt abrufen, das System den Korpus während des Schlussfolgerns abfragen lassen statt alles vorab zu laden - und eine Aufgabe, die nach einer Million Tokens aussah, braucht oft ein paar tausend relevante.


  3. Jede Session bekommt eine Maschine

    Ein gängiges Agenten-Design provisioniert eine Ausführungsumgebung für jede Session, für den Fall, dass der Agent Code ausführen muss. Die meisten Agenten-Turns führen nichts aus - sie rufen ab, lesen, planen und schreiben. Erst beim ersten tatsächlichen Bedarf zu provisionieren statt bei Ankunft beseitigt einen großen Anteil an Infrastruktur, die sonst im Leerlauf steht.


  4. Agenten im Leerlauf halten an allem fest

    Wenn jede Konversation ihr eigener Prozess ist, der seinen Zustand im Speicher hält, kostet ein Agent im Leerlauf fast so viel wie ein beschäftigter - und die meisten Agenten sind die meiste Zeit im Leerlauf. Wenn eine Session ihren Zustand stattdessen in einem persistenten Protokoll hält und zwischen Turns nichts behält, kann sie bei Bedarf neu aufgebaut werden, viele Sessions können sich einen Prozess teilen, und Leerlauf wird fast kostenlos.


  5. Alle Arbeit wird als dringend behandelt

    Hier wird die EUISS-Empfehlung praktisch. KI-Nachfrage mit billigem und erneuerbarem Strom abzugleichen ist nur möglich, wenn die Architektur Arbeit trennt, die in Sekunden antworten muss, von Arbeit, die warten kann. Batch-Verarbeitung, Embedding, Re-Indexierung, Evaluierungsläufe und Batch-Analysen können an günstigere Standorte und zu günstigeren Zeiten wandern. Interaktives Schlussfolgern bleibt nah beim Nutzer. Eine Plattform, die alles als interaktiv behandelt, kann billigen Strom nicht nutzen, selbst wenn er verfügbar ist.


  6. Der Computer auf jedem Schreibtisch tut nichts

    Apple, Qualcomm, Intel und AMD liefern mittlerweile Neuronalprozessoren in praktisch jedem Business-Laptop, und fast nichts davon wird für Enterprise AI genutzt. Ein früherer Beitrag dieser Serie argumentierte, dass der Endpunkt die Rechenleistungsstufe ist, die niemand bepreist. [¹¹] Er kann weder den Korpus noch das Berechtigungsmodell halten, Retrieval bleibt also auf dem Server - aber Reasoning-Schritte können auf Hardware laufen, die bereits bezahlt ist, bereits innerhalb des Perimeters liegt und bereits unter europäischer Jurisdiktion steht.


  7. Niemand misst Kosten pro Ergebnis

    Kosten pro Token und Kosten pro Turn führen beide in die Irre, weil die Reasoning-Länge enorm variiert und ein billiger Turn, der scheitert, mehr kostet als ein teurer, der gelingt. Die Zahl, die zeigt, ob ein Stack effizient ist, sind die Kosten pro abgeschlossener Arbeitseinheit: pro abgeglichenem Dokument, pro verifiziertem Befund, pro geschlossenem Fall. Ich würde jeden CIO, der das hier liest, ermutigen, diese Zahl vor der nächsten Verlängerung von seinen Anbietern zu verlangen. Wenn eine Plattform sie nicht ausweisen kann, kann niemand sagen, ob sie effizient ist - auch der Anbieter nicht.

Was Effizienz nicht leisten kann

Drei Grenzen gehören in die Argumentation. Effizienz bringt kein Frontier-Training nach Europa; die größten Modelle werden weiterhin dort trainiert, wo Energie billig ist, und manche Aufgaben werden sie tatsächlich brauchen. Das ist in Ordnung, wenn der Zugriff eine bewusste Routing-Entscheidung mit Jurisdiktion als einer ihrer Variablen ist, und nicht in Ordnung, wenn er der Standard ist. Effizienz ist auch nicht gratis: Routing, Distillation, Retrieval-Disziplin und eine Laufzeitumgebung, die nur bei Bedarf provisioniert, sind echte Ingenieurarbeit. Und sie verschafft Europa keinen Vorsprung gegenüber irgendwem, weil ein amerikanisches Unternehmen dieselben Verbesserungen vornehmen kann. Sie beseitigt einen Nachteil. Angesichts der Größe des Nachteils reicht das.

Wo neuland.ai steht

Der neuland.ai HUB ist eine souveräne KI-Management- und Orchestrierungsplattform, und Effizienz ist einer der Gründe, warum er so gebaut ist, wie er ist. Jeder Workload wird nach Fähigkeit, Kosten, Standort und Policy geroutet: Open-Weight-Modelle, die wir hosten - GLM, Mistral Large 3, Qwen, DeepSeek und andere - tragen den Großteil der Arbeit, und proprietäre Endpunkte wie Claude und GPT werden dort eingesetzt, wo die Aufgabe es rechtfertigt und die Policy des Kunden es erlaubt. Weil wir kein Modell verkaufen, ist die günstigste ausreichende Antwort ein normales Ergebnis und keine Bedrohung für unsere Marge. Retrieval verengt den Kontext, bevor das Modell schlussfolgert, wobei die Berechtigungen des Nutzers zuerst angewendet werden. Der HUB läuft auf der Infrastruktur, die der Kunde wählt - On-Premises, in einer europäischen Sovereign Cloud wie STACKIT oder in einer Hyperscaler-Region, wo der Workload es erlaubt. Und die Agent-Laufzeitumgebung unter der Plattform wird um zwei Entscheidungen herum gebaut: Ausführung wird erst beim ersten Bedarf provisioniert, und Sessions halten zwischen Turns nichts. Endpoint-Inferenz ist eine erklärte Richtung, keine ausgelieferte Fähigkeit.  [¹²]

Das ist auch die Antwort auf eine Frage, die ich von CFOs öfter höre als von CIOs: Ist souveräne KI nicht einfach teurer? Pro Token, ehrlich gesagt, ja - und das wird noch eine Weile so bleiben. Pro abgeschlossener Arbeitseinheit muss das nicht so sein. Nach unserer Erfahrung zahlen die Kunden, die am Ende mehr für Souveränität zahlen, fast immer für Verschwendung, die sie überall gehabt hätten.

Persönliche Einordnung

Ich möchte mit der Rahmung hier vorsichtig sein. Dieser Beitrag ist kein Argument gegen europäische Rechenzentren, und er ist kein Argument gegen die Energie- und Netzreformen, die der EUISS-Brief empfiehlt. Beides ist nötig, und Europa wird eigene Rechenleistung brauchen, unabhängig davon, wie effizient seine Software wird.

Wogegen ich mich wehre, ist die Vorstellung, Souveränität sei etwas, das ein europäisches Unternehmen kauft - ein Zertifikat, eine Region, ein Aufpreis auf einer Rechnung. Die europäische KI-Debatte wurde bislang fast vollständig in Investitionsausgaben geführt: wie viele Gigawatt, wie viele Beschleuniger, welche Gigafactory. Das ist ein Wettlauf, den Europa konstruktionsbedingt verliert, und die Investitionszahlen belegen das. Den Wettlauf, den Europa gewinnen kann, misst Output pro Kilowattstunde. Die europäische Industrie hat sich jahrzehntelang über Effizienz statt über billige Energie behauptet, und es gibt keinen Grund, warum Enterprise AI die Ausnahme sein sollte.

Die regulatorische Richtung weist denselben Weg. Der EU AI Act gilt seit dem 2. August 2026 in der Breite; der Digital Omnibus verschiebt die Hochrisiko-Verpflichtungen aus Anhang III auf den 2. Dezember 2027 und Anhang I auf den 2. August 2028. [¹³] Im Rahmen des Bewertungsschemas der Union für die Energieeffizienz von Rechenzentren wird Effizienz zudem zu etwas, das Betreiber berichten, statt zu etwas, das sie behaupten. Unternehmen, die jetzt anfangen, Kosten pro Arbeitseinheit zu messen, werden sich in beiden Gesprächen deutlich leichter tun.

Wir bei neuland.ai geben das Geld unserer Kunden lieber für weniger, besser gewählte Tokens aus als für einen Aufpreis auf Tokens, die sie nie gebraucht haben. Souveräne Rechenleistung kostet ein Drittel mehr. Die meisten Unternehmen können heute weit mehr als ein Drittel von dem einsparen, was sie verbrauchen.


  1. Serienartikel verfügbar unter neuland.ai/en/resources/insights.

  2. Cedrik Neike (Mitglied des Vorstands, Siemens AG; CEO Digital Industries), Bemerkungen auf der VivaTech 2026, berichtet von DIGITIMES, "Europe's AI infrastructure: the cost gap that policy cannot paper over", Juni 2026. Betriebskosten europäischer Rechenzentren 20 bis 30 Prozent über US-Niveau, getrieben durch Energiepreise, Baugenehmigungen und Netzengpässe; Vorlaufzeiten von bis zu zehn Jahren in den wichtigsten Märkten.

  3. Internationale Energieagentur, Electricity 2026: EU-Strompreise für energieintensive Industrie im Durchschnitt mehr als doppelt so hoch wie in den USA. CBRE European Data Centre Research, 2026: durchschnittlich 12 Prozent Anstieg der Kosten für die Sicherung von Rechenzentrumskapazität in Frankfurt, London, Amsterdam, Dublin und Paris; Zitat Kevin Restivo, Director, European Data Centre Research, CBRE, berichtet von OilPrice.com, Mai 2026. Zum Energiepreisschock 2026 und dem relativen Kostenvorteil der nordischen Märkte und Frankreichs siehe CNBC, "High energy prices could derail Europe's AI race with U.S. and China", 18. Mai 2026.

  4. Internationale Energieagentur, Key Questions on Energy and AI, 2026: weltweiter Stromverbrauch von Rechenzentren 2025 um 17 Prozent auf 485 TWh gestiegen, KI-fokussierte Einrichtungen um 50 Prozent gewachsen. Stanford HAI, AI Index 2026: private KI-Investitionen 2025 von rund 285,9 Milliarden US-Dollar in den Vereinigten Staaten und rund 20,9 Milliarden US-Dollar in Europa.

  5. McKinsey, The State of AI, veröffentlicht 25. August 2026: 20 Prozent der Befragten berichten, dass KI-Betriebskosten einschließlich Token-Kosten ihre Nutzung von KI einschränken.

  6. Anthropic, Claude Opus 5.5, veröffentlicht 22. September 2026, Preis 20 Prozent unter Claude Opus 5.

  7. European Union Institute for Security Studies, "Feeding the beast: Energy security as a precondition for the EU's AI power", Brief, 28. September 2026, herausgegeben von Clotilde Bômont und Caspar Hobhouse.

  8. Z.ai, GLM-5.3-Flash, veröffentlicht 26. August 2026 unter der MIT-Lizenz; Listenpreis 0,15 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens, gegenüber 1,40 und 4,40 US-Dollar für GLM-5.3. Siehe auch den früheren Beitrag dieser Serie zur Blindbewertung.

  9. Siehe den früheren Beitrag dieser Serie zu Distillation und kundenspezifischen kleinen Modellen.

  10. Hong, Troynikov und Huber, "Context rot: how context degradation affects LLM performance", Chroma Technical Report, Juli 2025. Zum Prinzip erst reduzieren, dann schlussfolgern siehe den ersten Beitrag dieser Serie, "Control Panels, Execution Surfaces und das Ende der Prompt-First-Automatisierung".

  11. Siehe den früheren Beitrag dieser Serie zum Rechenleistungs-Engpass und dem Endpunkt als unbepreister Stufe.

  12. neuland.ai HUB: Routing pro Workload nach Fähigkeit, Kosten, Standort und kundenspezifischer Policy über selbst gehostete Open-Weight- und proprietäre Modelle; berechtigungsgesteuertes Retrieval vor dem Schlussfolgern; Betrieb On-Premises, in einer europäischen Sovereign Cloud oder in einer Hyperscaler-Region, einschließlich Air-Gapped-Betrieb. Die beschriebenen Laufzeitprinzipien spiegeln die aktuelle Engineering-Richtung wider; Endpoint-Inferenz ist eine erklärte architektonische Richtung, keine ausgelieferte Fähigkeit. neuland.ai AG behält die Verantwortung für Inhaltsqualität und saubere Ergebnislieferung über alle Kundenprojekte hinweg.

  13. Verordnung (EU) 2024/1689 (AI Act), seit dem 2. August 2026 in der Breite anwendbar. Rat der EU und Europäisches Parlament, vorläufige politische Einigung zum Digital Omnibus on AI, 7. Mai 2026: Hochrisiko-Verpflichtungen aus Anhang III verschoben auf den 2. Dezember 2027; Anhang-I-Verpflichtungen verschoben auf den 2. August 2028. Delegierte Verordnung (EU) 2024/1364 der Kommission zur ersten Phase eines gemeinsamen Bewertungsschemas der Union für Rechenzentren im Rahmen der Energieeffizienzrichtlinie.

Zum Inhalt

Fuß der Seite