
Research
AI Agents
Compute ist die Beschränkung. Der Endpoint ist die Ebene, die niemand einpreist

Article by
Dr. Anoj Winston Gladius
·
Ende Juni 2026 wurde berichtet, dass Google Meta mitgeteilt habe, es könne nicht so viel Zugriff auf Gemini-Modelle erhalten, wie es wollte, weil Google nicht über die Kapazität verfüge, dies zu bedienen. Zwei der fünf wertvollsten Unternehmen der Welt, beide mit faktisch unbegrenzten finanziellen Mitteln, und das eine, das sein eigenes Silizium entwickelt, konnte das andere nicht beliefern. Im selben Zeitraum erhöhte Google seine Investitionsausgaben-Prognose für 2026 auf zwischen 180 und 190 Milliarden Dollar, erklärte, man erwarte für 2027 einen deutlichen Anstieg dieser Zahl, leitete eine Eigenkapitalaufnahme von nahezu 85 Milliarden Dollar ein, ausdrücklich zur Finanzierung von KI-Compute-Infrastruktur, und unterzeichnete einen Mietvertrag im Wert von rund 920 Millionen Dollar pro Monat für Rechenzentrumskapazität von xAI. Innerhalb des Unternehmens standen DeepMind-Forscher für TPUs an, die an externe Kunden verkauft worden waren — Anthropic hatte bis zu eine Million Ironwood-Chips, fünf Gigawatt Kapazität über fünf Jahre, in einer Vereinbarung im Wert von bis zu vierzig Milliarden Dollar kontrahiert, Meta separat unterschrieben. Demis Hassabis räumte die Beschränkung öffentlich ein und lokalisierte sie präzise: wenige Lieferanten weniger Schlüsselkomponenten, was die höfliche Umschreibung für einen High-Bandwidth-Memory-Engpass ist, der sich über drei Anbieter erstreckt und jeden fortgeschrittenen Beschleuniger auf dem Planeten begrenzt. Forscher, bemerkte er, benötigen sehr viele Chips, um neue Ideen in einem sinnvollen Maßstab zu erproben. Nichts davon ist das Verhalten eines Unternehmens, das sich absichert. Es ist das Verhalten eines Unternehmens, das an eine physische Wand gestoßen ist — und eine Wand, die Google bindet, bindet alle dahinter. Für ein europäisches Unternehmen ist die interessante Frage nicht, wer das Kapazitätsrennen gewinnt. Sondern was man damit macht, dass die Gewinner einen rationieren werden, dass der Zähler gerade neu gestaltet wird, um für Compute-Zeit statt Tokens abzurechnen, und dass das beste Inferenz-Silizium der Welt rechtlich nicht in das eigene Gebäude gelangen kann.
Dies ist der achtzehnte Beitrag einer Reihe, die ich für neuland.ai schreibe. [¹] Frühere Beiträge haben argumentiert, dass das Modell eine Komponente und kein Burggraben ist, dass die Routing-Tabelle wichtiger ist als jede einzelne Modellentscheidung, und zuletzt, dass Souveränität des Standorts kurz vor der Kommoditisierung steht, während Souveränität der Kontrolle nicht zum Verkauf steht. [²] Dieser Beitrag handelt von der Ebene darunter, die die vorherigen siebzehn als gegeben behandelt haben: dem Compute selbst. Er hat aufgehört, gegeben zu sein.
Was die beiden abgesicherten Giganten tatsächlich getan haben
Es gibt eine verlockende Erzählung, nach der Google und Apple das KI-Rennen aussitzen, während OpenAI, Anthropic, xAI und die chinesischen Labore es unter sich ausfechten. Sie ist in Bezug auf Google auf eine leicht überprüfbare Weise falsch, und in Bezug auf Apple auf eine interessantere Weise.
Google sitzt nicht aus. Google läuft im Rennen mit, während es gleichzeitig die meisten anderen Läufer beliefert. Es trainierte sein eigenes Frontier-Modell vollständig auf eigenem Silizium, brachte eine Enterprise-Agentenplattform in die allgemeine Verfügbarkeit und verkaufte riesige Blöcke an Beschleunigerkapazität an zwei seiner direktesten Wettbewerber — mit der Folge, dass die eigene Forschungsorganisation nun hinter zahlenden Kunden wartet und mindestens ein langjähriger Forscher zu einem Startup mit besserem Zugang zu Chips gewechselt ist. [³] Das ist ein Unternehmen, das sich so stark dem Rennen verschrieben hat, dass es seine eigene experimentelle Kapazität kannibalisiert, um den Markt zu bedienen, und von einem Rivalen mietet, um die Lücke zu schließen.
Apple sieht eher nach Verzicht aus, ist es aber nicht. Apple bewertete seine eigenen Modelle bei Gesprächsqualität, Reasoning und mehrstufiger Aufgabenerledigung als zwölf bis achtzehn Monate hinter der Frontier zurückliegend und lizenzierte im Januar 2026 eine maßgeschneiderte Gemini-Variante für rund eine Milliarde Dollar pro Jahr, statt etwas Unterlegenes auszuliefern und zu warten. [⁴] Aber schauen Sie auf die Architektur, die im Juni auf der WWDC ankam, statt auf die Schlagzeile. Ein kleines On-Device-Modell mit ungefähr drei Milliarden Parametern übernimmt latenz- und datenschutzsensible Arbeit. Eine kontrollierte Cloud-Umgebung übernimmt die Mitte. Das schwerste Reasoning wird an die lizenzierte Frontier-Ebene geroutet. Apples eigene Modelle der nächsten Generation und sein eigenes Server-Silizium befinden sich in Entwicklung, mit der Absicht, das lizenzierte Modell ab 2027 zu ersetzen. [⁵]
Und das Detail, das für dieses Argument am meisten zählt, ist eines, das außerhalb von Entwicklerkommentaren fast keine Berichterstattung erhielt: Apples Foundation-Model-Framework ist nicht mehr auf Apples eigene Modelle beschränkt. Jedes Modell, das einem neuen öffentlichen Protokoll entspricht, kann verwendet werden, was bedeutet, dass eine Anwendung das lizenzierte Frontier-Modell gegen das eines Wettbewerbers oder gegen ein lokales austauschen kann, ohne ihre Funktionen neu zu schreiben. Die Einschätzung der Entwickler war unverblümt — Provider-Abstraktion ist zum Mindesteinsatz geworden, und die Kopplung der eigenen Codebasis an einen einzelnen Anbieter sieht nun wie technische Schuld aus. [⁶]
Die beiden Unternehmen, die am meisten zu verlieren haben, wenn sie das falsch machen, kamen also beide bei derselben Architektur an: Frontier-Fähigkeit dort mieten, wo sie wirklich benötigt wird, die Kontrolle über die Inferenzebene behalten, kleine Modelle lokal für Arbeiten laufen lassen, die privat sind oder schnell sein müssen, den Anbieter abstrahieren, damit Substitution günstig bleibt, und in der Zwischenzeit das Substrat darunter aufbauen.
Das ist kein Verzicht. Es ist die anspruchsvollste Absicherung, die verfügbar ist, umgesetzt von Organisationen, die sich jede Option leisten können, die sie wollen. Es ist außerdem, fast Zeile für Zeile, die Architektur, für die diese Reihe seit Februar argumentiert — was ich nicht als Bestätigung anführe, sondern weil es der stärkste verfügbare Hinweis darauf ist, dass die Architektur richtig ist und nicht nur für uns bequem.
Drei Konsequenzen, die beim Unternehmen landen
Der Zähler wird neu gestaltet, und nicht zu Ihrem Vorteil. Google stellte seine Consumer-KI-Tarife auf computebasierte Nutzungslimits um, bei denen das Kontingent entsprechend der tatsächlich erforderlichen Verarbeitung verbraucht wird statt nach der Zahl der gestellten Anfragen, und entfernte die gebündelten monatlichen Credits aus dem kostenpflichtigen Tarif. Seine Enterprise-Plattform führte eine separate Abrechnung für Agenten-Laufzeit ein. [⁷] Die Richtung ist unmissverständlich und sie kommt für Käufer genau zum falschen Zeitpunkt: Die Messung verschiebt sich von Tokens in Richtung Compute-Zeit, genau in dem Moment, in dem Agenten beginnen, stundenlang statt sekundenlang zu laufen. Ein Preismodell, das an verstrichene Compute-Zeit gekoppelt ist und auf Workloads angewendet wird, deren definierendes Merkmal darin besteht, dass sie lange laufen, ist keine Rundungsdifferenz im Budget.
Rationierung läuft bergab. Die lehrreichste Tatsache des Quartals ist nicht die Höhe irgendeiner Investitionsausgabe. Es ist, dass ein Hyperscaler unter Kapazitätsdruck den Modellzugriff eines der fünf wertvollsten Unternehmen der Welt begrenzte. Wenn das Meta passiert, sollte kein Unternehmen einen kritischen Workflow auf der Annahme garantierter Zuteilung aufbauen. Das ist dasselbe Argument, das der Flexibilitätsbeitrag nach dem Rückzug eines Modells durch Exportkontrollanweisung gemacht hat, nur aus einer völlig anderen Richtung: Ihr Zugang zu Frontier-Fähigkeit hängt von der Beschränkung eines anderen ab, und Kontingenz muss entworfen und nicht erhofft werden.
Das beste Silizium ist für Sie strukturell nicht verfügbar. Das ist der Punkt, den ich einem Vorstand vorlegen würde. Googles Beschleuniger sind nur über Google Cloud erreichbar. Es gibt keinen On-Premises-Weg, keinen Lizenzierungspfad, keine Air-Gapped-Option. Die kommende inferenzoptimierte Generation beansprucht so etwas wie eine achtzigprozentige Verbesserung der Performance pro Dollar für latenzarmes Serving großer Mixture-of-Experts-Modelle — und jede Organisation mit einer Anforderung an Datenresidenz, einem air-gapped Netzwerk oder einer Richtlinie gegen Public Cloud kann sie überhaupt nicht nutzen, unabhängig davon, wie gut sie ist. [⁸] Dieser Ausschluss ist dauerhaft und architektonisch. Er wird nicht weicher, wenn die Anbieterbeziehung reift.
Nimmt man diese drei Dinge zusammen, ist die Schlussfolgerung unbequem für jeden, dessen KI-Strategie aus einem Vertrag mit einem Hyperscaler besteht. Die Fähigkeit ist real, der Preis steigt, die Messung wird umstrukturiert, die Zuteilung liegt im Ermessen, und das Beste davon ist genau den Unternehmen verwehrt, für die diese Reihe geschrieben wird.
Der Compute, den Sie bereits besitzen
Hier ist der Teil, den fast niemand einpreist.
Ein Unternehmen mit zehntausend Mitarbeitern besitzt ungefähr zehntausend Geräte mit Neural Processing Units, plus eine vergleichbare Zahl an Telefonen. Apples aktuelles Silizium hat neu gestaltete neuronale Beschleuniger in jedem Kern mit ungefähr vierzig Prozent mehr KI-Durchsatz als die vorherige Generation, und entsprechende Hardware steckt mittlerweile in im Wesentlichen jedem Business-Laptop, der verkauft wird. Diese Flotte wurde in einem Erneuerungszyklus gekauft, der nichts mit KI zu tun hat, sie befindet sich konstruktionsbedingt innerhalb des Unternehmensperimeters, und für Inferenzzwecke läuft sie bei nahezu null Auslastung.
Sie ist außerdem die eine Compute-Ebene, die nicht von einem Lieferanten rationiert, nicht durch eine Exportkontrollanweisung entzogen, nicht mitten im Vertrag neu bepreist werden kann und keine Verhandlung über Datenresidenz erfordert — weil sie bereits im Gebäude ist und bereits bezahlt wurde.
Speziell für Europa zählt das mehr als anderswo. Europa wird kein Kapazitätsrennen gegen sechshundert Milliarden Dollar pro Jahr an Hyperscaler-Investitionsausgaben gewinnen; dieses Argument war vorbei, bevor es begonnen hatte, und so zu tun, als sei es anders, war eine anhaltende europäische Schwäche. Aber die Endpoint-Flotte in europäischen Unternehmen ist sehr groß, vollständig innerhalb europäischer Jurisdiktion, im Eigentum statt gemietet, und fast vollständig ungenutzt. Der vorherige Beitrag in dieser Reihe argumentierte, dass das, was die Kommoditisierung überlebt, das ist, was Kapital nicht kaufen kann. Compute-Kapazität ist das klarste Beispiel für etwas, das Kapital kaufen kann, genau deshalb ist der Wettbewerb darum vergeblich — und genau deshalb ist der Compute, den Europa bereits gekauft hat, ernst zu nehmen.
Ich möchte hier vorsichtig sein, denn die naive Version dieses Arguments ist in mehrfacher Hinsicht falsch, und die ehrliche Version ist nützlicher.
Der Enterprise-Korpus lebt nicht auf dem Endpoint. Retrieval muss weiterhin zu einem Server, auf dem Index und Berechtigungsmodell liegen, was bedeutet, dass lokaler Compute die Reasoning-Schritte bedient und nicht das Grounding. Modelle über Tausende heterogener Geräte zu verteilen und zu aktualisieren, ist ein echtes Betriebsproblem, keine Fußnote. Die Varianz zwischen einem fünf Jahre alten Laptop und aktuellem Silizium ist enorm, also muss jede Routing-Entscheidung die Geräteklasse berücksichtigen. Lokale Ausführung verleiht nicht von selbst Datenschutz — das Harness muss weiterhin Berechtigungen durchsetzen, und ein unbeschränkter lokaler Agent ist exakt so gefährlich wie ein unbeschränkter entfernter. Kleine Modelle sind fähig, aber nicht frontierfähig, also ist Workload-Triage wesentlich und nicht optional. Und Nutzer bemerken, wenn der Lüfter hochdreht.
Daraus ergibt sich eine Behauptung, die in ihrer Form bescheiden und in ihrer Konsequenz erheblich ist: Der Endpoint ist eine Ebene in der Routing-Tabelle, kein Ersatz für die Cloud. Die Routing-Entscheidung, die diese Reihe seit einem Jahr beschreibt — welches Modell, zu welchen Kosten, unter welcher Policy, in welcher Jurisdiktion — bekommt eine weitere Dimension. Wo läuft das.
Warum Bring-your-own-model aufgehört hat, interessant zu sein
Modellagnostik war etwa achtzehn Monate lang ein Differenzierungsmerkmal. Jetzt ist sie ein Protokoll in einem Consumer-Betriebssystem. Wenn der Plattformanbieter Provider-Abstraktion als öffentliche Schnittstelle ausliefert, sodass jedes konforme Modell ohne Neuschreiben der Anwendung ersetzt werden kann, ist das Argument vorbei: Das eigene Modell mitzubringen ist ein Kontrollkästchen, und jeder Anbieter, der es noch als strategischen Vorteil präsentiert, beschreibt Mindesteinsatz.
Die interessante Frage ist eine Ebene nach oben gerückt. Nicht welches Modell läuft, sondern wessen Loop es laufen lässt.
Bis Ende 2026 wird ein großer Anteil von Enterprise-Anwendungen bereits eingebettete aufgabenspezifische Agenten ausliefern, ausgehend von einem sehr kleinen Anteil ein Jahr zuvor. [⁹] Diese Unternehmen haben Harnesses gebaut. Sie haben Agenten-Loops, Tool-Definitionen, Evaluationssuiten und Meinungen zu all dem. Was sie nicht haben — wie der vorherige Beitrag in dieser Reihe ausführlich argumentiert hat — ist berechtigungsbewusstes Retrieval, das auf die anfragende Identität zuschneidet, bevor das Modell reasoning betreibt, ein gepflegtes Modell ihres eigenen Geschäfts, gegen das geerdet werden kann, ein append-only Protokoll, das beantwortet, was eine gegebene Identität zu einem gegebenen Zeitpunkt hätte sehen können, oder eine Routing-Tabelle, die überlebt, wenn ein Anbieter rationiert oder entzogen wird.
Diesen Kunden zu sagen, sie sollen auf dem Agenten-Framework eines anderen neu aufbauen, ist ein schlechtes Angebot. Bring your own harness ist das bessere: Behalte den Loop, den du gebaut hast, und stecke ihn in das governte Substrat darunter. Die Plattform hört auf, der Agent sein zu wollen, und wird zu dem, worauf der Agent läuft.
Wo neuland.ai steht
Der neuland.ai HUB ist von Anfang an konstruktionsbedingt modellagnostisch gewesen, aus dem strukturellen Grund, den die früheren Beiträge dargelegt haben: Wir haben auf der Modellebene nichts zu verkaufen, also kann die Routing-Entscheidung nach den Verdiensten des Workloads getroffen werden statt nach unseren. Deployment-Optionen umfassen Sovereign Cloud, Private Cloud, On-Premises und wirklich air-gapped Betrieb, was nur möglich ist, weil wir vollständig auf Gewichten laufen können, die der Kunde hält — und was genau die Fähigkeit ist, die Cloud-only-Beschleuniger strukturell nicht bieten können.
Zwei Erweiterungen folgen aus dem obenstehenden Argument und dort liegt derzeit unsere Engineering-Aufmerksamkeit.
Die erste ist Bring your own harness: der bestehende Agenten-Loop des Kunden, Tool-Definitionen und Ausführungslogik, verbunden mit dem berechtigungsbewussten Retrieval, der Ontologie, dem Audit-Trail und dem Modell-Routing der Plattform, statt durch unsere ersetzt. Daneben durable streaming für langlaufende Arbeit, weil ein Agent, der stundenlang läuft, Unterbrechung überleben, dort fortsetzen, wo er aufgehört hat, und durchgehend inspizierbar bleiben muss — Eigenschaften, die im Substrat liegen müssen und nicht im Agenten.
Die zweite ist der Endpoint als Routing-Ebene. Wenn Compute die bindende Beschränkung ist und Cloud-Compute rationiert und neu bepreist wird, dann ist das Routing geeigneter Arbeit auf Hardware, die der Kunde bereits besitzt, zugleich eine Kosten- und Souveränitätsoptimierung. Die ehrliche Rahmung ist, dass dies eine Richtung und keine fertige Fähigkeit ist: Die Reasoning-Ebene bewegt sich leichter als die Retrieval-Ebene, das Geräteklassenproblem ist real, und die Frage der Modellverteilung ist eine Betriebsdisziplin, die wir lieber sauber lösen als früh ankündigen. Aber die Architektur behandelt bereits, wo Inferenz geschieht, als Policy-Entscheidung statt als Produktbeschränkung, und das ist der Teil, der schwer nachzurüsten ist. [¹⁰]
Der Forschungsaufwand dahinter bleibt System- und Infrastrukturarbeit statt Modellforschung. Niemand bei neuland.ai wird einen Beschleuniger entwerfen. Was wir tun können, ist sicherzustellen, dass, wenn sich die Compute-Beschränkung weiter verschärft — und jede öffentliche Aussage der Menschen, die diese Beschränkung kontrollieren, nahelegt, dass sie das wird — die Architektur des Kunden dies als Routing-Änderung behandelt statt als Ausfall oder Neuverhandlung.
Persönliche Einschätzung
Die Compute-Knappheit ist die am meisten unterdiskutierte strategische Tatsache in Enterprise-KI, und ich glaube, sie ist unterdiskutiert, weil sie für alle unvorteilhaft ist. Sie ist unvorteilhaft für die Labore, deren Ökonomie von Kapazität abhängt, die sie nicht kontrollieren. Sie ist unvorteilhaft für die Hyperscaler, die Kunden rationieren, während sie Rekordinvestitionen ankündigen. Sie ist unvorteilhaft für europäische Politik, die drei Jahre lang Souveränität in Begriffen von Datenstandort diskutiert hat, während sich herausstellte, dass die bindende Beschränkung die High-Bandwidth-Memory-Versorgung über drei Anbieter ist. Und sie ist unvorteilhaft für Unternehmen, deren KI-Budgets auf einem Tokenpreis modelliert wurden, der durch einen Compute-Zeit-Preis ersetzt wird.
Was wirklich ermutigend ist, ist, dass die zwei bestinformierten und bestkapitalisierten Unternehmen der Branche unabhängig voneinander zu derselben Schlussfolgerung kamen, was zu tun ist: die Architektur nicht auf ein Modell setzen, die Kontrolle über die Inferenzebene behalten, lokal ausführen, was lokal ausgeführt werden kann, und den Anbieter abstrahieren, damit Substitution günstig bleibt. Keines von beiden tut dies aus Prinzip. Sie tun es, weil es die richtige Engineering-Antwort auf eine Beschränkung ist, die sie klarer sehen als alle anderen.
Europäische Unternehmen sollten dieselbe Schlussfolgerung ziehen und früher danach handeln, weil sie weniger Spielraum haben. Und sie sollten bemerken, dass die eine Compute-Ebene, die ihnen vollständig gehört — die Flotte von Maschinen, die bereits auf den Schreibtischen ihrer Mitarbeiter steht, innerhalb ihres eigenen Perimeters, unter ihrer eigenen Jurisdiktion, immun gegen Rationierung und Exportkontrolle — derzeit überhaupt nichts für sie tut.
Eine kurze Anmerkung zum regulatorischen Hintergrund, da er sich weiterentwickelt. Der EU AI Act wurde am 2. August 2026 weitgehend anwendbar, wobei die Durchsetzungsbefugnisse für GPAI nach Kapitel V ab diesem Datum bindend wurden; die Digital-Omnibus-Vereinbarung vom 7. Mai 2026 verschob die Hochrisiko-Verpflichtungen nach Anhang III auf den 2. Dezember 2027 und die Verpflichtungen nach Anhang I auf den 2. August 2028. [¹¹] Im Kontext dieses Beitrags bemerkenswert: Eine Architektur, die Inferenz zwischen Cloud, On-Premises und Endpoint unter Policy-Kontrolle bewegen kann, ist über eine divergierende Regulierungslandschaft hinweg erheblich leichter compliant zu halten als eine, deren Inferenzstandort eine Eigenschaft eines Anbieter Vertrags ist.
Compute ist die Beschränkung. Der Endpoint ist die Ebene, die niemand einpreist. Das ist die Arbeit, die vor uns liegt, und es ist die Arbeit, die wir getan haben.
¹ Serienbeiträge bei neuland.ai: Zentrale Plattform für Enterprise-KI .
² Siehe frühere Beiträge in dieser Reihe zur Fast-Follower-Workhorse-These, zu Flexibilität als architektonischer Eigenschaft nach dem Rückzug eines Frontier-Modells durch Exportkontrollanweisung, zur Open-Weight-Frontier und zur Kommoditisierung der Souveränität des Standorts.
³ Berichtet im Juni 2026: Google begrenzte Metas Zugriff auf Gemini-Modelle aufgrund von Compute-Kapazitätsbeschränkungen. Googles Investitionsausgaben-Prognose für 2026 von 180 bis 190 Milliarden US-Dollar, mit der Erwartung eines deutlichen Anstiegs 2027; Eigenkapitalaufnahme von rund 84,75 Milliarden US-Dollar zur Finanzierung von KI-Compute-Infrastruktur; Mietvertrag für Rechenzentrumskapazität von xAI zu etwa 920 Millionen US-Dollar pro Monat. Anthropic-TPU-Zusage: bis zu eine Million Ironwood-Chips, fünf Gigawatt Kapazität über fünf Jahre, bewertet mit bis zu 40 Milliarden US-Dollar, mit zusätzlicher Versorgung bis 2027; separate TPU-Vereinbarung mit Meta früher im Jahr 2026. Mitte 2026 berichtete interne Compute-Warteschlangen, die DeepMind-Forschungszeitpläne beeinflussten, einschließlich Abgängen langjähriger leitender Forscher zu besser ausgestatteten Startups. Öffentliche Anerkennung der Beschränkung durch Demis Hassabis, der sie einer kleinen Zahl von Lieferanten zentraler Komponenten zuschrieb — dem High-Bandwidth-Memory-Engpass über Samsung, Micron und SK Hynix.
⁴ Apple-Google-Vereinbarung, angekündigt am 12. Januar 2026, für eine maßgeschneiderte Gemini-Variante, geschätzt auf etwa eine Milliarde US-Dollar jährlich. Interne Bewertung setzte Apples eigene große Sprachmodelle Berichten zufolge zwölf bis achtzehn Monate hinter führenden Alternativen bei Gesprächsqualität, Reasoning und mehrstufiger Aufgabenerledigung. Zum Kontext: Apple zahlt eine deutlich größere jährliche Summe für die Platzierung als Standardsuche.
⁵ Apple WWDC, 8. Juni 2026: neu aufgebauter Assistent auf neuen Apple Foundation Models angekündigt, mit einer lizenzierten Frontier-Cloud-Ebene für das anspruchsvollste Reasoning. Die Architektur behält ein On-Device-Modell mit ungefähr drei Milliarden Parametern für latenz- und datenschutzsensible Aufgaben bei, mit einer kontrollierten Cloud-Compute-Umgebung als Zwischenebene. Eigene multimodale Architektur der nächsten Generation und proprietäre Modelle mit Billionen Parametern in Entwicklung, mit der Absicht, das lizenzierte Modell ab 2027 zu verdrängen; eigenes KI-Server-Silizium in Entwicklung. Analystische Einordnung der Partnerschaft als Entlastung kurzfristigen Drucks und nicht als langfristige strategische Verschiebung, wobei erwartet wird, dass die Nachfrage nach On-Device-KI ab 2027 stärker wächst.
⁶ Apples Foundation-Model-Framework wurde auf der WWDC 2026 über ein neues öffentliches Protokoll über Apples eigene Modelle hinaus geöffnet, wodurch die Substitution von lizenzierten Frontier-, Wettbewerber- oder On-Device-Modellen ohne Neuschreiben von Anwendungen möglich wird. Entwicklerkommentare bezeichneten Provider-Abstraktion als zum Mindesteinsatz geworden und Single-Provider-Kopplung als entstehende technische Schuld. Apple-Silizium der aktuellen Generation verfügt über neu gestaltete neuronale Beschleuniger in jedem Kern mit ungefähr 40 Prozent höherem KI-Durchsatz als die vorherige Generation.
⁷ Compute-basierte Nutzungslimits wurden im Mai 2026 in Googles Consumer-KI-Tarifen eingeführt, wobei das Kontingent entsprechend der tatsächlich erforderlichen rechnerischen Verarbeitung statt nach Anfragezahl verbraucht wird, und zuvor gebündelte monatliche KI-Credits aus dem kostenpflichtigen Tarif entfernt wurden. Separate Agenten-Laufzeitabrechnung auf der Enterprise-Plattform eingeführt.
⁸ Google-TPU-Zugriff ist ausschließlich über Google Cloud Platform verfügbar, ohne On-Premises-Deployment-Pfad. Organisationen mit Anforderungen an Datensouveränität, air-gapped Netzwerken oder Richtlinien, die Public Cloud ausschließen, können die Hardware unabhängig von ihren technischen Eigenschaften nicht nutzen. Die kommende inferenzoptimierte Generation soll ungefähr 80 Prozent Verbesserung der Performance pro Dollar für latenzarme Inferenz auf großen Mixture-of-Experts-Modellen bieten.
⁹ Gartner-Prognose: Etwa 40 Prozent der Enterprise-Anwendungen werden bis Ende 2026 mit aufgabenspezifischen KI-Agenten ausgeliefert, gegenüber unter 5 Prozent ein Jahr zuvor, wobei der Agentic-AI-Hype-Cycle 2026 einen Markt beschreibt, der sich von Experimenten in Richtung Produktionsreife bewegt, sobald Governance- und Orchestrierungsebenen eintreffen.
¹⁰ neuland.ai HUB: modellagnostisches Routing pro Workload über proprietäre Frontier- und selbst gehostete Open-Weight-Modelle hinweg, entschieden nach Fähigkeit, Kosten, Residenz und Policy; berechtigungsbewusstes Retrieval vor dem Reasoning durchgesetzt; kundeneigene Ontologie- und Wissensebene; append-only Audit über Retrieval- und Zugriffsentscheidungen; Deployment-Optionen von Sovereign Cloud, Private Cloud, On-Premises bis zu air-gapped Betrieb. Bring-your-own-harness-Unterstützung und durable streaming für langlaufende agentische Arbeit sind aktuelle Engineering-Prioritäten; Endpoint-Tier-Inferenzrouting ist eine erklärte architektonische Richtung und keine ausgelieferte Fähigkeit. neuland.ai AG behält die Verantwortung für Inhaltsqualität und saubere Lieferung von Ergebnissen über alle Kundenengagements hinweg.
¹¹ Rat der EU und Europäisches Parlament, vorläufige politische Einigung zum Digital Omnibus on AI, 7. Mai 2026: Hochrisiko-Verpflichtungen nach Anhang III auf den 2. Dezember 2027 verschoben; Verpflichtungen nach Anhang I auf den 2. August 2028 verschoben; Artikel 50(2)-Wasserzeichenpflichten auf den 2. Dezember 2026 verschoben. GPAI-Durchsetzungsbefugnisse nach Kapitel V ab 2. August 2026 bindend.
Bild generiert mit dem neuland.ai HUB.