Die führenden Modelle nebeneinander. Unabhängig gemessen.
Vom Frontier-Modell bis zum offenen Modell für Ihr eigenes Rechenzentrum: wie leistungsfähig, wie schnell und wie teuer die führenden Modelle sind. Gemessen hat Artificial Analysis, eingeordnet haben wir.
Modelle im Vergleich
Stärke, Tempo und Preis. Selten alles in einem Modell.
Filtern und sortieren Sie nach dem, was für Ihren Einsatz zählt: Stärke, Tempo, Preis oder Betrieb im eigenen Rechenzentrum. Alle Werte hat Artificial Analysis unabhängig gemessen, so wählen Sie das Modell nach Ihrer Aufgabe und nicht nach dem Anbieter.
52 von 52 Modellen · sortiert nach Intelligenz
| Rang | Modell | Coding | |||
|---|---|---|---|---|---|
| 01 | Claude Opus 5.5Anthropic | Intelligenz 57,6 | Codingnicht gemessen | Tempo97Tokens/s | Preis |
| 02 | Claude Sonnet 5.5Anthropic | Intelligenz 56,0 | Codingnicht gemessen | Tempo128Tokens/s | Preis |
| 03 | Claude Fable 5.1Anthropic | Intelligenz 53,4 | Coding81,6 | Tempo61Tokens/s | Preis |
| 04 | GPT-6 AstraOpenAI | Intelligenz 52,7 | Coding76,9 | Tempo63Tokens/s | Preis |
| 05 | Gemini 4 ArgonGoogle | Intelligenz 52,6 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 06 | GPT-6.1 SolOpenAI | Intelligenz 51,8 | Codingnicht gemessen | Tempo58Tokens/s | Preis |
| 07 | Claude Opus 5Anthropic | Intelligenz 50,8 | Coding78,0 | Tempo57Tokens/s | Preis |
| 08 | Muse Spark 1.3Meta | Intelligenz 48,1 | Codingnicht gemessen | Tempo187Tokens/s | Preis |
| 09 | GPT-6 SolOpenAI | Intelligenz 47,6 | Codingnicht gemessen | Tempo110Tokens/s | Preis |
| 10 | GPT-5.6 SolOpenAI | Intelligenz 47,0 | Coding77,4 | Tempo97Tokens/s | Preis |
| 11 | Grok 4.7SpaceXAI | Intelligenz 46,4 | Codingnicht gemessen | Tempo92Tokens/s | Preis |
| 12 | MiMo-V2.6-ProXiaomi | Intelligenz 46,3 | Codingnicht gemessen | Tempo45Tokens/s | Preis |
| 13 | Qwen3.8 MaxAlibaba | Intelligenz 45,4 | Codingnicht gemessen | Tempo37Tokens/s | Preis |
| 14 | GLM-5.3Z.aiOpen WeightsOn-Prem möglich | Intelligenz 44,8 | Coding74,8 | Tempo75Tokens/s | Preis |
| 15 | Kimi K3Moonshot AIOpen WeightsOn-Prem möglich | Intelligenz 43,6 | Coding76,2 | Tempo52Tokens/s | Preis |
| 16 | GPT-5.6 TerraOpenAI | Intelligenz 42,1 | Coding76,7 | Tempo125Tokens/s | Preis |
| 17 | Claude Opus 4.8Anthropic | Intelligenz 41,8 | Coding74,3 | Tempo64Tokens/s | Preis |
| 18 | GLM-5.3 FlashZ.ai | Intelligenz 41,8 | Coding71,5 | Tempo53Tokens/s | Preis |
| 19 | Gemini 3.8 FlashGoogle | Intelligenz 40,9 | Coding76,3 | Tempo242Tokens/s | Preis |
| 20 | Claude Opus 4.7Anthropic | Intelligenz 40,7 | Coding73,6 | Temponicht gemessen | Preis |
| 21 | Qwen3.8 2.4T A95BAlibaba | Intelligenz 39,9 | Codingnicht gemessen | Tempo39Tokens/s | Preis |
| 22 | Qwen3.8-Flash-NextAlibaba | Intelligenz 39,8 | Codingnicht gemessen | Tempo55Tokens/s | Preis |
| 23 | DeepSeek V4.1 FlashDeepSeek | Intelligenz 39,5 | Codingnicht gemessen | Tempo222Tokens/s | Preis |
| 24 | GPT-5.4OpenAI | Intelligenz 39,0 | Coding71,1 | Temponicht gemessen | Preis |
| 25 | GPT-5.5OpenAI | Intelligenz 38,4 | Coding74,9 | Tempo104Tokens/s | Preis |
| 26 | Claude Sonnet 5AnthropicOpen WeightsOn-Prem möglich | Intelligenz 38,2 | Coding71,5 | Tempo86Tokens/s | Preis |
| 27 | GPT-6 LunaOpenAIOpen WeightsOn-Prem möglich | Intelligenz 38,1 | Codingnicht gemessen | Tempo147Tokens/s | Preis |
| 28 | MiMo-V2.6-FlashXiaomiOpen WeightsOn-Prem möglich | Intelligenz 37,9 | Codingnicht gemessen | Tempo62Tokens/s | Preis |
| 29 | GPT-5.6 LunaOpenAIOpen WeightsOn-Prem möglich | Intelligenz 37,3 | Coding71,4 | Tempo128Tokens/s | Preis |
| 30 | DeepSeek V4 Pro 0813DeepSeekOpen WeightsOn-Prem möglich | Intelligenz 36,0 | Codingnicht gemessen | Tempo99Tokens/s | Preis |
| 31 | DeepSeek V4 Flash VisionDeepSeekOpen WeightsOn-Prem möglich | Intelligenz 34,8 | Codingnicht gemessen | Tempo232Tokens/s | Preis |
| 32 | Qwen3.8 27BAlibabaOpen WeightsOn-Prem möglich | Intelligenz 33,7 | Coding68,1 | Tempo47Tokens/s | Preis |
| 33 | Gemini 3.5 FlashGoogle | Intelligenz 32,6 | Coding70,1 | Tempo335Tokens/s | Preis |
| 34 | Claude Opus 4.6Anthropic | Intelligenz 31,9 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 35 | Claude Sonnet 4.6Anthropic | Intelligenz 30,1 | Coding63,0 | Tempo46Tokens/s | Preis |
| 36 | Gemini 3 ProGoogle | Intelligenz 28,0 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 37 | GPT-5.1OpenAI | Intelligenz 24,7 | Coding49,4 | Temponicht gemessen | Preis |
| 38 | GPT-5OpenAIOpen WeightsOn-Prem möglich | Intelligenz 23,0 | Coding37,8 | Tempo129Tokens/s | Preis |
| 39 | Qwen3.6 27BAlibabaOpen WeightsOn-Prem möglich | Intelligenz 21,4 | Coding53,7 | Tempo56Tokens/s | Preis |
| 40 | Gemini 2.5 ProGoogleOpen WeightsOn-Prem möglich | Intelligenz 16,1 | Coding33,3 | Tempo136Tokens/s | Preis |
| 41 | Gemma 4 31BGoogle | Intelligenz 14,7 | Coding43,4 | Tempo36Tokens/s | Preisnicht gemessen |
| 42 | Qwen3 VL 235BAlibaba | Intelligenz 13,4 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 43 | Gemini 2.5 FlashGoogle | Intelligenz 13,1 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 44 | GPT-4.1OpenAI | Intelligenz 12,7 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 45 | gpt-oss-120bOpenAI | Intelligenz 11,6 | Coding30,4 | Tempo197Tokens/s | Preis |
| 46 | Mistral Large 3Mistral | Intelligenz 9,3 | Coding20,1 | Tempo83Tokens/s | Preis |
| 47 | gpt-oss-20bOpenAI | Intelligenz 9,0 | Coding20,7 | Tempo188Tokens/s | Preis |
| 48 | Gemini 2.5 Flash-LiteGoogle | Intelligenz 8,5 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 49 | GPT-4oOpenAI | Intelligenz 8,4 | Codingnicht gemessen | Temponicht gemessen | Preis |
| 50 | Llama 3.3 70BMeta | Intelligenz 7,7 | Coding11,9 | Tempo94Tokens/s | Preis |
| 51 | GPT-4o miniOpenAI | Intelligenz 6,7 | Coding11,4 | Temponicht gemessen | Preis |
| 52 | Gemma 3 27BGoogle | Intelligenz 4,9 | Coding10,1 | Temponicht gemessen | Preisnicht gemessen |
Quelle: Artificial Analysis (artificialanalysis.ai), Stand 06.10.2026. Bei Modellen mit einstellbarer Denktiefe gilt die Messung mit hoher oder maximaler Denktiefe. Fehlt ein Wert, hat Artificial Analysis ihn nicht gemessen; wir schätzen nichts dazu.
Leistung gegen Preis
Jeder Punkt ist ein Modell: je höher, desto stärker, je weiter rechts, desto teurer. Die Effizienzgrenze verbindet die Modelle, die mehr leisten als jedes günstigere.
- Anthropic
- OpenAI
- OpenAI
- Meta
- SpaceXAI
- Xiaomi
- Alibaba
- Z.ai
- Moonshot AI
- OpenAI
- DeepSeek
- OpenAI
- OpenAI
- OpenAI
- Mistral
- Proprietär
- Open Weights
- Effizienzgrenze
Über einen Punkt fahren oder ihn anklicken: Name und Werte stehen unten im Feld.
Claude Opus 5.5
- Intelligenz
- 57,6
- Coding
- nicht gemessen
- Tempo
- 97Tokens/s
- Preis
Nicht eingezeichnet (Preis oder Index nicht gemessen): Gemma 4 31B, Gemma 3 27B. Quelle: Artificial Analysis (artificialanalysis.ai), Stand 06.10.2026.
So lesen Sie die Werte
Intelligence Index
Die unabhängige Bewertung von Artificial Analysis fasst mehrere Tests zu Wissen, Logik, Mathematik und Programmieren in einer Zahl zusammen. Höher ist besser. Der Coding Index misst das Programmieren allein.
Tempo
Wie viele Tokens ein Modell pro Sekunde schreibt, gemessen beim Anbieter. Ein Token ist ein Wortteil. Im eigenen Rechenzentrum hängt das Tempo von Ihrer Hardware ab.
Preisstufe
Der Listenpreis je Million Tokens bei den Anbietern, eingeteilt in fünf Stufen. Mehr Balken heißt teurer. Ihre Konditionen hängen vom Betrieb ab und stehen in Ihrem Angebot.
On-Prem möglich
Die Gewichte des Modells sind offen veröffentlicht. Es lässt sich in Ihrer eigenen Infrastruktur oder souverän betreiben.
Open Weights und On-Prem
Modelle mit offenen Gewichten. Betrieb im eigenen Rechenzentrum möglich.
Viele der Modelle sind mit offenen Gewichten veröffentlicht. Für Organisationen wie Banken, Versicherer, Kanzleien, Kliniken oder Verwaltungen heißt das: Das Modell rechnet dort, wo auch die Daten liegen.
Modellwahl
Sie bestimmen, welches Modell arbeitet. Je Gruppe, je Aufgabe, auf Wunsch mit eigenem Schlüssel.
Welches Modell eine Aufgabe übernimmt, legen Sie im neuland.ai HUB fest. Admins lassen Modelle je Gruppe zu, alles Weitere regelt der Modus Auto oder die Wahl im Chat.
- Modus AutoJede Nachricht geht je nach Komplexität an ein passendes Modell, nur unter den für die Gruppe zugelassenen. Im Vertrieb fasst ein schnelles Modell die Gesprächsnotiz zusammen, die Auswertung eines langen Geschäftsberichts übernimmt das stärkste Modell, das die Gruppe nutzen darf.
- Freie Wahl im ChatWer will, wählt selbst, auch mitten im Chat, und vergleicht die Antworten zweier Modelle nebeneinander.
- Eigene Schlüssel mitbringenMit Bring Your Own Key (BYOK) nutzen Sie bestehende Verträge mit Modellanbietern: Sie hinterlegen Ihren eigenen API-Schlüssel im neuland.ai HUB, die Modellnutzung läuft dann über Ihren eigenen Vertrag.
- Wechsel ohne UmbauRückt ein stärkeres Modell in den neuland.ai HUB, lassen Admins es für eine Gruppe zu. Die Agenten der Gruppe arbeiten ab dann damit, ohne dass jemand sie neu baut.
Fragen
Was Kunden zu den Modellen zuerst fragen.
Das hängt von der Aufgabe ab. Im Intelligence Index liegt derzeit Claude Opus 5.5 vorn (57,6), knapp dahinter Claude Sonnet 5.5 (56,0). Für eine schnelle Zusammenfassung genügt oft ein Modell wie Gemini 3.5 Flash mit 335 Tokens pro Sekunde, dem schnellsten der Übersicht, und gpt-oss-120b läuft in der niedrigsten Preisstufe sogar im eigenen Rechenzentrum. Diese Abwägung übernimmt je Nachricht der Modus Auto.
Alle Modelle mit offenen Gewichten, in der Übersicht als On-Prem möglich gekennzeichnet. Das sind etwa Qwen3.8 27B, gpt-oss-120b, Mistral Large 3, Llama 3.3 70B und Gemma 4 31B; dazu zählen stärkere offene Modelle wie MiMo-V2.6-Pro, GLM-5.3, Kimi K3 oder DeepSeek V4.1 Flash. Proprietäre Modelle wie Claude, GPT oder Gemini binden Sie über die Cloud ihres Anbieters an. Welche Hardware ein offenes Modell braucht, klären wir mit Ihnen im Betriebskonzept.
Nein. Ihre Daten werden nie zum Training von Sprachmodellen verwendet und bleiben im Unternehmenskontext, gleich welches Modell Sie nutzen.
Ja, über Bring Your Own Key (BYOK). Haben Sie bereits einen Vertrag mit einem Modellanbieter, hinterlegen Sie Ihren eigenen API-Schlüssel im neuland.ai HUB. Die Modellnutzung läuft dann über Ihren eigenen Vertrag.
Stand 29.09.2026. Die Werte stammen von Artificial Analysis, einem unabhängigen Anbieter von Modellvergleichen, der seine Messungen laufend fortschreibt. Fehlt ein Wert, hat Artificial Analysis ihn für dieses Modell nicht gemessen; wir schätzen nichts dazu.
Weil der Preis einer Anfrage im neuland.ai HUB vom Betrieb abhängt: über die Cloud eines Anbieters, über Ihren eigenen Vertrag oder auf eigener Hardware rechnet sie sich jeweils anders. Die Preisstufe zeigt deshalb nur, wie teuer die Modelle im Verhältnis zueinander sind, gemessen an den Listenpreisen der Anbieter je Million Tokens. Das Angebot erstellen wir nach Ihrem Use Case, Details in der Preisübersicht.
Die unabhängige Bewertung von Artificial Analysis fasst mehrere Tests zu Wissen, Logik, Mathematik und Programmieren in einer Zahl zusammen. Höher ist besser. Der Coding Index misst das Programmieren allein.
Wie viele Tokens ein Modell pro Sekunde schreibt, gemessen beim Anbieter. Ein Token ist ein Wortteil. Im eigenen Rechenzentrum hängt das Tempo von Ihrer Hardware ab.
Admins lassen Modelle je Gruppe zu. Wer will, wählt dann selbst im Chat, auch mitten im Gespräch, und vergleicht die Antworten zweier Modelle nebeneinander; sonst übernimmt der Modus Auto die Wahl.
Die Gewichte des Modells sind öffentlich veröffentlicht, etwa bei Hugging Face. Solche Modelle lassen sich in Ihrer eigenen Infrastruktur oder souverän betreiben.
Das richtige Modell je Aufgabe. Wir wählen mit Ihnen aus.
Sie bringen Ihre Aufgaben mit, wir legen die Werte daneben: welches Modell stark genug ist, welches schnell genug und welches im eigenen Rechenzentrum laufen muss.
Nach Ihrer Anfrage
- 01Sie nennen Aufgaben und Schutzbedarf
- 02Wir ordnen jeder Aufgabe passende Modelle zu
- 03Sie erhalten die Auswahl je Bereich als Grundlage für Ihren Onboarding-Plan









