Zum Inhalt
Modell-Benchmark

Die führenden Modelle nebeneinander. Unabhängig gemessen.

Vom Frontier-Modell bis zum offenen Modell für Ihr eigenes Rechenzentrum: wie leistungsfähig, wie schnell und wie teuer die führenden Modelle sind. Gemessen hat Artificial Analysis, eingeordnet haben wir.

Stand 06.10.2026Quelle: Artificial Analysis
Claude Opus 5.557,6Stärkstes Modell im Intelligence Index
MiMo-V2.6-Pro46,3Stärkstes offenes Modell am Markt, on-prem betreibbar
Gemini 3.5 Flash335Tokens pro Sekunde, das schnellste Modell der Übersicht

Modelle im Vergleich

Stärke, Tempo und Preis. Selten alles in einem Modell.

Filtern und sortieren Sie nach dem, was für Ihren Einsatz zählt: Stärke, Tempo, Preis oder Betrieb im eigenen Rechenzentrum. Alle Werte hat Artificial Analysis unabhängig gemessen, so wählen Sie das Modell nach Ihrer Aufgabe und nicht nach dem Anbieter.

Sortieren

52 von 52 Modellen · sortiert nach Intelligenz

Modelle im Vergleich, Quelle Artificial Analysis (artificialanalysis.ai), Stand 06.10.2026
RangModellCoding
01
Claude Opus 5.5Anthropic
Intelligenz
57,6
Codingnicht gemessenTempo97Tokens/sPreis
02
Claude Sonnet 5.5Anthropic
Intelligenz
56,0
Codingnicht gemessenTempo128Tokens/sPreis
03
Claude Fable 5.1Anthropic
Intelligenz
53,4
Coding81,6Tempo61Tokens/sPreis
04
GPT-6 AstraOpenAI
Intelligenz
52,7
Coding76,9Tempo63Tokens/sPreis
05
Gemini 4 ArgonGoogle
Intelligenz
52,6
Codingnicht gemessenTemponicht gemessenPreis
06
GPT-6.1 SolOpenAI
Intelligenz
51,8
Codingnicht gemessenTempo58Tokens/sPreis
07
Claude Opus 5Anthropic
Intelligenz
50,8
Coding78,0Tempo57Tokens/sPreis
08
Muse Spark 1.3Meta
Intelligenz
48,1
Codingnicht gemessenTempo187Tokens/sPreis
09
GPT-6 SolOpenAI
Intelligenz
47,6
Codingnicht gemessenTempo110Tokens/sPreis
10
GPT-5.6 SolOpenAI
Intelligenz
47,0
Coding77,4Tempo97Tokens/sPreis
11
Grok 4.7SpaceXAI
Intelligenz
46,4
Codingnicht gemessenTempo92Tokens/sPreis
12
MiMo-V2.6-ProXiaomi
Intelligenz
46,3
Codingnicht gemessenTempo45Tokens/sPreis
13
Qwen3.8 MaxAlibaba
Intelligenz
45,4
Codingnicht gemessenTempo37Tokens/sPreis
14
GLM-5.3Z.aiOpen WeightsOn-Prem möglich
Intelligenz
44,8
Coding74,8Tempo75Tokens/sPreis
15
Kimi K3Moonshot AIOpen WeightsOn-Prem möglich
Intelligenz
43,6
Coding76,2Tempo52Tokens/sPreis
16
GPT-5.6 TerraOpenAI
Intelligenz
42,1
Coding76,7Tempo125Tokens/sPreis
17
Claude Opus 4.8Anthropic
Intelligenz
41,8
Coding74,3Tempo64Tokens/sPreis
18
GLM-5.3 FlashZ.ai
Intelligenz
41,8
Coding71,5Tempo53Tokens/sPreis
19
Gemini 3.8 FlashGoogle
Intelligenz
40,9
Coding76,3Tempo242Tokens/sPreis
20
Claude Opus 4.7Anthropic
Intelligenz
40,7
Coding73,6Temponicht gemessenPreis
21
Qwen3.8 2.4T A95BAlibaba
Intelligenz
39,9
Codingnicht gemessenTempo39Tokens/sPreis
22
Qwen3.8-Flash-NextAlibaba
Intelligenz
39,8
Codingnicht gemessenTempo55Tokens/sPreis
23
DeepSeek V4.1 FlashDeepSeek
Intelligenz
39,5
Codingnicht gemessenTempo222Tokens/sPreis
24
GPT-5.4OpenAI
Intelligenz
39,0
Coding71,1Temponicht gemessenPreis
25
GPT-5.5OpenAI
Intelligenz
38,4
Coding74,9Tempo104Tokens/sPreis
26
Claude Sonnet 5AnthropicOpen WeightsOn-Prem möglich
Intelligenz
38,2
Coding71,5Tempo86Tokens/sPreis
27
GPT-6 LunaOpenAIOpen WeightsOn-Prem möglich
Intelligenz
38,1
Codingnicht gemessenTempo147Tokens/sPreis
28
MiMo-V2.6-FlashXiaomiOpen WeightsOn-Prem möglich
Intelligenz
37,9
Codingnicht gemessenTempo62Tokens/sPreis
29
GPT-5.6 LunaOpenAIOpen WeightsOn-Prem möglich
Intelligenz
37,3
Coding71,4Tempo128Tokens/sPreis
30
DeepSeek V4 Pro 0813DeepSeekOpen WeightsOn-Prem möglich
Intelligenz
36,0
Codingnicht gemessenTempo99Tokens/sPreis
31
DeepSeek V4 Flash VisionDeepSeekOpen WeightsOn-Prem möglich
Intelligenz
34,8
Codingnicht gemessenTempo232Tokens/sPreis
32
Qwen3.8 27BAlibabaOpen WeightsOn-Prem möglich
Intelligenz
33,7
Coding68,1Tempo47Tokens/sPreis
33
Gemini 3.5 FlashGoogle
Intelligenz
32,6
Coding70,1Tempo335Tokens/sPreis
34
Claude Opus 4.6Anthropic
Intelligenz
31,9
Codingnicht gemessenTemponicht gemessenPreis
35
Claude Sonnet 4.6Anthropic
Intelligenz
30,1
Coding63,0Tempo46Tokens/sPreis
36
Gemini 3 ProGoogle
Intelligenz
28,0
Codingnicht gemessenTemponicht gemessenPreis
37
GPT-5.1OpenAI
Intelligenz
24,7
Coding49,4Temponicht gemessenPreis
38
GPT-5OpenAIOpen WeightsOn-Prem möglich
Intelligenz
23,0
Coding37,8Tempo129Tokens/sPreis
39
Qwen3.6 27BAlibabaOpen WeightsOn-Prem möglich
Intelligenz
21,4
Coding53,7Tempo56Tokens/sPreis
40
Gemini 2.5 ProGoogleOpen WeightsOn-Prem möglich
Intelligenz
16,1
Coding33,3Tempo136Tokens/sPreis
41
Gemma 4 31BGoogle
Intelligenz
14,7
Coding43,4Tempo36Tokens/sPreisnicht gemessen
42
Qwen3 VL 235BAlibaba
Intelligenz
13,4
Codingnicht gemessenTemponicht gemessenPreis
43
Gemini 2.5 FlashGoogle
Intelligenz
13,1
Codingnicht gemessenTemponicht gemessenPreis
44
GPT-4.1OpenAI
Intelligenz
12,7
Codingnicht gemessenTemponicht gemessenPreis
45
gpt-oss-120bOpenAI
Intelligenz
11,6
Coding30,4Tempo197Tokens/sPreis
46
Mistral Large 3Mistral
Intelligenz
9,3
Coding20,1Tempo83Tokens/sPreis
47
gpt-oss-20bOpenAI
Intelligenz
9,0
Coding20,7Tempo188Tokens/sPreis
48
Gemini 2.5 Flash-LiteGoogle
Intelligenz
8,5
Codingnicht gemessenTemponicht gemessenPreis
49
GPT-4oOpenAI
Intelligenz
8,4
Codingnicht gemessenTemponicht gemessenPreis
50
Llama 3.3 70BMeta
Intelligenz
7,7
Coding11,9Tempo94Tokens/sPreis
51
GPT-4o miniOpenAI
Intelligenz
6,7
Coding11,4Temponicht gemessenPreis
52
Gemma 3 27BGoogle
Intelligenz
4,9
Coding10,1Temponicht gemessenPreisnicht gemessen

Quelle: Artificial Analysis (artificialanalysis.ai), Stand 06.10.2026. Bei Modellen mit einstellbarer Denktiefe gilt die Messung mit hoher oder maximaler Denktiefe. Fehlt ein Wert, hat Artificial Analysis ihn nicht gemessen; wir schätzen nichts dazu.

Leistung gegen Preis

Jeder Punkt ist ein Modell: je höher, desto stärker, je weiter rechts, desto teurer. Die Effizienzgrenze verbindet die Modelle, die mehr leisten als jedes günstigere.

  • Anthropic
  • OpenAI
  • Google
  • OpenAI
  • Meta
  • SpaceXAI
  • Xiaomi
  • Alibaba
  • Z.ai
  • Moonshot AI
  • OpenAI
  • DeepSeek
  • OpenAI
  • OpenAI
  • OpenAI
  • Mistral
Intelligence Index
  • Proprietär
  • Open Weights
  • Effizienzgrenze

Über einen Punkt fahren oder ihn anklicken: Name und Werte stehen unten im Feld.

0102030405060günstigerteurer

Claude Opus 5.5

Anthropic · veröffentlicht 22.09.2026
Intelligenz
57,6
Coding
nicht gemessen
Tempo
97Tokens/s
Preis

Nicht eingezeichnet (Preis oder Index nicht gemessen): Gemma 4 31B, Gemma 3 27B. Quelle: Artificial Analysis (artificialanalysis.ai), Stand 06.10.2026.

So lesen Sie die Werte

Intelligence Index

Die unabhängige Bewertung von Artificial Analysis fasst mehrere Tests zu Wissen, Logik, Mathematik und Programmieren in einer Zahl zusammen. Höher ist besser. Der Coding Index misst das Programmieren allein.

Tempo

Wie viele Tokens ein Modell pro Sekunde schreibt, gemessen beim Anbieter. Ein Token ist ein Wortteil. Im eigenen Rechenzentrum hängt das Tempo von Ihrer Hardware ab.

Preisstufe

Der Listenpreis je Million Tokens bei den Anbietern, eingeteilt in fünf Stufen. Mehr Balken heißt teurer. Ihre Konditionen hängen vom Betrieb ab und stehen in Ihrem Angebot.

On-Prem möglich

Die Gewichte des Modells sind offen veröffentlicht. Es lässt sich in Ihrer eigenen Infrastruktur oder souverän betreiben.

Open Weights und On-Prem

Modelle mit offenen Gewichten. Betrieb im eigenen Rechenzentrum möglich.

Viele der Modelle sind mit offenen Gewichten veröffentlicht. Für Organisationen wie Banken, Versicherer, Kanzleien, Kliniken oder Verwaltungen heißt das: Das Modell rechnet dort, wo auch die Daten liegen.

Leistung46,3 zu 57,6Das stärkste offene Modell am Markt, MiMo-V2.6-Pro, erreicht im Intelligence Index rund vier Fünftel des stärksten proprietären, Claude Opus 5.5.
GewichteOffen veröffentlichtDie Modellgewichte liegen öffentlich vor, etwa bei Hugging Face. Wann ein Modell wechselt, bestimmen Sie, nicht der Hersteller.
BetriebIm Haus oder souveränIn Ihrem Rechenzentrum, in einer souveränen Cloud wie der Schwarz Digits Cloud (STACKIT) oder hybrid, je nach Schutzbedarf.
AnfragenVerlassen Ihr Netz nichtLaufen der neuland.ai HUB und das offene Modell in Ihrem Rechenzentrum, verlassen Anfragen und Antworten Ihr Netz nicht.

Modellwahl

Sie bestimmen, welches Modell arbeitet. Je Gruppe, je Aufgabe, auf Wunsch mit eigenem Schlüssel.

Welches Modell eine Aufgabe übernimmt, legen Sie im neuland.ai HUB fest. Admins lassen Modelle je Gruppe zu, alles Weitere regelt der Modus Auto oder die Wahl im Chat.

  • Modus AutoJede Nachricht geht je nach Komplexität an ein passendes Modell, nur unter den für die Gruppe zugelassenen. Im Vertrieb fasst ein schnelles Modell die Gesprächsnotiz zusammen, die Auswertung eines langen Geschäftsberichts übernimmt das stärkste Modell, das die Gruppe nutzen darf.
  • Freie Wahl im ChatWer will, wählt selbst, auch mitten im Chat, und vergleicht die Antworten zweier Modelle nebeneinander.
  • Eigene Schlüssel mitbringenMit Bring Your Own Key (BYOK) nutzen Sie bestehende Verträge mit Modellanbietern: Sie hinterlegen Ihren eigenen API-Schlüssel im neuland.ai HUB, die Modellnutzung läuft dann über Ihren eigenen Vertrag.
  • Wechsel ohne UmbauRückt ein stärkeres Modell in den neuland.ai HUB, lassen Admins es für eine Gruppe zu. Die Agenten der Gruppe arbeiten ab dann damit, ohne dass jemand sie neu baut.

Fragen

Was Kunden zu den Modellen zuerst fragen.

  • Das hängt von der Aufgabe ab. Im Intelligence Index liegt derzeit Claude Opus 5.5 vorn (57,6), knapp dahinter Claude Sonnet 5.5 (56,0). Für eine schnelle Zusammenfassung genügt oft ein Modell wie Gemini 3.5 Flash mit 335 Tokens pro Sekunde, dem schnellsten der Übersicht, und gpt-oss-120b läuft in der niedrigsten Preisstufe sogar im eigenen Rechenzentrum. Diese Abwägung übernimmt je Nachricht der Modus Auto.

Das richtige Modell je Aufgabe. Wir wählen mit Ihnen aus.

Sie bringen Ihre Aufgaben mit, wir legen die Werte daneben: welches Modell stark genug ist, welches schnell genug und welches im eigenen Rechenzentrum laufen muss.

Nach Ihrer Anfrage

  1. 01Sie nennen Aufgaben und Schutzbedarf
  2. 02Wir ordnen jeder Aufgabe passende Modelle zu
  3. 03Sie erhalten die Auswahl je Bereich als Grundlage für Ihren Onboarding-Plan

Fuß der Seite