| Anbieter | Modell | API-ID | Status | Klasse | Kontext | Max. Output | Input $/1M | Cached $/1M | Output $/1M | Kosten $ | Input-Modalitäten | Fähigkeiten | Cutoff | Release | Open | API ✓ |
|---|
Zeile anklicken für Beschreibung, Preis-Hinweise und Quellen. „Cached“ = Preis für Cache-Treffer bei Prompt-Caching. „Kosten“ = Input-Preis × Mio. Input + Output-Preis × Mio. Output aus dem Kostenrechner. „API ✓“: ✓ = API-ID live beim Anbieter bestätigt, ✗ = nicht in der Live-Liste, – = nicht prüfbar (kein Key hinterlegt). Download: models.json · models.csv
Anthropic
Die Basispreise gelten pro 1 Mio. Tokens; Prompt Caching und Batch-Verarbeitung haben abweichende Tarife. Claude Pro und Max sind Abonnements für Claude-Apps, keine separaten API-Modellvarianten. Bei Legacy-Modellen sind gemäß Vorgabe nur die jeweils unmittelbar abgelösten Vorgänger erfasst.
xAI (Grok)
Stand 2026-09-04 führt die offizielle xAI-Preisseite sieben gehostete Text-/Bild-zu-Text-Sprachmodelle auf. Die Standardpreise gelten unter 200.000 Prompt-Tokens; ab diesem Schwellenwert gilt für sämtliche Tokens eines Requests der jeweilige Long-Context-Tarif. Priority Processing kostet laut Preisseite das Doppelte des Standardtarifs; Batch ist nur bei den entsprechend gekennzeichneten Modellen verfügbar und dort um 20 % reduziert.
OpenAI
Stand: 2026-09-04. Die reguläre API-Produktlinie besteht aus GPT-6 Astra (limitiert ausgerollt), der GPT-5.6-Familie sowie weiterhin buchbaren GPT-5.5-/GPT-5.4-Vorgängern und GPT-5.3-Codex. Batch und Flex sind bei den aktuellen GPT-5.6-Modellen günstiger, Fast Mode teurer; lange Kontexte können einen Aufschlag auslösen.
Mistral AI
Stand: 2026-09-04. Standardpreise gelten für die globale Serverless-API; Batch-Verarbeitung halbiert laut Anbieter die Tokenpreise, regionale Inferenz kann für unterstützte Modelle 10 % Aufschlag haben. Die fünf als „legacy“ geführten Vorgänger sind nach der dokumentierten sechsmonatigen Deprecation-Frist am Stichtag noch erreichbar; Labs-Vorgänger mit nur einem Monat Frist wurden nicht aufgenommen.
Google (Gemini)
Google bietet über die Gemini API einen kostenlosen Einstieg sowie kostenpflichtige Standard-, Batch-, Flex- und Priority-Inference an. Batch und Flex sind bei den meisten Tokenmodellen günstiger als Standard; Priority ist teurer. Preise können nach Kontextlänge oder Eingabemodalität variieren und sind je Modell in den Preisnotizen zusammengefasst.
Meta (Llama)
Die frühere Llama API wurde durch die Meta Model API abgelöst; diese befindet sich am 4. September 2026 weiterhin im Public Preview. Muse Spark 1.3 ist das aktuelle proprietäre API-Flaggschiff; die günstigere „Contributor“-Route ist derselbe Modellcheckpoint, erlaubt Meta jedoch die Nutzung von Ein- und Ausgaben zur Produktverbesserung. Llama 4 und Muse Glimmer sind Open-Weights-Angebote ohne direkte, von Meta betriebene Token-API.
DeepSeek
Stand 2026-09-04 führt DeepSeek für seine API drei Chatmodell-IDs; die früheren IDs `deepseek-chat` und `deepseek-reasoner` wurden am 2026-07-24 um 15:59 UTC eingestellt und sind daher keine Legacy-Einträge mehr. Die unten als Standardpreise verwendeten Peak-Tarife gelten werktags 01:00–04:00 sowie 06:00–10:00 UTC; alle übrigen Zeiten werden mit 50 % Rabatt abgerechnet.
Moonshot AI (Kimi)
Moonshot AI bietet auf der Kimi API Platform nutzungsbasierte Abrechnung pro Token; die angegebenen Preise verstehen sich ohne anfallende Steuern. Automatisches Context Caching senkt den Preis für Cache-Hits. Der Batch-Modus kostet 60 % des Echtzeit-Tarifs, unterstützt aber nur kimi-k2.7-code und kimi-k2.6, nicht K3.
MiniMax
MiniMax bietet aktuell ein 1M-kontextiges, multimodales Flaggschiff (M3), die weiterhin regulär bepreisten M2.7-Varianten sowie ältere M2.5-Varianten an. Die API-Standardpreise gelten pro 1 Mio. Tokens; M3 wird oberhalb von 512k Input-Tokens teurer, und der Priority-Service kostet 1,5× des Standardtarifs. M2-her ist weiterhin per API dokumentiert, steht jedoch nicht mehr mit einem separaten Tarif in der aktuellen Pay-as-you-go-Tabelle.
Cohere
Stand 4. September 2026. Cohere rechnet reguläre API-Modelle grundsätzlich tokenbasiert ab; mehrere neuere Modelle sind über die Standard-API zunächst nur rate-limitiert kostenlos nutzbar und erfordern für produktive Nutzung Model Vault bzw. ein Sales-Angebot. Datierte Cohere-Modellversionen wurden gemäß Vorgabe zu undatierten Familien-IDs normalisiert; die konkreten, aktuell dokumentierten Snapshots stehen in den Quellseiten.
Amazon (Nova)
Amazon Nova wird über Amazon Bedrock nutzungsbasiert pro Token abgerechnet; die Tarifseite unterscheidet je nach Modell zwischen Standard-, Flex-, Priority- und Batch-Inferenz. Nova 2 ist die aktuelle Generation; die weiterhin API-verfügbaren Nova-1-Modelle sind hier als „legacy“ eingeordnet. Nicht enthalten sind Sonic (Live-Sprache), Embeddings, Canvas/Reel sowie Nova Act.
Z.ai / Zhipu (GLM)
Stand 2026-09-04. Z.AI rechnet API-Nutzung pro 1 Mio. Tokens ab; bei den kostenpflichtigen Chatmodellen ist Context-Cache-Speicherung derzeit zeitlich begrenzt kostenlos. GLM-5.3-Flash läuft aktuell zu einem bis 2026-09-09 (UTC+8) befristet um 50 % reduzierten Tarif; die unten stehenden Preise sind die aktuell berechneten Preise. Die noch angebotenen GLM-4.5-/4.5V-Modelle wurden als weiter zurückliegende Historie nicht aufgenommen; enthalten ist jeweils nur die letzte abgelöste GLM-4.6-/4.6V-Generation.
Perplexity (Sonar)
Die Sonar API ist in der aktuellen Perplexity-Dokumentation als „Legacy API“ eingeordnet, ihre vier dokumentierten Modelle sind jedoch weiterhin über den Sonar-Chat-Completion-Endpunkt nutzbar und auf der Preisseite ausgewiesen. Abrechnung erfolgt nutzungsbasiert ohne Abonnement; neben Tokenpreisen fallen bei Sonar, Sonar Pro und Sonar Reasoning Pro kontextabhängige Request-Gebühren an.
Alibaba (Qwen)
Abgerechnet wird bei Alibaba Cloud Model Studio standardmäßig nutzungsbasiert pro Token; die Preise unterscheiden sich je nach Region, Eingabelänge, Thinking-Modus und Modalität. Die untenstehenden Preisfelder geben, soweit verfügbar, den regulären Pay-as-you-go-Starttarif für Global/US beziehungsweise International an; Staffel-, Cache-, Batch- und Modalitätsabweichungen stehen in price_notes. Berücksichtigt sind Qwen-Text- und multimodale Chat-/Understanding-Modelle, nicht jedoch reine Generierungs-, Speech-, Embedding-, Moderations-, Realtime- oder Robotik-Modelle.