LLM-Check Preise & Umfang aktueller Sprachmodelle

180 Modelle von 14 Anbietern · Stand 04.09.2026, 10:48 Uhr · Preise in USD pro 1 Mio. Tokens (Standard-Tarif) · Recherche: gpt-5.6-terra mit Web-Suche auf offiziellen Anbieterseiten

Kostenrechner: Mio. Input Mio. Output
Anbieter Modell API-ID Status Klasse Kontext Max. Output Input $/1M Cached $/1M Output $/1M Kosten $ Input-Modalitäten Fähigkeiten Cutoff Release Open API ✓

Zeile anklicken für Beschreibung, Preis-Hinweise und Quellen. „Cached“ = Preis für Cache-Treffer bei Prompt-Caching. „Kosten“ = Input-Preis × Mio. Input + Output-Preis × Mio. Output aus dem Kostenrechner. „API ✓“: ✓ = API-ID live beim Anbieter bestätigt, ✗ = nicht in der Live-Liste, – = nicht prüfbar (kein Key hinterlegt). Download: models.json · models.csv

Anthropic · 9 Modelle

Die Basispreise gelten pro 1 Mio. Tokens; Prompt Caching und Batch-Verarbeitung haben abweichende Tarife. Claude Pro und Max sind Abonnements für Claude-Apps, keine separaten API-Modellvarianten. Bei Legacy-Modellen sind gemäß Vorgabe nur die jeweils unmittelbar abgelösten Vorgänger erfasst.
Preise · Doku · API-Liste live abgeglichen

xAI (Grok) · 8 Modelle

Stand 2026-09-04 führt die offizielle xAI-Preisseite sieben gehostete Text-/Bild-zu-Text-Sprachmodelle auf. Die Standardpreise gelten unter 200.000 Prompt-Tokens; ab diesem Schwellenwert gilt für sämtliche Tokens eines Requests der jeweilige Long-Context-Tarif. Priority Processing kostet laut Preisseite das Doppelte des Standardtarifs; Batch ist nur bei den entsprechend gekennzeichneten Modellen verfügbar und dort um 20 % reduziert.

OpenAI · 14 Modelle

Stand: 2026-09-04. Die reguläre API-Produktlinie besteht aus GPT-6 Astra (limitiert ausgerollt), der GPT-5.6-Familie sowie weiterhin buchbaren GPT-5.5-/GPT-5.4-Vorgängern und GPT-5.3-Codex. Batch und Flex sind bei den aktuellen GPT-5.6-Modellen günstiger, Fast Mode teurer; lange Kontexte können einen Aufschlag auslösen.
Preise · Doku · API-Liste live abgeglichen

Mistral AI · 15 Modelle

Stand: 2026-09-04. Standardpreise gelten für die globale Serverless-API; Batch-Verarbeitung halbiert laut Anbieter die Tokenpreise, regionale Inferenz kann für unterstützte Modelle 10 % Aufschlag haben. Die fünf als „legacy“ geführten Vorgänger sind nach der dokumentierten sechsmonatigen Deprecation-Frist am Stichtag noch erreichbar; Labs-Vorgänger mit nur einem Monat Frist wurden nicht aufgenommen.

Google (Gemini) · 18 Modelle

Google bietet über die Gemini API einen kostenlosen Einstieg sowie kostenpflichtige Standard-, Batch-, Flex- und Priority-Inference an. Batch und Flex sind bei den meisten Tokenmodellen günstiger als Standard; Priority ist teurer. Preise können nach Kontextlänge oder Eingabemodalität variieren und sind je Modell in den Preisnotizen zusammengefasst.
Preise · Doku · API-Liste live abgeglichen

Meta (Llama) · 6 Modelle

Die frühere Llama API wurde durch die Meta Model API abgelöst; diese befindet sich am 4. September 2026 weiterhin im Public Preview. Muse Spark 1.3 ist das aktuelle proprietäre API-Flaggschiff; die günstigere „Contributor“-Route ist derselbe Modellcheckpoint, erlaubt Meta jedoch die Nutzung von Ein- und Ausgaben zur Produktverbesserung. Llama 4 und Muse Glimmer sind Open-Weights-Angebote ohne direkte, von Meta betriebene Token-API.

DeepSeek · 3 Modelle

Stand 2026-09-04 führt DeepSeek für seine API drei Chatmodell-IDs; die früheren IDs `deepseek-chat` und `deepseek-reasoner` wurden am 2026-07-24 um 15:59 UTC eingestellt und sind daher keine Legacy-Einträge mehr. Die unten als Standardpreise verwendeten Peak-Tarife gelten werktags 01:00–04:00 sowie 06:00–10:00 UTC; alle übrigen Zeiten werden mit 50 % Rabatt abgerechnet.
Preise · Doku · API-Liste live abgeglichen

Moonshot AI (Kimi) · 4 Modelle

Moonshot AI bietet auf der Kimi API Platform nutzungsbasierte Abrechnung pro Token; die angegebenen Preise verstehen sich ohne anfallende Steuern. Automatisches Context Caching senkt den Preis für Cache-Hits. Der Batch-Modus kostet 60 % des Echtzeit-Tarifs, unterstützt aber nur kimi-k2.7-code und kimi-k2.6, nicht K3.
Preise · Doku · API-Liste live abgeglichen

MiniMax · 6 Modelle

MiniMax bietet aktuell ein 1M-kontextiges, multimodales Flaggschiff (M3), die weiterhin regulär bepreisten M2.7-Varianten sowie ältere M2.5-Varianten an. Die API-Standardpreise gelten pro 1 Mio. Tokens; M3 wird oberhalb von 512k Input-Tokens teurer, und der Priority-Service kostet 1,5× des Standardtarifs. M2-her ist weiterhin per API dokumentiert, steht jedoch nicht mehr mit einem separaten Tarif in der aktuellen Pay-as-you-go-Tabelle.

Cohere · 17 Modelle

Stand 4. September 2026. Cohere rechnet reguläre API-Modelle grundsätzlich tokenbasiert ab; mehrere neuere Modelle sind über die Standard-API zunächst nur rate-limitiert kostenlos nutzbar und erfordern für produktive Nutzung Model Vault bzw. ein Sales-Angebot. Datierte Cohere-Modellversionen wurden gemäß Vorgabe zu undatierten Familien-IDs normalisiert; die konkreten, aktuell dokumentierten Snapshots stehen in den Quellseiten.

Amazon (Nova) · 7 Modelle

Amazon Nova wird über Amazon Bedrock nutzungsbasiert pro Token abgerechnet; die Tarifseite unterscheidet je nach Modell zwischen Standard-, Flex-, Priority- und Batch-Inferenz. Nova 2 ist die aktuelle Generation; die weiterhin API-verfügbaren Nova-1-Modelle sind hier als „legacy“ eingeordnet. Nicht enthalten sind Sonic (Live-Sprache), Embeddings, Canvas/Reel sowie Nova Act.

Z.ai / Zhipu (GLM) · 12 Modelle

Stand 2026-09-04. Z.AI rechnet API-Nutzung pro 1 Mio. Tokens ab; bei den kostenpflichtigen Chatmodellen ist Context-Cache-Speicherung derzeit zeitlich begrenzt kostenlos. GLM-5.3-Flash läuft aktuell zu einem bis 2026-09-09 (UTC+8) befristet um 50 % reduzierten Tarif; die unten stehenden Preise sind die aktuell berechneten Preise. Die noch angebotenen GLM-4.5-/4.5V-Modelle wurden als weiter zurückliegende Historie nicht aufgenommen; enthalten ist jeweils nur die letzte abgelöste GLM-4.6-/4.6V-Generation.

Perplexity (Sonar) · 4 Modelle

Die Sonar API ist in der aktuellen Perplexity-Dokumentation als „Legacy API“ eingeordnet, ihre vier dokumentierten Modelle sind jedoch weiterhin über den Sonar-Chat-Completion-Endpunkt nutzbar und auf der Preisseite ausgewiesen. Abrechnung erfolgt nutzungsbasiert ohne Abonnement; neben Tokenpreisen fallen bei Sonar, Sonar Pro und Sonar Reasoning Pro kontextabhängige Request-Gebühren an.

Alibaba (Qwen) · 57 Modelle

Abgerechnet wird bei Alibaba Cloud Model Studio standardmäßig nutzungsbasiert pro Token; die Preise unterscheiden sich je nach Region, Eingabelänge, Thinking-Modus und Modalität. Die untenstehenden Preisfelder geben, soweit verfügbar, den regulären Pay-as-you-go-Starttarif für Global/US beziehungsweise International an; Staffel-, Cache-, Batch- und Modalitätsabweichungen stehen in price_notes. Berücksichtigt sind Qwen-Text- und multimodale Chat-/Understanding-Modelle, nicht jedoch reine Generierungs-, Speech-, Embedding-, Moderations-, Realtime- oder Robotik-Modelle.