LongCat-2.0 ist Meituans neues Open-Weight-Sprachmodell für Coding, lang laufende Agenten und komplexe Tool-Workflows. Das Modell kombiniert eine Mixture-of-Experts-Architektur mit 1,6 Billionen Gesamtparametern, ungefähr 48 Milliarden aktivierten Parametern pro Token, einem Kontextfenster von bis zu einer Million Tokens und einer maximalen API-Ausgabe von 128.000 Tokens.12

Aktualisiert am 8. Oktober 2026. LongCat-2.0 ist Meituans öffentliches Open-Weight-Modell mit 1,6 Billionen Gesamtparametern, rund 48 Milliarden aktiven Parametern pro Token und einem API-Kontextfenster von 1 Million Tokens. Das Modell ist unter der MIT-Lizenz verfügbar, benötigt für vollständiges Selbsthosting aber Rechenzentrums-Hardware. Die LongCat-Plattform bietet inzwischen zusätzlich LongCat-2.5-Preview an – einen anderen API-Modellnamen mit Bildverständnis. Die beiden Versionen sind nicht gleichzusetzen.123

Die offiziellen Preislisten sind weiterhin öffentlich. Allerdings gelten Standard- und befristete Rabattpreise parallel; entscheidend ist die Abrechnung im eigenen Konto. Die konkreten Beträge und Cache-Rechnungen stehen weiter unten.4

Übersicht der wichtigsten LongCat-2.0-Spezifikationen: 1,6 Billionen Parameter, etwa 48 Milliarden aktive Parameter, 1M Kontext und 128K Ausgabe.
Diagramm auf Basis der offiziellen Modellkarte. Quelle: Meituan LongCat.

LongCat-2.0 oder LongCat-2.5-Preview? Aktueller Plattformstatus

Die offizielle Änderungshistorie dokumentiert die reguläre Freigabe von LongCat-2.0 am 30. Juni 2026 und den Start von LongCat-2.5-Preview am 25. September 2026. Beide Modell-IDs werden im aktuellen API-Quickstart aufgeführt.

EntscheidungskriteriumLongCat-2.0LongCat-2.5-Preview
API-Modell-IDLongCat-2.0LongCat-2.5-Preview
Statusreguläres API-Modell, offene 2.0-Gewichteneueres Preview-API-Modell
Eingabentextorientiertes Sprachmodellzusätzlich Bildverständnis dokumentiert
API-Kontext / maximaler Output1M / 128K Tokens1M / 128K Tokens
Veröffentlichte Gewichte2.0-Checkpoint auf Hugging Face unter MITnicht identisch mit dem 2.0-Checkpoint; separat prüfen
Pay-as-you-go-Rabatt (USD/M)0,30 Input / 0,006 Cache / 1,20 Output0,30 Input / 0,006 Cache / 1,20 Output laut aktueller Preview-Preisliste

Wichtig: Der 2.0-Artikel ist keine technische Modellkarte für 2.5. Vor einem Wechsel sollten Agenten die Tool-Calls, das Reasoning-Verhalten, die Latenz und das tatsächliche Prompt-Caching auf dem eigenen Harness testen. Die neuen multimodalen Fähigkeiten sind ein Grund, 2.5 separat zu prüfen – kein Beleg, dass jedes Coding-Benchmark-Ergebnis automatisch besser ist.35

Vergleich LongCat-2.0 und LongCat-2.5-Preview: API-Modell-IDs, Bildverständnis, Kontextgrenzen und Tarifarten.
Eigene Gegenüberstellung nach Meituans API-Quickstart, September-Changelog und Preisliste. Keine Benchmark-Rangliste.235

LongCat-2.0 in Kürze

MerkmalOffizielle AngabeEinordnung
Gesamtparameter1,6 BillionenMixture-of-Experts-Modell mit 1,6 Billionen Gesamtparametern
Aktivierte Parameterca. 48 Milliarden pro TokenRechenaufwand deutlich kleiner als der gesamte Parameterbestand
Kontextfenster1.000.000 TokensFür große Repositories, lange Dokumente und Agentenverläufe
Maximale Ausgabe128.000 TokensMaximal dokumentierte API-Ausgabe
Pretrainingmehr als 35 Billionen TokensLaut Meituan auf AI-ASIC-Superpods
N-Gram-Embedding135 Milliarden ParameterZusätzliche sparse Kapazität
LizenzMITBreite Verwendung unter den Lizenzbedingungen
API-FormateOpenAI und AnthropicEinfache Integration in bestehende Anwendungen
SchwerpunktCoding und AgentenTool Calls, mehrstufige Aufgaben, Repository-Änderungen

Was ist LongCat-2.0?

LongCat-2.0 gehört zur LongCat-Modellfamilie von Meituan. Der Vorgänger LongCat-Flash nutzte ebenfalls eine Mixture-of-Experts-Architektur, war mit 560 Milliarden Gesamtparametern und durchschnittlich rund 27 Milliarden aktivierten Parametern pro Token jedoch deutlich kleiner. LongCat-2.0 erweitert sowohl den Modellumfang als auch das Langkontext-Design.6

Die API-Vorschau von LongCat-2.0 erschien im April 2026. Am 30. Juni 2026 dokumentierte Meituan die reguläre Freigabe und den Start des kostenpflichtigen API-Angebots. Parallel stellte die Plattform mehrere ältere LongCat-Dienste zurück, um Ressourcen auf LongCat-2.0 zu konzentrieren.3

Der zentrale Unterschied zu einem klassischen dichten Modell lautet: Nicht alle 1,6 Billionen Parameter werden für jedes Token berechnet. Ein Router wählt für jeden Verarbeitungsschritt relevante Experten aus. Rund 48 Milliarden Parameter werden aktiviert. Dadurch bleibt der Rechenpfad wesentlich kleiner als das vollständige Modell, obwohl alle Gewichte gespeichert oder über ein verteiltes System verfügbar sein müssen.

Architektur: Warum 1,6 Billionen Parameter nicht 1,6 Billionen aktive Parameter bedeuten

Bei einem dichten Transformer nehmen alle Modellparameter an jeder Vorwärtsrechnung teil. Ein Mixture-of-Experts-Modell verteilt dagegen Teile der Feedforward-Berechnung auf viele spezialisierte Experten. Für ein Token wird nur eine Auswahl davon aktiviert.

LongCat-2.0 meldet ungefähr 48 Milliarden aktive Parameter je Token. Das entspricht nur etwa drei Prozent der angegebenen 1,6 Billionen Gesamtparameter. Daraus ergeben sich zwei unterschiedliche Anforderungen:

  1. Rechenaufwand: Pro Token muss nur der aktive Pfad berechnet werden.
  2. Speicher- und Infrastrukturbedarf: Die vollständigen Expertengewichte müssen trotzdem verfügbar sein, typischerweise verteilt über viele Beschleuniger.

Die Zahl der aktiven Parameter ist deshalb kein Maß für die Dateigröße des Modells. Sie erklärt, warum LongCat-2.0 trotz seiner enormen Gesamtkapazität effizienter als ein dichtes 1,6T-Modell inferiert werden kann. Sie macht es aber nicht zu einem gewöhnlichen lokalen 48B-Modell.

LongCat Sparse Attention

Normale Self-Attention vergleicht bei langen Sequenzen sehr viele Tokenpaare. Die Kosten wachsen in einer naiven Implementierung quadratisch mit der Sequenzlänge. Bei einer Million Tokens wird dieser Ansatz praktisch unbrauchbar. LongCat-2.0 führt deshalb LongCat Sparse Attention (LSA) ein.1

Konzeptgrafik zu LongCat Sparse Attention mit Streaming-aware Indexing, Cross-Layer Indexing und Hierarchical Indexing.
Konzeptionelle Darstellung der drei von Meituan beschriebenen Indexierungsstrategien; keine vollständige Schichtarchitektur. Quelle: Meituan LongCat.

LSA kombiniert drei Verfahren:

Streaming-aware Indexing (SI) verbindet zusammenhängende, hardwarefreundliche Speicherzugriffe mit dynamisch ausgewählten Tokens. Statt vieler kleiner und schlecht planbarer Zugriffe sollen größere, sequenzielle HBM-Leseoperationen entstehen.

Cross-Layer Indexing (CLI) nutzt die Beobachtung, dass wichtige Attention-Positionen in benachbarten Schichten oft ähnlich bleiben. Ein berechneter Index kann deshalb für mehrere aufeinanderfolgende Layer wiederverwendet werden. Meituan nennt Cross-Layer-Distillation als Trainingsmechanismus, der diese Wiederverwendung ermöglicht.

Hierarchical Indexing (HI) führt eine zweistufige Auswahl durch. Zuerst werden auf Blockebene aussichtsreiche Kandidaten grob bestimmt. Danach erfolgt innerhalb dieser Blöcke die feinere Tokenauswahl. Der teure Feinscore muss dadurch nur noch auf einem kleineren Kandidatenraum arbeiten.

Meituan verbindet diese Verfahren zudem mit einem dreistufigen Multi-Token-Prediction-Modul für spekulative Dekodierung. Mehrere kommende Tokens werden vorgeschlagen, während Indexinformationen teilweise gemeinsam genutzt werden.1

135 Milliarden Parameter für N-Gram-Embeddings

LongCat-2.0 übernimmt N-Gram-Embeddings aus LongCat-Flash-Lite. Insgesamt sollen 135 Milliarden Parameter in diesen Embeddings stecken. Sie erweitern die Modellkapazität in einer anderen sparsamen Dimension als die MoE-Experten.1

Vereinfacht gesagt können häufige Tokenfolgen zusätzliche gelernte Repräsentationen erhalten. Das kann lokale Muster effizienter abbilden, ohne sämtliche zusätzliche Kapazität in immer mehr Experten zu investieren. Meituan behauptet, dass die gewählte Mischung robuster skaliert als ein gleich großes reines MoE-Modell. Unabhängige Ablationen speziell für LongCat-2.0 sind zum Veröffentlichungszeitpunkt jedoch noch begrenzt.

Eine Million Tokens Kontext: Was das praktisch bedeutet

Die LongCat-API dokumentiert ein Kontextfenster von 1.000.000 Tokens und eine maximale Ausgabe von 128.000 Tokens.2 Das unterstützt folgende Aufgaben:

  • Analyse großer Software-Repositories
  • Verarbeitung langer Log- und Terminalverläufe
  • Zusammenführung zahlreicher Dokumente
  • agentenbasierte Workflows mit vielen Zwischenschritten und Tool-Ergebnissen
  • umfangreiche Code-Migrationen mit vielen abhängigen Dateien
  • lange Recherche- und Automatisierungsworkflows
Skalengrafik zum Kontextfenster von LongCat-2.0 mit einer Million Tokens und 128.000 Tokens maximaler Ausgabe.
Die Balken zeigen die dokumentierten API-Grenzen und den 128K-Kontext der LongCat-Flash-Generation. Quelle: Meituan LongCat.

Ein großes Kontextfenster ist nicht gleichbedeutend mit perfekter Nutzung jedes Tokens. Entscheidend sind auch Retrieval-Qualität, Positionsrobustheit, Ablenkung durch irrelevante Inhalte, Prompt-Struktur, Latenz und Kosten. Für produktive Systeme bleibt es sinnvoll, große Datenmengen zu segmentieren, relevante Teile vorzuselektieren und Resultate zu überprüfen.

Wie viel Text ist eine Million Tokens?

Eine exakte Umrechnung in Wörter oder Seiten ist nicht möglich, weil Tokenisierung von Sprache, Code, Sonderzeichen und Formatierung abhängt. Als grobe Größenordnung kann eine Million englische Tokens mehreren hunderttausend Wörtern entsprechen. Quellcode kann aufgrund kurzer Bezeichner, Satzzeichen und Einrückung deutlich anders tokenisiert werden.

Für Agenten zählt neben der Eingabemenge auch der Verlauf der Sitzung: Tool-Ausgaben, Terminal-Logs, Patches und interne Zwischenstände sammeln sich an. Ein großes Fenster reduziert den unmittelbaren Zwang zur Komprimierung, ersetzt aber keine gute Kontextverwaltung.

Training auf AI-ASIC-Superpods

Meituan gibt an, dass sowohl das vollständige Training als auch die großskalige Bereitstellung auf AI-ASIC-Superpods durchgeführt wurden. Das Pretraining habe mehr als 35 Billionen Tokens und Millionen Beschleunigertage umfasst. Zudem meldet Meituan keine Rollbacks oder nicht wiederherstellbaren Loss-Spikes während des Trainings.1

Meituan stellt LongCat-2.0 als Beispiel für Frontier-Training auf einer alternativen Beschleunigerplattform dar. Die Modellkarte nennt allerdings keine vollständige Hardwarestückliste, keine unabhängig überprüfte Energieaufnahme und keine detaillierte Gesamtkostenrechnung. Aussagen zur Effizienz sollten daher auf die veröffentlichten Fakten begrenzt bleiben.

LongCat-2.0 Benchmarks

Meituan veröffentlicht Ergebnisse für Coding-Agenten, allgemeine Agenten, Suche, Instruction Following, Schreiben, Mathematik und wissenschaftliches Schlussfolgern. Die wichtigsten gemeldeten LongCat-2.0-Werte sind:

BenchmarkLongCat-2.0
Terminal-Bench 2.170,8
SWE-bench Pro59,5
SWE-bench Multilingual77,3
FORTE73,2
BrowseComp79,9
RWSearch78,8
IFEval90,0
WritingBench83,8
IMO-AnswerBench81,8
GPQA Diamond88,9
Balkendiagramm ausgewählter offizieller LongCat-2.0-Benchmarkwerte.
Herstellerangaben. Die meisten LongCat-Werte wurden laut Modellkarte intern unter einem einheitlichen Harness gemessen. Quelle: Meituan LongCat.

Wie gut sind diese Werte einzuordnen?

Die Ergebnisse unterscheiden sich je nach Benchmark:

  • Bei SWE-bench Pro meldet LongCat-2.0 59,5 Punkte und liegt in Meituans Tabelle über den dort aufgeführten Werten von Gemini 3.1 Pro, GPT-5.5 und Claude Opus 4.6, aber unter Claude Opus 4.7 und 4.8.
  • Bei SWE-bench Multilingual liegt LongCat-2.0 mit 77,3 nahe an Claude Opus 4.6 und oberhalb des aufgeführten Gemini-Werts, aber unter Opus 4.7 und 4.8.
  • Bei Terminal-Bench 2.1 ist LongCat-2.0 mit 70,8 etwa auf dem Niveau des angegebenen Gemini-Werts, aber hinter GPT-5.5 und Opus 4.8.
  • IFEval 90,0 liegt in der Tabelle unter Gemini 3.1 Pro, GPT-5.5 und Claude Opus 4.6.
  • GPQA Diamond 88,9 bleibt unter mehreren Vergleichsmodellen.

Diese Vergleiche sind nicht vollständig unabhängig. Meituan weist darauf hin, dass nicht mit Stern markierte Werte intern unter einem eigenen, einheitlichen Harness erhoben wurden, während Sternwerte aus offiziellen Berichten der jeweiligen Anbieter stammen. Unterschiedliche Agentengerüste, Toolsets, Budgets, Sampling-Einstellungen und Bewertungszeitpunkte können Ergebnisse beeinflussen.1 Die Tabelle ist daher ein Signal für Wettbewerbsfähigkeit, kein endgültiges Rangsystem.

Warum Agenten-Benchmarks schwer vergleichbar sind

Bei klassischen Wissensfragen ist der Bewertungsablauf relativ überschaubar. Agenten-Benchmarks hängen stärker von der gesamten Laufzeitumgebung ab:

  • Welche Tools stehen zur Verfügung?
  • Wie viele Schritte oder Tokens darf das Modell verwenden?
  • Darf es Fehler korrigieren und Tests wiederholen?
  • Welche Container-, Netzwerk- oder Dateirechte besitzt der Agent?
  • Wird mit einem einzelnen Sample oder mehreren Versuchen bewertet?
  • Welche Version des Benchmarks und des Agenten-Harnesses wurde genutzt?

Deshalb sollte ein Team LongCat-2.0 zusätzlich auf eigenen Repositories, Tickets und Automatisierungen testen.

LongCat-2.0 API: OpenAI- und Anthropic-kompatibel

Die LongCat API Platform bietet zwei Schnittstellen:

  • OpenAI-kompatible Chat Completions
  • Anthropic-kompatible Messages API

Dadurch lässt sich LongCat-2.0 in viele vorhandene Programme integrieren, ohne das komplette Anwendungskonzept neu zu schreiben.2

Python-Beispiel mit dem OpenAI-SDK

import os
from openai import OpenAI

api_key = os.environ.get("LONGCAT_API_KEY")
if not api_key:
    raise RuntimeError("Setze zuerst LONGCAT_API_KEY.")

client = OpenAI(
    api_key=api_key,
    base_url="https://api.longcat.chat/openai",
)

response = client.chat.completions.create(
    model="LongCat-2.0",
    messages=[
        {
            "role": "system",
            "content": (
                "Du bist ein sorgfältiger Coding-Assistent. "
                "Prüfe Annahmen und nenne alle geänderten Dateien."
            ),
        },
        {
            "role": "user",
            "content": (
                "Analysiere dieses Repository und plane eine sichere "
                "Migration auf Python 3.14."
            ),
        },
    ],
    max_tokens=4000,
)

print(response.choices[0].message.content)

Der API-Schlüssel sollte ausschließlich über eine Umgebungsvariable oder einen Secret Manager eingebunden werden. Er gehört nicht in ein Repository oder in clientseitigen JavaScript-Code.

Robuste Requests für lange Agentenläufe

Bei langen Ausgaben empfiehlt die API-Dokumentation Streaming. Anwendungen sollten außerdem sinnvolle Timeouts, exponentielles Backoff bei HTTP 429 und eine Protokollierung von Tokenverbrauch, Laufzeit und Fehlerquote implementieren.7

Ein produktiver Agent sollte zusätzlich:

  1. vor Änderungen einen Plan erzeugen,
  2. Dateien gezielt statt pauschal laden,
  3. Änderungen in kleinen Schritten durchführen,
  4. Tests nach jedem logischen Abschnitt ausführen,
  5. Patches und Tool-Ergebnisse validieren,
  6. bei Unsicherheit stoppen oder menschliche Freigabe verlangen.

Claude Code mit LongCat-2.0

Meituan dokumentiert eine direkte Konfiguration über die Anthropic-kompatible Basis-URL. In ~/.claude/settings.json können unter anderem ANTHROPIC_AUTH_TOKEN, ANTHROPIC_BASE_URL und die LongCat-Modellnamen gesetzt werden.8

Das macht LongCat-2.0 technisch zu einer Alternative innerhalb des Claude-Code-Harness. Die Modellantworten stammen dann von LongCat, nicht von einem Claude-Modell. Kompatibilität mit dem API-Format garantiert außerdem nicht, dass alle proprietären Modellverhaltensweisen identisch sind.

LongCat-2.0 API-Preise: Liste, Rabatt und reale Cache-Kosten

Die offizielle 2.0-Preisliste zeigt am 8. Oktober 2026 weiterhin zwei Spalten: normale API-Sätze und befristete Rabattpreise, jeweils USD pro 1 Million Tokens. Das sind keine EUR-Endpreise inklusive deutscher Umsatzsteuer. Meituan erklärt ausdrücklich, dass die Werte in der eigenen API-Konsole und auf der tatsächlichen Rechnung maßgeblich sind.4

API-TokentypStandard-ListenpreisBefristeter Rabattpreis
Uncached Input0,75 USD0,30 USD
Cached Input0,015 USD0,006 USD
Output2,95 USD1,20 USD
LongCat-2.0 API: bestätigte Standard- und befristete Rabattpreise je Million Tokens, einschließlich Cache-Input.
USD-Listenpreise aus Meituans aktueller 2.0-Preisliste, geprüft am 8. Oktober 2026. Rabattdauer nicht zugesichert.4

Kostenbeispiele ohne doppelte Cache-Abrechnung

Fall A: 100.000 nicht gecachte Input-Tokens und 10.000 Output-Tokens kosten 0,1045 USD Standard oder 0,042 USD zum angegebenen Rabatt.

Fall B – Agentensitzung: 50 Mio. Input-Tokens, davon bereits enthalten 40 Mio. Cache-Hits, plus 5 Mio. Output-Tokens:

BerechnungStandardRabatt
10 Mio. uncached Input7,50 USD3,00 USD
40 Mio. cached Input0,60 USD0,24 USD
5 Mio. Output14,75 USD6,00 USD
Gesamt22,85 USD9,24 USD

Formel: (Input gesamt − Cache-Hits) × Uncached-Tarif + Cache-Hits × Cached-Tarif + Output × Output-Tarif. Ein Cache-Treffer ist nicht garantiert: Nur tatsächlich als cached verbuchte Tokens dürfen zum Cache-Tarif gerechnet werden.

Meituan bietet separat 30 Tage gültige Token Packs. Für verifizierte internationale Unternehmenskonten listet die FAQ darüber hinaus verbrauchsabhängige Pay-as-you-go-Staffelrabatte bis 40 %, ab 75 / 300 / 1.200 / 6.000 USD monatlichem Verbrauch. Diese Konditionen sind nicht automatisch zusätzlich mit Aktionspreisen kombinierbar und keine Standardkonditionen für Privatkonten.7

Kostenfalle: Das maximale Kontextfenster vollschreiben

Ein Kontextfenster von 1 Mio. Tokens bedeutet keine Pflicht, es auszunutzen. Lange Historys erhöhen Netzwerk- und Prefill-Zeit, Cache-Miss-Risiko und Agentenwiederholungen. Das offiziell dokumentierte Limit von 128.000 Output-Tokens ist eine Obergrenze, keine garantierte Antwortlänge. Der Quickstart empfiehlt bei HTTP 429 exponentiellen Backoff mit retry_after; context_length_exceeded verlangt einen kürzeren Request.27

Kann LongCat-2.0 lokal auf einem Mac laufen?

Für einen gewöhnlichen Mac lautet die praktische Antwort: nicht als vollständiges Modell.

Die offizielle Angabe von 1,6 Billionen Parametern ergibt bereits theoretisch folgende reine Gewichtsmengen:

FormatTheoretische Mindestgröße der Gewichte
BF16 / FP16ca. 3,2 TB
8 Bitca. 1,6 TB
4 Bitca. 800 GB

Dazu kommen Quantisierungsmetadaten, Laufzeitpuffer, KV-Cache, Routing, temporäre Aktivierungen und Framework-Overhead. Die rund 48 Milliarden aktiven Parameter reduzieren die Berechnung pro Token, nicht automatisch den benötigten Speicher für sämtliche Experten.

Selbst ein Mac Studio mit sehr großem Unified Memory reicht daher nicht für eine komfortable vollständige lokale Bereitstellung. Starke Offloading-Lösungen könnten theoretische Experimente ermöglichen, wären aber langsam und weit entfernt von der vorgesehenen Superpod-Infrastruktur. Für Mac-Nutzer ist die LongCat-API der realistische Zugangsweg.

Die Modellkarte nennt GPU- und NPU-Bereitstellung über SGLang beziehungsweise SGLang-FluentLLM. Hugging Face zeigt zudem Hinweise für vLLM, SGLang und verfügbare Quantisierungen. Das bedeutet nicht, dass ein durchschnittlicher Rechner die vollständigen Gewichte sinnvoll hosten kann.1

Warum „48B aktiv“ nicht heißt: „passt wie ein 48B-Modell“

Bei jeder einzelnen Tokenberechnung wird nur ein Teil der Experten verwendet. Der Router kann für das nächste Token jedoch andere Experten auswählen. Damit die Auswahl flexibel bleibt, muss das System Zugriff auf den gesamten Expertenbestand haben. Ein lokaler Rechner kann die ungenutzten Gewichte nicht einfach dauerhaft löschen.

Stärken von LongCat-2.0

1. Sehr großes Langkontextfenster

Eine Million Tokens ermöglichen Aufgaben, bei denen klassische 32K- oder 128K-Fenster schnell an Grenzen stoßen. Für große Repositories und lange Agentenverläufe ist das ein relevantes Produktmerkmal.

2. Fokus auf echte Agenten-Harnesses

Meituan nennt nicht nur abstraktes Tool Calling, sondern konkrete Integrationen mit Claude Code, Hermes, OpenClaw, OpenCode und Kilo Code. Dadurch lässt sich das Modell in existierenden Workflows testen.

3. Offene Gewichte unter MIT-Lizenz

Die Modellgewichte werden laut Modellkarte unter der MIT-Lizenz veröffentlicht. Das ist deutlich freier als viele Community-Lizenzen mit Nutzungs- oder Umsatzgrenzen. Marken- und Patentrechte von Meituan werden dadurch allerdings nicht automatisch eingeräumt.1

4. Flexible API-Kompatibilität

OpenAI- und Anthropic-kompatible Endpunkte verringern den Integrationsaufwand. Anwendungen können oft durch Austausch von Basis-URL, Schlüssel und Modellnamen angepasst werden.

5. Veröffentlichte API-Preise

Der veröffentlichte Preis für gecachten Input liegt deutlich unter dem Preis für nicht gecachten Input. Das kann LongCat-2.0 für lange, wiederverwendete Kontexte relevant machen, sofern Latenz, Zuverlässigkeit und Qualität zum jeweiligen Workflow passen.

Grenzen und offene Fragen

Unabhängige Evaluationen fehlen noch

LongCat-2.0 ist neu. Viele öffentlich diskutierte Ergebnisse stammen direkt von Meituan. Externe Reproduktionen auf identischen Agentenbudgets und Harness-Versionen sind für eine belastbare Marktpositionierung entscheidend.

1M Kontext ist nicht gleich 1M zuverlässige Erinnerung

Maximale Eingabelänge, effektive Informationswiedergewinnung und stabile Schlussfolgerung über den gesamten Kontext sind unterschiedliche Eigenschaften. Praktische Needle-in-a-Haystack-, Multi-Hop- und Repository-Tests bleiben wichtig.

Selbsthosting erfordert massive Infrastruktur

Die MIT-Lizenz macht die Gewichte zugänglich; sie reduziert nicht deren Speicherbedarf. Für die meisten Entwickler ist API-Nutzung realistischer als lokales Hosting.

Sprach- und Sicherheitsleistung kann variieren

Meituan weist selbst darauf hin, dass Leistung zwischen Sprachen und Anwendungen schwanken kann. Vor Einsätzen in Medizin, Recht, Finanzen, Personalentscheidungen oder kritischer Infrastruktur sind eigene Tests und menschliche Kontrolle erforderlich.1

Daten- und Betriebsfragen

Wer die gehostete API verwendet, sollte Datenschutzbestimmungen, Datenstandorte, Logging, Aufbewahrung, Vertragsbedingungen und Compliance-Anforderungen prüfen. API-Kompatibilität allein beantwortet diese Fragen nicht.

LongCat-2.0 vs. LongCat-Flash

MerkmalLongCat-FlashLongCat-2.0
Gesamtparameter560B1,6T
Aktivierte Parameter18,6B–31,3B, Ø ca. 27Bca. 48B
Kontextbis 128K in der Flash-Generationbis 1M
Hauptfokuseffiziente allgemeine und agentische Nutzunglange Agentenaufgaben, Coding und Repository-Arbeit
Aufmerksamkeitfrühere LongCat-ArchitekturLongCat Sparse Attention
N-Gram-Embeddingbei Flash-Lite eingeführt135B Parameter
LizenzMIT bei veröffentlichten ModellenMIT

LongCat-2.0 vergrößert die Gesamt- und die aktive Kapazität und baut den Kontextpfad neu aus. Dadurch steigt auch der Infrastrukturbedarf.

Für wen passt LongCat-2.0?

LongCat-2.0 passt zu folgenden Szenarien:

  • Entwickler, die lange Coding-Agenten testen
  • Teams mit sehr großen Repositories
  • Anbieter von Agentenplattformen und Tool-Harnesses
  • Forschung zu Sparse Attention und MoE-Skalierung
  • Unternehmen, die OpenAI- oder Anthropic-kompatible APIs austauschbar halten
  • Nutzer von Hermes oder OpenClaw, die eine neue Modelloption evaluieren
  • Entwickler, die offene Gewichte benötigen, aber Inferenz auf Serverinfrastruktur auslagern können

Weniger geeignet ist das Modell für Anwender, die ein schnelles lokales LLM auf einem MacBook, Mac mini oder normalen Desktop suchen. Dafür sind kleinere dichte Modelle oder kompakte MoE-Modelle erheblich realistischer.

Fazit: Große offene Gewichte, für Macs praktisch die API

LongCat-2.0 kombiniert 1,6 Billionen Gesamtparameter, rund 48 Milliarden aktive Parameter, eine Million Kontexttokens, eine offene MIT-Lizenz und eine direkte Ausrichtung auf Coding-Agenten. LongCat Sparse Attention, N-Gram-Embeddings und Multi-Token Prediction erweitern den Langkontext- und Inferenzpfad über eine reine Vergrößerung des Modells hinaus.

Die Benchmarks sind größtenteils Herstellerergebnisse, nicht unabhängig replizierte Praxiswerte. Für die meisten Macs ist LongCat-2.0 ein Cloud-API-Modell trotz offener MIT-Gewichte. Seit September 2026 existiert außerdem die separate LongCat-2.5-Preview mit Bildverständnis; sie ist ein Anlass für einen eigenen Test, nicht rückwirkend dasselbe Modell. Entscheidend für die Wahl bleiben Tool-Zuverlässigkeit, Latenz, tatsächliche Cache-Hits, Kosten und Sicherheit auf eigenen Aufgaben.

Wie viel Unified Memory ein so großes Modell real braucht, erklärt der RAM-Guide; realistische offene Alternativen listet das Open-Weight-Roundup.

Quellen

Weitere offizielle Links: GitHub Repository · Technischer Blog

Footnotes

  1. Meituan LongCat-2.0 Model Card ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10

  2. LongCat API Quick Start ↩ ↩2 ↩3 ↩4 ↩5 ↩6

  3. LongCat API Change Log ↩ ↩2 ↩3 ↩4

  4. LongCat-2.0 Pricing ↩ ↩2 ↩3

  5. LongCat-2.5-Preview Pricing ↩ ↩2

  6. LongCat-Flash-Chat Model Card ↩

  7. LongCat API FAQ ↩ ↩2 ↩3

  8. LongCat Claude Code Configuration ↩

Häufig gestellte Fragen

Steht LongCat-2.0 unter einer Open-Source-Lizenz?

Die Modellgewichte und Repository-Beiträge stehen laut offizieller Modellkarte unter der MIT-Lizenz. Präziser ist häufig der Begriff Open Weight, da nicht automatisch alle Trainingsdaten, Datenpipelines und internen Trainingssysteme vollständig veröffentlicht sind.

Wie viele Parameter hat LongCat-2.0?

Meituan nennt 1,6 Billionen Gesamtparameter und ungefähr 48 Milliarden aktivierte Parameter pro Token.

Wie groß ist das Kontextfenster?

Die LongCat API dokumentiert bis zu 1.000.000 Kontexttokens und maximal 128.000 Ausgabetokens.

Kann LongCat-2.0 auf einem Mac laufen?

Nicht sinnvoll als vollständiges Modell auf gewöhnlicher Mac-Hardware. Bereits vierbitquantisierte Gewichte würden theoretisch ungefähr 800 GB benötigen, bevor zusätzlicher Laufzeitbedarf berücksichtigt wird.

Unterstützt LongCat-2.0 Tool Calling?

Ja. Meituan beschreibt native Tool Calls, mehrstufiges Reasoning und Integrationen mit Claude Code, Hermes, OpenClaw, OpenCode und weiteren Agentenwerkzeugen.

Wie teuer ist die LongCat-2.0 API?

Am 8. Oktober 2026 nennt Meituan 0,75 / 0,015 / 2,95 USD je Million Tokens als regulären Uncached-/Cache-/Output-Tarif. Der befristete Rabatt lautet 0,30 / 0,006 / 1,20 USD. Ob der Rabatt noch gilt, entscheidet die aktuelle Plattformabrechnung.

Was ist der Unterschied zu LongCat-2.5-Preview?

LongCat-2.5-Preview ist seit 25. September 2026 als separate API-Modell-ID mit Bildverständnis verfügbar. LongCat-2.0 bleibt gelistet; seine veröffentlichten MIT-Gewichte sind nicht automatisch die Gewichte der 2.5-Preview.

Welche API-Formate werden unterstützt?

Die Plattform bietet OpenAI-kompatible Chat Completions und eine Anthropic-kompatible Messages API.

Mit KI recherchiert und geschrieben, Quellen angegeben, eigene Messungen gekennzeichnet. KI-Transparenz

Veröffentlicht: 20. Juli 2026 Aktualisiert: 8. Oktober 2026

Über den Autor