Stand: 7. Oktober 2026
Anthropic hat Claude Haiku 5.5 am 7. Oktober 2026 veröffentlicht. Das neue kleine Claude-Modell richtet sich vor allem an hochvolumige und latenzkritische Aufgaben wie Klassifizierung, Extraktion, Routing, Zusammenfassungen und Subagent-Workloads.
Die wichtigsten Eckdaten: 1 Million Tokens Kontext, bis zu 128.000 reguläre Output-Tokens, Adaptive Thinking und API-Preise ab $0,10 pro Million Input-Tokens sowie $0,50 pro Million Output-Tokens. Die offizielle API-Modell-ID lautet claude-haiku-5-5.
Claude Haiku 5.5 ist wesentlich günstiger als Haiku 4.5 und gleichzeitig deutlich stärker ausgestattet. Die niedrigen $0,10/$0,50-Preise gelten allerdings nur für Prompts bis einschließlich 100.000 Tokens. Bei längeren Prompts greift eine höhere Preisstufe.
Claude Haiku 5.5 auf einen Blick
| Merkmal | Claude Haiku 5.5 |
|---|---|
| Veröffentlichung | 7. Oktober 2026 |
| Claude-API-ID | claude-haiku-5-5 |
| Kontextfenster | 1.000.000 Tokens |
| Max. regulärer Output | 128.000 Tokens |
| Batch-Output | bis zu 300.000 Tokens, Beta |
| Thinking | Adaptive Thinking |
| Standard-Effort | medium |
| Input bis 100K Prompt-Tokens | $0,10 / MTok |
| Output bis 100K Prompt-Tokens | $0,50 / MTok |
| Input über 100K Prompt-Tokens | $0,50 / MTok |
| Output über 100K Prompt-Tokens | $2,50 / MTok |
| Cache Read bis 100K | $0,01 / MTok |
| Batch API | 50 % Rabatt auf Input und Output |
| Wissens-Cutoff | Juni 2026 |
Die größte Änderung ist der Preis
Claude Haiku 4.5 kostete laut Anthropic $1 pro Million Input-Tokens und $5 pro Million Output-Tokens. Haiku 5.5 reduziert diese Listenpreise bei Prompts bis 100.000 Tokens auf $0,10 Input und $0,50 Output.
Rein nominal entspricht das einer Preissenkung von 90 Prozent pro Token.
Beispielrechnung: 5 Millionen Input + 1 Million Output
Für einen Workload mit insgesamt fünf Millionen Input-Tokens und einer Million Output-Tokens, bei dem jede Anfrage unter 100.000 Prompt-Tokens bleibt:
- Haiku 4.5: 5 × $1 + 1 × $5 = $10
- Haiku 5.5: 5 × $0,10 + 1 × $0,50 = $1
Das ist ein nomineller Unterschied von 90 Prozent.
Anthropic selbst spricht für typische Aufgaben von ungefähr 75 Prozent niedrigeren Laufkosten gegenüber Haiku 4.5. Diese Angabe ist plausibel niedriger als die reine Tokenpreis-Differenz, weil Haiku 5.5 einen neueren Tokenizer verwendet und identischer Text laut Dokumentation ungefähr 30 Prozent mehr Tokens erzeugen kann als bei Haiku 4.5.
Für echte Kostenvergleiche sollte deshalb Cost per Successful Task gemessen werden, nicht nur der Listenpreis pro Million Tokens.
Zwei Preisstufen statt eines einheitlichen Haiku-Preises
Die günstigen $0,10/$0,50-Preise gelten nur, solange der Prompt höchstens 100.000 Tokens enthält.
Bei längeren Prompts steigt der Preis auf:
- $0,50 / MTok Input
- $2,50 / MTok Output
- $0,05 / MTok Cache Read
Das ist für Long-Context-Anwendungen entscheidend. Haiku 5.5 bietet zwar ein Kontextfenster von einer Million Tokens, aber ein 500K-Prompt wird nicht zum gleichen Preis abgerechnet wie ein kleiner 20K-Prompt.
Kontextfenster: 200K werden zu 1M
Das Kontextfenster wächst gegenüber Haiku 4.5 von 200.000 auf 1.000.000 Tokens – also auf das Fünffache. Gleichzeitig verdoppelt sich der reguläre maximale Output von 64K auf 128K Tokens.
Diese Kombination macht Haiku 5.5 besonders interessant für:
- große Dokumente,
- Retrieval- und RAG-Systeme,
- Code-Repositories,
- lange Agenten-Historien,
- Kontextkomprimierung,
- große Mengen wiederkehrender Daten.
Die Batch API kann laut Dokumentation in einer Beta-Konfiguration sogar bis zu 300K Output-Tokens unterstützen.
Adaptive Thinking kommt zu Haiku
Haiku 5.5 unterstützt Anthropics aktuelles Adaptive Thinking. Standardmäßig verwendet das Modell den Effort-Level medium.
Statt für jeden Prompt ein fixes Reasoning-Budget festzulegen, kann das Modell abhängig von der Aufgabe mehr oder weniger Denkaufwand verwenden. Das ist besonders interessant für Agentensysteme: einfache Klassifizierungen benötigen wenig Reasoning, während schwierigere Tool- oder Coding-Schritte mehr Rechenarbeit bekommen können.
Für Migrationen ist das relevant, weil Anwendungen, die bei älteren Claude-Versionen manuelles Extended Thinking oder budget_tokens voraussetzen, angepasst werden müssen.
Haiku 5.5 wird für High-Volume-Agenten positioniert
Anthropic beschreibt Haiku 5.5 ausdrücklich als Modell für high-volume, latency-sensitive tasks. Dazu gehören unter anderem:
- Klassifizierung
- Extraktion
- Routing
- Zusammenfassung
- Datenbankabfragen
- Live Support
- In-App-Assistenten
- Voice Agents
- Kontextkomprimierung
- Subagent-Aufgaben
Das ist strategisch wichtiger als die Frage, ob Haiku 5.5 in jedem Benchmark Sonnet erreicht. Ein günstiger Agent-Worker muss nicht alle komplexen Aufgaben lösen. Er muss möglichst viele einfache bis mittlere Aufgaben zuverlässig und kosteneffizient abarbeiten und schwierige Fälle an ein stärkeres Modell eskalieren.
Benchmarks: großer Sprung, aber Launch-Zahlen richtig einordnen
Anthropic veröffentlicht zum Launch deutliche Verbesserungen gegenüber Haiku 4.5. Zwei besonders auffällige Werte sind:
| Benchmark | Haiku 5.5 | Haiku 4.5 |
|---|---|---|
| OSWorld 2.1, ausgewiesenes Offline-Subset | 72,4 % | 15,7 % |
| Terminal-Bench 4.0 | 39,2 % | 0,0 % |
Diese Zahlen sprechen für einen großen Fortschritt bei Computer Use und agentischem Coding. Sie sollten am Veröffentlichungstag trotzdem nicht als endgültiges unabhängiges Urteil behandelt werden.
Die Benchmarks selbst stammen aus extern entwickelten Evaluationssystemen; die hier ausgewiesenen Haiku-5.5-Ergebnisse werden jedoch zum Launch primär von Anthropic kommuniziert. Umfangreiche unabhängige Reruns auf identischen Einstellungen fehlen unmittelbar nach Veröffentlichung naturgemäß noch.
Was diese Zahlen noch nicht beantworten
Synthetische Benchmarkwerte sagen wenig darüber aus:
- wie viele Tool Calls eine Aufgabe benötigt,
- wie oft ein Agent Schleifen produziert,
- wie stabil lange Runs sind,
- wie hoch die reale Tokens-per-Second-Rate ist,
- wie gut Prompt Caching in deinem konkreten Workflow greift,
- wie häufig ein stärkeres Modell als Fallback benötigt wird,
- was eine tatsächlich gelöste Aufgabe am Ende kostet.
Für Agentensysteme ist daher Cost per Successful Task die wichtigere Zielgröße.
Prompt Caching kann extrem günstig werden
Bei kleinen Prompts kostet ein Cache Read nur $0,01 pro Million Tokens. Bei wiederkehrenden Kontextblöcken kann das einen erheblichen Unterschied machen.
Typische Kandidaten sind:
- große Systemprompts,
- Projektregeln,
- statische Dokumentation,
- wiederkehrende Repository-Kontexte,
- lange Agent-Grundkontexte.
Für Anwendungen mit hohem Cache-Hit-Anteil kann der effektive Inputpreis dadurch weit unter dem regulären Preis liegen.
Migration von Haiku 4.5: nicht nur die Modell-ID austauschen
Beim Wechsel auf Haiku 5.5 sollten bestehende Integrationen getestet werden.
Anthropic weist unter anderem auf folgende Änderungen hin:
- Modell-ID auf
claude-haiku-5-5ändern. - Manuelles Extended Thinking auf Adaptive Thinking umstellen.
- Nicht unterstützte Sampling-Parameter entfernen.
- Assistant Prefill nicht voraussetzen.
- Antwortblöcke robuster parsen.
- Computer-Use-Toolsets prüfen.
- Tokenlimits und Kosten wegen des neuen Tokenizers neu messen.
Gerade der letzte Punkt ist für Kosten-Dashboards relevant: eine Anwendung, die Tokenmengen anhand von Haiku-4.5-Verhältnissen schätzt, kann bei Haiku 5.5 systematisch danebenliegen.
Wo ist Claude Haiku 5.5 verfügbar?
Anthropic führt das Modell für:
- Claude Platform
- Amazon Bedrock
- Google Cloud
- Microsoft Foundry
- Claude Platform on AWS
Die Modellbezeichner unterscheiden sich teilweise je nach Plattform. In der Claude API lautet die ID claude-haiku-5-5.
Da es sich um einen Launch vom 7. Oktober 2026 handelt, können einzelne Partnerseiten oder SDK-Listen zeitweise hinter Anthropics eigener Dokumentation zurückliegen.
Haiku 5.5 vs. Haiku 4.5
| Kategorie | Haiku 4.5 | Haiku 5.5 |
|---|---|---|
| Kontext | 200K | 1M |
| Max. Output | 64K | 128K |
| Thinking | Extended | Adaptive |
| Inputpreis, kleine Prompts | $1/MTok | $0,10/MTok |
| Outputpreis, kleine Prompts | $5/MTok | $0,50/MTok |
| Cache Read | $0,10/MTok | ab $0,01/MTok |
| Schwerpunkt | schnelles kleines Claude | High-Volume, Routing, Subagents |
| Tokenizer | ältere Generation | neuer, ca. 30 % mehr Tokens für gleichen Text laut Anthropic |
Haiku 5.5 ist damit nicht einfach eine kleine Versionspflege. Anthropic verändert gleichzeitig Preisstruktur, Kontextfenster, Thinking-System, Tokenizer und Agent-Positionierung.
Für wen lohnt sich Claude Haiku 5.5?
Besonders interessant
Haiku 5.5 wirkt stark für Workloads, bei denen sehr viele Modellaufrufe stattfinden:
- AI-Agenten
- Multi-Agent-Systeme
- Coding-Subagents
- Support-Automatisierung
- E-Mail- und Dokumentklassifizierung
- Extraktion strukturierter Daten
- Zusammenfassung
- RAG
- Routing
- Browser- und Computer-Use-Teilaufgaben
Weniger eindeutig
Für lange, komplexe und offene Coding-Aufgaben bleibt ein stärkeres Sonnet- oder Opus-Modell oft sinnvoller. Der entscheidende Vorteil von Haiku 5.5 ist weniger „maximale Intelligenz“ als das Verhältnis aus Preis, Latenz und ausreichend hoher Erfolgsquote.
Fazit: 1M Kontext und niedrigere Preise für Agenten-Workloads
Claude Haiku 5.5 ist einer der größten Sprünge innerhalb der Haiku-Reihe: 1M Kontext, Adaptive Thinking, deutlich stärkere veröffentlichte Benchmarks und API-Preise ab $0,10/$0,50 pro Million Tokens.
Für kleine Prompts sinkt der nominelle Tokenpreis gegenüber Haiku 4.5 um 90 Prozent. Realistischere Task-Kosten fallen wegen des neuen Tokenizers und unterschiedlicher Workloads weniger extrem aus; Anthropic spricht von ungefähr 75 Prozent niedrigeren durchschnittlichen Laufkosten.
Für Agenten- und API-Workloads ist Haiku 5.5 deshalb besonders interessant. Ob es tatsächlich das beste Preis-Leistungs-Verhältnis liefert, lässt sich jedoch erst durch identische reale Workloads beantworten.
Was AI on Mac als Nächstes testen sollte
Ein sinnvoller eigener Benchmark sollte Haiku 5.5 mit Haiku 4.5 und einem stärkeren Claude-Modell auf denselben Agent-Aufgaben vergleichen und mindestens folgende Werte messen:
- Erfolgsquote
- Gesamttokens
- Cache-Read-Tokens
- Tool Calls
- Latenz
- Fehlversuche
- Eskalationen auf stärkere Modelle
- Kosten pro erfolgreich gelöster Aufgabe
Genau daraus entsteht ein Vergleich, den eine einfache Launch-Zusammenfassung nicht ersetzen kann.
Transparenz
Quellen und Prüfgrundlage
Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.