Claude Haiku 5.5: Luna-Preis mit 100k-Haken

Anthropic senkt den Preis seines kleinen Modells um 90 Prozent, aber nur bis 100.000 Tokens Prompt. Dazu kommen Breaking Changes und API-Credits im Abo.

Anthropic hat am 07.10.2026 Claude Haiku 5.5 veröffentlicht. Das kleine Modell kostet bei kurzen Prompts ein Zehntel des Vorgängers und liegt damit exakt auf dem Preis von OpenAIs GPT-6 Luna. Damit schließt Anthropic die Lücke, die nach dem Preiskampf vom 22.09.2026 am unteren Ende geblieben war. Der günstige Preis gilt allerdings nur bis 100.000 Tokens Prompt, und wer von Haiku 4.5 umsteigt, muss seinen Code an mehreren Stellen anfassen.

Preise und Eckdaten

Haiku 5.5 bis 100.000 TokensHaiku 5.5 darüberHaiku 4.5GPT-6 Luna
Input (pro 1 Mio. Tokens)0,10 $0,50 $1 $0,10 $
Output0,50 $2,50 $5 $0,50 $
Cache-Read0,01 $0,05 $0,10 $0,01 $

Preise laut den Preislisten von Anthropic und OpenAI, Stand 08.10.2026. Haiku 5.5 hat ein Kontextfenster von 1 Mio. Tokens, gibt bis zu 128.000 Tokens aus und hat den Wissensstand Juni 2026. Der Standard-Effort in der API ist medium. Anthropic sagt zu, das Modell nicht vor dem 07.10.2027 abzuschalten.

Der Haken bei 100.000 Tokens

Die Staffel richtet sich nach der Länge des Prompts. Überschreitet er 100.000 Tokens, kostet die Anfrage das Fünffache. Laut Anthropic lagen beim Vorgänger rund 90 Prozent aller Anfragen unter dieser Grenze, im Schnitt rechnet der Hersteller deshalb mit 75 Prozent Ersparnis.

Für einfache Klassifikation, Extraktion und Routing stimmt das. Für Agenten ist die Grenze enger, als sie klingt: Ein Sub-Agent, der in einer längeren Sitzung Dateien liest und Tool-Ergebnisse sammelt, schickt bei jedem Aufruf den ganzen bisherigen Verlauf mit. Sobald der über 100.000 Tokens wächst, zahlt jeder weitere Aufruf den höheren Satz.

Bei OpenAI ist die Staffel flacher. Simon Willison weist darauf hin, dass GPT-6 Luna erst ab 272.000 Tokens teurer wird und dann nur auf 0,20 und 0,75 Dollar steigt. Sein Urteil: "Above 100,000 tokens, Luna looks like a much better deal."

Dazu kommt der Tokenizer. Haiku 5.5 nutzt denselben wie die anderen aktuellen Claude-Modelle, und der zählt für denselben Text laut Anthropic rund 30 Prozent mehr Tokens als bei Haiku 4.5. Willison hat an einem langen Prompt den Faktor 1,25 gemessen und nennt das eine versteckte Preiserhöhung. Die Folgen sind überschaubar, aber real: Aus 90 Prozent Ersparnis werden rechnerisch etwa 87, und ein Prompt, der bei Haiku 4.5 noch 80.000 Tokens hatte, liegt jetzt über der Schwelle.

Was sich beim Umstieg ändert

Der Migration Guide listet zehn Punkte. Diese fünf treffen die meisten Integrationen, vier davon mit einem Fehler 400:

  • Thinking mit Budget geht nicht mehr. thinking: {"type": "enabled", "budget_tokens": N} wird abgelehnt. Haiku 5.5 denkt adaptiv, gesteuert über den Effort. Das ist standardmäßig an, eine Antwort kann also mit einem Thinking-Block beginnen. Code, der den ersten Block als Antwort liest, muss nach type auswählen.
  • Keine Sampling-Parameter. temperature, top_p und top_k sollen ganz entfallen. Abweichende Werte führen zum Fehler.
  • Kein Prefill. Eine vorbereitete Assistenten-Nachricht am Ende, die das Modell fortsetzen soll, wird abgelehnt. Der Ersatz für festes Ausgabeformat sind Structured Outputs oder Tools.
  • Computer Use braucht das neue Toolset. Auf der Claude API und bei Google Cloud wird computer_20250124 abgelehnt, nötig ist computer_toolset_20260801.
  • max_tokens neu einstellen. Thinking-Tokens zählen mit, und der Tokenizer zählt mehr. Ein knappes Limit aus Haiku-4.5-Zeiten kann dazu führen, dass die Antwort nach dem Nachdenken abbricht, bevor Text kommt.

Zwei weitere Punkte betreffen den Betrieb. Haiku 5.5 kann Anfragen über Sicherheitsklassifikatoren ablehnen (stop_reason: "refusal") und hat dafür keinen serverseitigen Fallback. Und der Priority Tier wird für Haiku 5.5 nicht unterstützt. Wer dort eine Zusage für Haiku 4.5 hat, muss die Kapazität separat planen.

Wie schon bei Sonnet 5.5 nimmt der Befehl /claude-api migrate in Claude Code die Änderungen im Code vor und erzeugt eine Checkliste für den Rest.

Eile ist nicht nötig. Haiku 4.5 ist weiter aktiv und nicht abgekündigt. Die Abkündigungsseite nennt als frühestes Abschaltdatum den 15.10.2026, Anthropic sagt aber mindestens 60 Tage Vorlauf zu.

Was das Modell kann

Die Benchmarks stammen alle von Anthropic. Auf OSWorld 2.1, einem Test für die Bedienung von Desktop-Oberflächen, kommt Haiku 5.5 auf 72,4 Prozent, Haiku 4.5 lag bei 15,7 und GPT-6 Luna bei 48,9. Auf Terminal-Bench 4.0 erreicht es 39,2 Prozent, Luna 16,4 und Sonnet 5.5 70,6.

Der letzte Wert zeigt die Grenze, und Anthropic benennt sie selbst: Für komplexes agentisches Coding seien Sonnet 5.5 und Opus 5.5 weiterhin die bessere Wahl. Haiku 5.5 sei für eng umrissene Aufgaben gedacht, etwa Zusammenfassungen, das Verdichten von Kontext, Datenbankabfragen und die Arbeit als Sub-Agent unter einem größeren Modell.

Bei Security-Themen ist Haiku 5.5 strenger als der Vorgänger. Penetrationstests bleiben laut Anthropic blockiert, defensive Aufgaben sind in größerem Umfang erlaubt als bei Sonnet 5.5.

Was am selben Tag noch kam

Sonnet 5.5 wird beim Caching billiger. Cache-Reads kosten dort jetzt 0,10 statt 0,20 Dollar pro Mio. Tokens. Das hilft vor allem Agenten, die denselben Kontext immer wieder mitschicken.

API-Credits in den Abos. Max- und Team-Pläne bekommen ein monatliches Guthaben für die Claude Platform: 100 Dollar bei Max 5x, 200 Dollar bei Max 20x und bis zu 500 Dollar bei Team, dort als gemeinsamer Topf. Die Credits gelten für alle Modelle. Laut Willison verfallen sie am Monatsende und müssen unter Settings > Billing aktiviert werden. Die Einführung läuft laut Anthropic im Lauf dieser Woche.

Verfügbarkeit. Haiku 5.5 läuft auf der Claude API, bei Amazon Bedrock, Google Cloud und in Microsoft Foundry. In GitHub Copilot steht es seit dem 07.10.2026 für Pro, Pro+, Max, Business und Enterprise bereit, abgerechnet zum Listenpreis des Anbieters.

Für wen sich der Umstieg lohnt

Wer Haiku 4.5 für kurze Massenaufgaben nutzt, spart mit dem Wechsel sofort den größten Teil der Rechnung. Den Umstieg vorher einmal gegen die Liste oben testen, dann ist er in einem Nachmittag erledigt.

Wer mit langen Prompts arbeitet, sollte erst messen, wie viele Anfragen über 100.000 Tokens liegen, und zwar mit dem neuen Tokenizer gezählt. Liegt ein großer Teil darüber, lohnt der Vergleich mit GPT-6 Luna oder der Versuch, den Kontext zu kürzen.

Und wer bisher alles mit Sonnet erledigt hat, weil Haiku 4.5 zu schwach war, hat jetzt einen Grund, einfache Schritte auszulagern. Zwischen Haiku 5.5 und Sonnet 5.5 liegt bei kurzen Prompts der Faktor 20. Wie man Aufgaben auf Modelle verteilt, steht im Artikel zum Modellrouter und in KI-Kosten im Team senken.

Quellen8