Kolibri: Aleph Alpha und die China-Frage

Aleph Alpha gibt Kolibri unter Apache 2.0 frei und misst zugleich die politische Schlagseite chinesischer Modelle. Was das für Self-Hosting-Teams heißt.

9 Min. Lesezeit

Aleph Alpha hat am 03.10.2026 mit Kolibri ein deutsch-englisches Sprachmodell veröffentlicht, dessen Gewichte unter Apache 2.0 auf Hugging Face liegen. Fünf Tage vorher erschien aus demselben Haus eine Untersuchung, die zeigt, wie stark chinesische Open-Weight-Modelle bei heiklen Themen die Linie der Kommunistischen Partei wiedergeben. Beides gehört zusammen: Die Studie liefert das Argument, das Modell soll die Antwort sein. Für Teams, die Modelle selbst betreiben, steckt in beiden Texten Brauchbares, und an einer Stelle auch ein Widerspruch.

Was Kolibri ist

Kolibri ist ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, von denen pro Token nur 3,46 Milliarden rechnen. Trainiert wurde es laut Aleph Alpha in Deutschland und Finnland auf 768 Nvidia-B200-GPUs, mit 20 Billionen Token im Vortraining und einem deutschen Anteil von gut einem Fünftel. Das Wissen reicht bis zum 18.06.2026.

Die Eckdaten aus der Modellkarte:

MerkmalKolibri-1
LizenzApache 2.0, ohne Zugangsbeschränkung
SprachenDeutsch und Englisch
Kontextbis 1.048.576 Token, empfohlen höchstens 262.144
Speicherbedarfrund 78 GB (FP8-Gewichte)
Mindesthardware2 x A100 80 GB, 2 x H100 oder 1 x H200, B200, B300
Reasoningvier Stufen (none, low, medium, high)
Tool-Callingja
BetriebvLLM mit dem Plugin aleph-alpha-inference, OpenAI-kompatible API

Der Speicherbedarf ist der Preis der Architektur. Weil nur ein kleiner Teil des Modells pro Token aktiv ist, läuft die Inferenz schnell und günstig, im Speicher liegen muss aber das ganze Modell. Auf einer Workstation oder einem Mac mit 64 GB läuft Kolibri in der veröffentlichten Form nicht. Wer es betreiben will, braucht Rechenzentrums-GPUs oder einen Hoster, der sie vermietet.

Wo Kolibri stark ist und wo nicht

Aleph Alpha vergleicht Kolibri im Tech-Report mit anderen offenen Modellen. Alle Zahlen stammen vom Hersteller, unabhängige Messungen gibt es einen Tag nach dem Release noch nicht. Der fairste Vergleich ist Qwen3.5 35B-A3B, weil es ebenfalls mit rund 3 Milliarden aktiven Parametern arbeitet:

BenchmarkKolibriQwen3.5 35B-A3B
Gesamtwert Englisch75,574,7
Gesamtwert Deutsch70,869,8
Tau3-Bench Banking (Agenten-Aufgaben)38,111,3
Tau2-Bench Airline76,776,0
BFCL v3 Multi-Turn (Tool-Calling)39,854,0
TerminalBench 2.1 (Coding im Terminal)27,739,7

Im Gesamtwert liegt Kolibri knapp vorn, bei Mathematik und bei den Banking-Aufgaben deutlich. Bei längeren Tool-Calling-Dialogen und beim Arbeiten im Terminal fällt es klar zurück. Als Motor für einen Coding-Agenten ist es nach den eigenen Zahlen des Herstellers nicht die erste Wahl. Und wer bereit ist, mehr Rechenleistung pro Token zu bezahlen, bekommt mit dem dichten Qwen3.8 27B auch auf Deutsch mehr: 79,9 gegenüber 70,8 Punkten.

Aleph Alpha positioniert das Modell entsprechend anders. Gedacht ist es für Verwaltung, Industrie und Luftfahrt, für Dokumentenarbeit, Fragen über eigene Bestände und Assistenzsysteme, bei denen ein Mensch das Ergebnis prüft. Die Modellkarte sagt ausdrücklich, dass Kolibri in Entscheidungssystemen auf die beratende Seite gehört. Dazu passt, dass es trainiert wurde, "I don't know" zu antworten, wenn die Antwort nicht im mitgegebenen Kontext steht.

Der eigentliche Unterschied zu Qwen, DeepSeek oder GLM liegt in der Herkunft. Aleph Alpha dokumentiert die Trainingsdaten, hat den EU-Verhaltenskodex für Allzweck-KI unterzeichnet und nennt sogar den Energieverbrauch des Trainings (rund 950 MWh). Für Teams, die eine Lieferkette nachweisen müssen, ist das mehr wert als zwei Benchmarkpunkte.

Parteilinie in offenen Gewichten

Am 28.09.2026 hat Aleph Alpha unter dem Titel Training on the Party Line einen eigenen Benchmark vorgestellt: 967 politisch heikle Prompts zu 56 von Hand ausgewählten Themen, darunter Tiananmen, Taiwan, Xinjiang und Hongkong. Ein Sprachmodell (GPT-OSS 120B) sortiert die Antworten in drei Gruppen: gibt die Position der KPCh wieder, ist ausgewogen, oder verweigert.

ModellKPCh-Linieausgewogenverweigert
Qwen 3.6 35B-A3B80 %17 %2,5 %
Qwen 3.8 2.4T-A95B62 %19 %19 %
DeepSeek R1 052877 %22 %0,8 %
DeepSeek V4 Pro16 %18 %66 %
Kimi K2.547 %37 %16 %
Kimi K340 %41 %19 %
Claude Sonnet 52,8 %70 %27 %
Mistral Small 26038 %92 %0,2 %

Zwei Beobachtungen sind über die Schlagzeile hinaus interessant. Erstens ändert sich zwischen den Modellgenerationen die Form, kaum der Anteil ausgewogener Antworten. DeepSeek V4 Pro behauptet viel seltener Parteipositionen als R1, verweigert dafür zwei Drittel der Fragen. Zweitens bleibt der Effekt nicht bei China-Themen. In einem zweiten Satz von 240 Prompts, die China gar nicht erwähnen, tauchten bei mehreren Modellen trotzdem Verweise auf chinesische Positionen auf, etwa bei der Frage nach Zensur in den USA.

Die Studie räumt eine Schwäche selbst ein: Ob ein Verweis auf geltendes Recht eine vernünftige Vorsicht oder eine politische Ausrichtung ist, entscheidet ein Sprachmodell als Richter, und der kann danebenliegen. Auch Claude Sonnet 5 verweigert 27 Prozent der Prompts. Andere politische Schlagseiten, etwa westliche, untersucht der Benchmark ausdrücklich nicht.

Die Schlagseite färbt ab

Am meisten Gewicht hat ein Ergebnis, das gar kein chinesisches Modell betrifft. Nvidias Nemotron Cascade 2 fiel bei 17 Prozent der Prompts auf. Aleph Alpha hat sich die von Nvidia veröffentlichten Feintuning-Daten angesehen und dort die wahrscheinliche Ursache gefunden: Die Chat-Daten wurden großteils mit DeepSeek und Qwen erzeugt, und rund 3.500 von 9,3 Millionen Zeilen enthielten Parteipositionen. Das ist ein Anteil von weniger als einem halben Promille, und er reichte, um im fertigen Modell sichtbar zu werden.

Das betrifft auch Kolibri. Im Tech-Report steht, dass Aleph Alpha seine synthetischen Trainingsdaten vor allem mit GLM-5.2, GLM-5.3 und Qwen3.8-27B erzeugt hat, also mit chinesischen Modellen. Der Report sagt das offen: "We acknowledge that several of our teacher models were built in China, so they carry known political biases on sensitive topics". Als Gegenmaßnahmen nennt er einen Filter, der Konversationen mit KPCh-Narrativen aus den Daten entfernt, eigene Frage-Antwort-Paare zu heiklen Themen und eine Trainingsumgebung, die ausgewogene Antworten belohnt.

Was fehlt, ist das Ergebnis. Weder die Studie noch der Tech-Report nennen einen Wert für Kolibri auf dem eigenen 967-Prompt-Benchmark. Das "souveräne" Modell ist also mit Hilfe genau der Modelle entstanden, vor denen die Studie warnt, und ob die Filter gewirkt haben, lässt sich von außen bisher nicht nachprüfen. Das macht Kolibri nicht schlechter als andere, die meisten Labs destillieren aus fremden Modellen. Es relativiert aber den Anspruch, die gesamte Lieferkette zu kontrollieren.

Was das für euch bedeutet

Die Studie stammt von einem Anbieter, der kurz darauf ein Konkurrenzprodukt veröffentlicht hat. Das sollte man beim Lesen im Kopf behalten, es entwertet die Messung aber nicht. Die Beispiele im Blogpost sind nachvollziehbar, und die Richtung deckt sich mit dem, was jeder selbst mit ein paar Fragen zu Taiwan ausprobieren kann.

Für die Praxis kommt es darauf an, wofür ein Modell eingesetzt wird. Wer ein chinesisches Open-Weight-Modell als Coding-Modell hinter einem Agenten betreibt, wird von dieser Schlagseite kaum etwas merken. Anders sieht es aus, sobald das Modell Texte über Politik, Geschichte, Menschenrechte oder internationale Lieferketten schreibt oder zusammenfasst: Pressespiegel, Bildungsinhalte, Recherche-Assistenten, Bürgeranfragen. Ein Modell, das dort dokumentierte Ereignisse bestreitet oder Anfragen still entschärft, liefert fachlich falsche Ergebnisse.

Wie man Modelle grundsätzlich nach Herkunft und Kontrolle einordnet, steht in Digitale Souveränität für KI-Teams. Zu Aleph Alphas Fusionsgesprächen mit Cohere haben wir im April berichtet.

Quellen4