Kolibri: Aleph Alpha und die China-Frage
Aleph Alpha gibt Kolibri unter Apache 2.0 frei und misst zugleich die politische Schlagseite chinesischer Modelle. Was das für Self-Hosting-Teams heißt.
Aleph Alpha hat am 03.10.2026 mit Kolibri ein deutsch-englisches Sprachmodell veröffentlicht, dessen Gewichte unter Apache 2.0 auf Hugging Face liegen. Fünf Tage vorher erschien aus demselben Haus eine Untersuchung, die zeigt, wie stark chinesische Open-Weight-Modelle bei heiklen Themen die Linie der Kommunistischen Partei wiedergeben. Beides gehört zusammen: Die Studie liefert das Argument, das Modell soll die Antwort sein. Für Teams, die Modelle selbst betreiben, steckt in beiden Texten Brauchbares, und an einer Stelle auch ein Widerspruch.
Was Kolibri ist
Kolibri ist ein Mixture-of-Experts-Modell mit 78,1 Milliarden Parametern, von denen pro Token nur 3,46 Milliarden rechnen. Trainiert wurde es laut Aleph Alpha in Deutschland und Finnland auf 768 Nvidia-B200-GPUs, mit 20 Billionen Token im Vortraining und einem deutschen Anteil von gut einem Fünftel. Das Wissen reicht bis zum 18.06.2026.
Die Eckdaten aus der Modellkarte:
| Merkmal | Kolibri-1 |
|---|---|
| Lizenz | Apache 2.0, ohne Zugangsbeschränkung |
| Sprachen | Deutsch und Englisch |
| Kontext | bis 1.048.576 Token, empfohlen höchstens 262.144 |
| Speicherbedarf | rund 78 GB (FP8-Gewichte) |
| Mindesthardware | 2 x A100 80 GB, 2 x H100 oder 1 x H200, B200, B300 |
| Reasoning | vier Stufen (none, low, medium, high) |
| Tool-Calling | ja |
| Betrieb | vLLM mit dem Plugin aleph-alpha-inference, OpenAI-kompatible API |
Der Speicherbedarf ist der Preis der Architektur. Weil nur ein kleiner Teil des Modells pro Token aktiv ist, läuft die Inferenz schnell und günstig, im Speicher liegen muss aber das ganze Modell. Auf einer Workstation oder einem Mac mit 64 GB läuft Kolibri in der veröffentlichten Form nicht. Wer es betreiben will, braucht Rechenzentrums-GPUs oder einen Hoster, der sie vermietet.
Wo Kolibri stark ist und wo nicht
Aleph Alpha vergleicht Kolibri im Tech-Report mit anderen offenen Modellen. Alle Zahlen stammen vom Hersteller, unabhängige Messungen gibt es einen Tag nach dem Release noch nicht. Der fairste Vergleich ist Qwen3.5 35B-A3B, weil es ebenfalls mit rund 3 Milliarden aktiven Parametern arbeitet:
| Benchmark | Kolibri | Qwen3.5 35B-A3B |
|---|---|---|
| Gesamtwert Englisch | 75,5 | 74,7 |
| Gesamtwert Deutsch | 70,8 | 69,8 |
| Tau3-Bench Banking (Agenten-Aufgaben) | 38,1 | 11,3 |
| Tau2-Bench Airline | 76,7 | 76,0 |
| BFCL v3 Multi-Turn (Tool-Calling) | 39,8 | 54,0 |
| TerminalBench 2.1 (Coding im Terminal) | 27,7 | 39,7 |
Im Gesamtwert liegt Kolibri knapp vorn, bei Mathematik und bei den Banking-Aufgaben deutlich. Bei längeren Tool-Calling-Dialogen und beim Arbeiten im Terminal fällt es klar zurück. Als Motor für einen Coding-Agenten ist es nach den eigenen Zahlen des Herstellers nicht die erste Wahl. Und wer bereit ist, mehr Rechenleistung pro Token zu bezahlen, bekommt mit dem dichten Qwen3.8 27B auch auf Deutsch mehr: 79,9 gegenüber 70,8 Punkten.
Aleph Alpha positioniert das Modell entsprechend anders. Gedacht ist es für Verwaltung, Industrie und Luftfahrt, für Dokumentenarbeit, Fragen über eigene Bestände und Assistenzsysteme, bei denen ein Mensch das Ergebnis prüft. Die Modellkarte sagt ausdrücklich, dass Kolibri in Entscheidungssystemen auf die beratende Seite gehört. Dazu passt, dass es trainiert wurde, "I don't know" zu antworten, wenn die Antwort nicht im mitgegebenen Kontext steht.
Der eigentliche Unterschied zu Qwen, DeepSeek oder GLM liegt in der Herkunft. Aleph Alpha dokumentiert die Trainingsdaten, hat den EU-Verhaltenskodex für Allzweck-KI unterzeichnet und nennt sogar den Energieverbrauch des Trainings (rund 950 MWh). Für Teams, die eine Lieferkette nachweisen müssen, ist das mehr wert als zwei Benchmarkpunkte.
Parteilinie in offenen Gewichten
Am 28.09.2026 hat Aleph Alpha unter dem Titel Training on the Party Line einen eigenen Benchmark vorgestellt: 967 politisch heikle Prompts zu 56 von Hand ausgewählten Themen, darunter Tiananmen, Taiwan, Xinjiang und Hongkong. Ein Sprachmodell (GPT-OSS 120B) sortiert die Antworten in drei Gruppen: gibt die Position der KPCh wieder, ist ausgewogen, oder verweigert.
| Modell | KPCh-Linie | ausgewogen | verweigert |
|---|---|---|---|
| Qwen 3.6 35B-A3B | 80 % | 17 % | 2,5 % |
| Qwen 3.8 2.4T-A95B | 62 % | 19 % | 19 % |
| DeepSeek R1 0528 | 77 % | 22 % | 0,8 % |
| DeepSeek V4 Pro | 16 % | 18 % | 66 % |
| Kimi K2.5 | 47 % | 37 % | 16 % |
| Kimi K3 | 40 % | 41 % | 19 % |
| Claude Sonnet 5 | 2,8 % | 70 % | 27 % |
| Mistral Small 2603 | 8 % | 92 % | 0,2 % |
Zwei Beobachtungen sind über die Schlagzeile hinaus interessant. Erstens ändert sich zwischen den Modellgenerationen die Form, kaum der Anteil ausgewogener Antworten. DeepSeek V4 Pro behauptet viel seltener Parteipositionen als R1, verweigert dafür zwei Drittel der Fragen. Zweitens bleibt der Effekt nicht bei China-Themen. In einem zweiten Satz von 240 Prompts, die China gar nicht erwähnen, tauchten bei mehreren Modellen trotzdem Verweise auf chinesische Positionen auf, etwa bei der Frage nach Zensur in den USA.
Die Studie räumt eine Schwäche selbst ein: Ob ein Verweis auf geltendes Recht eine vernünftige Vorsicht oder eine politische Ausrichtung ist, entscheidet ein Sprachmodell als Richter, und der kann danebenliegen. Auch Claude Sonnet 5 verweigert 27 Prozent der Prompts. Andere politische Schlagseiten, etwa westliche, untersucht der Benchmark ausdrücklich nicht.
Die Schlagseite färbt ab
Am meisten Gewicht hat ein Ergebnis, das gar kein chinesisches Modell betrifft. Nvidias Nemotron Cascade 2 fiel bei 17 Prozent der Prompts auf. Aleph Alpha hat sich die von Nvidia veröffentlichten Feintuning-Daten angesehen und dort die wahrscheinliche Ursache gefunden: Die Chat-Daten wurden großteils mit DeepSeek und Qwen erzeugt, und rund 3.500 von 9,3 Millionen Zeilen enthielten Parteipositionen. Das ist ein Anteil von weniger als einem halben Promille, und er reichte, um im fertigen Modell sichtbar zu werden.
Das betrifft auch Kolibri. Im Tech-Report steht, dass Aleph Alpha seine synthetischen Trainingsdaten vor allem mit GLM-5.2, GLM-5.3 und Qwen3.8-27B erzeugt hat, also mit chinesischen Modellen. Der Report sagt das offen: "We acknowledge that several of our teacher models were built in China, so they carry known political biases on sensitive topics". Als Gegenmaßnahmen nennt er einen Filter, der Konversationen mit KPCh-Narrativen aus den Daten entfernt, eigene Frage-Antwort-Paare zu heiklen Themen und eine Trainingsumgebung, die ausgewogene Antworten belohnt.
Was fehlt, ist das Ergebnis. Weder die Studie noch der Tech-Report nennen einen Wert für Kolibri auf dem eigenen 967-Prompt-Benchmark. Das "souveräne" Modell ist also mit Hilfe genau der Modelle entstanden, vor denen die Studie warnt, und ob die Filter gewirkt haben, lässt sich von außen bisher nicht nachprüfen. Das macht Kolibri nicht schlechter als andere, die meisten Labs destillieren aus fremden Modellen. Es relativiert aber den Anspruch, die gesamte Lieferkette zu kontrollieren.
Was das für euch bedeutet
Die Studie stammt von einem Anbieter, der kurz darauf ein Konkurrenzprodukt veröffentlicht hat. Das sollte man beim Lesen im Kopf behalten, es entwertet die Messung aber nicht. Die Beispiele im Blogpost sind nachvollziehbar, und die Richtung deckt sich mit dem, was jeder selbst mit ein paar Fragen zu Taiwan ausprobieren kann.
Für die Praxis kommt es darauf an, wofür ein Modell eingesetzt wird. Wer ein chinesisches Open-Weight-Modell als Coding-Modell hinter einem Agenten betreibt, wird von dieser Schlagseite kaum etwas merken. Anders sieht es aus, sobald das Modell Texte über Politik, Geschichte, Menschenrechte oder internationale Lieferketten schreibt oder zusammenfasst: Pressespiegel, Bildungsinhalte, Recherche-Assistenten, Bürgeranfragen. Ein Modell, das dort dokumentierte Ereignisse bestreitet oder Anfragen still entschärft, liefert fachlich falsche Ergebnisse.
Wie man Modelle grundsätzlich nach Herkunft und Kontrolle einordnet, steht in Digitale Souveränität für KI-Teams. Zu Aleph Alphas Fusionsgesprächen mit Cohere haben wir im April berichtet.
Quellen4
- Aleph Alpha: Kolibri has landed, a sovereign open-weight model (03.10.2026)aleph-alpha.com
- Hugging Face: Aleph-Alpha/Kolibri-1, Modellkarte (abgerufen 04.10.2026)huggingface.co
- Aleph Alpha: Kolibri Tech Report (PDF, abgerufen 04.10.2026)aleph-alpha.com
- Aleph Alpha: Training on the Party Line (28.09.2026)aleph-alpha.com