Aleph Alpha Kolibri: Deutsches KI-Modell mit offenen Gewichten und Self-Hosting
Kolibri ist das neue Sprachmodell von Aleph Alpha für Deutsch und Englisch. Die offenen Gewichte und die Möglichkeit zum Self-Hosting machen es für Unternehmen interessant, die ihre KI-Verarbeitung selbst kontrollieren möchten. Für die Auswahl zählen aber auch Qualität im eigenen Workflow und die Anforderungen an den Betrieb.
Aleph Alpha hat Kolibri am 3. Oktober 2026 veröffentlicht. Diese Vorstellung ordnet die offiziellen Angaben und Modellvergleiche ein; sie enthält keinen eigenen Praxistest. Quellenstand: 5. Oktober 2026. Offizielle Veröffentlichung
Was ist Kolibri von Aleph Alpha?
Kolibri ist ein textbasiertes Mixture-of-Experts-Modell, kurz MoE. Dabei wird für jedes erzeugte Token nur ein Teil des Modells aktiviert. Das reduziert den Rechenaufwand gegenüber einer Architektur, die alle Parameter verwendet. Die vollständigen Gewichte müssen trotzdem im Speicher liegen. Modellkarte
| Eigenschaft | Kolibri 1 |
|---|---|
| Sprachen | Deutsch und Englisch |
| Parameter insgesamt | Rund 78 Milliarden |
| Aktive Parameter pro Token | Rund 3,46 Milliarden |
| Kontextfenster | Bis zu 1.048.576 Token; empfohlen höchstens 262.144 für effizienten Betrieb und komplexe Aufgaben |
| Fähigkeiten | Reasoning, Tool Calling, Textverarbeitung |
| Lizenz der Modellgewichte | Apache 2.0 |
Quelle: Offizielle Modellkarte von Aleph Alpha.
Für ein Unternehmen ist der Sprachfokus ein Anlass, Kolibri in die engere Auswahl aufzunehmen. Ob es interne Fachbegriffe, österreichische Formulierungen oder unvollständige Dokumente zuverlässig verarbeitet, muss eine eigene Evaluation zeigen. „Deutschsprachig“ ist dafür ein Ausgangspunkt, kein Qualitätsnachweis für jede Branche.
Wie schneidet Kolibri im Modellvergleich ab?
Die folgenden Diagramme stellen eine Auswahl der veröffentlichten Vergleichswerte von Aleph Alpha dar. Die Werte wurden unverändert übernommen und für diesen Artikel neu visualisiert. Es sind Hersteller-Benchmarks, keine unabhängigen Messungen. Alle Achsen beginnen bei null; höhere Werte sind besser.
Aleph Alpha verwendet eigene Evaluationsumgebungen und, soweit anwendbar, die höchste Reasoning-Stufe des jeweiligen Modells. Die Vergleichsmodelle unterscheiden sich in Größe und Architektur. Ein Gesamtwert fasst mehrere Aufgaben zusammen und ist keine Erfolgsquote für Ihren Geschäftsprozess. Benchmark-Tabelle und Methodik
Gesamtbewertung auf Deutsch und Englisch
Gesamtbewertung: Auswahl aus Aleph Alphas Post-Training-Benchmarks. Modellgröße und aktive Parameter stehen bei jedem Modell. Quelle: Aleph Alpha, 3. Oktober 2026.
Kolibri liegt in dieser Auswahl vor den gezeigten MoE-Vergleichsmodellen. Das dichte Modell Qwen3.8 27B erzielt höhere Gesamtwerte, aktiviert aber auch deutlich mehr Parameter pro Token. Daraus lässt sich weder der Speicherbedarf noch der Preis pro Anfrage unmittelbar ableiten. Vollständiger Vergleich
Meine Einordnung: Ein Modell kann attraktiv sein, ohne jede Rangliste anzuführen. Entscheidend ist, ob die gewünschte Qualität mit vertretbarer Latenz, Hardware und Betriebsaufwand erreichbar ist.
Deutsches Industrie-RAG
Bei Retrieval-Augmented Generation, kurz RAG, erhält das Modell passende Dokumentstellen als Grundlage für seine Antwort. Das macht diesen Vergleich für interne Wissenssysteme besonders interessant.
Durchschnitt der deutschen Industry-RAG-Aufgaben. Die Aufgaben sind interne Customer-Proxy-Benchmarks des Herstellers. Quelle: Kolibri Technical Report und Modellkarte.
Hier liegt Qwen3.5 vor Kolibri, obwohl Kolibri die höhere deutsche Gesamtbewertung erreicht. Die Rangfolge hängt also von der Aufgabe ab. Die Branchenaufgaben bilden vom Hersteller entwickelte Tests ab; sie belegen keine entsprechende Trefferquote für Ihre Dokumente. Technischer Bericht, Abschnitt 3.3.3
Für ein eigenes Wissenssystem bleiben Dokumentqualität, Suche und Zugriffsrechte zentral. Ein Modellwechsel behebt keine fehlenden Quellen oder falsch vergebenen Berechtigungen. Mehr dazu: RAG-Evaluation mit einem Golden Dataset.
Tool Calling über mehrere Dialogschritte
Tool Calling bedeutet, dass ein Modell Aufrufe von Funktionen oder APIs vorbereitet. Für Workflows ist relevant, ob das auch über mehrere Schritte konsistent funktioniert.
BFCL v4, Multi-Turn: ein einzelner Tool-Calling-Benchmark, keine allgemeine Agentenrangliste. Quelle: Aleph Alphas veröffentlichte Benchmark-Tabelle.
Dieser Vergleich zeigt eine Grenze: Kolibri führt bei dieser Aufgabe die dargestellte Auswahl nicht an. Wer einen mehrstufigen Agenten plant, sollte genau solche Fälle prüfen. Ein überzeugender Gesamtwert reicht als Entscheidungsgrundlage nicht aus. Veröffentlichte Tool-Calling-Ergebnisse
Kolibri selbst hosten: Was bedeutet das praktisch?
Kolibri kann auf eigener Infrastruktur betrieben werden. Aleph Alpha stellt dafür ein vLLM-Plugin und eine dokumentierte Inferenzumgebung bereit. Der Server lässt sich über eine OpenAI-kompatible Schnittstelle ansprechen. Reasoning kann pro Anfrage angepasst oder deaktiviert werden. Offizielles Inferenz-Repository
Für Unternehmen eröffnet das Kontrolle über Modellversion, Zugriffe und Betriebsumgebung. Es kann die Abhängigkeit von einem einzelnen Modellendpunkt verringern. Dafür übernimmt das Unternehmen auch Verantwortung für Kapazität, Updates, Monitoring und Ausfallsicherheit.
3,46 Milliarden aktive Parameter machen Kolibri nicht zu einem kleinen lokalen Modell. Die Modellkarte nennt rund 78 GB für die FP8-Gewichte allein und als unterstützte Mindestkonfigurationen beispielsweise zwei A100 mit je 80 GB oder eine H200. Laufzeitbedarf, Kontext und parallele Anfragen kommen hinzu. Die veröffentlichten Anforderungen beziehen sich auf den dokumentierten FP8-Betrieb; daraus folgt keine bestätigte Kompatibilität mit beliebigen Desktop-LLM-Apps. Hardwareangaben
Für welche Unternehmen ist Kolibri interessant?
Ich würde Kolibri näher prüfen, wenn bereits ein konkreter deutschsprachiger Dokumenten- oder Wissensprozess besteht und ein kontrollierter eigener Betrieb einen nachvollziehbaren Nutzen hat. Denkbare Anwendungen sind interne Recherche, Dokumententwürfe und die strukturierte Aufbereitung von Informationen. Diese Beispiele sind mögliche Einsatzfelder, keine von mir gemessenen Ergebnisse.
Für einen kleinen Einstieg lohnt sich zuerst die Frage, ob vorhandene Infrastruktur und Betriebswissen ausreichen. Ein großes Kontextfenster allein rechtfertigt keine umfangreiche GPU-Anschaffung. Wenn ein kleineres Modell die Aufgabe bereits zuverlässig erledigt, kann dessen Betrieb wirtschaftlicher sein.
Mein nächster Schritt wäre ein begrenzter Vergleich mit eigenen Beispielen: vollständige Dokumente, fehlende Antworten und fehleranfällige Tool-Aufrufe. Dabei sollten Ergebnisqualität, Antwortzeit und Betriebsaufwand gemeinsam bewertet werden. Kolibri gehört auf die Prüfliste; eine pauschale Ablösung vorhandener Modelle lässt sich aus den Hersteller-Benchmarks nicht begründen.
Häufige Fragen zu Kolibri
Was ist Aleph Alpha Kolibri?
Kolibri ist ein auf Deutsch und Englisch ausgerichtetes Sprachmodell von Aleph Alpha. Es verwendet eine Mixture-of-Experts-Architektur und unterstützt Reasoning sowie Tool Calling.
Kann man Kolibri selbst hosten?
Ja. Die Modellgewichte sind unter Apache 2.0 verfügbar. Aleph Alpha dokumentiert den Betrieb über vLLM mit einem eigenen Plugin. Für die FP8-Version nennt die Modellkarte etwa 78 GB Speicher allein für die Gewichte.
Ist Kolibri besser als Qwen, Gemma oder Mistral?
Das hängt von der Aufgabe ab. Die veröffentlichten Hersteller-Benchmarks zeigen Stärken und Schwächen. Sie ersetzen keinen Vergleich mit eigenen Dokumenten, Qualitätskriterien und Betriebsanforderungen.