Aleph Alpha veröffentlicht Kolibri-1 mit Fokus auf Deutsch und lange Dokumente

Aleph Alpha veröffentlicht Kolibri-1 mit Fokus auf Deutsch und lange Dokumente

Aleph Alpha hat mit Kolibri-1 ein neues deutsch-englisches KI-Sprachmodell vorgestellt. Das Open-Weights-Modell soll insbesondere bei der Verarbeitung sehr langer Dokumente, bei Retrieval-Augmented Generation (RAG) und beim Einsatz externer Werkzeuge punkten. Mit insgesamt 78 Milliarden Parametern setzt Kolibri-1 auf eine Mixture-of-Experts-Architektur, um den Rechenaufwand während der Nutzung zu begrenzen.

Kolibri-1 wurde mit 20 Billionen Tokens trainiert

Für das grundlegende Training von Kolibri-1 kamen nach Angaben des Unternehmens rund 20 Billionen Tokens zum Einsatz. Der gefilterte zweisprachige Datensatz kombiniert Webinhalte, synthetische Umformulierungen und weitere hochwertige Datenquellen.

Weitere 3,44 Billionen Tokens wurden während einer sogenannten Mid-Training-Phase verarbeitet. Für die Erweiterung der Kontextlänge kamen zusätzlich 201 Milliarden Tokens zum Einsatz.

Der Trainingsdatensatz besteht laut technischer Dokumentation zu rund 62,5 Prozent aus englischsprachigen Inhalten. Deutsch macht 23,9 Prozent aus, weitere 13,6 Prozent entfallen auf Programmcode. Damit richtet sich das Modell ausdrücklich auch an deutschsprachige Anwendungsszenarien.

Kontextfenster von mehr als einer Million Tokens getestet

Beim Pretraining arbeitete Kolibri-1 zunächst mit Sequenzen von 16.384 Tokens. Während des Mid-Trainings wurde dieser Wert auf 65.536 Tokens erhöht. Das finale Training erfolgte mit einer nativen Kontextlänge von 262.144 Tokens.

Nach Angaben der Entwickler lässt sich das Modell theoretisch ohne Position Scaling noch darüber hinaus einsetzen. Validiert wurde die Leistungsfähigkeit bis zu einer Kontextlänge von 1.048.576 Tokens.

Eine derart große Kontextkapazität ist vor allem für Unternehmen und Behörden interessant, die umfangreiche Dokumentensammlungen, technische Unterlagen oder lange Berichte automatisiert analysieren wollen.

Mixture-of-Experts soll Rechenaufwand reduzieren

Kolibri-1 verfügt über 50 Transformer-Layer. In jedem Layer stehen 384 Experten innerhalb der Mixture-of-Experts-Architektur zur Verfügung.

Ein Experte wird dabei für sämtliche Tokens aktiviert, während pro Token sechs weitere Experten hinzugeschaltet werden. Dadurch sind trotz insgesamt 78 Milliarden Parametern jeweils nur rund 3,46 Milliarden Parameter aktiv.

Dieser Ansatz reduziert den Rechenaufwand während der Inferenz deutlich. Einen Nachteil gibt es allerdings: Das vollständige Modell muss weiterhin im Speicher gehalten werden. Entsprechend hoch fallen die Hardware- und Hosting-Anforderungen aus.

Reasoning und Tool Calling integriert

Kolibri-1 bietet einen eigenen Reasoning-Modus. Nutzer können zwischen niedrigem, mittlerem und hohem Denkaufwand wählen oder die Reasoning-Funktion vollständig deaktivieren.

Darüber hinaus unterstützt das Sprachmodell Tool Calling. Damit kann es beispielsweise strukturierte Informationen extrahieren, Daten über Programmierschnittstellen abrufen oder Code ausführen.

Für diese Fähigkeiten entwickelten die Verantwortlichen spezielle Trainingsdatensätze für Retrieval-Augmented Generation, agentisches Tool Calling und die Verarbeitung langer Dokumente. Die Datensätze wurden sowohl für deutsche als auch für englische Inhalte erstellt.

Training auf 768 Nvidia-B200-GPUs

Der Trainingsaufwand für Kolibri-1 war erheblich. Nach Angaben der Entwickler wurden einschließlich der Leistungsaufnahme der Nodes und des Rechenzentrums-Overheads schätzungsweise 950 Megawattstunden Energie benötigt.

Allein das Pretraining lief über einen Zeitraum von 21 Tagen auf 768 Nvidia-B200-GPUs, verteilt auf insgesamt 96 HGX-Nodes.

Apache-2.0-Lizenz ermöglicht breite Nutzung

Aleph Alpha veröffentlichte Kolibri-1 am 3. Oktober 2026 unter der Apache-2.0-Lizenz. Als mögliche Einsatzgebiete nennt das Unternehmen unter anderem Chatbots, automatisierte Dokumentenverarbeitung und RAG-Systeme.

Die offene Lizenz ermöglicht grundsätzlich auch kommerzielle Anwendungen und dürfte damit die Nutzung des Modells in Unternehmen und bei Entwicklern erleichtern. Aufgrund der Größe des Modells bleiben die technischen Anforderungen für den eigenständigen Betrieb allerdings beträchtlich.

Aleph Alpha nach Übernahme durch Cohere

Die Veröffentlichung erfolgt vor dem Hintergrund der Übernahme von Aleph Alpha durch das kanadische KI-Unternehmen Cohere. Bundesdigitalminister Karsten Wildberger (CDU) hatte die Verbindung der beiden Unternehmen am 24. April 2026 mit den Worten kommentiert: „So entsteht eine echte Alternative – made in Germany, made in Canada.“

Eine wichtige Rolle bei der technischen Infrastruktur sollen die Rechenzentren von Schwarz Digits spielen. Sie sollen Infrastruktur für den Einsatz der KI-Systeme von Cohere bereitstellen. Schwarz Digits hält zudem einen Anteil von mehr als 20 Prozent an Aleph Alpha und zählt damit zu den wichtigsten Investoren des Heidelberger KI-Unternehmens.

Mit Kolibri-1 bringt Aleph Alpha damit ein leistungsfähiges Open-Weights-Modell auf den Markt, das sich insbesondere durch seine deutsch-englische Ausrichtung und die Verarbeitung sehr großer Kontextmengen positioniert. Für den praktischen Einsatz dürfte neben der Modellleistung vor allem entscheidend sein, wie Unternehmen mit den hohen Speicher- und Infrastrukturanforderungen umgehen.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert