Німецька компанія Aleph Alpha представила відкриту модель штучного інтелекту Kolibri, яку розробляли для регульованих сфер. Вона має 78 млрд параметрів, з яких під час роботи активними є близько 3 млрд, і підтримує контекст до мільйона токенів. Модель вже доступна для завантаження на платформі Hugging Face.
Kolibri створили як спеціалізовану мовну модель для критично важливих завдань у державному управлінні, промисловості та аерокосмічній галузі. Компанія оптимізувала її для німецької та англійської мови, логічного мислення, математики, агентної поведінки й інших завдань, які потрібні клієнтам у виробничих сферах.
Однією з ключових особливостей моделі в Aleph Alpha називають її «суверенність». Компанія заявляє, що контролює весь ланцюг створення Kolibri — від отримання та підготовки даних до попереднього й подальшого навчання та фінального оцінювання, а клієнти можуть розгортати модель самостійно й зберігати контроль над власними даними.
Kolibri розробляли з урахуванням Закону ЄС про штучний інтелект, Кодексу практики для моделей загального призначення та Загального регламенту про захист даних (General Data Protection Regulation, GDPR). За даними компанії, модель створили в Німеччині, навчали на інфраструктурі Німеччини та Фінляндії відповідно до європейського і німецького законодавства та без іноземного контролю.
Що вміє Kolibri
Модель використовує 3 млрд активних параметрів із 78 млрд загальних, що, за твердженням Aleph Alpha, дає змогу поєднати продуктивність із відносно низькою вартістю розгортання. Компанія заявляє, що Kolibri перебуває на «межі Парето» за співвідношенням якості та вартості обслуговування для англійської і німецької мов.
У тестах Kolibri показала конкурентні результати в математиці, програмуванні, роботі з довгим контекстом, агентних завданнях і роботі зі знаннями. Зокрема, модель отримала 96,9% в AIME 2025 англійською мовою, 96% в AIME 2026, 84,3% у GPQA Diamond та 85,9% у LiveCodeBench v6.
Окрему увагу розробники приділили німецькій мові. У переднавчанні вона становила 21,3% токенів. Компанія також використовувала переважно органічні німецькі дані замість машинного перекладу, щоб зберегти мовний та культурний контекст.
Для роботи з німецькою та англійською мовами команда створила власний двомовний токенізатор. За словами розробників, він ефективніше стискає німецький текст, що дає змогу використовувати менше токенів під час обробки завдань і скорочувати витрати та час відповіді.
Модель навчили казати «Я не знаю»
Одним із напрямів розробки стало зменшення галюцинацій — випадків, коли модель генерує неправдиву інформацію замість визнання недостатності даних. В Aleph Alpha наголошують, що для регульованих сфер здатність утриматися від відповіді, коли інформації недостатньо, є важливою умовою для практичного використання моделі.
Для цього компанія розробила власну процедуру Merlin-Arthur, яка генерує синтетичні негативні приклади й навчає модель розрізняти ситуації, коли відповідь підтверджується контекстом, і випадки, коли потрібно сказати «Я не знаю». За даними Aleph Alpha, Kolibri утримувалася від неправильної відповіді у 44% запитань тесту AA-Omniscience проти 15% у Kolibri Origin.
У власному показнику заземлення M/A, який оцінює, наскільки відповідь ґрунтується на наданому документі, Kolibri отримала 0,23 бала. Для Kolibri Origin цей показник становив 0, тоді як у низки інших порівнюваних моделей він також дорівнював нулю.
Створення Kolibri
Розробка моделі тривала кілька місяців і стала продовженням роботи над Kolibri Origin. Її попереднє навчання завершили 11 червня 2026 року, тоді як Kolibri завершила цей етап 11 вересня, а публічний реліз відбувся 3 жовтня.
За цей час загальний обсяг моделі зріс із 30,6 млрд до 78,1 млрд параметрів, кількість навчальних токенів — із 7,51 трлн до 20 трлн, а максимальна довжина контексту під час навчання — із 65 536 до 262 144 токенів. Для фінальної версії також передбачили чотири рівні зусиль для міркування — від відсутнього до високого, щоб користувачі могли балансувати між швидкістю, вартістю та якістю відповіді.
Під час основного навчання Kolibri використовувала 768 графічних процесорів B200. Загалом модель пройшла три етапи: 20 трлн токенів переднавчання з довжиною послідовності 16 тисяч, 3,44 трлн токенів проміжного навчання з контекстом 64 тисячі та 200 млрд токенів адаптації до довгого контексту на 256 тисяч.
Під час 21 дня переднавчання команда зафіксувала 38 незапланованих переривань через апаратні збої або проблеми зі з'єднанням. Конвеєр автоматично перезапускав навчання на інших вузлах і відновлював його з контрольної точки, що була максимум на 250 кроків позаду.
Для яких сфер призначена модель
Aleph Alpha розробила окремі внутрішні тести для державного сектору Німеччини, авіації, виробництва, автомобільної промисловості та інших спеціалізованих галузей. За даними компанії, ці тести дають змогу оцінювати не лише загальні можливості моделі, а й те, наскільки добре вона працює з конкретними робочими процесами та предметними знаннями.
У п'яти тестових завданнях Kolibri була лідером або перебувала на одному рівні з найкращою порівнюваною моделлю в чотирьох випадках із п'яти. Найвищий результат у цих тестах модель показала для постачальника автомобільної продукції — 99%, для напівпровідників отримала 80%, для німецького державного сектору — 75%, для аерокосмічної галузі — 58%, а для технологій промислових приводів — 60%.
Kolibri також підтримує контекст до 1 млн токенів, хоча під час основного навчання найдовша послідовність становила 256 тисяч токенів. Компанія зазначає, що для роботи з контекстом понад 262 144 токени користувачам потрібно окремо збільшити максимальну довжину моделі під час розгортання.
Модель уже доступна на Hugging Face з відкритими вагами за ліцензією Apache 2.0. Для її запуску потрібен пакет aleph-alpha-inference, який надає плагін Kolibri для vLLM.
Нагадаємо, що минулого місяця Україна запропонувала Європейському Союзу використовувати країну як експериментальну «пісочницю» для тестування технологій ШІ. Під час переговорів у Берліні Міністерство цифрової трансформації домовилося з німецькими партнерами створити спільні команди для аналізу українського досвіду цифровізації, зокрема функціонування держпослуг у застосунку «Дія» та використання відкритих ШІ-моделей у державному секторі.