Лаборатория открытого ИИ mii-llm представила Zagreus-0.4B-por - базовую языковую модель с 400 миллионами параметров, обученную с нуля для работы с португальским и английским языками. Модель не является готовым продуктом для конечного пользователя. Это открытая основа для дообучения, исследований и создания узкоспециализированных решений. Спонсорами обучения выступили Seeweb и Regolo.ai.
Zagreus-0.4B-por - часть эксперимента по созданию небольших открытых моделей для европейских языков. Разработчики mii-llm выбрали путь обучения с нуля, а не дистилляции из крупных моделей. Это даёт полный контроль над архитектурой и данными. Результат: компактная модель, которая на независимом тестировании превосходит Qwen3-0.6B-Base, несмотря на меньший размер.
Что такое Zagreus-0.4B-por и зачем она нужна
Zagreus-0.4B-por - это открытая базовая модель на 400 миллионов параметров. Двуязычная архитектура обеспечивает работу с португальским и английским языками. Модель обучена с нуля лабораторией mii-llm при спонсорской поддержке Seeweb и Regolo.ai. Предтренировочный корпус собран из открытых датасетов на Hugging Face, включая FineWeb и StarCoderData.
Позиционирование модели чёткое: это не готовый ассистент и не замена ChatGPT. Zagreus-0.4B-por - база для файнтюнинга под конкретные задачи. Разработчики рассматривают её как инструмент для исследователей, стартапов и образовательных проектов. Модель подходит для создания узкоспециализированных ассистентов на португальском языке, образовательных инструментов и лёгких приложений на периферийных устройствах.
Почему это важно? Португальский язык - шестой по числу носителей в мире, но качественных открытых моделей для него критически мало. Инициатива mii-llm закрывает этот пробел. Компактный размер снижает порог входа: файнтюнинг возможен на потребительских GPU, инференс - на мобильных устройствах и IoT.
Технические детали: архитектура, данные и процесс обучения
Архитектура Zagreus-0.4B-por основана на стандартном трансформерном декодере. Точные детали архитектуры - количество слоёв, размерность эмбеддингов, число голов внимания - mii-llm не раскрывает в полном объёме. Известно, что модель использует двуязычный токенизатор, способный обрабатывать португальский и английский текст без переключения словарей.
Обучение с нуля - принципиальное решение. Большинство компактных моделей получают дистилляцией из крупных: берут готовую 7B-модель и сжимают знания в 0.4B. mii-llm пошли другим путём. Полный цикл предтренировки на собранном корпусе даёт независимость от архитектурных решений родительских моделей и позволяет оптимизировать модель под целевую языковую пару.
Спонсорство Seeweb и Regolo.ai покрыло вычислительные ресурсы для обучения. Seeweb - итальянский облачный провайдер, специализирующийся на AI-нагрузках. Regolo.ai - платформа для оркестрации ML-экспериментов. Партнёрство с инфраструктурными компаниями позволило mii-llm сосредоточиться на исследовательской части, не отвлекаясь на поиск вычислительных мощностей.
Датасеты: FineWeb, StarCoderData и другие источники
Предтренировочный корпус Zagreus-0.4B-por построен на открытых датасетах Hugging Face. Два ключевых компонента: FineWeb и StarCoderData. FineWeb - это отфильтрованный и дедуплицированный датасет веб-страниц, собранный из Common Crawl. Он обеспечивает широкое покрытие тем и стилей естественного языка. StarCoderData добавляет в корпус программный код на различных языках программирования.
Баланс языков в обучающей выборке - критический фактор для двуязычной модели. mii-llm не публиковали точное соотношение португальских и английских текстов. Судя по результатам на португальских бенчмарках, португальский получил достаточное представительство. Вероятно, в корпус вошли дополнительные португалоязычные датасеты: Portuguese Wikipedia, OSCAR, Europarl и другие источники из экосистемы Hugging Face.
Использование кодового датасета StarCoderData заслуживает отдельного внимания. Добавление кода в предтренировку улучшает способность модели к логическому мышлению и следованию инструкциям. Этот подход подтверждён исследованиями: модели, обученные на смеси текста и кода, показывают лучшие результаты в reasoning-задачах. Zagreus-0.4B-por наследует это преимущество.
Производительность: бенчмарки и сравнение с Qwen3-0.6B-Base
Средний результат Zagreus-0.4B-por на португальских версиях бенчмарков ARC, HellaSwag и MMLU составляет 0.3113. Это базовая модель без инструктивного дообучения и alignment. Прямое сравнение с инструктивными моделями некорректно. Сравнивать нужно с другими базовыми моделями схожего размера.
Ключевой результат: на независимом тестировании Zagreus-0.4B-por превосходит Qwen3-0.6B-Base. Qwen3-0.6B-Base имеет на 50% больше параметров (600 миллионов против 400), но уступает в качестве. Это указывает на эффективность архитектурных решений и качества обучающих данных mii-llm. Меньше параметров - быстрее инференс, ниже требования к памяти, дешевле файнтюнинг.
Результат 0.3113 - средний балл по трём бенчмаркам. Для компактной базовой модели это приемлемый уровень. После инструктивного дообучения и alignment показатели вырастут. Главное - у модели есть прочный фундамент знаний португальского и английского языков, на котором можно строить специализированные решения.
Детализация по бенчмаркам: ARC, HellaSwag, MMLU
| Бенчмарк | Что измеряет | Результат |
|---|---|---|
| ARC (AI2 Reasoning Challenge) | Логическое мышление, ответы на вопросы из школьной программы | В составе среднего 0.3113 |
| HellaSwag | Здравый смысл, выбор наиболее правдоподобного продолжения текста | В составе среднего 0.3113 |
| MMLU (Massive Multitask Language Understanding) | Широкий спектр знаний: от истории до физики | В составе среднего 0.3113 |
ARC тестирует способность модели к многошаговым рассуждениям. Вопросы требуют не просто извлечения факта из памяти, а применения логики. HellaSwag оценивает понимание здравого смысла: модель должна выбрать наиболее естественное продолжение ситуации из повседневной жизни. MMLU - самый сложный из трёх, охватывает 57 предметных областей на уровне undergraduate-образования.
Покомпонентные результаты по каждому бенчмарку mii-llm не опубликовали. Средний балл 0.3113 даёт общую картину, но для практического применения важно знать сильные и слабые стороны. Например, если модель проваливает MMLU, но хороша на HellaSwag - это база для разговорного ассистента. Если обратная ситуация - лучше подходит для фактологических задач.
Практическое применение: сценарии дообучения и ограничения
Zagreus-0.4B-por - базовая модель, не предназначенная для прямого использования в продакшене. Без файнтюнинга она генерирует продолжения текста, а не выполняет инструкции. Прямой запрос «напиши письмо» даст бессвязный поток текста, а не структурированный ответ. Это ожидаемое поведение для модели на стадии предтренировки.
Сценарии дообучения чётко определены разработчиками. Первый - создание узкоспециализированных ассистентов на португальском языке. Например, служба поддержки бразильского банка может файнтюнить модель на корпоративной документации. Второй - образовательные инструменты: модель может объяснять грамматику португальского, проверять сочинения, помогать с переводом. Третий - лёгкие приложения на периферийных устройствах: 400 миллионов параметров помещаются в память смартфона или одноплатного компьютера.
Ограничения модели связаны с её размером. 400 миллионов параметров не могут вместить энциклопедические знания. Фактологическая точность будет низкой, особенно в узких доменах. Модель склонна к галлюцинациям - выдумыванию несуществующих фактов. Мультиязычность ограничена двумя языками: португальским и английским. Для других языков потребуется дополнительный файнтюнинг или выбор другой модели.
Компактные модели с гибридными архитектурами показывают, что эффективность не всегда пропорциональна размеру. В материале про Silia v2 мы разбирали, как 0.5M параметров с комбинацией DeepSeek MLA и Apple Attention Free Transformer конкурируют с более крупными аналогами. Zagreus-0.4B-por идёт схожим путём: ставка на качество данных и эффективную архитектуру вместо наращивания параметров.
Запуск и первые шаги: код для инференса
Модель доступна на Hugging Face в репозитории mii-llm. Для загрузки и инференса используйте библиотеку transformers от Hugging Face. Базовый пример кода на Python:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "mii-llm/Zagreus-0.4B-por"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto"
)
prompt = "A inteligência artificial é"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=50)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))Этот код загружает модель в режиме автовыбора точности и устройства. Для файнтюнинга используйте стандартные инструменты: библиотеки transformers + datasets, LoRA для эффективного дообучения, PEFT для управления адаптерами. Требования к памяти: модель занимает около 800 МБ в fp16, что позволяет файнтюнить её на GPU с 8 ГБ видеопамяти.
Для тех, кто хочет глубже разобраться в процессе создания собственных моделей, рекомендуем материал про Language Model Builder - бесплатное Mac-приложение, которое позволяет обучить модель уровня GPT-2-small за неделю на MacBook Pro. Практический опыт обучения с нуля помогает понять, какие решения приняли разработчики Zagreus-0.4B-por.
Значение для португалоязычного AI и открытой науки
Португальский язык обслуживает более 260 миллионов носителей в Португалии, Бразилии, Анголе, Мозамбике и других странах. Это девятая по величине языковая группа в мире. Качественных открытых моделей для португальского - единицы. Доминируют английские модели, адаптированные через мультиязычные версии. Специализированные португальские решения часто закрыты или требуют платной лицензии.
Zagreus-0.4B-por меняет ситуацию. Открытая лицензия позволяет использовать модель в коммерческих проектах без отчислений. Исследователи получают baseline для экспериментов с португальским языком. Стартапы - готовую основу для создания локальных AI-решений. Образовательные учреждения - инструмент для обучения студентов работе с языковыми моделями.
Инициатива mii-llm вписывается в глобальный тренд демократизации AI для неанглийских языков. Крупные компании фокусируются на английском и нескольких major-языках. Небольшие лаборатории берут на себя задачу покрытия остальных языков. Такой подход мы видели в материале про Looped Transformer, где 3B-модель обходит аналоги в 4 раза больше за счёт циклического переиспользования слоёв. Эффективность архитектуры и качество данных важнее грубой силы параметров.
Открытая наука выигрывает от таких проектов напрямую. Воспроизводимость экспериментов, возможность аудита обучающих данных, коллективное улучшение модели - всё это работает только при открытых весах и прозрачной методологии. mii-llm публикуют модель на Hugging Face, делятся деталями обучения и приглашают сообщество к сотрудничеству.
Компактные модели вроде Zagreus-0.4B-por снижают порог входа в AI-разработку для неанглоязычных сообществ. Файнтюнинг 400M-модели стоит десятки долларов, а не тысячи. Инференс работает на потребительском оборудовании. Это открывает дорогу локальным AI-проектам в Бразилии, Португалии и африканских португалоязычных странах. Вместо зависимости от API крупных компаний, разработчики получают инструмент для создания суверенных AI-решений.