Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

Zagreus-0.4B-por: компактная двуязычная модель для португальского — обзор, тесты и применение

Лаборатория mii-llm представила Zagreus-0.4B-por — открытую базовую модель на 400M параметров для португальского и английского. Разбираем архитектуру, бенчмарки

Коротко

Что будет в материале

  1. 01

    Что такое Zagreus-0.4B-por и зачем она нужна

  2. 02

    Технические детали: архитектура, данные и процесс обучения

  3. 03

    Производительность: бенчмарки и сравнение с Qwen3-0.6B-Base

  4. 04

    Практическое применение: сценарии дообучения и ограничения

Лаборатория открытого ИИ mii-llm представила Zagreus-0.4B-por - базовую языковую модель с 400 миллионами параметров, обученную с нуля для работы с португальским и английским языками. Модель не является готовым продуктом для конечного пользователя. Это открытая основа для дообучения, исследований и создания узкоспециализированных решений. Спонсорами обучения выступили Seeweb и Regolo.ai.

Zagreus-0.4B-por - часть эксперимента по созданию небольших открытых моделей для европейских языков. Разработчики mii-llm выбрали путь обучения с нуля, а не дистилляции из крупных моделей. Это даёт полный контроль над архитектурой и данными. Результат: компактная модель, которая на независимом тестировании превосходит Qwen3-0.6B-Base, несмотря на меньший размер.

Что такое Zagreus-0.4B-por и зачем она нужна

Zagreus-0.4B-por - это открытая базовая модель на 400 миллионов параметров. Двуязычная архитектура обеспечивает работу с португальским и английским языками. Модель обучена с нуля лабораторией mii-llm при спонсорской поддержке Seeweb и Regolo.ai. Предтренировочный корпус собран из открытых датасетов на Hugging Face, включая FineWeb и StarCoderData.

Позиционирование модели чёткое: это не готовый ассистент и не замена ChatGPT. Zagreus-0.4B-por - база для файнтюнинга под конкретные задачи. Разработчики рассматривают её как инструмент для исследователей, стартапов и образовательных проектов. Модель подходит для создания узкоспециализированных ассистентов на португальском языке, образовательных инструментов и лёгких приложений на периферийных устройствах.

Почему это важно? Португальский язык - шестой по числу носителей в мире, но качественных открытых моделей для него критически мало. Инициатива mii-llm закрывает этот пробел. Компактный размер снижает порог входа: файнтюнинг возможен на потребительских GPU, инференс - на мобильных устройствах и IoT.

Технические детали: архитектура, данные и процесс обучения

Архитектура Zagreus-0.4B-por основана на стандартном трансформерном декодере. Точные детали архитектуры - количество слоёв, размерность эмбеддингов, число голов внимания - mii-llm не раскрывает в полном объёме. Известно, что модель использует двуязычный токенизатор, способный обрабатывать португальский и английский текст без переключения словарей.

Обучение с нуля - принципиальное решение. Большинство компактных моделей получают дистилляцией из крупных: берут готовую 7B-модель и сжимают знания в 0.4B. mii-llm пошли другим путём. Полный цикл предтренировки на собранном корпусе даёт независимость от архитектурных решений родительских моделей и позволяет оптимизировать модель под целевую языковую пару.

Спонсорство Seeweb и Regolo.ai покрыло вычислительные ресурсы для обучения. Seeweb - итальянский облачный провайдер, специализирующийся на AI-нагрузках. Regolo.ai - платформа для оркестрации ML-экспериментов. Партнёрство с инфраструктурными компаниями позволило mii-llm сосредоточиться на исследовательской части, не отвлекаясь на поиск вычислительных мощностей.

Датасеты: FineWeb, StarCoderData и другие источники

Предтренировочный корпус Zagreus-0.4B-por построен на открытых датасетах Hugging Face. Два ключевых компонента: FineWeb и StarCoderData. FineWeb - это отфильтрованный и дедуплицированный датасет веб-страниц, собранный из Common Crawl. Он обеспечивает широкое покрытие тем и стилей естественного языка. StarCoderData добавляет в корпус программный код на различных языках программирования.

Баланс языков в обучающей выборке - критический фактор для двуязычной модели. mii-llm не публиковали точное соотношение португальских и английских текстов. Судя по результатам на португальских бенчмарках, португальский получил достаточное представительство. Вероятно, в корпус вошли дополнительные португалоязычные датасеты: Portuguese Wikipedia, OSCAR, Europarl и другие источники из экосистемы Hugging Face.

Использование кодового датасета StarCoderData заслуживает отдельного внимания. Добавление кода в предтренировку улучшает способность модели к логическому мышлению и следованию инструкциям. Этот подход подтверждён исследованиями: модели, обученные на смеси текста и кода, показывают лучшие результаты в reasoning-задачах. Zagreus-0.4B-por наследует это преимущество.

Производительность: бенчмарки и сравнение с Qwen3-0.6B-Base

Средний результат Zagreus-0.4B-por на португальских версиях бенчмарков ARC, HellaSwag и MMLU составляет 0.3113. Это базовая модель без инструктивного дообучения и alignment. Прямое сравнение с инструктивными моделями некорректно. Сравнивать нужно с другими базовыми моделями схожего размера.

Ключевой результат: на независимом тестировании Zagreus-0.4B-por превосходит Qwen3-0.6B-Base. Qwen3-0.6B-Base имеет на 50% больше параметров (600 миллионов против 400), но уступает в качестве. Это указывает на эффективность архитектурных решений и качества обучающих данных mii-llm. Меньше параметров - быстрее инференс, ниже требования к памяти, дешевле файнтюнинг.

Результат 0.3113 - средний балл по трём бенчмаркам. Для компактной базовой модели это приемлемый уровень. После инструктивного дообучения и alignment показатели вырастут. Главное - у модели есть прочный фундамент знаний португальского и английского языков, на котором можно строить специализированные решения.

Детализация по бенчмаркам: ARC, HellaSwag, MMLU

БенчмаркЧто измеряетРезультат
ARC (AI2 Reasoning Challenge)Логическое мышление, ответы на вопросы из школьной программыВ составе среднего 0.3113
HellaSwagЗдравый смысл, выбор наиболее правдоподобного продолжения текстаВ составе среднего 0.3113
MMLU (Massive Multitask Language Understanding)Широкий спектр знаний: от истории до физикиВ составе среднего 0.3113

ARC тестирует способность модели к многошаговым рассуждениям. Вопросы требуют не просто извлечения факта из памяти, а применения логики. HellaSwag оценивает понимание здравого смысла: модель должна выбрать наиболее естественное продолжение ситуации из повседневной жизни. MMLU - самый сложный из трёх, охватывает 57 предметных областей на уровне undergraduate-образования.

Покомпонентные результаты по каждому бенчмарку mii-llm не опубликовали. Средний балл 0.3113 даёт общую картину, но для практического применения важно знать сильные и слабые стороны. Например, если модель проваливает MMLU, но хороша на HellaSwag - это база для разговорного ассистента. Если обратная ситуация - лучше подходит для фактологических задач.

Практическое применение: сценарии дообучения и ограничения

Zagreus-0.4B-por - базовая модель, не предназначенная для прямого использования в продакшене. Без файнтюнинга она генерирует продолжения текста, а не выполняет инструкции. Прямой запрос «напиши письмо» даст бессвязный поток текста, а не структурированный ответ. Это ожидаемое поведение для модели на стадии предтренировки.

Сценарии дообучения чётко определены разработчиками. Первый - создание узкоспециализированных ассистентов на португальском языке. Например, служба поддержки бразильского банка может файнтюнить модель на корпоративной документации. Второй - образовательные инструменты: модель может объяснять грамматику португальского, проверять сочинения, помогать с переводом. Третий - лёгкие приложения на периферийных устройствах: 400 миллионов параметров помещаются в память смартфона или одноплатного компьютера.

Ограничения модели связаны с её размером. 400 миллионов параметров не могут вместить энциклопедические знания. Фактологическая точность будет низкой, особенно в узких доменах. Модель склонна к галлюцинациям - выдумыванию несуществующих фактов. Мультиязычность ограничена двумя языками: португальским и английским. Для других языков потребуется дополнительный файнтюнинг или выбор другой модели.

Компактные модели с гибридными архитектурами показывают, что эффективность не всегда пропорциональна размеру. В материале про Silia v2 мы разбирали, как 0.5M параметров с комбинацией DeepSeek MLA и Apple Attention Free Transformer конкурируют с более крупными аналогами. Zagreus-0.4B-por идёт схожим путём: ставка на качество данных и эффективную архитектуру вместо наращивания параметров.

Запуск и первые шаги: код для инференса

Модель доступна на Hugging Face в репозитории mii-llm. Для загрузки и инференса используйте библиотеку transformers от Hugging Face. Базовый пример кода на Python:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "mii-llm/Zagreus-0.4B-por"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)

prompt = "A inteligência artificial é"
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=50)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Этот код загружает модель в режиме автовыбора точности и устройства. Для файнтюнинга используйте стандартные инструменты: библиотеки transformers + datasets, LoRA для эффективного дообучения, PEFT для управления адаптерами. Требования к памяти: модель занимает около 800 МБ в fp16, что позволяет файнтюнить её на GPU с 8 ГБ видеопамяти.

Для тех, кто хочет глубже разобраться в процессе создания собственных моделей, рекомендуем материал про Language Model Builder - бесплатное Mac-приложение, которое позволяет обучить модель уровня GPT-2-small за неделю на MacBook Pro. Практический опыт обучения с нуля помогает понять, какие решения приняли разработчики Zagreus-0.4B-por.

Значение для португалоязычного AI и открытой науки

Португальский язык обслуживает более 260 миллионов носителей в Португалии, Бразилии, Анголе, Мозамбике и других странах. Это девятая по величине языковая группа в мире. Качественных открытых моделей для португальского - единицы. Доминируют английские модели, адаптированные через мультиязычные версии. Специализированные португальские решения часто закрыты или требуют платной лицензии.

Zagreus-0.4B-por меняет ситуацию. Открытая лицензия позволяет использовать модель в коммерческих проектах без отчислений. Исследователи получают baseline для экспериментов с португальским языком. Стартапы - готовую основу для создания локальных AI-решений. Образовательные учреждения - инструмент для обучения студентов работе с языковыми моделями.

Инициатива mii-llm вписывается в глобальный тренд демократизации AI для неанглийских языков. Крупные компании фокусируются на английском и нескольких major-языках. Небольшие лаборатории берут на себя задачу покрытия остальных языков. Такой подход мы видели в материале про Looped Transformer, где 3B-модель обходит аналоги в 4 раза больше за счёт циклического переиспользования слоёв. Эффективность архитектуры и качество данных важнее грубой силы параметров.

Открытая наука выигрывает от таких проектов напрямую. Воспроизводимость экспериментов, возможность аудита обучающих данных, коллективное улучшение модели - всё это работает только при открытых весах и прозрачной методологии. mii-llm публикуют модель на Hugging Face, делятся деталями обучения и приглашают сообщество к сотрудничеству.

Компактные модели вроде Zagreus-0.4B-por снижают порог входа в AI-разработку для неанглоязычных сообществ. Файнтюнинг 400M-модели стоит десятки долларов, а не тысячи. Инференс работает на потребительском оборудовании. Это открывает дорогу локальным AI-проектам в Бразилии, Португалии и африканских португалоязычных странах. Вместо зависимости от API крупных компаний, разработчики получают инструмент для создания суверенных AI-решений.

Подписаться на канал