Перейти к содержанию
Публикация AiManual

Aurora1.0-150M: компактная LLM на 150M параметров, её бенчмарки и запуск локально

Aurora1.0-150M это компактная языковая модель на 150 млн параметров, обученная на 7 млрд токенов одной GPU RTX Pro 6000. Смотрим её открытые бенчмарки, требован

Коротко

Что будет в материале

  1. 01

    Что такое Aurora1.0-150M и почему о ней говорят

  2. 02

    Результаты бенчмарков Aurora1.0-150M: цифры и их интерпретация

  3. 03

    Как запустить Aurora1.0-150M локально

  4. 04

    Кому и зачем нужна Aurora1.0-150M

Что такое Aurora1.0-150M и почему о ней говорят

Aurora1.0-150M это первая версия компактной языковой модели на 150 млн параметров. Обучение прошло на 7 млрд токенов, расчёты выполнялись на одной GPU RTX Pro 6000. Авторы заявляют, что качество модели сопоставимо с GPT-2 Small, а метрики опубликовали открыто. Веса и пример скрипта для инференса выложены на Hugging Face, поэтому проверить заявления можно на своём железе, не дожидаясь чужих обзоров.

Оговорка, которая касается всего текста ниже: все цифры взяты из описания релиза. Независимых прогонов бенчмарков сторонними командами нет, архитектура и датасет не раскрыты, так что речь идёт о заявленных результатах, а не о воспроизведённых кем-то со стороны.

Ключевые характеристики модели

  • Параметров: 150 млн.
  • Обучающих токенов: 7 млрд.
  • Оборудование для обучения: одна GPU RTX Pro 6000.
  • Версия: первая в линейке, обновления возможны.
  • Практический доступ: репозиторий на Hugging Face с примером скрипта инференса.

Соотношение данных и размера сети получается около 47 токенов на один параметр. Для сравнения, классический ориентир из подхода Chinchilla, примерно 20 токенов на параметр, для сети на 150 млн даёт около 3 млрд токенов. То есть авторы скормили модели вдвое больше текста, чем минимально необходимо для насыщения такого числа весов. Это правильный ход: при фиксированном размере сети дополнительные данные обычно дают больше, чем дополнительные параметры.

Чего в публикации нет: описания архитектуры (кроме числа параметров), состава датасета, токенизатора, длины контекста, схемы оптимизации, времени обучения и лицензии. Без этого методологию оценить нельзя, можно только зафиксировать заявленные метрики и проверить их самостоятельно.

Сравнение с GPT-2 Small: что стоит за заявлением

GPT-2 Small вышла у OpenAI в 2019 году и содержит 124 млн параметров. Это тот же класс моделей: небольшая базовая сеть для предсказания следующего токена, без выравнивания под диалог. Сравнение по масштабу корректное, вопрос в том, чем оно подтверждено на практике.

В материалах релиза есть формулировка о сопоставимой производительности, но нет построчного сопоставления по каждому бенчмарку с числами GPT-2 Small. Плюс не указано, в каких условиях замеряли Aurora: zero-shot или few-shot, на какой длине контекста, с какой выборкой. Для HellaSwag и ARC разница между zero-shot и few-shot легко даёт несколько процентных пунктов, а это уже половина расстояния между «сопоставимо» и «заметно лучше».

Как вообще читать такие сравнения и почему одна цифра без условий замера мало что значит, подробно разобрано в материале о том, как сравнивать open source и закрытые LLM и почему нельзя назвать точную дату паритета. Тот же принцип работает и здесь: корректно сравнивать модели в одинаковом режиме оценки, на одинаковых промптах и одинаковой версии харнесса.

Результаты бенчмарков Aurora1.0-150M: цифры и их интерпретация

Авторы опубликовали шесть метрик. Ниже они собраны в таблицу вместе с тем, что каждый тест проверяет и как выглядит случайное угадывание.

БенчмаркЧто проверяетРезультатСлучайный уровень
PIQAФизическая интуиция, выбор из двух вариантов62.24%50%
HellaSwagБытовой здравый смысл, выбор из четырёх вариантов32.20%25%
ARC-EasyШкольные научные вопросы, четыре варианта44.91%25%
ARC-ChallengeСложные научные вопросы, четыре варианта25.00%25%
Arithmark 3.0Арифметические задачи33.90%не указан
CapitalBenchЗнание столиц стран36.55%не указан

Условия замеров в публикации не описаны. Не указано, использовались ли few-shot примеры, как считались ответы и на какой версии харнесса получены числа. Это не отменяет цифры, но снижает точность любых выводов из них.

PIQA и HellaSwag: проверка здравого смысла

PIQA даёт 62.24% при случайном уровне 50%. Модель уверенно выше угадывания, но запас невелик: она выбирает физически осмысленный вариант заметно чаще монетки и заметно реже, чем хотелось бы для практических задач. Для сетей на 150 млн параметров такой порядок типичен.

HellaSwag с 32.20% при случайных 25% это почти угадывание. Тест требует выбрать правдоподобное продолжение бытовой ситуации из четырёх вариантов, и малые модели на нём традиционно проваливаются: различия между вариантами тонкие, а нужен именно житейский опыт, которого в 150 млн весов помещается мало. Насколько широкий разброс результатов бывает у моделей этого класса, видно в разборе архитектуры Silia v2 и её бенчмарков: там автор честно сравнивает свою сеть с несколькими аналогами и показывает, как отличаются цифры при разной архитектуре при сопоставимом бюджете вычислений.

ARC и Arithmark: научные вопросы и арифметика

ARC-Easy на 44.91% при случайных 25% выглядит прилично и говорит, что базовые школьные факты модель частично усвоила. ARC-Challenge на 25.00% ровно совпадает со случайным уровнем: сложные научные вопросы сеть не решает, а выбирает вариант наугад.

Arithmark 3.0 даёт 33.90%, и это ожидаемо. Арифметика требует пошаговых вычислений, которых у модели на 150 млн параметров просто нет в достаточном объёме. Если задача подразумевает точный счёт, эту модель использовать не стоит, ответы будут выглядеть правдоподобно и быть неверными.

CapitalBench: знание фактов

36.55% на вопросах о столицах стран это ниже среднего. Фактические знания такой сети ограничены объёмом и составом датасета, а 7 млрд токенов не покрывают справочную информацию сколько-нибудь плотно. Для викторин, справок и любых запросов, где нужна фактическая точность, модель не подходит: она может уверенно назвать неверный город.

Как запустить Aurora1.0-150M локально

Для инференса модель доступна в репозитории на Hugging Face, там же лежит пример скрипта. Обучение шло на RTX Pro 6000, но запуск такой мощной карты не нужен: 150 млн параметров это один из самых лёгких классов LLM.

Требования к железу для локального запуска

  • Веса в FP16 занимают около 300 МБ, в FP32 около 600 МБ.
  • С учётом кэша ключей и значений и промежуточных активаций достаточно 2-4 ГБ видеопамяти.
  • Запуск на CPU возможен, скорость генерации будет ниже, но для проверки работоспособности хватит и этого.
  • Подойдут карты уровня GTX 1060 и новее; квантование для 150M не требуется, модель и так помещается в память целиком.

Для сравнения: требования к обучению здесь принципиально другие, там нужна карта с большим объёмом памяти и высокой пропускной способностью, поскольку через неё проходят градиенты и состояния оптимизатора.

Пример скрипта для инференса

Ниже общий шаблон на Python с библиотекой transformers. Это не дословная копия скрипта из репозитория, а типовой код, который делает то же самое: загружает токенизатор и модель, подаёт промпт, генерирует продолжение.

import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

MODEL_PATH = "путь к локальной папке или идентификатор репозитория из карточки модели"

tokenizer = AutoTokenizer.from_pretrained(MODEL_PATH)
model = AutoModelForCausalLM.from_pretrained(MODEL_PATH, torch_dtype=torch.float16)
model.eval()

prompt = "Once upon a time"
inputs = tokenizer(prompt, return_tensors="pt")

with torch.no_grad():
    output = model.generate(
        **inputs,
        max_new_tokens=50,
        do_sample=True,
        temperature=0.8,
        top_p=0.95,
    )

print(tokenizer.decode(output[0], skip_special_tokens=True))

Зависимости стандартные: torch и transformers. Если карточка модели требует trust_remote_code или другого имени класса, это будет указано в самом репозитории, там же стоит смотреть точные настройки генерации.

Важный момент про поведение. Информации о дообучении по инструкциям в публикации нет, а набор бенчмарков характерен для базовых моделей, которые предсказывают следующий токен. Ждать от неё диалога в стиле чат-ассистента не стоит: на промпт-вопрос она, скорее всего, ответит продолжением текста, а не ответом. Промпты лучше формулировать как начало фразы, которую модель должна дописать.

Кому и зачем нужна Aurora1.0-150M

Сценарии использования: где модель будет полезна

  • Эксперименты с малыми LLM: сравнение методов сэмплирования, температуры, длины контекста.
  • Отладка и тестирование собственных пайплайнов генерации, где важна скорость, а не качество текста.
  • Проверка инфраструктуры на слабом железе: ноутбук, старая видеокарта, мини-ПК, CPU.
  • Учебные задачи: посмотреть, как выглядит генерация модели, обученной на 7 млрд токенов.
  • Черновая генерация в связке с более сильной моделью, которая потом проверяет и переписывает результат.

Что модель не потянет: перевод связных текстов, многошаговые рассуждения, математику, работу с кодом, ответы на фактические вопросы. Для этих задач нужны сети на порядки больше. Посмотреть, какие открытые модели доступны сейчас и как они отличаются по качеству и скорости, можно в обзоре свежих open-weights релизов 2026 года с бенчмарками и замерами скорости на разных GPU.

Ограничения и риски

  • Все метрики взяты со слов авторов, независимая проверка не упоминается.
  • Условия замеров не раскрыты, поэтому сравнивать цифры с другими моделями напрямую рискованно.
  • Лицензия не указана. Для коммерческого использования это прямой риск: неизвестно, что разрешено, а что нет.
  • Состав датасета не раскрыт, поэтому возможны смещения и попадание тестовых данных в обучение.
  • Результаты на HellaSwag, ARC-Challenge, Arithmark и CapitalBench низкие, сеть легко выдаёт правдоподобную, но неверную информацию.

Отдельно стоит помнить, что «сопоставимо с GPT-2 Small» это не комплимент в 2026 году. GPT-2 Small вышла в 2019-м, и её уровень качества для большинства рабочих сценариев давно недостаточен. Сопоставимость с ней означает лишь то, что сеть находится в своей весовой категории, а не то, что она годится для продакшена.

Как обучают компактные LLM: контекст Aurora1.0-150M

Семь миллиардов токенов для обучения это немного по современным меркам. GPT-3 обучали на 300 млрд токенов, а открытые датасеты предобучения давно измеряются триллионами. Для сети на 150 млн параметров 7 млрд токенов уже выше минимального порога, но запас качества, который могли бы дать ещё десятки миллиардов токенов, здесь не выбран.

Объём вычислений на обучение оценивается формулой 6ND, где N это число параметров, а D это число токенов. Для Aurora1.0-150M получается порядка 6×1018 операций. Это скромный бюджет по меркам больших языковых моделей, именно поэтому хватает одной карты RTX Pro 6000, и именно поэтому такие проекты по силам отдельному разработчику или небольшой команде.

Что осталось за кадром: состав и фильтрация датасета, длина последовательности, тип оптимизатора, расписание learning rate, токенизатор. Без этих деталей повторить обучение один в один не получится, придётся делать собственные допущения. Для практики это значит простую вещь: результаты Aurora1.0-150M стоит воспринимать как точку на карте возможностей малых моделей, а не как воспроизводимый рецепт.

Итог: стоит ли пробовать Aurora1.0-150M

Модель интересна тем, что показывает реальный уровень сети на 150 млн параметров с открытыми метриками и доступным инференсом. Если вы хотите посмотреть, как ведёт себя малая LLM на своём железе, сравнить её поведение с GPT-2 Small на собственных промптах или протестировать пайплайн генерации без затрат на API, скачивание займёт минуты, а запуск поместится в 4 ГБ видеопамяти.

Для рабочих задач, где нужны точность, связные ответы или вычисления, ищите модели крупнее. И главное: не полагайтесь на чужие цифры. Разверните модель, прогоните десяток своих промптов, посмотрите на вывод и сравните с тем, что вам действительно нужно. Только так станет понятно, есть ли у этой сети место в ваших задачах.

Подписаться на канал