Перейти к содержанию
Публикация AiManual

smolbenchmark: бенчмарк малых LLM для слабого железа - от Raspberry Pi до Jetson

smolbenchmark измеряет не абстрактный рейтинг, а tok/s, токены на джоуль и нагрев на реальном слабом железе. Разбираем метрики, текущее покрытие платформ и то,

Коротко

Что будет в материале

  1. 01

    Что такое smolbenchmark и какую задачу он решает

  2. 02

    Какие метрики измеряет smolbenchmark и что они значат на практике

  3. 03

    На каком железе уже есть данные, а где пока пробелы

  4. 04

    Как использовать smolbenchmark для выбора модели под своё устройство

Что такое smolbenchmark и какую задачу он решает

smolbenchmark собирает в одну таблицу результаты запуска малых языковых моделей на устройствах без серверной видеокарты. Ориентир проекта - порог 8 ГБ памяти: всё, что в него помещается, можно запускать локально, без аренды облачных ускорителей. Замеры идут на планшетах, смартфонах, Mac, Jetson и Raspberry Pi.

Практическая ценность в другом наборе показателей. Классические лидерборды отвечают, какая модель точнее решает тесты. smolbenchmark отвечает, потянет ли конкретная модель конкретное устройство и какой ценой: сколько токенов в секунду она выдаёт, сколько энергии тратит на токен и как при этом греется.

Состояние на сентябрь 2026 года: в таблице 13 семейств моделей и около 1000 конфигураций для Jetson Nano Orin Super 8 ГБ. Живые данные по tok/s, tok/J, ITL, задержке, энергопотреблению, температуре и батарее заполнены по одному устройству. По Raspberry Pi, смартфонам и Mac mini строки пока пустые, автор обещает добавить их позже. Проект в активной разработке и открыт для обратной связи.

Чем smolbenchmark отличается от обычных лидербордов

Типичный лидерборд сравнивает модели на серверных GPU и сводит результат к одному числу: качество ответов на наборе задач. Такой рейтинг полезен при выборе модели для API, но молчит о том, как та же модель поведёт себя на Jetson с 8 ГБ памяти или на смартфоне.

smolbenchmark меняет систему координат. Качество здесь не главная ось: акцент на скорости декодирования, энергоэффективности и нагреве. Это дополнение к тестам качества, а не замена. Логика прикладного бенчмарка, где модель оценивают по реальным задачам и понятным метрикам, разобрана отдельно в материале о прикладном бенчмарке для честной оценки LLM.

Отдельная деталь: независимого подтверждения методологии у проекта нет. Пока это замеры автора на своём железе, и относиться к ним стоит как к измерениям одного человека, а не как к отраслевому стандарту.

Почему 8 ГБ памяти - важный порог

8 ГБ - распространённый объём памяти на устройствах, которые стоят на столе или лежат в кармане: Jetson Nano Orin Super, базовые конфигурации Mac mini, часть планшетов и смартфонов. Если модель помещается в этот объём вместе с контекстом и рантаймом, её можно запускать автономно, без сети.

Порог задаёт и верхнюю границу размера модели. При 8 ГБ памяти с квантованием в 4 бита помещаются модели примерно до 7-9 млрд параметров; более крупные требуют агрессивного сжатия и выгрузки слоёв на диск, что бьёт по скорости. Поэтому в таблице 13 семейств моделей и около 1000 конфигураций посчитаны под Jetson Nano Orin Super 8 ГБ: это основной стенд проекта.

Какие метрики измеряет smolbenchmark и что они значат на практике

Живые данные по одному устройству включают семь показателей. Каждый отвечает на свой практический вопрос.

МетрикаЧто показываетГде важна
tok/sСредняя скорость генерации, токенов в секундуДлинные ответы, генерация кода
tok/JСколько токенов приходится на джоуль энергииАвтономные устройства, работа от батареи
ITLЗадержка между соседними токенамиЧат, голосовые сценарии
ЗадержкаВремя до первого токенаИнтерактивные интерфейсы
ЭнергопотреблениеМощность под нагрузкойПитание, тепловой бюджет
ТемператураНагрев в процессе генерацииТроттлинг, корпуса без активного охлаждения
БатареяСостояние и расход зарядаСмартфоны, планшеты, носимые устройства

Скорость декодирования и ITL: почему tok/s - не единственный показатель

tok/s усредняет генерацию по всему ответу. Число удобно для сравнения конфигураций между собой, но не описывает, как выглядит вывод на экране. Две конфигурации с одинаковыми 12 токенами в секунду могут ощущаться по-разному: одна выдаёт текст ровно, вторая - рывками с паузами по полсекунды.

Именно это ловит ITL, средняя задержка между соседними токенами. Для чата и голосовых сценариев равномерность важнее пиковой скорости: пользователь замечает рваный ритм раньше, чем просевшую среднюю цифру. При высоком ITL ответ появляется ступенями даже при приемлемом tok/s. При выборе модели под интерактив смотрите на связку «задержка до первого токена плюс ITL», а tok/s оставляйте для длинных генераций.

Токены на джоуль и нагрев: энергоэффективность на слабом железе

tok/J показывает, сколько работы устройство выполняет на единицу затраченной энергии. Для Jetson, Raspberry Pi, смартфонов и планшетов это ключевая метрика: от неё зависит время автономной работы и то, упрётся ли устройство в тепловой лимит.

Нагрев связан с энергопотреблением напрямую. Устройство без активного охлаждения после нескольких минут генерации уходит в троттлинг, частота падает, и скорость декодирования снижается прямо по ходу ответа. Поэтому температура в таблице - не справочная величина, а предсказание того, как поведёт себя модель в длинной сессии, а не в коротком замере. Похожая логика разбора latency и tokens/s при сравнении компактных моделей с более крупными собрана в статье о сравнении Nanbeige 4.2 3B DSpark и Qwen 3.5 9B.

На каком железе уже есть данные, а где пока пробелы

Замеры идут на планшетах, смартфонах, Mac, Jetson и Raspberry Pi. Заполнена пока одна платформа.

Jetson Nano Orin Super 8 ГБ: что уже измерено

Это единственное устройство с живыми данными. По нему доступны tok/s, tok/J, ITL, задержка, энергопотребление, температура и состояние батареи. Таблица покрывает 13 семейств моделей и около 1000 конфигураций, то есть разбивку по размеру модели, типу квантования и другим параметрам запуска.

1000 конфигураций на одном устройстве выглядят солидно, но стоит помнить: это один стенд с одной системой охлаждения и одной версией рантайма. Переносить цифры на другой Jetson в закрытом корпусе без поправки на тепловой режим не стоит.

Raspberry Pi, смартфоны и Mac mini: чего ждать и когда

По Raspberry Pi, смартфонам и Mac mini данные не заполнены. Автор обещает добавить их позже, конкретные сроки не называются. Проект в активной разработке, поэтому порядок появления платформ может сдвигаться.

Практический вывод: если ваше устройство не Jetson Nano Orin Super 8 ГБ, готовых замеров под него сейчас нет. Ждать данных по Mac mini есть смысл тем, кто сравнивает Apple Silicon в streaming-режиме: там важны различия prefill и decode, а также поведение квантованных MoE-моделей, а не только итоговая скорость. Разбор таких сценариев есть в материале о Qwen3.8-Next на Mac M5 Air.

Как использовать smolbenchmark для выбора модели под своё устройство

Алгоритм простой и не требует запускать всё самому.

  1. Определите объём доступной памяти. Если у вас 8 ГБ unified memory, отбор идёт по этому порогу.
  2. Найдите в таблице строки своего класса устройств. Сейчас заполнен только Jetson Nano Orin Super 8 ГБ.
  3. Отфильтруйте конфигурации по приоритетной метрике: tok/s для скорости, tok/J для автономности, температуру для стабильности в длинной сессии.
  4. Сверьте пару кандидатов с одинаковым размером модели и разным квантованием: разница в tok/J часто перевешивает небольшую разницу в скорости.
  5. Проверьте выбранный вариант на своём устройстве хотя бы на одном длинном запросе: таблица даёт ориентир, а не гарантию.

Сценарии: чат, генерация кода, автономные устройства

Для чата первыми идут задержка до первого токена и ITL. Пользователь ждёт начало ответа и ровный ритм, а не рекордный tok/s.

Для генерации кода важнее tok/s и стабильность температуры. Длинный ответ на сотни токенов нагревает устройство, и падение скорости в середине генерации раздражает сильнее, чем невысокая стартовая скорость. Если вы собираете локальный coding-harness на малой модели, полезно заранее понять, сколько контекста съедает инструмент: этому посвящён разбор little-coder против Pi для локального кодинга.

Для автономных устройств решают tok/J и энергопотребление. Камера, датчик или носимый гаджет работают от батареи, и лишний ватт на генерацию сокращает время работы напрямую. Здесь модель с меньшим tok/s, но заметно лучшим tok/J окажется практичнее быстрой, но прожорливой.

Ограничения текущих данных и как их учитывать

Живые метрики есть только по одному устройству, а методология не имеет независимого подтверждения. Таблица годится как ориентир для отбора кандидатов, а не как истина в последней инстанции. Проект открыт для обратной связи, поэтому данные и состав метрик могут уточняться: цифры, снятые сегодня, через несколько обновлений способны измениться.

Ограничения и риски smolbenchmark на текущем этапе

  • Данные по Raspberry Pi, смартфонам и Mac mini не заполнены. Для этих платформ сравнивать пока нечего.
  • Живые метрики доступны только по Jetson Nano Orin Super 8 ГБ, то есть по одному устройству.
  • Независимого подтверждения методологии и воспроизводимости нет. Неизвестно, насколько результаты повторятся на другом экземпляре железа или другой версии рантайма.
  • Проект в активной разработке: состав таблицы, набор метрик и формат подачи могут меняться.
  • Замеры одного человека на одном стенде не заменяют серию независимых прогонов, особенно по температуре и энергопотреблению, где многое зависит от условий охлаждения.

Как присоединиться или повлиять на развитие бенчмарка

Проект открыт для обратной связи и находится в активной разработке. Если у вас есть подходящее устройство, вы можете предложить свои замеры, сообщить о неточностях или указать метрики, которых не хватает в таблице. Конкретные каналы связи в описании проекта не указаны, поэтому актуальные контакты стоит искать там, где проект представлен.

Наиболее полезны данные по платформам, которых в таблице пока нет: Raspberry Pi, смартфоны, планшеты и Mac mini. Замеры на них закрывают самые заметные пробелы.

Итог: кому и зачем нужен smolbenchmark

smolbenchmark занимает нишу, которую обходят обычные лидерборды: поведение малых LLM на железе с 8 ГБ памяти. Скорость декодирования, токены на джоуль, ITL, задержка, энергопотребление, температура и состояние батареи дают ответ на вопрос, который не решается местом модели в общем рейтинге.

Инструмент пригодится владельцам Jetson Nano Orin Super 8 ГБ, энтузиастам с Raspberry Pi и смартфонами, а также тем, кто выбирает малую модель для автономного устройства. Ограничения стоит держать в голове: заполнена одна платформа, методология не проверена независимо, проект продолжает меняться. Если ваше железо совпадает с единственным заполненным стендом, таблицей можно пользоваться уже сейчас. В остальных случаях разумно подписаться на обновления и дождаться данных по своей платформе.

Подписаться на канал