Модель Qwen3 0.6B выдаёт ~7 токенов в секунду на процессоре Celeron N5095 в режиме CPU-only. Этого достаточно для автоматической классификации текстов, извлечения сущностей и краткой суммаризации. Модель 8B на том же железе упирается в пропускную способность памяти и генерирует менее 1 токена в секунду - интерактивная работа исключена. Тест проводился на одноплатном компьютере Youyeetoo X1S с 16 ГБ ОЗУ под управлением Kali 2025.4 через Ollama. Мы замерили производительность шести моделей семейства Qwen3 и определили границы практической применимости этого 15-ваттного чипа.
Методика тестирования: железо, софт и модели
Прозрачность методики - обязательное условие для воспроизводимых бенчмарков. Ниже зафиксированы все компоненты стенда: от спецификаций процессора до команд запуска. Читатель с аналогичной платформой сможет повторить замеры и сравнить результаты.
Конфигурация стенда: Youyeetoo X1S и Celeron N5095
Youyeetoo X1S - одноплатный компьютер в форм-факторе чуть крупнее Raspberry Pi, построенный на процессоре Intel Celeron N5095. Чип относится к микроархитектуре Jasper Lake, выполнен по техпроцессу 10 нм и имеет 4 ядра с 4 потоками. Базовая частота 2.0 ГГц, максимальная в бусте - 2.9 ГГц. TDP зафиксирован на отметке 15 Вт, активное охлаждение не требуется - плата обходится пассивным радиатором.
Конфигурация тестового стенда:
- Процессор: Intel Celeron N5095 (Jasper Lake, 4C/4T, 2.0-2.9 ГГц, 15W TDP)
- ОЗУ: 16 ГБ DDR4-2666 (одноканальный режим)
- Накопитель: NVMe SSD 256 ГБ
- Графика: Intel UHD Graphics (16 EU, 450-750 МГц, в тесте не задействована)
- Питание: 12V DC, пиковое потребление платы ~18 Вт под нагрузкой
Выбор этой платформы обусловлен её пограничным положением: Celeron N5095 - один из самых доступных x86-процессоров с 4 ядрами, который ещё можно рассматривать для экспериментов с локальным инференсом. Результаты теста отвечают на вопрос «какой минимальный порог входа для запуска LLM без GPU».
Программный стек: Kali 2025.4 и Ollama в CPU-only
Операционная система - Kali Linux 2025.4 с ядром 6.6. Ollama установлена через официальный скрипт, версия 0.5.7. Для принудительного отключения GPU-ускорения и работы только на CPU использовалась переменная окружения:
OLLAMA_NUM_GPU=0 ollama serve
После запуска сервера модель загружается стандартной командой:
ollama run qwen3:0.6b
Замер скорости проводился утилитой ollama run --verbose, которая выводит статистику после каждой генерации: количество токенов, общее время, скорость в токенах в секунду и время до первого токена. Для каждой модели выполнялось 5 прогонов с одинаковым промптом из 200 токенов, результат усреднялся. Промпт - смесь английского и русского текста с задачей на суммаризацию.
Протестированные модели (все из семейства Qwen3, квантование Q4_K_M):
- Qwen3 0.6B (размер файла ~0.5 ГБ)
- Qwen3 1.5B (~1.1 ГБ)
- Qwen3 3B (~2.1 ГБ)
- Qwen3 4B (~2.8 ГБ)
- Qwen3 7B (~4.7 ГБ)
- Qwen3 8B (~5.4 ГБ)
Все модели помещаются в 16 ГБ ОЗУ с запасом для системных нужд и контекста. Подкачка не использовалась - swap был отключён на время тестов.
Результаты: скорость инференса Qwen3 от 0.6B до 8B
Цифры подтверждают правило: на CPU-only системах производительность инференса обратно пропорциональна размеру модели. Переход от 0.6B к 8B даёт падение скорости в 8 раз. Ключевое ограничение - не вычислительная мощность ядер, а пропускная способность подсистемы памяти.
| Модель | Размер на диске | Скорость (токен/с) | Задержка первого токена (с) | ОЗУ под модель (ГБ) |
|---|---|---|---|---|
| Qwen3 0.6B | 0.5 ГБ | 7.1 | 1.8 | 1.2 |
| Qwen3 1.5B | 1.1 ГБ | 3.4 | 3.9 | 2.3 |
| Qwen3 3B | 2.1 ГБ | 1.7 | 8.2 | 3.8 |
| Qwen3 4B | 2.8 ГБ | 1.3 | 11.5 | 4.9 |
| Qwen3 7B | 4.7 ГБ | 0.8 | 19.0 | 7.8 |
| Qwen3 8B | 5.4 ГБ | 0.7 | 24.3 | 8.7 |
Задержка первого токена растёт нелинейно: для 0.6B это 1.8 секунды, для 8B - уже 24.3 секунды. Пользователь ждёт почти полминуты до начала ответа, а затем получает слова со скоростью 0.7 токенов в секунду. При длине ответа в 100 токенов полное ожидание составит более двух минут.
Qwen3 0.6B: ~7 токенов/с - рабочий минимум для классификации и суммаризации
Семь токенов в секунду - это примерно 3-4 слова в секунду на русском языке. Человек читает со скоростью 4-6 слов в секунду, поэтому генерация выглядит как неторопливый, но непрерывный поток текста. Для интерактивного чата порог комфорта находится в районе 10 токенов/с, но 7 токенов/с уже не вызывают раздражения при коротких ответах.
Практические сценарии, где 0.6B модель на Celeron N5095 применима уже сегодня:
- Классификация текстов. Определение тональности, категоризация обращений, фильтрация спама. Модель обрабатывает промпт из 200 токенов за 1.8 секунды и выдаёт вердикт в 5-10 токенов - полное время ответа менее 3 секунд.
- Извлечение сущностей. Выделение имён, дат, сумм из неструктурированного текста. Задача укладывается в 20-30 выходных токенов, что даёт задержку 4-5 секунд на запрос.
- Краткая суммаризация. Сжатие абзаца до одного предложения. При лимите выхода в 50 токенов ответ генерируется за 7-8 секунд - приемлемо для пакетной обработки документов.
- Микросервисы с низким RPS. Модель способна обслуживать 5-10 запросов в минуту, что покрывает нужды небольших телеграм-ботов или внутренних инструментов команды.
Качество ответов Qwen3 0.6B ожидаемо уступает старшим моделям: на сложных инструкциях модель может уходить в повторения, а фактическая точность при извлечении сущностей падает на неоднозначных формулировках. Для задач, где ошибка не критична (черновая разметка данных, первичная фильтрация), этого достаточно.
Qwen3 8B: менее 1 токена/с - когда CPU упирается в память
Модель 8B в квантовании Q4_K_M занимает 5.4 ГБ на диске и 8.7 ГБ в оперативной памяти после загрузки. Это превышает объём кэша процессора в сотни раз: Celeron N5095 имеет 4 МБ L3-кэша. На каждом шаге генерации модель читает веса из DDR4-2666, и именно пропускная способность памяти становится бутылочным горлышком.
Одноканальная DDR4-2666 обеспечивает теоретическую пропускную способность 21.3 ГБ/с. Практическая - около 17-18 ГБ/с с учётом накладных расходов. Для генерации одного токена модель 8B должна прочитать примерно 8.7 ГБ данных (все веса). Делим 17 ГБ/с на 8.7 ГБ - получаем теоретический предел около 1.95 токенов в секунду. Реальные 0.7 токенов/с объясняются тем, что процессор не только читает память, но и выполняет вычисления, а одноканальный контроллер не способен утилизировать всю полосу при нерегулярном доступе к весам.
Для сравнения: комфортный интерактивный диалог требует от 10 токенов/с. Модель 8B на Celeron N5095 отстаёт от этого порога в 14 раз. Даже пакетная обработка с такими задержками неэффективна: генерация ответа из 200 токенов занимает почти 5 минут. Единственный осмысленный сценарий - разовый запрос с последующим длительным анализом результата, но для этого проще использовать API облачных провайдеров.
Ситуация типична для бюджетных CPU без GPU. В нашем тесте Qwen3.5 122B против Qwen3 Next 80B на 64 ГБ RAM мы наблюдали аналогичную картину: даже на десктопном процессоре с двухканальной памятью большие модели упираются в полосу пропускания, а скорость обработки промптов делает невозможным использование в агентских рабочих нагрузках.
Практическая применимость: какие сценарии реальны на Celeron N5095
После замеров формируется чёткая картина: Celeron N5095 с 16 ГБ ОЗУ - это платформа для моделей до 1.5B параметров. Всё, что крупнее, работает либо на грани комфорта, либо за гранью.
Разбивка по сценариям:
- Пакетная обработка (ночные задачи, разбор логов, разметка датасетов). Модели 0.6B и 1.5B справляются без ограничений. Модель 3B применима, если время не критично. Модели 7B и 8B - нет.
- Чат-боты и ассистенты с низким темпом диалога. 0.6B держит темп «вопрос-ответ за 5-10 секунд». 1.5B уже заставляет ждать 15-20 секунд на сложных запросах - пользователь может уйти. 3B и выше - только для асинхронного взаимодействия, где ответ приходит через минуты.
- Локальные RAG-системы (поиск по документам с генерацией ответа). Узкое место - обработка промпта с контекстом. Даже 0.6B тратит 1.8 секунды на 200 токенов, а при контексте в 2000 токенов задержка вырастет до 15-20 секунд. Для сравнения: в тесте Strix Halo на Ryzen AI Max+ 395 скорость prefill достигает сотен токенов в секунду, что позволяет комфортно работать с большими контекстами.
- Эксперименты и обучение. Идеальный сценарий для Celeron N5095. Платформа позволяет запустить модель, изучить её поведение, протестировать промпты, понять ограничения квантования - без затрат на облачные API и без шума от миллионов других пользователей.
Рекомендация по выбору модели: начинайте с Qwen3 1.5B. Она вдвое медленнее 0.6B, но качество ответов заметно выше - модель реже срывается в повторения и лучше держит контекст. Если скорость критична, берите 0.6B и компенсируйте качество тщательным проектированием промптов.
Для запуска моделей уровня 8B на этой платформе нужен GPU. Встроенная графика Jasper Lake (Intel UHD, 16 EU) теоретически может дать прирост через Vulkan-бэкенд Ollama. Этому посвящён следующий раздел.
Что дальше: анонс сравнения CPU vs Vulkan на Jasper Lake
Ollama поддерживает Vulkan-бэкенд для инференса на встроенных GPU Intel. Встроенная графика Jasper Lake имеет 16 исполнительных блоков (EU) и работает на частоте до 750 МГц. Пиковая производительность - около 192 GFLOPS (FP16), что сопоставимо с CPU-частью чипа. Преимущество iGPU - собственная подсистема памяти с низкой латентностью, хотя физически она использует ту же DDR4 через общий контроллер.
Мы готовим прямое сравнение CPU-only против Vulkan на том же Celeron N5095 с теми же моделями Qwen3. Основные вопросы, на которые ответит тест:
- Даёт ли Vulkan прирост на моделях малого размера (0.6B-1.5B), где CPU ещё не упирается в полосу пропускания?
- Способна ли встроенная графика «разогнать» модель 8B хотя бы до 2-3 токенов/с?
- Какой объём ОЗУ резервируется под iGPU и не создаст ли это дефицита для самой модели?
Предварительная гипотеза: Vulkan даст умеренный прирост (20-40%) на малых моделях за счёт разгрузки CPU, но кардинально ситуацию с 8B не изменит - узким местом останется пропускная способность DDR4. Цифры и выводы - в следующей статье.
Выводы: бюджетный инференс - компромисс размера и скорости
Celeron N5095 в составе Youyeetoo X1S с 16 ГБ ОЗУ способен выполнять полезную работу с языковыми моделями. Ключевые цифры: 7.1 токен/с на Qwen3 0.6B, 3.4 токен/с на 1.5B, 0.7 токен/с на 8B. Практический потолок для интерактивных сценариев - модель 1.5B. Модели 3B и выше применимы только для пакетной обработки без жёстких требований ко времени.
Ниша таких платформ - эксперименты, обучение и микросервисы с низкой нагрузкой. Celeron N5095 не заменит десктоп с дискретной видеокартой, но его 15-ваттный TDP и пассивное охлаждение позволяют собрать бесшумный сервер для фоновых AI-задач. Для тех, кто рассматривает более производительные CPU-only решения, рекомендуем обратить внимание на Project Zero - CPU-only движок инференса на чистом C99, который демонстрирует до 36 токенов/с на Intel Xeon за счёт оптимизаций под конкретные архитектуры.
Главный вывод теста: размер модели - первичен. На CPU-only системах без высокоскоростной памяти лучше использовать маленькую модель с хорошим промптом, чем ждать ответа от большой. 0.6B, отвечающая за 3 секунды, полезнее 8B, которая думает 5 минут.