5 токенов в секунду: короткий ответ без универсального порога
Да, 5 токенов в секунду может хватить для комфортной работы с локальной LLM. Такой темп подходит для подготовки черновиков, суммаризации документов, поиска идей и других задач, где ответ можно подождать несколько десятков секунд.
20 токенов в секунду сокращают время ожидания, однако более быстрый режим способен сильнее загрузить GPU, занять больше доступной памяти и ухудшить работу игры, браузера или другого ресурсоёмкого приложения. Если компьютер должен одновременно запускать локальную модель и выполнять другие задачи, стабильность системы иногда важнее пиковой скорости генерации.
Универсального порога комфортной скорости нет. Прямого тестового сравнения режимов на 5 и 20 токенов в секунду в доступных материалах нет, поэтому эти значения стоит воспринимать как ориентиры для выбора сценария, а не как обязательные требования.
Когда медленная генерация остаётся комфортной
Пять токенов в секунду обычно не мешают, когда пользователь отправляет запрос и занимается другой работой. Например, локальная LLM может подготовить черновик письма, кратко пересказать текст, предложить варианты заголовка или собрать идеи для проекта. В этот момент ожидание становится фоновой операцией.
Такой режим полезен, если приоритетом служит доступ к более подходящей модели, большой контекст или запас RAM и VRAM. Компактная модель с высокой скоростью не всегда лучше крупной модели, которая точнее работает с нужным типом текста или помещается в доступную память без нестабильного обмена с диском.
Похожая логика работает в сценариях с отдельным постоянно доступным AI-сервером. Подход с медленным inference и фоновыми задачами разобран в статье о практической пользе медленного локального inference.
Когда 5 токенов в секунду начинают мешать
Задержка быстро становится заметной, если запросы короткие, а пользователь постоянно уточняет ответ. В диалоге с несколькими последовательными вопросами ожидание повторяется после каждого сообщения. В программировании пауза возникает после каждой правки, проверки и новой попытки генерации.
Для ответа на 100 токенов темп 5 токенов в секунду даёт примерно 20 секунд генерации. Если таких итераций пять, суммарное ожидание может приблизиться к 100 секундам. При высокой скорости этот интервал сокращается, и рабочий ритм ощущается иначе.
Задержку усиливают длинный входной контекст, загрузка модели и время до появления первого токена. Поэтому одинаковые 5 токенов в секунду могут восприниматься по-разному: короткий ответ завершится быстро, а большой анализ заставит ждать заметно дольше.
Скорость генерации токенов локально: что именно измеряет показатель
tokens/s показывает темп выдачи новых токенов во время генерации. Токеном может быть слово, часть слова, знак препинания или служебный фрагмент. Токены не равны количеству слов, поэтому длину ответа нужно оценивать в той же метрике, в которой работает рантайм.
Итоговое время включает несколько этапов: загрузку модели, обработку пользовательского запроса, работу с контекстом, генерацию и остановку на заданном условии. Показатель генерации описывает один этап. На практике скорость первого ответа может зависеть от prefill, или PP, а скорость последующей выдачи часто обозначают как TG или decode.
Разницу между обработкой промпта и генерацией подробно разбирает материал о показателях PP и TG для локального запуска LLM. Это разделение помогает не путать высокую скорость обработки входного текста с быстрым появлением готового ответа.
Почему одинаковые 5 токенов в секунду ощущаются по-разному
Упрощённый расчёт выглядит так:
| Длина ответа | При 5 токенах в секунду | При 20 токенах в секунду |
|---|---|---|
| 20 токенов | около 4 секунд | около 1 секунды |
| 100 токенов | около 20 секунд | около 5 секунд |
| 500 токенов | около 100 секунд | около 25 секунд |
Это арифметическая оценка при стабильном темпе, а не результат бенчмарка. Реальное ожидание меняется из-за времени обработки промпта, длины контекста, настроек остановки и поведения конкретного запуска.
Для короткого ответа разница между режимами может быть почти незаметной после учёта задержки до первой выдачи. Длинный текст показывает разрыв сильнее. Серия из пяти ответов по 100 токенов требует примерно 100 секунд генерации при 5 токенах в секунду и примерно 25 секунд при 20 токенах в секунду, без учёта пауз на ввод и обработки контекста.
20 токенов в секунду - это ускорение ожидания, а не гарантия лучшего режима
Номинально 20 токенов в секунду в четыре раза быстрее 5 токенов в секунду. Пользователь получает ответ раньше, особенно при длинной генерации и частых итерациях. Ускорение полезно, если модель не конкурирует за ресурсы с задачами, которые важны в тот же момент.
Короткий запрос может упереться в обработку промпта, а не в decode. Большой контекст способен увеличить время до первого токена даже при высокой скорости последующей генерации. Сравнивать два режима нужно на одинаковой модели, схожем контексте и сопоставимой длине ответа.
На результат влияет и сам программный стек. Сравнение TensorSharp и llama.cpp для GLM-5.3-Flash показывает, что особенности рантайма, prefill, decode, кеша и архитектуры модели способны заметно менять поведение локального inference. Поэтому цифра на экране относится к конкретной связке модели, квантования, драйвера и движка.
Почему память и GPU важнее одной цифры tokens/s
Локальная LLM использует веса модели, KV-кеш и рабочие буферы. Видеопамять хранит часть или весь этот набор при GPU-инференсе, а оперативная память принимает данные при запуске на CPU или при распределении модели между CPU и GPU. Недостаток VRAM может вынудить перенести часть нагрузки в RAM, что обычно увеличивает задержки и снижает темп генерации.
Производительность системы задаёт узкое место. Если запуск упирается в память, ускорение вычислительного блока не решит проблему. Если главным ограничением стал GPU, свободная оперативная память сама по себе не даст более быстрый decode.
VRAM и оперативная память определяют доступный класс моделей
Большой объём VRAM расширяет выбор моделей, квантований и размеров контекста. Медленный запуск крупной модели иногда практичнее быстрого запуска компактной, если крупная модель лучше подходит для анализа, кода или длинного документа, а компьютер сохраняет приемлемую отзывчивость.
Примером конфигурации с приоритетом GPU-памяти служит System76 Thelio Mira AI. Рабочая станция может оснащаться двумя NVIDIA RTX PRO 6000 Blackwell с 96 ГБ ECC-памяти на каждую карту, то есть до 192 ГБ суммарно. Такая конфигурация показывает, как объём памяти становится отдельной целью при создании системы для локальных AI-нагрузок. Эти характеристики не предсказывают скорость конкретной LLM на любом компьютере.
Компактные модели дают другой компромисс. В разборе Nanbeige 4.2 3B DSpark и Qwen 3.5 9B показано, почему размер модели, требования к VRAM, latency, tokens/s и качество нужно сопоставлять вместе.
Загрузка GPU может стать главным ограничением
Инференс локальной модели способен занять значительную долю вычислительных ресурсов GPU. В режиме на 20 токенов в секунду ускоритель может работать с меньшим запасом для игры, видеомонтажа, генерации изображений или другого графически требовательного процесса.
Теория ограничений описывает такую ситуацию через самый слабый участок цепочки. Ускорение одного этапа не повышает общий результат, если следующий этап упирается в память, пропускную способность или конкурирующую задачу. Поэтому при выборе режима нужно смотреть на весь компьютер.
Конфигурация для локального AI может сознательно балансировать CPU и GPU. В Thelio Mira AI используется менее мощный и более доступный AMD Ryzen 9000 Series, чтобы высвободить больше энергоресурса для двух GPU. Такой пример показывает, что максимальная скорость каждого компонента не всегда служит целью всей системы.
Локальная LLM для работы и игр: когда 5 токенов практичнее 20
Параллельный запуск LLM и игры создаёт конкуренцию за GPU, VRAM, оперативную память и пропускную способность системы. Если быстрый inference полностью загружает ускоритель, средний FPS может сохраниться, а время отображения отдельных кадров станет менее стабильным.
Что происходит с игрой при параллельной генерации
Игровой опыт зависит от среднего FPS, задержки ввода, стабильности времени кадра и отсутствия микростаттеров. Микростаттеры проявляются как короткие рывки, которые не всегда видны в усреднённом FPS. Для динамичной игры они могут раздражать сильнее, чем умеренное снижение пиковой производительности.
Если режим на 20 токенов в секунду удерживает GPU на высокой загрузке и вызывает просадки, задержки или микрофризы, режим на 5 токенов может оказаться рациональнее. Он дольше формирует ответ, зато оставляет системе больше запаса, если настройки действительно снижают конкуренцию за ресурсы.
На стабильность влияют драйверы, графический API, конкретная игра и конфигурация ПК. Обновление драйвера способно исправить ошибки рендеринга, снизить микростаттеры или добавить оптимизацию для определённой игры. При сравнении режимов лучше сохранять одинаковую версию драйвера, иначе результат будет смешивать несколько изменений.
Почему общая отзывчивость важнее максимальной скорости генерации
Комфортный режим сохраняет возможность пользоваться браузером, редактором, мессенджером и рабочими файлами во время генерации. Критерий выбора можно разложить на несколько вопросов:
- Как быстро появляется первый токен и завершается ответ?
- Сколько GPU и VRAM остаётся для игры или рабочего приложения?
- Сохраняется ли нормальная работа интерфейса при открытии больших документов?
- Появляются ли микростаттеры, задержки ввода или скачки времени кадра?
- Помещается ли выбранная модель в доступную память без нестабильного обмена с RAM?
Если ответы на эти вопросы лучше у медленного режима, 5 токенов в секунду дают более цельный пользовательский опыт. Практика с отдельным CPU-сервером и фоновыми задачами подробно описана в сравнении медленного и быстрого локального inference.
Сколько токенов в секунду нужно для LLM в разных сценариях
Черновики, суммаризация и поиск идей
Для черновика статьи, списка вариантов, краткого пересказа или первичной структуры текста 5 токенов в секунду часто достаточно. Пользователь формулирует запрос, запускает генерацию и параллельно проверяет исходные материалы или выполняет другую задачу.
Суммаризация длинного документа может занять больше времени из-за обработки контекста, но скорость выдачи не всегда становится главным ограничением. Приоритетом служат корректный размер модели, доступная память и способность удерживать нужный объём текста.
Диалог, программирование и частые итерации
В интерактивном диалоге задержка повторяется после каждого уточнения. В программировании к ней добавляются чтение ответа, внесение изменений, запуск проверки и новая генерация. При таком цикле 20 токенов в секунду способны заметно сократить суммарное ожидание.
Скорость не компенсирует слабое соответствие модели задаче. Быстрый ответ с ошибочным кодом создаёт дополнительную проверку и повторную работу. Оптимальный режим сочетает подходящее качество модели, приемлемую задержку и стабильную работу среды разработки.
Игры и параллельная работа на одном компьютере
Здесь приоритет смещается к свободным ресурсам и стабильности. Пользователь может выбрать 5 токенов в секунду, если генерация идёт в фоне, а игра или рабочее приложение требуют предсказуемого времени кадра и низкой задержки.
20 токенов в секунду оправданы при наличии запаса GPU и VRAM, когда генерация не вызывает заметных просадок FPS, микростаттеров и задержек интерфейса. Проверять нужно конкретную игру, конкретную модель и конкретный режим запуска.
Как выбрать режим запуска локальной модели на практике
Сначала определить приоритет: скорость ответа или свободные ресурсы
Начните с цены ожидания. Если каждая итерация блокирует работу, а модель нужна для диалога, программирования или оперативной проверки идей, приоритет получает короткое время ответа.
Если модель должна работать одновременно с игрой, браузером, редактором или другой AI-задачей, оцените цену потери отзывчивости. Несколько дополнительных секунд ожидания могут оказаться приемлемыми, когда они сохраняют стабильность всей системы.
Отдельный выбор касается размера модели. Большая модель с более низким темпом может дать нужное качество и контекст, а компактная с высокой скоростью может быстрее закончить задачу, но потребовать больше ручных исправлений.
Какие показатели сравнить до и после запуска
Сначала зафиксируйте базовое состояние компьютера без генерации. Запишите загрузку GPU, занятость VRAM и RAM, FPS, время кадра, отклик интерфейса и поведение рабочего приложения. Для игры полезно проверить короткий одинаковый игровой фрагмент с повторяемой сценой.
Затем запустите одну и ту же модель с одинаковым контекстом и сопоставимым запросом. Сравните режимы на близкой длине ответа. Одного показателя tokens/s недостаточно, поэтому зафиксируйте следующие данные:
- Время до первого токена и полное время генерации.
- Средний темп генерации после обработки промпта.
- Загрузку GPU, объём занятой VRAM и использование RAM.
- FPS, стабильность времени кадра и наличие микростаттеров.
- Отзывчивость браузера, редактора и других приложений.
Повторите проверку несколько раз после загрузки модели. Первый запуск может включать чтение файлов и создание кешей, поэтому его результат не всегда сопоставим с последующими запросами.
Простое правило выбора между 5 и 20 токенами в секунду
Выбирайте 20 токенов в секунду, когда ответы нужны в интерактивном режиме, задержка накапливается, а GPU, VRAM и RAM сохраняют достаточный запас. При этом проверьте стабильность игры и рабочих приложений.
Выбирайте 5 токенов в секунду, когда генерация может идти в фоне, требуется крупная модель или важно продолжать работу на том же компьютере. Режим подходит, если система не демонстрирует заметных задержек, микрофризов и проблем с памятью.
Если оба режима работают на разных моделях, сначала сравните качество результата и требования к памяти. Скорость имеет смысл оценивать после того, как выбранная модель решает задачу с приемлемым количеством исправлений.
Что скорость генерации не говорит о качестве работы с LLM
Почему универсального ответа «нужно не меньше X токенов» нет
Комфорт зависит от длины ответа, типа задачи, времени до первого токена, размера контекста, модели, квантования, рантайма и конкурирующих процессов. Личная терпимость к ожиданию тоже отличается: для фоновой суммаризации 20 секунд могут быть нормальным интервалом, а для интерактивной отладки тот же интервал разрушает рабочий ритм.
Прямых измерений режимов на 5 и 20 токенов в секунду в предоставленных материалах нет. Поэтому нельзя объявить 5 токенов обязательным минимумом или гарантировать комфорт при 20 токенах. Собственный ПК нужно проверять на тех задачах, ради которых запускается локальная LLM.
Tokens/s не описывает достоверность, качество рассуждений, соответствие модели запросу и стабильность результата. В юридических, медицинских, налоговых и коммерчески значимых задачах ответ LLM требует проверки специалистом. Быстрая генерация не снижает цену ошибки.
Итог: 5 токенов в секунду - это рабочий компромисс, а не технический провал
5 токенов в секунду достаточно для черновиков, суммаризации, поиска идей и фоновых задач, если пользователь готов ждать ответ. Такой режим особенно рационален, когда нужно сохранить доступную RAM и VRAM, снизить загрузку GPU и параллельно пользоваться компьютером или играть.
20 токенов в секунду дают заметный выигрыш при длинных ответах, программировании, диалоге и частых итерациях. Выигрыш оправдан, если ускорение не ухудшает FPS, время кадра, задержку ввода и общую отзывчивость системы.
Практический критерий прост: выбирайте режим, который быстрее приводит к полезному результату с учётом всех задач компьютера. Иногда это 20 токенов в секунду. Иногда более медленная и стабильная локальная LLM.