Перейти к содержанию
Публикация AiManual

TokenRhythm/NeoHorse-1-4B-GGUF: что известно о новой 4B-модели в GGUF и как её проверить

Разбираем, что реально подтверждено о TokenRhythm/NeoHorse-1-4B-GGUF, сколько памяти обычно просит 4B-модель в GGUF и как за один вечер замерить её скорость, ка

Коротко

Что будет в материале

  1. 01

    Что на самом деле известно о TokenRhythm/NeoHorse-1-4B-GGUF

  2. 02

    Что такое GGUF и почему этот формат важен для локального запуска

  3. 03

    Какие требования к железу ожидать от 4B-модели в GGUF

  4. 04

    Как самостоятельно проверить TokenRhythm/NeoHorse-1-4B-GGUF

Короткий ответ: о модели TokenRhythm/NeoHorse-1-4B-GGUF подтверждено ровно три вещи, имя репозитория, формат GGUF и размер 4B. Всё остальное, архитектура, контекстное окно, датасет, лицензия, результаты тестов и требования к железу, в доступных источниках не описано.

Единственное найденное упоминание, это пост пользователя u/Lordaizen639 в сообществе r/LocalLLaMA с вопросом «Anyone tried this model.what is your experience» и ссылкой на модель (обсуждение на Reddit, 19 сентября 2026 года по данным источника). Ни замеров, ни скриншотов тестов, ни описания железа в посте нет.

Дальше разберём, что делать с таким пробелом в данных: как устроен GGUF, сколько памяти обычно просит 4B-модель, и как получить собственные цифры по скорости и качеству вместо того, чтобы опираться на чужие впечатления из треда.

Что на самом деле известно о TokenRhythm/NeoHorse-1-4B-GGUF

Подтверждённые факты и открытые вопросы

ПараметрСтатусЧто известно
НазваниеПодтвержденоTokenRhythm/NeoHorse-1-4B-GGUF
ФорматПодтвержденоGGUF
РазмерПодтверждено4B, около 4 млрд параметров (следует из названия)
Публичное обсуждениеПодтвержденоПост u/Lordaizen639 в r/LocalLLaMA, 19 сентября 2026
АрхитектураНе подтвержденоВ источниках не описана
Контекстное окноНе подтвержденоДанных нет
Обучающий датасет и метод обученияНе подтвержденоДанных нет
ЛицензияНе подтвержденоДанных нет
Набор доступных квантовНе подтвержденоНужно смотреть карточку модели
Качество ответовНе подтвержденоНи тестов, ни воспроизводимых сравнений
Скорость генерации и потребление VRAMНе подтвержденоЗамеров нет

Пустая карточка не говорит о качестве модели. Она говорит лишь о том, что проверять её придётся самому. Отсутствие данных это пробел в источниках, а не характеристика весов.

Почему одного поста в сообществе недостаточно

Пост с вопросом это не обзор и не тест. Автор не сообщает, какой квант использовал, на каком железе запускал, с какой длиной контекста и на каких промптах смотрел ответы. Без этих четырёх параметров любые впечатления из комментариев нельзя ни повторить, ни сравнить между собой.

Для решения о скачивании нужен минимальный набор: карточка модели с описанием архитектуры и обучающих данных, лицензия, список файлов GGUF с указанием квантов, примеры промптов и хотя бы одна попытка замера скорости и памяти. Пока этого нет, вывод «модель слабая» и вывод «модель отличная» одинаково ни на чём не основаны.

Что такое GGUF и почему этот формат важен для локального запуска

GGUF простыми словами: формат, кванты и совместимость

GGUF это файловый формат для хранения весов моделей, который развивается вместе с llama.cpp. По сути это контейнер: внутри лежат тензоры весов, токенизатор, описание архитектуры и метаданные с типами квантизации. Загрузчик читает метаданные, понимает, как разложить тензоры по слоям и сколько памяти запросить, после чего считает модель на CPU, на GPU или на их смеси.

Квантование внутри GGUF сжимает веса: часть точности отбрасывается, значения группируются в блоки со своим масштабом. Модель занимает меньше места и меньше видеопамяти, но чем агрессивнее сжатие, тем выше риск просадки качества. Основные варианты, которые встречаются в репозиториях:

  • Q4_K_M, популярный баланс размера и качества, обычно первый выбор для потребительской видеокарты;
  • Q5_K_M, чуть точнее и чуть тяжелее;
  • Q8_0, близко к исходным весам, но файл и VRAM заметно больше;
  • низкобитные IQ2 и IQ3, для случаев, когда памяти критично мало, с явной потерей качества.

Практический совет: смотрите на фактический размер файла, а не только на имя кванта. Размер даёт более честную картину плотности модели.

GGUF читают llama.cpp, LM Studio, Ollama, koboldcpp, text-generation-webui и другие инструменты. Свежие архитектуры иногда требуют свежей сборки: если модель не загружается, первым делом проверьте версию движка, а не сам файл.

Почему 4B-модели интересны для потребительского железа

4B означает примерно 4 миллиарда параметров. В кванте Q4_K_M такая модель обычно занимает порядка 2,5-3,5 ГБ весов, в Q8_0 около 4-5 ГБ. Этого достаточно, чтобы разместиться на GPU с 6-8 ГБ VRAM, а иногда и обойтись процессором с достаточным объёмом RAM. Для владельца ноутбука или старой видеокарты это тот класс, где локальный запуск перестаёт быть экспериментом.

Цифры выше относятся к классу 4B в целом. Точный размер NeoHorse зависит от архитектуры, числа слоёв и выбранного кванта, поэтому перед скачиванием стоит сверить фактический размер файла в репозитории. Как выбирать между Q4, Q5 и Q6, когда VRAM мало, разобрано в материале о квантизации под 6 ГБ VRAM.

Какие требования к железу ожидать от 4B-модели в GGUF

VRAM, RAM и контекст: как считать бюджет памяти

Потребление памяти складывается из трёх частей: веса, KV-кэш и оверхед рантайма.

КвантПримерный размер весов для 4BКомментарий
Q4_K_M2,5-3,5 ГБобычный выбор для 6-8 ГБ VRAM
Q5_K_M3-4 ГБнемного точнее, немного тяжелее
Q8_04-5 ГБближе к исходным весам, требует больше памяти

KV-кэш растёт линейно с длиной контекста. Арифметика такая: если у модели 32 слоя, 8 KV-голов и размер головы 128, то один токен контекста в fp16 занимает около 128 КБ, а 4096 токенов дают примерно 0,5 ГБ кэша. У моделей с группированными KV-головами расход ниже, у длинного контекста выше. Кэш можно сжать до q8_0 или q4_0 и вернуть часть VRAM, но качество длинного контекста от этого может пострадать.

Для 6-8 ГБ VRAM модель 4B в Q4 обычно комфортна вместе с контекстом 4-8 тысяч токенов. На 4 ГБ придётся сокращать контекст или выгружать часть слоёв на CPU. Точных требований NeoHorse никто не публиковал, так что эти цифры стоит воспринимать как ориентир для класса, а не как гарантию.

Когда хватит CPU, а когда нужна GPU

Запуск только на CPU возможен: llama.cpp умеет работать без дискретной видеокарты. Плата за это, скорость. Для интерактивного чата комфортным считается примерно от 10-15 токенов в секунду, когда ответ читается в темпе набора. На CPU 4B-модель в Q4 нередко выдаёт единицы токенов в секунду, и это уже ближе к пакетной обработке, чем к живому диалогу.

GPU ускоряет генерацию в разы, но требует VRAM. Промежуточный вариант, гибридный режим, когда несколько слоёв уходит на видеокарту через параметр -ngl, остальное считает процессор. Это позволяет запустить модель на слабой карте, потеряв часть скорости. Конкретные значения для NeoHorse нужно измерять самостоятельно: чужие цифры без конфигурации железа смысла не имеют.

Как самостоятельно проверить TokenRhythm/NeoHorse-1-4B-GGUF

Шаг 1: где скачать и на что смотреть в карточке модели

Прямую ссылку на репозиторий здесь не приводим: в источнике указана только ссылка на модель, открыть её можно из самого поста (тред в r/LocalLLaMA). Перед скачиванием проверьте:

  • кто автор или организация и есть ли у неё другие публикации;
  • заполнена ли карточка модели: архитектура, число параметров, обучающие данные;
  • указана ли лицензия и допускает ли она коммерческое использование;
  • какие файлы GGUF лежат в репозитории и какого они размера;
  • когда модель обновлялась в последний раз.

Пустая карточка без лицензии и без списка квантов это повод отложить загрузку. Файл с именем кванта, но без описания, что внутри, тоже не лучший старт.

Шаг 2: запуск через llama.cpp, LM Studio или Ollama

llama.cpp даёт самый прямой доступ к метрикам и лучше всего подходит для замеров. Имя файла подставьте своё, фактических имён файлов NeoHorse в источниках нет:

./llama-cli -m model.gguf -p "Привет" -n 256 -ngl 99

LM Studio удобен, если нужен графический интерфейс: файл GGUF кладётся в папку моделей и выбирается в списке. Ollama запускает модель через Modelfile:

FROM ./model.gguf
PARAMETER num_ctx 4096

Дальше ollama create neohorse -f Modelfile. Для постоянно работающего сервера на Linux пригодится схема из руководства про быстрый локальный стек на llama.cpp и llama-swap: там разобраны юниты systemd и диагностика проблем с VRAM.

Шаг 3: как оценить качество ответов

Набор промптов стоит заготовить заранее, чтобы сравнение было воспроизводимым. Минимальный комплект: фактологический вопрос с проверяемым ответом, суммаризация текста на 300-500 слов, генерация короткой функции или скрипта, инструкция с явным ограничением (например, «ровно три пункта, без вступлений»), вопрос на русском языке.

Смотреть стоит на четыре вещи: следует ли модель инструкции, не теряет ли связность на длинном ответе, выдумывает ли факты, держит ли язык. Отдельная метрика, perplexity через llama-perplexity на своём тексте, полезна только для сравнения одной и той же модели в разных квантах. Между разными моделями с разными токенизаторами она почти ничего не значит.

Полезно взять точку отсчёта из своего же арсенала: Qwen2.5-3B, Llama-3.2-3B, Phi-3.5-mini или Gemma-2-2B, прогнать те же промпты и сравнить ответы вслепую. Вывод по одному удачному ответу делать нельзя, разброс на коротких тестах слишком велик.

Шаг 4: замер скорости и потребления VRAM

Скорость измеряется двумя числами: tokens/s на генерации и время до первого токена. К ним добавляется скорость обработки промпта, она отвечает за отзывчивость на длинном контексте. В llama.cpp метрики печатаются прямо в консоль, а для чистого замера есть llama-bench:

./llama-bench -m model.gguf -p 512 -n 128

Память смотрите на ходу: nvidia-smi в Linux, диспетчер задач или GPU-Z в Windows. Замеряйте не один раз, а на двух-трёх квантах и двух длинах контекста. Записывайте конфигурацию: GPU, CPU, объём RAM, квант, контекст, число слоёв на GPU. Без этих строк цифры не воспроизводимы даже на вашей же машине через месяц. Быстро прикинуть ожидаемую скорость по карточке модели на Hugging Face можно способом из материала про оценку скорости GGUF-модели.

Кому и для каких задач может подойти 4B-модель

Сценарии, где 4B-модель оправдана

Компактные модели хорошо работают там, где нужен быстрый ответ по короткому контексту: локальный помощник для заметок, суммаризация статей и переписки, извлечение сущностей из текста, классификация обращений, черновая генерация кода с последующей правкой руками, простые RAG-пайплайны с небольшим корпусом документов. Плюс офлайн-режим: модель работает без сети и не отправляет данные наружу.

Примеры из свежих релизов показывают, что компактный размер не всегда означает слабый результат: K2 Horizon 7B обошла Qwen 3.6 27B по индексу Artificial Analysis при заметно меньшем числе параметров. Но это свойство конкретной модели, а не всего класса 4B, и переносить его на NeoHorse без замеров нельзя.

Где 4B-модель, скорее всего, не хватит

Многошаговые рассуждения с промежуточными выводами, длинный контекст с противоречиями, точная математика, генерация больших массивов кода, агентные сценарии с вызовом инструментов. Модели такого размера чаще выдумывают факты и хуже удерживают сложные инструкции, чем 30B+ собратья.

Это ограничение класса, а не приговор NeoHorse. Как вспомогательная модель в связке с более крупной она может оказаться уместной: например, для черновой разметки или маршрутизации запросов.

Как не попасться на маркетинг и слухи вокруг новой модели

Красные флаги в анонсах моделей

Настораживают: отсутствие карточки модели, отсутствие лицензии, вместо примеров только скриншоты чата, обещания уровня GPT-4 без воспроизводимых тестов, отсутствие даты и номера версии, анонимная публикация без истории у автора. Отдельный признак, когда единственный источник это вопрос «кто уже пробовал» без описания условий запуска.

Что проверить перед скачиванием

Короткий чек-лист: автор и его репутация, лицензия, размеры файлов, список квантов, дата обновления, наличие обсуждений с техническими деталями, а не только с эмоциями. Если данных нет, скачивать можно, но строить на модели рабочий процесс рано. И помните, что подобранные бенчмарки существуют, поэтому собственный набор промптов остаётся самым честным критерием.

Итог: стоит ли пробовать TokenRhythm/NeoHorse-1-4B-GGUF

По состоянию на 19 сентября 2026 года о модели известно только имя, формат GGUF и размер 4B. Ни характеристик, ни лицензии, ни тестов, ни требований к железу в источниках нет. Единственное публичное упоминание, вопрос в сообществе без технических деталей (тред).

Практический вывод простой. Если вам интересен класс 4B-моделей для локального запуска и есть свободный вечер, скачайте репозиторий, проверьте карточку и лицензию, прогоните пять промптов из шага 3 и замерьте токены в секунду на своём железе. Полученные цифры будут полезнее любого обсуждения без методологии. Если модель нужна для рабочего процесса или продукта, сначала дождитесь заполненной карточки и проверяемой лицензии, а тесты проведите на своих данных. 4B это всегда компромисс между качеством и требованиями к железу, и решать, приемлем он для ваших задач, можно только по замерам.

Подписаться на канал