Перейти к содержанию
Публикация AiManual

LiquidAI d1-3B и d1-omni-600M: что такое decision-модели и как запустить их локально через GGUF

LiquidAI выпустила две decision-модели, d1-3B и d1-omni-600M, и для обеих уже доступны GGUF-сборки. Разбираем, чем decision-модели отличаются от генеративных LL

Коротко

Что будет в материале

  1. 01

    Что именно выпустила LiquidAI: d1-3B и d1-omni-600M

  2. 02

    Что такое decision-модели и чем они отличаются от генеративных LLM

  3. 03

    Сравнение d1-3B и d1-omni-600M: размер, железо, сценарии

  4. 04

    Зачем нужны GGUF-сборки и как запустить модели локально

Что именно выпустила LiquidAI: d1-3B и d1-omni-600M

LiquidAI выпустила две новые decision-модели: d1-3B и d1-omni-600M. Обе опубликованы на Hugging Face в организации LiquidAI — карточки доступны по адресам LiquidAI/d1-3B и LiquidAI/d1-omni-600M. Для обеих есть официальные GGUF-репозитории: LiquidAI/d1-3B-GGUF и LiquidAI/d1-omni-600M-GGUF, то есть локальный запуск не требует ручной конвертации весов. Компания описывает их как «две открытые decision-модели семейства d1» в официальном анонсе и в блоге на Hugging Face.

Новости, которых ждали, в релизе не оказалось: новых моделей линейки LFM (Liquid Foundation Models) LiquidAI не представила. В анонсе это отмечено короткой фразой «No new LFM» и смайлом, и такое настроение совпало с реакцией части сообщества в обсуждении релиза в r/LocalLLaMA. Пользователи, которые следят за компанией из-за LFM, получили расширение портфеля в сторону другого класса моделей.

Что можно сделать сразу: скачать GGUF-файл нужной модели из репозиториев организации LiquidAI на Hugging Face и запустить его в llama.cpp или Ollama. Лицензия моделей в доступных источниках не указана, поэтому её стоит проверить в карточке перед использованием. Числа в названиях читаются как ориентир по масштабу: 3B параметров у d1-3B и 600M у d1-omni-600M.

Что такое decision-модели и чем они отличаются от генеративных LLM

Генеративная LLM предсказывает следующий токен и выдаёт текст токен за токеном, пока не остановится. Decision-модели d1 устроены иначе: по формулировке LiquidAI, «в отличие от наших генеративных Liquid Foundation Models (LFMs), наши decision-модели d1 не производят токены. Вместо этого они выдают ответ за один прямой проход (single forward pass)». Это не чат-модель: она не пишет текст.

На вход d1 принимает состояние (state) — текст, JSON, изображения или их смесь — и набор именованных вопросов. На выходе — калиброванные типизированные ответы. В одном запросе можно задать несколько вопросов разных типов.

Ключевые отличия от генеративных LLM

Ось сравненияГенеративная LLMDecision-модель d1
Формат работыГенерирует токены последовательноНе производит токены, отвечает за один прямой проход
ВходПромпт (текст, иногда изображения)Состояние (текст, JSON, изображения или их смесь) плюс набор вопросов
ВыходСвободный текст произвольной длиныКалиброванные типизированные ответы на именованные вопросы
РольЧат, суммаризация, перевод, генерация кодаПринятие решений: да/нет, выбор варианта, оценка по шкале

Три типа вопросов, которые поддерживает d1

  • Noul — отвечает на вопрос «да или нет», возвращая вероятность от 0 до 1.
  • Choice — выбирает один вариант из нескольких и выдаёт распределение вероятностей между ними.
  • Score — оценивает объект по заданной шкале и также возвращает вероятности для каждого уровня.

В одном запросе можно задать несколько вопросов разных типов. По заявлению LiquidAI, d1-3B набрал 48.57 балла в Decision Index 0.2.1, опередив все модели до 10B и Decider 35B-A3B (47.11). Это внутренняя метрика компании, независимых подтверждений в источниках нет.

Сравнение d1-3B и d1-omni-600M: размер, железо, сценарии

По карточкам моделей характеристики выглядят так.

Параметрd1-3Bd1-omni-600M
Параметры3B600M
БазаМультимодальная decision-модель с визуальным энкодером SigLIP2 NaFlex shape-optimized 400MПостроена на LFM2.5-Encoder-350M
Длина контекстаВ карточке не указана16 384 токена (текстовые, визуальные и аудио-позиции вместе); при работе с изображениями текст состояния и вопроса обрезается до 896 токенов, как при обучении
Размер словаряВ карточке не указан65 536
МодальностиТекст и изображенияТекст и изображения либо текст и аудио
Заявленная скорость8 мс на NVIDIA RTX 4090, 9 мс на AMD MI325X, 30 мс на Apple M5 Pro, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin, 50 мс на Jetson Orin Nano; изображение 384px на GPU — менее 18 мсПоказатели не публикуются: это ранний исследовательский релиз в активной разработке

Обе модели, по данным LiquidAI, работают на полном стеке NVIDIA — от DGX в дата-центре до RTX-станций и Jetson на периферии — с поддержкой llama.cpp с первого дня.

Лицензия в доступных источниках не указана ни для одной из моделей, поэтому перед использованием её нужно проверить в карточке. Как выбирать между размером модели и уровнем квантования, разбираем в материале про квантованные модели и VRAM 16-24 ГБ.

d1-3B: для кого и под какие задачи

d1-3B — старшая из двух новых моделей по числу параметров, мультимодальная decision-модель с визуальным энкодером SigLIP2 NaFlex shape-optimized 400M. Если решения разнообразные, а цена ошибки высокая, начинать логичнее с неё: у 3B-модели больше ёмкости, чтобы улавливать тонкие различия между входами. Плата за это известна: больше памяти на веса и KV-кэш, выше задержка на ответ.

GGUF-сборка для неё уже есть, поэтому сценарий «локальный сервис, который отвечает по HTTP» закрывается через llama-server или Ollama. Точные требования к VRAM и поддерживаемый контекст смотрите в карточке модели.

d1-omni-600M: лёгкий вариант для слабого железа

d1-omni-600M примерно в пять раз меньше по числу параметров. Такой размер открывает сценарии, где 3B просто не помещается: ноутбук без дискретной видеокарты, мини-ПК, локальный фильтр на входе в поток данных. Агрессивное квантование здесь экономит память заметно, но на сложных решениях просадка качества обычно ощутимее, чем у крупных моделей, так что сравнивать кванты лучше на своих данных.

Приставка «omni» подтверждается карточкой: d1-omni-600M поддерживает текст и изображения либо текст и аудио. Это первый экспериментальный чекпоинт семейства, обрабатывающий все три модальности. Показатели скорости вывода для него не публикуются, поскольку это ранний исследовательский релиз в активной разработке.

Зачем нужны GGUF-сборки и как запустить модели локально

GGUF это формат хранения весов и метаданных, рассчитанный на локальный запуск. Он пришёл на смену GGML, поддерживает разные схемы квантования и читается llama.cpp и десятками совместимых инструментов. Для d1-3B и d1-omni-600M это означает простую вещь: скачал файл, запустил, конвертировать ничего не нужно.

Похожие релизы последних месяцев идут по той же схеме, например набор GGUF-моделей от LLMFan46 со sparse attention и vision, где готовые сборки важнее, чем сам факт выхода весов.

Что такое GGUF и почему это важно для локального запуска

Квантование снижает точность весов, чтобы уменьшить размер файла и требования к памяти. Взамен часть качества теряется: чем агрессивнее квант, тем выше шанс ошибки на тонких случаях. Практическая выгода в цифрах: модель на 3B параметров в fp16 занимает около 6 ГБ, а в Q4_K_M укладывается примерно в 2 ГБ, и держать её можно на обычной потребительской видеокарте.

Второй плюс: полный стек PyTorch для запуска не нужен. llama.cpp и совместимые рантаймы читают GGUF напрямую, работают и на GPU, и на CPU, а на слабой машине CPU-режим становится основным. Как это устроено и как собрать инструменты, подробно разобрано в статье про запуск LLM на обычном CPU с llama.cpp.

Запуск через llama.cpp: пошагово

  1. Собрать llama.cpp из исходников или взять готовый бинарник под свою систему.
  2. Скачать GGUF-файл нужной модели и выбранного кванта из репозитория LiquidAI на Hugging Face.
  3. Проверить работу через llama-cli или поднять HTTP-сервер через llama-server.

В карточке d1-omni-600M-GGUF приведена команда запуска сервера с указанием конкретного кванта:

llama-server -hf LiquidAI/d1-omni-600M-GGUF:Q8_0 -b 4096 -ub 4096

Шаблон для интерактивной проверки:

./llama-cli -m ./models/d1-omni-600M-Q4_K_M.gguf -p "..." -ngl 99 -c 4096

Шаблон для локального API:

./llama-server -m ./models/d1-3B-Q4_K_M.gguf --port 8080 -ngl 99 -c 8192

Ключевые флаги: -ngl задаёт число слоёв, выгруженных на GPU (увеличение ускоряет работу, пока хватает VRAM), -c задаёт размер контекста, -t задаёт число потоков CPU. Имена файлов в примерах условные: точные названия квантов и наличие конкретных сборок смотрите в репозитории модели. Для decision-модели важна не скорость генерации текста, а задержка до ответа, поэтому лишний контекст и крупные кванты бьют по ней напрямую. Формат промпта с вопросами и вариантами ответа тоже стоит взять из карточки: от него зависит, что именно вернёт модель.

Запуск через Ollama: альтернативный путь

Ollama работает с GGUF под капотом и прячет от пользователя сборку и флаги. Если готовая сборка модели есть в официальной библиотеке, хватит одной команды:

ollama run <имя-модели>

Наличие официальных сборок d1-3B и d1-omni-600M в реестре Ollama в доступных источниках не подтверждено, поэтому перед запуском стоит проверить библиотеку Ollama самостоятельно. Если модели там нет, собирается локальный вариант из GGUF-файла. Сначала создайте Modelfile:

FROM ./d1-omni-600M-Q4_K_M.gguf
PARAMETER num_ctx 4096

Затем зарегистрируйте сборку и запустите её:

ollama create d1-omni-local -f Modelfile
ollama run d1-omni-local

Имена и пути в примерах условные, их нужно подставить под свои файлы.

Практическая применимость: где decision-модели реально полезны

Сценарии, где компактная модель с одним выходом экономит больше всего:

  • Маршрутизация: определить тему запроса и отправить его нужному обработчику или инструменту.
  • Выбор инструмента в агенте: поиск, база данных, калькулятор, вызов внешнего API.
  • Бинарные проверки: спам, токсичность, соответствие политике.
  • Фильтрация в RAG: оценка релевантности найденных фрагментов до того, как они попадут в промпт большой модели.
  • Guardrails: пропустить запрос или заблокировать, прежде чем тратить токены на генерацию.

Общий принцип: decision-модель закрывает развилку, а текст пишет генеративная LLM. Для диалога, суммаризации и генерации кода логичнее брать обычную языковую модель, для проверки «да или нет» на каждом запросе дешевле держать маленькую.

Один нюанс: в доступных источниках нет описания задач, под которые LiquidAI позиционирует d1-3B и d1-omni-600M, и нет независимых бенчмарков. Список выше это сценарии класса моделей, а не заявленные возможности этих двух сборок. Проверять нужно по карточкам и на собственных данных.

Методика такой проверки разобрана в материале про GLM-5.3-Flash и DeepSeek-V4-Flash: замеры на своих задачах, контроль VRAM и рабочего контекста вместо рекламных цифр. Тот же подход применим и к d1.

Ограничения и на что обратить внимание

  • Лицензия моделей в доступных источниках не указана. Первый шаг перед скачиванием это карточка модели на Hugging Face.
  • Независимых бенчмарков и тестов d1-3B и d1-omni-600M в источниках нет. Заявленные цифры (например, 48.57 в Decision Index 0.2.1) — внутренняя метрика LiquidAI.
  • Для d1-omni-600M показатели скорости вывода не публикуются: это ранний исследовательский релиз в активной разработке.
  • Decision-модель не заменяет генеративную: она отвечает на конкретный вопрос и не напишет текст ответа пользователю.
  • Модель на 600M ограничена по ёмкости. На редких и сложных случаях точность может падать, поэтому ставить её на вход продакшена без проверки рискованно.
  • Квантование меняет поведение модели. Если решение уходит в автоматику, сравнивайте Q4_K_M и Q8_0 на одних и тех же данных.
  • Выход decision-модели требует логики обработки в приложении. Заранее решите, что делать, если модель вернула неожиданный вариант.

Реакция сообщества и что с линейкой LFM

Новостей про LFM в этом релизе нет, и это отметили в самом анонсе смайлом. В обсуждении релиза в r/LocalLLaMA видно, что часть аудитории следила за LiquidAI именно из-за линейки Liquid Foundation Models и ждала её продолжения, а не нового класса моделей.

Причин и сроков в анонсе нет, гадать о них не продуктивнее, чем предсказывать дату следующего релиза. Что известно точно: d1-3B и d1-omni-600M это отдельное направление в портфеле LiquidAI, а не замена LFM. Выпустили их вместе с GGUF-сборками, то есть с расчётом и на тех, кто запускает модели локально.

Итог: стоит ли пробовать d1-3B и d1-omni-600M

Релиз закрывает узкую, но практичную нишу: локальные decision-модели, которые принимают решение вместо генерации текста. Если в ваших пайплайнах есть развилки (маршрутизация запросов, классификация, фильтры в RAG), посмотреть на d1 стоит уже из-за готовых GGUF-сборок: запуск сводится к скачиванию файла и одной команде.

Ориентир по выбору: для ноутбука, мини-ПК и сценариев с жёсткой экономией памяти берите d1-omni-600M; если решения сложные и железо позволяет держать 3B-модель, начинайте с d1-3B. Для запуска подойдут llama.cpp (llama-cli для проверки, llama-server для локального API) или Ollama с локальным Modelfile.

Если вы ждали новые LFM или генеративную модель для чата и кода, этот релиз вам ничего не даст: он про другой класс задач. И перед тем как ставить любую из моделей в рабочий процесс, откройте карточку на Hugging Face, проверьте лицензию и длину контекста, а затем прогоните модель на своих данных и сравните кванты Q4_K_M и Q8_0.

Подписаться на канал