Что именно выпустила LiquidAI: d1-3B и d1-omni-600M
LiquidAI выпустила две новые decision-модели: d1-3B и d1-omni-600M. Обе опубликованы на Hugging Face в организации LiquidAI — карточки доступны по адресам LiquidAI/d1-3B и LiquidAI/d1-omni-600M. Для обеих есть официальные GGUF-репозитории: LiquidAI/d1-3B-GGUF и LiquidAI/d1-omni-600M-GGUF, то есть локальный запуск не требует ручной конвертации весов. Компания описывает их как «две открытые decision-модели семейства d1» в официальном анонсе и в блоге на Hugging Face.
Новости, которых ждали, в релизе не оказалось: новых моделей линейки LFM (Liquid Foundation Models) LiquidAI не представила. В анонсе это отмечено короткой фразой «No new LFM» и смайлом, и такое настроение совпало с реакцией части сообщества в обсуждении релиза в r/LocalLLaMA. Пользователи, которые следят за компанией из-за LFM, получили расширение портфеля в сторону другого класса моделей.
Что можно сделать сразу: скачать GGUF-файл нужной модели из репозиториев организации LiquidAI на Hugging Face и запустить его в llama.cpp или Ollama. Лицензия моделей в доступных источниках не указана, поэтому её стоит проверить в карточке перед использованием. Числа в названиях читаются как ориентир по масштабу: 3B параметров у d1-3B и 600M у d1-omni-600M.
Что такое decision-модели и чем они отличаются от генеративных LLM
Генеративная LLM предсказывает следующий токен и выдаёт текст токен за токеном, пока не остановится. Decision-модели d1 устроены иначе: по формулировке LiquidAI, «в отличие от наших генеративных Liquid Foundation Models (LFMs), наши decision-модели d1 не производят токены. Вместо этого они выдают ответ за один прямой проход (single forward pass)». Это не чат-модель: она не пишет текст.
На вход d1 принимает состояние (state) — текст, JSON, изображения или их смесь — и набор именованных вопросов. На выходе — калиброванные типизированные ответы. В одном запросе можно задать несколько вопросов разных типов.
Ключевые отличия от генеративных LLM
| Ось сравнения | Генеративная LLM | Decision-модель d1 |
|---|---|---|
| Формат работы | Генерирует токены последовательно | Не производит токены, отвечает за один прямой проход |
| Вход | Промпт (текст, иногда изображения) | Состояние (текст, JSON, изображения или их смесь) плюс набор вопросов |
| Выход | Свободный текст произвольной длины | Калиброванные типизированные ответы на именованные вопросы |
| Роль | Чат, суммаризация, перевод, генерация кода | Принятие решений: да/нет, выбор варианта, оценка по шкале |
Три типа вопросов, которые поддерживает d1
- Noul — отвечает на вопрос «да или нет», возвращая вероятность от 0 до 1.
- Choice — выбирает один вариант из нескольких и выдаёт распределение вероятностей между ними.
- Score — оценивает объект по заданной шкале и также возвращает вероятности для каждого уровня.
В одном запросе можно задать несколько вопросов разных типов. По заявлению LiquidAI, d1-3B набрал 48.57 балла в Decision Index 0.2.1, опередив все модели до 10B и Decider 35B-A3B (47.11). Это внутренняя метрика компании, независимых подтверждений в источниках нет.
Сравнение d1-3B и d1-omni-600M: размер, железо, сценарии
По карточкам моделей характеристики выглядят так.
| Параметр | d1-3B | d1-omni-600M |
|---|---|---|
| Параметры | 3B | 600M |
| База | Мультимодальная decision-модель с визуальным энкодером SigLIP2 NaFlex shape-optimized 400M | Построена на LFM2.5-Encoder-350M |
| Длина контекста | В карточке не указана | 16 384 токена (текстовые, визуальные и аудио-позиции вместе); при работе с изображениями текст состояния и вопроса обрезается до 896 токенов, как при обучении |
| Размер словаря | В карточке не указан | 65 536 |
| Модальности | Текст и изображения | Текст и изображения либо текст и аудио |
| Заявленная скорость | 8 мс на NVIDIA RTX 4090, 9 мс на AMD MI325X, 30 мс на Apple M5 Pro, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin, 50 мс на Jetson Orin Nano; изображение 384px на GPU — менее 18 мс | Показатели не публикуются: это ранний исследовательский релиз в активной разработке |
Обе модели, по данным LiquidAI, работают на полном стеке NVIDIA — от DGX в дата-центре до RTX-станций и Jetson на периферии — с поддержкой llama.cpp с первого дня.
Лицензия в доступных источниках не указана ни для одной из моделей, поэтому перед использованием её нужно проверить в карточке. Как выбирать между размером модели и уровнем квантования, разбираем в материале про квантованные модели и VRAM 16-24 ГБ.
d1-3B: для кого и под какие задачи
d1-3B — старшая из двух новых моделей по числу параметров, мультимодальная decision-модель с визуальным энкодером SigLIP2 NaFlex shape-optimized 400M. Если решения разнообразные, а цена ошибки высокая, начинать логичнее с неё: у 3B-модели больше ёмкости, чтобы улавливать тонкие различия между входами. Плата за это известна: больше памяти на веса и KV-кэш, выше задержка на ответ.
GGUF-сборка для неё уже есть, поэтому сценарий «локальный сервис, который отвечает по HTTP» закрывается через llama-server или Ollama. Точные требования к VRAM и поддерживаемый контекст смотрите в карточке модели.
d1-omni-600M: лёгкий вариант для слабого железа
d1-omni-600M примерно в пять раз меньше по числу параметров. Такой размер открывает сценарии, где 3B просто не помещается: ноутбук без дискретной видеокарты, мини-ПК, локальный фильтр на входе в поток данных. Агрессивное квантование здесь экономит память заметно, но на сложных решениях просадка качества обычно ощутимее, чем у крупных моделей, так что сравнивать кванты лучше на своих данных.
Приставка «omni» подтверждается карточкой: d1-omni-600M поддерживает текст и изображения либо текст и аудио. Это первый экспериментальный чекпоинт семейства, обрабатывающий все три модальности. Показатели скорости вывода для него не публикуются, поскольку это ранний исследовательский релиз в активной разработке.
Зачем нужны GGUF-сборки и как запустить модели локально
GGUF это формат хранения весов и метаданных, рассчитанный на локальный запуск. Он пришёл на смену GGML, поддерживает разные схемы квантования и читается llama.cpp и десятками совместимых инструментов. Для d1-3B и d1-omni-600M это означает простую вещь: скачал файл, запустил, конвертировать ничего не нужно.
Похожие релизы последних месяцев идут по той же схеме, например набор GGUF-моделей от LLMFan46 со sparse attention и vision, где готовые сборки важнее, чем сам факт выхода весов.
Что такое GGUF и почему это важно для локального запуска
Квантование снижает точность весов, чтобы уменьшить размер файла и требования к памяти. Взамен часть качества теряется: чем агрессивнее квант, тем выше шанс ошибки на тонких случаях. Практическая выгода в цифрах: модель на 3B параметров в fp16 занимает около 6 ГБ, а в Q4_K_M укладывается примерно в 2 ГБ, и держать её можно на обычной потребительской видеокарте.
Второй плюс: полный стек PyTorch для запуска не нужен. llama.cpp и совместимые рантаймы читают GGUF напрямую, работают и на GPU, и на CPU, а на слабой машине CPU-режим становится основным. Как это устроено и как собрать инструменты, подробно разобрано в статье про запуск LLM на обычном CPU с llama.cpp.
Запуск через llama.cpp: пошагово
- Собрать llama.cpp из исходников или взять готовый бинарник под свою систему.
- Скачать GGUF-файл нужной модели и выбранного кванта из репозитория LiquidAI на Hugging Face.
- Проверить работу через llama-cli или поднять HTTP-сервер через llama-server.
В карточке d1-omni-600M-GGUF приведена команда запуска сервера с указанием конкретного кванта:
llama-server -hf LiquidAI/d1-omni-600M-GGUF:Q8_0 -b 4096 -ub 4096
Шаблон для интерактивной проверки:
./llama-cli -m ./models/d1-omni-600M-Q4_K_M.gguf -p "..." -ngl 99 -c 4096
Шаблон для локального API:
./llama-server -m ./models/d1-3B-Q4_K_M.gguf --port 8080 -ngl 99 -c 8192
Ключевые флаги: -ngl задаёт число слоёв, выгруженных на GPU (увеличение ускоряет работу, пока хватает VRAM), -c задаёт размер контекста, -t задаёт число потоков CPU. Имена файлов в примерах условные: точные названия квантов и наличие конкретных сборок смотрите в репозитории модели. Для decision-модели важна не скорость генерации текста, а задержка до ответа, поэтому лишний контекст и крупные кванты бьют по ней напрямую. Формат промпта с вопросами и вариантами ответа тоже стоит взять из карточки: от него зависит, что именно вернёт модель.
Запуск через Ollama: альтернативный путь
Ollama работает с GGUF под капотом и прячет от пользователя сборку и флаги. Если готовая сборка модели есть в официальной библиотеке, хватит одной команды:
ollama run <имя-модели>
Наличие официальных сборок d1-3B и d1-omni-600M в реестре Ollama в доступных источниках не подтверждено, поэтому перед запуском стоит проверить библиотеку Ollama самостоятельно. Если модели там нет, собирается локальный вариант из GGUF-файла. Сначала создайте Modelfile:
FROM ./d1-omni-600M-Q4_K_M.gguf PARAMETER num_ctx 4096
Затем зарегистрируйте сборку и запустите её:
ollama create d1-omni-local -f Modelfile ollama run d1-omni-local
Имена и пути в примерах условные, их нужно подставить под свои файлы.
Практическая применимость: где decision-модели реально полезны
Сценарии, где компактная модель с одним выходом экономит больше всего:
- Маршрутизация: определить тему запроса и отправить его нужному обработчику или инструменту.
- Выбор инструмента в агенте: поиск, база данных, калькулятор, вызов внешнего API.
- Бинарные проверки: спам, токсичность, соответствие политике.
- Фильтрация в RAG: оценка релевантности найденных фрагментов до того, как они попадут в промпт большой модели.
- Guardrails: пропустить запрос или заблокировать, прежде чем тратить токены на генерацию.
Общий принцип: decision-модель закрывает развилку, а текст пишет генеративная LLM. Для диалога, суммаризации и генерации кода логичнее брать обычную языковую модель, для проверки «да или нет» на каждом запросе дешевле держать маленькую.
Один нюанс: в доступных источниках нет описания задач, под которые LiquidAI позиционирует d1-3B и d1-omni-600M, и нет независимых бенчмарков. Список выше это сценарии класса моделей, а не заявленные возможности этих двух сборок. Проверять нужно по карточкам и на собственных данных.
Методика такой проверки разобрана в материале про GLM-5.3-Flash и DeepSeek-V4-Flash: замеры на своих задачах, контроль VRAM и рабочего контекста вместо рекламных цифр. Тот же подход применим и к d1.
Ограничения и на что обратить внимание
- Лицензия моделей в доступных источниках не указана. Первый шаг перед скачиванием это карточка модели на Hugging Face.
- Независимых бенчмарков и тестов d1-3B и d1-omni-600M в источниках нет. Заявленные цифры (например, 48.57 в Decision Index 0.2.1) — внутренняя метрика LiquidAI.
- Для d1-omni-600M показатели скорости вывода не публикуются: это ранний исследовательский релиз в активной разработке.
- Decision-модель не заменяет генеративную: она отвечает на конкретный вопрос и не напишет текст ответа пользователю.
- Модель на 600M ограничена по ёмкости. На редких и сложных случаях точность может падать, поэтому ставить её на вход продакшена без проверки рискованно.
- Квантование меняет поведение модели. Если решение уходит в автоматику, сравнивайте Q4_K_M и Q8_0 на одних и тех же данных.
- Выход decision-модели требует логики обработки в приложении. Заранее решите, что делать, если модель вернула неожиданный вариант.
Реакция сообщества и что с линейкой LFM
Новостей про LFM в этом релизе нет, и это отметили в самом анонсе смайлом. В обсуждении релиза в r/LocalLLaMA видно, что часть аудитории следила за LiquidAI именно из-за линейки Liquid Foundation Models и ждала её продолжения, а не нового класса моделей.
Причин и сроков в анонсе нет, гадать о них не продуктивнее, чем предсказывать дату следующего релиза. Что известно точно: d1-3B и d1-omni-600M это отдельное направление в портфеле LiquidAI, а не замена LFM. Выпустили их вместе с GGUF-сборками, то есть с расчётом и на тех, кто запускает модели локально.
Итог: стоит ли пробовать d1-3B и d1-omni-600M
Релиз закрывает узкую, но практичную нишу: локальные decision-модели, которые принимают решение вместо генерации текста. Если в ваших пайплайнах есть развилки (маршрутизация запросов, классификация, фильтры в RAG), посмотреть на d1 стоит уже из-за готовых GGUF-сборок: запуск сводится к скачиванию файла и одной команде.
Ориентир по выбору: для ноутбука, мини-ПК и сценариев с жёсткой экономией памяти берите d1-omni-600M; если решения сложные и железо позволяет держать 3B-модель, начинайте с d1-3B. Для запуска подойдут llama.cpp (llama-cli для проверки, llama-server для локального API) или Ollama с локальным Modelfile.
Если вы ждали новые LFM или генеративную модель для чата и кода, этот релиз вам ничего не даст: он про другой класс задач. И перед тем как ставить любую из моделей в рабочий процесс, откройте карточку на Hugging Face, проверьте лицензию и длину контекста, а затем прогоните модель на своих данных и сравните кванты Q4_K_M и Q8_0.