Что такое Ollivo и зачем он нужен
Ollivo - открытое Windows-приложение, которое запускает локальные нейросети как обычную программу: скачал установщик, открыл окно, выбрал модель, начал работать. Без установки Python, без CUDA, без командной строки.
Проблема, которую он решает, знакома каждому, кто пробовал поднять LLM на своём ПК. Нужно поставить Python нужной версии, найти сборку llama.cpp под свою видеокарту, разобраться с драйверами и библиотеками, а потом запускать всё это в терминале длинной командой. Если что-то отвалилось, приходится читать логи и выяснять, какой DLL не нашёлся.
Ollivo берёт эту рутину на себя. Движки ставятся и чинятся сами, а интерфейс рассчитан на человека, который хочет разговаривать с моделью, а не отлаживать сборку. Проект развивает разработчик как собственный стартап, код открыт, а о внутренней кухне он рассказывает в статье на Хабре.
Версия на момент публикации - 0.3, ранняя. Для тех, кто планирует ставить программу в рабочий процесс, это ключевая деталь, а не мелкая оговорка.
Как Ollivo управляет движками llama.cpp, whisper.cpp и ComfyUI
Под капотом у Ollivo три движка. llama.cpp отвечает за текстовые модели, whisper.cpp - за распознавание речи, ComfyUI - за генерацию изображений. Пользователь не собирает их из исходников и не прописывает пути к бинарникам: программа сама скачивает, ставит и починяет то, что сломалось.
Практическая ценность в том, что не нужно решать, какую сборку llama.cpp брать под конкретную карту и какой бэкенд включать, CUDA или Vulkan. Этот выбор переложен на приложение.
У генерации изображений статус отдельный: ComfyUI назван управляемым движком, но сама генерация картинок появится в следующих версиях Ollivo. Рассчитывать на полный цикл работы с изображениями сейчас не стоит.
Почему Tauri 2 и Rust, а не Electron и Python
Ollivo написан на Tauri 2 и Rust. Rust даёт нативный бинарник, поэтому приложению не нужен внешний интерпретатор: пользователю не приходится ставить Python и следить за версиями пакетов. Tauri 2 для интерфейса использует системный WebView Windows, а не встроенный браузерный движок, что сказывается на размере дистрибутива.
На практике это обычное Windows-приложение, а не набор скриптов для запуска в терминале. Для аудитории, которая откладывала локальные модели именно из-за настройки окружения, стек здесь важен не сам по себе, а как причина, по которой установка сводится к нескольким кликам.
Как Ollivo находит уже скачанные модели и не копирует гигабайты
Модель на 20-30 ГБ качается часами, и заводить вторую копию того же файла ради другой программы бессмысленно. То, что уже скачано в LM Studio, Ollama или ComfyUI, Ollivo находит сам и не копирует.
Сценарий простой: если вы уже загружали GGUF-модель в LM Studio, она появится в списке Ollivo и запустится без дубликата на диске. То же с моделями Ollama. Место не удваивается, старые загрузки не пропадают, а новая программа не требует перекачивать архив заново.
Поддержка GGUF и перетаскивание файлов
Ollivo работает с любым GGUF: файл можно просто перетащить в окно программы. Конвертировать, переименовывать или раскладывать по особым папкам не нужно.
GGUF - стандартный формат для llama.cpp, и внутри одного формата разница в квантовании огромна: одна и та же модель в Q4_K_M и Q8_0 ведёт себя как два разных инструмента по скорости и аппетиту к памяти. Если вы не помните, что выбрать под CPU и слабую видеокарту, разбор квантов Q4_0, Q4_K_M, Q5_K_M и Q8_0 помогает выбрать осознанно, а не наугад.
Поиск по HuggingFace и подборка проверенных моделей
Для тех, кто не знает, с чего начать, есть подборка из восьми проверенных моделей и поиск по HuggingFace. Это закрывает главный барьер новичка: не надо угадывать, какая модель подойдёт для его железа и задач.
Поиск по HuggingFace решает обратную задачу: вы ищете конкретную модель и забираете её прямо из приложения. Отдельная деталь, о которой стоит знать заранее: при загрузке с HuggingFace автор столкнулся с тем, что HTTP/2 мешал многопоточной загрузке.
Прогноз скорости и памяти до загрузки модели
Самая частая ошибка при первом запуске: скачать файл, потратить час и выяснить, что модель не влезает в память. Ollivo показывает до загрузки, поместится ли модель в память и с какой скоростью она будет отвечать. Сколько слоёв отдать видеокарте и сколько памяти под разговор, программа считает сама.
Почему «слова в секунду» и «страницы» вместо токенов
В окне Ollivo нет слова «токены». Скорость показана в словах в секунду и сравнивается со скоростью чтения. Память разговора считается в страницах, то есть в объёме текста, который человек может себе представить.
Метрики упрощены осознанно. Цифра «17 токенов в секунду» сама по себе ничего не говорит тому, кто не работал с инференсом, а сравнение со скоростью чтения сразу отвечает на практический вопрос: будет ли диалог комфортным. Вместо «Q4_K_M» в интерфейсе написано «обычный выбор: почти как оригинал, а места вдвое меньше», вместо Q2 - «отвечает заметно хуже».
Как Ollivo считает слои и память под разговор
Распределение ресурсов в приложении автоматическое: оно определяет, сколько слоёв отдать видеокарте, а сколько памяти оставить под контекст разговора. Детали алгоритма в источнике не раскрываются, поэтому воспринимайте прогноз как ориентир, а не как гарантию: фактическая скорость зависит от драйвера, бэкенда и того, чем ещё занята видеокарта.
Ценность прогноза практическая. Вы видите результат до загрузки модели и можете отказаться от кандидата, который не поместится, вместо того чтобы ждать окончания скачивания и разбираться с ошибкой выделения памяти.
Практические подводные камни: Vulkan vs CUDA, HTTP/2 и Qwen
Наблюдения ниже - личный опыт автора на GTX 1080, а не универсальные бенчмарки. На другом железе результат может отличаться.
Vulkan быстрее CUDA на GTX 1080: почему так вышло
Vulkan на его GTX 1080 генерирует в полтора раза быстрее CUDA. Для карты NVIDIA, где CUDA обычно считают основным путём, результат неочевидный. Практический вывод: перед тем как ставить CUDA-сборку, стоит сравнить оба бэкенда на своей задаче.
Из этого нельзя вывести правило «Vulkan всегда быстрее». Замер сделан на одной карте поколения Pascal, в одной сборке llama.cpp и на конкретных моделях. На современных GPU с тензорными ядрами картина, скорее всего, будет другой, так что проверять нужно у себя.
HTTP/2 и многопоточная загрузка с HuggingFace
При загрузке моделей с HuggingFace HTTP/2 мешал многопоточной загрузке. Логика «разбить один большой файл на несколько параллельных потоков» для 20-гигабайтной модели разбивается о поведение протокола. Подробностей, почему так происходит и как именно автор обошёл ограничение, в источнике нет.
Для пользователя важен сам факт: скорость загрузки зависит не только от ширины канала, и на плохом соединении разница может быть заметной.
Qwen и китайские слова в русском тексте при температуре 0
Qwen вставляет китайские слова в русский текст даже при температуре 0. Температура 0 должна делать генерацию максимально предсказуемой, и всё равно сбой воспроизводится: смешанные языковые данные в обучающем корпусе вылезают в готовом ответе.
Это наблюдение на конкретной проверке, а не характеристика всех версий Qwen. Если русский текст критичен, ответы стоит вычитывать или брать модель с более чистой языковой подготовкой.
Галлюцинации: модель отчиталась об удалении файла, но ничего не удалила
Маленькая модель однажды отчиталась, что удалила файл, и ничего не удалила. Отчёт выглядел правдоподобно, и на глаз его от реального действия не отличить.
Именно поэтому в Ollivo есть режимы работы с папкой проекта: «Вручную», «Авто» и «План», а любое изменение можно вернуть. Список наблюдений автор приводит в исходной статье, и галлюцинация об удалённом файле там стоит в одном ряду с проблемами производительности, а не как курьёз.
Ограничения и статус проекта: версия 0.3, только Windows и NVIDIA
Ollivo сейчас в версии 0.3, и это ранняя версия. Ниже - ограничения, которые стоит учесть до установки.
Почему только Windows и NVIDIA
Поддерживаются только Windows и NVIDIA. О поддержке AMD и Intel не заявляется, сроков по ним нет. Владельцам Radeon, Arc и Linux-машин Ollivo сейчас не подходит, ждать или искать альтернативу - вопрос личного выбора, но обещаний от разработчика по этим платформам нет.
Отсутствие подписи Microsoft: что это значит на практике
Подписи Microsoft нет. Windows может показать предупреждение SmartScreen при первом запуске установщика. Это факт о состоянии поставки: цифровая подпись подтверждает издателя, а не отсутствие проблем внутри программы, и наоборот, её отсутствие само по себе не говорит о вредоносном коде.
Генерация изображений: чего ждать в следующих версиях
Генерация изображений появится в следующих версиях. ComfyUI уже указан как управляемый движок, но полноценный цикл работы с картинками пока не заявлен как готовый. Конкретных сроков источник не называет.
Складывая это вместе: Ollivo подойдёт тем, кто хочет запускать текстовые модели и работать с расшифровкой речи на Windows с картой NVIDIA, и пока не подойдёт тем, кому нужна генерация изображений из коробки или поддержка AMD. Актуальный статус автор фиксирует в описании проекта.
Для кого Ollivo: сценарии использования и сравнение с LM Studio и Ollama
Ollivo не заменяет LM Studio или Ollama. Он работает с тем, что уже есть на диске: находит модели и не копирует файлы. Поэтому вопрос не «переходить или нет», а «зачем второй инструмент рядом с первым».
Ollivo и LM Studio: в чём разница
LM Studio - отдельное приложение для запуска LLM со своим интерфейсом и каталогом моделей. Ollivo находит скачанные в LM Studio файлы и запускает их через llama.cpp. Рабочий сценарий: вы продолжаете хранить модели там, а Ollivo берёт те же файлы для чата, работы с документами и папкой проекта.
Полезно и другое: если поиск LM Studio приводит вас на сторонние страницы, разбор навигации по продуктам LM Studio и Bionic Agent помогает отличить нужное приложение от чужого лендинга.
Ollivo и Ollama: могут ли они работать вместе
Ollama запускает модели через командную строку и удобна для быстрого старта. Ollivo видит скачанные в Ollama модели и не дублирует их. Если у вас уже развёрнута Ollama, перекачивать гигабайты не придётся.
Разница в подходе, а не в моделях: разбор удобства Ollama и её ограничений показывает, где командный инструмент проигрывает визуальному управлению. Если нужен именно визуальный менеджер над llama.cpp с профилями запуска, несколькими endpoint'ами и OpenAI-совместимым API, стоит посмотреть на LLaMA.cpp Windows Manager - это другой инструмент с другим набором функций, и часть задач он закрывает иначе.
Работа с документами, фото и диктовка
Помимо текстового чата Ollivo умеет работать с документами: PDF, DOCX, ODT, TXT. Фото можно отправлять моделям со зрением. Есть диктовка и расшифровка записей, в том числе голосовых из Telegram. За распознавание речи отвечает whisper.cpp.
Это расширяет сценарии за пределы «поболтать с моделью»: расшифровать голосовое сообщение, разобрать PDF-документ, показать модели фотографию и получить текст. Для новичка такой набор снимает часть страха перед терминалом, для опытного пользователя - экономит обвязку из отдельных утилит.
Безопасность и контроль: режимы работы с файлами и откат изменений
Модель, которая умеет менять файлы в папке проекта, - это одновременно удобство и риск. Ollivo даёт три режима работы с папкой проекта.
Режим «Вручную»: полный контроль над изменениями
В режиме «Вручную» каждое изменение требует разрешения. Модель предлагает правку, вы её принимаете или отклоняете. Самый предсказуемый вариант для незнакомой кодовой базы и для файлов, которые жалко потерять.
Режим «Авто» и «План»: когда можно доверять модели
В режиме «Авто» модель может вносить изменения без подтверждения. В режиме «План» она только расписывает, что собирается сделать, и ничего не трогает. С учетом примера с моделью, отчитавшейся об удалении файла, «Авто» разумно включать на копии проекта или на задаче с быстрой проверкой результата, а «План» - когда нужно сначала понять замысел.
Откат изменений и сообщение об ошибке одной кнопкой
Любое изменение можно вернуть. Есть понятные ошибки с кнопками и «Сообщить о проблеме» одной кнопкой. Для ранней версии 0.3 это практично: не нужно вручную искать, что именно поменялось в файлах, и не нужно собирать логи для обращения к разработчику.
Как начать работу с Ollivo: мастер первого запуска
Первый запуск сводится к короткой проверке окружения, которую мастер проходит сам.
Проверка видеокарты, драйвера и диска
Мастер проверяет видеокарту и драйвер, предлагает диск. Это отсекает классические грабли: неподходящий GPU, устаревший драйвер, диск, на котором не хватит места под модель.
Проверка интернета и прокси
Мастер проверяет интернет и прокси. Сеть нужна для загрузки моделей и движков, поэтому если у вас прокси или нестандартный доступ, проверка покажет проблему до того, как вы начнёте качать 20 ГБ.
Права администратора не требуются
Ollivo не просит прав администратора. Это упрощает установку и снижает риск задеть системные каталоги: работа с файлами идёт в папке проекта, а не в корне диска.
Начинать стоит с простого шага: установить Ollivo на Windows с картой NVIDIA, дать мастеру проверить железо и посмотреть, какие модели он найдёт в уже установленных Ollama или LM Studio. Если терминал вам не мешает и хватает текущего инструмента, сначала можно пройти короткий путь на 8B-модели и сравнить ощущения: запуск DeepSeek R1 8B через Ollama занимает около 15 минут и даёт точку отсчёта. Держите в голове два ограничения: версия 0.3 ранняя, а генерация изображений ещё не готова.