Троичные нейросети обещают 16-кратное сжатие и работу без GPU, но реальные тесты Bonsai 27B показывают: платить за это приходится качеством, которое пока неприемлемо для большинства практических задач. Разбираемся, почему теория расходится с практикой и что должно измениться, чтобы ternary-подход перестал быть нишевым экспериментом.
Практические тесты Ternary-Bonsai-27B на Terminal-Bench 2.0 дали 7.9% - это ниже, чем у Qwen3.5-9B с её 9.2%. При этом 1-битная версия модели уходит в бесконечную генерацию, выдавая 14 тысяч токенов без стоп-сигнала. Такой результат ставит под сомнение применимость экстремального квантования для агентных сценариев. Но означает ли это, что троичный подход обречён? Ответ не бинарный.
Чтобы понять, что происходит, нужно разобрать три слоя проблемы: математические ограничения ternary-весов, незрелость инфраструктуры и фундаментальные трудности обучения. Пройдём по каждому.
Что такое троичные нейросети и почему о них говорят
Троичная нейросеть использует веса, принимающие только три значения: -1, 0 и 1. В отличие от стандартных float32-моделей, где каждый вес занимает 32 бита, ternary-вес требует всего 2 бита. Теоретически это даёт сжатие в 16 раз и полный отказ от операций с плавающей точкой при инференсе - умножение на -1, 0 или 1 превращается в смену знака или обнуление.
Идея не нова. Ternary-сети обсуждались ещё в 2016 году, но только в 2024-2025 годах появились первые крупные реализации. Prism-ML с семейством Bonsai стала одной из первых компаний, попытавшихся масштабировать подход до размеров, пригодных для практического использования. Результат - Bonsai 27B, модель, которая весит около 5 ГБ и теоретически способна работать на устройствах без дискретного GPU.
Математика ternary: как работают веса -1, 0, 1
Прямой проход в нейросети - это умножение входного вектора на матрицу весов. В float32-модели каждое умножение требует перемножения двух чисел с плавающей точкой. В ternary-модели умножение на -1 меняет знак, на 0 обнуляет, на 1 сохраняет значение. Это не просто быстрее - это принципиально другая операция, которую можно реализовать на уровне целочисленной арифметики или даже специализированных аналоговых схем.
Проблема начинается там, где заканчивается математика прямого прохода. Веса -1, 0, 1 могут закодировать лишь три состояния для каждого параметра. Float32-вес различает 4 миллиарда градаций. Потеря информации при ternarization колоссальна - вопрос лишь в том, насколько модель способна компенсировать это увеличенным числом параметров. Bonsai 27B пытается ответить именно на этот вопрос: 27 миллиардов параметров, каждый из которых в 16 раз «беднее» float32-аналога.
Энергоэффективность как главный аргумент
Инференс большой языковой модели на GPU потребляет от 200 до 700 Вт в зависимости от размера и нагрузки. Ternary-модель, выполняющая только целочисленные операции, может работать на CPU с энергопотреблением 15-65 Вт. Для edge-устройств, IoT-сенсоров и сценариев с батарейным питанием это критический разрыв.
Рынок ждёт решений, способных запускать LLM на смартфонах без облака. Локальные AI-ассистенты, офлайн-переводчики, системы мониторинга - все эти сценарии требуют моделей, которые помещаются в 4-8 ГБ оперативной памяти и не разряжают батарею за час. Тесты Bonsai 27B в 8GB VRAM показывают, что модель действительно запускается в таких условиях, но качество генерации становится платой за доступность.
Bonsai 27B: что показали практические тесты
Prism-ML выпустила Bonsai 27B с амбициозным позиционированием: модель, которая даёт качество 27B-уровня при ресурсах 2B-модели. Практические тесты рисуют иную картину. На Terminal-Bench 2.0, бенчмарке для агентных задач, Ternary-Bonsai-27B набирает 7.9%. Для сравнения: Qwen3.5-9B с традиционным квантованием показывает 9.2%, а Qwen3.6-35B-A3B - 24.3%. Разрыв не просто значительный - он качественный: модель не дотягивает до уровня вчетверо меньших традиционных аналогов.
Ситуация усугубляется при переходе к 1-битной версии. Модель теряет способность останавливать генерацию, уходя в циклы самовалидации. Это не баг реализации - это фундаментальное следствие потери информации: веса перестают нести достаточно сигнала для определения конца последовательности.
Сравнение с традиционными 27B-моделями: цифры
| Бенчмарк | Bonsai 27B (2-bit) | Qwen3.5-9B (4-bit) | Qwen3.6-35B-A3B |
|---|---|---|---|
| Terminal-Bench 2.0 | 7.9% | 9.2% | 24.3% |
| MMLU (оценка) | ~42% | ~58% | ~72% |
| HellaSwag (оценка) | ~55% | ~68% | ~80% |
Цифры по MMLU и HellaSwag - оценочные, основанные на данных из model cards и независимых тестов сообщества. Точные значения варьируются в зависимости от конфигурации инференса, но тренд однозначен: Bonsai 27B проигрывает не только моделям своего размера, но и значительно меньшим аналогам с традиционным квантованием.
Где Bonsai 27B справляется, а где - нет
Модель сохраняет базовую связность текста в простых сценариях: суммаризация коротких документов, ответы на фактологические вопросы, простые классификации. Проблемы начинаются при усложнении задачи.
Логические цепочки из трёх и более шагов Bonsai 27B регулярно обрывает или зацикливает. Генерация кода страдает от синтаксических ошибок, которые традиционные модели того же размера не допускают. Креативные задачи - написание текстов с заданной стилистикой, построение аналогий - выполняются на уровне моделей 3-7B параметров.
Практическая ниша для Bonsai 27B сегодня - это задачи, где критично энергопотребление, а качество вторично: роутинг запросов, детекция интентов, простые чат-боты с ограниченным доменом. Дообучение через ternary_QAT может улучшить показатели в узких доменах, но не решает фундаментальных ограничений архитектуры.
Почему троичные модели пока проигрывают: технический разбор
Разрыв между теорией и практикой упирается в три фактора: сложность обучения, отсутствие нативной аппаратной поддержки и фундаментальные ограничения ternarization как метода сжатия. Разберём каждый.
4-битная квантизация через GPTQ или AWQ работает, потому что сохраняет градации внутри слоя. Веса округляются до ближайшего значения из 16 возможных - это грубо, но различимо. Ternary-подход оставляет всего три градации на вес. Чтобы компенсировать эту потерю, модель должна либо наращивать число параметров, либо использовать сложные схемы масштабирования. Bonsai 27B идёт по первому пути, но 27 миллиардов ternary-параметров не эквивалентны 27 миллиардам float32-параметров - эффективная ёмкость модели значительно ниже.
Проблема обучения: градиенты и ternarization
Обучать ternary-сеть напрямую невозможно: градиент функции, выдающей только -1, 0, 1, равен нулю почти везде. Стандартный обходной путь - Straight-Through Estimator (STE), который притворяется, что производная ternarization равна единице. Это работает для простых задач, но для глубоких сетей с миллиардами параметров накопленная ошибка градиента разрушает обучение.
Альтернативный подход - дистилляция: сначала обучается полновесная модель, затем её знания переносятся в ternary-архитектуру. Prism-ML использовала именно этот метод для Bonsai 27B. Проблема в том, что дистилляция сама по себе теряет часть информации, а поверх неё накладывается потеря от ternarization. Результат - двойной штраф к качеству.
Железо и софт: где поддержка?
Нативных ядер для ternary-операций нет ни в CUDA, ни в ROCm, ни в один из актуальных бэкендов инференса. Умножение на -1, 0, 1 эмулируется через целочисленные операции, которые не оптимизированы под эту задачу. Для сравнения: 4-битное и 8-битное квантование имеет зрелую экосистему - llama.cpp, vLLM, TensorRT-LLM поддерживают эти форматы на уровне ядер.
Фреймворки для ternary-инференса - bitnet.cpp и аналоги - находятся в ранней стадии. Они работают, но не дают того прироста скорости, который обещает теория. Без аппаратной поддержки энергоэффективность ternary-моделей остаётся теоретической: CPU выполняет эмулированные операции, и реальное энергопотребление снижается не в разы, а на десятки процентов.
Прогноз на 2026: станут ли троичные модели зрелыми?
Традиционные модели продолжают расти в качестве быстрее, чем ternary-подход сокращает разрыв. Claude Opus 5 по состоянию на июль 2026 года набирает 30.2% на ARC-AGI-3 и 97.5% на ARC-AGI-1 при максимальном усилении рассуждений - это результаты, которые ternary-модели не могут даже аппроксимировать. Прогнозы по открытым 27B-моделям показывают, что к концу 2026 года традиционные архитектуры этого размера приблизятся к уровню GPT-5.6, в то время как ternary-аналоги останутся на периферии.
Инвестиции в ternary-исследования растут, но медленно. Основные лаборатории - Prism-ML, Nota AI с методом REAP для прунинга - фокусируются на гибридных подходах, где ternary-слои комбинируются с полновесными. Чистые ternary-архитектуры остаются академическими проектами.
Что должно произойти для прорыва
Первый необходимый шаг - новые методы обучения, которые не полагаются на STE и дистилляцию. Исследования в области обучения с дискретными весами через стохастические методы или reinforcement learning показывают обнадёживающие результаты, но до масштабирования на 27B+ параметров ещё далеко.
Второй шаг - аппаратная поддержка. Пока производители чипов не увидят рыночный спрос, они не будут встраивать ternary-ядра в GPU и NPU. Спрос появится, только когда ternary-модели покажут конкурентоспособное качество. Это классическая проблема курицы и яйца, которая тормозит развитие.
Третий шаг - успешный крупный проект. Если какая-либо компания выпустит ternary-модель, которая на реальных задачах не уступает 4-битным аналогам при вдвое меньшем энергопотреблении, это запустит цепную реакцию. Bonsai 27B таким проектом не стал.
Практические рекомендации: стоит ли внедрять троичные модели сейчас
Короткий ответ: для задач, требующих высокого качества генерации, ternary-модели не готовы. Разрыв в бенчмарках слишком велик, а риски - от бесконечной генерации до фактических ошибок - перевешивают экономию на железе.
Альтернативы существуют и работают. 4-битная квантизация через GPTQ или AWQ сжимает традиционные модели в 4-8 раз с минимальной потерей качества. Дистилляция позволяет уменьшить размер модели на порядок, сохраняя приемлемую производительность. Looped Transformer в Nanbeige4.2-3B показывает, как архитектурные инновации могут дать прирост эффективности без экстремального квантования.
Экспериментировать с Bonsai 27B имеет смысл в двух сценариях. Первый: вы работаете над системой, где критично энергопотребление, а задачи ограничены простой классификацией или роутингом. Второй: вы исследуете ternary-подход и готовы к тому, что модель потребует значительной доработки. Для всех остальных случаев традиционные модели с умеренным квантованием остаются практичным выбором.