Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
2653
Auto-SKILLs: как Gemma 4 создаёт навыки для агентов, наблюдая за действиями на экране
Как Gemma 4 автоматически создает навыки для AI-агентов, наблюдая за действиями пользователя на экране. Обзор возможностей, сравнение с аналогами и примеры испо
2654
InCoder-32B-Thinking: обзор открытой LLM для генерации кода под микроконтроллеры и GPU
Обзор InCoder-32B-Thinking — открытой модели для генерации кода на Verilog и CUDA. Возможности, сравнение с альтернативами, примеры использования.
2655
FATE: как ускорить вывод MoE-моделей в llama.cpp с помощью кэша экспертов и prefetching
Обзор FATE - форка llama.cpp с кэшем экспертов и prefetching для ускорения вывода MoE-моделей. Примеры с Qwen3-30B.
2656
EUPE от Meta: под микроскопом. Зачем вам еще один vision-энкодер, и почему он резко сократит ваш счет за облако
Разбираем EUPE от Meta - компактный vision encoder меньше 100M параметров. Как установить, где использовать и стоит ли он внимания в 2026 году.
2657
Memory Sparse Attention: 100 миллионов токенов в контексте. Это конец всем предыдущим хитам?
Технология Memory Sparse Attention обещает контекст в 100 млн токенов для локальных LLM. Как это работает и почему это перевернет все в 2026 году?
2658
Как выбрать лучший GGUF-квант для Gemma 4 31B: сравнение по KL divergence и практические рекомендации
Актуальный гайд на 2026 год: сравниваем все кванты Gemma 4 31B по KL divergence, смотрим размеры и даем рекомендации для слабого железа.
2659
Файловый доступ для AI-агента: как избежать ошибок с KV-кэшем и реализовать permission gate
Глубокий разбор бага с динамическим временем в промпте, убивающим KV-кэш llama.cpp, и реализация permission gate для безопасного доступа к файлам. Практическое
2660
TurboQuant для Gemma 4 31B: как использовать KV-сжатие 3-bit для работы с длинным контекстом
Практическое руководство по применению TurboQuant с PolarQuant для сжатия KV-кэша Gemma 4 31B. Экономим память, работаем с контекстом до 256K токенов.
2661
MCP-Manticore: как подключить AI-ассистента к поисковому движку для автоматизации SQL-запросов
Обзор MCP-Manticore — MCP-сервера для подключения AI-ассистентов к поисковому движку Manticore. Автоматизируйте сложные SQL-запросы в Cursor IDE и Claude Code б
2662
Gemma 4 на iPhone 17 Pro: самый быстрый мобильный LLM по токенам в секунду
Тесты показывают, что Gemma 4 на новом iPhone 17 Pro генерирует текст быстрее всех конкурентов. Разбираем результаты бенчмарка и что это значит для мобильных ас
2663
Ускорение Q8_0 моделей в 3.1 раза на Intel Arc: фикс переупорядочивания в llama.cpp
Исправление переупорядочивания в llama.cpp повышает загрузку памяти видеокарт Intel Arc, ускоряя генерацию 8-битных моделей втрое. Актуально на 2026 год.
2664
Q1_0 — ядерная бомба для сжатия моделей: как 1-битное квантование ggml запускает монстров на CPU
Разбираем прорывной 1-битный формат Q1_0 в ggml: как радикально сжимать LLM для запуска на обычных CPU с минимальной памятью в 2026 году.