Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

2653 Auto-SKILLs: как Gemma 4 создаёт навыки для агентов, наблюдая за действиями на экране Как Gemma 4 автоматически создает навыки для AI-агентов, наблюдая за действиями пользователя на экране. Обзор возможностей, сравнение с аналогами и примеры испо 5 мин чтения 2654 InCoder-32B-Thinking: обзор открытой LLM для генерации кода под микроконтроллеры и GPU Обзор InCoder-32B-Thinking — открытой модели для генерации кода на Verilog и CUDA. Возможности, сравнение с альтернативами, примеры использования. 4 мин чтения 2655 FATE: как ускорить вывод MoE-моделей в llama.cpp с помощью кэша экспертов и prefetching Обзор FATE - форка llama.cpp с кэшем экспертов и prefetching для ускорения вывода MoE-моделей. Примеры с Qwen3-30B. 5 мин чтения 2656 EUPE от Meta: под микроскопом. Зачем вам еще один vision-энкодер, и почему он резко сократит ваш счет за облако Разбираем EUPE от Meta - компактный vision encoder меньше 100M параметров. Как установить, где использовать и стоит ли он внимания в 2026 году. 7 мин чтения 2657 Memory Sparse Attention: 100 миллионов токенов в контексте. Это конец всем предыдущим хитам? Технология Memory Sparse Attention обещает контекст в 100 млн токенов для локальных LLM. Как это работает и почему это перевернет все в 2026 году? 5 мин чтения 2658 Как выбрать лучший GGUF-квант для Gemma 4 31B: сравнение по KL divergence и практические рекомендации Актуальный гайд на 2026 год: сравниваем все кванты Gemma 4 31B по KL divergence, смотрим размеры и даем рекомендации для слабого железа. 6 мин чтения 2659 Файловый доступ для AI-агента: как избежать ошибок с KV-кэшем и реализовать permission gate Глубокий разбор бага с динамическим временем в промпте, убивающим KV-кэш llama.cpp, и реализация permission gate для безопасного доступа к файлам. Практическое 6 мин чтения 2660 TurboQuant для Gemma 4 31B: как использовать KV-сжатие 3-bit для работы с длинным контекстом Практическое руководство по применению TurboQuant с PolarQuant для сжатия KV-кэша Gemma 4 31B. Экономим память, работаем с контекстом до 256K токенов. 7 мин чтения 2661 MCP-Manticore: как подключить AI-ассистента к поисковому движку для автоматизации SQL-запросов Обзор MCP-Manticore — MCP-сервера для подключения AI-ассистентов к поисковому движку Manticore. Автоматизируйте сложные SQL-запросы в Cursor IDE и Claude Code б 5 мин чтения 2662 Gemma 4 на iPhone 17 Pro: самый быстрый мобильный LLM по токенам в секунду Тесты показывают, что Gemma 4 на новом iPhone 17 Pro генерирует текст быстрее всех конкурентов. Разбираем результаты бенчмарка и что это значит для мобильных ас 5 мин чтения 2663 Ускорение Q8_0 моделей в 3.1 раза на Intel Arc: фикс переупорядочивания в llama.cpp Исправление переупорядочивания в llama.cpp повышает загрузку памяти видеокарт Intel Arc, ускоряя генерацию 8-битных моделей втрое. Актуально на 2026 год. 5 мин чтения 2664 Q1_0 — ядерная бомба для сжатия моделей: как 1-битное квантование ggml запускает монстров на CPU Разбираем прорывной 1-битный формат Q1_0 в ggml: как радикально сжимать LLM для запуска на обычных CPU с минимальной памятью в 2026 году. 6 мин чтения