Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
2761
Сравнение скорости квантований Bartowski и Unsloth для Gemma 4 26B: разбор причин разницы в 10 токенов/сек
Технический разбор: почему квантования Bartowski и Unsloth для Gemma 4 26B дают разницу в 10 токенов/сек при одинаковом размере файлов.
2762
Почему Gemma 4 проваливает Winogrande, но отлично работает на практике: разбор парадокса бенчмарков
Gemma 4 показывает низкие результаты на тесте Winogrande, но блестяще справляется с реальными задачами. Разбираемся, почему метрики вводят в заблуждение и как о
2763
Monarch v3: как ускорить вывод LLM на 78% с помощью NES-памяти подкачки KV cache
Monarch v3 решает проблему KV-кэша через NES-inspired подкачку. Ускорение inference до 78% с минимальным overhead VRAM. Актуально на 04.04.2026.
2764
Ваш старый телефон теперь AI-сервер: полный разбор OpenClaw на Android
Подробное руководство по превращению старого Android-смартфона в AI-сервер для OpenClaw. Настройка фонового режима, обход ограничений, интеграция с Telegram. Ак
2765
GLM-5 против Claude Opus: я целый год управлял стартапом двумя AI и вот что в итоге
Итоги реального годового теста: GLM-5 Ultra конкурирует с Claude Opus v3.2 в управлении бизнесом, но стоит в 11 раз дешевле. Подробный разбор затрат и качества.
2766
Gemma 4 MoE: рекордные 120 TPS на двух RTX 3090 для локальных LLM и агентов
Рекордные 120 токенов в секунду от Gemma 4 MoE на двух RTX 3090. Как архитектура MoE ускоряет локальные LLM и агентские workflow. Актуально на 04.04.2026.
2767
19 локальных LLM на Strix Halo: Gemma 4 против Qwen 3.5 и других — полный тест для homelab
Полный бенчмарк 19 локальных LLM на APU AMD Strix Halo (04.2026). Сравнение производительности, качества и энергопотребления Gemma 4, Qwen 3.5 и других моделей
2768
Luminarys AI: обзор платформы для безопасных AI-агентов с изоляцией на WebAssembly
Подробный разбор платформы Luminarys AI для создания изолированных AI-агентов на WebAssembly. Сравнение с Docker и LangChain, примеры использования на Rust и Go
2769
Пошаговая настройка Gemma 4 для реального перевода японских игр на английский через LunaTranslator
Полный гайд по запуску Gemma 4 от Google для перевода японских визуальных новелл. Квантование Q5_K_M, интеграция с LunaTranslator и text-generation-webui. Работ
2770
Qwen tokenizer на C++: как ускорить обработку текста в 20 раз против Tiktoken
Обзор header-only токенизатора для Qwen на C++. Сравнение с Tiktoken, примеры использования и рекомендации для разработчиков LLM на 03.04.2026.
2771
Яндекс Code Assistant без Яндекса: зачем и как запустить локально с Ollama и Qdrant
Полная инструкция по установке Яндекс Code Assistant в VSCode с локальными Ollama и векторной БД Qdrant для приватной разработки на 2026 год.
2772
Gemma 4 против Qwen3.5: когда KV cache съедает вашу видеопамять и как это исправить
Gemma 4 требует много VRAM из-за кэша KV. Узнайте, как оптимизировать память с помощью квантования и стоит ли выбрать Qwen3.5. Актуально на 2026 год.