Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

2761 Сравнение скорости квантований Bartowski и Unsloth для Gemma 4 26B: разбор причин разницы в 10 токенов/сек Технический разбор: почему квантования Bartowski и Unsloth для Gemma 4 26B дают разницу в 10 токенов/сек при одинаковом размере файлов. 4 мин чтения 2762 Почему Gemma 4 проваливает Winogrande, но отлично работает на практике: разбор парадокса бенчмарков Gemma 4 показывает низкие результаты на тесте Winogrande, но блестяще справляется с реальными задачами. Разбираемся, почему метрики вводят в заблуждение и как о 4 мин чтения 2763 Monarch v3: как ускорить вывод LLM на 78% с помощью NES-памяти подкачки KV cache Monarch v3 решает проблему KV-кэша через NES-inspired подкачку. Ускорение inference до 78% с минимальным overhead VRAM. Актуально на 04.04.2026. 5 мин чтения 2764 Ваш старый телефон теперь AI-сервер: полный разбор OpenClaw на Android Подробное руководство по превращению старого Android-смартфона в AI-сервер для OpenClaw. Настройка фонового режима, обход ограничений, интеграция с Telegram. Ак 7 мин чтения 2765 GLM-5 против Claude Opus: я целый год управлял стартапом двумя AI и вот что в итоге Итоги реального годового теста: GLM-5 Ultra конкурирует с Claude Opus v3.2 в управлении бизнесом, но стоит в 11 раз дешевле. Подробный разбор затрат и качества. 4 мин чтения 2766 Gemma 4 MoE: рекордные 120 TPS на двух RTX 3090 для локальных LLM и агентов Рекордные 120 токенов в секунду от Gemma 4 MoE на двух RTX 3090. Как архитектура MoE ускоряет локальные LLM и агентские workflow. Актуально на 04.04.2026. 5 мин чтения 2767 19 локальных LLM на Strix Halo: Gemma 4 против Qwen 3.5 и других — полный тест для homelab Полный бенчмарк 19 локальных LLM на APU AMD Strix Halo (04.2026). Сравнение производительности, качества и энергопотребления Gemma 4, Qwen 3.5 и других моделей 9 мин чтения 2768 Luminarys AI: обзор платформы для безопасных AI-агентов с изоляцией на WebAssembly Подробный разбор платформы Luminarys AI для создания изолированных AI-агентов на WebAssembly. Сравнение с Docker и LangChain, примеры использования на Rust и Go 5 мин чтения 2769 Пошаговая настройка Gemma 4 для реального перевода японских игр на английский через LunaTranslator Полный гайд по запуску Gemma 4 от Google для перевода японских визуальных новелл. Квантование Q5_K_M, интеграция с LunaTranslator и text-generation-webui. Работ 8 мин чтения 2770 Qwen tokenizer на C++: как ускорить обработку текста в 20 раз против Tiktoken Обзор header-only токенизатора для Qwen на C++. Сравнение с Tiktoken, примеры использования и рекомендации для разработчиков LLM на 03.04.2026. 4 мин чтения 2771 Яндекс Code Assistant без Яндекса: зачем и как запустить локально с Ollama и Qdrant Полная инструкция по установке Яндекс Code Assistant в VSCode с локальными Ollama и векторной БД Qdrant для приватной разработки на 2026 год. 6 мин чтения 2772 Gemma 4 против Qwen3.5: когда KV cache съедает вашу видеопамять и как это исправить Gemma 4 требует много VRAM из-за кэша KV. Узнайте, как оптимизировать память с помощью квантования и стоит ли выбрать Qwen3.5. Актуально на 2026 год. 8 мин чтения