Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

5125 Запуск 80B MoE-модели на iGPU NAS: пошаговая оптимизация llama.cpp с Vulkan для AMD Ryzen AI Практический гайд по запуску Qwen3-Coder-Next 80B MoE на встроенной графике NAS через llama.cpp Vulkan. От 3 до 18 токен/с на AMD Ryzen AI с квантованием Q4_K_M 8 мин чтения 5126 Swarmcore: ваш домашний Deep Research без подписки на Google Создавайте сложные агентские цепочки на локальных LLM с помощью Swarmcore. Аналог Gemini Deep Research без облаков. 5 мин чтения 5127 35x ускорение в llama.cpp: почему ngram-mod не работает и как исправить CRLF/LF Пошаговое руководство по настройке ngram-mod в llama.cpp для 35x ускорения. Исправляем проблему с CRLF/LF в VS Code и git. Анализ производительности на 11.02.20 8 мин чтения 5128 Dreaming Engine: как обратный обход графа спасает RAG от катастрофического забывания Как работает Dreaming Engine на основе Inverse Graph Traversal для решения проблемы катастрофического забывания в RAG-системах. Практическое руководство на 2026 8 мин чтения 5129 SAE Steering сломал JSON: почему популярный метод от Anthropic разрушает структурированный вывод 6 экспериментов показывают: активационное стеринг-управление (SAE Steering) разрушает JSON-вывод LLM. Обзор методов, которые действительно работают в 2026 году. 8 мин чтения 5130 Персональный автокомплит для Discord: как заставить Qwen 14B говорить вашими словами Пошаговый гайд по созданию персонального автокомплита для Discord: скрапинг сообщений, QLoRA финтюнинг Qwen 14B, развертывание в Ollama и Chrome-расширение. 9 мин чтения 5131 Как собрать inference-сервер на Threadripper для 24/7 работы с большими моделями: сравнение TRX40 vs TRX50, GPU и бюджета Практический гайд по сборке сервера для 24/7 инференса больших моделей на Threadripper. Сравнение TRX40 и TRX50, выбор GPU (RTX 6000 Pro, A40, L40S), бюджет от 9 мин чтения 5132 MiniCPM-o 4.5 теперь говорит: Full Duplex голосовой и видеочат на вашем компьютере Полная инструкция по установке голосового и видеочата MiniCPM-o 4.5 с Full Duplex на Windows и Linux. One-click installer, Docker, CUDA поддержка. 5 мин чтения 5133 UI-TARS от Bytedance: локальный агент, который щелкает твой рабочий стол как орехи Полный обзор UI-TARS от Bytedance — локального AI-агента с моделью 7B для автоматизации задач на рабочем столе. Установка, сравнение, примеры использования. 7 мин чтения 5134 Mycelium Memory Hub: как настроить персистентную память и общение между AI-агентами в реальном времени Настройка Mycelium Memory Hub - SQLite/PostgreSQL хранилище с WebSocket и MCP-серверами для общения AI-агентов в реальном времени. Готовое решение для контекста 8 мин чтения 5135 MOHAWK: как изолировать AI-агентов так, чтобы они не сбежали и не убили вашу инфраструктуру Глубокий разбор MOHAWK - фреймворка для изоляции AI-агентов. 4 слоя безопасности: WebAssembly, Zero-Trust Manifests, TPM, Circuit Breaker. Практическая реализац 11 мин чтения 5136 CPU-only инференс LLM: полное руководство по оптимизации скорости и памяти без видеокарты Полное руководство по запуску локальных LLM на CPU без видеокарты. Оптимизация llama.cpp, настройка RAM, выбор моделей и реальные тесты производительности на 10 9 мин чтения