Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
6181
DGX Spark: тестирование реальной производительности матричного умножения (GEMM) и анализ аномалий INT4
Практическое тестирование реальной производительности матричного умножения на DGX Spark. Анализ аномалий INT4, сравнение TFLOP, настройка CUDA ядер и оптимизаци
6182
Локальные LLM против интернет-цензуры: как настроить Gemma3 и Qwen3 для обхода блокировок
Пошаговый гайд по настройке локальных LLM (Gemma3 12B, Qwen3 8B) для автономной работы без интернета. Обход блокировок, офлайн-модели, llama.cpp.
6183
Multi-Head Latent Attention: как DeepSeek переизобрела механизм внимания и почему это работает быстрее
Полный разбор Multi-Head Latent Attention от DeepSeek с кодом на PyTorch. Оптимизации KV-cache, сравнение с MHA/GQA/MQA и практическая реализация.
6184
SAM 3 против специализированных детекторов: реальные цифры, которые заставят вас передумать
Сравнение Segment Anything Model 3 с кастомными детекторами: время инференса 1100ms на P100, точность и когда тренировать свою модель бессмысленно.
6185
Sovereign JARVIS: Как совет из 7 AI-агентов заменит персонального ассистента в 2026
Разбираем революционную архитектуру персонального AI-ассистента с советом агентов, гранулярным управлением доступом и shared memory. Актуально на январь 2026.
6186
RTX 4090 48GB: Хардверный хак от Northridge Fix, который NVIDIA скрывает
Пошаговое руководство по замене памяти на RTX 4090 до 48 ГБ. Модификация для запуска Llama 3.3 405B локально. Все риски, инструменты и тесты производительности.
6187
Zerotap: Android превращается в автономный AI-ассистент с контролем экрана
Обзор Zerotap: как превратить Android в приватного AI-ассистента с поддержкой Ollama, контролем экрана и MCP серверами. Полная автономность и приватность.
6188
TrustifAI: как оценить доверие к ответам LLM и отладить галлюцинации в RAG-системах
Глубокий разбор TrustifAI: метрики Evidence Coverage, Semantic Drift, Trust Score и визуализации Reasoning Graphs для отладки RAG-систем. Сравнение с альтернати
6189
Как заставить opensource-модель говорить как Claude: системные промпты, которые превращают Llama в харизматичного ассистента
Готовые промпты и техники, чтобы opensource-модели (Llama 3.3, Qwen 2.5, MiniMax M3) общались как Claude. Без API-ключей и подписок.
6190
SOSM: графовая архитектура, которая пытается забыть про трансформеры
Технический разбор SOSM (Self-Organizing State Model) - открытой графовой архитектуры LLM. Исходный код, сравнение с трансформерами и Mamba, реальные перспектив
6191
Как развернуть локального ИИ-ассистента для кода с OpenCode и Docker Model Runner: гайд по приватности и экономии
Полный гайд по развертыванию приватного ИИ-ассистента для программирования на своем железе. Экономия, безопасность кода, настройка OpenCode и Docker Model Runne
6192
Настройка Minisforum AI X1 Pro под llama.cpp Vulkan: оптимизация для запуска 120B моделей
Полная настройка Minisforum AI X1 Pro под llama.cpp Vulkan для запуска 120B моделей. BIOS, GRUB, драйверы, оптимизация AMD Radeon 890M.