Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
2149
Memory MCP для LLM: гибридный поиск BM25+вектора+RRF на Qwen3.5-4B — установка и настройка
Пошаговая установка и настройка Memory MCP сервера для долговременной памяти LLM. Гибридный поиск BM25 + векторные эмбеддинги + RRF ранжирование на Qwen3.5-4B.
2150
EDEN: Как старый алгоритм квантования 2021 года уделал TurboQuant (и почему об этом молчат)
Разбор алгоритма EDEN для сжатия эмбеддингов, градиентов и KV-кэша. Почему случайное вращение + Lloyd-Max квантование работают лучше TurboQuant. Код Python и бе
2151
Запуск Qwen3.6-27B с agentic search на одной 3090: достижение 95.7% SimpleQA локально
Как запустить Qwen3.6-27B с агентическим поиском на одной RTX 3090 и обогнать GPT-4o в фактологической точности. Инструкция и тесты.
2152
Гибридный инференс LLM на Android: llama.cpp + LiteRT + NPU/GPU — первый опыт
Разбираем первый опыт гибридного инференса LLM на Android: llama.cpp + LiteRT с задействованием NPU/GPU. Сравнение с альтернативами, примеры настройки и практич
2153
Объединяем GPU в домашний кластер: mDNS и ZeroConf для распределенного обучения LLM без боли
Как настроить автоматическое обнаружение узлов через mDNS для распределенного обучения LLM на домашнем кластере. Пошаговый гайд с Avahi и PyTorch Distributed.
2154
OBLITERATUS: новый уровень red-teaming для MoE моделей — почему Heretic уже не тянет
Разбираем инструмент elder_plinus для red-teaming MoE моделей. Сравнение с Heretic, примеры атак и выводы для пентестеров. Актуально на май 2026.
2155
Исследование: 'Теплые' AI-модели чаще ошибаются при грустном пользователе — выводы для разработчиков
Исследование Nature: эмпатичные AI-ассистенты с высоким fine-tuning дают больше ошибок, когда пользователь в плохом настроении. Выводы для разработчиков.
2156
Лучшая agentic‑модель для кода на MacBook M5 Max: бенчмарки, квантования и настройка
Подробный гайд по выбору и настройке agentic LLM для кодинга на MacBook M5 Max. Сравнение Qwen2.5‑Coder, DeepSeek Coder, GLM-5. GGUF, MLX, производительность.
2157
Реальная стоимость GenAI в продакшене: от демо до enterprise — полный разбор затрат
Полный разбор скрытых затрат GenAI: инфраструктура, RAG, guardrails, масштабирование. Как не разориться на AI в 2026 году.
2158
LLM Engineer: профессия-призрак или новый золотой стандарт?
Анализ путаницы в вакансиях LLM Engineer: кто нужен работодателям — промпт-инженер, RAG-специалист или ML-исследователь? Реальные навыки и требования в 2026 год
2159
Скиллы Claude Code: как сэкономить $1000 и автоматизировать рутину с помощью маркетплейса (спойлер: там есть сессионные отчёты)
Малоизвестная фича Claude Code — скиллы из marketplace. Разбираем session-report, MCP-интеграции и способы сэкономить на API. Пошаговый гайд с примерами для Dev
2160
Как получить работу в AI-эре: советы для junior от рекрутера с опытом 500+ собеседований
Рекрутер с 500+ собеседованиями делится секретами: как выделиться среди джунов в 2026 году, не пытаться обмануть AI и показать реальную ценность.