Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3445
Nemotron-3-Super-120B дистиллирована от Claude 4.6: когда 120 миллиардов параметров помещаются в ваш ноутбук
Практический обзор дистиллированной Nemotron-3-Super-120B от Claude 4.6. Сравнение форматов BF16, FP8, GGUF и инструкция по локальному запуску мощной модели.
3446
SPEED-Bench: когда спекулятивное декодирование перестает быть магией и становится цифрами
Полный обзор SPEED-Bench — нового стандарта для оценки скорости спекулятивного декодирования в больших языковых моделях. Примеры использования и сравнения.
3447
Кейс Т-Банка: как умный фильтр поднял качество AI Code Completion
Как Т-Банк увеличил Acceptance Rate AI-подсказок с 20% до 65% с помощью умного фильтра. Реальный кейс из продакшена.
3448
Автоматизация CRM: пайплайн из YandexGPT и МТС Exolve для Bitrix24 на Python
Пошаговый гайд по созданию пайплайна для автоматической обработки звонков и анализа лидов в Bitrix24 с помощью YandexGPT и МТС Exolve на Python. BANT анализ, ве
3449
AFM MLX: как ускорить локальные LLM на Mac с помощью нативного Swift-инструмента
Узнайте, как AFM MLX ускоряет локальные LLM на Apple Silicon с помощью нативного Swift, batch mode и prefix cache. Сравнение с альтернативами и примеры использо
3450
Гибридное квантование Qwen3.5 27B: сравнение Steampunque Q6_K_H и Unsloth K_XL
Подробный разбор гибридного квантования Qwen3.5 27B. Сравнение производительности, точности и памяти между Steampunque Q6_K_H и Unsloth K_XL. Практический гайд
3451
Виртуальные двойники в медицине: как цифровые копии пациентов спасают жизни
Как Boston Children's Hospital использует виртуальные копии сердца для планирования операций. Технологии, риски и будущее на 19 марта 2026.
3452
Оптимизация AI-агентов для Raspberry Pi: как заменить тяжёлые фреймворки на детерминированный роутинг и LLM
Пошаговый гайд по замене LangChain на легковесную гибридную архитектуру для AI-агентов на Raspberry Pi. Увеличьте скорость в 5 раз и уменьшите потребление памят
3453
Fine-tuning Qwen2-0.5B для автоматизации задач: полный гайд с LoRA, квантованием GGUF и запуском на CPU
Пошаговый гайд по fine-tuning Qwen2-0.5B с помощью LoRA, квантованию в формат GGUF и запуску на обычном CPU для автоматизации задач. Актуально на март 2026.
3454
30 паттернов инженерии ИИ-систем: разбор антипаттернов и лучших практик от экспертов
Экспертный разбор 30 ключевых паттернов и антипаттернов в архитектуре AI-систем на 2026 год. RAG, LLMops, промпт-инжиниринг от практиков.
3455
95.2% против промпт-инъекций: как разреженные автоэнкодеры стали детективами для LLM
Новый метод на основе разреженных автоэнкодеров и FP-Growth детектирует инъекции в промпты с точностью 95.2% и задержкой <5 мс. Механистическая интерпретируемос
3456
CompactifAI: как технологии сжатия Multiverse Computing позволяют запускать мощные модели локально
Как работает CompactifAI от Multiverse Computing. Технология квантового сжатия для запуска GPT-4o-class моделей на ноутбуке. Сравнение, примеры, кому подойдет в