Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
6049
Как создать локальный диктофон для Windows с потреблением <50MB RAM на Whisper и Native AOT
Пошаговое руководство по созданию офлайн-диктофона для Windows с использованием квантованного Whisper и Native AOT для экономии памяти и приватности.
6050
AI Grand Prix: как Anduril превратила автономные гонки дронов в оружие для охоты на гениев
Palmer Luckey устраивает автономные гонки дронов с призом в $500K. Это не шоу — это новый способ найти лучших AI-инженеров для оборонных проектов.
6051
Две RTX PRO 6000 и терабайт памяти: выдержит ли эта станция 20 одновременных пользователей?
Реальные тесты производительности, сравнение fp8 vs int4, анализ масштабируемости и ограничений KV-cache на серверной рабочей станции с 1.15TB RAM.
6052
MiniMax-M2.1-REAP: новые квантования 139B и 172B моделей для локального запуска
Обзор новых квантований REAP для MiniMax M2.1: 139B и 172B параметров для локального запуска. Сравнение версий, требования к железу, практическое применение.
6053
Офлайн-ассистент за 11 минут: RunAnywhere SDK + форк Expo — больше никаких облачных API
Практический гайд по созданию полностью офлайн голосового ассистента с локальными моделями без облачных API. RunAnywhere SDK + форк Expo для быстрого старта.
6054
Заголовочный конвейер: как большие языковые модели разбирают глобализацию на запчасти
Глубокий анализ на 27.01.2026: почему GPT-5, Claude 4 и другие LLM делают гигантские фабрики невыгодными и возвращают производство домой.
6055
Qwen3-32B INT4: как получить 12-кратный прирост емкости с потерей точности 1.8%
Практический гайд по квантованию Qwen3-32B до INT4: 12-кратный прирост емкости модели с потерей точности менее 2% на бенчмарках MMLU-Pro. Подробный разбор метод
6056
Полная утечка системного промпта Kimi K2.5: разбор инструментов и техник prompt engineering
Полный разбор утекшего системного промпта Kimi K2.5 от Moonshot AI. Инструменты, memory-протоколы, техники prompt engineering на 27.01.2026.
6057
Subquadratic Attention: как NVIDIA взломала 1M контекст на одном RTX 5090
Разбор технологии subquadratic attention от NVIDIA: как получить контекст 1M токенов на 30B модели с одной видеокартой. Архитектура, бенчмарки, сравнение с альт
6058
Kimi-K2.5 на vLLM: почему TTFT убивает производительность и как это исправить
Полный разбор проблем с Time To First Token в Kimi-K2.5 на vLLM. Настройка для 128k контекста, бенчмарк производительности и оптимизация токенизатора. Практичес
6059
Как обучить Gemma-3 270M для обфускации данных: инструкция по финтюну с Unsloth и датасетом на 1700 примеров
Полное руководство по обучению Gemma-3 270M для анонимизации данных на португальском языке с Unsloth. Датасет 1700 примеров, код, ошибки.
6060
OpenAI Prism: как новый AI-воркспейс на GPT-5.2 ускорит научные исследования и написание статей
Обзор нового инструмента OpenAI Prism на основе GPT-5.2 для ускорения научной работы, написания статей и формальной верификации данных.