Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
13
Как Open ASR Leaderboard начал учитывать Hindi и Indian English: почему ASR-бенчмаркам нужны новые языки и метаданные
Open ASR Leaderboard добавил Hindi и Indian English, показав, почему одного общего WER недостаточно для честного сравнения ASR-моделей. Разбираем роль метаданны
14
DGX Spark: практические результаты тестов DeepSeek V4 Flash, Qwen3.8 Flash Next и Qwen3.8-27B
Разбираем, как честно сравнивать DeepSeek V4 Flash, Qwen3.8 Flash Next, Qwen3.8-27B и Qwen3.6-35B-A3B на четырёх DGX Spark. Объясняем, почему пиковые 80 tok/s н
15
Qwen 3.8 Next UD IQ1_S против Qwen 3.8 27B UD Q4: есть ли смысл в ультранизкой квантизации
Практическое сравнение Qwen 3.8 Next UD IQ1_S и Qwen 3.8 27B UD Q4 без выдуманных бенчмарков: разберем экономию VRAM, возможные потери качества, влияние offload
16
Qwen3.8-Flash-Next и mmap: почему tensor-read-lazy не спасает от нехватки памяти
Qwen3.8-Flash-Next может не помещаться в память даже при включенном tensor-read-lazy. Разбираем разницу между mmap и load-mode auto, влияние --ngl, --split-mode
17
Что будет с локальными LLM, если frontier-лабы потеряют позиции в 2026 году
Ослабление frontier-лабораторий не уничтожит локальные LLM, но способно изменить цены на GPU, стоимость инференса и баланс между открытыми и закрытыми моделями.
18
Как потратить $4000 на AI-апгрейд: второй GPU, локальные модели и практичный сценарий для кодинга и медиа
Разбираем, как потратить $4000 на AI-апгрейд без переплаты: выбрать вторую GPU, отдельный AI-сервер или улучшить память, накопитель и программный стек. Сравнива
19
Как запустить Qwen 27B с контекстом 100K на 16 ГБ GPU через beellama.cpp
Практический разбор запуска Qwen 27B на GPU с 16 ГБ VRAM через beellama.cpp и llama-server. Разбираем квантование, KV cache, контекст 100K, tail precision, spec
20
GLM-5.3-Flash или DeepSeek-V4-Flash-0731 локально: HumanEval, nvfp4, VRAM и контекст
Практическое сравнение GLM-5.3-Flash и DeepSeek-V4-Flash-0731 для локального запуска: что проверять в HumanEval, как nvfp4 влияет на VRAM и скорость, почему раз
21
MTPLX ускоряет локальный запуск Qwen на Apple Silicon: как работает новый подход к MTP
Разбираем, как MTPLX связывает MTP, draft depth и MLX-ready конвертацию для ускорения Qwen на Apple Silicon. Объясняем разницу между prefill и decode, ограничен
22
Как собрать локального исследовательского агента на небольшой LLM и какие данные для этого нужны
Разбираем, как собрать локального исследовательского агента на небольшой LLM: зачем нужны RAG и внешние инструменты, почему arXiv-абстрактов недостаточно и каки
23
Почему китайским LLM важно догнать уровень Opus-класса и что это меняет для рынка
Разбираем, что означает «догнать Opus» для китайских LLM, где разница в качестве действительно влияет на результат и почему AI-рынок смещается от токенов к вычи
24
Как заменить RAG более дешевыми NLP-методами в enterprise-документах
Разбираем, чем заменить RAG в enterprise-документах: точным совпадением, нормализацией OCR-шума, словарями, классификаторами и embeddings. Показываем каскадную