Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
25
Почему преимущество Nvidia в AI смещается от GPU к системной оркестрации
Производительность AI-дата-центра всё меньше определяется одной видеокартой. Разбираем, как память, KV-кэш, PCIe, сеть, prefill, decode и программный стек форми
26
Тихий апдейт GGUF-файлов Ornith 1.5 35B: что изменилось и стоит ли обновляться?
Тихая замена GGUF может скрывать новую квантизацию, смену checkpoint или обычную правку метаданных. Разбираем, как проверить Ornith 1.5 35B Q4_K_M по SHA-256, c
27
Tencent Hunyuan Hy4 и квантизация Q1: что означают 1-битные модели на практике
Разбираем Q1-квантизацию Tencent Hunyuan Hy4 и объясняем, почему заявленная «1-битность», вероятно, означает около 2.38 bpw. Узнайте, как это влияет на VRAM, RA
28
Как построить морфоанализатор для малоресурсного языка с нуля: кейс ингушского языка в 2026 году
Практический разбор создания морфоанализатора для ингушского языка с нуля: архитектура, словарь, корпусная и носительская проверка, обработка омонимии и трассир
29
Claude Code и Codex: как выбрать coding agent под задачу в 2026 году
Claude Code или Codex для разработки в 2026 году? Практическая матрица выбора по типу задачи, контексту, числу итераций и уровню автономности. Разбираем огранич
30
Как довести вайбкоденный голосовой AI-сервис до прода: где демо превращается в инженерную задачу
Разбираем, как превратить эффектное голосовое AI-демо в сервис для продакшена и продаж. VAD, ASR, LLM, TTS, streaming, VRAM, квантизация, логи и воспроизводимые
31
Tencent сжала Hy4-preview с 1.5 ТБ до 200 ГБ в GGUF: что известно о сохранении 98% производительности
Tencent заявила о сокращении Hy4-preview с 1.5 ТБ до 200 ГБ в GGUF при сохранении около 98% производительности. Разбираем, что означают эти цифры на практике, х
32
Exo Labs и кластеризация Mac Studio: почему bandwidth и latency снова важны для локальных LLM
Разбираем, когда кластер Mac Studio действительно помогает запускать локальные LLM, почему суммарный memory bandwidth не равен линейному ускорению и где latency
33
Запуск больших LLM на 16 ГБ VRAM: реальность, offloading и ожидания
Разбираем, что происходит при запуске Qwen3.8-Flash-Next на 16 ГБ VRAM, 64 ГБ RAM и SSD: почему offloading в llama.cpp снижает скорость примерно до 6 ток/с и гд
34
Как разные LLM проходят Political Compass: что показывает этот тест и где у него ограничения
Разбираем, что на самом деле показывает Political Compass при сравнении разных LLM, почему одна и та же модель меняет ответы из-за промпта и системных настроек
35
Бенчмарки Tenstorrent QuietBox 2 на Qwen3.7-27B: что они говорят о возможностях p300c
Честный разбор редких упоминаний Tenstorrent QuietBox 2 и p300c: какие цифры по Qwen3.7-27B можно считать доказанными, что меняет тест без MTP и каких данных не
36
LLM и человек: модель мира, контекст и ограничения языковых моделей
Чем предсказание токенов в LLM отличается от человеческой модели мира? Разбираем роль контекста, памяти, телесности и predictive coding, объясняем причины галлю