Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

25 Почему преимущество Nvidia в AI смещается от GPU к системной оркестрации Производительность AI-дата-центра всё меньше определяется одной видеокартой. Разбираем, как память, KV-кэш, PCIe, сеть, prefill, decode и программный стек форми 14 мин чтения 26 Тихий апдейт GGUF-файлов Ornith 1.5 35B: что изменилось и стоит ли обновляться? Тихая замена GGUF может скрывать новую квантизацию, смену checkpoint или обычную правку метаданных. Разбираем, как проверить Ornith 1.5 35B Q4_K_M по SHA-256, c 9 мин чтения 27 Tencent Hunyuan Hy4 и квантизация Q1: что означают 1-битные модели на практике Разбираем Q1-квантизацию Tencent Hunyuan Hy4 и объясняем, почему заявленная «1-битность», вероятно, означает около 2.38 bpw. Узнайте, как это влияет на VRAM, RA 10 мин чтения 28 Как построить морфоанализатор для малоресурсного языка с нуля: кейс ингушского языка в 2026 году Практический разбор создания морфоанализатора для ингушского языка с нуля: архитектура, словарь, корпусная и носительская проверка, обработка омонимии и трассир 15 мин чтения 29 Claude Code и Codex: как выбрать coding agent под задачу в 2026 году Claude Code или Codex для разработки в 2026 году? Практическая матрица выбора по типу задачи, контексту, числу итераций и уровню автономности. Разбираем огранич 16 мин чтения 30 Как довести вайбкоденный голосовой AI-сервис до прода: где демо превращается в инженерную задачу Разбираем, как превратить эффектное голосовое AI-демо в сервис для продакшена и продаж. VAD, ASR, LLM, TTS, streaming, VRAM, квантизация, логи и воспроизводимые 12 мин чтения 31 Tencent сжала Hy4-preview с 1.5 ТБ до 200 ГБ в GGUF: что известно о сохранении 98% производительности Tencent заявила о сокращении Hy4-preview с 1.5 ТБ до 200 ГБ в GGUF при сохранении около 98% производительности. Разбираем, что означают эти цифры на практике, х 10 мин чтения 32 Exo Labs и кластеризация Mac Studio: почему bandwidth и latency снова важны для локальных LLM Разбираем, когда кластер Mac Studio действительно помогает запускать локальные LLM, почему суммарный memory bandwidth не равен линейному ускорению и где latency 11 мин чтения 33 Запуск больших LLM на 16 ГБ VRAM: реальность, offloading и ожидания Разбираем, что происходит при запуске Qwen3.8-Flash-Next на 16 ГБ VRAM, 64 ГБ RAM и SSD: почему offloading в llama.cpp снижает скорость примерно до 6 ток/с и гд 11 мин чтения 34 Как разные LLM проходят Political Compass: что показывает этот тест и где у него ограничения Разбираем, что на самом деле показывает Political Compass при сравнении разных LLM, почему одна и та же модель меняет ответы из-за промпта и системных настроек 9 мин чтения 35 Бенчмарки Tenstorrent QuietBox 2 на Qwen3.7-27B: что они говорят о возможностях p300c Честный разбор редких упоминаний Tenstorrent QuietBox 2 и p300c: какие цифры по Qwen3.7-27B можно считать доказанными, что меняет тест без MTP и каких данных не 8 мин чтения 36 LLM и человек: модель мира, контекст и ограничения языковых моделей Чем предсказание токенов в LLM отличается от человеческой модели мира? Разбираем роль контекста, памяти, телесности и predictive coding, объясняем причины галлю 12 мин чтения