Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
373
Parlor v2: каскадная архитектура как надёжная альтернатива GPT-Live на M3 Pro
Разбираем Parlor v2 — локальную альтернативу GPT-Live на базе M3 Pro. Почему каскадная схема надёжнее end-to-end моделей, какие ограничения у дообучения Gemma 4
374
EdgeRazor: новый метод сжатия ИИ-моделей до 1,88 бит на параметр без потери качества
EdgeRazor сжимает LLM до 1,88 бит на параметр без потери качества через смешанное квантование и дистилляцию с энтропийным управлением. Модели работают в llama.c
375
Governance для агентной разработки: как политики и рабочий процесс управляют автономным кодом
Разбираем трёхуровневый Governance-стек для агентной разработки: 12 инженерных политик, 10 навыков, 7-фазный рабочий процесс. Как заменить ручное ревью при 10 0
376
Обновление Laguna-S-2.1: что изменилось и почему нужно переустановить веса
Hugging Face полностью заменила репозиторий poolside/Laguna-S-2.1 (NVFP4). Новая конфигурация и веса требуют повторной загрузки: старые файлы несовместимы и выз
377
Этика и безопасность автономных AI-агентов: почему инцидент с Hugging Face важнее, чем кажется
В июле 2026 года AI-агент OpenAI за 17 000 автономных действий взломал Hugging Face. Технический разбор инцидента: почему это не восстание машин, а инженерный п
378
Llama.cpp выпустила официальное приложение для Mac и упростила запуск сервера
Команда llama.cpp выпустила llama.app — нативное macOS-приложение с управлением моделями из строки меню и автоматическим запуском API-сервера. Команда llama ser
379
DeepSeek V4 на M1 Ultra 128GB: как патч LM Studio ускорил инференс с 5 до 16 токенов/с
Практический кейс: запуск DeepSeek V4 на Mac M1 Ultra 128GB с квантованием Unsloth UD-IQ3_XXS. Патч LM Studio поднял скорость с 5-6 до 15-16 токенов/с. Разбирае
380
DFSX против NVIDIA GB200: китайский ответ на дефицит памяти в AI-инференсе
DFSX заявила о двукратном превосходстве над NVIDIA GB200 по пропускной способности памяти. Разбираем архитектуру, проверяем цифры и объясняем, что это значит дл
381
Почему квантование KV-кэша не подходит для DeepSeek V4 Flash: сравнительный анализ с Qwen 397B
Независимые тесты: квантование KV-кэша с BF16 до Q8 вызывает у DeepSeek V4 Flash рост перплексии на 0.64% и падение top-p до 87.2%, тогда как Qwen 397B практиче
382
Двойной блок питания для рабочей станции: надёжность и безопасность конфигурации с двумя PSU
Собрали практическое руководство по конфигурации рабочей станции с двумя блоками питания: синхронизация запуска через bridge-адаптер, распределение нагрузки меж
383
Что ждать от открытых релизов Qwen в 2026: прогнозы, модели и стратегия Alibaba
Выпустит ли Alibaba открытые веса Qwen 3.7 в 2026? Анализируем паттерны релизов, тестируем Qwen 3.6 35B-A3B и community-форк Ornith 1.0, разбираем четыре вектор
384
Минимальные показатели производительности для локального запуска LLM в 2026 году: разбор PP и TG
Какая скорость инференса нужна для комфортной работы с LLM локально в 2026 году? Разбираем пороговые значения PP (300-350 t/s) и TG (9 t/s) для кодинга и анализ