Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

373 Parlor v2: каскадная архитектура как надёжная альтернатива GPT-Live на M3 Pro Разбираем Parlor v2 — локальную альтернативу GPT-Live на базе M3 Pro. Почему каскадная схема надёжнее end-to-end моделей, какие ограничения у дообучения Gemma 4 7 мин чтения 374 EdgeRazor: новый метод сжатия ИИ-моделей до 1,88 бит на параметр без потери качества EdgeRazor сжимает LLM до 1,88 бит на параметр без потери качества через смешанное квантование и дистилляцию с энтропийным управлением. Модели работают в llama.c 7 мин чтения 375 Governance для агентной разработки: как политики и рабочий процесс управляют автономным кодом Разбираем трёхуровневый Governance-стек для агентной разработки: 12 инженерных политик, 10 навыков, 7-фазный рабочий процесс. Как заменить ручное ревью при 10 0 11 мин чтения 376 Обновление Laguna-S-2.1: что изменилось и почему нужно переустановить веса Hugging Face полностью заменила репозиторий poolside/Laguna-S-2.1 (NVFP4). Новая конфигурация и веса требуют повторной загрузки: старые файлы несовместимы и выз 5 мин чтения 377 Этика и безопасность автономных AI-агентов: почему инцидент с Hugging Face важнее, чем кажется В июле 2026 года AI-агент OpenAI за 17 000 автономных действий взломал Hugging Face. Технический разбор инцидента: почему это не восстание машин, а инженерный п 7 мин чтения 378 Llama.cpp выпустила официальное приложение для Mac и упростила запуск сервера Команда llama.cpp выпустила llama.app — нативное macOS-приложение с управлением моделями из строки меню и автоматическим запуском API-сервера. Команда llama ser 6 мин чтения 379 DeepSeek V4 на M1 Ultra 128GB: как патч LM Studio ускорил инференс с 5 до 16 токенов/с Практический кейс: запуск DeepSeek V4 на Mac M1 Ultra 128GB с квантованием Unsloth UD-IQ3_XXS. Патч LM Studio поднял скорость с 5-6 до 15-16 токенов/с. Разбирае 6 мин чтения 380 DFSX против NVIDIA GB200: китайский ответ на дефицит памяти в AI-инференсе DFSX заявила о двукратном превосходстве над NVIDIA GB200 по пропускной способности памяти. Разбираем архитектуру, проверяем цифры и объясняем, что это значит дл 10 мин чтения 381 Почему квантование KV-кэша не подходит для DeepSeek V4 Flash: сравнительный анализ с Qwen 397B Независимые тесты: квантование KV-кэша с BF16 до Q8 вызывает у DeepSeek V4 Flash рост перплексии на 0.64% и падение top-p до 87.2%, тогда как Qwen 397B практиче 6 мин чтения 382 Двойной блок питания для рабочей станции: надёжность и безопасность конфигурации с двумя PSU Собрали практическое руководство по конфигурации рабочей станции с двумя блоками питания: синхронизация запуска через bridge-адаптер, распределение нагрузки меж 8 мин чтения 383 Что ждать от открытых релизов Qwen в 2026: прогнозы, модели и стратегия Alibaba Выпустит ли Alibaba открытые веса Qwen 3.7 в 2026? Анализируем паттерны релизов, тестируем Qwen 3.6 35B-A3B и community-форк Ornith 1.0, разбираем четыре вектор 9 мин чтения 384 Минимальные показатели производительности для локального запуска LLM в 2026 году: разбор PP и TG Какая скорость инференса нужна для комфортной работы с LLM локально в 2026 году? Разбираем пороговые значения PP (300-350 t/s) и TG (9 t/s) для кодинга и анализ 9 мин чтения