Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3181
TurboQuant от Google: тестирование метода экстремального квантования для локальных LLM
Практический гайд по тестированию метода TurboQuant от Google для сжатия LLM до 1-2 бит на вес. Установка, калибровка, сравнение с AWQ и GPTQ на актуальных моде
3182
Новый Figma MCP-сервер: как настроить AI-агента для автоматической сборки дизайна по вашей системе
Полное руководство по настройке Figma MCP-сервера в режиме read/write для автоматической сборки UI по вашей дизайн-системе с помощью AI-агентов. Актуально на ма
3183
Инцидент с AI-агентом Kiro в Amazon: как чрезмерные права и автономность привели к падению продакшена
Как автономный AI-агент Kiro в Amazon вызвал сбой в продакшене из-за чрезмерных прав. Уроки безопасности и управления для компаний.
3184
Интеграция TurboQuant в MLX Studio: инструкция по квантованию моделей для Apple Silicon
Полное руководство по интеграции TurboQuant в MLX Studio для квантования LLM под Apple Silicon. Шаги, ошибки, настройки на 2026 год.
3185
Litellm взломали: три альтернативы, которые не сломают вашу цепочку поставок
Обзор безопасных AI gateway после компрометации Litellm. Сравнение Bifrost 2.1, Kosong 0.9 и Helicone 1.6 на 2026 год по языку, производительности и лицензии.
3186
Весенний провал: SQL-инъекции в Spring AI и дыры в ONNX взрывают безопасность ИИ-стека
Критические уязвимости в Spring AI 3.5.0 и ONNX Runtime 1.20.0 позволяют проводить SQL-инъекции через векторные БД и обходить проверки моделей. Анализ CVE и защ
3187
Тупой бенчмарк для LLM: как 76% моделей галлюцинируют на простейшем вопросе 'current date'
Эксперимент: 76% языковых моделей дают неверный ответ на вопрос 'current date'. Почему LLM галлюцинируют на простом и как это тестировать. Методика тупого бенчм
3188
Как стабилизировать multi-agent циклы на локальных LLM: разбор архитектуры и промптов
Практический разбор EvidionAI для создания стабильных multi-agent систем на локальных LLM. Решение проблем doubt loops, skeptic agent и маршрутизации. Актуально
3189
TurboQuant от Google: как сжать KV-кэш и когда ждать квантование моделей
Новая технология TurboQuant от Google Research обещает сжать KV-кэш в 10 раз. Когда ждать квантование моделей и как это повлияет на локальный AI в 2026 году.
3190
Ни одна модель не знает чувашский: EduBench-RU проверил 22 LLM для российских учителей
Первый бенчмарк EduBench-RU тестирует 22 AI-модели для задач учителей: технологические карты ФГОС, задания ОГЭ, перевод на чувашский. Результаты шокируют.
3191
Per-row MSE quantization: практическое руководство по сжатию LLM до 15MB с минимальной потерей качества
Пошаговый гайд по per-row MSE quantization для сжатия больших языковых моделей. Код на PyTorch, сравнение BPB, оптимизация под edge-устройства.
3192
Локальный Qwen 3.5 на 16 ГБ GPU против облачного Kimi K2.5: тест скорости и точности
Детальное сравнение локального запуска Qwen 3.5 с квантованием unsloth q2_k_xl на 16 ГБ GPU и облачного Kimi K2.5. Метрики скорости 120 t/s, настройка LM Studio