Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3181 TurboQuant от Google: тестирование метода экстремального квантования для локальных LLM Практический гайд по тестированию метода TurboQuant от Google для сжатия LLM до 1-2 бит на вес. Установка, калибровка, сравнение с AWQ и GPTQ на актуальных моде 7 мин чтения 3182 Новый Figma MCP-сервер: как настроить AI-агента для автоматической сборки дизайна по вашей системе Полное руководство по настройке Figma MCP-сервера в режиме read/write для автоматической сборки UI по вашей дизайн-системе с помощью AI-агентов. Актуально на ма 9 мин чтения 3183 Инцидент с AI-агентом Kiro в Amazon: как чрезмерные права и автономность привели к падению продакшена Как автономный AI-агент Kiro в Amazon вызвал сбой в продакшене из-за чрезмерных прав. Уроки безопасности и управления для компаний. 4 мин чтения 3184 Интеграция TurboQuant в MLX Studio: инструкция по квантованию моделей для Apple Silicon Полное руководство по интеграции TurboQuant в MLX Studio для квантования LLM под Apple Silicon. Шаги, ошибки, настройки на 2026 год. 7 мин чтения 3185 Litellm взломали: три альтернативы, которые не сломают вашу цепочку поставок Обзор безопасных AI gateway после компрометации Litellm. Сравнение Bifrost 2.1, Kosong 0.9 и Helicone 1.6 на 2026 год по языку, производительности и лицензии. 4 мин чтения 3186 Весенний провал: SQL-инъекции в Spring AI и дыры в ONNX взрывают безопасность ИИ-стека Критические уязвимости в Spring AI 3.5.0 и ONNX Runtime 1.20.0 позволяют проводить SQL-инъекции через векторные БД и обходить проверки моделей. Анализ CVE и защ 5 мин чтения 3187 Тупой бенчмарк для LLM: как 76% моделей галлюцинируют на простейшем вопросе 'current date' Эксперимент: 76% языковых моделей дают неверный ответ на вопрос 'current date'. Почему LLM галлюцинируют на простом и как это тестировать. Методика тупого бенчм 6 мин чтения 3188 Как стабилизировать multi-agent циклы на локальных LLM: разбор архитектуры и промптов Практический разбор EvidionAI для создания стабильных multi-agent систем на локальных LLM. Решение проблем doubt loops, skeptic agent и маршрутизации. Актуально 6 мин чтения 3189 TurboQuant от Google: как сжать KV-кэш и когда ждать квантование моделей Новая технология TurboQuant от Google Research обещает сжать KV-кэш в 10 раз. Когда ждать квантование моделей и как это повлияет на локальный AI в 2026 году. 3 мин чтения 3190 Ни одна модель не знает чувашский: EduBench-RU проверил 22 LLM для российских учителей Первый бенчмарк EduBench-RU тестирует 22 AI-модели для задач учителей: технологические карты ФГОС, задания ОГЭ, перевод на чувашский. Результаты шокируют. 5 мин чтения 3191 Per-row MSE quantization: практическое руководство по сжатию LLM до 15MB с минимальной потерей качества Пошаговый гайд по per-row MSE quantization для сжатия больших языковых моделей. Код на PyTorch, сравнение BPB, оптимизация под edge-устройства. 9 мин чтения 3192 Локальный Qwen 3.5 на 16 ГБ GPU против облачного Kimi K2.5: тест скорости и точности Детальное сравнение локального запуска Qwen 3.5 с квантованием unsloth q2_k_xl на 16 ГБ GPU и облачного Kimi K2.5. Метрики скорости 120 t/s, настройка LM Studio 8 мин чтения