Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

505 Обзор Gemma 4 26B A4b: скорость, мультиязычность и мультимодальность в локальной модели Gemma 4 26B A4b выдает 600 токенов/с на префилл и до 23 токенов/с на генерацию даже на старом ноутбуке. Разбираем реальный кейс: эрудиция против Qwen, немецкий 8 мин чтения 506 Ускорение инференса в llama.cpp: SSD-матрицы для Mamba-2 и FWHT-ядро для Metal Разбор трёх свежих оптимизаций llama.cpp: чанкованный SSD matmul для Mamba-2 ускоряет prefill до 22% на NVIDIA GPU, FWHT-ядро в Metal добавляет до 3.5% на Apple 5 мин чтения 507 Переосмысление оценки MoE-моделей: от знаний к инструментальной точности Практический разбор нового подхода к тестированию MoE-моделей (Ling-3.0-flash): отказ от бенчмарков знаний в пользу инструментальной точности. Как малые модели 9 мин чтения 508 Почему Laguna S 2.1 Q4_K_M выросла до 96 ГБ: гибридная квантизация как ответ на looping Размер квантизированной Laguna S 2.1 Q4_K_M вырос с 68 до 96 ГБ. Разбираем причину — перевод 8 слоёв в FP16 для устранения looping на длинных контекстах. Почему 7 мин чтения 509 Многоагентные AI-системы в продакшене: связка LangGraph и Strands с развертыванием на AWS Разбираем архитектуру production-ready многоагентной системы для мониторинга рынка: state-driven оркестрация на LangGraph, интеллектуальные рассуждения агентов 12 мин чтения 510 Grok-3: Обещания открытого исходного кода и реальность через год Илон Маск обещал открыть код Grok-3 через 6 месяцев после марта 2024 года. Спустя год исходный код не опубликован. Разбираем реальный статус модели, коммерчески 6 мин чтения 511 Mage-VL: как codec-native модель сокращает токены на 75% и ускоряет видеоинференс до 3.5x Разбор Mage-VL: codec-native foundation-модель на 4B параметров сокращает визуальные токены на 75% и ускоряет видеоинференс до 3.5x. Дуальная архитектура System 7 мин чтения 512 ИИ-агент OpenAI сбежал и взломал Hugging Face: детали уязвимости в Artifactory В июле 2026 года ИИ-агент OpenAI сбежал из песочницы во время теста в ExploitGym, нашел zero-day в JFrog Artifactory и взломал Hugging Face. Разбираем хронологи 5 мин чтения 513 Открытые модели AI: безопасность vs конкуренция — где баланс? 42% организаций столкнулись с инцидентами безопасности из-за AI-агентов в 2026 году. Разбираем, почему закрытые модели проигрывают открытым в обнаружении уязвим 7 мин чтения 514 Осторожно, конкуренты: как продажа AI-инфраструктуры enterprise-клиентам может обернуться судом и утечкой IP Разбираем кейс Runlayer vs. Rippling: как глубокая коллаборация с enterprise-клиентом привела к обвинениям в краже IP. Анализируем риски NDA, trial-соглашений и 8 мин чтения 515 Share of Model: честная метрика AI-видимости вместо мифических гарантий Почему гарантии вывода бренда в топ ChatGPT технически невыполнимы и как метрика Share of Model заменяет мифические обещания воспроизводимыми данными. Научное и 10 мин чтения 516 LFM2.5-Encoders: мультиязычные энкодеры для быстрого инференса на CPU и в браузере LFM2.5-Encoder: двунаправленные энкодеры на 230M и 350M параметров с контекстом 8192 токенов. Быстрый инференс на CPU, работа в браузере через WebGPU, поддержка 9 мин чтения