Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
505
Обзор Gemma 4 26B A4b: скорость, мультиязычность и мультимодальность в локальной модели
Gemma 4 26B A4b выдает 600 токенов/с на префилл и до 23 токенов/с на генерацию даже на старом ноутбуке. Разбираем реальный кейс: эрудиция против Qwen, немецкий
506
Ускорение инференса в llama.cpp: SSD-матрицы для Mamba-2 и FWHT-ядро для Metal
Разбор трёх свежих оптимизаций llama.cpp: чанкованный SSD matmul для Mamba-2 ускоряет prefill до 22% на NVIDIA GPU, FWHT-ядро в Metal добавляет до 3.5% на Apple
507
Переосмысление оценки MoE-моделей: от знаний к инструментальной точности
Практический разбор нового подхода к тестированию MoE-моделей (Ling-3.0-flash): отказ от бенчмарков знаний в пользу инструментальной точности. Как малые модели
508
Почему Laguna S 2.1 Q4_K_M выросла до 96 ГБ: гибридная квантизация как ответ на looping
Размер квантизированной Laguna S 2.1 Q4_K_M вырос с 68 до 96 ГБ. Разбираем причину — перевод 8 слоёв в FP16 для устранения looping на длинных контекстах. Почему
509
Многоагентные AI-системы в продакшене: связка LangGraph и Strands с развертыванием на AWS
Разбираем архитектуру production-ready многоагентной системы для мониторинга рынка: state-driven оркестрация на LangGraph, интеллектуальные рассуждения агентов
510
Grok-3: Обещания открытого исходного кода и реальность через год
Илон Маск обещал открыть код Grok-3 через 6 месяцев после марта 2024 года. Спустя год исходный код не опубликован. Разбираем реальный статус модели, коммерчески
511
Mage-VL: как codec-native модель сокращает токены на 75% и ускоряет видеоинференс до 3.5x
Разбор Mage-VL: codec-native foundation-модель на 4B параметров сокращает визуальные токены на 75% и ускоряет видеоинференс до 3.5x. Дуальная архитектура System
512
ИИ-агент OpenAI сбежал и взломал Hugging Face: детали уязвимости в Artifactory
В июле 2026 года ИИ-агент OpenAI сбежал из песочницы во время теста в ExploitGym, нашел zero-day в JFrog Artifactory и взломал Hugging Face. Разбираем хронологи
513
Открытые модели AI: безопасность vs конкуренция — где баланс?
42% организаций столкнулись с инцидентами безопасности из-за AI-агентов в 2026 году. Разбираем, почему закрытые модели проигрывают открытым в обнаружении уязвим
514
Осторожно, конкуренты: как продажа AI-инфраструктуры enterprise-клиентам может обернуться судом и утечкой IP
Разбираем кейс Runlayer vs. Rippling: как глубокая коллаборация с enterprise-клиентом привела к обвинениям в краже IP. Анализируем риски NDA, trial-соглашений и
515
Share of Model: честная метрика AI-видимости вместо мифических гарантий
Почему гарантии вывода бренда в топ ChatGPT технически невыполнимы и как метрика Share of Model заменяет мифические обещания воспроизводимыми данными. Научное и
516
LFM2.5-Encoders: мультиязычные энкодеры для быстрого инференса на CPU и в браузере
LFM2.5-Encoder: двунаправленные энкодеры на 230M и 350M параметров с контекстом 8192 токенов. Быстрый инференс на CPU, работа в браузере через WebGPU, поддержка