Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
2305
DeepSeek V4 Flash и Pro: обзор архитектуры, бенчмарков и как запустить 1.6-триллионную модель локально
Подробный обзор DeepSeek V4 Flash и Pro. Архитектура MoE 1.6T параметров, бенчмарки против GPT-5 и Gemini 2.5, практическое руководство по запуску на своем желе
2306
DeepSeek-V4: как работает миллионный контекст для AI-агентов — архитектура KV cache и оптимизация FLOPs
Разбираем архитектуру DeepSeek-V4: Multi-head Latent Attention, сжатие KV cache, sparse attention. Сравнение с Gemini 1.5 Pro и GPT-4o. Примеры для AI-агентов.
2307
Робастный отбор переменных в скоринговой модели: метод с 4-фолдовой стратифицированной кросс-валидацией
Пошаговый гайд с кодом Python: как использовать 4-фолдовую стратифицированную кросс-валидацию для стабильного отбора переменных в скоринговых моделях. Пример на
2308
AWS Graviton для AI-инференса: как ARM-чипы меняют облачную инфраструктуру Meta
Meta делает ставку на AWS Graviton для inference AI-агентов. Разбираем, почему ARM-процессоры выгоднее GPU в облаке, и как это меняет рынок дата-центров.
2309
Как ИИ-агенты (Claude) автономно эксплуатируют уязвимости: демонстрация Blind SQL-инъекции на Ghost CMS
Демонстрация того, как Claude автономно проводит Blind SQL-инъекцию на Ghost CMS. Полный гайд с кодом, настройкой и разбором ошибок. Узнайте, как защититься.
2310
Как я оптимизировал AI-инструменты для iOS-разработки: Cursor, Claude Code, локальные Qwen и AGENTS.md
Личный опыт iOS-разработчика: как уменьшить AGENTS.md в 10 раз, настроить локальные Qwen на Mac M3, комбинировать Cursor и Claude Code для Xcode-проектов. Рабоч
2311
Моделирование загрузки промышленных GPU для LLM: доработка InferSim от Alibaba под российские реалии
Полный гайд по адаптации симулятора InferSim от Alibaba для российских GPU: микро-бенчмарки, метрики TTFT/TPOT/MFU, пошаговая настройка под серые A100 и китайск
2312
OpenAI Privacy Filter на русском: результаты тестирования и как улучшить поиск PII для кириллицы
Тестируем OpenAI Privacy Filter на русском языке. Выявляем слабые места (патронимы, ASR-артефакты, регистр). Даем код улучшения и пошаговое руководство.
2313
Как спасти Time-to-First-Token при пиковых нагрузках: настройка динамической лени с LazyGate для vLLM
Практический гайд по снижению Time-to-First-Token с помощью LazyGate. Динамическое управление max_tokens и системным промптом для vLLM. Настройка, конфигурация,
2314
Как использовать локальную LLM в качестве zero-shot классификатора текста: гайд с примерами
Научитесь классифицировать тексты без тонкой настройки и API. Используем локальную LLM (Ollama, llama.cpp) для zero-shot. Пошаговый план, примеры, ошибки.
2315
Закрытие DALL-E 2 и DALL-E 3: что пошло не так и какие альтернативы выбрать
OpenAI закрыла DALL-E 2 и DALL-E 3. Разбираем причины падения трафика на 80% и выбираем достойные замены: FLUX, Imagen 3, Adobe Firefly. Полный анализ рынка AI-
2316
DeepMind взламывает закон Мура для обучения: Decoupled DiLoCo позволяет тренировать LLM на дата-центрах через низкоскоростные каналы
Новая архитектура асинхронного обучения от DeepMind — Decoupled DiLoCo — решает проблему синхронизации при тренировке гигантских моделей на географически распре