Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

2305 DeepSeek V4 Flash и Pro: обзор архитектуры, бенчмарков и как запустить 1.6-триллионную модель локально Подробный обзор DeepSeek V4 Flash и Pro. Архитектура MoE 1.6T параметров, бенчмарки против GPT-5 и Gemini 2.5, практическое руководство по запуску на своем желе 1 мин чтения 2306 DeepSeek-V4: как работает миллионный контекст для AI-агентов — архитектура KV cache и оптимизация FLOPs Разбираем архитектуру DeepSeek-V4: Multi-head Latent Attention, сжатие KV cache, sparse attention. Сравнение с Gemini 1.5 Pro и GPT-4o. Примеры для AI-агентов. 7 мин чтения 2307 Робастный отбор переменных в скоринговой модели: метод с 4-фолдовой стратифицированной кросс-валидацией Пошаговый гайд с кодом Python: как использовать 4-фолдовую стратифицированную кросс-валидацию для стабильного отбора переменных в скоринговых моделях. Пример на 7 мин чтения 2308 AWS Graviton для AI-инференса: как ARM-чипы меняют облачную инфраструктуру Meta Meta делает ставку на AWS Graviton для inference AI-агентов. Разбираем, почему ARM-процессоры выгоднее GPU в облаке, и как это меняет рынок дата-центров. 5 мин чтения 2309 Как ИИ-агенты (Claude) автономно эксплуатируют уязвимости: демонстрация Blind SQL-инъекции на Ghost CMS Демонстрация того, как Claude автономно проводит Blind SQL-инъекцию на Ghost CMS. Полный гайд с кодом, настройкой и разбором ошибок. Узнайте, как защититься. 6 мин чтения 2310 Как я оптимизировал AI-инструменты для iOS-разработки: Cursor, Claude Code, локальные Qwen и AGENTS.md Личный опыт iOS-разработчика: как уменьшить AGENTS.md в 10 раз, настроить локальные Qwen на Mac M3, комбинировать Cursor и Claude Code для Xcode-проектов. Рабоч 8 мин чтения 2311 Моделирование загрузки промышленных GPU для LLM: доработка InferSim от Alibaba под российские реалии Полный гайд по адаптации симулятора InferSim от Alibaba для российских GPU: микро-бенчмарки, метрики TTFT/TPOT/MFU, пошаговая настройка под серые A100 и китайск 5 мин чтения 2312 OpenAI Privacy Filter на русском: результаты тестирования и как улучшить поиск PII для кириллицы Тестируем OpenAI Privacy Filter на русском языке. Выявляем слабые места (патронимы, ASR-артефакты, регистр). Даем код улучшения и пошаговое руководство. 7 мин чтения 2313 Как спасти Time-to-First-Token при пиковых нагрузках: настройка динамической лени с LazyGate для vLLM Практический гайд по снижению Time-to-First-Token с помощью LazyGate. Динамическое управление max_tokens и системным промптом для vLLM. Настройка, конфигурация, 7 мин чтения 2314 Как использовать локальную LLM в качестве zero-shot классификатора текста: гайд с примерами Научитесь классифицировать тексты без тонкой настройки и API. Используем локальную LLM (Ollama, llama.cpp) для zero-shot. Пошаговый план, примеры, ошибки. 6 мин чтения 2315 Закрытие DALL-E 2 и DALL-E 3: что пошло не так и какие альтернативы выбрать OpenAI закрыла DALL-E 2 и DALL-E 3. Разбираем причины падения трафика на 80% и выбираем достойные замены: FLUX, Imagen 3, Adobe Firefly. Полный анализ рынка AI- 4 мин чтения 2316 DeepMind взламывает закон Мура для обучения: Decoupled DiLoCo позволяет тренировать LLM на дата-центрах через низкоскоростные каналы Новая архитектура асинхронного обучения от DeepMind — Decoupled DiLoCo — решает проблему синхронизации при тренировке гигантских моделей на географически распре 5 мин чтения