Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

4729 LLM для анализа постмортемов: как Zalando автоматизировал разбор инцидентов и выжил Практический гайд по использованию LLM для автоматического анализа постмортемов инцидентов. На основе кейса Zalando с Postgres, AWS, Elasticsearch. 9 мин чтения 4730 Vulkan для локальных LLM на NVIDIA в 2026: состояние, установка и сравнение с CUDA Полный гайд по использованию Vulkan API через NVK драйвер для запуска локальных LLM на NVIDIA без CUDA. Установка, тесты производительности, сравнение с CUDA на 9 мин чтения 4731 Автономный ИИ-сотрудник на OpenAI API: пошаговый гайд по автоматизации бизнес-процессов с Batch API и Structured Outputs Пошаговое руководство по созданию автономного ИИ-сотрудника на OpenAI API с использованием Batch API, Structured Outputs и RAG. Автоматизация бизнес-процессов в 10 мин чтения 4732 Февральский взрыв: Opus 4.6, GPT-5.3-Codex и китайский GLM-5 меняют правила игры Обзор ключевых релизов AI февраля 2026: контекст в 1M токенов, агентные команды, финансирование стартапов и война за кодеров. 5 мин чтения 4733 Qwen3.5-397B-A17B на домашнем железе: когда 2 видеокарты — это почти достаточно Практический гайд по запуску модели Qwen3.5-397B-A17B на домашнем железе с EPYC 7402p и 2x3090Ti. Реальные результаты, настройки llama.cpp и оптимизация под огр 6 мин чтения 4734 Запуск Qwen3.5-397B на 128GB GPU: детальный разбор smol-IQ2_XS квантования в llama.cpp Практическое руководство по запуску Qwen3.5-397B на 128GB GPU с smol-IQ2_XS квантованием в llama.cpp. Детали, команды, сравнение с альтернативами. 7 мин чтения 4735 Как с нуля написать и обучить Трансформер на чистом Python и Numpy: полный гайд с кодом Пошаговое создание Transformer с нуля на чистом Python и Numpy. Реализация автограда, внимания, обучения. Полный код без PyTorch/TensorFlow. 10 мин чтения 4736 Как работает «режим размышления» в модели Nanbeige4.1-3B: анализ внутреннего диалога LLM Разбор внутреннего диалога LLM на примере Nanbeige4.1-3B. Как работает chain-of-thought reasoning и как им управлять через промпты. Актуально на 2026 год. 6 мин чтения 4737 Как собрать кластер из разных видеокарт для запуска больших LLM: практический гайд на примере Qwen3-Coder-30B Пошаговый гайд по сборке кластера из разнородных видеокарт для запуска 30B-моделей. Настройка llama.cpp RPC, квантование Q4_K_S, конфигурация для RTX 5080, 3060 9 мин чтения 4738 Почему вы платите больше за худшие результаты: парадокс настроек усилия в GPT-5 и Gemini Flash 3 Исследование Deep Research Bench показывает: дорогие настройки GPT-5 и Gemini Flash 3 снижают точность веб-поиска. Как сэкономить до 2x без потери качества. 8 мин чтения 4739 Локальные модели 20-100B для кодинга: как не промахнуться с выбором и не сжечь видеокарту Практический гайд по выбору локальной LLM для кодинга: сравниваем Qwen3-32B-Coder, GLM-4.7-Flash, DeepSeek-Coder, считаем VRAM, тестируем на реальных задачах. О 9 мин чтения 4740 Ваш смартфон теперь AI-сервер: ставим приватного ассистента с Qwen3 и Stable Diffusion Запускаем локальный Qwen3, Stable Diffusion и Whisper на Android/iOS. Полная приватность, работа без интернета, сравнение CPU/GPU. Инструкция на февраль 2026. 9 мин чтения