Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
4729
LLM для анализа постмортемов: как Zalando автоматизировал разбор инцидентов и выжил
Практический гайд по использованию LLM для автоматического анализа постмортемов инцидентов. На основе кейса Zalando с Postgres, AWS, Elasticsearch.
4730
Vulkan для локальных LLM на NVIDIA в 2026: состояние, установка и сравнение с CUDA
Полный гайд по использованию Vulkan API через NVK драйвер для запуска локальных LLM на NVIDIA без CUDA. Установка, тесты производительности, сравнение с CUDA на
4731
Автономный ИИ-сотрудник на OpenAI API: пошаговый гайд по автоматизации бизнес-процессов с Batch API и Structured Outputs
Пошаговое руководство по созданию автономного ИИ-сотрудника на OpenAI API с использованием Batch API, Structured Outputs и RAG. Автоматизация бизнес-процессов в
4732
Февральский взрыв: Opus 4.6, GPT-5.3-Codex и китайский GLM-5 меняют правила игры
Обзор ключевых релизов AI февраля 2026: контекст в 1M токенов, агентные команды, финансирование стартапов и война за кодеров.
4733
Qwen3.5-397B-A17B на домашнем железе: когда 2 видеокарты — это почти достаточно
Практический гайд по запуску модели Qwen3.5-397B-A17B на домашнем железе с EPYC 7402p и 2x3090Ti. Реальные результаты, настройки llama.cpp и оптимизация под огр
4734
Запуск Qwen3.5-397B на 128GB GPU: детальный разбор smol-IQ2_XS квантования в llama.cpp
Практическое руководство по запуску Qwen3.5-397B на 128GB GPU с smol-IQ2_XS квантованием в llama.cpp. Детали, команды, сравнение с альтернативами.
4735
Как с нуля написать и обучить Трансформер на чистом Python и Numpy: полный гайд с кодом
Пошаговое создание Transformer с нуля на чистом Python и Numpy. Реализация автограда, внимания, обучения. Полный код без PyTorch/TensorFlow.
4736
Как работает «режим размышления» в модели Nanbeige4.1-3B: анализ внутреннего диалога LLM
Разбор внутреннего диалога LLM на примере Nanbeige4.1-3B. Как работает chain-of-thought reasoning и как им управлять через промпты. Актуально на 2026 год.
4737
Как собрать кластер из разных видеокарт для запуска больших LLM: практический гайд на примере Qwen3-Coder-30B
Пошаговый гайд по сборке кластера из разнородных видеокарт для запуска 30B-моделей. Настройка llama.cpp RPC, квантование Q4_K_S, конфигурация для RTX 5080, 3060
4738
Почему вы платите больше за худшие результаты: парадокс настроек усилия в GPT-5 и Gemini Flash 3
Исследование Deep Research Bench показывает: дорогие настройки GPT-5 и Gemini Flash 3 снижают точность веб-поиска. Как сэкономить до 2x без потери качества.
4739
Локальные модели 20-100B для кодинга: как не промахнуться с выбором и не сжечь видеокарту
Практический гайд по выбору локальной LLM для кодинга: сравниваем Qwen3-32B-Coder, GLM-4.7-Flash, DeepSeek-Coder, считаем VRAM, тестируем на реальных задачах. О
4740
Ваш смартфон теперь AI-сервер: ставим приватного ассистента с Qwen3 и Stable Diffusion
Запускаем локальный Qwen3, Stable Diffusion и Whisper на Android/iOS. Полная приватность, работа без интернета, сравнение CPU/GPU. Инструкция на февраль 2026.