Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3817
Как настроить гибридную систему Ollama + Claude API для замены Cursor Pro и экономии $200 в месяц
Пошаговый гайд по настройке гибридной AI-системы для программирования на базе Ollama, Qwen3-Coder 30B MoE и Claude API. Работает на Windows/Mac, экономит $200 н
3818
Архитектура Vera 1.6: как Gated Delta Networks и Sparse MoE создают агента с 1M контекстом
Глубокий разбор Vera 1.6: Gated Delta Networks, Sparse Mixture-of-Experts и RoPE scaling для агентов с контекстом в миллион токенов. Сравнение, примеры, для ког
3819
Disco-Torch: как портировать DeepMind DiscoRL из JAX в PyTorch с помощью Claude Code
Обзор Disco-Torch — инструмента для автоматического переноса алгоритма DeepMind DiscoRL из JAX в PyTorch с использованием Claude Code. Актуально на 2026 год.
3820
Запуск TripoSR на iPhone: полное руководство по ONNX Runtime и CoreML для 3D-реконструкции
Пошаговый гайд по запуску TripoSR для 3D-реконструкции на iPhone с использованием ONNX Runtime и CoreML. Локальный AI без облаков.
3821
Tesla P40 против vLLM: как взломать фреймворк для работы с устаревшей архитектурой
Практический гайд по модификации vLLM 0.5.8 для работы с GPU Tesla P40 (архитектура Pascal) и запуска модели Qwen3 ASR для транскрипции аудио в 2026 году.
3822
Fabricated Execution в ИИ-агентах: архитектурная дыра и инструмент для верификации выполнения задач
ИИ-агенты врут о выполнении задач. Fabricated Execution - скрытая угроза. Гайд по внедрению Deterministic Commitment Layer для аудита и верификации агентов на 2
3823
Выбор модели для агентного кодирования на RTX 3060: сравнение производительности и памяти
Практическое руководство по выбору LLM для агентного кодирования на RTX 3060. Сравнение Qwen 3.5, CodeLlama и других по использованию VRAM и скорости генерации
3824
Triton2CUDA: конвертер ядер из Triton API в CUDA C++ для ускорения ML-разработки
Обзор Triton2CUDA - инструмента для конвертации ядер из Triton API в CUDA C++. Возможности, сравнение с альтернативами, примеры использования. Актуально на март
3825
Запуск LLM на Android через Termux и Ollama: полное руководство для энтузиастов
Пошаговый гайд по установке Termux, сборке Ollama и запуску локальных LLM моделей на Android без интернета. Работаем с lfm2.5-thinking и qwen3.5:2b.
3826
Создаём AI Dungeon Master на Python: разбор open-source движка для игр с управлением состоянием через JSON
Пошаговый разбор open-source движка на Python для создания игр с AI Dungeon Master. Управление состоянием через JSON, интеграция с Ollama и OpenAI API, многопот
3827
Как запустить NVFP4 MoE модели на RTX 5090/Pro 6000 (Blackwell): фикс сломанных ядер через --moe-backend marlin в vLLM
Подробный гайд по запуску больших MoE-моделей (Qwen3.5 397B) в NVFP4 на Blackwell (SM120) через vLLM с флагом --moe-backend marlin. Решение проблемы генерации м
3828
PythoC: пишем высокопроизводительный C-код на Python-синтаксисе — полный обзор и примеры
Полный обзор PythoC 3.0: компилятор Python-подобного синтаксиса в нативный C-код через LLVM IR. Примеры, сравнение с Mojo и Cython, кому подойдет.