Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3073
Архитектура OCR-системы для ипотеки с 100% точностью: layout-aware извлечение, валидация полей и compliance
Гибридная AI-система для обработки ипотечных документов с валидацией полей и compliance. Практический гайд от Senior DevOps.
3074
Nemotron-Cascade-2 30B (Mamba+MoE) на RTX 3090: настройка vLLM с FP8 кэшем для скорости и длинного контекста
Подробный гайд по запуску модели Nemotron-Cascade-2 30B (Mamba+MoE) на RTX 3090. Настройка vLLM с FP8 кэшем ключей-значений для высокой скорости и поддержки кон
3075
Flash Attention для старых AMD MI50 (gfx906): как обойти ограничения и запустить генерацию видео без OOM
Полное руководство по запуску генерации видео на AMD MI50 (gfx906) с обходом ограничений памяти. Memory-efficient attention, SDPA PyTorch и оптимизации под ROCm
3076
Практическое руководство: как оценивать локальную LLM после DPO-тюнинга (на примере психотерапевтического датасета)
Подробный гайд по оценке локальных LLM после DPO-тюнинга. Шаг за шагом: от тестового датасета до экспертной проверки. Актуальные инструменты и методология на ма
3077
TypeWhisper 1.0: Когда приватная диктовка обрела модульность
Полный обзор TypeWhisper 1.0: модульное приложение для диктовки с поддержкой WhisperKit, Parakeet, Qwen3 и LLM-постобработкой. Работает локально на macOS.
3078
Chatterbox Turbo на VLLM: как добиться 37.6x ускорения генерации речи на RTX 4090
Портирование TTS-модели Chatterbox Turbo на vLLM дает ускорение в 37.6 раз на RTX 4090. Бенчмарки, настройка и примеры для реального синтеза речи.
3079
Сравнение 9 LLM в AIfred Intelligence: производительность и качество в multi-agent дебатах
Тестируем 9 больших языковых моделей (80B-235B) в AIfred Intelligence на Tesla P40 и RTX 8000. Сравнение скорости, квантования Q4_K_M и качества в Tribunal mode
3080
MCP memory server на Rust: когда граф знаний встречает нейроны в хранилище
Гибридный поиск на Rust, граф знаний и нейропластичность памяти для AI агентов. Сравнение с Python, тесты производительности и примеры использования.
3081
Как запустить локальный GraphRAG без GPU: пошаговый гайд с Llama 3.1, Neo4j и LangChain
Полный пайплайн GraphRAG на локальной машине без видеокарты. Устанавливаем квантованную Llama 3.1, Neo4j и LangChain для извлечения графа знаний из документов.
3082
MuninnDB: как настроить Dream Engine для консолидации памяти LLM с изоляцией данных Ollama
Полное руководство по настройке MuninnDB Dream Engine для консолидации памяти LLM с изоляцией данных через Ollama vault. Актуально на 2026 год.
3083
Крошечные модели против коллайдера: как CERN «сжигает» ИИ в кремний с помощью HLS4ML
Против тренда: CERN использует HLS4ML, чтобы «впечатывать» в FPGA крошечные нейросети для фильтрации данных БАК за наносекунды. Контрархитектура в мире больших
3084
TideSurf: как сжать DOM в 30 раз для веб-агентов и ускорить TTFT в 12 раз на Qwen 3.5 9B (туториал по npm-пакету)
TideSurf сокращает токены DOM на 30x и ускоряет время до первого токена в 12 раз для веб-агентов на Qwen 3.5 9B. Гайд по установке и использованию npm @tidesurf