Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3073 Архитектура OCR-системы для ипотеки с 100% точностью: layout-aware извлечение, валидация полей и compliance Гибридная AI-система для обработки ипотечных документов с валидацией полей и compliance. Практический гайд от Senior DevOps. 8 мин чтения 3074 Nemotron-Cascade-2 30B (Mamba+MoE) на RTX 3090: настройка vLLM с FP8 кэшем для скорости и длинного контекста Подробный гайд по запуску модели Nemotron-Cascade-2 30B (Mamba+MoE) на RTX 3090. Настройка vLLM с FP8 кэшем ключей-значений для высокой скорости и поддержки кон 8 мин чтения 3075 Flash Attention для старых AMD MI50 (gfx906): как обойти ограничения и запустить генерацию видео без OOM Полное руководство по запуску генерации видео на AMD MI50 (gfx906) с обходом ограничений памяти. Memory-efficient attention, SDPA PyTorch и оптимизации под ROCm 8 мин чтения 3076 Практическое руководство: как оценивать локальную LLM после DPO-тюнинга (на примере психотерапевтического датасета) Подробный гайд по оценке локальных LLM после DPO-тюнинга. Шаг за шагом: от тестового датасета до экспертной проверки. Актуальные инструменты и методология на ма 8 мин чтения 3077 TypeWhisper 1.0: Когда приватная диктовка обрела модульность Полный обзор TypeWhisper 1.0: модульное приложение для диктовки с поддержкой WhisperKit, Parakeet, Qwen3 и LLM-постобработкой. Работает локально на macOS. 6 мин чтения 3078 Chatterbox Turbo на VLLM: как добиться 37.6x ускорения генерации речи на RTX 4090 Портирование TTS-модели Chatterbox Turbo на vLLM дает ускорение в 37.6 раз на RTX 4090. Бенчмарки, настройка и примеры для реального синтеза речи. 5 мин чтения 3079 Сравнение 9 LLM в AIfred Intelligence: производительность и качество в multi-agent дебатах Тестируем 9 больших языковых моделей (80B-235B) в AIfred Intelligence на Tesla P40 и RTX 8000. Сравнение скорости, квантования Q4_K_M и качества в Tribunal mode 7 мин чтения 3080 MCP memory server на Rust: когда граф знаний встречает нейроны в хранилище Гибридный поиск на Rust, граф знаний и нейропластичность памяти для AI агентов. Сравнение с Python, тесты производительности и примеры использования. 6 мин чтения 3081 Как запустить локальный GraphRAG без GPU: пошаговый гайд с Llama 3.1, Neo4j и LangChain Полный пайплайн GraphRAG на локальной машине без видеокарты. Устанавливаем квантованную Llama 3.1, Neo4j и LangChain для извлечения графа знаний из документов. 8 мин чтения 3082 MuninnDB: как настроить Dream Engine для консолидации памяти LLM с изоляцией данных Ollama Полное руководство по настройке MuninnDB Dream Engine для консолидации памяти LLM с изоляцией данных через Ollama vault. Актуально на 2026 год. 4 мин чтения 3083 Крошечные модели против коллайдера: как CERN «сжигает» ИИ в кремний с помощью HLS4ML Против тренда: CERN использует HLS4ML, чтобы «впечатывать» в FPGA крошечные нейросети для фильтрации данных БАК за наносекунды. Контрархитектура в мире больших 5 мин чтения 3084 TideSurf: как сжать DOM в 30 раз для веб-агентов и ускорить TTFT в 12 раз на Qwen 3.5 9B (туториал по npm-пакету) TideSurf сокращает токены DOM на 30x и ускоряет время до первого токена в 12 раз для веб-агентов на Qwen 3.5 9B. Гайд по установке и использованию npm @tidesurf 6 мин чтения