Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
7693
Аблитерированные модели: как «обнулить» Llama 3.3 8B и заставить её говорить всё
Что такое «аблитерированные» модели ИИ, как они обходят цензуру через KL-дивергенцию и почему утечка Llama 3.3 8B изменила правила игры.
7694
Как создать гиперлокальную модель ИИ: кейс Twinkle AI для Тайваня на базе Gemma 3
Пошаговое руководство по созданию гиперлокальной модели ИИ для Тайваня на базе Gemma 3. Тонкая настройка под традиционный китайский, сленг и культурный контекст
7695
Тренировка LoRA для VibeVoice: разбираемся с diffusion-head, acoustic и semantic connector (практическое руководство)
Подробный разбор архитектуры VibeVoice: diffusion-head, acoustic и semantic connector. Практическое руководство по тренировке LoRA для клонирования голоса с при
7696
EasyWhisperUI: Гайд по установке и использованию кроссплатформенного GUI для транскрибации аудио с GPU-ускорением
Пошаговый гайд по установке и использованию EasyWhisperUI - кроссплатформенного GUI для транскрибации аудио с поддержкой GPU-ускорения через Vulkan и Metal.
7697
Бэкенд для VLM в 2026: vLLM против llama.cpp на Ubuntu — выбор, который сломает или ускорит твой проект
Практический разбор: как выбрать бэкенд для VLM (Qwen2.5-VL) на Ubuntu в 2026. vLLM или llama.cpp? Подробное сравнение, тесты производительности и пошаговая нас
7698
Sparse: как сжать тонко настроенную модель с 14 ГБ до 50 МБ после обучения (альтернатива LoRA)
Обзор Sparse - инструмента для сжатия тонко настроенных LLM до 50 МБ без потерь. Сравнение с LoRA, примеры кода, когда использовать.
7699
Orla: превращаем терминал в фабрику локальных ИИ-агентов
Установка и использование Orla для запуска локальных AI-агентов через терминал. Интеграция с Ollama, примеры команд, сравнение с альтернативами.
7700
Локальный RAG для видео: с нуля до поиска за 15 минут
Запустите RAG для видео локально: Whisper для транскрипции, OCR для текста на кадрах, векторный поиск. API и примеры кода.
7701
Adaptive-P: Когда llama.cpp наконец перестанет повторять одно и то же
Обзор Adaptive-P - нового сэмплера для llama.cpp. Как установить через PR, сравнение с Top-P и Top-K, примеры использования для креативного текста.
7702
TraceML: Поймай утечки памяти и простои даталоадера до того, как они убьют твой LLM-тюнинг
Обзор TraceML — инструмента для отслеживания утечек памяти CUDA и простоев даталоадера при обучении LLM на PyTorch. Сравнение с альтернативами, примеры кода для
7703
gsh: когда твой терминал внезапно поумнел и начал предсказывать команды
Обзор gsh — инструмента, который превращает терминал в интеллектуальную оболочку с локальными LLM. Установка, примеры использования, сравнение с альтернативами.
7704
RTX 5070 Ti и оверфлоу VRAM: почему новая карта тормозит сильнее старой?
Технический разбор аномалии RTX 5070 Ti: почему при оверфлоу VRAM новая карта теряет больше токенов/с чем RTX 4070 Ti и как это исправить.