Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

7693 Аблитерированные модели: как «обнулить» Llama 3.3 8B и заставить её говорить всё Что такое «аблитерированные» модели ИИ, как они обходят цензуру через KL-дивергенцию и почему утечка Llama 3.3 8B изменила правила игры. 8 мин чтения 7694 Как создать гиперлокальную модель ИИ: кейс Twinkle AI для Тайваня на базе Gemma 3 Пошаговое руководство по созданию гиперлокальной модели ИИ для Тайваня на базе Gemma 3. Тонкая настройка под традиционный китайский, сленг и культурный контекст 7 мин чтения 7695 Тренировка LoRA для VibeVoice: разбираемся с diffusion-head, acoustic и semantic connector (практическое руководство) Подробный разбор архитектуры VibeVoice: diffusion-head, acoustic и semantic connector. Практическое руководство по тренировке LoRA для клонирования голоса с при 9 мин чтения 7696 EasyWhisperUI: Гайд по установке и использованию кроссплатформенного GUI для транскрибации аудио с GPU-ускорением Пошаговый гайд по установке и использованию EasyWhisperUI - кроссплатформенного GUI для транскрибации аудио с поддержкой GPU-ускорения через Vulkan и Metal. 4 мин чтения 7697 Бэкенд для VLM в 2026: vLLM против llama.cpp на Ubuntu — выбор, который сломает или ускорит твой проект Практический разбор: как выбрать бэкенд для VLM (Qwen2.5-VL) на Ubuntu в 2026. vLLM или llama.cpp? Подробное сравнение, тесты производительности и пошаговая нас 8 мин чтения 7698 Sparse: как сжать тонко настроенную модель с 14 ГБ до 50 МБ после обучения (альтернатива LoRA) Обзор Sparse - инструмента для сжатия тонко настроенных LLM до 50 МБ без потерь. Сравнение с LoRA, примеры кода, когда использовать. 6 мин чтения 7699 Orla: превращаем терминал в фабрику локальных ИИ-агентов Установка и использование Orla для запуска локальных AI-агентов через терминал. Интеграция с Ollama, примеры команд, сравнение с альтернативами. 7 мин чтения 7700 Локальный RAG для видео: с нуля до поиска за 15 минут Запустите RAG для видео локально: Whisper для транскрипции, OCR для текста на кадрах, векторный поиск. API и примеры кода. 7 мин чтения 7701 Adaptive-P: Когда llama.cpp наконец перестанет повторять одно и то же Обзор Adaptive-P - нового сэмплера для llama.cpp. Как установить через PR, сравнение с Top-P и Top-K, примеры использования для креативного текста. 6 мин чтения 7702 TraceML: Поймай утечки памяти и простои даталоадера до того, как они убьют твой LLM-тюнинг Обзор TraceML — инструмента для отслеживания утечек памяти CUDA и простоев даталоадера при обучении LLM на PyTorch. Сравнение с альтернативами, примеры кода для 7 мин чтения 7703 gsh: когда твой терминал внезапно поумнел и начал предсказывать команды Обзор gsh — инструмента, который превращает терминал в интеллектуальную оболочку с локальными LLM. Установка, примеры использования, сравнение с альтернативами. 7 мин чтения 7704 RTX 5070 Ti и оверфлоу VRAM: почему новая карта тормозит сильнее старой? Технический разбор аномалии RTX 5070 Ti: почему при оверфлоу VRAM новая карта теряет больше токенов/с чем RTX 4070 Ti и как это исправить. 9 мин чтения