Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
7321
Делим одну GPU на всех: vGPU, MIG и другие способы совместной работы с LLM без драк за железо
Как разделить одну видеокарту между несколькими пользователями для работы с LLM. Полное сравнение vGPU, MIG, Slurm и Open OnDemand с пошаговой настройкой.
7322
Полное руководство по выбору GGUF-модели: K-Quants vs I-Quants, сравнение форматов и рекомендации по загрузке
Подробное руководство по выбору GGUF-моделей: сравнение форматов квантования K-Quants и I-Quants, практические рекомендации для llama.cpp.
7323
Дженсен Хуанг на CES: почему открытые модели победят и как это изменит индустрию AI
Глава NVIDIA сделал ключевое заявление на CES. Открытые модели изменят индустрию AI, сместив фокус с облачных API на локальные вычисления.
7324
Цензура LLM: режем на живую или хирургически удаляем? NPBA против PRISM
Глубокий разбор двух методов удаления цензуры из языковых моделей: Norm-Preserving Biprojected Abliteration и PRISM. Тесты, примеры, что выбрать для uncensored
7325
Perplexity Comet MCP: когда ваш браузер слушается локальную нейросеть
Полный гайд по настройке и использованию Comet MCP для автоматизации браузера через локальные языковые модели. Установка, примеры, сравнение с аналогами.
7326
Сравнение локальных AI-моделей для генерации изображений и видео на RTX 5090: SD3, Flux, SVD и другие
Практическое сравнение Stable Diffusion 3, Flux.1 Dev, Stable Video Diffusion для генерации изображений и видео на RTX 5090. Требования к памяти, скорость, каче
7327
Работа найдется: как заставить AI-агента проходить HR-фильтры и писать отклики, которые не пахнут AI-slop
Пошаговый пайплайн: извлечение фактов из вакансий, анализ резюме и генерация уникальных сопроводительных писем. Борьба с галлюцинациями и AI-slop.
7328
GRPO и ревард-хакинг: как модель учится говорить красиво ничего не говоря
Практическое руководство по борьбе с reward hacking в GRPO: почему модели генерируют мусор и как это исправить. KL divergence, стабильные reward функции, паттер
7329
Groq vs. Локальный GPU: как GPT-OSS-20B убивает RTX 4090 в токенах в секунду
Практический тест: Groq выдает 250+ токенов в секунду, RTX 4090 - 45. Когда облако быстрее локального железа и стоит ли покупать GPU?
7330
Function Calling в Open WebUI: какие модели на самом деле работают с llama.cpp
Полное руководство по настройке Native Function Calling в Open WebUI v0.7. Список моделей, которые работают и не работают с llama.cpp, пошаговая настройка Chat
7331
ASUS UGen300: USB-флешка, которая обещает запускать нейросети. Серьезно?
Разбираем ASUS UGen300 — USB-акселератор на Hailo-10H с 40 TOPS. Возможности, сравнение с NPU и GPU, кому подойдет для edge-инференса.
7332
Как создать локальный RAG-пайплайн для аудио на RTX 2060: Whisper + Ollama + ChromaDB
Полный гайд по созданию автономного RAG-пайплайна для обработки аудио на слабой видеокарте. Faster-whisper, Ollama, ChromaDB и Streamlit локально.