Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

7321 Делим одну GPU на всех: vGPU, MIG и другие способы совместной работы с LLM без драк за железо Как разделить одну видеокарту между несколькими пользователями для работы с LLM. Полное сравнение vGPU, MIG, Slurm и Open OnDemand с пошаговой настройкой. 10 мин чтения 7322 Полное руководство по выбору GGUF-модели: K-Quants vs I-Quants, сравнение форматов и рекомендации по загрузке Подробное руководство по выбору GGUF-моделей: сравнение форматов квантования K-Quants и I-Quants, практические рекомендации для llama.cpp. 7 мин чтения 7323 Дженсен Хуанг на CES: почему открытые модели победят и как это изменит индустрию AI Глава NVIDIA сделал ключевое заявление на CES. Открытые модели изменят индустрию AI, сместив фокус с облачных API на локальные вычисления. 4 мин чтения 7324 Цензура LLM: режем на живую или хирургически удаляем? NPBA против PRISM Глубокий разбор двух методов удаления цензуры из языковых моделей: Norm-Preserving Biprojected Abliteration и PRISM. Тесты, примеры, что выбрать для uncensored 8 мин чтения 7325 Perplexity Comet MCP: когда ваш браузер слушается локальную нейросеть Полный гайд по настройке и использованию Comet MCP для автоматизации браузера через локальные языковые модели. Установка, примеры, сравнение с аналогами. 4 мин чтения 7326 Сравнение локальных AI-моделей для генерации изображений и видео на RTX 5090: SD3, Flux, SVD и другие Практическое сравнение Stable Diffusion 3, Flux.1 Dev, Stable Video Diffusion для генерации изображений и видео на RTX 5090. Требования к памяти, скорость, каче 7 мин чтения 7327 Работа найдется: как заставить AI-агента проходить HR-фильтры и писать отклики, которые не пахнут AI-slop Пошаговый пайплайн: извлечение фактов из вакансий, анализ резюме и генерация уникальных сопроводительных писем. Борьба с галлюцинациями и AI-slop. 9 мин чтения 7328 GRPO и ревард-хакинг: как модель учится говорить красиво ничего не говоря Практическое руководство по борьбе с reward hacking в GRPO: почему модели генерируют мусор и как это исправить. KL divergence, стабильные reward функции, паттер 9 мин чтения 7329 Groq vs. Локальный GPU: как GPT-OSS-20B убивает RTX 4090 в токенах в секунду Практический тест: Groq выдает 250+ токенов в секунду, RTX 4090 - 45. Когда облако быстрее локального железа и стоит ли покупать GPU? 7 мин чтения 7330 Function Calling в Open WebUI: какие модели на самом деле работают с llama.cpp Полное руководство по настройке Native Function Calling в Open WebUI v0.7. Список моделей, которые работают и не работают с llama.cpp, пошаговая настройка Chat 8 мин чтения 7331 ASUS UGen300: USB-флешка, которая обещает запускать нейросети. Серьезно? Разбираем ASUS UGen300 — USB-акселератор на Hailo-10H с 40 TOPS. Возможности, сравнение с NPU и GPU, кому подойдет для edge-инференса. 5 мин чтения 7332 Как создать локальный RAG-пайплайн для аудио на RTX 2060: Whisper + Ollama + ChromaDB Полный гайд по созданию автономного RAG-пайплайна для обработки аудио на слабой видеокарте. Faster-whisper, Ollama, ChromaDB и Streamlit локально. 8 мин чтения