Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
6373
Unsloth для эмбеддингов: тонкая настройка в 3.3 раза быстрее на 3 ГБ VRAM
Практический гайд по fine-tuning эмбеддингов в Unsloth. Ускорение до 3.3x, работа на 3 ГБ VRAM, EmbeddingGemma, FastSentenceTransformer, RAG.
6374
KernelAI: 43 локальные модели в кармане, или Как превратить iPhone в AI-сервер
Запускаем Gemma 3, Llama 3.2 и 41 другую модель на iPhone без интернета. Потребление ОЗУ 400-600 МБ, поддержка vision и TTS. Полный обзор на 23.01.2026.
6375
vLLM или SGLang? Разрубаем гордиев узел выбора движка для LLM в 2026 году
Глубокий разбор vLLM и SGLang в 2026 году. Сравнение архитектур, производительности, Inferact, RadixArk. Какой движок выбрать для вашей задачи?
6376
Как выбрать стратегию развёртывания LLM: от облачных API до локального хостинга
Практическое руководство по выбору стратегии развёртывания LLM в 2026. Сравнение облачных API и локального хостинга: цена, контроль данных, сложность миграции.
6377
PromptBridge-0.6b: собираем свою фабрику промптов для Stable Diffusion
Полное руководство по созданию своей модели для генерации промптов для Stable Diffusion на базе Qwen3-0.6b с примером работающего пайплайна
6378
Соединил iPhone и Mac в суперкомпьютер: как заставить Llama-3.3 70B работать на 12 ГБ RAM
Практический гайд по объединению памяти iPhone и Mac для запуска Llama-3.3 70B через MLX и exo. Тестируем USB vs Wi-Fi, ограничения wired memory и ускоренные яд
6379
Топ-модели провалились в бенчмарке Apex-Agents. ИИ-агентам до офисных работников ещё 5 лет
Новый бенчмарк Apex-Agents от Mercor показал: даже GPT-4.5 Turbo и Claude 3.7 Sonnet не справляются с реальными рабочими задачами. Разбираем провалы.
6380
Apple AI Pin: умная булавка против провала Humane
Все об умной булавке Apple AI Pin: отличия от Humane AI Pin, оффлайн-ИИ, камеры, цена и дата выхода в 2026 году.
6381
vLLM с $150 млн в кармане: как они ломают инференс и заставляют Nvidia нервничать
Разбираем, как vLLM с новыми $150 млн инвестиций меняет правила игры в инференсе больших языковых моделей через PagedAttention и стандартизацию.
6382
Q4, Q6, Q8: как выбрать квантование для офлайн-помощника на смартфоне и планшете
Практический гайд по выбору квантования Q4, Q6, Q8 для офлайн-помощников на смартфонах. Сравнение Dolphin 3.0, Llama 3.1 8B, тесты на Pixel 10, потеря качества
6383
iPhone 12 против Android-планшета: какая uncensored LLM выживет на 8 ГБ ОЗУ в 2026
Практическое сравнение uncensored LLM моделей для iPhone 12 и Android-планшетов с 8 ГБ ОЗУ. Тесты скорости, инструкции по запуску в LM Studio, выбор оптимальной
6384
AI в HR: как алгоритмы и нейросети убивают экспертизу и здравый смысл в найме IT-специалистов
Анализ того, как AI, ATS и нейросети разрушают экспертный подход в найме IT-специалистов. Реальные кейсы и проблемы автоматизации HR в 2026 году.