Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

5269 Как настроить LoRA для Qwen3-VL 2B: оптимальные параметры для слабого GPU Пошаговый гайд по настройке LoRA для Qwen3-VL 2B на GPU с 8-12 ГБ VRAM. Оптимальные параметры, команды, ошибки и экономия памяти. 9 мин чтения 5270 Unsloth + Q4 квантование: как заставить 30B модель работать на 8 ГБ VRAM с оффлоадингом в RAM Пошаговая инструкция по тонкой настройке больших языковых моделей с Unsloth, Q4 квантованием и оффлоадингом в RAM. Работаем с 30B моделями на 8 ГБ VRAM. 8 мин чтения 5271 Почему LLM ломают JSON-парсеры: бенчмарк 672 вызовов и как это исправить Реальный тест 8 моделей на 672 вызовах показал: 67% ответов ломают JSON-парсеры. Сравнение GPT-4o, Claude 3.7 Sonnet, Mistral Large 2, Llama 3.3 и других. Практ 8 мин чтения 5272 Recursive Session Forking в Dropstone: как сериализовать цепочки рассуждений для совместной работы Как Dropstone v3.0.5 решает проблему дрейфа контекста через сериализацию цепочек рассуждений для локальных coding-агентов. Практический обзор новой архитектуры. 4 мин чтения 5273 Локальные LLM в работе: реальные кейсы, которые меняют всё Лучшие практики применения локальных LLM от разработчиков: кодинг, анализ данных, автоматизация. Полный гайд с примерами для Ollama, LM Studio. 8 мин чтения 5274 Q4_K_M квантование: золотая середина или компромисс без выбора? Полный разбор Q4_K_M квантования: что это такое, как влияет на качество ответов AI-моделей, сравнение с Q8_0 и Q2_K, практические рекомендации по выбору формата 6 мин чтения 5275 AI OS: Собираем свою операционную систему для ИИ на FastAPI и Ollama Разбираем open-source проект AI OS: FastAPI бэкенд, React фронтенд, Ollama для локальных моделей. Полный стек для приватного AI-ассистента. 7 мин чтения 5276 Две карты, одна скорость: почему ваша LLM на двух GPU работает как на одной и как это исправить Разбираем проблему неравномерной загрузки GPU в LM Studio и vLLM. Пошаговый гайд по диагностике, настройке tensor parallelism и оптимизации скорости генерации t 10 мин чтения 5277 Нейросети ищут то, чего мы не знаем: как ИИ на Большом адронном коллайдере ловит призраки новой физики Как нейросети анализируют данные LHC в 2026 году, почему стандартные методы не работают и что ИИ уже нашел в столкновениях частиц. Актуальные данные на февраль 8 мин чтения 5278 «Smoke Jumpers»: как Google масштабирует Gemini для миллиардов пользователей — взгляд изнутри Как работает кросс-функциональная команда Google для запуска Gemini 3 на TPU-кластерах. Инженерные практики и культура Smoke Jumpers на 08.02.2026. 7 мин чтения 5279 Claude Agent SDK для бизнес-аналитики: кейс BGL и вызовы text-to-SQL Как BGL использует Claude Agent SDK для демократизации данных. Анализ отчёта Anthropic о состоянии AI-агентов и практические проблемы text-to-SQL. 4 мин чтения 5280 Распределённое обучение с подкреплением: от Dota 2 до реальных роботов и почему это до сих пор ад Как распределённое обучение с подкреплением работает в реальном мире в 2026 году. Проблемы, прорывы и почему роботы учатся медленнее, чем нейросети для игр. 5 мин чтения