Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
5329
Unsloth + Q4 квантование: как заставить 30B модель работать на 8 ГБ VRAM с оффлоадингом в RAM
Пошаговая инструкция по тонкой настройке больших языковых моделей с Unsloth, Q4 квантованием и оффлоадингом в RAM. Работаем с 30B моделями на 8 ГБ VRAM.
5330
Почему LLM ломают JSON-парсеры: бенчмарк 672 вызовов и как это исправить
Реальный тест 8 моделей на 672 вызовах показал: 67% ответов ломают JSON-парсеры. Сравнение GPT-4o, Claude 3.7 Sonnet, Mistral Large 2, Llama 3.3 и других. Практ
5331
Recursive Session Forking в Dropstone: как сериализовать цепочки рассуждений для совместной работы
Как Dropstone v3.0.5 решает проблему дрейфа контекста через сериализацию цепочек рассуждений для локальных coding-агентов. Практический обзор новой архитектуры.
5332
Локальные LLM в работе: реальные кейсы, которые меняют всё
Лучшие практики применения локальных LLM от разработчиков: кодинг, анализ данных, автоматизация. Полный гайд с примерами для Ollama, LM Studio.
5333
Q4_K_M квантование: золотая середина или компромисс без выбора?
Полный разбор Q4_K_M квантования: что это такое, как влияет на качество ответов AI-моделей, сравнение с Q8_0 и Q2_K, практические рекомендации по выбору формата
5334
AI OS: Собираем свою операционную систему для ИИ на FastAPI и Ollama
Разбираем open-source проект AI OS: FastAPI бэкенд, React фронтенд, Ollama для локальных моделей. Полный стек для приватного AI-ассистента.
5335
Две карты, одна скорость: почему ваша LLM на двух GPU работает как на одной и как это исправить
Разбираем проблему неравномерной загрузки GPU в LM Studio и vLLM. Пошаговый гайд по диагностике, настройке tensor parallelism и оптимизации скорости генерации t
5336
Нейросети ищут то, чего мы не знаем: как ИИ на Большом адронном коллайдере ловит призраки новой физики
Как нейросети анализируют данные LHC в 2026 году, почему стандартные методы не работают и что ИИ уже нашел в столкновениях частиц. Актуальные данные на февраль
5337
«Smoke Jumpers»: как Google масштабирует Gemini для миллиардов пользователей — взгляд изнутри
Как работает кросс-функциональная команда Google для запуска Gemini 3 на TPU-кластерах. Инженерные практики и культура Smoke Jumpers на 08.02.2026.
5338
Claude Agent SDK для бизнес-аналитики: кейс BGL и вызовы text-to-SQL
Как BGL использует Claude Agent SDK для демократизации данных. Анализ отчёта Anthropic о состоянии AI-агентов и практические проблемы text-to-SQL.
5339
Распределённое обучение с подкреплением: от Dota 2 до реальных роботов и почему это до сих пор ад
Как распределённое обучение с подкреплением работает в реальном мире в 2026 году. Проблемы, прорывы и почему роботы учатся медленнее, чем нейросети для игр.
5340
AWS зарабатывает $142 млрд на AI-лихорадке: почему облака теперь дороже нефти
Анализ рекордных финансовых показателей Amazon Web Services в 2025-2026 гг. Рост на 24%, $142 млрд ARR и стратегия доминирования на рынке AI-инфраструктуры.