Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

493 Экономика инференса LLM на Apple Silicon: почему большая модель может быть дешевле Практический эксперимент на Mac Studio M3 Ultra: замеряем энергопотребление и стоимость за миллион токенов для пяти моделей от 4B до 120B. Узнайте, почему квант 6 мин чтения 494 Managed Agents в Gemini API: обзор Gemini 3.6 Flash, хуков окружения и бюджетного контроля Google DeepMind обновила Managed Agents: Gemini 3.6 Flash по умолчанию, environment hooks для кастомизации песочницы, HTTP-хуки для внешней валидации, контроль 6 мин чтения 495 Мультиязычное расширение SWE-rebench: первые результаты GLM-5.2, DeepSeek-V4 Pro и Qwen3.6-27B в задачах на Go, Java, Python, Rust и TS Обновлённый SWE-rebench тестирует модели на Go, Java, Python, Rust и TypeScript. GLM-5.2 лидирует с Pass@1 62,9% и полным прохождением всех языков в 39,6% случа 6 мин чтения 496 DeepSeek V4 Flash на AMD Ryzen AI MAX+ 395: как достичь 32 tok/s локального инференса Команда Lucebox запустила DeepSeek V4 Flash (284B) на одном APU AMD Ryzen AI MAX+ 395 со скоростью 32 tok/s — вдвое быстрее предыдущего рекорда. Разбираем смеша 8 мин чтения 497 Оптимизация эмбеддеров для RAG: как ужать русский retriever до 24 млн параметров и не потерять качество Как создать быстрый русский dense-эмбеддер для RAG: обрезка RuModernBERT-small до 4 слоёв, контрастивное обучение и разбор ошибок, которые стоили 14 п.п. recall 7 мин чтения 498 Следующее поколение Qwen: когда ждать модели 30B–100B и к чему готовиться Прогноз релиза Qwen 30B–100B: разбираем слухи о версиях 3.7/3.8, оцениваем реалистичные сроки выхода во второй половине 2026 и даём практические рекомендации по 8 мин чтения 499 Структурная инженерия для агентного SDLC на слабых LLM: опыт корпоративного харнеса Как построить надёжный агентный SDLC на слабых LLM через структурную инженерию: правила, изоляция, трехуровневая защита и реальные кейсы из корпоративной практи 11 мин чтения 500 Как построить надёжный AI-пайплайн: практический разбор архитектуры Shorts Maker v2 Разбор рефакторинга AI-генератора коротких видео: от прототипа на asyncio.gather() с полной потерей прогресса при сбоях до production-решения с DDD, атомарными 9 мин чтения 501 Почему Cyera платит $1 млрд за стартап по безопасности AI-агентов: разбор сделки и рынка Non-Human Identities Cyera покупает Oasis Security за $1 млрд, чтобы контролировать AI-агентов и нечеловеческие идентичности. Разбираем технологию, финансовые показатели и последств 6 мин чтения 502 Позиция Цукерберга: почему будущее AI за широким доступом, а не за закрытыми лабораториями Марк Цукерберг в колонке для WSJ представил четвёртую позицию в дебатах о будущем AI — ставку на широкий доступ вместо закрытых лабораторий. Разбираем, чем его 7 мин чтения 503 Компактные нейросети для домашних серверов без GPU: классификация, распознавание и автоматизация на 16 ГБ ОЗУ Какие легкие модели ИИ реально работают на мини-ПК с 16 ГБ ОЗУ и без видеокарты? Разбираем MobileNet, YOLO-tiny, DistilBERT и другие для задач классификации, де 10 мин чтения 504 LoRA-обучение DeepSeek-V4-Flash в 90 ГБ VRAM: GGUF и Triton-ядра против ограничений железа Как обучить 284B-модель DeepSeek-V4-Flash с LoRA всего на 90 ГБ VRAM. Разбор техники с GGUF и кастомными Triton-ядрами для sliding attention, CSA, HCA, mHC. Ско 7 мин чтения