Перейти к содержанию
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

685 Организационная структура OpenAI: коалиция или корпорация? Как устроена OpenAI изнутри: некоммерческий фонд, ограниченная прибыль и коммерческий рукав. Анализ коалиционной модели, конфликта интересов и влияния на страте 6 мин чтения 686 Мониторинг использования локальных AI-моделей: месяц практики и аналитика За месяц трекинга через JSON-логгер собрано 14 200 запросов к локальным LLM. Разбираем реальные паттерны переключения на облака, балансировку рабочих и хобби-пр 11 мин чтения 687 Владение ИИ-интеллектом: как построить контролируемую, экономичную и самообучающуюся систему агентов Что значит владеть ИИ-интеллектом в бизнесе? Разбираем три уровня контроля: модель, обвязка, контекст. Как построить цикл обратной связи с трейсами, фидбеком и 8 мин чтения 688 Средние MoE-модели 2026: обзор Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и альтернатив Сравниваем средние MoE-модели 2026 года: Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и DeepSeek v4 Flash. Бенчмарки, требования к VRAM, примеры кода для запуска 8 мин чтения 689 Локальные LLM на мобильных устройствах в 2026: практические сценарии, ограничения и трюки Запуск LLM на iPhone и Android в 2026: 5 работающих сценариев с кодом, замеры скорости MLX и GGUF, техника компактификации контекста для бесконечных диалогов и 8 мин чтения 690 Домашний AI-сервер на AMD 7800X3D + 7800XT: проверка конфигурации и выбор LLM для Vibe Coding в 2026 Проверяем, поместятся ли Qwen 3.6-35B-A3B и 27B в 16 ГБ VRAM на AMD 7800XT. Цифры по квантизации, бенчмарки кода против 12B моделей, настройка Continue.dev и Ai 9 мин чтения 691 Браузерный инференс LLM: как LFM 2.5 на WebGPU выдаёт 1440 токенов/с без сервера Разработчик создал бэкенд для запуска LFM 2.5 и Bonsai 1.7B прямо в браузере через WebGPU. На RTX 3090 скорость достигает 1440 токенов/с, на Apple M4 — до 500 т 7 мин чтения 692 TensorSharp vs. llama.cpp: Практическое сравнение производительности нового GGUF-инференс-движка на CUDA и Vulkan Прямое сравнение TensorSharp и llama.cpp на Gemma 4 и Qwen 3.6: замеры decode, prefill и TTFT на CUDA и Vulkan. Узнайте, где новый C# движок выигрывает до 27.9% 8 мин чтения 693 CodeSlicer: как AI-агенты теряют целостность кода и почему граф влияния проекта решает эту проблему CodeSlicer строит проверяемый граф влияния кодовой базы и устраняет главную причину ошибок AI-агентов — невидимость системных зависимостей. Разбираем конвейер и 10 мин чтения 694 Экономия токенов как новая метрика эффективности: почему Gemini 3.6 Flash выгоднее флагманов для агентных систем Gemini 3.6 Flash сокращает расход выходных токенов на 17% и снижает стоимость задачи до 31%, а в агентных сценариях — до 71%. Разбираем метрику «токенов на зада 9 мин чтения 695 Цикличность AI-трендов: почему повторение прошлого — это закономерность, а не ошибка В 2026 году AI-тренды повторяют сценарии прошлого: от циклов фондирования до возврата энкодер-декодер архитектур. Разбираем исторические паттерны, анализируем к 10 мин чтения 696 Лучшие локальные LLM для анализа видео в 2026: обзор моделей и практические настройки Какие локальные модели действительно умеют анализировать видео? Сравнение Qwen, LLaMA, Gemma и FLUX 3. Практическое руководство по настройке Ollama и Hugging Fa 9 мин чтения