Все выпуски
Архив публикаций
Все материалы AiManual в единой хронологической ленте.
3541
Квантование Qwen3.5-27B до 8 бит: практика, которая меняет правила игры
Полное сравнение fp8 и bf16 квантования для Qwen3.5-27B. Тесты на памяти контекста, пошаговое руководство для vLLM, результаты на RTX 6000 Pro.
3542
Как создать ИИ-трейдера OpenClaw без кода: пошаговая настройка и примеры стратегий для Finam Trade API
Пошаговая инструкция по созданию ИИ-трейдера в OpenClaw для автоматической торговли через Finam Trade API. Стратегии, настройка MCP-сервера, примеры.
3543
Open-Toys: как собрать локальную storytelling-игрушку для детей на Qwen3-TTS и MLX для Apple Silicon
Пошаговый гайд по созданию оффлайн storytelling-игрушки для детей с использованием Qwen3-TTS, MLX и ESP32. Приватность и открытый код.
3544
Опыт квантования Qwen3.5-122B: почему модели >100B параметров не стоит квантить ниже Q4
Почему модели более 100B параметров не стоит квантить ниже Q4: опыт, тесты и альтернативы для экономии VRAM без потери качества.
3545
Собираем локальный ассистент для заметок с транскрипцией и суммаризацией на базе open-source LLM
Полный гайд по сборке приватного ассистента для заметок на базе Whisper 3.1 и Llama 4. Установка, код, оптимизация. Работает оффлайн.
3546
Google AI Ultra для мульти-агентных систем: параллельные воркеры и кросс-модельный консенсус
Полный гайд по использованию Google AI Ultra в мульти-агентных системах. Параллельные воркеры, кросс-модельный консенсус, оптимизация затрат. Инструменты Antigr
3547
Локальные LLM для продакшена: Qwen 3.5 122B vs GPT-oss-120B и Mac M5 128GB для кодинга в 2025
Практическое сравнение локальных LLM Qwen 3.5 122B и GPT-oss-120B для продакшен-кодинга. Разбираем выбор Mac M5 128GB, квантование, скорость и настройку для раб
3548
Первый в мире лазерный чип Tower Semiconductor: как DWDM спасает AI-кластеры от сетевого удушья
Tower Semiconductor представила первый в мире интегральный лазерный чип для DWDM-сетей. Как это решает проблему масштабирования и энергопотребления AI-дата-цент
3549
nano-KvLLM: Сжимаем KV-кеш в 4 раза без потерь для длинных контекстов
Обзор nano-KvLLM 2.1 - фреймворка для сжатия KV-кеша на основе nano-vLLM. Ускорение работы с длинным контекстом, сравнение с vLLM и llama.cpp, примеры использов
3550
Attention вместо Residual Connections: как Kimi добился прорыва в архитектуре LLM
Kimi K2.5 заменил residual connections на attention mechanism. Улучшение бенчмарков GPQA, MATH, HumanEval при минимальных накладных расходах. Участие Karpathy.
3551
OpenCode не совсем локальный: разбираемся с проблемой прокси и как обеспечить true local режим
Почему OpenCode отправляет данные наружу по умолчанию? Гайд по настройке истинно локального режима и альтернативы для работы за firewall.
3552
NVIDIA Rubin: как новые чипы с HBM4 и 22 ТБ/с снизят стоимость инференса в 10 раз
Технический анализ NVIDIA Rubin с HBM4 и пропускной способностью 22 ТБ/с. Как транзисторы 336B снижают стоимость AI-инференса в 10 раз к 2026 году.