Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Все выпуски

Архив публикаций

Все материалы AiManual в единой хронологической ленте.

3541 Квантование Qwen3.5-27B до 8 бит: практика, которая меняет правила игры Полное сравнение fp8 и bf16 квантования для Qwen3.5-27B. Тесты на памяти контекста, пошаговое руководство для vLLM, результаты на RTX 6000 Pro. 6 мин чтения 3542 Как создать ИИ-трейдера OpenClaw без кода: пошаговая настройка и примеры стратегий для Finam Trade API Пошаговая инструкция по созданию ИИ-трейдера в OpenClaw для автоматической торговли через Finam Trade API. Стратегии, настройка MCP-сервера, примеры. 10 мин чтения 3543 Open-Toys: как собрать локальную storytelling-игрушку для детей на Qwen3-TTS и MLX для Apple Silicon Пошаговый гайд по созданию оффлайн storytelling-игрушки для детей с использованием Qwen3-TTS, MLX и ESP32. Приватность и открытый код. 6 мин чтения 3544 Опыт квантования Qwen3.5-122B: почему модели >100B параметров не стоит квантить ниже Q4 Почему модели более 100B параметров не стоит квантить ниже Q4: опыт, тесты и альтернативы для экономии VRAM без потери качества. 7 мин чтения 3545 Собираем локальный ассистент для заметок с транскрипцией и суммаризацией на базе open-source LLM Полный гайд по сборке приватного ассистента для заметок на базе Whisper 3.1 и Llama 4. Установка, код, оптимизация. Работает оффлайн. 9 мин чтения 3546 Google AI Ultra для мульти-агентных систем: параллельные воркеры и кросс-модельный консенсус Полный гайд по использованию Google AI Ultra в мульти-агентных системах. Параллельные воркеры, кросс-модельный консенсус, оптимизация затрат. Инструменты Antigr 9 мин чтения 3547 Локальные LLM для продакшена: Qwen 3.5 122B vs GPT-oss-120B и Mac M5 128GB для кодинга в 2025 Практическое сравнение локальных LLM Qwen 3.5 122B и GPT-oss-120B для продакшен-кодинга. Разбираем выбор Mac M5 128GB, квантование, скорость и настройку для раб 8 мин чтения 3548 Первый в мире лазерный чип Tower Semiconductor: как DWDM спасает AI-кластеры от сетевого удушья Tower Semiconductor представила первый в мире интегральный лазерный чип для DWDM-сетей. Как это решает проблему масштабирования и энергопотребления AI-дата-цент 5 мин чтения 3549 nano-KvLLM: Сжимаем KV-кеш в 4 раза без потерь для длинных контекстов Обзор nano-KvLLM 2.1 - фреймворка для сжатия KV-кеша на основе nano-vLLM. Ускорение работы с длинным контекстом, сравнение с vLLM и llama.cpp, примеры использов 4 мин чтения 3550 Attention вместо Residual Connections: как Kimi добился прорыва в архитектуре LLM Kimi K2.5 заменил residual connections на attention mechanism. Улучшение бенчмарков GPQA, MATH, HumanEval при минимальных накладных расходах. Участие Karpathy. 4 мин чтения 3551 OpenCode не совсем локальный: разбираемся с проблемой прокси и как обеспечить true local режим Почему OpenCode отправляет данные наружу по умолчанию? Гайд по настройке истинно локального режима и альтернативы для работы за firewall. 3 мин чтения 3552 NVIDIA Rubin: как новые чипы с HBM4 и 22 ТБ/с снизят стоимость инференса в 10 раз Технический анализ NVIDIA Rubin с HBM4 и пропускной способностью 22 ТБ/с. Как транзисторы 336B снижают стоимость AI-инференса в 10 раз к 2026 году. 4 мин чтения