Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4371 материалов
01 GLM 5.2 с Vision на 8x NVIDIA GB10: первые тесты и реальная производительность Реальные тесты GLM 5.2 Vision на 8× NVIDIA GB10: 33-54 токенов/с на тексте, задержка 200-400 мс на изображениях. Цифры, конфиги запуска и честный разбор огранич 11 мин чтения 02 Slipstream: как запустить MoE-модели до 480B на MacBook с 36 ГБ RAM, стримя экспертов с SSD Slipstream — форк llama.cpp для стриминга экспертов MoE-моделей с SSD. Запустите Qwen3.6-35B-A3B (13 ток/с) и Laguna 118B-A8B на MacBook с 36 ГБ RAM. Разбор про 9 мин чтения 03 Anthropic: Инсайты технического специалиста о внутренних дебатах и будущем AI-безопасности Разбор внутренних дебатов Anthropic по AI-безопасности: аргументы инженеров о темпах разработки, открытых весах и alignment-подходах. Как эти дискуссии влияют н 9 мин чтения 04 Организационная структура OpenAI: коалиция или корпорация? Как устроена OpenAI изнутри: некоммерческий фонд, ограниченная прибыль и коммерческий рукав. Анализ коалиционной модели, конфликта интересов и влияния на страте 6 мин чтения 05 Мониторинг использования локальных AI-моделей: месяц практики и аналитика За месяц трекинга через JSON-логгер собрано 14 200 запросов к локальным LLM. Разбираем реальные паттерны переключения на облака, балансировку рабочих и хобби-пр 11 мин чтения 06 Владение ИИ-интеллектом: как построить контролируемую, экономичную и самообучающуюся систему агентов Что значит владеть ИИ-интеллектом в бизнесе? Разбираем три уровня контроля: модель, обвязка, контекст. Как построить цикл обратной связи с трейсами, фидбеком и 8 мин чтения 07 Средние MoE-модели 2026: обзор Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и альтернатив Сравниваем средние MoE-модели 2026 года: Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и DeepSeek v4 Flash. Бенчмарки, требования к VRAM, примеры кода для запуска 8 мин чтения 08 Локальные LLM на мобильных устройствах в 2026: практические сценарии, ограничения и трюки Запуск LLM на iPhone и Android в 2026: 5 работающих сценариев с кодом, замеры скорости MLX и GGUF, техника компактификации контекста для бесконечных диалогов и 8 мин чтения 09 Домашний AI-сервер на AMD 7800X3D + 7800XT: проверка конфигурации и выбор LLM для Vibe Coding в 2026 Проверяем, поместятся ли Qwen 3.6-35B-A3B и 27B в 16 ГБ VRAM на AMD 7800XT. Цифры по квантизации, бенчмарки кода против 12B моделей, настройка Continue.dev и Ai 9 мин чтения 10 Браузерный инференс LLM: как LFM 2.5 на WebGPU выдаёт 1440 токенов/с без сервера Разработчик создал бэкенд для запуска LFM 2.5 и Bonsai 1.7B прямо в браузере через WebGPU. На RTX 3090 скорость достигает 1440 токенов/с, на Apple M4 — до 500 т 7 мин чтения 11 TensorSharp vs. llama.cpp: Практическое сравнение производительности нового GGUF-инференс-движка на CUDA и Vulkan Прямое сравнение TensorSharp и llama.cpp на Gemma 4 и Qwen 3.6: замеры decode, prefill и TTFT на CUDA и Vulkan. Узнайте, где новый C# движок выигрывает до 27.9% 8 мин чтения 12 CodeSlicer: как AI-агенты теряют целостность кода и почему граф влияния проекта решает эту проблему CodeSlicer строит проверяемый граф влияния кодовой базы и устраняет главную причину ошибок AI-агентов — невидимость системных зависимостей. Разбираем конвейер и 10 мин чтения