Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4371
материалов
01
GLM 5.2 с Vision на 8x NVIDIA GB10: первые тесты и реальная производительность
Реальные тесты GLM 5.2 Vision на 8× NVIDIA GB10: 33-54 токенов/с на тексте, задержка 200-400 мс на изображениях. Цифры, конфиги запуска и честный разбор огранич
02
Slipstream: как запустить MoE-модели до 480B на MacBook с 36 ГБ RAM, стримя экспертов с SSD
Slipstream — форк llama.cpp для стриминга экспертов MoE-моделей с SSD. Запустите Qwen3.6-35B-A3B (13 ток/с) и Laguna 118B-A8B на MacBook с 36 ГБ RAM. Разбор про
03
Anthropic: Инсайты технического специалиста о внутренних дебатах и будущем AI-безопасности
Разбор внутренних дебатов Anthropic по AI-безопасности: аргументы инженеров о темпах разработки, открытых весах и alignment-подходах. Как эти дискуссии влияют н
04
Организационная структура OpenAI: коалиция или корпорация?
Как устроена OpenAI изнутри: некоммерческий фонд, ограниченная прибыль и коммерческий рукав. Анализ коалиционной модели, конфликта интересов и влияния на страте
05
Мониторинг использования локальных AI-моделей: месяц практики и аналитика
За месяц трекинга через JSON-логгер собрано 14 200 запросов к локальным LLM. Разбираем реальные паттерны переключения на облака, балансировку рабочих и хобби-пр
06
Владение ИИ-интеллектом: как построить контролируемую, экономичную и самообучающуюся систему агентов
Что значит владеть ИИ-интеллектом в бизнесе? Разбираем три уровня контроля: модель, обвязка, контекст. Как построить цикл обратной связи с трейсами, фидбеком и
07
Средние MoE-модели 2026: обзор Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и альтернатив
Сравниваем средние MoE-модели 2026 года: Qwen 3.5 35B, Gemma 4 A4B, Nemotron 3 Nano и DeepSeek v4 Flash. Бенчмарки, требования к VRAM, примеры кода для запуска
08
Локальные LLM на мобильных устройствах в 2026: практические сценарии, ограничения и трюки
Запуск LLM на iPhone и Android в 2026: 5 работающих сценариев с кодом, замеры скорости MLX и GGUF, техника компактификации контекста для бесконечных диалогов и
09
Домашний AI-сервер на AMD 7800X3D + 7800XT: проверка конфигурации и выбор LLM для Vibe Coding в 2026
Проверяем, поместятся ли Qwen 3.6-35B-A3B и 27B в 16 ГБ VRAM на AMD 7800XT. Цифры по квантизации, бенчмарки кода против 12B моделей, настройка Continue.dev и Ai
10
Браузерный инференс LLM: как LFM 2.5 на WebGPU выдаёт 1440 токенов/с без сервера
Разработчик создал бэкенд для запуска LFM 2.5 и Bonsai 1.7B прямо в браузере через WebGPU. На RTX 3090 скорость достигает 1440 токенов/с, на Apple M4 — до 500 т
11
TensorSharp vs. llama.cpp: Практическое сравнение производительности нового GGUF-инференс-движка на CUDA и Vulkan
Прямое сравнение TensorSharp и llama.cpp на Gemma 4 и Qwen 3.6: замеры decode, prefill и TTFT на CUDA и Vulkan. Узнайте, где новый C# движок выигрывает до 27.9%
12
CodeSlicer: как AI-агенты теряют целостность кода и почему граф влияния проекта решает эту проблему
CodeSlicer строит проверяемый граф влияния кодовой базы и устраняет главную причину ошибок AI-агентов — невидимость системных зависимостей. Разбираем конвейер и