Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4371
материалов
01
Интеграция Minimax M3 в llama.cpp: архитектура MSA и локальный инференс без облаков
Minimax M3 с архитектурой MSA теперь в llama.cpp. Запускайте модели локально на CPU и GPU без облачных API. Пошаговое руководство, бенчмарки на i9, M2 и RTX 409
02
Gemma 3: что нового в обновлённой линейке моделей от Google и стоит ли её внедрять
Google готовит Gemma 3 — открытую модель с улучшенной архитектурой, контекстом до 128K токенов и оптимизацией для CPU и мобильных устройств. Разбираем ожидаемые
03
Agentic Bakeoff: ThinkingCap vs Fable Fusion vs стоковый Qwen3.6-27B — кто побеждает в агентных задачах?
90 тестовых прогонов, 6 задач, 3 модели: ThinkingCap экономит 34% токенов, но срывается в штопор лишних вызовов. Fable Fusion находит мейнтейнера через GitHub A
04
Архитектура ELIZA: как первый чат-бот имитировал понимание и почему это важно сегодня
Детальный разбор архитектуры ELIZA: движок обработки естественного языка, скрипты, шаблоны, память и эффект Элизы. Узнайте, как Вейценбаум в 1966 году создал пр
05
Кластеризация AMD Ryzen AI Halo: почему RPC-связь убивает производительность и как это исправить
Эксперимент LTT Labs с двумя Linux-версиями AMD Ryzen AI Halo показал, что наивное удвоение модулей не даёт прироста из-за RPC-связи. Разбираем метрики задержек
06
MiniMax открывает веса: что внутри флагманской модели и как это изменит рынок открытых AI в 2026
MiniMax выложила веса флагманской модели: 2,4 трлн параметров, MoE-архитектура, поддержка русского языка. Бенчмарки, требования к GPU, код для файнтюнинга и инс
07
TurboQuant в 2026: зрелость, стабильность и практическое применение
TurboQuant в 2026 году: детальный разбор зрелости форка llama.cpp для экстремального сжатия LLM. Сравнение с GGUF и AWQ по perplexity, скорости и потреблению VR
08
Falcon3-10B в 1.58 бита на RTX 5070: 97.5 ток/с на декоде — разбор реализации
Разбор экспериментального GPU-инференса Falcon3-10B в 1.58 бита на RTX 5070. Triton-ядра, упаковка весов, DP4A, StaticCache и CUDA Graph дают 97.5 ток/с — в 9.8
09
GLM 5.2 3-bit: Бенчмарк скорости на гибридной конфигурации CPU+GPU за $900
Тестируем 3-битную GLM 5.2 на системе с 4×Xeon E5-8880 v4, 1 ТБ DDR3 и двумя RTX 3060 12 ГБ. Инференс 44 токена/с, генерация 8 токенов/с при контексте 20K. Счит
10
RTX 5090 vs workstation-карты: что выбрать для локального инференса LLM в 2026 году?
RTX 5090 или RTX 6000 Ada для локального инференса LLM? Сравниваем VRAM, NVLink, цену за гигабайт и реальные сценарии файнтюнинга. Цифры, таблицы и четкий ответ
11
Локальное развёртывание Qwen TTS: разбор типичных ошибок и их исправление
Локальный Qwen TTS выдаёт шум или тишину? Пошаговый разбор трёх типичных симптомов с кодом диагностики, готовый requirements.txt для совместимых версий библиоте
12
Истерика вокруг китайских AI-моделей: политика, страхи и реальность
Релиз Kimi от Moonshot AI вызвал панику в США: Nasdaq упал, лоббисты заговорили об «AI-коммунизме». Разбираем реальные причины истерики, кому выгодна шумиха вок