Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4371 материалов
01 Интеграция Minimax M3 в llama.cpp: архитектура MSA и локальный инференс без облаков Minimax M3 с архитектурой MSA теперь в llama.cpp. Запускайте модели локально на CPU и GPU без облачных API. Пошаговое руководство, бенчмарки на i9, M2 и RTX 409 8 мин чтения 02 Gemma 3: что нового в обновлённой линейке моделей от Google и стоит ли её внедрять Google готовит Gemma 3 — открытую модель с улучшенной архитектурой, контекстом до 128K токенов и оптимизацией для CPU и мобильных устройств. Разбираем ожидаемые 7 мин чтения 03 Agentic Bakeoff: ThinkingCap vs Fable Fusion vs стоковый Qwen3.6-27B — кто побеждает в агентных задачах? 90 тестовых прогонов, 6 задач, 3 модели: ThinkingCap экономит 34% токенов, но срывается в штопор лишних вызовов. Fable Fusion находит мейнтейнера через GitHub A 7 мин чтения 04 Архитектура ELIZA: как первый чат-бот имитировал понимание и почему это важно сегодня Детальный разбор архитектуры ELIZA: движок обработки естественного языка, скрипты, шаблоны, память и эффект Элизы. Узнайте, как Вейценбаум в 1966 году создал пр 10 мин чтения 05 Кластеризация AMD Ryzen AI Halo: почему RPC-связь убивает производительность и как это исправить Эксперимент LTT Labs с двумя Linux-версиями AMD Ryzen AI Halo показал, что наивное удвоение модулей не даёт прироста из-за RPC-связи. Разбираем метрики задержек 7 мин чтения 06 MiniMax открывает веса: что внутри флагманской модели и как это изменит рынок открытых AI в 2026 MiniMax выложила веса флагманской модели: 2,4 трлн параметров, MoE-архитектура, поддержка русского языка. Бенчмарки, требования к GPU, код для файнтюнинга и инс 8 мин чтения 07 TurboQuant в 2026: зрелость, стабильность и практическое применение TurboQuant в 2026 году: детальный разбор зрелости форка llama.cpp для экстремального сжатия LLM. Сравнение с GGUF и AWQ по perplexity, скорости и потреблению VR 8 мин чтения 08 Falcon3-10B в 1.58 бита на RTX 5070: 97.5 ток/с на декоде — разбор реализации Разбор экспериментального GPU-инференса Falcon3-10B в 1.58 бита на RTX 5070. Triton-ядра, упаковка весов, DP4A, StaticCache и CUDA Graph дают 97.5 ток/с — в 9.8 5 мин чтения 09 GLM 5.2 3-bit: Бенчмарк скорости на гибридной конфигурации CPU+GPU за $900 Тестируем 3-битную GLM 5.2 на системе с 4×Xeon E5-8880 v4, 1 ТБ DDR3 и двумя RTX 3060 12 ГБ. Инференс 44 токена/с, генерация 8 токенов/с при контексте 20K. Счит 7 мин чтения 10 RTX 5090 vs workstation-карты: что выбрать для локального инференса LLM в 2026 году? RTX 5090 или RTX 6000 Ada для локального инференса LLM? Сравниваем VRAM, NVLink, цену за гигабайт и реальные сценарии файнтюнинга. Цифры, таблицы и четкий ответ 8 мин чтения 11 Локальное развёртывание Qwen TTS: разбор типичных ошибок и их исправление Локальный Qwen TTS выдаёт шум или тишину? Пошаговый разбор трёх типичных симптомов с кодом диагностики, готовый requirements.txt для совместимых версий библиоте 7 мин чтения 12 Истерика вокруг китайских AI-моделей: политика, страхи и реальность Релиз Kimi от Moonshot AI вызвал панику в США: Nasdaq упал, лоббисты заговорили об «AI-коммунизме». Разбираем реальные причины истерики, кому выгодна шумиха вок 7 мин чтения