Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Как Qwen 3.5-27B автоматически строит backend-системы: разбор AutoBe и экономия до 25 раз Как инструмент AutoBe с моделью Qwen 3.5-27B автоматически создает backend. Разбор возможностей, сравнение с аналогами и реальная экономия до 25 раз на разработ 5 мин чтения 02 Исправленный Qwen3.5-35B-A3B-Uncensored: как установить и использовать с промптом для глубокого мышления Пошаговый гайд: как скачать исправленные GGUF-файлы Qwen3.5-35B-A3B-Uncensored с Hugging Face, настроить llama.cpp и использовать мощный промпт для глубокого мы 7 мин чтения 03 Google AI Edge Eloquent: тестируем офлайн-диктовку на Gemma и сравнение с Wispr Flow Обзор Google AI Edge Eloquent — офлайн-диктовка на Gemma ASR. Сравнение с Wispr Flow по точности, скорости и приватности. 5 мин чтения 04 Tensor Parallelism в ik_llama: подробный гайд по ускорению Gemma 4 31B на нескольких GPU Полное руководство по настройке Tensor Parallelism в ik_llama для запуска Gemma 4 31B на нескольких видеокартах. Тесты PPL, сравнение производительности и пошаг 7 мин чтения 05 Асинхронные под-агенты в Deep Agents: как распараллелить долгие задачи и не сойти с ума Как использовать асинхронные под-агенты в Deep Agents для распараллеливания длинных задач. Stateful агенты, удаленные агенты, гетерогенное развертывание. 6 мин чтения 06 SpectralQuant: революционный метод квантования LLM, который на 18% лучше TurboQuant — установка и бенчмарки Обзор SpectralQuant — нового метода квантования LLM с открытым кодом. Сравнение с TurboQuant, установка и бенчмарки на 07.04.2026. 4 мин чтения 07 Auto-SKILLs: как Gemma 4 создаёт навыки для агентов, наблюдая за действиями на экране Как Gemma 4 автоматически создает навыки для AI-агентов, наблюдая за действиями пользователя на экране. Обзор возможностей, сравнение с аналогами и примеры испо 5 мин чтения 08 InCoder-32B-Thinking: обзор открытой LLM для генерации кода под микроконтроллеры и GPU Обзор InCoder-32B-Thinking — открытой модели для генерации кода на Verilog и CUDA. Возможности, сравнение с альтернативами, примеры использования. 4 мин чтения 09 FATE: как ускорить вывод MoE-моделей в llama.cpp с помощью кэша экспертов и prefetching Обзор FATE - форка llama.cpp с кэшем экспертов и prefetching для ускорения вывода MoE-моделей. Примеры с Qwen3-30B. 5 мин чтения 10 EUPE от Meta: под микроскопом. Зачем вам еще один vision-энкодер, и почему он резко сократит ваш счет за облако Разбираем EUPE от Meta - компактный vision encoder меньше 100M параметров. Как установить, где использовать и стоит ли он внимания в 2026 году. 7 мин чтения 11 Как выбрать лучший GGUF-квант для Gemma 4 31B: сравнение по KL divergence и практические рекомендации Актуальный гайд на 2026 год: сравниваем все кванты Gemma 4 31B по KL divergence, смотрим размеры и даем рекомендации для слабого железа. 6 мин чтения 12 TurboQuant для Gemma 4 31B: как использовать KV-сжатие 3-bit для работы с длинным контекстом Практическое руководство по применению TurboQuant с PolarQuant для сжатия KV-кэша Gemma 4 31B. Экономим память, работаем с контекстом до 256K токенов. 7 мин чтения