Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Как Veai 5.7 ускоряет разработку: работа с директориями и переключение моделей в IDE Обзор плагина Veai 5.7. Как работа с контекстом папок и переключение между OpenAI, Anthropic и локальными LLM ускоряют код в IntelliJ IDEA. 5 мин чтения 02 Как заставить LLM играть в визуальные новеллы: патчинг Ren'Py, Ollama и автоматизация диалогов Как интегрировать локальную LLM в игры Ren'Py для автоматизации диалогов. Подробный гайд по патчингу, настройке Ollama и созданию ИИ-агента для визуальных новел 6 мин чтения 03 Microsoft GraphRAG и Ollama: практическое руководство по построению графа знаний на локальной машине Пошаговая сборка графа знаний с Microsoft GraphRAG и Ollama 0.6.0. Извлекаем сущности, визуализируем в Gephi, делаем запросы. Полный код и актуальные модели на 8 мин чтения 04 AdamBench: полный обзор бенчмарка для локальных LLM в агентском кодинге на RTX 5080 Полный обзор AdamBench — бенчмарка для оценки локальных LLM в агентском кодинге на RTX 5080. Сравнение моделей, метрики, примеры использования. 7 мин чтения 05 Modly: как запустить локальную генерацию 3D-моделей с TripoSG и TRELLIS Полный гайд по установке Modly для генерации 3D-моделей на своём ПК. Используйте TripoSG и TRELLIS для игровых ассетов и 3D-печати без интернета. 5 мин чтения 06 Voxtral Codec: как ужать речь до 2.14 кбит/с и не заметить разницы Обзор Voxtral Codec. Как работает новый кодек для TTS со сжатием речи до 2.14 кбит/с. Архитектура VQ+FSQ, сравнение с альтернативами, примеры использования. 5 мин чтения 07 Конфигурация vLLM для Qwen 3.5 27B: как добиться 1.1M токен/с на кластере с B200 Рекордная скорость инференса 1.1M токен/с на Qwen 3.5 27B с vLLM, NVIDIA B200, FP8 KV cache и MTP-1. Настройки и конфиги. 4 мин чтения 08 Кастомный бэкенд llama.cpp для AMD XDNA2 NPU: полное руководство по установке и настройке Эксклюзивный гайд по сборке кастомного бэкенда llama.cpp для AMD XDNA2 NPU. Настройка XRT, offload GEMM операций, тесты на Ryzen AI MAX 385. 6 мин чтения 09 Обзор OpenRoom от MiniMax: как запустить нишевую модель на Qwen 27B через llama.cpp Обзор нишевой модели OpenRoom для генерации контента. Инструкция по локальному запуску Qwen 27B через llama.cpp, сравнение с аналогами и примеры использования. 5 мин чтения 10 Cohere Transcribe: 2-миллиардный монстр для транскрипции, который не стесняется работать локально Открытая модель транскрипции от Cohere с 2 млрд параметров. Сравнение с Whisper, Parakeet, запуск на своем GPU. Точность, скорость, приватность. 5 мин чтения 11 OpenAgentPrompts: библиотека промптов для AI-агентов, которая экономит часы настроек Обзор open-source библиотеки системных промптов для AI-агентов. Готовые конфигурации для Cursor, Claude и локальных моделей. Экономия времени, сообщество на Dis 5 мин чтения 12 RotorQuant: новый метод квантования в 10-19 раз быстрее TurboQuant (CUDA и Metal ядра) RotorQuant — прорыв в квантовании KV-кэша с использованием Clifford rotors. Скорость в 10-19 раз выше TurboQuant, реализации на CUDA и Metal. Обзор на 26.03.202 5 мин чтения