Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Llama.cpp MTP: как включить Multi-Token Prediction в бета-версии для ускорения инференса Как активировать MTP в бета-сборке llama.cpp? Инструкция, тесты скорости на Qwen и Llama, сравнение с mlx-lm и vLLM. Ускорение до 2x на слабом железе. 7 мин чтения 02 Создаём AI-репетитора по английскому на Go с Clean Architecture и четырьмя LLM: полный разбор кода Подробный гайд по созданию AI-репетитора английского языка на Go: Clean Architecture, интеграция GPT-4o, Claude, Mistral, Gemini. Архитектура, примеры кода, сра 10 мин чтения 03 Hummingbird+: FPGA-ускоритель для LLM за $150 – обзор производительности Qwen3-30B-A3B Q4 на 24GB FPGA-ускоритель Hummingbird+ запускает Qwen3-30B-A3B Q4 со скоростью 18 токенов/с на 24GB. Стоит $150 - реальная альтернатива GPU. Подробные тесты и сравнения. 4 мин чтения 04 Daggr: цепляй AI-приложения кодом, а отлаживай глазами — стартуем Знакомство с библиотекой Daggr: пишем AI-пайплайны на Python, визуализируем граф, отлаживаем каждый узел. Сравнение с LangChain, примеры кода. 7 мин чтения 05 Granite 4.1: IBM сделала маленькие модели, которые бьют гигантов — архитектура, RL и секрет DAPO Разбор IBM Granite 4.1: архитектура 3B/8B/30B, претрейнинг на 15 трлн токенов, RL с GRPO и DAPO. 8B модель уделывает 32B MoE. Кому подходит, бенчмарки, сравнени 6 мин чтения 06 AI-агент спроектировал RISC-V процессор: как Verkor.io создал VerCore с помощью Design Conductor Первый в мире случай полного проектирования CPU AI-агентом. Обзор платформы Design Conductor, создавшей RISC-V процессор VerCore. Как это изменит chip-дизайн? 1 мин чтения 07 Как заблокировать нежелательные фразы в llama.cpp: готовый скрипт и инструкция по настройке Готовый скрипт на Python для фильтрации вывода llama.cpp. Установка, примеры, сравнение с альтернативами. Блокируйте конкретные слова и фразы в генерации. 4 мин чтения 08 Memory MCP для LLM: гибридный поиск BM25+вектора+RRF на Qwen3.5-4B — установка и настройка Пошаговая установка и настройка Memory MCP сервера для долговременной памяти LLM. Гибридный поиск BM25 + векторные эмбеддинги + RRF ранжирование на Qwen3.5-4B. 7 мин чтения 09 Запуск Qwen3.6-27B с agentic search на одной 3090: достижение 95.7% SimpleQA локально Как запустить Qwen3.6-27B с агентическим поиском на одной RTX 3090 и обогнать GPT-4o в фактологической точности. Инструкция и тесты. 5 мин чтения 10 Гибридный инференс LLM на Android: llama.cpp + LiteRT + NPU/GPU — первый опыт Разбираем первый опыт гибридного инференса LLM на Android: llama.cpp + LiteRT с задействованием NPU/GPU. Сравнение с альтернативами, примеры настройки и практич 6 мин чтения 11 Объединяем GPU в домашний кластер: mDNS и ZeroConf для распределенного обучения LLM без боли Как настроить автоматическое обнаружение узлов через mDNS для распределенного обучения LLM на домашнем кластере. Пошаговый гайд с Avahi и PyTorch Distributed. 6 мин чтения 12 OBLITERATUS: новый уровень red-teaming для MoE моделей — почему Heretic уже не тянет Разбираем инструмент elder_plinus для red-teaming MoE моделей. Сравнение с Heretic, примеры атак и выводы для пентестеров. Актуально на май 2026. 6 мин чтения