Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

1920 материалов
01 Как субъективно оценить скорость генерации LLM: скрипт для визуализации tokens/s Узнайте, как скрипт визуализации токенов в секунду помогает реально ощутить скорость генерации LLM, сравнить квантования и избежать иллюзий бенчмарков. 6 мин чтения 02 NCCL-Free Tensor Parallelism в llama.cpp: две Blackwell GPU работают без лишних танцев с бубном Разбираем новую фичу llama.cpp b9095 — тензорный параллелизм без NCCL на двух Blackwell. Как это работает, кому нужно и почему проще, чем кажется. 5 мин чтения 03 BarkingDog: как я гонял Telegram-бота на LLM через адский редтиминг Разбираем BarkingDog — open-source утилиту для автоматического тестирования безопасности Telegram-ботов на базе LLM. Примеры атак, сравнение с аналогами и практ 5 мин чтения 04 EMO: эмерджентная модульность в MoE — новая парадигма обучения языковых моделей Разбираем EMO — новый подход к Mixture of Experts, который включает только 12.5% экспертов без балансировки нагрузки. Сравнение с DeepSeek, Qwen, анализ архитек 6 мин чтения 05 ds4 WebUI: минимализм, который не бесит, или как antirez подарил нам UI для сервера из одного файла Обзор ds4-webui — минималистичного веб-интерфейса для сервера ds4 от antirez. Сравнение с Oobabooga, Jan AI, LM Studio и Open WebUI, примеры использования, для 5 мин чтения 06 Три в одном: Nvidia Star Elastic — как 12B, 23B и 30B живут в одном файле, и зачем тебе Zero-Shot Slicing Nvidia Star Elastic хранит три модели в одном чекпоинте. Узнайте, как работает Zero-Shot Slicing, и получите пошаговое руководство по запуску на своем железе. 6 мин чтения 07 OncoAgent: open-source мультиагентная система для онкологии на LangGraph и QLoRA Обзор OncoAgent — мультиагентной системы на LangGraph и QLoRA для анализа рака. Приватное развертывание на AMD MI300X. Сравнение с Med-PaLM, примеры. 6 мин чтения 08 LazyWeb: бесплатный MCP-сервер для AI-дизайна интерфейсов с пулом из 257 000 экранов реальных приложений Бесплатный MCP-сервер LazyWeb с пулом из 257 000 реальных скриншотов приложений. Решает проблему AI-look, помогает генерировать уникальные интерфейсы через Clau 5 мин чтения 09 BeeLlama.cpp: форк llama.cpp с TurboQuant и DFlash – ускорение Qwen 27B до 135 tps на 3090 Обзор форка llama.cpp с TurboQuant и DFlash: как выжать 135 tps из Qwen 27B на RTX 3090. Детали квантования Q5, контекст 200k, сравнение с альтернативами. 6 мин чтения 10 Как запустить MiMo-V2.5 с контекстом 1M на локальном ПК: тест производительности и настройка Пошаговый гайд по запуску MiMo-V2.5 с контекстом 1M токенов. Оптимизация памяти, команды для llama-server, тесты скорости и реальные сценарии использования. 6 мин чтения 11 Caliby: новая open-source векторная БД для AI-агентов, превосходящая pgvector и FAISS Обзор Caliby — встраиваемой векторной БД, которая обгоняет pgvector и FAISS по скорости и эффективности на диске. Примеры, сравнения, рекомендации. 5 мин чтения 12 CyberSecQwen-4B: маленькая, злая и полностью ваша. Локальная LLM для безопасности CyberSecQwen-4B - 4-миллиардная модель для SOC и пентестеров. Работает офлайн, не сливает данные, понимает логи, атаки, уязвимости. Полный обзор и сравнение с а 5 мин чтения