Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4365 материалов
01 v100-skinny: как запустить Qwen3.6 27B на старых V100 с NVFP4 и получить до 366 токенов/с Проект v100-skinny запускает Qwen3.6 27B с NVFP4-квантованием на устаревших V100 со скоростью до 366 токенов/с. Разбираем CUDA-ядра, бенчмарки на JSON и кодоген 7 мин чтения 02 Почему больше инструментов не значит лучше: как monday.com перестроил архитектуру своего AI-ассистента Sidekick Инженерный кейс monday.com: как рост числа инструментов разрушает работу AI-ассистента в production, и почему модульная архитектура с оркестратором, субагентами 11 мин чтения 03 Сравнительный локальный бенчмарк Muse Glimmer 30B, Qwen 3.6 27B и Gemma4 31B: эффективность и запросы Независимый тест моделей 27B–31B: Muse Glimmer 30B догоняет конкурентов по качеству, но требует в 2-3 раза больше запросов. Детальные метрики и выводы для практ 5 мин чтения 04 Daybreak Red и Daybreak Blue на Amazon Bedrock: как AWS и OpenAI усиливают киберзащиту с помощью специализированных моделей AWS и OpenAI запустили Daybreak Red (GPT-5.6 Cyber) и Daybreak Blue (GPT-5.6 Sol) на Amazon Bedrock. Разбираем контекстную архитектуру безопасности, сценарии дл 9 мин чтения 05 Квантование DeepSeek V4 0731: скрытые баги конвертера, честный бенчмарк и хаос в названиях на Hugging Face Команда AtomicChat нашла критические ошибки в конвертере DeepSeek V4 0731: NaN в эмбеддингах и искажение FP8→Q8_0. Исправленная модель и тест 38 квантов на 8×RT 6 мин чтения 06 Многоузловые конфигурации Spark Cluster для LLM: опыт сообщества r/LocalLLaMA Разбор уникального кейса: участник r/LocalLLaMA продаёт четырёхузловой Spark-кластер с недокументированными конфигурациями супернод для оптимизации LLM-фреймвор 8 мин чтения 07 Практическое тестирование CMP170HX: 256 ГБ VRAM за $200 — реальность или лотерея? Четыре CMP170HX по 64 ГБ дают 256 ГБ VRAM за $800. Тестируем в llama.cpp: до 120 t/s на 20B моделях, контекст 1M для DeepSeek V4-Flash. Разбираем узкие места, с 9 мин чтения 08 Accel закрывает фонд $550M для Индии: ставка на ИИ и новые горизонты венчурного рынка Accel закрыла фонд для Индии на $550 млн, несмотря на неиспользованные резервы предыдущего. Разбираем стратегию: почему ИИ стал горизонтальной технологией, каки 5 мин чтения 09 Могут ли LLM распознавать свои галлюцинации через анализ logprobs? Эксперимент с Gemma и Qwen Экспериментальная проверка гипотезы: можно ли отловить галлюцинации LLM через анализ logprobs в момент первого появления факта? Тесты Gemma и Qwen показали AUC 7 мин чтения 10 Тест Muse Glimmer в реальных задачах кодинга: результаты, ограничения и сравнение с Qwen3.6 27B Практический тест Muse Glimmer с Q4 квантизацией на M5 Pro: 17 токенов/с, сравнение качества кода с Qwen3.6 27B на frontend и backend задачах. Честный обзор огр 8 мин чтения 11 Muse Spark 1.2: стратегический ход Meta на фоне задержки Llama 4 Behemoth Meta открыла исходный код Muse Spark 1.2 — мультимодальной модели на 30B параметров с двукратной экономией токенов. Разбираем архитектуру, визуальную цепочку ра 9 мин чтения 12 Daybreak Blue и Red: как OpenAI перестраивает киберзащиту с помощью новых уровней и модели GPT-5.6-Cyber OpenAI разделила киберзащиту Daybreak на уровни Blue и Red. Blue — реагирование на инциденты, анализ вредоносного ПО и проверка патчей для большинства защитнико 6 мин чтения