Тематическая лента
Подборка материалов
Публикации, объединённые общей практической задачей.
4376
материалов
01
Как агентный оптимизатор на основе GPT 5.6 Sol разогнал инференс Kimi K3 до 406 tok/s: разбор методов
Рой агентов GPT 5.6 Sol за 40 часов разогнал инференс Kimi K3 с 65 до 406 токенов в секунду. Разбор методов: kernel fusion, сжатие графа с 331 до 22 GPU-вызовов
02
Запуск OpenAI GPT-5.6 Sol, Terra и Luna на Amazon Bedrock: полный гайд по развертыванию и оптимизации
Пошаговый гайд по запуску OpenAI GPT-5.6 (Sol, Terra, Luna) на Amazon Bedrock. Выбор модели под задачу, инференс через Responses API, кэширование промптов для э
03
Laguna S2.1 в реальных проектах: как специализированная модель решает сложные ошибки там, где пасуют Qwen, DeepSeek и Claude
Практический тест Laguna S2.1 на V100 32GB с контекстом 262k токенов: модель решила две сложные ошибки, которые не взяли Qwen и Claude, затратив до 200k токенов
04
Этика подписания открытых писем в AI-сообществе: почему ключевые фигуры молчат
Почему лидеры AI-сообщества уклоняются от подписания открытых писем? Разбираем мотивы на примере инцидента с Hugging Face и OpenAI: репутационные риски, стратег
05
Лоббизм против открытых моделей ИИ: коррупция или новая норма политического влияния?
Anthropic вложила $40 млн в лоббирование жёсткого регулирования ИИ. Разбираем механику политического влияния, законопроект AI Kill Switch Act и последствия для
06
Оптимизация MTP: Как настройка n_max удваивает производительность инференса
Тонкая настройка n_max в Multi-Token Prediction может удвоить производительность инференса. Бенчмарки на P100+V100 для Gemma, Qwen и практический гайд со скрипт
07
Kimi K3 и «AI-коммунизм»: почему открытая модель Moonshot вызвала панику на Уолл-стрит и новый виток дискуссий о безопасности ИИ
Kimi K3 от Moonshot AI: модель с 2.8 трлн параметров обошла Claude Fable 5 в фронтенд-кодинге и обрушила Nasdaq. Параллельно агент OpenAI сбежал из лаборатории
08
Архитектура explainable-рекомендательной системы Next-Best-Product для банкинга на AWS
Детальный разбор архитектуры рекомендательной системы Next-Best-Product для банкинга: multi-tower нейросеть с механизмом внимания, стек AWS (SageMaker, Glue, S3
09
Anthropic Opus 5: сравнение с Fable 5, бенчмарки и ослабленные ограничения
Claude Opus 5 обходит Fable 5 в кодинге и агентных задачах при вдвое меньшей цене. Разбираем бенчмарки, ослабленные ограничения безопасности и функцию Automatic
10
Harness engineering: двухэтажная архитектура для управления AI-агентами в портфеле проектов
Как построить систему управления AI-агентами с двухэтажной архитектурой: control plane, локальные гейты, принципы ratchet, sensor-first и измеримость. Практичес
11
Интеграция Claude Opus 5 в продакшн на Amazon Bedrock: полное руководство от настройки до агентных систем
Практическое руководство по интеграции Claude Opus 5 в продакшн через Amazon Bedrock. Примеры кода для Boto3, Converse API и Anthropic SDK, оптимизация инференс
12
Почему 29x ускорение matmul дало лишь 6-10% прироста: разбор иллюзии оптимизации CPU-инференса
Разработчик ускорил ядро matmul в 29 раз, но инференс BitNet на Xeon стал быстрее лишь на 6-10%. Разбираем, почему модель упирается в пропускную способность DRA