Перейти к содержанию
Тематическая лента

Подборка материалов

Публикации, объединённые общей практической задачей.

4371 материалов
01 Gemini Distillation Service: дистилляция моделей от Google как услуга для разработчиков Google запускает Gemini Distillation Service — управляемый сервис дистилляции LLM, который сжимает недели экспериментов в часы. Разбираем механику, сценарии при 7 мин чтения 02 Энергетический кризис дата-центров: отключения, автономное питание и будущее AI-инфраструктуры Крупнейшая электросеть США PJM начала отключать дата-центры мощностью от 50 МВт из-за нехватки генерации. Оптовые цены на электроэнергию почти удвоились, потреб 11 мин чтения 03 Открытие весов устаревших проприетарных моделей: почему GPT-4 и Gemini-2.5 остаются закрытыми Сэм Альтман обещал открыть GPT-4 как «музейный артефакт» ещё в октябре 2025 — модель до сих пор закрыта. Разбираем три реальных барьера: коммерческую монетизаци 7 мин чтения 04 Экономика инференса LLM на Apple Silicon: почему большая модель может быть дешевле Практический эксперимент на Mac Studio M3 Ultra: замеряем энергопотребление и стоимость за миллион токенов для пяти моделей от 4B до 120B. Узнайте, почему квант 6 мин чтения 05 Managed Agents в Gemini API: обзор Gemini 3.6 Flash, хуков окружения и бюджетного контроля Google DeepMind обновила Managed Agents: Gemini 3.6 Flash по умолчанию, environment hooks для кастомизации песочницы, HTTP-хуки для внешней валидации, контроль 6 мин чтения 06 Мультиязычное расширение SWE-rebench: первые результаты GLM-5.2, DeepSeek-V4 Pro и Qwen3.6-27B в задачах на Go, Java, Python, Rust и TS Обновлённый SWE-rebench тестирует модели на Go, Java, Python, Rust и TypeScript. GLM-5.2 лидирует с Pass@1 62,9% и полным прохождением всех языков в 39,6% случа 6 мин чтения 07 DeepSeek V4 Flash на AMD Ryzen AI MAX+ 395: как достичь 32 tok/s локального инференса Команда Lucebox запустила DeepSeek V4 Flash (284B) на одном APU AMD Ryzen AI MAX+ 395 со скоростью 32 tok/s — вдвое быстрее предыдущего рекорда. Разбираем смеша 8 мин чтения 08 Оптимизация эмбеддеров для RAG: как ужать русский retriever до 24 млн параметров и не потерять качество Как создать быстрый русский dense-эмбеддер для RAG: обрезка RuModernBERT-small до 4 слоёв, контрастивное обучение и разбор ошибок, которые стоили 14 п.п. recall 7 мин чтения 09 Следующее поколение Qwen: когда ждать модели 30B–100B и к чему готовиться Прогноз релиза Qwen 30B–100B: разбираем слухи о версиях 3.7/3.8, оцениваем реалистичные сроки выхода во второй половине 2026 и даём практические рекомендации по 8 мин чтения 10 Структурная инженерия для агентного SDLC на слабых LLM: опыт корпоративного харнеса Как построить надёжный агентный SDLC на слабых LLM через структурную инженерию: правила, изоляция, трехуровневая защита и реальные кейсы из корпоративной практи 11 мин чтения 11 Как построить надёжный AI-пайплайн: практический разбор архитектуры Shorts Maker v2 Разбор рефакторинга AI-генератора коротких видео: от прототипа на asyncio.gather() с полной потерей прогресса при сбоях до production-решения с DDD, атомарными 9 мин чтения 12 Почему Cyera платит $1 млрд за стартап по безопасности AI-агентов: разбор сделки и рынка Non-Human Identities Cyera покупает Oasis Security за $1 млрд, чтобы контролировать AI-агентов и нечеловеческие идентичности. Разбираем технологию, финансовые показатели и последств 6 мин чтения