Что известно о планах DeepSeek на 2T и 8T параметров
Обсуждение в r/LocalLLaMA, опубликованное 21 сентября 2026 года, содержит конкретное утверждение: DeepSeek обучает модель с 2 триллионами параметров и рассчитывает со временем дойти до 8 триллионов. Официального подтверждения у этих цифр нет. Ни анонса в блоге компании, ни упоминания в техническом отчёте, ни карточки модели с такими характеристиками. Это заявление из треда, и относиться к нему нужно соответственно.
Там же приводятся точки отсчёта: текущая DeepSeek Flash оценивается в 552 млрд параметров, DeepSeek Pro - в 1,6 трлн общих параметров при 49 млрд активируемых весов на токен. Отдельно упоминается Mythos/Fable с оценкой около 10 трлн параметров. Все эти числа идут из одного разговора, а не из опубликованных конфигураций, поэтому уточнения возможны по любой из позиций.
Практический смысл новости в другом. Даже если 2T и 8T окажутся неточными, направление видно: лаборатории продолжают наращивать общее число параметров, а разбираться в таких моделях всё равно приходится через активируемые веса, требования к памяти и стоимость инференса.
Почему это пока только заявления из обсуждения
Первоисточник - тред в r/LocalLLaMA от 21 сентября 2026 года. Это запись дискуссии, а не пресс-релиз и не статья с техническими деталями. В подобных обсуждениях регулярно появляются сведения от людей, знакомых с разработкой изнутри, но проверить их нечем: нет ни подтверждения от DeepSeek, ни конфигурационных файлов, ни опубликованных весов.
Отсюда три практических правила. Первое: цифры 2T и 8T не годятся как основа для планирования бюджета или закупки железа, потому что у них нет ни сроков, ни подтверждённых характеристик. Второе: параметры Flash, Pro и Mythos/Fable из того же разговора тоже могут быть неточными, включая 552 млрд у Flash. Третье: сверять такие данные нужно по официальным каналам DeepSeek - странице моделей, техотчётам, репозиториям и карточкам на Hugging Face, где выкладывают веса и их формат.
Текущие модели DeepSeek: Flash и Pro в цифрах
Разница между Flash и Pro по указанным данным выглядит так:
- DeepSeek Flash - 552 млрд параметров. Число активируемых весов на токен в источнике не приводится.
- DeepSeek Pro - 1,6 трлн общих параметров и 49 млрд активируемых весов на токен.
Колонку с активируемыми весами для Flash никто не заполнил, и подставлять туда догадки не нужно: это разные модели, и переносить цифру Pro на Flash некорректно. Если понадобится точное значение, его придётся искать в официальном описании модели.
Pro интересен тем, что показывает разреженность в числах. 1,6 трлн весов лежат в памяти целиком, но при генерации каждого токена участвует только 49 млрд из них, то есть около 3% от общего объёма.
Как работает MoE и что такое разреженная активация
Mixture of Experts (MoE) - схема, при которой трансформерный блок содержит не один набор весов, а множество параллельных подсетей-экспертов. Слой-роутер оценивает текущий токен и выбирает нескольких экспертов из доступного набора. Работают только выбранные, остальные в этом шаге не участвуют.
Из этой конструкции следуют два числа, которые описывают любую MoE-модель: сколько параметров у неё всего и сколько активируется на один токен.
Общие параметры против активируемых: в чём разница
Общие параметры - это весь объём весов модели. Их нужно где-то хранить: в VRAM, в оперативной памяти или на диске, если часть слоёв уходит в оффлоад. Именно общий размер определяет, поместится модель в ваше железо или нет, и сколько памяти под неё придётся выделить.
Активируемые параметры на токен - та часть весов, которая реально участвует в вычислении при генерации очередного токена. У DeepSeek Pro таких весов 49 млрд. По объёму вычислений один шаг генерации сопоставим с плотной моделью на 49 млрд параметров, а не на 1,6 трлн. Общая масса весов при этом никуда не девается и занимает память полностью.
Аналогия: библиотека на миллионы книг, где на каждый вопрос библиотекарь приносит несколько нужных полок. Искать по всему зданию не приходится, но здание всё равно построено и отапливается.
Почему активируемые веса на токен важнее «сырого» размера
Для инференса смотреть нужно в первую очередь на активируемые веса. Они задают вычислительную нагрузку на каждый токен, а значит latency и throughput. Общий объём влияет на другое: сколько памяти занять и как долго грузить веса перед первым запросом.
Отсюда практический пример. Теоретическая MoE-модель с 2 трлн общих параметров и 50 млрд активируемых по расчётной нагрузке ближе к плотной модели на 50B, чем к чему-то трёхтриллионному. С оговоркой: при условии, что роутинг не добавляет серьёзных накладных расходов, а память успевает отдавать нужные веса. На практике узким местом часто становится именно память и интерконнект, а не сами вычисления.
Обратную сторону той же логики видно на компактных MoE-моделях с ~2 млрд активных параметров, которые уверенно идут на GPU с 4 ГБ памяти: общий размер у них больше активируемой части, но требования к железу определяет именно она.
Что масштаб до 2T и 8T значит на практике: VRAM, кластеры и инференс
Начнём с арифметики, которая снимает большую часть иллюзий. Память под веса считается от числа параметров и формата хранения.
Сколько VRAM нужно для модели на 2T и 8T параметров
| Формат хранения | 2 трлн параметров | 8 трлн параметров |
|---|---|---|
| FP16 | около 4 ТБ | около 16 ТБ |
| 8 бит | около 2 ТБ | около 8 ТБ |
| 4 бита | около 1 ТБ | около 4 ТБ |
Это только веса. KV-кэш растёт с длиной контекста и числом параллельных запросов, а активации и служебные буферы добавляют ещё десятки гигабайт. На длинном контексте и батче из нескольких запросов кэш легко перекрывает разницу между 4 и 8 битами.
Для сравнения: у DeepSeek Flash 552 млрд параметров, то есть в FP16 это порядка 1,1 ТБ, а в 4-битной квантизации около 280 ГБ на веса. У Pro с 1,6 трлн общих параметров эти цифры примерно втрое выше.
Вывод по железу: модели на 2T и 8T живут на кластерах из десятков ускорителей с быстрым интерконнектом. Домашняя сборка на одной-двух картах такую модель не примет. Даже если веса уместить в жёсткую квантизацию, часть слоёв уйдёт в системную память, и перекачка весов по PCIe обрушит скорость генерации. Как считается распределение весов и KV-кэша по узлам и где упирается связь между ними, показано в разборе про кластеры на DGX Spark.
Почему стоимость инференса не растёт линейно
Логика такая: при росте общих параметров растёт объём памяти и требования к её пропускной способности, а активируемые веса могут остаться умеренными. Если гипотетическая 8T модель активирует те же 49-50 млрд весов на токен, что и Pro, объём вычислений на токен изменится слабо.
Дорожает другое. Эксперты раскладываются по разным устройствам, и роутер гоняет данные между ними. Нужна балансировка, чтобы часть GPU не простаивала. Чем больше общий объём, тем больше узлов и тем чувствительнее система к пропускной способности интерконнекта. Инфраструктура под 8T модель обойдётся заметно дороже, чем под 1,6T, даже при близком числе активируемых весов.
Второй фактор - оборудование и режим работы. Стоимость миллиона токенов сильно зависит от того, где крутится модель: на арендованных GPU, на своём сервере или на компактной локальной машине с квантизацией. Как это выглядит в цифрах на примере Apple Silicon, показано в разборе экономики инференса на Mac Studio: там квантизованная MoE-модель на 118B параметров выходит в пять раз дешевле плотной 27B.
Как масштаб влияет на качество и скорость
Закон масштабирования и его ограничения
Общее правило: рост числа параметров вместе с объёмом данных и compute улучшает качество, но отдача убывает. Каждый следующий триллион параметров даёт меньший прирост, чем предыдущий, и требует непропорционально больше вычислений на обучение.
У MoE добавляется свой фактор. Качество зависит от того, насколько хорошо обучен роутер и насколько равномерно распределяется нагрузка между экспертами. Слабый роутинг сведёт на нет преимущество большого числа экспертов. Поэтому Mythos/Fable с оценкой около 10 трлн параметров - это цифра размера, а не доказательство превосходства. Без данных о качестве и результатах на задачах сравнивать модели по одному числу параметров бессмысленно.
Второй ограничитель - данные. Веса нужно чем-то заполнять: если качественного текста и кода для обучения не хватает, лишние параметры не дадут отдачи. Третий - физический предел сжатия интеллекта в компактные конфигурации, о котором говорит отдельный разбор пределов сжатия в модели на 20B параметров. Там разбирается, что даёт MoE, дистилляция и квантование и где заканчиваются возможности маленьких моделей.
Скорость генерации: что важнее общего размера
На скорость в реальных задачах влияют активируемые параметры на токен, эффективность роутинга, пропускная способность памяти и интерконнект. Общий размер здесь вторичен: он сказывается на времени загрузки и объёме памяти, но не на числе операций для одного токена.
Ориентир по активируемым весам: DeepSeek Pro активирует 49 млрд на токен. Если у гипотетической модели на 2T активируемых весов будет столько же или меньше, скорость генерации может остаться сопоставимой с Pro. Если больше - latency вырастет. Пока нет опубликованных конфигураций и замеров для 2T и 8T, оценивать токены в секунду не на чем.
Замеры на конкретном стенде тоже требуют осторожности: у MoE-моделей скорость сильно зависит от того, как веса разложены по устройствам и где оставлен KV-кэш. Как это выглядит на практике при фиксированных 192 ГБ VRAM, видно в сравнении Minimax 2.7, DeepSeek V4 Flash и Laguna S 2.1: там приведены цифры по качеству кода, скорости и стоимости инференса.
Сравнение масштаба: DeepSeek, Flash, Pro и Mythos/Fable
Сводная картина по числам из обсуждения:
| Модель | Общие параметры | Активируемые веса на токен | Статус данных |
|---|---|---|---|
| DeepSeek Flash | 552 млрд | не раскрыто | текущая, по данным обсуждения |
| DeepSeek Pro | 1,6 трлн | 49 млрд | текущая, по данным обсуждения |
| Будущая модель DeepSeek | 2 трлн, цель 8 трлн | не раскрыто | заявлено, не подтверждено |
| Mythos/Fable | около 10 трлн | не раскрыто | оценка из обсуждения |
Переход с 1,6T на 2T - это примерно +25% к общему размеру при неизвестном изменении активируемых весов. Такой шаг выглядит как эволюция внутри того же класса моделей.
Переход на 8T - другая история: это пятикратный рост относительно Pro и примерно в 15 раз больше, чем у Flash. Здесь меняется класс инфраструктуры, а не только размер чекпоинта. Оценка Mythos/Fable в 10 трлн показывает, что разговоры о числах такого порядка в сообществе уже идут, но это оценка, а не измеренная конфигурация.
Сравнивать модели напрямую по этой таблице нельзя: в ней нет ни одного столбца с качеством или результатами на задачах. Она показывает масштаб, а не силу модели.
Что это значит для локального запуска и практического использования
Какие модели реально доступны для локального запуска
Для домашнего инференса ориентир прежний: активируемые веса и доступная квантизация. Модели с 30-70 млрд активируемых параметров уже требуют продуманной конфигурации, а общий размер в квантизации определяет, поместится ли всё в память одной карты или понадобится разбивка по нескольким.
DeepSeek Flash с 552 млрд общих параметров - не домашний сценарий в чистом виде. Даже в 4-битной квантизации около 280 ГБ на веса означают либо несколько GPU, либо связку ускорителя и системной памяти с оффлоадом части слоёв. Компактные MoE-модели с ~2 млрд активных параметров работают на GPU от 4 ГБ и остаются рабочим вариантом для большинства домашних сборок, и об этом есть отдельный разбор MoE-моделей с 2B активных параметров.
Как следить за анонсами DeepSeek и не попадаться на слухи
Порядок проверки простой. Официальная страница моделей и техотчёты DeepSeek, репозитории компании, карточки весов на Hugging Face. Появление модели видно по конкретным файлам, конфигурациям и формату квантизации, а не по формулировкам из треда. Если в разговоре всплывают цифры вроде 2T или 8T без ссылки на такой источник, это гипотеза.
План действий на сейчас. Не откладывать рабочие задачи в ожидании 8T модели: сроков нет, характеристики неизвестны. Для локального инференса выбирать модели по активируемым весам и квантизации, которые помещаются в вашу память, а не по общему числу параметров в анонсе. Для задач, где нужен максимум качества, смотреть на API и облачные варианты, а не ждать запуска триллионной модели на домашнем железе.
По поводу 2T и 8T полезно держать в голове пропорцию, а не абсолют. Если архитектура останется разреженной, даже при пятикратном росте общего числа параметров на каждый токен будет активироваться лишь небольшая часть весов, и именно она определит скорость и стоимость работы с моделью.