Перейти к содержанию
Публикация AiManual

K2 Horizon от IFM: шесть открытых моделей от 0.9B до 375B и AMA с разработчиками 5 октября

IFM открыла K2 Horizon: шесть моделей от 0.9B до 375B, и вместе с весами выложила обучающие данные, код, промежуточные чекпоинты и логи тренировки. Разбираем, ч

Коротко

Что будет в материале

  1. 01

    Что такое K2 Horizon и почему это важно для локального AI

  2. 02

    Почему открытие данных и кода важно для сообщества

  3. 03

    AMA с командой IFM: как принять участие и что спросить

  4. 04

    Практический взгляд: кому и зачем нужны модели K2 Horizon

Institute of Foundation Models (IFM) выпустила K2 Horizon: шесть полностью открытых моделей размером от 0.9B до 375B параметров. Лаборатория называет набор связанным флотом (connected fleet). Пост с анонсом и приёмом вопросов опубликован на r/LocalLLaMA.

Веса - лишь один из артефактов релиза. IFM открыла обучающие данные и рецепты их подготовки, код обучения, промежуточные чекпоинты, детальные логи тренировки и результаты оценок. Такой комплект выкладывают редко: большинство открытых релизов ограничиваются файлами весов и карточкой модели.

Параллельно команда проводит AMA. Прямой эфир - в понедельник, 5 октября, с 20:00 до 22:00 по тихоокеанскому времени, вопросы принимают уже сейчас. Ниже - детали релиза, практический смысл открытых артефактов и список вопросов, которые стоит успеть задать.

Что такое K2 Horizon и почему это важно для локального AI

IFM (Institute of Foundation Models) - исследовательская лаборатория, которая занимается открытой и независимой разработкой фундаментных моделей фронтирного класса. K2 Horizon - её новый релиз. Публичный анонс короткий: диапазон размеров, перечень открытых артефактов, приглашение на AMA. Названий отдельных моделей, архитектур и лицензий в нём нет.

Для тех, кто запускает LLM на своём железе, важна комплектность релиза. Обычно пользователь получает файл весов и вынужден верить, что модель учили на приличных данных и без ошибок в пайплайне. Здесь вместе с весами публикуют данные, рецепты, код, чекпоинты и логи. Проверить можно многое: от состава смеси до поведения модели на середине обучения.

Шесть моделей: от 0.9B до 375B

Из анонса известны крайние точки диапазона. Младшая модель - 0.9B, старшая - 375B. Промежуточные размеры IFM не перечислила, поэтому четыре позиции из шести пока остаются неизвестными.

Разрыв между крайними точками огромен по требованиям к памяти. 0.9B в FP16 занимает примерно 1,8 ГБ под веса, в 4-битном квантовании - около 0,5 ГБ, плюс KV-cache и оверхед рантайма. Это арифметика по числу параметров, а не данные из карточки модели, но порядок величин такой. Такие версии рассчитаны на ноутбуки, мини-ПК, одноплатные компьютеры и быстрый инференс на CPU.

375B - противоположный конец: около 750 ГБ в FP16 и порядка 190 ГБ даже в 4-битном квантовании. Для локального запуска нужны несколько GPU или машина с большим объёмом памяти, а чаще аренда облачного узла. Число параметров не равно стоимости инференса напрямую: плотные и разреженные архитектуры ведут себя по-разному при одинаковом размере, а на скорость влияют контекст, батч и движок. Механику разбираем в материале про архитектуру, контекстное окно, KV-cache, VRAM и стоимость инференса.

Что именно связывает шесть моделей в «флот», в анонсе не расшифровано. Это может быть общий датасет, общее расписание обучения или дистилляция из старшей модели в младшие. Ответ на этот вопрос стоит получить до того, как строить планы вокруг конкретной версии.

Что именно открыл IFM: данные, код, чекпоинты, логи

Перечень открытых артефактов из анонса:

  • обучающие данные и рецепты их подготовки;
  • код обучения;
  • промежуточные чекпоинты;
  • детальные логи тренировки (fine-grained training logs);
  • результаты оценок (evals).

Практический смысл каждого пункта разный. Рецепты показывают, как фильтровали и смешивали корпуса. Код обучения фиксирует, как именно запускался процесс. Промежуточные чекпоинты дают доступ к модели на отдельных шагах, до финального постобучения. Логи содержат динамику метрик по шагам, что полезно для отладки собственных запусков. Результаты оценок дают точку отсчёта для сравнения.

Оговорка по объёму открытия. Из анонса не ясно, сколько данных выложено, под какой лицензией они распространяются и есть ли ограничения на коммерческое использование моделей. Формулировка «полностью открытые модели» описывает сами модели, но не гарантирует отсутствие лицензионных рамок. Считать релиз безлимитным до ответов команды рано.

Почему открытие данных и кода важно для сообщества

Открытые веса решают одну задачу: дают модель, которую можно запустить. Они не объясняют, почему модель ведёт себя именно так. Ответы лежат в данных, рецептах и логах, и эту часть IFM выложила публично.

Воспроизводимость и прозрачность обучения

С открытым кодом и рецептами обучение можно повторить, если есть ресурсы сопоставимого порядка. Для 375B это сотни GPU и месяцы работы, для 0.9B задача куда скромнее. Повторный запуск нужен не ради копии: он показывает, воспроизводится результат или держится на удачном стечении обстоятельств.

Промежуточные чекпоинты позволяют увидеть, как модель меняется по ходу обучения и на каком этапе появляются отдельные навыки. Логи тренировки связывают изменения метрик с гиперпараметрами и расписанием. Из этой связки складывается доверие к заявленным результатам.

Качество открытой модели зависит от данных, вычислений и архитектуры одновременно, и по одному числу параметров его не измерить. Эту зависимость разбираем в статье о том, почему локальные LLM пока уступают закрытым моделям.

Как это можно использовать на практике

Дообучение на своих данных. Открытые рецепты показывают, как готовили корпуса, и подсказывают, стоит ли повторять такой же пайплайн для доменных данных: юридических, медицинских, технических.

Работа со смесями. По рецептам видно, в каких пропорциях соединяли источники. Тот же подход применим к собственной смеси для файнтюна или для обучения небольшой модели с нуля.

Эксперименты с дистилляцией. Промежуточный чекпоинт иногда удобнее взять как промежуточную цель, чем финальную модель. Гипотезу придётся проверять на своих данных.

Отладка своих пайплайнов. Логи с детализацией по шагам показывают, как выглядят нормальные кривые, и упрощают поиск проблемы, если ваш запуск расходится с ожиданиями.

Для сообщества локальных LLM выгода в предсказуемости: видно, откуда взялись веса, и понятно, что можно менять. Тема ценности открытых моделей обсуждается и на уровне государственных стратегий, подробности в разборе предложений Hugging Face для AI-стратегии США.

AMA с командой IFM: как принять участие и что спросить

Сессия проходит на r/LocalLLaMA: понедельник, 5 октября, с 20:00 до 22:00 по тихоокеанскому времени. Вопросы принимают заранее, в комментариях к посту u/aya-ifm. Год в анонсе не указан, но по дате публикации поста речь о 2026-м, и 5 октября 2026 года действительно понедельник.

Отвечать будут шесть исследователей IFM:

  • Hector Liu, u/hunterhector;
  • Alexander Moreno, u/IFMAlex;
  • Mikhail Yurochkin, u/my-moonfolk;
  • Rupesh Srivastava, u/k2pt;
  • Junlin Chen, u/Junlin_Chen110;
  • Haonan Li, u/East-Career9147.

Заявленные темы AMA: предобучение, постобучение, MoVA, развёртывание

Список тем из анонса и что за ними стоит.

Предобучение и смеси данных. Как собирали корпуса, какие источники вошли, в каких пропорциях и по каким критериям отбраковывали мусор. Для тех, кто готовит собственные датасеты, это самая полезная часть.

Постобучение. Что делали с моделью после предобучения: этапы, методы, влияние на поведение. Конкретные подходы IFM пока не называла.

Малые модели на устройствах. Как ужимать модель под ограниченную память и как это отражается на качестве. Речь о ноутбуках, смартфонах и edge-железе.

MoVA и разреженное внимание. Разреженное внимание (sparse attention) - приём, при котором каждый токен смотрит не на весь контекст, а на подмножество позиций. Полное внимание растёт квадратично по длине контекста, разреженное снижает вычислительную нагрузку и позволяет держать длинные окна дешевле. Схемы бывают разными: скользящее окно, блочная структура, обучение паттерна. Что из этого применяется в K2 Horizon, в анонсе не сказано. Термин MoVA IFM не расшифровала. В литературе встречаются похожие сокращения, но связывать их с K2 Horizon без подтверждения нельзя.

Развёртывание. Форматы весов, поддерживаемые движки, требования к железу. Практичный блок для тех, кто планирует запуск.

Текущие и будущие релизы. Что уже доступно и что выйдет дальше. Здесь можно уточнить расписание для промежуточных размеров.

Какие вопросы стоит задать: пробелы в информации

Формулировки ниже опираются на то, чего нет в публичных материалах. Такие вопросы получают ответы чаще, чем общие рассуждения о перспективах.

  • Как называются все шесть моделей и какие у них архитектуры: плотные или разреженные?
  • Под какими лицензиями выходят веса, данные и код? Разрешено ли коммерческое использование?
  • Что входит в обучающие данные: объём, языки, доля синтетики, дата отсечки?
  • Что означает MoVA и какая схема разреженного внимания используется в K2 Horizon?
  • Какие платформы развёртывания поддерживаются официально: llama.cpp, vLLM, TensorRT-LLM?
  • Какие результаты показывают модели на бенчмарках и на каких версиях тестов?
  • Что именно связывает модели в «связанный флот»: общий датасет, расписание или дистилляция?
  • Планируются ли GGUF- и AWQ-кванты и когда ждать промежуточные размеры?

Практический взгляд: кому и зачем нужны модели K2 Horizon

Аудитория делится по доступному железу. Чем больше памяти, тем старше модель можно взять.

Малые модели для устройств: 0.9B и другие

0.9B укладывается в память ноутбука и одноплатного компьютера. В 4-битном квантовании веса занимают меньше гигабайта, остальное приходится на KV-cache и рантайм. Типовые задачи для такого размера: перевод, суммаризация коротких текстов, извлечение структурированных данных, простые шаги в агентных сценариях. Качество ниже, чем у больших версий, и это нормальный компромисс ради скорости и автономности.

Средние размеры, когда IFM их раскроет, обычно интересуют владельцев домашних серверов: там баланс между качеством и требованиями к памяти заметно лучше. Это общее наблюдение про open-weight модели, а не характеристика K2 Horizon.

Большие модели: 375B и требования к железу

375B относится к фронтирному классу. Даже в 4-битном квантовании это около 190 ГБ под веса, плюс KV-cache, который на длинном контексте съедает десятки гигабайт. Одна потребительская карта такой объём не тянет. Реалистичные варианты: аренда облачного узла с несколькими GPU или оффлоад части слоёв в системную память с просадкой по скорости. Поддерживаемые форматы и ограничения лицензии в анонсе не указаны.

Если нужен платный зарубежный сервис для аренды GPU или облачного API, оплата из России часто упирается в карту. Виртуальная банковская карта зарубежного банка выпускается дистанционно и пополняется в рублях через СБП, управление идёт через мессенджер, поддерживается привязка к Apple Pay, Google Pay, Alipay и WeChat.

Для исследовательских групп 375B интересна как объект экспериментов. Открытые промежуточные чекпоинты позволяют изучать, что происходит с моделью на разных этапах обучения, и это дешевле, чем обучать собственную модель с нуля.

Что осталось за кадром: ограничения и открытые вопросы

Публичный анонс короткий, и пробелов в нём больше, чем фактов. Что известно точно: шесть моделей, диапазон размеров от 0.9B до 375B, перечень открытых артефактов, дата и время AMA, состав участников.

  • Названия отдельных моделей, архитектуры и лицензии не раскрыты.
  • Содержание обучающих данных, рецептов, кода, чекпоинтов, логов и оценок не описано, подтверждён сам факт открытия.
  • MoVA и разреженное внимание упомянуты как темы, но без пояснений применительно к K2 Horizon.
  • Время указано в PT, без перевода в UTC.
  • Результаты оценок и поддерживаемые платформы развёртывания не названы.
  • Сравнений с Llama, Mistral, Falcon и другими открытыми семействами в анонсе нет.

До ответов команды оценки вроде «лучше всех в своём размере» брать неоткуда: нет ни бенчмарков, ни данных о железе, на котором их снимали. Практические выводы имеет смысл делать после AMA и после появления квантов.

Как следить за обновлениями и готовиться к AMA

Порядок действий, если тема интересна практически.

  1. Откройте пост на r/LocalLLaMA и оставьте вопросы в комментариях. Приём идёт до старта сессии.
  2. Сформулируйте 2-3 вопроса под свой сценарий: локальный запуск, файнтюн, лицензия для коммерческого продукта. Общие вопросы про будущее ИИ ответа не получат.
  3. Заблаговременно отметьте время эфира. 5 октября, 20:00-22:00 PT - это 6:00-8:00 по московскому времени 6 октября (в этот период PT соответствует UTC-7).
  4. После сессии вернитесь к посту: ответы и уточнения обычно появляются в комментариях, а не в отдельном анонсе.

Держать руку на пульсе по таким релизам удобно через подборки исследований: о том, как читать и фильтровать свежие работы, есть отдельный материал про Daily Papers на Hugging Face.

Что делать прямо сейчас: зайти в пост и задать вопрос про лицензии, названия моделей и поддерживаемые движки. Эти три пункта определяют, получится ли использовать K2 Horizon в работе или он останется только объектом для экспериментов.

Подписаться на канал