Перейти к содержанию
Публикация AiManual

HuatuoGPT-3-27B: медицинская LLM на Qwen3 с обучением OnePO без SFT

FreedomIntelligence выпустила HuatuoGPT-3-27B: медицинскую LLM на базе Qwen3.8-27B, адаптированную за один этап RL без доменного SFT. Разбираем, как устроен One

Коротко

Что будет в материале

  1. 01

    Что такое HuatuoGPT-3-27B и почему это интересно

  2. 02

    OnePO: как обучают медицинскую LLM за один этап RL

  3. 03

    Что опубликовано вместе с моделью: код, датасет и грейдер

  4. 04

    HuatuoGPT-3-9B и 27B: зачем две версии

Что такое HuatuoGPT-3-27B и почему это интересно

FreedomIntelligence выпустила HuatuoGPT-3-27B, медицинскую языковую модель на базе Qwen3.8-27B. Обучение построено на методе One-stage Policy Optimization (OnePO): адаптация к медицине проходит за один этап обучения с подкреплением, без предварительного доменного supervised fine-tuning. Анонс релиза опубликован в сообществе LocalLLaMA: обсуждение HuatuoGPT-3-27B.

Неделей раньше вышла уменьшенная версия HuatuoGPT-3-9B. Вместе с 27B-моделью команда выложила код обучения, медицинский RL-датасет и рубричный грейдер на 8B. Набор закрывает и инференс, и воспроизведение обучения целиком.

Главное в релизе - метод. Классическая схема доменной адаптации требует двух стадий: сначала модель дообучают на размеченных медицинских примерах, потом выравнивают через обучение с подкреплением. OnePO оставляет одну стадию RL, а роль учителя в ней временная.

Цифр качества в анонсе нет: ни бенчмарков, ни сравнений с другими медицинскими моделями. Оценивать HuatuoGPT-3-27B по метрикам пока нечем. Это первый факт, который стоит держать в голове при чтении любых громких заголовков о релизе.

База у модели тоже не нейтральная. Qwen3.8 привлекал внимание поведением на тестах калибровки и готовностью признавать незнание, об этом мы разбирали отдельно: анализ честности Qwen3.8 в тестах на человекоподобие. Как это поведение переносится на медицинские ответы, в анонсе не уточняется.

OnePO: как обучают медицинскую LLM за один этап RL

One-stage Policy Optimization сокращает пайплайн до одной стадии: модель оптимизируют методом обучения с подкреплением прямо на медицинских задачах. Ответы учителя дают временные подсказки и отключаются по мере улучшения модели. Никакого предварительного доменного SFT между базой и RL нет.

Логика простая. Награда говорит, какой ответ лучше, но не диктует, как именно его построить. Модель вынуждена сама находить формулировки, которые получают высокую оценку, вместо того чтобы копировать заранее заготовленный шаблон из обучающего корпуса.

Чем OnePO отличается от классической связки SFT + RLHF

В пайплайне SFT + RLHF модель сначала учится воспроизводить целевые ответы на размеченных парах «инструкция - ответ», а затем проходит второй этап: обычно обучается модель вознаграждения на человеческих предпочтениях, и политика оптимизируется по этой награде. Две стадии, два набора данных, две разные динамики обучения.

АспектSFT + RLHFOnePO
Доменный SFTОбязателен: модель копирует целевые ответы с размеченных примеровСтадия отсутствует
Число стадийДве: SFT, затем RLОдна: RL
Роль учителяРазметка и предпочтения фиксируются до старта RLОтветы учителя работают как временные подсказки и отключаются по мере роста качества модели
Что задаёт формат ответаШаблоны и стиль из SFT-корпусаСигнал награды, шаблоны заранее не заданы
Ключевые данныеПары «инструкция - ответ» плюс данные предпочтенийМедицинский RL-датасет

Две последние строки - следствие логики самих методов, а не измеренный результат. В анонсе нет сравнения OnePO с SFT + RLHF ни по качеству ответов, ни по стоимости обучения, поэтому переносить эти различия в выводы о превосходстве одного подхода нельзя.

Что OnePO даёт по пайплайну: отпадает необходимость в большом корпусе доменных пар «инструкция - ответ». Что он не даёт: гарантий удержания медицинского формата, который в SFT задаётся примерами напрямую.

Как работают временные подсказки учителя и почему они отключаются

Учитель в OnePO выступает источником сигнала на старте: его ответы подсказывают модели, в каком направлении двигаться. По мере улучшения модели подсказки отключаются, и она переходит от повторения чужих решений к собственной генерации.

Схема близка к двум известным приёмам. Первый - имитационное обучение с постепенным отказом от демонстраций, когда модель сначала копирует эталон, а затем оптимизирует собственное поведение. Второй - curriculum learning, где сложность и объём подсказок меняются по ходу тренировки.

Зачем отключать учителя. Если оставить его подсказки до конца, модель застревает в стиле и стратегиях учителя, а её собственные находки не закрепляются. Плюс появляется риск деградации в момент снятия подсказок, если модель успела выучить формат, но не выучила содержание. В анонсе не раскрыто, по какому критерию учитель отключается: по числу шагов, по порогу оценки или по расписанию.

Что опубликовано вместе с моделью: код, датасет и грейдер

FreedomIntelligence выложила три компонента помимо весов: код обучения, медицинский RL-датасет и рубричный грейдер на 8B.

  • Код обучения нужен тем, кто хочет повторить OnePO на своей базе или на своей предметной области.
  • Медицинский RL-датасет закрывает вопрос, на чём вообще оптимизировалась модель. Без него воспроизведение метода превращается в подбор данных на глаз.
  • Грейдер на 8B позволяет оценивать ответы автоматически, без ручной разметки каждой генерации.

Размер датасета, лицензия и точный формат записей в анонсе не указаны. Планировать эксперименты стоит с оглядкой на это: сначала проверяйте сами файлы в репозитории, а потом оценивайте бюджет.

8B rubric grader: зачем нужен отдельный оценщик

Рубричный грейдер оценивает ответы по заранее заданным критериям. В обучении с подкреплением такая модель способна формировать награду автоматически и масштабировать оценку на тысячи генераций, где человек физически не успевает разметить всё вручную.

Как именно грейдер встроен в цикл OnePO, в анонсе не сказано. Зато он интересен сам по себе: это отдельный инструмент на 8B, который можно использовать для оценки любых медицинских LLM, включая чужие. Для исследовательских задач это дешевле и воспроизводимее, чем живая экспертная разметка, хотя и не заменяет её полностью: рубрика оценивает соответствие формальным критериям, а не клиническую корректность в конкретном случае.

HuatuoGPT-3-9B и 27B: зачем две версии

Первой вышла HuatuoGPT-3-9B, через неделю появилась HuatuoGPT-3-27B. Разница по заявленным характеристикам одна: количество параметров.

ВерсияРазмерДля чего подходит
HuatuoGPT-3-9B9B параметровЛокальный запуск на потребительских GPU, быстрые эксперименты, отладка пайплайна
HuatuoGPT-3-27B27B параметровЗадачи, где важнее качество ответа, чем скорость и требования к железу

Карточка HuatuoGPT-3-9B на Hugging Face описывает её как медицинскую LLM на базе Qwen3.5-9B, обученную тем же OnePO, с тем же набором опубликованных артефактов: код обучения, медицинский RL-датасет и 8B рубричный грейдер. Точная дата публикации 9B-версии в доступных материалах не указана, поэтому утверждение «неделей раньше» опирается только на формулировку анонса 27B-модели.

Сравнивать качество версий по цифрам не получится: бенчмарков в анонсе нет. Практический смысл двух размеров в другом. 9B удобна как полигон: на ней дешевле проверять идеи и пайплайн оценки, а 27B держать для тех случаев, когда качество формулировок критично.

Ограничения и риски медицинской LLM без доменного SFT

Отказ от доменного SFT экономит ресурсы и сокращает пайплайн, но меняет профиль рисков. Разберём, что именно меняется.

Первое. SFT обычно отвечает за предсказуемость формата: модель учится отвечать в нужной структуре, соблюдать протоколы и шаблоны. Когда этот этап пропускают, формат задаётся только сигналом награды, и стабильность стиля приходится проверять отдельно, а не принимать на веру.

Второе. Знания модели приходят из базовой Qwen3.8-27B, а OnePO меняет поведение, а не добавляет фактическую базу. Если чего-то не было в базовых данных, обучение с подкреплением это не исправит: оно в лучшем случае научит модель увереннее формулировать то, что она уже знает.

Третье. Учитель отключается, и дальше модель работает самостоятельно. Качество такого перехода зависит от того, насколько прочно усвоены стратегии учителя. Проверить это можно только тестами, которых в анонсе нет.

Общий момент для любой медицинской LLM: галлюцинации и уверенные неверные ответы остаются штатным режимом работы языковых моделей. Никакой метод обучения не убирает этот класс ошибок полностью. HuatuoGPT-3-27B не медицинское изделие и не заменяет врача. Любое использование в чувствительном контексте требует валидации на своих данных и внешнего контроля.

Обратная сторона отказа от SFT

Выигрыш от пропуска SFT очевиден: меньше данных, короче пайплайн, ниже стоимость доменной адаптации. Цена тоже понятна. Модель не проходит этап, на котором обычно закрепляются строгие формы ответа и медицинские шаблоны.

В клинических сценариях важна не только правильность факта, но и то, как он сформулирован. Формулировка влияет на решения, которые по ней принимают люди. Если формат ответа никем не зафиксирован примерами, предсказуемость падает, и это стоит учитывать при развёртывании.

Разумная стратегия для команд, которые смотрят на эту модель: рассматривать её как исследовательский инструмент, а не как готовый компонент медицинского продукта. Проверять на доменных тестах, сравнивать с моделями, прошедшими SFT, и фиксировать, где именно расхождения формата начинают мешать.

Как запустить и где использовать HuatuoGPT-3-27B

Веса и сопутствующие компоненты опубликованы на Hugging Face в репозитории FreedomIntelligence, ссылка на анонс приведена выше. Требования к железу зависят от формата весов и квантизации; в доступных материалах точных цифр по объёму памяти для HuatuoGPT-3-27B нет, поэтому ориентируйтесь на параметры, указанные в карточке модели, и на требования выбранного движка инференса. Квантизация экономит память, но добавляет собственную погрешность, которую на медицинских ответах стоит проверять отдельно.

Практический минимум по шагам:

  1. Откройте репозиторий модели и проверьте лицензию, формат весов и требования к версиям библиотек.
  2. Разверните инференс через transformers или vLLM для GPU; для CPU и смешанных конфигураций подойдут квантованные сборки, если они есть в наличии.
  3. Прогоните свои тестовые вопросы и сравните форматы ответов с моделью, прошедшей SFT. Это покажет, насколько стабильна структура ответа.
  4. Для воспроизведения обучения возьмите опубликованный код и медицинский RL-датасет, а оценку постройте на 8B-грейдере по своим рубрикам.

Сценарии, где такая модель уместна: исследовательские проекты по доменной адаптации, генерация черновиков медицинских текстов с обязательной проверкой человеком, обучение собственных моделей на базе опубликованного кода. Сценарии, где она неуместна: постановка диагноза, назначение лечения, любые решения без участия специалиста.

Если 27B не влезает в доступное железо, начните с HuatuoGPT-3-9B: она дешевле в запуске и позволяет отработать пайплайн оценки. За новыми релизами FreedomIntelligence и подобных команд удобно следить через ленту исследований, о работе с ней мы писали здесь: Daily Papers на Hugging Face.

Итог: кому стоит обратить внимание на HuatuoGPT-3-27B

HuatuoGPT-3-27B полезна тем, кто занимается доменной адаптацией LLM и хочет посмотреть на альтернативу связке SFT + RLHF в живом релизе, а не в описании метода. Код обучения, медицинский RL-датасет и 8B-грейдер дают возможность проверить OnePO на своих данных или перенести схему в другую предметную область.

Для практикующих врачей без технического бэкграунда это не инструмент: бенчмарков нет, валидации нет, статуса медицинского изделия тоже. Для разработчиков медицинских AI-систем модель годится как отправная точка для экспериментов, но не как готовый ответ на вопрос о качестве доменной адаптации без SFT.

Что сделать дальше. Откройте репозиторий, посмотрите состав датасета и критерии грейдера, прогоните десяток своих вопросов и сравните ответы с моделью, прошедшей классический SFT. Так вы получите собственные данные о том, насколько OnePO держит формат, вместо того чтобы опираться на описание метода.

Подписаться на канал