Перейти к содержанию
Публикация AiManual

Открытые agent skills для HCLS: как научить AI-агента правильно применять медицинские и биологические методики

AWS открыла коллекцию из 38 agent skills для 11 доменов healthcare и life sciences под лицензией MIT-0. Разбираем формат SKILL.md, механизм progressive disclosu

Коротко

Что будет в материале

  1. 01

    Что такое agent skills и зачем они нужны в HCLS

  2. 02

    Как устроены SKILL.md и progressive disclosure

  3. 03

    Установка и три сценария использования agent skills

  4. 04

    Результаты оценки: насколько skills улучшают работу агентов

AWS выложила в открытый доступ коллекцию из 38 agent skills для 11 доменов healthcare и life sciences (HCLS) под лицензией MIT-0. Каждый skill описывает конкретную процедуру: в каком порядке сверять критерии, какие пороги проверять, что делать при неполных данных. Skills подключаются к агенту во время инференса, поэтому веса модели остаются нетронутыми, а переобучение не нужно.

Проблема, которую закрывает коллекция, выглядит так: модель на базовых настройках уверенно называет нужный клинический или научный фреймворк и тут же нарушает его процедуру. Рекомендация с высоким уровнем доказательности используется там, где данных мало; порог частоты генетического варианта не проверяется вовсе; оценка предиктора появляется в ответе без расчёта. Знание есть, дисциплины следования знанию нет.

Дальше: формат SKILL.md и механизм progressive disclosure, установка и три сценария работы (один агент в Quick Desktop, мультиагентная оркестрация в Kiro CLI с координатором и восемью специалистами, продакшн-деплой через Strands SDK на Amazon Bedrock AgentCore), цифры оценки на 410 промптах и честный список ограничений.

Что такое agent skills и зачем они нужны в HCLS

Agent skill - это текстовый документ, который задаёт агенту процедуру принятия решений в узкой предметной области. Не справочная статья о том, что такое клиническое руководство, а чек-лист: что запросить, что сверить, где остановиться. Коллекция AWS покрывает 11 доменов HCLS и распространяется по лицензии MIT-0, то есть её можно использовать, изменять и встраивать в коммерческие продукты без требования указывать авторство.

Медицинские и биологические задачи плохо переносят импровизацию. Ошибка в выборе категории доказательств или пропущенный порог частоты меняют вывод целиком, при этом сам ответ остаётся гладким и уверенным. Skills встраивают в работу агента обязательные шаги именно там, где базовые модели чаще всего их пропускают.

Почему базовые агенты ошибаются в медицинских и научных задачах

Ошибки в HCLS редко выглядят как откровенный бред. Обычно это аккуратный ответ с одним неверным шагом.

  • Путаница категорий доказательств. Агент корректно называет систему градации, а затем переносит вывод с сильного уровня на слабый или наоборот. Рекомендация звучит убедительно, хотя её основание слабее заявленного.
  • Пропуск пороговых значений. Для генетических вариантов вывод о редкости зависит от частоты аллеля в популяционных базах, и без сверки с порогом вариант легко объявить редким. Модель подставляет порог из общих представлений, а не из инструкции.
  • Галлюцинации в оценках предикторов. Вместо расчёта или вызова инструмента агент выдаёт правдоподобное число. Проверить его по тексту ответа нельзя, а решение на нём уже построено.

Причина одна: базовая модель обучена продолжать текст, а не следовать чек-листу. Описания фреймворков в обучающих данных хватает, а обязательной последовательности шагов в них нет.

Чем skills отличаются от RAG и fine-tuning

ПодходЧто добавляетСтоимость обновленияГде уместен
RAGВнешние факты в контекст: документы, базы, выдержкиПереиндексация корпусаНужен доступ к актуальным данным и источникам
Fine-tuningИзменение весов моделиДатасет, обучение, повторная валидацияНужен стабильный стиль и формат ответов
Agent skillsПроцедурные инструкции, подгружаемые по требованиюПравка markdown-файлаНужно, чтобы агент соблюдал порядок шагов

RAG отвечает на вопрос «какие факты есть», fine-tuning меняет поведение модели на уровне весов, skills задают вопрос «в каком порядке действовать». Подходы не конкурируют: skill может требовать вызова поиска, а результат поиска подставляется в описанную процедуру. Для HCLS это важно, потому что ошибка чаще возникает не из-за отсутствия факта, а из-за нарушения последовательности работы с ним.

Как устроены SKILL.md и progressive disclosure

Skill - это один файл SKILL.md: YAML-шапка с метаданными и markdown-тело с процедурой. Метаданные содержат имя, домен, версию, зависимости и условия срабатывания. Тело описывает шаги: какие данные запросить, с какими порогами сверить, как поступить при конфликте критериев, в какой точке остановиться и передать вопрос человеку.

---
name: variant-frequency-check
domain: genomics
version: 1.0.0
license: MIT-0
triggers:
  - variant_classification
  - allele_frequency
---

# Когда применять
Запрос требует оценить редкость генетического варианта.

# Обязательные шаги
1. Запроси частоту аллеля из популяционной базы.
2. Сравни значение с порогом из инструкции, не оценивай порог по памяти.
3. Если данных по популяции нет, укажи это прямо в ответе.
4. При частоте выше порога не называй вариант редким.

# Запрещено
Приводить числовое значение частоты без указания, откуда оно взято.

Это схематичный пример структуры, а не файл из коллекции. Смысл раздела «Запрещено» в том, что он ставит жёсткую границу там, где агент чаще всего выдумывает число.

Progressive disclosure - механизм подключения. Агенту сначала отдают только перечень skills с именами и короткими описаниями. Когда формулировка запроса совпадает с условием срабатывания, подгружается полный текст нужного файла. Контекст не забивается процедурами по клиническим исследованиям, когда вопрос про геномику, а инструкции оказываются рядом с точкой решения. Системный промпт так не работает: туда всё приходится укладывать сразу, и чем больше инструкций, тем выше шанс, что часть из них проигнорируется.

Похожая логика применяется и в разработке: skill для Claude Code автоматизирует цикл написания и ревью кода между двумя моделями. Там процедура тоже вынесена в отдельный документ вместо разового промпта.

Установка и три сценария использования agent skills

Порядок действий одинаков для всех сценариев:

  1. Получить коллекцию skills из открытого репозитория AWS. Лицензия MIT-0 разрешает использование, изменение и коммерческое применение без указания авторства.
  2. Посмотреть, какие домены покрывают 38 skills и попадает ли ваша задача хотя бы в один из них.
  3. Разложить файлы в директорию, которую читает агент, сохранив структуру каталогов.
  4. Проверить работу на промптах, где базовый агент стабильно ошибался. Если поведение не изменилось, skill не подхватился.

Точные имена директорий и команд стоит сверять с документацией репозитория: коллекция обновляется, а пути зависят от версии инструмента.

Single-agent в Quick Desktop: быстрый старт

Quick Desktop подходит для первого знакомства: один агент, локальный запуск, без распределения ролей. Шаги простые: указать агенту каталог со skills, задать в настройках уровень доступа к файлам и отправить тестовый запрос. Типичная задача для проверки - разбор клинического вопроса, где нужно определить уровень доказательности и явно сказать, чего не хватает для более сильного вывода.

Методика проверки: возьмите два промпта из своей практики, где базовый агент путал категории доказательств, и сравните ответы до и после подключения skills. Если разницы нет, дело либо в срабатывании триггеров, либо в том, что нужный skill не относится к вашему типу задач.

Мультиагентная оркестрация в Kiro CLI: координатор и восемь специалистов

В Kiro CLI схема другая: координатор принимает задачу целиком, разбивает её на подзадачи и раздаёт восьми специализированным агентам. Роли в такой конфигурации, например, фармакология, генетика, клинические исследования, регуляторные требования, биоинформатика, статистика, работа с литературой и контроль качества данных. Каждый агент работает со своим набором skills, поэтому в контекст попадают только релевантные процедуры.

Координатор в этой схеме отвечает за склейку результата и разрешение конфликтов: если оценка фармаколога расходится с выводом по генетике, арбитраж идёт на уровне координатора, а не внутри одного длинного рассуждения. Такая архитектура дороже в настройке, зато сложные многошаговые запросы перестают разваливаться на середине.

Если строите что-то похожее с нуля, полезно заранее посмотреть, как устроен самописный AI-агент: оркестрация LLM, память, инструменты и обработка ошибок. Метрики latency, cost и reliability там разобраны с кодом на Python, и они же становятся основой для оценки мультиагентной схемы.

Продакшн-деплой через Strands SDK на Amazon Bedrock AgentCore

Для продакшна используется Strands SDK: агент описывается кодом, а skills включаются в его артефакт и версионируются вместе с ним. Дальше агент разворачивается на Amazon Bedrock AgentCore, где получает масштабирование, изоляцию сессий и трассировку вызовов. Управление skills переезжает в облако: обновление процедуры - это новая версия артефакта, а не правка файла на машине разработчика.

Что важно на этом этапе: держать skills в системе контроля версий, фиксировать, какая версия процедуры отработала конкретный запрос, и не выпускать в продакшн skill без тестового прогона. Общий контур работы с AWS-стеком для агентов, включая Bedrock, AgentCore и Guardrails, разобран в материале про корпоративную программу обучения агентному ИИ на базе AWS.

Результаты оценки: насколько skills улучшают работу агентов

Оценка проводилась на 410 промптах. Skilled-агенты выигрывали 70-86% парных сравнений: судья получал два ответа на один и тот же запрос и выбирал лучший, не зная, какой из них получен со skills.

Наибольший прирост пришёлся на категорию critical thinking, где размер эффекта по Коэну составил d = 0.65-1.03. Ориентиры для интерпретации: 0.2 - небольшой эффект, 0.5 - средний, 0.8 - большой. Значение 0.65 и выше означает устойчивое улучшение, а не случайный разброс между прогонами.

Максимальный выигрыш зафиксирован на самых сложных запросах, то есть там, где базовый агент ошибается чаще всего. Практический вывод: skills дают мало на простых вопросах, которые модель и так решает, и заметно больше на многошаговых задачах с несколькими критериями и порогами.

Оговорка по цифрам: это собственная оценка AWS, независимой репликации на момент публикации нет. Относитесь к процентам как к ориентиру, а не как к гарантированному приросту на ваших данных. Свой замер удобно собрать по схеме из разбора Eval Engineering Skill: автоматизация тестов для AI-агентов через репозиторий и трейсы.

Ограничения и риски использования skills в HCLS

  • Skills не заменяют экспертизу. Ответственность за клиническое или научное решение остаётся на человеке, а не на файле с инструкцией.
  • MIT-0 снимает юридические ограничения на использование и изменение, но не гарантирует корректность содержимого. Каждый skill перед применением нужно вычитать.
  • Коллекция покрывает 11 доменов, и редкие узкие задачи в неё не попадают. Для них придётся писать свои skills.
  • Новых знаний о мире skills не дают. Если агенту не хватает фактов, нужен доступ к данным, а не процедура.
  • Много загруженных skills конфликтуют между собой и раздувают контекст. Держите включённым только нужное.
  • Галлюцинации не исчезают полностью. Skill снижает вероятность выдуманного порога или оценки, но не отменяет проверку результата.

Как адаптировать skills под свои задачи

SKILL.md - открытый формат, и писать свои файлы никто не запрещает. Практичная последовательность такая:

  1. Найдите процедуру, где агент ошибается стабильно, а не время от времени. Одиночный сбой повторить не получится, и проверить эффект будет нечем.
  2. Заполните YAML-метаданные: имя, домен, версию, зависимости, условия срабатывания. Условия формулируйте по типу задачи, а не по ключевым словам вроде «анализ».
  3. Опишите тело как нумерованные шаги. Добавьте раздел с запретами: он закрывает самые частые выдумки модели.
  4. Проверьте skill на своих промптах до и после подключения. Разница в ответах - единственный критерий, который что-то значит.
  5. Храните файлы в git и фиксируйте версию в метаданных, иначе через месяц никто не вспомнит, какая процедура дала результат.

AWS поощряет вклад в коллекцию, так что удачный skill по своей области можно предложить сообществу.

Итог: кому и когда стоит использовать agent skills для HCLS

Подход стоит внимания разработчикам и специалистам, которые уже гоняют AI-агентов по медицинским и биологическим задачам и упираются в процедурные ошибки: агент знает фреймворк, но не следует ему. Skills решают именно это, не требуют переобучения модели и обновляются правкой markdown-файла.

Порядок освоения простой: Quick Desktop для быстрой проверки на двух-трёх своих промптах, Kiro CLI с координатором и специалистами для многошаговых задач, Strands SDK на Amazon Bedrock AgentCore для продакшна с версионированием и трассировкой. Перед любым из этих шагов прочитайте содержимое skills, которые включаете, и оставьте в процессе человека, принимающего финальное решение.

Подписаться на канал