AWS выложила в открытый доступ коллекцию из 38 agent skills для 11 доменов healthcare и life sciences (HCLS) под лицензией MIT-0. Каждый skill описывает конкретную процедуру: в каком порядке сверять критерии, какие пороги проверять, что делать при неполных данных. Skills подключаются к агенту во время инференса, поэтому веса модели остаются нетронутыми, а переобучение не нужно.
Проблема, которую закрывает коллекция, выглядит так: модель на базовых настройках уверенно называет нужный клинический или научный фреймворк и тут же нарушает его процедуру. Рекомендация с высоким уровнем доказательности используется там, где данных мало; порог частоты генетического варианта не проверяется вовсе; оценка предиктора появляется в ответе без расчёта. Знание есть, дисциплины следования знанию нет.
Дальше: формат SKILL.md и механизм progressive disclosure, установка и три сценария работы (один агент в Quick Desktop, мультиагентная оркестрация в Kiro CLI с координатором и восемью специалистами, продакшн-деплой через Strands SDK на Amazon Bedrock AgentCore), цифры оценки на 410 промптах и честный список ограничений.
Что такое agent skills и зачем они нужны в HCLS
Agent skill - это текстовый документ, который задаёт агенту процедуру принятия решений в узкой предметной области. Не справочная статья о том, что такое клиническое руководство, а чек-лист: что запросить, что сверить, где остановиться. Коллекция AWS покрывает 11 доменов HCLS и распространяется по лицензии MIT-0, то есть её можно использовать, изменять и встраивать в коммерческие продукты без требования указывать авторство.
Медицинские и биологические задачи плохо переносят импровизацию. Ошибка в выборе категории доказательств или пропущенный порог частоты меняют вывод целиком, при этом сам ответ остаётся гладким и уверенным. Skills встраивают в работу агента обязательные шаги именно там, где базовые модели чаще всего их пропускают.
Почему базовые агенты ошибаются в медицинских и научных задачах
Ошибки в HCLS редко выглядят как откровенный бред. Обычно это аккуратный ответ с одним неверным шагом.
- Путаница категорий доказательств. Агент корректно называет систему градации, а затем переносит вывод с сильного уровня на слабый или наоборот. Рекомендация звучит убедительно, хотя её основание слабее заявленного.
- Пропуск пороговых значений. Для генетических вариантов вывод о редкости зависит от частоты аллеля в популяционных базах, и без сверки с порогом вариант легко объявить редким. Модель подставляет порог из общих представлений, а не из инструкции.
- Галлюцинации в оценках предикторов. Вместо расчёта или вызова инструмента агент выдаёт правдоподобное число. Проверить его по тексту ответа нельзя, а решение на нём уже построено.
Причина одна: базовая модель обучена продолжать текст, а не следовать чек-листу. Описания фреймворков в обучающих данных хватает, а обязательной последовательности шагов в них нет.
Чем skills отличаются от RAG и fine-tuning
| Подход | Что добавляет | Стоимость обновления | Где уместен |
|---|---|---|---|
| RAG | Внешние факты в контекст: документы, базы, выдержки | Переиндексация корпуса | Нужен доступ к актуальным данным и источникам |
| Fine-tuning | Изменение весов модели | Датасет, обучение, повторная валидация | Нужен стабильный стиль и формат ответов |
| Agent skills | Процедурные инструкции, подгружаемые по требованию | Правка markdown-файла | Нужно, чтобы агент соблюдал порядок шагов |
RAG отвечает на вопрос «какие факты есть», fine-tuning меняет поведение модели на уровне весов, skills задают вопрос «в каком порядке действовать». Подходы не конкурируют: skill может требовать вызова поиска, а результат поиска подставляется в описанную процедуру. Для HCLS это важно, потому что ошибка чаще возникает не из-за отсутствия факта, а из-за нарушения последовательности работы с ним.
Как устроены SKILL.md и progressive disclosure
Skill - это один файл SKILL.md: YAML-шапка с метаданными и markdown-тело с процедурой. Метаданные содержат имя, домен, версию, зависимости и условия срабатывания. Тело описывает шаги: какие данные запросить, с какими порогами сверить, как поступить при конфликте критериев, в какой точке остановиться и передать вопрос человеку.
---
name: variant-frequency-check
domain: genomics
version: 1.0.0
license: MIT-0
triggers:
- variant_classification
- allele_frequency
---
# Когда применять
Запрос требует оценить редкость генетического варианта.
# Обязательные шаги
1. Запроси частоту аллеля из популяционной базы.
2. Сравни значение с порогом из инструкции, не оценивай порог по памяти.
3. Если данных по популяции нет, укажи это прямо в ответе.
4. При частоте выше порога не называй вариант редким.
# Запрещено
Приводить числовое значение частоты без указания, откуда оно взято.
Это схематичный пример структуры, а не файл из коллекции. Смысл раздела «Запрещено» в том, что он ставит жёсткую границу там, где агент чаще всего выдумывает число.
Progressive disclosure - механизм подключения. Агенту сначала отдают только перечень skills с именами и короткими описаниями. Когда формулировка запроса совпадает с условием срабатывания, подгружается полный текст нужного файла. Контекст не забивается процедурами по клиническим исследованиям, когда вопрос про геномику, а инструкции оказываются рядом с точкой решения. Системный промпт так не работает: туда всё приходится укладывать сразу, и чем больше инструкций, тем выше шанс, что часть из них проигнорируется.
Похожая логика применяется и в разработке: skill для Claude Code автоматизирует цикл написания и ревью кода между двумя моделями. Там процедура тоже вынесена в отдельный документ вместо разового промпта.
Установка и три сценария использования agent skills
Порядок действий одинаков для всех сценариев:
- Получить коллекцию skills из открытого репозитория AWS. Лицензия MIT-0 разрешает использование, изменение и коммерческое применение без указания авторства.
- Посмотреть, какие домены покрывают 38 skills и попадает ли ваша задача хотя бы в один из них.
- Разложить файлы в директорию, которую читает агент, сохранив структуру каталогов.
- Проверить работу на промптах, где базовый агент стабильно ошибался. Если поведение не изменилось, skill не подхватился.
Точные имена директорий и команд стоит сверять с документацией репозитория: коллекция обновляется, а пути зависят от версии инструмента.
Single-agent в Quick Desktop: быстрый старт
Quick Desktop подходит для первого знакомства: один агент, локальный запуск, без распределения ролей. Шаги простые: указать агенту каталог со skills, задать в настройках уровень доступа к файлам и отправить тестовый запрос. Типичная задача для проверки - разбор клинического вопроса, где нужно определить уровень доказательности и явно сказать, чего не хватает для более сильного вывода.
Методика проверки: возьмите два промпта из своей практики, где базовый агент путал категории доказательств, и сравните ответы до и после подключения skills. Если разницы нет, дело либо в срабатывании триггеров, либо в том, что нужный skill не относится к вашему типу задач.
Мультиагентная оркестрация в Kiro CLI: координатор и восемь специалистов
В Kiro CLI схема другая: координатор принимает задачу целиком, разбивает её на подзадачи и раздаёт восьми специализированным агентам. Роли в такой конфигурации, например, фармакология, генетика, клинические исследования, регуляторные требования, биоинформатика, статистика, работа с литературой и контроль качества данных. Каждый агент работает со своим набором skills, поэтому в контекст попадают только релевантные процедуры.
Координатор в этой схеме отвечает за склейку результата и разрешение конфликтов: если оценка фармаколога расходится с выводом по генетике, арбитраж идёт на уровне координатора, а не внутри одного длинного рассуждения. Такая архитектура дороже в настройке, зато сложные многошаговые запросы перестают разваливаться на середине.
Если строите что-то похожее с нуля, полезно заранее посмотреть, как устроен самописный AI-агент: оркестрация LLM, память, инструменты и обработка ошибок. Метрики latency, cost и reliability там разобраны с кодом на Python, и они же становятся основой для оценки мультиагентной схемы.
Продакшн-деплой через Strands SDK на Amazon Bedrock AgentCore
Для продакшна используется Strands SDK: агент описывается кодом, а skills включаются в его артефакт и версионируются вместе с ним. Дальше агент разворачивается на Amazon Bedrock AgentCore, где получает масштабирование, изоляцию сессий и трассировку вызовов. Управление skills переезжает в облако: обновление процедуры - это новая версия артефакта, а не правка файла на машине разработчика.
Что важно на этом этапе: держать skills в системе контроля версий, фиксировать, какая версия процедуры отработала конкретный запрос, и не выпускать в продакшн skill без тестового прогона. Общий контур работы с AWS-стеком для агентов, включая Bedrock, AgentCore и Guardrails, разобран в материале про корпоративную программу обучения агентному ИИ на базе AWS.
Результаты оценки: насколько skills улучшают работу агентов
Оценка проводилась на 410 промптах. Skilled-агенты выигрывали 70-86% парных сравнений: судья получал два ответа на один и тот же запрос и выбирал лучший, не зная, какой из них получен со skills.
Наибольший прирост пришёлся на категорию critical thinking, где размер эффекта по Коэну составил d = 0.65-1.03. Ориентиры для интерпретации: 0.2 - небольшой эффект, 0.5 - средний, 0.8 - большой. Значение 0.65 и выше означает устойчивое улучшение, а не случайный разброс между прогонами.
Максимальный выигрыш зафиксирован на самых сложных запросах, то есть там, где базовый агент ошибается чаще всего. Практический вывод: skills дают мало на простых вопросах, которые модель и так решает, и заметно больше на многошаговых задачах с несколькими критериями и порогами.
Оговорка по цифрам: это собственная оценка AWS, независимой репликации на момент публикации нет. Относитесь к процентам как к ориентиру, а не как к гарантированному приросту на ваших данных. Свой замер удобно собрать по схеме из разбора Eval Engineering Skill: автоматизация тестов для AI-агентов через репозиторий и трейсы.
Ограничения и риски использования skills в HCLS
- Skills не заменяют экспертизу. Ответственность за клиническое или научное решение остаётся на человеке, а не на файле с инструкцией.
- MIT-0 снимает юридические ограничения на использование и изменение, но не гарантирует корректность содержимого. Каждый skill перед применением нужно вычитать.
- Коллекция покрывает 11 доменов, и редкие узкие задачи в неё не попадают. Для них придётся писать свои skills.
- Новых знаний о мире skills не дают. Если агенту не хватает фактов, нужен доступ к данным, а не процедура.
- Много загруженных skills конфликтуют между собой и раздувают контекст. Держите включённым только нужное.
- Галлюцинации не исчезают полностью. Skill снижает вероятность выдуманного порога или оценки, но не отменяет проверку результата.
Как адаптировать skills под свои задачи
SKILL.md - открытый формат, и писать свои файлы никто не запрещает. Практичная последовательность такая:
- Найдите процедуру, где агент ошибается стабильно, а не время от времени. Одиночный сбой повторить не получится, и проверить эффект будет нечем.
- Заполните YAML-метаданные: имя, домен, версию, зависимости, условия срабатывания. Условия формулируйте по типу задачи, а не по ключевым словам вроде «анализ».
- Опишите тело как нумерованные шаги. Добавьте раздел с запретами: он закрывает самые частые выдумки модели.
- Проверьте skill на своих промптах до и после подключения. Разница в ответах - единственный критерий, который что-то значит.
- Храните файлы в git и фиксируйте версию в метаданных, иначе через месяц никто не вспомнит, какая процедура дала результат.
AWS поощряет вклад в коллекцию, так что удачный skill по своей области можно предложить сообществу.
Итог: кому и когда стоит использовать agent skills для HCLS
Подход стоит внимания разработчикам и специалистам, которые уже гоняют AI-агентов по медицинским и биологическим задачам и упираются в процедурные ошибки: агент знает фреймворк, но не следует ему. Skills решают именно это, не требуют переобучения модели и обновляются правкой markdown-файла.
Порядок освоения простой: Quick Desktop для быстрой проверки на двух-трёх своих промптах, Kiro CLI с координатором и специалистами для многошаговых задач, Strands SDK на Amazon Bedrock AgentCore для продакшна с версионированием и трассировкой. Перед любым из этих шагов прочитайте содержимое skills, которые включаете, и оставьте в процессе человека, принимающего финальное решение.