Перейти к содержанию
Новое AiManual теперь в MAX Подписаться
Публикация AiManual

ИИ в дизайне биологических лекарств: от ускорения R&D до de novo синтеза

Генеративный ИИ сокращает цикл разработки биопрепаратов с лет до месяцев. AstraZeneca отсеивает 85% нежизнеспособных кандидатов до синтеза. De novo дизайн белко

Коротко

Что будет в материале

  1. 01

    Как ИИ меняет ландшафт R&D биологических препаратов

  2. 02

    Генеративный ИИ и de novo дизайн белков

  3. 03

    Кейс AstraZeneca: ИИ для отсева кандидатов на ранних этапах

  4. 04

    Ключевой вызов: предсказание безопасности и виртуальные клинические испытания

Генеративный ИИ и мультимодальные датасеты сокращают цикл «дизайн-синтез-тестирование-анализ» биологических препаратов с нескольких лет до месяцев. AstraZeneca уже использует AI-модели для отсева нежизнеспособных кандидатов на ранних этапах, фокусируя лабораторные ресурсы на молекулах с наивысшим потенциалом. В перспективе 3-5 лет ожидается переход к полностью автономным системам: ИИ генерирует de novo белковые последовательности с заданными свойствами, а роботизированные платформы тестируют тысячи взаимодействий в неделю. Главный барьер - предсказание безопасности in vivo, требующее интеграции AI с физическими тестовыми стендами и концепции виртуальных клинических испытаний.

Традиционный путь биологического препарата от идеи до клиники занимает 10-15 лет при стоимости свыше $2,6 млрд. 90% кандидатов отсеиваются на стадии доклинических и клинических испытаний. Основная причина - несоответствие между расчётными характеристиками молекулы и её поведением в живом организме. AI-модели меняют эту картину: они обучаются на исторических данных успешных и провальных проектов, выявляя паттерны, недоступные ручному анализу.

Связка генеративных архитектур и мультимодальных датасетов - структур молекул, профилей связывания, токсикологических профилей и производственных параметров - позволяет предсказывать не только аффинность к мишени, но и агрегационную стабильность, иммуногенность, фармакокинетику. Результат: сокращение числа синтезируемых вариантов в 5-10 раз при одновременном повышении доли успешных кандидатов. Этот подход подробно разобран в материале о применении AI в биомедицинских исследованиях, где алгоритмы глубокого обучения прогнозируют свойства белков на основе аминокислотных последовательностей.

Как ИИ меняет ландшафт R&D биологических препаратов

Внедрение AI в фармацевтическую разработку - сдвиг парадигмы, сопоставимый с появлением высокопроизводительного скрининга в 1990-х. Тогда автоматизация увеличила пропускную способность лабораторий на порядок. Сегодняшние модели увеличивают «интеллектуальную пропускную способность»: вместо перебора миллионов вариантов вслепую система целенаправленно генерирует сотни осмысленных кандидатов.

Три ключевых компонента этой трансформации:

  • Генеративные модели - диффузионные архитектуры и трансформеры создают новые последовательности белков, нуклеотидов и малых молекул с заданными параметрами.
  • Предиктивные модели - графовые нейросети и энкодеры последовательностей оценивают свойства кандидатов до синтеза: аффинность, стабильность, токсичность, проницаемость.
  • Оркестровка данных - интеграция разрозненных источников в единые мультимодальные датасеты для обучения.

Компании, внедрившие хотя бы один из компонентов, фиксируют сокращение времени выхода на стадию IND (Investigational New Drug) на 30-40%. Полностью интегрированные AI-пайплайны, по оценкам участников рынка, способны сократить этот срок вдвое.

От месяцев к неделям: сокращение цикла разработки

Классический цикл оптимизации биологического препарата выглядит так: биоинформатик предлагает мутации на основе структурного анализа, биолог-экспериментатор синтезирует и тестирует 10-50 вариантов, данные анализируются вручную, цикл повторяется. Одна итерация занимает 4-8 недель. Для достижения требуемых параметров необходимо 5-15 итераций.

AI-ускоренный цикл перестраивает эту последовательность. Генеративная модель предлагает 500-1000 вариантов за один проход. Предиктивная модель ранжирует их по вероятности успеха, оставляя топ-50. Роботизированная платформа синтезирует и тестирует эти 50 вариантов за 1-2 недели. Данные автоматически поступают обратно в модель для дообучения. Следующая итерация генерирует ещё более точные предсказания. Три-четыре таких цикла - и кандидат готов к углублённым доклиническим испытаниям. Общее время: 2-4 месяца вместо 12-18.

Критический фактор здесь - качество предиктивных моделей. Модель, предсказывающая аффинность с точностью R² = 0.7, сокращает число синтезируемых вариантов на 60%. Модель с R² = 0.9 - на 85%. Разница между 0.7 и 0.9 - это миллионы долларов бюджета и кварталы времени. Именно поэтому фармкомпании инвестируют в сбор и разметку данных: каждый дополнительный порядок размера обучающей выборки даёт прирост точности на 2-5 процентных пунктов для современных архитектур.

Мультимодальные датасеты: топливо для AI-моделей

Мономодальный подход - обучение только на последовательностях или только на структурах - даёт потолок качества. Белок с идеальной аффинностью in silico может агрегировать в растворе, деградировать за часы в плазме или вызывать цитокиновый шторм. Каждое из этих свойств определяется разными физико-химическими механизмами и требует отдельных экспериментальных данных для обучения.

Эффективный мультимодальный датасет включает минимум четыре слоя:

  • Структурный слой: кристаллографические и крио-EM структуры, предсказанные AlphaFold3 модели, карты поверхностного электростатического потенциала, данные молекулярной динамики.
  • Слой связывания: профили SPR (поверхностный плазмонный резонанс), BLI (биослойная интерферометрия), ITC (изотермическая калориметрия) - кинетика ассоциации/диссоциации, термодинамические параметры.
  • Слой безопасности: данные гепатотоксичности, кардиотоксичности (hERG), иммуногенности (MHC-II презентация, T-клеточная активация), профили нецелевого связывания.
  • Производственный слой: выход экспрессии в CHO/HEK293 клетках, профили гликозилирования, агрегационная стабильность при различных pH и концентрациях, данные ускоренной деградации.

Объединение этих модальностей в одной модели - технически сложная задача. Разные типы данных имеют разную размерность, разреженность и уровень шума. Решение - архитектуры с раздельными энкодерами для каждой модальности и общим латентным пространством, где векторы разных типов данных приводятся к единой размерности через контрастивное обучение. Такой подход, реализованный в моделях типа BioNeMo и ESM-3, позволяет модели «понимать» взаимосвязи между последовательностью, структурой и функцией белка без явного моделирования физических уравнений.

Генеративный ИИ и de novo дизайн белков

De novo дизайн - создание белковых последовательностей, не существующих в природе, для выполнения заданной функции. Это принципиально иной подход по сравнению с инженерией существующих белков: вместо оптимизации природного шаблона модель конструирует молекулу «с нуля», руководствуясь только физическими и функциональными ограничениями.

Прорыв в этой области произошёл в 2022-2024 годах с появлением диффузионных моделей для белковых структур (RFdiffusion) и инверсных моделей сворачивания (ProteinMPNN). Связка этих инструментов работает так: RFdiffusion генерирует трёхмерный каркас белка, удовлетворяющий геометрическим ограничениям активного центра, а ProteinMPNN подбирает аминокислотную последовательность, которая сворачивается в этот каркас. Результаты впечатляют: экспериментальный успех - растворимый, стабильный белок с заданной структурой - достигается в 50-80% случаев для небольших доменов (до 200 аминокислот).

Для более сложных задач - генерации белков, связывающих конкретную мишень - используются модели семейства ESM (Evolutionary Scale Modeling). ESM-3, обученный на 2,7 млрд белковых последовательностях, одновременно работает с последовательностью, структурой и функциональными аннотациями. Он генерирует кандидатов, обусловленных не только структурой мишени, но и желаемыми биофизическими свойствами: термостабильностью, устойчивостью к протеазам, отсутствием перекрёстной реактивности.

Как ИИ «придумывает» новые белки: архитектуры и подходы

Три архитектурных семейства доминируют в генерации белков по состоянию на 2026 год:

Диффузионные модели (RFdiffusion, Chroma). Принцип работы: на структуру белка накладывается гауссов шум, разрушающий координаты атомов, затем модель обучается обращать этот процесс - восстанавливать структуру из шума, обусловленную целевыми ограничениями. На инференсе модель стартует со случайного шума и итеративно «проявляет» структуру, удовлетворяющую условиям: форма активного центра, наличие определённых мотивов, симметрия олигомера. Преимущество - работа непосредственно в пространстве трёхмерных координат, что позволяет точно контролировать геометрию.

Авторегрессионные трансформеры (ProGen2, ESM-3). Белковая последовательность токенизируется - аминокислоты становятся токенами, как слова в языковой модели. Трансформер обучается предсказывать следующую аминокислоту, учитывая контекст - предшествующие остатки, структурные аннотации, функциональные теги. Генерация происходит посеквентно, с контролем через conditioning tags: «термостабильный», «pH 5.5», «связывает IL-17». ESM-3 масштабирует этот подход до 98 млрд параметров, объединяя sequence, structure и function в едином токенизированном пространстве.

Инверсные модели сворачивания (ProteinMPNN, ESM-IF). Задача: дана трёхмерная структура, подобрать последовательность, которая в неё свернётся. Архитектура - message-passing нейросеть на графе, где узлы - аминокислотные позиции, рёбра - пространственные взаимодействия. Модель итеративно обновляет скрытые представления узлов, агрегируя информацию от соседей, и предсказывает распределение вероятностей аминокислот для каждой позиции. ProteinMPNN достигает 52-67% восстановления нативной последовательности при сохранении сворачиваемости - это означает, что модель «понимает» физические принципы упаковки белка, а не просто запоминает эволюционные паттерны.

Метрики качества генерации включают не только структурное сходство с целевым каркасом (RMSD < 2 Å), но и экспериментальные показатели: выход экспрессии в E. coli или HEK293, температуру плавления (Tm), константу диссоциации (KD) с мишенью. Современные модели достигают KD в наномолярном диапазоне (10⁻⁸ - 10⁻⁹ M) для de novo сгенерированных белков против заданных мишеней - показатель, сопоставимый с антителами, полученными иммунизацией животных.

От компьютерного дизайна к лабораторному тестированию

Разрыв между in silico предсказанием и экспериментальной валидацией остаётся узким местом. Модель может сгенерировать 10 000 кандидатов за ночь, но синтез и тестирование даже 100 из них - это недели ручной работы. Решение - роботизированные платформы для высокопроизводительного скрининга.

Современная «лаборатория будущего» интегрирует три модуля:

  • Синтез: безклеточные системы экспрессии или автоматизированные линии с CHO/HEK293 культурами, выдающие очищенный белок для 96-384 образцов за 48-72 часа.
  • Характеризация: автоматические SPR/BLI станции, дифференциальная сканирующая флуориметрия (DSF) для термостабильности, аналитическое ультрацентрифугирование для агрегации.
  • Обратная связь: данные с приборов напрямую поступают в базу, модель дообучается на новых результатах, генерирует следующую партию кандидатов.

Производительность таких платформ достигает 1000-5000 охарактеризованных молекулярных взаимодействий в неделю. Для сравнения: ручной формат - 20-50 взаимодействий в неделю на одного исследователя. Ускорение в 50-100 раз при снижении стоимости одного измерения на порядок. Это не замещает исследователя - это меняет характер его работы с рутинного исполнения на дизайн эксперимента и интерпретацию результатов. Вопрос о том, где проходит грань между полезным ускорением и риском потери экспертизы, подробно разобран в статье об ИИ-ассистентах в разработке - те же принципы применимы и к биотехнологическим R&D процессам.

Кейс AstraZeneca: ИИ для отсева кандидатов на ранних этапах

AstraZeneca интегрировала AI-модели в процесс ранней оценки кандидатов для портфеля биологических препаратов в 2023-2024 годах. Инициатива охватывает направление мультиспецифичных антител и конъюгатов антитело-лекарство (ADC).

Архитектура решения включает три компонента. Первый - мультимодальная предиктивная модель, обученная на внутренних данных компании: 15 000+ экспериментально охарактеризованных молекул с разметкой по аффинности, агрегации, фармакокинетике и токсичности. Второй - генеративный модуль на основе диффузионных архитектур, предлагающий варианты оптимизации для молекул, прошедших предиктивный фильтр. Третий - слой оркестровки, распределяющий кандидатов между внутренними лабораториями и CRO (контрактными исследовательскими организациями) на основе предсказанной вероятности успеха.

Результаты, представленные компанией на внутренних R&D днях в 2025 году:

  • Процент молекул, отсеянных на стадии in silico до синтеза: 70-85% (ранее 30-40% на основе ручного анализа).
  • Доля кандидатов, прошедших в доклинические испытания после AI-фильтрации: выросла с 12% до 28%.
  • Среднее время от выбора мишени до nomination candidate: сократилось с 24 до 16 месяцев.
  • Экономия бюджета на синтез и характеризацию: $4-7 млн на программу ранней стадии.

Ключевой вывод AstraZeneca: AI не заменяет экспериментаторов, а фокусирует их ресурсы. Вместо синтеза 500 вариантов и тестирования всех подряд, команда синтезирует 50 топ-кандидатов, предсказанных моделью, и 20 «исследовательских» вариантов из областей неопределённости - для активного обучения модели. Такой подход балансирует exploitation и exploration, предотвращая деградацию качества предсказаний на узком распределении данных.

Ключевой вызов: предсказание безопасности и виртуальные клинические испытания

Аффинность и стабильность - решаемые задачи для AI. Безопасность in vivo - нет. Причина в сложности биологических систем: молекула взаимодействует с тысячами белков, метаболизируется в печени, выводится почками, активирует иммунные клетки. Каждый из этих процессов плохо описан количественно, а экспериментальные данные фрагментированы и зашумлены.

Текущие модели предсказывают отдельные аспекты безопасности с умеренной точностью: гепатотоксичность - AUC 0.75-0.82, hERG-связывание - AUC 0.85-0.90, иммуногенность (MHC-II презентация) - AUC 0.70-0.78. Проблема в том, что эти предсказания слабо коррелируют между собой и не агрегируются в интегральную оценку риска. Молекула, безопасная по всем отдельным тестам, может вызывать системную токсичность через неизвестный механизм.

Решение - концепция виртуальных клинических испытаний: интеграция AI-моделей с физическими тестовыми стендами, имитирующими физиологию человека. Три направления развития:

  • Органы-на-чипе: микрофлюидные устройства с живыми клетками, воспроизводящие архитектуру и функцию органов. Печень-на-чипе, почка-на-чипе, гематоэнцефалический барьер-на-чипе. Данные с этих устройств - концентрационные профили, маркеры повреждения, транскриптомные ответы - используются для калибровки AI-моделей.
  • Цифровые двойники пациентов: математические модели физиологии, параметризованные под конкретного пациента - возраст, вес, генетические полиморфизмы, сопутствующие заболевания. AI-модель «прогоняет» кандидата через популяцию цифровых двойников, предсказывая распределение ответов и выявляя субпопуляции риска.
  • Трансферное обучение от животных моделей к человеку: модели, обученные на парах «данные токсикологии на мышах - данные фазы I на людях», предсказывают человеческую токсикологию по животным данным с поправкой на межвидовые различия.

Интеграция AI и физических тестовых стендов

Практическая реализация гибридного подхода выглядит так: AI-модель генерирует кандидатов и предсказывает их безопасность in silico. Кандидаты с неопределённым прогнозом (модель даёт низкую уверенность) направляются на физические тестовые стенды. Результаты экспериментов возвращаются в обучающую выборку, модель дообучается, её уверенность растёт. После нескольких итераций модель начинает точно предсказывать результаты физических тестов для новых кандидатов, снижая потребность в дорогостоящих экспериментах.

Платформы, реализующие этот подход, пока находятся на стадии пилотных проектов в крупных фармкомпаниях и академических консорциумах. Основные технические сложности: стандартизация форматов данных между AI-модулем и лабораторным оборудованием, автоматическая разметка и контроль качества экспериментальных данных, калибровка неопределённости моделей. Последнее критически важно: модель должна честно сообщать, когда она не уверена, чтобы такие кандидаты гарантированно попадали на физический стенд, а не пропускались с ложной уверенностью.

Проблема калибровки неопределённости и управления рисками в AI-системах универсальна - она проявляется и в фармацевтике, и в промышленной разработке. Технический долг в эпоху AI - материал о том, как неконтролируемая сложность AI-систем приводит к экспоненциальному росту издержек на верификацию. Те же принципы применимы к валидации AI-моделей в дизайне лекарств: каждый непроверенный прогноз - это потенциальный токсикологический инцидент на фазе I.

Будущее: автономные лаборатории и полностью ИИ-управляемый дизайн

Полностью автономная лаборатория - система, где ИИ ставит гипотезу, дизайнит эксперимент, управляет роботизированным оборудованием, анализирует результаты и формулирует следующую гипотезу без участия человека. Это не научная фантастика: прототипы таких систем уже работают в академических центрах.

Проект Self-Driving Lab в Университете Торонто демонстрирует автономную платформу для оптимизации каталитических реакций. ИИ-агент выбирает условия реакции, роботизированная станция проводит синтез и анализ, данные поступают обратно в модель. За 100 итераций система находит оптимум, недоступный ручному поиску. Адаптация этой архитектуры к дизайну белков требует решения дополнительных сложностей: синтез белка занимает дни, а не часы; характеризация многомерна (аффинность, стабильность, агрегация, токсичность); пространство поиска дискретно и разреженно.

Ожидаемые сроки появления промышленных автономных лабораторий для биологических препаратов: 2027-2029 годы для узких задач (оптимизация термостабильности антитела), 2030-2032 годы для комплексного дизайна (генерация de novo кандидата с заданным профилем безопасности и биофизических свойств). Ключевой драйвер - не столько прогресс AI, сколько снижение стоимости и повышение надёжности роботизированных платформ для синтеза и характеризации белков.

Влияние на скорость открытия новых биопрепаратов будет нелинейным. Первые 50% ускорения даст автоматизация рутинных операций. Следующие 30% - AI-оптимизация дизайна эксперимента. Последние 20% - появление эмерджентных свойств системы, когда ИИ находит неочевидные закономерности в данных, недоступные человеческой интуиции. Именно эти 20% могут привести к открытию принципиально новых классов биологических препаратов.

Вопрос о том, как платформенный подход меняет внедрение AI в корпоративных средах, детально разобран в статье о внедрении генеративного ИИ в Enterprise. Фармацевтические компании сталкиваются с теми же проблемами масштабирования AI-пилотов, что и другие отрасли: дублирование интеграций, разные стеки безопасности, отсутствие переиспользуемых сценариев. Единая AI-платформа для R&D - такой же критический компонент, как оркестрация моделей в промышленной разработке.

Практические выводы: как применить ИИ в ваших R&D процессах

Внедрение AI в дизайн биологических препаратов - поэтапный процесс. Попытка сразу построить автономную лабораторию обречена на провал: модели не будут работать без качественных данных, а данные не появятся без экспериментов. Практическая дорожная карта на 2026 год:

Этап 1: Инвентаризация данных (1-3 месяца). Соберите все исторические данные по прошлым проектам: последовательности, структуры, результаты характеризации - успешные и провальные. Оцифруйте лабораторные журналы. Оцените объём и качество: сколько уникальных молекул, сколько параметров на молекулу, доля пропущенных данных. Минимальный порог для обучения предиктивной модели - 500+ молекул с 5+ параметрами.

Этап 2: Предиктивная модель на исторических данных (2-4 месяца). Обучите графовую нейросеть или трансформер на своих данных. Задача: предсказать известные результаты характеризации по последовательности/структуре. Метрика успеха: модель предсказывает ваши собственные данные с точностью, достаточной для грубого ранжирования (Spearman ρ > 0.6). Если не получается - данных недостаточно, начните с добора экспериментальных точек.

Этап 3: Активное обучение (3-6 месяцев). Запустите цикл «модель предлагает кандидатов - вы синтезируете и тестируете - данные возвращаются в модель». Начните с 20-50 кандидатов за итерацию. Отслеживайте не только улучшение метрик модели, но и практический результат: долю кандидатов, превысивших пороговые значения по ключевым параметрам.

Этап 4: Генеративные модели (6-12 месяцев). Когда предиктивная модель стабильно работает, подключайте генерацию. Используйте открытые модели (RFdiffusion, ProteinMPNN, ESM-3) с файнтюнингом на своих данных. Генерируйте варианты, обусловленные желаемыми параметрами, фильтруйте через предиктивную модель, валидируйте экспериментально.

Предостережения. AI-модели интерполируют, а не экстраполируют: кандидат, сильно отличающийся от обучающей выборки, получит непредсказуемую оценку. Модели не понимают физику - они выучивают статистические паттерны; любое систематическое отличие новых мишеней от тренировочных приведёт к ошибкам. Иммуногенность и токсичность остаются слабо предсказуемыми: не полагайтесь на AI-оценки безопасности без экспериментальной валидации.

Ресурсы для дальнейшего изучения: открытые репозитории Protein Data Bank (структуры), UniProt (последовательности и аннотации), Therapeutic Structural Antibody Database (терапевтические антитела). Открытые модели: RFdiffusion, ProteinMPNN, ESM-3, AlphaFold3 (через API). Бенчмарки: CASP (структурное предсказание), TAP (предсказание разрабатываемости антител).

Подписаться на канал