Почему молекулярная динамика важна для разработки лекарств
Молекулярная динамика (МД) является важным инструментом в современной разработке лекарств. Хотя предсказание структуры и молекулярный докинг могут показать, как потенциальный препарат помещается в белок, они дают лишь моментальный снимок. Молекулы постоянно движутся. МД-симуляции позволяют исследователям увидеть, как препарат и его мишень ведут себя во времени: остается ли взаимодействие стабильным, как белок меняет форму и как развивается молекулярная система.
Проблема заключается в скорости.
МД-симуляции рассчитывают, как атомы взаимодействуют и движутся шаг за шагом, часто на протяжении миллионов шагов симуляции. Запуск этих симуляций в масштабе, необходимом для разработки лекарств, может потребовать значительных вычислительных ресурсов и времени, что ограничивает количество кандидатов в лекарства, которые исследователи могут детально изучить.
ИИ для молекулярной динамики: возможности и узкое горлышко данных
Это вызвало растущий интерес к использованию ИИ для ускорения молекулярной динамики. Вместо того чтобы вычислять каждый шаг исключительно с помощью традиционного моделирования, модели ИИ могут изучать паттерны молекулярного поведения и помогать генерировать или предсказывать эволюцию молекулярных систем.
Но это порождает другую проблему: ИИ нуждается в обучающих данных.
Чтобы обучить модель ИИ пониманию молекулярной динамики, исследователям обычно требуется большая коллекция МД-траекторий. Тем не менее, именно эти траектории дороже всего генерировать в первую очередь. По сравнению с огромным количеством доступных данных о статических молекулярных структурах, высококачественные данные молекулярной динамики остаются относительно дефицитными.
Это создает фундаментальное узкое горлышко. Мы хотим, чтобы ИИ снизил стоимость МД, но обучение ИИ для МД само по себе может зависеть от больших объемов дорогостоящих МД-данных.
В сотрудничестве со Стэнфордским университетом наша работа EGInterpolator исследует способ обхода этого узкого места и представляет фреймворк для масштабного обучения моделей ИИ для молекулярной динамики.
Идея проста. Прежде чем обучать ИИ тому, как движутся молекулы, нужно сначала научить его тому, как выглядят реалистичные молекулы. Эта работа была принята в качестве основной статьи конференции на ICLR 2026.
Решение: сначала изучить структуру, затем динамику
Большие наборы данных молекулярных конформеров предоставляют множество примеров трехмерных молекулярных структур. На основе этих данных модели ИИ могут изучать фундаментальную геометрию молекул, такую как длины связей, углы связей, молекулярные конформации и другие структурные паттерны.
Молекулярная динамика добавляет более сложное измерение: время. Вместо генерации одной реалистичной структуры модель должна научиться тому, как эта структура развивается во времени. Каждый отдельный кадр должен быть физически правдоподобным, в то время как вся последовательность также должна представлять реалистичное молекулярное движение.
Обучение непосредственно на МД-траекториях поэтому требует от модели решения двух сложных задач одновременно:
- Как выглядит реалистичная молекула?
Как выглядит реалистичная молекула?
- Как она движется во времени?
Как она движется во времени?
Сложность заключается в том, что эти два типа данных доступны неравноценно. Статические молекулярные структуры в изобилии, в то время как высококачественные МД-траектории гораздо дороже в генерации и поэтому относительно редки. Это приводит к ключевому выводу: большая часть знаний, необходимых для моделирования молекулярной динамики, в частности молекулярная геометрия, может быть изучена до того, как модель увидит хотя бы одну МД-траекторию.
Наша модель EGInterpolator опирается на эту идею: сначала изучить молекулярные структуры, а затем узнать, как эти структуры развиваются. Она состоит из двух этапов:
- Структурное предобучение: сначала мы предобучаем генеративную модель на основе диффузии на крупномасштабных данных молекулярных конформеров. Этот этап обучает модель распределению реалистичных трехмерных молекулярных геометрий, обеспечивая прочный структурный априор.
- Динамическая доводка: затем мы обучаем интерполятор траекторий на МД-данных, чтобы узнать, как молекулярные структуры соединяются во времени. Поскольку модель уже понимает молекулярную геометрию, дефицитные и дорогие МД-данные могут быть сосредоточены на том, что они предоставляют уникально: на динамике.
Концептуально этот двухэтапный процесс выглядит следующим образом:
Структурное предобучение → Динамическая доводка → Генерация молекулярных траекторий
Вместо того чтобы изучать молекулярную динамику исключительно на основе дорогостоящих данных траекторий, этот подход переносит знания из изобилующих статических структур в молекулярное движение, обеспечивая более эффективный с точки зрения данных и масштабируемый путь к молекулярной динамике на базе ИИ.
Результаты
EGInterpolator может генерировать молекулярные траектории, которые больше похожи на эталонные симуляции молекулярной динамики.
На бенчмарке прямой симуляции DRUGS модель EGInterpolator превзошла GeoTDM, предыдущий генеративный метод молекулярной динамики, по нескольким метрикам молекулярной геометрии и движения. Разница с эталонными МД-симуляциями уменьшилась с 0,640 до 0,173 для углов связей, с 0,643 до 0,142 для длин связей и с 0,498 до 0,377 для торсионного движения с точки зрения среднего расхождения Йенсена–Шеннона (JSD): примерно на 73%, 78% и 24% ниже соответственно.
Важно отметить, что наши эксперименты по абляции показывают, что само структурное предобучение играет главную роль. На бенчмарке DRUGS удаление структурного предобучения увеличило разницу с эталонными распределениями МД с 0,173 до 0,332 для углов связей, с 0,142 до 0,386 для длин связей и с 0,377 до 0,455 для торсионного движения, измеренную по среднему JSD. Это служит прямым доказательством нашей центральной идеи: предварительное изучение реалистичных молекулярных структур помогает ИИ понять, как движутся молекулы, подобные лекарственным.
Помимо малых молекул, мы распространили этот подход на более сложные молекулярные системы, включая тетрапептиды и белковые мономеры.
Вывод прост: сначала обучаясь на изобилующих данных молекулярных структур, ИИ может эффективнее изучать молекулярную динамику, уменьшая при этом зависимость от дефицитных и дорогих данных МД-траекторий. Для разработки лекарств это указывает на появление более масштабируемых инструментов ИИ для изучения того, как потенциальные молекулы лекарств ведут себя во времени.
Место Lambda
Молекулярная динамика традиционно была ресурсоемкой задачей научного моделирования. По мере того как ИИ изучает молекулярные структуры, энергии, силы и даже траектории, все большая часть молекулярного моделирования становится рабочей нагрузкой ИИ, изначально ориентированной на графические процессоры (GPU).
Это исследование иллюстрирует данный сдвиг. Вместо того чтобы полагаться исключительно на традиционное моделирование для генерации каждой молекулярной траектории, мы обучаем генеративные модели ИИ учиться на существующих молекулярных структурах и МД-данных и генерировать реалистичное молекулярное движение. Обучение и оценка этих моделей требуют тех же возможностей, которые лежат в основе современного ИИ: высокопроизводительных GPU, масштабируемой инфраструктуры для обучения и быстрого проведения экспериментов.
Мы обучили и оценили модели в этой работе на инфраструктуре Lambda GPU, используя графические процессоры NVIDIA в многопроцессорных экспериментах. Lambda предоставила вычислительную среду, необходимую для разработки, обучения и тестирования моделей на различных молекулах, соединениях, подобных лекарственным, пептидах и белках.
Для команд по разработке лекарств возможности выходят далеко за рамки одной модели. Современный вычислительный конвейер может включать предсказание структуры белков, генерацию молекул, виртуальный скрининг, докинг и молекулярную динамику — и всё это все больше ускоряется с помощью графических процессоров и ИИ.
Lambda предоставляет инфраструктуру графических процессоров для поддержки этих ресурсоемких рабочих нагрузок, позволяя исследователям запускать рабочие процессы ИИ, охватывающие понимание мишеней, молекулярное моделирование и оценку кандидатов, на единой вычислительной платформе.
Статья: arxiv.org/abs/2604.03911v1Авторы: Стэнфордский университет, Lambda. Авторы: Аникет Айенгар, Цзяци Хан, Пенгвэй Сунь, Минцзянь Цзян, Цзяньвэнь Се, Стефано Эрмон. ICLR 2026.









