Новая модель машинного обучения учится создавать стабильные белки, не копируя природу
Новая система машинного обучения призвана повысить точность компьютерного проектирования белков, одновременно отходя от результатов, воспроизводящих последовательности, встречающиеся в природе.
Исследовательская группа под руководством профессора Эми Э. Китинг с биологического факультета Массачусетского технологического института разработала новую модель машинного обучения под названием PottsMPNN, которая значительно улучшает процесс создания искусственных белков. Ученые обнаружили, что традиционный подход, заставляющий искусственный интеллект копировать природные аминокислотные последовательности, не является оптимальным для конструирования новых функциональных белков. Вместо этого их модель учитывает физические взаимодействия между аминокислотами и обучается на множестве эволюционно родственных последовательностей, что позволяет генерировать стабильные структуры, не имеющие аналогов в живой природе. Результаты этой работы были недавно опубликованы в научном журнале Proceedings of the National Academy of Sciences (PNAS).

Белки выполняют в наших клетках практически всю важную работу: они переносят кислород, ускоряют химические реакции, защищают от инфекций и даже запускают сигналы, связанные с болезнями. Их удивительная способность действовать так избирательно напрямую зависит от формы, которую принимает каждая белковая молекула. Эта форма, или структура, в свою очередь, закодирована в линейной цепочке аминокислот – двадцати разных «кирпичиков», которые соединяются в бесконечных комбинациях.
В природе одна и та же функциональная форма может быть получена из множества разных последовательностей, и наоборот – одна цепочка иногда способна складываться по-разному в зависимости от условий. Именно это многообразие долгое время ставило в тупик разработчиков новых белков, потому что компьютерным алгоритмам трудно было выбрать правильное решение среди такого множества вариантов.
Раньше типичный подход к созданию белков с помощью искусственного интеллекта выглядел как двухэтапный конструктор: сначала инженеры придумывали желаемую трехмерную форму, а затем обучали нейросеть подбирать такие аминокислотные последовательности, которые могли бы эту форму принять. При этом успех модели часто оценивали по тому, насколько точно она воспроизводит последовательности, которые случайно закрепились в процессе эволюции.
Однако, как подчеркивает профессор Китинг, такой критерий не лучший для настоящего творчества. Ведь если мы хотим создать белок с совершенно новой, невиданной структурой, то сравнивать его просто не с чем, и главным вопросом становится не сходство с природой, а сама способность цепочки стабильно сворачиваться в заданную форму.
Именно эту задачу решает новая модель PottsMPNN, которую разработали ученые. Ее главное отличие заключается в том, что она учится не просто запоминать примеры из баз данных, а понимать физику взаимодействий между аминокислотами. Модель анализирует, как каждая пара позиций в будущем белке влияет друг на друга, учитывая все двадцать возможных вариантов аминокислот в каждой паре.
Это позволяет ей значительно точнее предсказывать энергетический ландшафт белка, то есть, насколько выгодно молекуле находиться в той или иной конформации. Кроме того, исследователи добавили в обучение целые семейства эволюционно связанных последовательностей, которые сворачиваются в одну и ту же структуру. Так модель наглядно видит, что решений может быть много, и не зацикливается на единственном «правильном» варианте.
Важную роль в этой работе сыграло и сознательное использование «шума» – небольших случайных искажений структуры во время обучения. Этот прием помогает алгоритму не подражать слепо нативным белкам, а вырабатывать более универсальные закономерности.
В результате PottsMPNN демонстрирует, что чем меньше она опирается на конкретные природные последовательности, тем лучше справляется с прогнозом стабильности и совместимости для новых, искусственных конструкций. Это означает, что исследователи получают инструмент, который способен генерировать реалистичные, физически осуществимые белки, даже если их аминокислотный состав ни разу не встречался в природе.
В конечном счете, такая разработка открывает путь к настоящей биологической инженерии по заказу. Ученые смогут конструировать белки для самых разных целей, от захвата опасных молекул внутри клеток до создания новых биоматериалов или ферментов для промышленности. При этом модель не является окончательным решением: ее авторы планируют дальше настраивать алгоритм для решения конкретных прикладных задач, например, для более точного предсказания эффектов отдельных мутаций. Тем не менее, уже сейчас ясно, что отказ от слепого копирования эволюции и переход к физически обоснованной форме задает новое направление в этой быстро развивающейся области.
Главный итог работы – создание модели PottsMPNN, которая превосходит существующие методы по способности генерировать последовательности для заданных белковых структур и прогнозировать их стабильность. В отличие от прежних подходов, эта модель не стремится подражать природным последовательностям, а использует физические принципы и эволюционное разнообразие, что позволяет ей конструировать совершенно новые, стабильные белки, не встречающиеся в природе. Это не только расширит возможности в биомедицине и биоинженерии, но и закладывает более надежный фундамент для будущих открытий в области искусственного интеллекта и молекулярного дизайна.
Научная публикация:
Beyond native sequence recovery: Improved modeling of the sequence-energy landscape of protein structures
Foster Birnbaum, Amy E Keating
https://doi.org/10.1073/pnas.2535494123
