На главную

Консорциум фармкомпаний обучил ИИ-модель белков на 20 000 закрытых структурах

2 мин
Консорциум фармкомпаний обучил ИИ-модель белков на 20 000 закрытых структурах

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Консорциум фармацевтических компаний обучил ИИ-модель сворачивания белков на более чем 20 000 закрытых структурах, значительно улучшив её точность. Модель превзошла версии, обученные только на публичных данных или на изолированных наборах отдельных компаний. Исследование описано в блоге и не прошло рецензирование.

Ключевые факты

  • Консорциум использовал OpenFold3, открытую реплику AlphaFold 3, для обучения новой модели на более чем 20 000 закрытых структурах белков.
  • Модель превзошла сопоставимые системы, обученные только на публичных данных, и системы, обученные на изолированных наборах отдельных компаний.
  • В Protein Data Bank относительно мало примеров экспериментально определённых структур, взаимодействующих с лекарственными молекулами, — возможно, всего 10 000, по словам Пола Мортенсона из Astex Pharmaceuticals.
  • Проект OpenBind, поддержанный грантом до £8 млн (US$10,8 млн) от правительства Великобритании, в прошлом месяце опубликовал сотни новых структур белков.

Дефицит обучающих данных

Protein Data Bank (PDB), открытый репозиторий более чем 200 000 экспериментально определённых структур белков, стал основой обучающих данных AlphaFold 2. Точность AlphaFold 2 принесла её разработчикам Нобелевскую премию по химии 2024 года. AlphaFold 3 добавила возможность предсказывать, как белки взаимодействуют с другими молекулами, включая потенциальные лекарства. В PDB относительно мало примеров экспериментально определённых структур, взаимодействующих с лекарственными молекулами, — возможно, всего 10 000, говорит Пол Мортенсон, вице-президент по вычислительной химии и информатике Astex Pharmaceuticals в Кембридже, Великобритания.

Результаты модели

Консорциум использовал OpenFold3, открытую реплику AlphaFold 3, для разработки новой модели, обученной на более чем 20 000 закрытых структурах белков. Система превзошла как сопоставимые модели, обученные только на публичных данных, так и модели, обученные на изолированных наборах отдельных компаний. Исследование, описанное в блоге, не прошло рецензирование, а модель не является общедоступной. «Добавляешь все эти данные — и получаешь довольно большой прирост производительности», — говорит Мохаммед Аль-Курайши, вычислительный биолог из Колумбийского университета в Нью-Йорке, участвовавший в работе.

Инициативы открытых данных

По словам Аль-Курайши, результаты усиливают аргументы в пользу создания аналогичных общедоступных наборов данных для ускорения развития ИИ-моделей сворачивания белков. Один из таких проектов, OpenBind, поддержанный грантом до £8 млн (US$10,8 млн) от правительства Великобритании, в прошлом месяце опубликовал сотни новых структур белков, и ещё тысячи находятся в работе. Исследования показали, что точность AlphaFold 3 и других моделей совместного сворачивания резко падает, когда их просят предсказать взаимодействия между молекулами, сильно отличающимися от тех, на которых они обучались.

1 источник

Время · отставание