Контакты
-
Адрес: Москва, Ленинский пр. 31
-
Email: hia@igic.ras.ru

Злобин И.С., Беспалов И.А., Павлов А.А.
Центр цифрового материаловедения ИОНХ РАН
Введение
В органической химии давно известно понятие «каскадная реакция». В таком процессе исходное вещество без удаления промежуточных продуктов последовательно превращается в конечное целевое соединение: на каждой стадии создаются именно те функциональные группы или реакционные центры, которые необходимы для следующего шага.
Удивительно, но аналогию с каскадной реакцией можно найти и в области машинного обучения. В хемоинформатике всё более востребованной становится стратегия построения предсказательных моделей, в которой несколько этапов обучения выстраиваются в последовательную цепочку, а каждый следующий этап опирается на знания, накопленные предыдущим. Продолжая аналогию с химическими превращениями, мы предлагаем обозначить такой подход отдельным термином – каскадное обучение. В компьютерном зрении и обработке текстов подобная стратегия уже стала стандартной практикой, однако в химии она только начинает применяться систематически – и именно здесь её потенциал особенно высок. Каскадное обучение прямо нацелено на преодоление одного из ключевых барьеров современной хемоинформатики – хронического недостатка данных (подробнее о барьерах современной хемоинформатики читайте в нашей предыдущей статье: https://cheminform.ru/himicheskaya-nauka/chetyre-barera-sovremennoj-hemoinformatiki/).
Трансферное обучение и фундаментальные модели
Чтобы понять, что такое каскадное обучение, нужно начать с более известного понятия – трансферного обучения (англ. transfer learning). Идея проста: если нейронная сеть уже обучена решать одну задачу на большом наборе данных, накопленные ею внутренние представления о структуре объектов можно использовать как отправную точку для обучения на другой, смежной задаче (часто с значительно меньшим объёмом данных). Это позволяет преодолеть главное ограничение машинного обучения в химии: сбор сведений о физических свойствах, реакционной способности или биологической активности требует дорогостоящих экспериментов, и специализированные датасеты нередко насчитывают лишь несколько сотен примеров. При этом даже сравнительно небольшая нейронная сеть содержит миллионы параметров, и для надёжного обучения с нуля ей требуется сопоставимо большой набор данных – речь идёт о десятках миллионов примеров, а не тысячах.
Именно поэтому возникло понятие фундаментальных моделей: сетей, предобученных на максимально доступных данных (как правило, только на структурной информации, без целевых свойств). Например, модель ChemBERTa-2 [1] предобучена на 77 миллионах молекул из PubChem, модель Uni-Mol [2] – на 209 миллионах молекулярных конформаций, а масштабированная модель Uni-Mol2 [3] – на 800 миллионах конформаций. Следует оговориться: большинство существующих фундаментальных моделей ориентированы преимущественно на органические молекулы и, отчасти, биологически активные соединения. Для неорганических материалов, координационных соединений и полимеров предобученных моделей сопоставимого масштаба нет, а задача каскадного обучения в этих областях во многом остаётся открытой.
Такой огромный набор данных позволяет модели хорошо обобщить информацию о структурных закономерностях химических соединений – обнаружить типовые структурные каркасы, сформировать представление о различиях химических классах, выучить повторяющиеся функциональные фрагменты и т.д. Именно такая способность модели воспроизводить выученные закономерности на новых, ранее не встреченных соединениях называется генерализацией – и именно её качество определяет практическую ценность фундаментальной модели как основы для предварительного обучения.
Затем подключается трансферное обучение – предварительно обученные веса фундаментальной модели используются для решения новой задачи путем однократного дообучения на целевом наборе данных, который может насчитывать лишь несколько тысяч примеров. Как правило, в таком случае не происходит дообучение всей модели целиком – размораживается лишь один или несколько небольших слоёв нейронной сети или происходит дополнение архитектуры небольшим количеством новых весов. Так удаётся ограничить сложность модели и тем самым избежать переобучения – ситуации, при которой избыточное число параметров позволяет модели «заучить» обучающую выборку наизусть, но лишает её способности к генерализации на новых данных. Модель уже использует сформированные ранее знания об основных химических закономерностях, дообучаясь на небольшом количестве параметров для предсказания нужного свойства. Трансферное обучение уже активно используется в хемоинформатике [4] – и именно оно является фундаментом, на котором строится каскадное обучение.
Каскадное обучение
Каскадное обучение продолжает и развивает идею трансфера, снимая ограничения на число шагов. Вместо одного дообучения выстраивается цепочка из нескольких последовательных переходов, каждый из которых сужает специализацию модели: то, что раньше было конечной точкой, становится промежуточным звеном.
Рисунок 1 – Схема трехэтапного каскадного обучения

Чтобы разобраться, чем выигрышно такое расширение, придется слегка погрузиться в принцип работы современных нейросетевых моделей. Нейронная сеть – это многослойная иерархия представлений, в которой разные уровни в совокупности кодируют разные аспекты данных. Интерпретировать смысл отдельных нейронов или слоёв напрямую в общем случае невозможно – сеть не хранит знания в виде явных правил. Однако мы можем наблюдать, как ведёт себя модель в целом: сеть, обученная на огромном разнородном химическом пространстве, с трудом различает тонкие закономерности, характерные для узкого класса соединений. Это, в целом, ожидаемо – знания даже сотен миллионов структур органических молекул будет недостаточно для понимания закономерностей «структура-свойство» в задачах предсказания, например, КПД устройств органической фотовольтаики.
При этом сотни релевантных известных соединений может не хватить, чтобы адаптировать обобщенные химические знания для конкретной задачи – потребуется увеличивать количество параметров, а значит, и количество данных. Именно поэтому однократное дообучение показывает отличные результаты только на сравнительно больших наборах однородных данных (тысячи и десятки тысяч записей), а задачи с более специфическими свойствами или структурами остаются за рамками применимости.
В то же время, последовательное сужение обучающей выборки позволяет модели постепенно настроиться на специфику конкретной задачи. Каждый следующий шаг уточняет то, что было выучено на предыдущем, не разрушая уже сформированных обобщений. Так, промежуточными шагами в предсказании упомянутого выше КПД фотовольтаического устройства могут стать модели предсказания ВЗМО и НСМО органических молекул в целом и ширины запрещенной зоны в молекулах, наиболее близких к практически-значимой выборке – так, на каждом шаге веса модели будут становиться все более и более релевантными для конкретной задачи, постепенно снижая требования к количеству параметров последующих этапов.
В результате финальная модель работает точно там, где это нужно, – опираясь на богатые представления, накопленные на миллионах примеров на ранних этапах. Важнейшее практическое следствие: финальный шаг каскада может опираться на крайне малое число примеров, поскольку задача существенно упрощается, когда большая часть релевантной информации уже закодирована в весах сети.
Каскадное обучение представляет особый интерес для исследовательских и опытно-конструкторских подразделений промышленных химических компаний. В корпоративной среде обучение моделей, как правило, возможно исключительно на верифицированных внутренних данных и строго в рамках информационного периметра компании. Каскадная архитектура органично вписывается в эти ограничения: предобученные фундаментальные модели могут поставляться разработчиком в готовом виде, тогда как последний, специализирующий шаг каскада выполняется силами самой компании на её собственных данных. Таким образом, компании получают доступ к мощным обобщённым представлениям о химическом пространстве, не раскрывая и не передавая сторонним организациям свои проприетарные экспериментальные результаты.
Каскадное обучение на практике
Показательный пример последовательного каскада – семейство моделей Uni-Mol. Базовая модель предобучается на сотнях миллионов молекулярных конформаций без разметки, затем дообучается на обобщённых задачах предсказания молекулярных свойств, а далее в конкретных исследованиях выполняется ещё одно дообучение под узкоспециализированный набор данных. В версии Uni-Mol3, [5] ориентированной на предсказание результатов органических реакций, цепочка разворачивается ещё детальнее: сначала формируется молекулярное представление на неразмеченных данных, затем модель дообучается на общем корпусе химических реакций и лишь после этого – на конкретный реакционный тип. Благодаря этой стратегии модель последовательно усваивает «грамматику» молекул, затем общие принципы реакционных превращений и только потом специфику конкретного класса данных. В итоге Uni-Mol3 превосходит существующие методы по всем четырём типам реакционных задач, включая предсказание состава продуктов, ретросинтез, условия и выход реакции.
Схожая трёхступенчатая логика реализована в модели MoleVers [6], созданной специально для работы с крайне малыми объемами данных. На первом этапе модель обучается без учителя: она учится восстанавливать намеренно искажённую структуру молекулы, формируя общее структурное представление о химическом пространстве. На втором этапе проводится дообучение на расчётных данных, полученных методами квантовой химии (DFT) – значениях HOMO, LUMO и дипольного момента: это промежуточный уровень разметки, дешевле эксперимента, но содержательнее самообучения. Лишь на третьем, финальном шаге модель настраивается под конкретный экспериментальный датасет, нередко насчитывающий всего 50 и менее примеров. Результат: MoleVers превзошла все одношаговые базовые подходы в 18 из 22 задач нового бенчмарка, тогда как стандартные предобученные модели при том же объёме данных демонстрировали близкие к нулю значения R2.
Каскадный принцип успешно работает и в материаловедении. Задача предсказания теплопроводности кристаллических соединений крайне сложна из-за малого числа надёжных DFT-данных – точные датасеты насчитывают буквально десятки материалов. Модель MEGNet, [7] предобученная на задаче предсказания энергии образования для более чем 62 тысяч соединений из Materials Project, сначала дообучается на нескольких тысячах значений теплопроводности, рассчитанных приближённым методом, и лишь затем – на нескольких десятках высокоточных ab initio точек. Этот двухступенчатый каскад снизил среднюю ошибку предсказания вдвое по сравнению с одношаговым трансфером и втрое по сравнению с обучением без предобучения, одновременно существенно повысив воспроизводимость результата.
Заключение
Каскадное обучение – закономерное продолжение и обобщение идеи трансферного обучения применительно к реалиям химического эксперимента. Подобно каскадной реакции, оно позволяет строить высококачественные предсказательные модели без накопления огромных наборов данных на каждом этапе: роль исходного реагента здесь играет фундаментальная модель, роль промежуточных стадий – последовательные дообучения, а конечный продукт – модель, адаптированная под нужды конкретного химического исследования.
Именно эта практическая ориентированность делает каскадное обучение не просто методологическим улучшением, но и новым стандартом для специализированных задач. Модель, доведённая до финального шага каскада, оптимизирована не ради высокой метрики на абстрактном бенчмарке, а ради точной работы с конкретными соединениями, конкретными условиями и конкретным объёмом доступных данных. Именно такие модели оказываются востребованными в реальных исследовательских и промышленных приложениях – от направленного молекулярного дизайна до скрининга материалов с заданными свойствами.
Сегодня каскадное обучение активно развивается вместе с ростом числа и качества фундаментальных химических моделей: чем богаче первая ступень каскада, тем эффективнее каждый последующий шаг специализации. Это взаимное усиление формирует устойчивую тенденцию: будущее хемоинформатики – не в соревновании универсальных моделей за первое место в таблице лидеров, а в построении разветвлённых каскадных цепочек, на выходе которых появляются инструменты, по-настоящему встроенные в химическое исследование.
Список литературы.