Несмотря на недавние достижения, современные инструменты в области науки о данных и полимерной информатики по-прежнему ограничены и не имеют эффективных методов преобразования структур мономеров в физически обоснованные числовые дескрипторы, связанные с поведением полимеров.
Нейронные сети на основе графов в последнее время демонстрируют высокую эффективность прогнозирования, а новые методы их интерпретации открывают перспективы для выявления взаимосвязей между структурой и свойствами.
Однако при применении к данным о полимерных мономерах и органических макромолекулах эти методы по-прежнему сталкиваются с проблемами, связанными с интерпретируемостью и вычислительной эффективностью.
Новый шаг в полимерной информатике
Российские ученые разработали и представили новую систему машинного обучения для прогнозирования свойств полимеров. Ее ключевая особенность — использование физически обоснованных и химически интуитивно понятных дескрипторов (Machine learning with physically grounded, interpretable descriptors for polymer property prediction and monomer design).
В разработке приняли участие Глеб Аверочкин и Евгений Александров из Центра НТИ «Цифровое материаловедение: новые материалы и вещества» Московского государственного технического университета (МГТУ) им. Н. Э. Баумана совместно с Иваном Злобиным и Иваном Беспаловым из Института общей и неорганической химии им. Н. Н. Курнакова Российской академии наук, Московского государственного университета (МГУ) им. М. В. Ломоносова.
В основе работы — классические методологии QSPR (Quantitative Structure–Property Relationship), позволяющие прогнозировать физико‑химические свойства веществ по их молекулярной структуре. За теоретическую базу взяты разработки Андрея Аскадского и Джованни Бисерано (G. Bicerano). При этом подход существенно расширен: он специально адаптирован для учета структурных факторов, которые определяют поведение полимерных систем.

Было исследовано несколько дополнительных семейств дескрипторов, включая квантово-химические энергетические параметры из расчетов xTB, условия группового вклада, ван-дер-ваальсовы объемные вклады химически определенных атомных сред, дескрипторы моделей химических связей и кураторские подмножество интерпретируемых функций, производных от RDKit (открытая библиотека для хемоинформатики: она позволяет работать с молекулярными структурами, вычислять их свойства и применять в машинном обучении).
Система прогнозирования оценивалась по четырем критическим свойствам полимера: температуре стеклования, плотности, температуре плавления и температуре начала термического разложения.
Наборы данных, используемые для обучения и оценки, были созданы на основе базы данных PolyInfo и состоят из различных по химическому составу мономерных структур, включая алифатические, ароматические, гетероциклические и многофункциональные соединения.
На сегодняшний день относительно мало исследований посвящено прогнозированию плотности, температуры плавления и температуры термического разложения полимеров, и данная работа призвана восполнить этот пробел.
Разработанные в рамках этого исследования модели обеспечивают точность прогнозирования, сопоставимую с текущим уровнем развития технологий для выбранных целевых свойств.
«В этом исследовании мы систематически проанализировали основные подходы к QSPR-моделированию полимеров, сосредоточив внимание на пяти семействах дескрипторов: вкладах атомного объема типа Аскадского, вкладах функциональных групп типа Бицерано, молекулярных дескрипторах, полученных из RDKit, особенностях связывания и квантовых дескрипторах электронной структуры. Сравнительный анализ разнообразного и репрезентативного набора данных PolyInfo показал, что функции, основанные на Askadskii, превосходят все другие группы по точности прогнозирования»
комментируют разработчики.
Работа выполнена при поддержке Российского научного фонда, проект № 25-73-00026 и опубликована в международном журнале Chemical Engineering Science.




