Моделирование физических процессов методом молекулярной динамики. Учебное пособие
.pdf
5. Компьютерное моделирование физических процессов методом…
гурационного взаимодействия, связанных кластеров и функционала плотности; автоматическая оптимизация геометрии, нахождение переходных состояний с применением аналитических градиентов; нахождение молекулярных свойств.
10.Пакет Gaussian представляет собой коммерческий пакет для моделирования электронных структур в области химии, биохимии, физики и других областях. Пакет дает возможность прогнозировать энергии, молекулярные структуры и колебательные частоты молекулярных систем.
11.Пакет VASP (Vienna Ab initio Simulation Package) позволяет выпол-
нять квантово-механические расчеты в области молекулярной динамики.
12.Пакет MOPAC используется для расчета электронной структуры основного и возбужденного состояний атомов, молекул и твердых тел, дает возможность рассчитывать большие (до 15000 атомов) биомолекулы на базе применения локализованных молекулярных орбиталей.
13.X-PLOR – это пакет компьютерных программ для вычислительной структурной биологии. X-PLOR – это очень сложная программа, которая обеспечивает интерфейс между теоретическими основами и экспериментальными данными в структурной биологии, с особым акцентом на рентгеновскую кристаллографию и спектроскопию ядерного магнитного резонанса в растворах биологических макромолекул. Он предназначен в основном для исследователей и студентов в области вычислительной химии, структурной биологии и вычислительной молекулярной биологии.
14.Abalone – это универсальная программа молекулярной динамики
имолекулярной графики для моделирования биомолекул в периодических граничных условиях. В основном разработан для моделирования сворачивания белка и комплексов ДНК в силовом поле AMBER.
15.Amsterdam Density Functional (ADF) – это программа для расчетов электронной структуры из первых принципов.
16.CP2K – это свободно доступный программный пакет по квантовой химии и физике твердого тела, написанный на Fortran 2008, для выполнения атомистического моделирования твердотельных, жидких, молекулярных, периодических, материальных, кристаллических и биологических систем.
17.Еще одно научное приложение для искусственной реальности (YASARA) – это компьютерная программа для молекулярной визуализа-
41
5. Компьютерное моделирование физических процессов методом…
ции, моделирования и динамики. Бесплатная версия YASARA хорошо подходит для обучения биоинформатике. Существует серия свободно доступных курсов по биоинформатике, в которых используется это программное обеспечение.
18.Discovery Studio – это пакет программного обеспечения для моделирования систем малых молекул и макромолекул.
19.Ascalaph Designer – это компьютерная программа для молекулярного дизайна и моделирования общего назначения. Программа охватывает широкий спектр методов квантовой химии. Ascalaph Designer – бесплатное программное обеспечение с открытым исходным кодом.
20.Desmond – это программный пакет для выполнения высокоскоростного молекулярно-динамического моделирования биологических систем на обычных компьютерных кластерах. Код использует новые параллельные алгоритмы и численные методы для достижения высокой производительности на платформах, содержащих несколько процессоров, но также может выполняться на одном компьютере. Ядро и исходный код доступны бесплатно для некоммерческого использования университетами
идругими некоммерческими исследовательскими учреждениями.
21.MacroModel – это компьютерная программа для молекулярного моделирования органических соединений и биополимеров. Она включает различные химические силовые поля, а также алгоритмы минимизации энергии для прогнозирования геометрии и относительной конформационной энергии молекул. Она выполняет моделирование в рамках классической механики, также называемой молекулярной механикой, и молекулярной динамики для моделирования систем при конечных температурах с использованием стохастической динамики и смешанных алгоритмов Монте-Карло.
22.MAPS – это собственная веб-служба оценки или папок. Программное обеспечение полностью основано на веб-сервисах и предоставляет набор инструментов для записи доказательств, которые структурированы вокруг блога или дневника учащегося. Пользователи могут принадлежать к нескольким учреждениям, а отдельные папки полностью принадлежат физическому лицу. Затем человек выбирает, с каким учреждением или учреждениями поделиться своими папками. Учреждения получают агрегированное представление о папках, входящих в их состав.
42
5.Компьютерное моделирование физических процессов методом…
23.Materials Studio – программа для моделирования материалов. Это программное обеспечение используется в передовых исследованиях различных материалов, таких как полимеры, углеродные нанотрубки, катализаторы, металлы, керамика и так далее, университетами, исследовательскими центрами и высокотехнологичными компаниями. Materials Studio – это программный пакет клиент-серверной модели с клиентскими персональными компьютерами на базе Microsoft Windows и серверами на базе Windows и Linux, работающими на персональных компьюте-
рах, рабочих станциях Linux IA-64 (включая Silicon Graphics (SGI) Altix)
икластерах HP XC. Он выпущен как программное обеспечение с открытым исходным кодом.
24.Orac – это классическая программа молекулярной динамики, предназначенная для моделирования сложных молекулярных систем на атомистическом уровне. Программа написана на языке программирования Фортран. Последнюю версию Orac можно запускать параллельно с использованием стандартных библиотек интерфейса передачи сообщений (MPI), позволяющих моделировать неравновесные траектории с множественной управляемой молекулярной динамикой.
25.NWChem – это программный пакет для вычислительной химии, который включает функции квантовой химии и молекулярной динамики. Он был разработан для работы на высокопроизводительных параллельных суперкомпьютерах, а также на обычных кластерах рабочих станций. Он нацелен на масштабируемость как с точки зрения способности эффективно решать большие проблемы, так и с точки зрения использования доступных параллельных вычислительных ресурсов.
26.Q – это пакет компьютерных программ для моделирования молекулярной динамики. В отличие от других кодов молекулярной динамики, с момента своего создания он специализировался на трех конкретных типах расчетов свободной энергии. Эти расчеты основаны на следующих методах: эмпирическая валентная связь (EVB), возмущение свободной энергии (FEP) и энергия линейного взаимодействия (LIE).
27.SAMSON – компьютерная программная платформа для молекулярного дизайна, которая имеет модульную архитектуру, что делает ee подходящей для различных областей нанонауки, включая материаловедение, науки о жизни, физику, электронику, химию и образование.
43
5. Компьютерное моделирование физических процессов методом…
28.Scigress, стилизованный под SCiGRESS, представляет собой программный пакет для молекулярного моделирования, вычислительной химии, дизайна лекарств и материаловедения.
29.TeraChem – программа для вычислительной химии. По состоянию на 2020 г. программный комплекс все еще находится в активной разработке. TeraChem способна к быстрой молекулярной динамике ab initio и может использовать методы теории функционала плотности (DFT) для наноразмерных биомолекулярных систем с сотнями атомов.
30.Tinker, стилизованный под TINKER, представляет собой компьютерное программное приложение для моделирования молекулярной динамики с общим пакетом для молекулярной механики и молекулярной динамики, с некоторыми особенностями для биополимеров. Ядром пакета является модульный набор вызываемых подпрограмм, которые позволяют манипулировать координатами и оценивать потенциальную энергию и производные с помощью простых средств. Tinker работает в Windows, OS X, Linux и Unix. Исходный код доступен бесплатно по ограниченной лицензии.
5.1. Параллельные расчеты методом молекулярной динамики
Время, которое требуется для нахождения траектории молекулы, составляет порядка наносекунды, что говорит о том, что для проведения моделирования следует выполнить миллионы шагов моделирования. Время, необходимое процессору на 1 шаг молекулярной динамики, составляет от нескольких наносекунд и зависит от размера моделируемой системы. Следовательно, проводимые расчеты занимают очень долгое время.
Однако время, требуемое для расчета траектории системы, можно существенно снизить, применяя параллельные вычисления [4,9].
Параллельный кластер представляет собой набор рабочих станций, объединенных довольно быстрой аппаратурой передачи данных. В данной вычислительной системе оперативная память имеется у каждого процессора, каждый из которых имеет доступ только к своей памяти. При работе с таким кластером пользователь имеет возможность запускать программу моделирования сразу на нескольких компьютерах. Если предположить, что все процессоры в кластере одинаковые, то следует ожидать, что про-
44
5.1. Параллельные расчеты методом молекулярной динамики
грамма будет выполняться во столько раз быстрее, сколько компьютеров будет участвовать в расчетах. Результаты, рассчитанные на одних компьютерах, в определенные моменты времени передаются на другие для дальнейших вычислений. Конечное быстродействие в данном случае характеризуется не только быстродействием процессоров и временем доступа к оперативной памяти, но и скоростью работы аппаратуры передачи данных между процессорами.
При последовательной программе элементы массива, например, будут обрабатываться один за другим. Процессор не приступит к обработке следующего элемента, пока не завершит обработку предыдущего. Параллельная программа может реализовываться сразу на нескольких процессорах, поэтому различные участки массива обрабатываются на разных процессорах параллельного кластера. Процессоры выполняют разные копии одной программы в качестве отдельных задач. Распределение данных при вычислении заключается в описании в программе локального массива данных, представляющего собой часть общего массива, и к последующей работе в каждом процессе только с элементами своего подмассива и отправке между процессами недостаточных для расчета элементов подмассивов.
При написании такой программы необходимо обеспечить равномерную загрузку имеющихся процессоров и организовать обмен данными между процессами. Cамым главным вопросом успешного моделирования всегда является физика, которую можно извлечь из результатов моделирования. Эта цель должна определять размер исследуемой системы.
На каждом шаге моделирования методом молекулярной динамики требуется выполнить определенные операции:
1.Применяя известные координаты, рассчитывать силы, оказывающие влияние на каждую частицу со стороны остальных частиц системы.
2.Рассчитать новые координаты и скорости атомов.
3.Скорректировать новые расположения атомов в пространстве. Наиболее трудоемкой операцией является расчет сил, так как для
нее необходимо количество операций, квадратичное по отношению к числу частиц. Однако силы, оказывающие влияние на каждый атом, могут быть рассчитаны независимо, т.е. на разных процессорах. Таким образом, данная задача довольно хорошо подходит для параллельных вычислений.
45
5. Компьютерное моделирование физических процессов методом…
Параллельный алгоритм моделирования одного шага МД в общем включает пять этапов и применяет два различных принципа распараллеливания: по силам (по парам взаимодействующих атомов, независимо от принадлежности их к разным молекулам) и по молекулам (т.е. по группам химически связанных атомов).
На первом шаге выполняется передача координат всех атомов из главного процесса другим процессам и параллельное вычисление сил, оказывающих влияние на каждый атом от других атомов системы; распараллеливание работы процессоров на данном шаге выполняется по парам взаимодействующих атомов, независимо от принадлежности их к разным молекулам.
На следующем шаге данные по вычисленным силам передаются главному процессу, эти силы суммируются и части результирующих массивов передаются разным процессорам.
Третий и четвертый шаги заключаются в перемещении атомов и применяют принцип распараллеливания работы процессоров по молекулам. На третьем шаге выполняются расчеты новых скоростей и координат атомов. На четвертом шаге выполняется параллельная коррекция длины химических связей для всех химически связанных атомов. На пятом шаге передаются новые координаты атомов главному процессу.
Необходимо отметить, что распараллеливание процессов по парам взаимодействующих атомов на первом шаге дает возможность загрузить все процессоры равномерно. Распараллеливание по молекулам на третьем
ичетвертом шаге дает возможность избежать применения больших объемов данных для передачи между процессорами, поскольку на этапе параллельной коррекции длины химических связей каждому процессору необходимы координаты атомов только тех молекул, для длин связей которых выполняется коррекция.
Следовательно, при разработке эффективной параллельной программы необходима равномерная и сбалансированная загрузка всех процессоров
иминимизация обмена данными между участвующими процессорами.
Запуск программы моделирования на параллельном кластере дает возможность значительно сократить время моделирования и исследовать системы, состоящие из огромного количества многоатомных молекул.
46
5.1.Параллельные расчеты методом молекулярной динамики
Вклассическом методе молекулярной динамики можно смоделировать произвольно большие системы при условии наличия достаточно мощных компьютеров. Тем не менее, шкала времени остается в пределах нескольких наносекунд. Удивительно, но это также верно для очень маленьких систем (независимо от того, насколько мощные компьютеры мы используем). Причина в том, что очень маленькие системы не могут быть эффективно распараллелены.
Многие представляющие интерес системы проводят много времени
влокальных минимумах свободной энергии до того, как произойдет переход в другое состояние. В таких случаях свободная энергия имеет несколько локальных минимумов, разделенных большими барьерами. Это очень неэффективно с вычислительной точки зрения для моделирования с использованием классической молекулярной динамики.
Альтернативой классическим схемам молекулярной динамики является использование методов Монте-Карло, таких как алгоритм Метрополиса. В таких схемах все события и их связанная энергия должна быть известны заранее. Помимо наличия знания всех событий, еще один недостаток таких методов – отсутствие реальной динамики.
Чтобы преодолеть дилемму масштаба времени и при этом получить реальную динамику, ряд различных методов моделирования разрабатываются в последние годы.
Увеличение вычислительной мощности во многом способствовало успеху молекулярной динамики как широко используемому инструменту для анализа малых структур или материалов в экстремальных условиях. Дальнейшее увеличение вычислительной мощности несомненно увеличит возможности использования молекулярного моделирования для многих новых приложений. Вычислительная мощность значительно выросла за последние десятилетия, и сейчас достигает пиковых показателей в несколько PFLOP.
Впоследние годы во многих странах были созданы крупные вычислительные центры. Ранние суперкомпьютеры, такие как Almaden Spark, который использовался в 1960-е годы, были способны моделировать сотни атомов. В середине 1990-х годов вычисления GFLOPS включали миллионы частиц для моделирования. Светодиодные системы TFLOPS привели к первому моделированию систем, превышающих
47
5. Компьютерное моделирование физических процессов методом…
один миллиард частиц. В настоящее время атомистическое моделирование достигает размеров системы от десятков до сотен миллиардов атомов, соответствующих физическим размерам в несколько микрометров. Однако только несколько вычислительных групп или ученых в мире проводят такие масштабные моделирования. Организация top500.org дважды в год публикует списки самых быстрых суперкомпьютеров в мире под названием «TOP500». Доступ к нему можно получить по адресу http://www.top500.org.
5.2. Исследование материалов на основе больших данных
Исследование материалов вступает в эпоху, когда объем данных, полученных в результате экспериментов и вычислений, выходит за пределы уровня, с которым можно справиться с помощью установленных методов. Данная проблема связана с объемом (количеством данных), разнообразием (неоднородностью формы и значения данных), скоростью (скорость, с которой данные могут изменяться или поступать новые данные) и достоверностью (неопределенностью качества данных). Однако наиболее важно то, что большие данные материаловедения открывают новые, необычные и широкие возможности для достижения научных знаний и понимания. Эти возможности требуют новых исследовательских концепций и направлений мысли.
Сегодняшний общий подход в вычислительном материаловедении заключается в публикации результатов в виде целевых исследований, представляющих только те немногие данные, которые имеют непосредственное отношение к соответствующей теме. Таким образом, даже из очень обширных вычислений (затрачивающих тысячи или миллионы часов ядра процессора) очень немногие результаты передаются исследователям. Большинство данных, особенно если они не считаются имеющими непосредственное отношение к делу, хранятся в тайне или даже выбрасываются. В течение нескольких лет сообщество вычислительного материаловедения и инженерии претерпевает «изменения в научной культуре» и начало обширный обмен данными в этой области. Совместное использование всех данных, т.е. полных входных и выходных файлов вычислений, означает, что вычисления не
48
5.2. Исследование материалов на основе больших данных
нужно повторять снова и снова, и у них будет доступ к большим данным, которые можно будет использовать совершенно новым исследовательским способом, т.е. методами искусственного интеллекта. Методы искусственного интеллекта позволяют найти структуру и закономерности в больших данных, получить новое понимание, которое невозможно извлечь, изучая небольшие наборы данных, и таким образом даже предположительно неточные данные могут получить ценность.
Сегодня большие данные и искусственный интеллект революционизируют многие области нашей жизни, и материаловедение не исключение. Данные – важнейший сырьевой материал этого века. Обычно результаты исследований хранятся на компьютерах, рабочих станциях или локальных компьютерах, и большая часть этих данных не используется и часто даже выбрасывается, хотя информационное содержание вполне может быть значительным. В настоящее время эта область постепенно меняет свою научную культуру в сторону открытой науки и открытых данных, и для этого есть много причин. Открытый доступ к данным подразумевает, что данные могут использоваться кем угодно, а не только экспертами, которые разрабатывают или запускают сложные компьютерные коды. Если бы данные были открытыми (и хорошо описанными), с ними работало бы гораздо больше людей, например, компьютерщики, прикладные математики, аналитики конденсированных сред и другие.
Искусственный интеллект – это широкая и междисциплинарная область, а машинное обучение (обучение на основе данных) и сжатое восприятие (происходящее из сжатия сигнала; в первую очередь направленное на идентификацию дескриптора низкой размерности) являются важными подобластями в материаловедении.
Таким образом, определение корреляций, структур и закономерностей в (больших) данных само по себе является важным шагом. Когда взаимосвязь между интересующим свойством P и набором полезных описательных параметров (дескрипторов d1, d2,…, также называемых представлением) известна, графики, или приближенные уравнения могут быть получены для отношения P (d1, d2,…).
Глобальную модель, обращающуюся к количественному описанию всего набора данных, может быть трудно интерпретировать. Для многих
49
5. Компьютерное моделирование физических процессов методом…
требований в области исследования материалов были бы полезны местные модели, которые идентифицируют и описывают подгруппы. Концепции подгрупп (SGD) были введены в начале 1990-х гг., когда появление больших баз данных стимулировало разработку инструментов исследовательской и описательной аналитики в качестве интерпретируемого дополнения к глобальному моделированию.
Алгоритмы машинного обучения можно разделить на две категории [1]: алгоритмы обучения с учителем и алгоритмы обучения без учителя. Обучение с учителем можно разделить на регрессию и классификацию. В дизайне материалов контролируемое обучение пытается определить функцию, которая может прогнозировать свойства новых материалов на основе набора известных материалов и их свойств. Если целевым свойством является непрерывная величина (например, температура стеклования), процесс известен как регрессия. Типичными алгоритмами регрессии являются кригинг или регрессия на основе гауссовских процессов, искусственные нейронные сети (ИНС) и вспомогательные векторные машины (SVM). Если выходными данными являются дискретные цели (например, токсичный или нет, какой тип кристалла), процесс поиска функции прогнозирования называется классификацией. Алгоритмы дерева решений и случайного леса являются двумя наиболее часто используемыми алгоритмами классификации [1].
В то время как контролируемое обучение направлено на поиск функции, отображающей набор входных данных в соответствующее выходное свойство, неконтролируемое обучение пытается идентифицировать взаимосвязь между самими входными данными. Кластеризация, как типичный метод обучения без учителя, представляет собой процесс разделения набора данных на разные категории или регионы, так что точки данных в одной группе или кластере больше похожи друг на друга, чем на точки в других кластерах. Кластеризация очень полезна для извлечения физической информации из данных и для поиска новых многообещающих материалов на основе сравнительных исследований [1]. Наиболее популярными алгоритмами кластеризации являются k-средних, иерархическая кластеризация и скрытое марковское моделирование [1]. Поскольку каждый метод или алгоритм имеет свою область применения, выбор подхо-
50
