Биомедицина практика
.pdfСоздание новых экспериментальных технологий ставит перед биоинформатикой целый ряд новых задач. Например, развитие массспектрометрии позволяет в одном эксперименте проанализировать весь набор белков, присутствующий в клетке. Для решения этой задачи необходим совместный анализ спектров масс и геномов. Открытие новых биологических явлений и механизмов также приводит к появлению новых задач.
Хорошим примером служит открытие РНК интерференции, за которую в 2006 году дали Нобелевскую премию по физиологии. Это открытие вызвало появление целого ряда биоинформатических работ, посвященных поиску участков связывания микроРНК и новых микроРНК. Многие находки были затем подтверждены экспериментально.
Структурная биоинформатика
Каждый белок, помимо своей уникальной последовательности аминокислот, из цепочки которых состоит его молекула, обладает еще и уникальным способом укладки этой цепочки в пространстве. Задачу предсказания укладки по последовательности можно, в принципе, тоже считать задачей биоинформатики, но это задача в своем общем виде еще слишком далека от своего решения. Поэтому структурная биоинформатика занимается анализом пространственных структур, уже определенных экспериментально.
Структур белков известно намного меньше, чем последовательностей белков. Это связано с тем, что экспериментальные процедуры для определения структуры намного сложнее, дороже, и к тому же (в отличие от секвенирования) не являются «рутинными», то есть их результат вовсе не гарантирован. Тем не менее, на начало 2007 года для анализа доступны более 30 000 структур, что тоже немало (доступных белковых последовательностей – несколько миллионов). Среди них как структуры отдельных белковых молекул, так и структуры комплексов белков с ДНК, РНК, другими химическими веществами. Например, большинство лекарств представляют собой химические вещества, чьи молекулы способны связываться – образовывать комплексы – с молекулами тех или иных белков (как правило, в результате такого связывания белок оказывается неспособен выполнять свою природную функцию, что и обеспечивает эффект лекарства).
Исследование механизма действия лекарств имеет большое практическое значение, поэтому определением структуры комплексов молекул белков с молекулами лекарств занимаются многие экспериментальные группы. Как результат – большое количество доступных для компьютерного анализа структур комплексов.
Примеры задач структурной биоинформатики:
1. определение участков белковой молекулы, важных для той или иной функции данного белка (в биоинформатике часто вместо «определение» говорят «предсказание», поскольку компьютерный анализ не может
51
иметь результатом научный факт, а лишь более или менее достоверное предсказание, которое должно быть затем проверено экспериментами);
2.сравнительный анализ структур родственных белков, классификация белков на основе их пространственной структуры;
3.анализ структур комплексов двух или нескольких молекул белка, комплексов молекул белка с другими молекулами; предсказание воздействия молекул химических веществ (в частности, потенциальных лекарств) на молекулы белков;
4.предсказание структуры белка по структуре белка с похожей последовательностью (в такой ситуации задача предсказания укладки часто разрешима).
Основными направлениями биоинформатики являются:
1.эволюция, поиск и функциональный анализ генов в последователь-
ностях,
2.функциональный анализ и расшифровка геномов,
3.экзон-интронные взаимодействия,
4.классификация и характеристика белков,
5.сравнительная геномика и протеомика,
6.вопросы эволюции белков и геномов,
7.филогенез,
8.структурная биология,
9.разработка специализированных пакетов программ и сетевых сер-
висов.
Построение структурных моделей в биоинформатике проводится с использованием компьютерных средств (3D графика), что предполагает изображение геометрии объекта, его поверхности, среды объекта, цвета и оттенков. Существуют методы изменения цвета объекта, чтобы показать освещение с того или иного места и рассеянный свет, сформировать тень. Изображение, располагающееся на экране, может быть легко преобразовано. Рассматриваются структуры белков и нуклеиновых кислот (анализ структурных особенностей, моделирование, предсказание вторичной и третичной структур, определение параметров спирали нуклеиновых кислот).
Анализируются сложные биологически важные макромолекулы. Чтобы понять структуру сложной молекулы, необходимо рассмотреть не одну, а несколько структурных моделей.
Например, пространственное расположение цепи в макромолекуле высокомолекулярного соединения лучше понять с использованием ленточной модели (рис. 10(I)), а нахождение поверхностных групп и взаимодействие между атомами в макромолекуле удобно рассмотреть, применив модель, построенную из сфер с радиусом Ван-дер-Ваальса (рис. 10(II)).
52
Рис. 10. Ленточная модель (I) и модель, построенная из сфер с радиусом Ван-дер-Ваальса, строения белка
Компьютерные программы позволяют выделять в биополимере отдельные фрагменты сочетанием различных моделей. На рисунке 11 показана ленточная модель белка с выделенными фрагментами глицина.
Рис. 11. Ленточная модель белка с выделенными фрагментами глицина
Детали макромолекул рассматривают, укрупняя изображение. Химические элементы имеют определенные цвета (углерод – серый, водород – белый и т.д.), что облегчает восприятие структуры. Кроме того, на элементах структуры можно вводить символьные обозначения.
Компьютерная геномика
В настоящее время определены полные или почти полные последовательности геномов многих организмов. Прочтение полной нуклеотидной последовательности какого-либо генома не является самоцелью. На самом
53
деле это является первым шагом для исследования того, как функционирует та или иная клетка. Исследование геномов бактерий проводится для того, чтобы исследовать метаболизм бактерий и, в случае патогенных организмов, найти потенциальные мишени для лекарств. С другой стороны, изучение геномов может позволить найти новые метаболические пути или ферменты, которые будут применены в биотехнологическом производстве (например, витаминов). В течение как минимум полувека сотни лабораторий исследовали кишечную палочку (E. coli). Но даже такой весьма изученный организм имеет как минимум 25 % абсолютно не охарактеризованных генов. Значительное число секвенированных геномов принадлежат организмам, о которых вообще нет каких-либо других экспериментальных данных.
Экспериментальное определение функции только одного гена требует интенсивной работы одной лаборатории как минимум в течение нескольких месяцев. Компьютерный же анализ позволяет с известной степенью точности охарактеризовать несколько тысяч генов силами небольшой группы примерно за неделю. Разумеется, компьютерный анализ не исключает экспериментальную проверку, однако в этом случае экспериментальная работа существенно упрощается.
Компьютерный анализ геномов состоит из следующих основных элементов:
1.Предсказание генов в последовательностях. При этом в некоторых случаях удается даже найти ошибки в последовательности.
2.Предварительный функциональный анализ по сходству и другим особенностям белковых последовательностей.
3.Сравнительный анализ геномов.
4.Исследование регуляции работы генов.
5.Поиск «пропущенных» генов. Представим себе, что в клетке есть цепочка реакций, преобразующих вещество А в вещество Б, а затем вещество Б в вещество В. При этом ген, ответственный за первую реакцию известен
ив клетке присутствует, а для второй реакции гена не нашли. Это и есть пропущенный ген. На самом деле вторая реакция осуществляется, и проблема заключается в том, чтобы найти в геноме подходящую кандидатуру.
6.Исследование транспортеров (генов, обеспечивающих перенос питательных веществ в клетку и выброс вредных веществ из клетки)
Сравнительная геномика принесла уже несколько значительных открытий и «закрытий». В качестве «закрытия» можно привести, триклозан, который считался универсальным антибактериальным препаратом. Он входит в состав широко разрекламированного мыла «Safeguard». Его мишенью является белок, закодированный в гене fabI. Этот белок катализирует одну из реакций синтеза жирных кислот – необходимого компонента любой клетки. При этом у животных нет аналога этого белка, поэтому такой пре-
54
парат безопасен для человека. Компьютерный анализ бактериальных геномов показал, что стрептококки не имеют белка fabI, а его функцию выполняет совсем другой белок fabR. Поэтому триклозан не действует на стрептококки. Одним из ярких открытий геномики является открытие принципиально новой системы регуляции – рибопереключателей. Это специфическая структура РНК, которая стабилизируется при непосредственном связывании с низкомолекулярным веществом и блокирует синтез матричной РНК. Предсказание структуры и механизма действия было блестяще подтверждено экспериментально.
Другой класс исследований, проводимых компьютерной геномикой – полногеномный анализ и исследование эволюции. В частности, с помощью массового анализа было обнаружено, что альтернативный сплайсинг в генах человека является скорее правилом, чем исключением. Эволюционный взгляд на проблему позволяет выдвинуть гипотезу о том, что сплайсинг, в частности, альтернативный сплайсинг, является эффективным механизмом для эволюции, позволяющим без значительного риска для генома перебирать варианты последовательностей.
Массовый анализ большого количества геномов показал, что, по крайней мере у безъядерных организмов (бактерий и архебактерий), явление горизонтального переноса генов между видами является весьма распространенным явлением – от 10 до 30 % генов в этих геномах горизонтально перенесены из других видов.
Применение некоторых методов анализа для получения новых биологических знаний
Существует широкий спектр методов и инструментов для компьютерного анализа биологических данных. Здесь можно упомянуть и BLAST – наиболее популярный сервис для поиска похожих последовательностей в базах данных, и программы множественного выравнивания аминокислотных последовательностей, и программы предсказания вторичных структур РНК, программы визуализации пространственных структур, программы моделирования динамики пространственных структур и многое другое.
Упорядочивание, выравнивание (alignment) – важнейший метод, используемый в биоинформатике для анализа последовательностей. Сущест-
вуют парное (pairwise alignment) и множественное (multiple sequence alignment, MSА), локальное и глобальное выравнивания. Суть метода состоит в том, что в двух или нескольких последовательностях производится поиск идентичных или похожих участков. Поскольку в процессе эволюции генов могут происходить мутации, вставки или делеции, то допускается добавление в последовательности «пробелов» (gaps) для получения лучшего результата. В результате такого выравнивания можно выявить нуклеотиды или аминокислоты и их группы (мотивы), имеющиеся во всех сравнивае-
55
мых последовательностях в определенных позициях. То есть можно с большой долей вероятности говорить о том, что именно эти «консервативные» участки и есть биологически активные сайты в белках, поскольку они не подверглись изменениям в процессе эволюции. С другой стороны, используя данный метод и задавая в качестве параметра поиска определенный профиль (некоторую последовательность нуклеотидов или аминокислот), можно определить родственные протеины или ДНК и тем самым проследить эволюцию изучаемой последовательности. Анализ результатов множественного выравнивания аминокислотных последовательностей различных белков или участков ДНК, выделенных из разных организмов, может помочь проследить путь этого белка или гена от организма, в котором он проявился впервые и до более поздних видов. Таким образом, применяя MSА, можно ответить на вопросы происхождения того или иного вида, а, зная частоту мутаций, можно определить его примерный возраст. Парное выравнивание аминокислотных последовательностей двух белков, третичная структура одного из которых неизвестна, позволяет сопоставить первичные структуры. При хороших показателях выравнивания можно говорить о гомологии, о сходстве строения и функции исследуемых протеинов и смоделировать пространственную (3D) структуру. При этом установлено, что белки, имеющие не менее 40–50 % гомологии в аминокислотных последовательностях, будут иметь похожие третичные структуры. Следовательно, можно предполагать, что и функции таких белков могут быть похожими.
Структурная биология белка, являясь частью биоинформатики, широко использует ее методы и математический аппарат для решения различных задач, связанных с пространственной организацией белка.
Доказано, что именно третичная структура протеина определяет его биологические функции, поэтому чрезвычайно важно знать не только последовательность аминокислот, составляющих белок, но и их взаимное расположение в пространстве. На сегодняшний день существует 2 основных экспериментальных способа определения третичной структуры белка – это рентгеноструктурный анализ и ядерно-магнитный резонанс (ЯМР). Полученные в результате этих исследований данные после обработки заносятся в специальные банки данных – pdb, SRS и SRS3d, SCOP, CATH, pfaM и т.д.
Оба метода не лишены недостатков и трудностей при выполнении исследования. Биоинформатика использует совершенно другие подходы для предсказания и визуализации третичной структуры белковых молекул: поиск и моделирование гомологов (homology modeling), предсказание на основе законов квантовой механики и молекулярной динамики (Аb initio prediction), предсказание вторичной структуры на основе статистических данных, распознавание фолда (fold recognition или threading), и, наконец, выравнивание структуры (structural alignment). Однако эти методы не могут предсказать точной 3D структуры, поскольку основаны на поиске в различных базах
56
данных уже существующих структур гомологов неизвестной молекулы или на статистически достоверных зависимостях между определенными последовательностями аминокислот и элементами вторичной структуры.
Методы молекулярной динамики требуют огромных вычислительных мощностей и многих лет расчетов (Ab initio). Наилучшие результаты (80– 95 %) дает совмещение этих методов. Биоинформатика может дать ответы на вопросы, связанные с четвертичной структурой белка и его взаимодействием с лигандами (docking). Основываясь на 3D структурах взаимодействующих молекул и их физических свойствах (гидрофобность, электростатический заряд, гибкость отдельных цепей, способность к образованию водородных связей) можно предсказать места контакта или связывания этих молекул, рассчитать характеристики связывания. Это позволяет моделировать малые молекулы, способные избирательно активировать или блокировать активные центры целевого протеина. Такое моделирование широко используется в разработке новых лекарств, несмотря на то, что требует больших вычислительных и временных ресурсов.
Визуализация и интуитивно понятное представление биологических данных является одной из задач, решаемых в вычислительной биологии. Известно, что до 90 % всей информации человек получает от органов зрения, поэтому очень важно, чтобы исследователи обладали инструментарием, позволяющим визуализировать макромолекулы и их комплексы и манипулировать ими. Для эффективной работы с пространственными структурами белков, их группами, комплексами «белок–ДНК», «белок–лиганд» и т.д. существует специализированное программное обеспечение, позволяющее выбирать нужные структуры из банка данных и отображать исследуемую молекулу или группу в виде, удобном для понимания и анализа. Также многие пакеты имеют средства для создания несложных анимаций, расчета и минимизации потенциальной энергии молекул по одному или нескольким методам и моделирования частей исследуемой молекулы de novo, то есть предоставляют инструментарий для осуществления in silico мутаций, построения петель, реконструкции гомологов, изменения протомеров радикалов аминокислот, осуществления докинга (предсказание связывания рецептора и лиганда), что чрезвычайно важно при проектировании новых лекарственных средств. На сегодняшний день исследователю доступны как свободно распространяемые программные продукты, так и коммерческие пакеты. Наиболее известным и бесплатным программным обеспечением, в то же время обладающим мощными возможностями для визуализации и моделирования белков, является deepView-Swiss PDB Viewer (разработчик – the Swiss institute of bioinformatics). Программа позволяет производить базовые операции над данными (рис. 12).
57
Рис. 12. Окно программы Swiss PDB Viewer. Белок кальмодулин
(PDB ID– 1CFC)
Впакете имеется возможность вычислять и минимизировать потенциальную энергию молекулы по методу GROMACS96, основанному на молекулярной динамике, выполнять моделирование гомологов (процедура проводится на удаленном сервере SwiSS-Model), строить выравнивание последовательностей аминокислот и производить структурное выравнивание молекул белков. Пользователь может производить базовые операции над полипептидной цепью – строить петли, выполнять мутации, изменять конформации цепи под контролем диаграммы торзионных углов (Ramachandran plot). Имеется также возможность взаимодействовать с этой программой при помощи скриптов, что может позволить автоматизировать рутинные операции.
Враспоряжении молекулярных биологов имеются и куда более мощные коммерческие продукты. Пакетом, обладающим огромным потенциалом в области молекулярного моделирования, развитым графическим аппаратом и в то же время позволяющим пользователю сразу начать работу, то есть имеющим понятный интерфейс, является Accelrys Discovery Studio. Это программное обеспечение и само по себе вполне способно удовлетворить большую часть запросов биолога, исследующего белки, но, будучи расширено путем подключения к Accelrys Pipeline Pilot Server, превращается в мощную платформу для моделирования, симуляции и конструирования белков, их комплексов, изучения их взаимодействия в динамике, проекти-
рования белков и проведения qSaR (quantitative structure-activity relationship – комплекс протоколов, широко используемый при разработке новых лекарственных средств).
58
Программный комплекс предоставляет возможность не только изучать различные уровни организации белков, но и осуществлять докинг, исследовать свойства сайтов связывания протеинов, выполнять сложные симуляции при помощи инструментов молекулярной динамики и многое другое (рис. 13).
Серверная часть Discovery Studio открывает доcтуп к базам данных и инструментам NCBi (national center for biotechnology information), протоко-
лам для исследований в области протеомики, фармакологии, анализа последовательностей и многого другого. Успехи медицины в настоящее время напрямую зависят от понимания процессов, происходящих на молекулярном уровне.
Большинство этих программ представлены в Интернете и имеют весьма удобный пользовательский интерфейс. Однако очень важно понимать границы применимости тех или иных методов. Любой компьютерный анализ биологических данных является экспериментом (только сделанным не в пробирке) и к нему предъявляются те же требования – важна четкость постановки и необходим соответствующий контроль. Значительная часть биоинформатических работ сделана именно с применением уже существующих средств. Для проведения такого рода работ, как правило, нет необходимости уметь программировать. Достаточно только внимательно анализировать результаты работы уже готовых программ. При этом часто биоинформатический анализ предшествует постановке эксперимента.
С другой стороны массовый (например, геномный) анализ требует использования простейших программ собственного исполнения.
Современные исследования, касающиеся самых актуальных областей, таких как разработка лекарств против вируса иммунодефицита человека и рака, ведутся именно на уровне генов, белков, управляющих транскрипцией, и механизмов регуляции этих процессов. Таким образом, связь биологии, медицины и информационных технологий в ближайшие десятилетия будет укрепляться, поэтому особую важность приобретает проблема преподавания биоинформатики в вузах медико-биологической направленности.
Разработка новых методов анализа биологических данных
Иногда существующие программы недостаточны для решения поставленных задач, или существующие программы имеют недостаточную точность, или для интересующей исследователя биологической задачи нет подходящих средств, или появился новый тип данных. В этом случае приходится разрабатывать новые алгоритмы и программы. Таких примеров множество. Даже алгоритмы для такой классической задачи, как построение множественного выравнивания имеет достаточно сильные ограничения. Современная биоинформатика при разработке новых алгоритмов широко использует достижения теории вероятностей, математической статистики, информатики.
59
60
Рис. 13. Окно программы Discovery Studio. Осуществлён докинг кальмодулина на Mlck (myosine light chain kinase).
Кальмодулин связан с α-спиралью кальмодулин-связывающего пептида (Т1711-Т1774). Видны вторичные и третичные структуры, поверхность кальмодулина и интерфейс взаимодействия. Доступные инструменты расположены слева от 3D окна, а протоколы для проведения глубокого изучения взаимодействующих молекул и симуляций – справа.
Окна сообщений и вспомогательной информации об исследуемых структурах расположены снизу
