Введение
Миллионы геномов и экзомов человека были секвенированы, однако их клинические применения остаются ограниченными из-за трудности разграничения болезнетворных мутаций и доброкачественных генетических вариаций. Из-за своего пагубного влияния на приспособленность клинически значимые генетические варианты имеют тенденцию быть чрезвычайно редкими в популяции. Поэтому обнаружение варианта с высокой частотой в популяции служит веским доказательством в пользу его доброкачественного характера, что позволяет систематически выявлять патогенные мутации методом исключения. Анализ распространенных вариаций в различных человеческих популяциях является эффективной стратегией каталогизации доброкачественных вариантов, но общее количество распространенных вариаций у современных людей ограничено. Из более чем 70 миллионов потенциальных миссенс-вариантов в референсном геноме только примерно 1 из 1000 встречается с общей популяционной частотой аллелей более 0,1%.
Помимо современных человеческих популяций, шимпанзе являются следующим наиболее близким из ныне живущих видов и имеют 94,4% идентичности аминокислотной последовательности. Почти полная идентичность белок-кодирующих последовательностей у людей и шимпанзе позволяет предположить, что естественный отбор, действующий на белок-кодирующие варианты шимпанзе, может также моделировать последствия для приспособленности идентичных мутаций у человека. Если полиморфизмы, идентичные по состоянию, сходным образом влияют на приспособленность у обоих видов, присутствие варианта с высокими частотами аллелей в популяциях шимпанзе должно указывать на его доброкачественный характер у человека, существенно расширяя каталог известных доброкачественных вариантов. Это формулирует гипотезу, которую необходимо проверить с помощью вариантов шимпанзе.
Мы продемонстрировали, что распространенные варианты приматов, как правило, являются доброкачественными в человеческой популяции. Используя сотни тысяч распространенных вариантов из популяционного секвенирования шести видов нечеловекообразных приматов в качестве обучающих данных, мы разработали PrimateAI — глубокую нейронную сеть, которая с высокой точностью предсказывает патогенные мутации.
Распространенные варианты у других приматов в основном доброкачественны для человека
Недавняя доступность агрегированных данных экзома, включающих 123 136 человек, собранных в рамках консорциума Exome Aggregation Consortium (ExAC) и базы данных Genome Aggregation Database (gnomAD), позволяет нам измерить влияние естественного отбора на миссенс- и синонимичные мутации в спектре частот аллелей. Синглтонные варианты (обнаруженные в когорте только один път) тесно соответствуют ожидаемому соотношению миссенс- к синонимичным заменам 2,2:1, предсказываемому de novo мутациями после поправки на конфеундинг-факторы (рис. 1а), однако при более высоких частотах аллелей количество наблюдаемых миссенс-вариантов уменьшается из-за удаления пагубных мутаций естественным отбором.
a, Все миссенс- и синонимичные варианты, обнаруженные в базе данных ExAC / gnomAD, были разделены на 4 категории по частоте аллелей. Затененные серым цветом полосы представляют количество синонимичных вариантов в каждой категории; темно-зеленые полосы представляют миссенс-варианты. Высота каждой полосы масштабируется в соответствии с числом синонимичных вариантов в каждой категории частоты аллелей. b, Спектр частот аллелей для миссенс- и синонимичных вариантов человека, идентичных по состоянию (IBS) с распространенными вариантами шимпанзе.
Варианты приматов были получены из проекта секвенирования геномов человекообразных обезьян и базы данных dbSNP. Сначала мы изучили распространенные варианты шимпанзе, идентичные по состоянию с вариантами человека (рис. 1b), и обнаружили, что соотношение миссенс- к синонимичным заменам остается в значительной степени постоянным во всем спектре частот аллелей человека, что согласуется с отсутствием негативного отбора против распространенных вариантов шимпанзе в человеческой популяции. Низкое соотношение миссенс- к синонимичным заменам, наблюдаемое у вариантов человека, идентичных по состоянию с распространенными вариантами шимпанзе, согласуется с большей эффективной численностью популяции шимпанзе, что позволяет более эффективно отфильтровывать умеренно пагубные вариации.
Затем мы идентифицировали варианты человека, идентичные по состоянию с вариациями, наблюдаемыми по меньшей мере у одного из шести видов нечеловекообразных приматов. Вариации у каждого из шести видов в основном представляют собой распространенные варианты, исходя из ограниченного числа секвенированных особей и низких соотношений миссенс- к синонимичным заменам, наблюдаемых для каждого вида. Подобно шимпанзе, мы обнаружили, что соотношение миссенс- к синонимичным заменам для вариантов из шести видов нечеловекообразных приматов примерно одинаково во всем спектре частот аллелей человека, за исключением небольшого дефицита миссенс-вариаций на частотах распространенных аллелей (рис. 2), что ожидаемо из-за включения небольшого числа редких вариантов.
Рисунок 2. Спектр частот аллелей для миссенс- и синонимичных вариантов человека, которые наблюдаются по меньшей мере у одного из видов нечеловекообразных приматов, аналогично рис. 1.
Мы обнаружили, что миссенс-варианты человека, идентичные по состоянию с наблюдаемыми вариантами приматов, сильно обогащены доброкачественными последствиями в базе данных ClinVar. После исключения вариантов с неопределенным значением и вариантов с противоречащими друг другу аннотациями, варианты ClinVar, присутствующие хотя бы у одного вида нечеловекообразных приматов, в среднем в 90% случаев аннотируются как доброкачественные (Benign) или вероятной доброкачественности (Likely Benign), по сравнению с 35% для миссенс-вариантов ClinVar в целом (рис. 3). Патогенность аннотаций ClinVar для вариантов приматов немного выше, чем та, которая наблюдается при выборке сопоставимой по размеру когорты здоровых людей (~95% доброкачественных или вероятно доброкачественных последствий).
Рисунок 3. Количество доброкачественных и патогенных миссенс-вариантов в общей базе данных ClinVar (верхний ряд) по сравнению с вариантами ClinVar в когорте из 30 людей, смоделированной путем выборки из частот аллелей ExAC / gnomAD (средний ряд), по сравнению с вариантами, наблюдаемыми у приматов (нижний ряд). Противоречащие друг другу утверждения о доброкачественности и патогенности, а также варианты, аннотированные только как имеющие неопределенное значение, были исключены.
Сеть глубокого обучения для классификации патогенности вариантов
Важность классификации вариантов для клинических применений побудила к многочисленным попыткам использовать машинное обучение с учителем для решения этой проблемы, но эти усилия столкнулись с препятствием в виде отсутствия датасета с достаточным размером эталонных данных, содержащего надежно помеченные доброкачественные и патогенные варианты для обучения. Существующие базы данных вариантов, отCмодерированных экспертами-людьми, охватывают лишь малую часть генома: около 50% вариантов в базе данных ClinVar происходят всего из 200 генов (~1% белок-кодирующих генов человека). Более того, систематические исследования показывают, что многие экспертные аннотации человека имеют сомнительные подтверждающие доказательства, что подчеркивает сложность интерпретации редких вариантов, которые могут наблюдаться только у одного пациента. Чтобы уменьшить предвзятость человеческой интерпретации, последние классификаторы обучались на распространенных полиморфизмах человека или фиксированных заменах человек-шимпанзе, однако в качестве входных данных эти классификаторы также используют баллы предсказания более ранних классификаторов, обученных на базах данных, курируемых людьми. Объективное сопоставление эффективности этих различных методов было затруднено из-за отсутствия независимого, свободного от предвзятости эталонного набора данных.
Вариабельность шести нечеловекообразных приматов (шимпанзе, бонобо, гориллы, орангутана, резуса и мармозетки) вносит более 300 000 уникальных миссенс-вариантов, которые не пересекаются с обычной человеческой изменчивостью и в значительной степени представляют собой распространенные варианты с доброкачественным эффектом, прошедшие через сито очищающего отбора, что значительно расширяет набор обучающих данных, доступных для подходов машинного обучения. В среднем каждый вид приматов дает эквивалент 50 тыс. вариантов, что превышает общее количество вариантов в текущей базе данных ClinVar. Кроме того, этот контент свободен от предвзятости человеческой интерпретации.
Используя набор данных, состоящий из общих вариантов человека и вариаций приматов, мы обучили новую глубокую остаточную сеть PrimateAI (https://github.com/Illumina/PrimateAI), на вход которой подаются аминокислотная последовательность, фланкирующая интересующий вариант, и ортологичные выравнивания последовательностей у других видов (рис. 4а). В отличие от существующих классификаторов, использующих признаки, разработанные человеком, наша сеть глубокого обучения извлекает признаки непосредственно из первичной последовательности. Чтобы включить информацию о белковой структуре, мы обучили отдельные сети предсказывать вторичную структуру и доступность растворителя только по последовательности, а затем включили их в качестве подсетей в полную модель (рис. 4b). Учитывая небольшое число человеческих белков, которые удалось успешно кристаллизовать, выведение структуры из первичной последовательности имеет преимущество в виде избежания предвзятости из-за неполной структуры белка и аннотации функциональных доменов. Общая глубина сети с учетом структуры белка составила 36 сверточных слоев, состоящих примерно из 400 000 обучаемых параметров.
Чтобы обучить классификатор, используя только варианты с доброкачественными метками, мы сформулировали задачу прогнозирования как вопрос о том, какова вероятность того, что данная мутация наблюдается как частый вариант в популяции. На вероятность наблюдения варианта с высокой частотой аллелей влияет несколько факторов, из которых нас интересует только вредоносность. Мы сопоставили каждый вариант из набора обучающих данных с доброкачественными свойствами с неразмеченной миссенс-мутацией, контролируя мешающие факторы, и обучили сеть глубокого обучения различать доброкачественные варианты и сопоставленные контрольные образцы. Поскольку количество неразмеченных вариантов значительно превышает размер размеченного набора обучающих данных с доброкачественными свойствами, мы обучили восемь сетей параллельно, каждая из которых использовала свой набор неразмеченных вариантов, сопоставленный с набором обучающих данных с доброкачественными свойствами, чтобы получить консенсусное предсказание.
Рисунок 4. Архитектура PrimateAI — сети глубокого обучения для предсказания патогенности. a, Архитектура сети глубокого обучения для предсказания патогенности PrimateAI. Предсказанная патогенность, обозначаемая как балл PrimateAI, находится в диапазоне от 0 (доброкачественный) до 1 (патогенный). На вход сети подаются эталонная человеческая аминокислота (АА) и альтернативная последовательность (50 аминокислот), центрированные по варианту, профили консервативности матрицы весов позиций (PWM), рассчитанные по 99 видам позвоночных, и b, выходы сетей глубокого обучения для предсказания вторичной структуры и доступности растворителя, которые предсказывают трехуровневую вторичную структуру белка (спираль — H, бета-лист — B и клубок — C) и трехуровневую доступность растворителя (погруженный — B, промежуточный — I и экспонированный — E).
Пример предсказания патогенности
Используя в качестве входных данных только первичную аминокислотную последовательность, сеть глубокого обучения точно присваивает высокие показатели патогенности остаткам в критических функциональных доменах белка, как показано для потенциал-зависимого натриевого канала SCN2A (рис. 5), основного гена заболеваний при эпилепсии, аутизме и интеллектуальной недостаточности. Структура SCN2A состоит из четырех гомологичных повторов, каждый из которых содержит шесть трансмембранных спиралей (S1–S6). При деполяризации мембраны положительно заряженная трансмембранная спираль S4 перемещается к внеклеточной стороне мембраны, заставляя порообразующие домены S5/S6 открываться через линкер S4-S5. Мутации в доменах S4, S4-S5 линкере и S5 доменах, которые клинически связаны с ранней эпилептической энцефалопатией, по прогнозам сети, имеют самые высокие баллы патогенности в гене и истощены на варианты в здоровой популяции.
Рисунок 5. Предсказанный балл патогенности в каждом положении аминокислоты в гене SCN2A с аннотацией ключевых функциональных доменов. Вдоль гена отложен средний балл PrimateAI для миссенс-замен в каждом положении аминокислоты.
Мы сравнили производительность нашей сети с существующими алгоритмами классификации, используя 10 000 распространенных вариантов приматов, которые не участвовали в обучении. Поскольку примерно 50% всех вновь возникающих человеческих миссенс-вариантов фильтруются очищающим отбором при обычных частотах аллелей (рис. 1а), мы определили 50-й перцентиль балла для каждого классификатора с использованием случайно выбранных вариантов, которые были сопоставлены с 10 000 распространенных вариантов приматов по скорости мутаций и покрытию секвенирования, и оценили точность каждого классификатора при этом пороге (рис. 6). Наша сеть глубокого обучения (точность 91%) превзошла производительность других классификаторов (точность 80% для следующей лучшей модели) при присвоении доброкачественного эффекта 10 000 не участвовавшим в обучении распространенным вариантам приматов. Примерно половина улучшения по сравнению с существующими методами достигается за счет использования сети глубокого обучения, а половина — за счет дополнения набора обучающих данных вариациями приматов, по сравнению с точностью сети, обученной только на данных о вариациях человека (рис. 6).
Рисунок 6. Сравнение классификаторов по прогнозированию доброкачественного эффекта для тестового набора из 10 000 распространенных вариантов приматов, которые не участвовали в обучении. Ось y представляет собой процент вариантов приматов, правильно классифицированных как доброкачественные, после нормализации порога каждого классификатора до его 50-го перцентиля балла на наборе из 10 000 случайных вариантов, которые были сопоставлены по частоте мутаций.
Чтобы протестировать классификацию вариантов с неопределенным значением в клиническом сценарии, мы оценили способность сети глубокого обучения различать de novo мутации, возникающие у пациентов с нарушениями нервно-психического развития, и здоровых людей из контрольной группы. По распространенности нарушения нервно-психического развития составляют одну из крупнейших категорий редких генетических заболеваний, и недавние исследования трио-секвенирования показали ключевую роль de novo миссенс-мутаций и мутаций, приводящих к усечению белка. Мы классифицировали каждый достоверно определенный de novo миссенс-вариант у 4293 пораженных индивидуумов из когорты «Расшифровка нарушений развития» (Deciphering Developmental Disorders, DDD) по сравнению с de novo миссенс-вариантами у 2517 здоровых сибсов из когорты Simon’s Simplex Collection (SSC) и оценили разницу в предсказанных баллах между двумя распределениями с помощью U-критерия Манна — Уитни (рис. 7а). Сеть глубокого обучения явно превосходит другие классификаторы в этой задаче (рис. 7b).
Рисунок 7. а, Распределение предсказательных оценок PrimateAI для de novo миссенс-вариантов, обнаруженных у пациентов с DDD, по сравнению с невлияющими на них сибсами, с соответствующими p-значениями для критерия суммы рангов Уилкоксона. b, Сравнение классификаторов по способности разделять de novo миссенс-варианты у пациентов с DDD и в контрольной группе. Для каждого классификатора приведены p-значения критерия суммы рангов Уилкоксона.
Затем мы попытались оценить точность сети глубокого обучения в классификации доброкачественных и патогенных мутаций в пределах одного и того же гена. Учитывая, что популяция DDD в основном состоит из пробандных случаев больных детей без пораженных родственников первой степени родства, крайне важно показать, что классификатор не завысил свою точность за счет предпочтения патогенности в генах с de novo доминантным типом наследования. Мы ограничили анализ 605 генами, которые были номинально значимы для ассоциации с заболеванием в исследовании DDD, рассчитанными только на основе вариантов с усечением белка. Внутри этих генов de novo миссенс-мутации обогащены в соотношении 3:1 по сравнению с ожидаемыми значениями (рис. 8а), что указывает на то, что ~67% из них являются патогенными. Сеть глубокого обучения смогла различить патогенные и доброкачественные de novo варианты в пределах одного и того же набора генов (рис. 8б), значительно превзойдя другие методы (рис. 8в).
Рисунок 8. Точность классификации в пределах 605 генов DDD с P < 0,05. а, Обогащение de novo миссенс-мутаций по сравнению с ожидаемыми значениями у пораженных лиц из когорты DDD в пределах 605 ассоциированных генов, которые были значимы для de novo вариантов с усечением белка (p<0,05). b, Распределение предсказательных оценок PrimateAI для de novo миссенс-вариантов, обнаруженных у пациентов с DDD по сравнению с невлияющими на них сибсами в пределах 605 ассоциированных генов, с соответствующим p-значением критерия суммы рангов Уилкоксона. c, Сравнение различных классификаторов по способности разделять de novo миссенс-варианты у случаев и в контроле в пределах 605 генов. На оси y показаны p-значения критерия суммы рангов Уилкоксона для каждого классификатора.
При бинарном пороге ≥ 0,803 (рис. 9а) 65% de novo миссенс-мутаций в случаях классифицируются сетью глубокого обучения как патогенные, по сравнению с 14% de novo миссенс-мутаций в контрольной группе, что соответствует точности классификации 88% (рис. 9б). Учитывая частую неполную пенетрантность и варьирующую экспрессивность при нервно-психических расстройствах, эта цифра, вероятно, занижает точность нашего классификатора из-за включения частично пенетрантных патогенных вариантов в контрольную группу.
Рисунок 9. Сравнение различных классификаторов. а, Производительность, показанная на ROC-кривой (Receiver Operator Characteristic), с указанием площади под кривой (AUC) для каждого классификатора. b, Точность классификации и AUC для каждого классификатора. Показанная точность классификации представляет собой среднее значение уровней ошибок для истинных положительных и истинных отрицательных результатов, с использованием порогового значения, при котором классификатор предсказал бы такое же количество патогенных и доброкачественных вариантов, как ожидалось на основе обогащения на рис. 8а. Чтобы принять во внимание тот факт, что 33% de novo миссенс-вариантов DDD представляют собой фоновый шум, максимальная достижимая AUC для идеального классификатора отмечена пунктирной линией.
Наши результаты показывают, что систематическое секвенирование популяций приматов является эффективной стратегией для классификации миллионов человеческих вариантов с неопределенной значимостью, которые в настоящее время ограничивают клиническую интерпретацию генома. Точность нашей сети глубокого обучения как для скрытых распространенных вариантов приматов, так и для клинических вариантов возрастает с увеличением числа доброкачественных вариантов, используемых для обучения сети. Каталогизация общей вариабельности у дополнительных видов приматов улучшила бы интерпретацию миллионов вариантов с неопределенной значимостью, что еще больше повысило бы клиническую полезность секвенирования генома человека.
Благодарности
Мы хотели бы поблагодарить Дж. К. Притчарда (J. K. Pritchard), М. Э. Херлса (M. E. Hurles), Дж. В. Белмонта (J. W. Belmont) и Р. Э. Грина (R. E. Green) за содержательные дискуссии. Мы выражаем благодарность Базе данных агрегации геномов (gnomAD) и группам, которые предоставили данные по экзомам и вариантам генома для этого ресурса. Яньцзюнь Ли (Yanjun Li) и Сяолинь Ли (Xiaolin Li) частично финансировались за счет гранта R01GM110240 Национального института общих медицинских наук и Национального научного фонда (гранты CNS-1747783, CNS-1624782 и OAC-1229576). Мы хотели бы выразить признательность авторам оригинальной статьи, включая Лакшшмана Сундарама (Laksshman Sundaram), Самскрути Редди Падигепати (Samskruthi Reddy Padigepati), Джереми Ф. МакРрея (Jeremy F. McRae), Яньцзюнь Ли (Yanjun Li), Джека А. Космицки (Jack A. Kosmicki), Нондаса Фритилас (Nondas Fritzilas), Йорга Хакенберга (Jorg Hakenberg), Анидиту Датту (Anindita Dutta), Джона Шона (John Shon), Цзиньбо Сюй (Jinbo Xu), Серафима Бацлоглоу (Serafim Batzloglou) и Сяолиня Ли (Xiaolin Li).
Внешние ссылки
Публикация: https://pubmed.ncbi.nlm.nih.gov/30038395/
Программное обеспечение: https://github.com/Illumina/PrimateAI
Полиморфизмы приматов из проекта генома человекообразных обезьян: https://eichlerlab.gs.washington.edu/greatape/data.html
И из базы данных dbSNP: https://www.ncbi.nlm.nih.gov/snp/
Оценки PrimateAI для 70 миллионов вариантов: https://basespace.illumina.com/s/cPgCSmecvhb4
- Макартур, Д. Г. и др. (MacArthur, D. G. et al.) Guidelines for investigating causality of sequence variants in human disease. Nature 508, 469-476, doi:10.1038/nature13127 (2014).
- Рем, Х. Л., Дж. С. Берг, Л. Д. Брукс, К. Д. Бустаманте, Дж. П. Эванс, М. Дж. Лэндрум, Д. Х. Ледбеттер, Д. Р. Маглотт, К. Л. Мартин, Р. Л. Нуссбаум, С. Е. Плон, Е. М. Рамос, С. Т. Шерри, М. С. Уотсон (Rehm, H. L., J. S. Berg, L. D. Brooks, C. D. Bustamante, J. P. Evans, M. J. Landrum, D. H. Ledbetter, D. R. Maglott, C. L. Martin, R. L. Nussbaum, S. E. Plon, E. M. Ramos, S. T. Sherry, M. S. Watson). ClinGen--the Clinical Genome Resource. N. Engl. J. Med. 372, 2235-2242 (2015).
- Бамшад, М. Дж., С. Б. Нг, А. В. Бигем, Х. К. Табор, М. Дж. Эмонд, Д. А. Никерсон, Дж. Шендур (Bamshad, M. J., S. B. Ng, A. W. Bigham, H. K. Tabor, M. J. Emond, D. A. Nickerson, J. Shendure). Exome sequencing as a tool for Mendelian disease gene discovery. Nat. Rev. Genet. 12, 745–755 (2011).
- Ричардс, С. и др. (Richards, S. et al.) Стандарты и рекомендации по интерпретации вариантов последовательности: совместная рекомендация по консенсусу Американского колледжа медицинской генетики и геномики и Ассоциации молекулярной патологии. Genet Med 17, 405-424, doi:10.1038/gim.2015.30 (2015).
- Лек, М. и др. (Lek, M. et al.) Analysis of protein-coding genetic variation in 60,706 humans. Nature 536, 285-291, doi:10.1038/nature19057 (2016).
- Лю, Х., Х. Цзянь, Э. Боервинкл (Liu, X., X. Jian, E. Boerwinkle). dbNSFP: A lightweight database of human nonsynonymous SNPs and their functional predictions. . Human Mutation 32, 894–899 (2011).
- Консорциум по анализу секвенирования шимпанзе (Chimpanzee Sequencing Analysis Consortium). Initial sequence of the chimpanzee genome and comparison with the human genome. Nature 437, 69-87, doi:10.1038/nature04072 (2005).
- Самоча, К. Е. и др. (Samocha, K. E. et al.) A framework for the interpretation of de novo mutation in human disease. Nat Genet 46, 944-950, doi:10.1038/ng.3050 (2014).
- Шерри, С. Т. и др. (Sherry, S. T. et al.) dbSNP: the NCBI database of genetic variation. Nucleic Acids Res 29, 308-311, doi:10.1093/nar/29.1.308 (2001).
- Прадо-Мартинес, Х. и др. (Prado-Martinez, J. et al.) Great ape genome diversity and population history. Nature 499, 471-475 (2013).
- Кимура, М. (Kimura, M.) The neutral theory of molecular evolution. Cambridge University Press, 1983
- де Мануэль, М. и др. (de Manuel, M. et al.) Chimpanzee genomic diversity reveals ancient admixture with bonobos. Science 354, 477-481, doi:10.1126/science.aag2602 (2016).
- Лэндрум, М. Дж. и др. (Landrum, M. J. et al.) ClinVar: public archive of interpretations of clinically relevant variants. Nucleic Acids Res 44, D862-868, doi:10.1093/nar/gkv1222 (2016).
- Нг, П. К. и Хеникофф, С. (Ng, P. C. & Henikoff, S.) Predicting deleterious amino acid substitutions. Genome Res 11, 863-874, doi:10.1101/gr.176601 (2001).
- Аджубей, И. А. и др. (Adzhubei, I. A. et al.) A method and server for predicting damaging missense mutations. Nat Methods 7, 248-249, doi:10.1038/nmeth0410-248 (2010).
- Чун, С., Дж. К. Фэй (Chun, S., J. C. Fay). Identification of deleterious mutations within three human genomes. Genome Research 19, 1553-1561 (2009).
- Шварц, Й. М., К. Рёдельспергер, М. Шульке, Д. Зелов (Schwarz, J. M., C. Rödelsperger, M. Schuelke, D. Seelow). MutationTaster evaluates disease-causing potential of sequence alterations. Nat. Methods 7, 575–576 (2010).
- Рева, Б., Антипин, Ю. и Сандер, К. (Reva, B., Antipin, Y. & Sander, C.) Predicting the functional impact of protein mutations: application to cancer genomics. Nucleic Acids Res 39, e118, doi:10.1093/nar/gkr407 (2011).
- Дун, К. и др. (Dong, C. et al.) Comparison and integration of deleteriousness prediction methods for nonsynonymous SNVs in whole exome sequencing studies. Hum Mol Genet 24, 2125-2137, doi:10.1093/hmg/ddu733 (2015).
- Картер, Х., Дувилль, К., Стенсон, П. Д., Купер, Д. Н. и Карчин, Р. (Carter, H., Douville, C., Stenson, P. D., Cooper, D. N. & Karchin, R.) Identifying Mendelian disease genes with the variant effect scoring tool. BMC Genomics 14 Suppl 3, S3, doi:10.1186/1471-2164-14-S3-S3 (2013).
- Чой, Й., Симс, Г. Е., Мерфи, С., Миллер, Дж. Р. и Чан, А. П. (Choi, Y., Sims, G. E., Murphy, S., Miller, J. R. & Chan, A. P.) Predicting the functional effect of amino acid substitutions and indels. PLoS One 7, e46688, doi:10.1371/journal.pone.0046688 (2012).
- Гулько, Б., Хубиз, М. Дж., Гронау, И. & Сипель, А. A method for calculating probabilities of fitness consequences for point mutations across the human genome. Nat Genet 47, 276-283, doi:10.1038/ng.3196 (2015).
- Шихаб, Х. А. и др. An integrative approach to predicting the functional effects of non-coding and coding sequence variation. Bioinformatics 31, 1536-1543, doi:10.1093/bioinformatics/btv009 (2015).
- Куанг, Д., Чен, Ю. & Се, С. DANN: a deep learning approach for annotating the pathogenicity of genetic variants. Bioinformatics 31, 761-763, doi:10.1093/bioinformatics/btu703 (2015).
- Белл, К. Дж., Д. Л. Динвидди, Н. А. Миллер, С. Л. Хейтли, Э. Э. Ганусова, Дж. Мидж, Р. Дж. Ленгли, Л. Чжэн, К. Ли, Р. Д. Шилки, Дж. Вудворд, Х. Э. Пекхем, Г. П. Шрот, Р. Ким, С. Ф. Кингсмор. Comprehensive carrier testing for severe childhood recessive diseases by next generation sequencing. Sci. Transl. Med. 3, 65ra64 (2011).
- Кирхер, М., Д. М. Виттен, П. Джейн, Б. Дж. О’Роак, Г. М. Купер, Дж. Шендор. A general framework for estimating the relative pathogenicity of human genetic variants. Nat. Genet. 46, 310-315 (2014).
- Смедли, Д. и др. A Whole-Genome Analysis Framework for Effective Identification of Pathogenic Regulatory Variants in Mendelian Disease. Am J Hum Genet 99, 595-606, doi:10.1016/j.ajhg.2016.07.005 (2016).
- Иоаннидис, Н. М. и др. REVEL: an ensemble method for predicting the pathogenicity of rare missense variants. Am J Hum Genet 99, 877-885, doi:10.1016/j.ajhg.2016.08.016 (2016).
- Джагадиш, К. А., А. М. Венгер, М. Дж. Бергер, Х. Гутуру, П. Д. Стенсон, Д. Н. Купер, Дж. А. Бернштейн, Г. Бейжерано. M-CAP eliminates a majority of variants of uncertain significance in clinical exomes at high sensitivity. Nature Genetics 48, 1581-1586 (2016).
- Гримм, Д. Г. The evaluation of tools used to predict the impact of missense variants is hindered by two types of circularity. Human Mutation 36, 513-523 (2015).
- Хэ, К., Чжэн, С., Жэнь, С., Сунь, Дж. Proceedings of the IEEE conference on computer vision and pattern recognition. IEEE 770-778.
- Хеффернан, Р. и др. Improving prediction of secondary structure, local backbone angles, and solvent accessible surface area of proteins by iterative deep learning. Sci Rep 5, 11476, doi:10.1038/srep11476 (2015).
- Ван, С., Пэн, Дж., Ма, Дж., Сюй, Дж. Protein secondary structure prediction using deep convolutional neural fields. Scientific Reports 6, 18962-18962 (2016).
- Пайандех, Й., Шойер, Т., Чжэн, Н. & Каттерал, У. А. Кристаллическая структура вольтажного натриевого канала. https://www.nature.com/articles/nature10238
- Шен, Х. и др. Структура эукариотического вольтажного натриевого канала с почти атомным разрешением. https://science.sciencemag.org/content/355/6328/eaal4326
- Накамура, К. и др. Clinical spectrum of SCN2A mutations expanding to Ohtahara syndrome. Neurology 81, 992-998, doi:10.1212/WNL.0b013e3182a43e57 (2013).
- Виссерс, Л. Э., Гилиссен, К. & Велтман, Дж. А. Genetic studies in intellectual disability and related disorders. Nat Rev Genet 17, 9-18, doi:10.1038/nrg3999 (2016).
- Нил, Б. М. и др. Patterns and rates of exonic de novo mutations in autism spectrum disorders. Nature 485, 242-245, doi:10.1038/nature11011 (2012).
- Сандерс, С. Дж. и др. De novo mutations revealed by whole-exome sequencing are strongly associated with autism. Nature 485, 237-241, doi:10.1038/nature10945 (2012).
- Де Рубеис, С. и др. Synaptic, transcriptional and chromatin genes disrupted in autism. Nature 515, 209-215, doi:10.1038/nature13772 (2014).
- Deciphering Developmental Disorders Study. Large-scale discovery of novel genetic causes of developmental disorders. Nature 519, 223-228, doi:10.1038/nature14135 (2015).
- Deciphering Developmental Disorders Study. Prevalence and architecture of de novo mutations in developmental disorders. Nature 542, 433-438, doi:10.1038/nature21062 (2017).
- Иосифов, И. и др. The contribution of de novo coding mutations to autism spectrum disorder. Nature 515, 216-221, doi:10.1038/nature13908 (2014).
- Чжу, С., Нид, А. К., Петровски, С. & Голдштейн, Д. Б. One gene, many neuropsychiatric disorders: lessons from Mendelian diseases. Nat Neurosci 17, 773-781, doi:10.1038/nn.3713 (2014).







