Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Oschuschenie kontrolya nad pandemiey covid 19 intervyu s pobeditelem denielom vo
Dev48

© 2026 · All rights reserved.

Ощущение контроля над пандемией COVID-19 | Интервью с победителем Дэниелом Вольфрамом

Источник: Medium

Ощущение контроля над пандемией COVID-19 | Интервью с победителем Дэниелом Вольфрамом

Источник: Medium

Как один участник Kaggle занял первые места в нескольких конкурсах, связанных с COVID. Фото Маркуса Шписке на Unsplash. Сегодня мы берем интервью у Дэниела, чьи ноутбуки принесли ему высшие баллы в конкурсах CORD-19 на Kaggle. Kaggle провел несколько конкурсов, основанных на наборе данных Kaggle CORD-19, и Дэниел трижды занимал 1-е место, в том числе с огромным отрывом в конкурсе TREC-COVID. (Он набрал 0,9 балла,

25 сентября 2026 г.

8 мин чтения

23 июля 2020 г.

Как один участник Kaggle занял первые места в нескольких конкурсах, связанных с COVID.

Нажмите Enter или щелкните, чтобы просмотреть изображение в полном размере

Сегодня мы берем интервью у Дэниела, чьи ноутбуки принесли ему высшие баллы в конкурсах CORD-19 на Kaggle. Kaggle провел несколько конкурсов, основанных на наборе данных Kaggle CORD-19, и Дэниел трижды занимал 1-е место, в том числе с огромным отрывом в конкурсе TREC-COVID. (Он набрал 0,9 балла, 2-е место в общем зачете набрало 0,75 балла, а 2-е место на Kaggle — 0,6 балла.)

Давайте познакомимся с Дэниелом!

Дэниел, расскажи нам немного о себе.

Дэниел: Я Дэниел Вольфрам, аспирант по математике и ассистент по анализу данных в Технологическом институте Карлсруэ (KIT) в Германии. Мои научные интересы включают вероятностное прогнозирование, причинно-следственный вывод и машинное обучение.

Нажмите Enter или щелкните, чтобы просмотреть изображение в полном размере

В рамках конкурса Kaggle CORD-19 я разработал discovid.ai — поисковую систему по литературе о COVID-19. Сейчас я работаю в немецком центре прогнозирования COVID-19 и пишу магистерскую диссертацию о создании и оценке ансамблей прогнозов смертности от COVID-19.

Что ж, неудивительно, что вы заняли первые места в конкурсе CORD-19! Это очень актуально!

Дэниел: Действительно. Я также работаю ассистентом, где последние 3 года участвовал в нескольких проектах по анализу данных и имел возможность работать с реальными данными из разных компаний в самых разных областях — от прогнозирования отходов на лесопилке до анализа дефектов в процессе поверхностного гальванического покрытия и тестирования эффективности маркетинговой кампании.

За время работы ассистентом мы также консультировали компанию, которая работает с большим объемом текстовых данных — именно там я получил свой первый опыт в NLP, а также пришел к идее поиска похожих документов с помощью тематического моделирования. В то время наш клиент хотел придерживаться другого подхода, поэтому мне так и не удалось опробовать метод LDA, но эта мысль всегда оставалась у меня в голове.

Как вы начали участвовать в соревнованиях на Kaggle?

Во время учебы в бакалавриате я вступил в университетскую группу, где мы самостоятельно изучали основы анализа данных — в основном работая над проектами Kaggle, такими как «Титаник» или конкурс Instacart. Так я и получил работу ассистента, потому что встретил там одного из своих нынешних коллег.

Что заставило вас принять участие именно в этом конкурсе?

Мой друг показал мне этот конкурс, и я сразу загорелся. Я вспомнил про подход LDA и просто хотел его опробовать.

Более того, когда конкурс был запущен, количество случаев заболевания COVID в Германии, где я живу, росло. Здесь были приняты первые защитные меры, чтобы «сгладить кривую» — все рестораны, магазины (кроме супермаркетов и аптек) и объекты досуга были закрыты. Мой университет был закрыт, а все экзамены отменены. Еще более шокирующими были цифры из Италии и других стран. Это была очень пугающая и неопределенная атмосфера, поэтому этот конкурс стал для меня способом вернуть себе контроль, встретив кризис лицом к лицу, просто используя свои навыки во благо. Я понимал, что это может не иметь большого влияния, но меня поддерживала мысль о том, что если хотя бы один медицинский исследователь воспользуется моей моделью и наткнется на что-то полезное, мои усилия уже не были напрасными.

Давайте перейдем к технической части

Какую предварительную обработку и проектирование признаков вы выполняли?

Для нормализации документов я удалил стоп-слова, выполнил токенизацию и лемматизацию. Этот последний шаг был здесь довольно критичным, поскольку набор данных CORD-19 содержит узкоспециализированные статьи с научным языком, которые невозможно успешно обработать стандартными пакетами. Было важно использовать scispacy — пакет, специализирующийся на обработке биомедицинских, научных или клинических текстов, который, таким образом, мог также нормализовать технические термины (например, химические элементы, названия лекарств и т. д.).

Чтобы тематическая модель работала должным образом, также необходимо было выполнить определение языка и удалить документы не на английском языке.

Все подробности можно найти в моем ноутбуке по предварительной обработке: https://www.kaggle.com/danielwolffram/cord-19-create-dataframe.

Чтобы дополнительно расширить данные, я также искал в каждой статье идентификаторы клинических испытаний, чтобы связать документ с Международной платформой регистрации клинических испытаний ВОЗ (ICTRP), что потребовало ручного создания нескольких регулярных выражений — подробности можно найти по адресу https://www.kaggle.com/danielwolffram/cord-19-match-clinical-trials.

Нажмите Enter или щелкните, чтобы просмотреть изображение в полном размере

Какие методы машинного обучения вы использовали?

Я использовал латентное размещение Дирихле (LDA) — это тематическая модель без учителя, которая изучает скрытые семантические связи внутри корпуса. Изначально она использовалась для поиска релевантных статей для каждой задачи конкурса CORD-19. Но когда мы перенесли этот подход на наш веб-сайт, мы внедрили более распространенную поисковую систему с использованием Whoosh, которая позволяет выполнять классический поиск по ключевым словам или более сложные логические запросы.

На discovid.ai тематическая модель теперь используется для поиска похожих статей — идея заключается в том, что каждая статья состоит из набора базовых тем, и если мы находим статьи с похожим тематическим составом или пересечением тем, они могут быть интересны читателю и могут дать новые идеи.

Нажмите Enter или щелкните, чтобы просмотреть изображение в полном размере

Нажмите Enter или щелкните, чтобы просмотреть изображение в полном размере

Здесь вы можете изучить 50 тем, которые наша модель обнаружила в корпусе — каждая тема представляет собой распределение слов, и каждый документ можно рассматривать как смесь этих тем.

Какое ваше самое важное открытие в данных?

Интересно, что до удаления неанглоязычных статей из корпуса наша тематическая модель обнаружила следующие темы:

  • Тема №46: der die und bei mit von eine ist werden zu für sind oder einer des den nicht das als nach zur auf durch auch ein
  • Тема №40: de les des en une est dans du par un ou sont pour plus au que avec chez sur d’une qui cas être pas ces
  • Тема №32: de en el los que se con las por un es para pacientes como más virus son tratamiento su infección puede ha casos enfermedad entre
  • Тема №7: un che con sono nel alla più ha tra gli degli come rischio ed pazienti nella nei osteonecrosis ad essere stato studio salute anche have

Как видите, была найдена тема для немецкого, французского, испанского и итальянского языков. Для меня это было очень обнадеживающе, потому что это демонстрирует, насколько мощным является LDA в изучении скрытых структур и что он действительно изучает что-то осмысленное.

Удивили ли вас какие-либо из ваших находок?

Когда люди впервые попробовали наш поисковик, стало ясно, что они ищут только по нескольким ключевым словам — в отличие от задач на Kaggle, которые состояли из гораздо большего объема текста. Это стало серьезной проблемой, так как запросы были слишком короткими, чтобы эффективно определять тематику. Именно тогда я решил внедрить более распространенный поисковый движок с использованием Whoosh в качестве первичного поиска (https://www.kaggle.com/danielwolffram/whoosh-search). Теперь тематическая модель используется только для поиска похожих статей, состоящих из схожих тем, что позволяет пользователям легко просматривать корпус документов и находить новые идеи.

Как вы распределили свое время в этом соревновании?

Как это часто бывает, большая часть моих усилий ушла на подготовку и очистку данных, особенно в начале, когда структура данных часто менялась, что требовало множества корректировок. Я также много читал на форуме и общался с людьми, имеющими медицинское образование, чтобы определить потребности сообщества. Именно поэтому мы также извлекаем методологические ключевые слова в качестве первого индикатора качества и добавляем перекрестные ссылки на клинические испытания, упомянутые в статьях. Я также потратил немало времени на обучение и освоение новых вещей, таких как определение языка или создание собственного поискового движка с помощью Whoosh, чего я никогда раньше не делал.

Каково было время выполнения обучения и прогнозирования вашего победного решения?

Преобразование документов и обучение тематической модели занимает примерно день.

Командная работа

Как сформировалась ваша команда?

Я начал в одиночку и создал несколько виджетов в блокноте Kaggle, чтобы легко исследовать набор данных CORD-19. Но благодаря хорошим отзывам и растущему интересу к моему подходу, я захотел сделать его более удобным для пользователя, чтобы им могли пользоваться люди без технического образования. Тогда я связался с одним из своих коллег, который без колебаний согласился помочь мне и собрал небольшую команду для создания нашего сайта discovid.ai.

Как ваша команда работала вместе?

Двое моих коллег работали над бэкендом и фронтендом, еще один запустил проект на сервере, а моя девушка разработала отличный дизайн и анимировала наше вступительное видео.

Как участие в команде помогло вам добиться успеха?

Это определенно помогло мне создать более полноценное решение, которое является удобным и доступным для каждого.

Просто для удовольствия

Какова работа вашей мечты?

Меня очень привлекает наука о данных в медицинской сфере, потому что я хочу использовать свои аналитические навыки в значимом проекте, который помогает другим. Думаю, именно это поддерживало меня на протяжении всего конкурса CORD-19 — дело было не в победе, а в том, чтобы использовать свои сильные стороны во благо и внести свой вклад в преодоление этого глобального кризиса.

Мудрые слова

Что вы вынесли из этого соревнования?

Это был очень значимый проект для меня, и по пути я познакомился со многими интересными и вдохновляющими людьми со всего мира. Было здорово видеть, как исследователи со всего земного шара объединились в поисках ответов на вопросы об этой глобальной пандемии, которая затрагивает каждого из нас по-разному и, как ни парадоксально, объединяет нас всех.

Есть ли у вас совет для тех, кто только начинает заниматься наукой о данных?

Просто начните! Я думаю, важно получить практический опыт и научиться работать с различными типами данных, чтобы вы могли легко преобразовывать их в формат, с которым можно работать. Но как студент-математик, я также должен сказать, что не стоит пренебрегать основами, такими как теория вероятностей и статистика, потому что в конечном итоге наука о данных — это наука, поэтому важно иметь интуитивное понимание неопределенности и ограничений различных подходов.

Также я считаю, что всегда важно сначала получить четкое представление о проблеме, которую вы пытаетесь решить, прежде чем применять к ней самые сложные модели машинного обучения.

Вы можете найти победную работу Дэниела для CORD-19 здесь: https://www.kaggle.com/danielwolffram/discovid-ai-a-search-and-recommendation-engine

← Все статьи