Ливерморская национальная лаборатория им. Лоуренса (Lawrence Berkeley National Laboratory) — одна из ведущих исследовательских лабораторий Министерства энергетики США, известная своими работами в области физики, химии и материаловедения, отмеченными Нобелевской премией, — управляет одними из самых передовых научных установок на планете. Среди них — Источник синхротронного излучения третьего поколения (Advanced Light Source, ALS), комплекс размером с футбольное поле, который производит исключительно яркие лучи рентгеновского излучения, позволяя исследователям изучать материалы от атомного и молекулярного уровней до целых растений. Приборы ALS, известные как каналы пучка (beamlines), генерируют огромные объемы данных, и поскольку недавняя модернизация установки значительно увеличила их разрешение и скорость, объем данных вырос до масштабов, с которыми ученые уже не могут справиться самостоятельно.
Цифры поражают воображение: установки источников света и нейтронов Министерства энергетики США теперь производят десятки петабайт данных ежегодно — это миллионы гигабайт, что примерно эквивалентно потоковой передаче 2 миллионов часов HD-видео. Этот объем данных накапливался не всегда. Модернизированные детекторы, которые перешли от захвата одного изображения каждые шесть секунд к 100 000 изображений в секунду, означают, что теперь эти установки генерируют на порядки больше данных, чем десятилетие назад, и традиционный ручной анализ просто не успевает за ними.
Проблема выходит за рамки объемов: профильных экспертов не хватает, и они перегружены, а современные эксперименты in-situ, в ходе которых ученые наблюдают за динамическими процессами, такими как химические реакции или разрушение материалов, по мере их возникновения, требуют интерпретации в реальном времени, которую ни одна команда людей не способна обеспечить вручную.
Значительная часть трудностей анализа сводится к одной задаче: сегментации — процессу выявления и проведения точных границ вокруг отдельных структур внутри изображения. В компьютерном зрение сегментация — это то, что лежит в основе всего: от медицинских сканирований, позволяющих отличить опухоли от здоровой ткани, до беспилотных автомобилей, отделяющих пешеходов от дорожного покрытия. В научных исследованиях сегментация — это то, что превращает исходное рентгеновское изображение из массива серых пикселей в размеченную карту значимых структур (клеточных стенок, минеральных зерен, полупроводниковых слоев), которые исследователи могут количественно измерять и сравнивать в ходе экспериментов.
SYNAPS-I и миссия Genesis
В конце 2025 года Белый дом запустил миссию Genesis (The Genesis Mission) — масштабную национальную инициативу под руководством Министерства энергетики, направленную на ускорение научных открытий и технологического лидерства с использованием передового искусственного интеллекта. SYNAPS-I (SYnergistic Neutron And Photon Science – Intelligence) — один из ее флагманских проектов: многолабораторная инициатива под руководством лаборатории в Беркли в партнерстве с национальными лабораториями Аргоннской, Брукхейвенской, Ок-Риджской и SLAC. Ее цель — превратить анализ данных в области нейтронных и рентгеновских исследований из длящегося месяцами узкого места в двигатель открытий в реальном времени, где научная визуализация является одной из главных целей. Нигде это узкое место не ощущается так остро, как в сегментации изображений, где извлечение значимых структур из экспериментальных данных может отнимать у экспертов недели работы для каждого набора данных.
В основе конвейера сегментации SYNAPS-I лежат две базовые модели с открытым исходным кодом, выпущенные Meta: Segment Anything Model 3 (SAM 3) и DINOv3.
Как SAM и DINO преображают научную визуализацию
DINOv3 — это модель компьютерного зрения с самообучением, то есть она изучает визуальные паттерны по сырым изображениям без предварительной разметки человеком. Она превосходно понимает, что представляют собой различные структуры на изображении и где они расположены. SAM выводит это понимание на новый уровень, прорисовывая точные границы вокруг отдельных объектов на изображении — во многом так же, как ученый тщательно обводит структуры вручную, но за секунды, а не часы.
Вместе эти две модели образуют взаимодополняющий конвейер: SAM выдает точные границы на уровне пикселей, в то время как DINO обеспечивает глобальный контекст для идентификации каждой структуры и ее места внутри образца. Команда SYNAPS-I дообучила обе модели на данных научной визуализации, собранных на каналах пучка Министерства энергетики, а затем развернула их на 300 графических процессорах A100 (высокопроизводительных чипах, обеспечивающих работу самых передовых ИИ-систем сегодняшнего дня) в национальных суперкомпьютерных центрах, таких как NERSC. Результат: полностью реконструированный, семантически размеченный 3D-объем, возвращенный ученому, который физически находится у установки канала пучка, готовый к интерпретации прямо во время эксперимента. Общее время обработки: около 15 минут.
Команда SYNAPS-I продемонстрировала этот конвейер на примере острой сельскохозяйственной проблемы — понимания того, как виноградная лоза реагирует на засуху на клеточном уровне. Используя микро-КТ-сканы, собранные на установке Advanced Light Source, конвейер реконструирует 3D-объемы стеблей винограда и автоматически определяет сосуды ксилемы — микроскопические трубки, отвечающие за транспорт воды внутри растения. Отслеживая изменения этих сосудов по мере развития засухи, исследователи получают знания, которые могут способствовать выведению устойчивых к засухе сельскохозяйственных культур и обеспечить решения для устойчивости сельского хозяйства в будущем.
Микро-КТ-скан стебля винограда, сегментированный SYNAPS-I. Голубой цвет: гидратированные сосуды ксилемы; темно-фиолетовый: сухие.
То, что раньше требовало месяца экспертной разметки для каждого временного шага, теперь занимает 15 минут, позволяя ученым изучать динамические биологические процессы со скоростью самого сбора данных.
Почему открытый исходный код имеет значение
Национальные лаборатории хранят предварительные исследовательские данные и модели ИИ на государственной инфраструктуре, а не в сторонних облачных сервисах. Эта работа должна управляться на защищенных платформах в процессе ее выполнения. Подход Meta с открытым исходным кодом делает это возможным. Команда SYNAPS-I может загружать, дообучать и развертывать SAM и DINO в своих собственных защищенных вычислительных средах, адаптируя модели, изначально обученные на природных изображениях, к научным областям, для которых они никогда не проектировались.
Объединяя 60 исследователей из пяти национальных лабораторий, проект SYNAPS-I строит будущее, в котором пользовательские объекты функционируют как интеллектуальные платформы для открытий — где ИИ не просто быстрее обрабатывает данные, но и помогает ученым генерировать гипотезы, рекомендует следующие эксперименты и передает знания между установками, чтобы прорыв на одном канале пучка приносил пользу исследователям на всех остальных. По мере того как Genesis масштабируется от пилотных проектов до полноценных программ, эта основа с открытым исходным кодом призвана ускорить совершение открытий в рамках расширяющегося круга национальных приоритетов.
На недавнем конвенте Trillion Parameter Consortium заместитель министра энергетики США Дарио Гил (Dario Gil) отметил потенциал этих усилий.
«Бесшовно объединяя искусственный интеллект, перечищенные вычисления и экспериментальные системы, SYNAPS-I анализирует данные по мере их поступления и направляет эксперименты в режиме реального времени, заменяя медленные ручные шаги адаптивным автоматизированным принятием решений, — заявил он. — Это сокращает время открытий с дней до мгновений и создает непрерывную, самосовершенствующуюся модель науки, которая будет иметь важное значение для реализации полного потенциала миссии Genesis».
Наши последние обновления — прямо в вашем почтовом ящике
Подпишитесь на нашу рассылку, чтобы быть в курсе новостей Meta AI, мероприятий, прорывов в исследованиях и многого другого.










