Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Anons grantov na issledovaniya v oblasti bezopasnosti
Dev48

© 2026 · All rights reserved.

Анонс грантов на исследования в области безопасности

Источник: Thinking Machines Lab

Анонс грантов на исследования в области безопасности

Источник: Thinking Machines Lab

Финансирование сообщества для укрепления защиты экосистемы.

25 сентября 2026 г.

Недавно мы выпустили Inkling и Inkling-Small с открытыми весами и объяснили наш подход к безопасности и открытости. Сегодня мы запускаем гранты Tinker в размере до 50 000 долларов США в виде кредитов на исследования безопасности моделей с открытыми весами. Ниже приведены некоторые направления, которые мы считаем перспективными. Этот список намеренно не является исчерпывающим. Если вы работаете над проектом по безопасности, который можно ускорить с помощью дополнительных кредитов Tinker, мы будем рады услышать о вас.

Повышение безопасности открытых моделей

Дифференцированное ускорение защитных возможностей по сравнению с наступательными. Многие возможности имеют двойное назначение: те же навыки в кибербезопасности, которые позволяют модели находить и исправлять уязвимости в руках защитников, могут ускорить эксплуатацию неисправленных систем в руках злоумышленников. Подобные компромиссы возникают в таких областях, как химия и биология. Однако мы предполагаем, что не каждый навык в равной степени способствует обеим сторонам — некоторые возможности (например, сортировка, обнаружение, укрепление защиты) могут быть несоразмерно полезны для защитников, в то время как другие (например, эксплуатация, уклонение) склоняются в сторону злоумышленников. BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems (Zhang et al, 2026), AI Agents Enable Adaptive Computer Worms (Guan et al, 2026). Можем ли мы дообучить модели так, чтобы дифференцированно улучшить защитные навыки при минимальном улучшении наступательных? Прямой эксперимент заключался бы в дообучении модели в сторону защитных навыков с последующим измерением прироста для каждой стороны — разрыва между нападением и защитой в процессе обучения, а не только оценки «сырых» возможностей. Ключевой вопрос заключается в том, отражает ли такой разрыв реальную асимметрию, а не подавление, которое исчезает под давлением злоумышленника, или имитацию слабости, которая сохраняется только в условиях измерения.

Создание классификаторов для опасных данных в масштабе. Обучающие данные могут содержать информацию, которая существенно увеличивает опасные возможности, но выявление этой информации затруднено. Shaping capabilities with token-level data filtering (Rathi and Radford, 2026). Влияние любого отдельного документа или точки данных на последующие результаты трудно предсказать заранее, Magic: Near-optimal data attribution for deep learning (Ilyas and Engstrom, 2025), а создание высококачественных меток часто требует дефицитных знаний в предметной области. Можем ли мы обучить модели фильтрации, которые надежно идентифицируют данные, важные для безопасности, в достаточном масштабе и с высокой полнотой, не отбрасывая при этом большие объемы полезного научного или технического контента? Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs (O’Brien et al, 2026), Enhancing Model Safety through Pretraining Data Filtering (Chen et al, 2025). И можно ли сделать эти классификаторы устойчивыми к перефразированию, обфускации, изменению домена и меняющимся возможностям моделей? Safety Pretraining: Toward the Next Generation of Safe AI (Maini et al, 2026). В конечном счете, самая строгая проверка проводится на последующих этапах и напрямую измеряется при наличии доступа к дообучению: действительно ли фильтрация снижает прирост опасных возможностей и какие вызывающие беспокойство возможности все еще могут быть изучены на данных, прошедших фильтр?

Защита от несанкционированного вмешательства при обучении безопасности. Встроенные средства защиты, изученные во время обучения модели, могут не оставаться стабильными при последующем дообучении. Можно ли разработать меры защиты, которые сохраняются при последующих модификациях, включая состязательное дообучение, направленное на удаление средств защиты, и обычное продолженное обучение, которое может непреднамеренно их стереть? Tamper-Resistant Safeguards for Open-Weight LLMs (Tamirisa et al, 2025), Open Technical Problems in Open-Weight AI Model Risk Management (Casper et al, 2026). Разработка масштабируемых методов состязательного обучения, которые улучшают устойчивость к разнообразным последующим модификациям, является одним из перспективных подходов, где обобщение на стратегии атак, не участвовавшие в обучении, является ключевым тестом на успех. Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities (Che et al, 2025). Понимание того, как устойчивость меняется с масштабом и архитектурой, — еще один важный вопрос, в то время как отрицательные результаты или доказательства невозможности могут помочь установить пределы того, чего могут достичь постоянные меры безопасности.

Понимание режимов сбоев при согласовании (alignment)

Обобщение, связанное с безопасностью, при узком дообучении. Узкое дообучение иногда может приводить к поведению, выходящему далеко за рамки задачи, для которой проводилось обучение. Эмерджентное несоответствие (Emergent misalignment: Narrow finetuning can produce broadly misaligned LLMs (Betley et al, 2025)) — один из ярких примеров, но мы подозреваем, что это лишь частный случай более широкого явления, и мы хотим охарактеризовать это явление напрямую: его граничные условия, свойства масштабирования и механизмы, которые его вызывают. Когда узкое вредоносное обучение обобщается в широкое изменение поведения, и требует ли это намеренно состязательных данных, или это может правдоподобно возникнуть случайно в результате обычного последующего дообучения? Связанный композиционный вопрос: может ли модель отдельно изучить планирование, использование инструментов и соответствующие знания в предметной области, а затем объединить эти части в вызывающее беспокойство поведение, которое никогда не демонстрировалось в сквозном режиме? Понимание того, какие из этих эффектов являются особенностями конкретных настроек, а какие — устойчивыми свойствами дообучения, существенно изменило бы подход к оценке последующего обучения.

Взлом вознаграждения и манипуляция надзором. Прокси-вознаграждения могут создавать реальные режимы сбоев. Оптимизация несовершенного вознаграждения в конечном итоге может привести к предпочтению поведения, которое получает высокие баллы, не достигая при этом намеченной цели. Мы хотим понять, когда возникает взлом вознаграждения, как он меняется с возможностями модели и давлением оптимизации, и могут ли ранние сигналы предсказать его до того, как он станет серьезным. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds (Çağatan and Zhao, 2026). Более тревожные сбои могут включать обучение моделей стратегиям манипуляции или вмешательства в надзор, например, мониторам цепочки рассуждений (chain-of-thought). Ключевой открытый вопрос заключается в том, можно ли обнаружить эти стратегии и переносятся ли они на другие задачи. Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks (Hadida et al, 2026).

Измерение и прогнозирование рисков

Оценка рисков в худшем случае и предельных рисков. Модели с открытыми весами позволяют людям адаптировать ИИ под свои нужды. Дополнительная проблема безопасности заключается в понимании максимального риска, который модель может представлять после выпуска. Как мы можем оценить снижение эффективности механизмов защиты в различных областях, связанных с безопасностью, в зависимости от времени, данных или усилий по оптимизации, затраченных мотивированным злоумышленником? Смежной величиной является предельный риск: какие вредоносные возможности открывает эта модель сверх того, что уже возможно? Сама по себе донастройка (fine-tuning) является здесь естественным стресс-тестом: оценки, основанные на состязательной донастройке, позволяют отличить возможности, которые действительно отсутствуют, от тех, что были лишь подавлены и легко могут быть восстановлены. TamperBench: Систематическое стресс-тестирование безопасности LLM в условиях донастройки и несанкционированного вмешательства (Hossain et al, 2026). Недавние работы по оценке рисков в худшем случае после обучения предоставляют полезные отправные точки, Оценка предельных рисков в худшем случае для LLM с открытыми весами (Wallace et al, 2026), но оставляют форму и границы этого ресурсно-рискового фронтира недостаточно изученными.

Прогнозирование тенденций масштабирования, связанных с безопасностью. Многие вопросы в этой публикации становятся значительно более решаемыми, если дорогостоящие эксперименты можно спрогнозировать на основе небольших запусков. Могут ли измерения при низких бюджетах на постобучение предсказать последующие свойства, связанные с безопасностью, включая рост возможностей, снижение эффективности защиты или взлом системы вознаграждения, по мере масштабирования оптимизации и вычислительных мощностей? В более широком смысле, мы хотим понять, какие тенденции масштабирования, связанные с безопасностью, надежно экстраполируются на возможности модели и бюджет обучения — и где эти тенденции нарушаются. Существующие работы по прогнозированию редких моделей поведения Прогнозирование редких моделей поведения языковых моделей (Jones et al, 2025) и состязательной устойчивости Тенденции масштабирования на основе возможностей для ред-тиминга с использованием LLM (Panfilov et al, 2026) предоставляют полезные примеры более широких возможностей.

Гранты

Ознакомьтесь с требованиями к заявкам, критериями отбора, графиком и полными условиями предоставления услуг в рамках грантовой программы.

← Все статьи