Масштаб и глубина влияния ИИ на организацию постоянно растут. Модели и агенты читают внутренние документы, вызывают инструменты, отправляют данные в производственные системы и автономно выполняют многоэтапные рабочие процессы. В то же время новые передовые модели выпускаются еженедельно (а иногда и ежедневно), и большинство команд регулярно заменяют старые модели на новые, запуская различные комбинации моделей параллельно.
Тем временем сообщения о том, что модели совершают неожиданные или вредоносные действия, стали регулярной темой новостей. Для предприятий этот риск стал одним из главных препятствий на пути внедрения ИИ. Командам необходимо знать, когда их рабочие процессы переходят в рискованную зону, и иметь возможность реагировать на это.
Мы уже предприняли шаги по внедрению безопасности в платформу Baseten: запустили Base Labs для проведения открытых исследований в области безопасности, начали сотрудничество с Hugging Face и Goodfire AI для создания нашей инфраструктуры безопасности, а также объединились с NVIDIA для работы над Open Agent Safety Platform. Сегодня мы анонсируем Project Beacon в партнерстве с Goodfire AI, чтобы внедрить проактивные встроенные средства контроля безопасности в процесс вывода моделей.
Риски, с которыми мы работаем
Project Beacon позволит нам двигаться к миру, где безопасность — это не статичная функция и не то, что происходит постфактум. Считывая внутренние активации модели во время генерации, вы можете определить проактивные политики, которые обнаруживают небезопасное событие в момент его возникновения и реагируют на него до того, как результат попадет к пользователю или в инструмент.
Риски безопасности на уровне вывода (inference) принимают разные формы:
- Инъекция промпта: инструкции в документе или результате работы инструмента пытаются перенаправить агента.
Инъекция промпта: инструкции в документе или результате работы инструмента пытаются перенаправить агента.
- Действия вне политики: агент предлагает изменения, которые не были санкционированы пользователем или организацией.
Действия вне политики: агент предлагает изменения, которые не были санкционированы пользователем или организацией.
- Раскрытие конфиденциальных данных: информация о клиентах или компании появляется там, где ее быть не должно.
Раскрытие конфиденциальных данных: информация о клиентах или компании появляется там, где ее быть не должно.
- Киберзлоупотребление: поведение модели вызывает опасения в рабочем процессе, чувствительном к вопросам безопасности.
Киберзлоупотребление: поведение модели вызывает опасения в рабочем процессе, чувствительном к вопросам безопасности.
Каждый случай требует сочетания мониторинга, текстовых проверок, контроля инструментов и анализа. В то время как Goodfire разрабатывает мониторы для конкретных моделей, Baseten связывает их сигналы с системами, которые определяют, как приложение должно реагировать. Внедряя зонды на основе активаций в путь вывода Baseten, мы можем создавать такие продукты, которые иначе были бы невозможны.
Схема архитектуры: мониторы активаций и текста классифицируют каждый запрос, а передовая модель вмешивается только тогда, когда они не согласны друг с другом. Политики для каждого клиента применяются для принятия решения о том, нужно ли запрашивать одобрение, отказать, использовать резервный вариант или зарегистрировать событие для администраторов. Мониторинг работает параллельно с генерацией и не блокирует создание ответа.
Что это значит для клиентов Baseten
Мы работаем над созданием готового решения по безопасности: базовый набор поддерживаемых мониторов и проверок, политики для различных рабочих нагрузок, оповещения и журнал того, что было помечено и как это было обработано. Команды смогут применять свои собственные стандарты для каждой модели с помощью встроенного стека безопасности.
Для предприятий
Команды по безопасности и ИИ-платформам видят открытые передовые модели, которые они хотят развернуть, но им нужны защитные барьеры от инъекций промптов, поведения вне политики компании, раскрытия конфиденциальных данных и необычного использования. По мере роста расходов на вывод (inference) в разных командах, отдельные фильтры и процессы проверки для каждого приложения становится трудно контролировать.
Мы предоставим базовый уровень безопасности, который можно применять централизованно, настраиваемые политики для рабочих нагрузок и четкий отчет о том, что было помечено и как это было обработано.
Для разработчиков
Мы работаем над тем, чтобы события безопасности и средства контроля предоставлялись через те же API и инструменты разработчика, которые используются для вывода в Baseten, чтобы разработчики могли легко реагировать на эти сигналы и создавать более безопасные ИИ-продукты.
Представьте агента по разрешению споров по платежам, который читает сообщения продавца и записи учетной записи, прежде чем предложить возврат средств. Ненадежный контент может перенаправить его; неверное действие может привести к раскрытию данных или переводу денег. При масштабировании проверка каждого шага другой большой моделью увеличивает стоимость и задержку.
Разработчикам нужны своевременные сигналы, которые они могут использовать для выбора правильного ответа — продолжить, исследовать, запросить одобрение или использовать резервный вариант — не теряя контроля над пользовательским опытом. Безопасность становится частью продукта по мере того, как агенты работают дольше и выполняют больше действий.
Что дальше
В течение следующих нескольких месяцев мы планируем выпустить функции безопасности, тесно интегрированные с выводом Baseten, начиная с выбранных моделей и отслеживаемых моделей поведения, и расширяя их до корпоративных средств контроля и инструментов для разработчиков.
Мы стремимся развивать передовые технологии в области безопасности по мере роста потребностей экосистемы. Это включает в себя вывод, обучение, песочницы — и все, что будет дальше. Обеспечение безопасности ИИ становится сложнее по мере масштабирования; каждая новая модель несет свои риски, а агенты расширяют поверхность для сбоев. Project Beacon существует для обеспечения последовательного контроля безопасности для любой модели, рабочей нагрузки и уровня доступа, которые вы используете.
Мы выведем возможности, созданные в рамках Project Beacon, на рынок с небольшим числом первых партнеров. Если средства контроля безопасности важны для вашего бизнеса по мере масштабирования использования ИИ, свяжитесь с нами, чтобы обсудить ранний доступ и партнерство.










