Дэн Бикель (Dan Bikel) | 1 октября 2026 г.
Размышляя о прозрачности в сфере ИИ, многие организации пристально изучают саму используемую модель и создаваемые ею результаты. Это хорошее начало, но в нем есть «слепые зоны», которые могут дать о себе знать, если ИИ предпримет действия или выдаст результаты, наносящие ущерб вашей безопасности, бизнесу или бренду. Предприятия уже вышли за рамки простого генеративного ИИ и теперь работают с агентными системами ИИ, которые взаимодействуют с самыми разными источниками данных, подключенными сервисами и автономными рабочими процессами.
В основе агентов лежат модели, однако они действуют на базе гораздо более крупных систем, состоящих из промптов, инструментов, поиска данных (retrieval), памяти, разрешений, защитных механизмов (guardrails) и других агентов. Прозрачность агентного ИИ должна простираться от базовой языковой модели до всей системы, в которой функционирует агент.
Прозрачность модели необходима, но ее недостаточно
Когда мы говорим о прозрачности модели, мы имеем в виду нечто большее, чем просто ознакомление с карточкой модели, поставляемой вместе с ней. Предприятиям необходим аналог отчета механика: полезная информация об архитектуре модели, обучающих данных, оценках, ограничениях и предполагаемом поведении.
Последний Индекс прозрачности базовых моделей Стэнфордского университета (Stanford Foundation Model Transparency Index) предлагает полезную проверку реальностью.
В ходе оценки в декабре 2025 года Стэнфорд оценил 13 крупнейших разработчиков базовых моделей по 100 индикаторам прозрачности. Средний балл составил 41 из 100, что на 17 пунктов ниже по сравнению с предыдущим изданием. Модель Palmyra X5 от WRITER набрала 72 балла — второй по величине результат в исследовании после Granite 3.3 от IBM с 95 баллами.
Это различие имеет значение, поскольку прозрачность модели не тождественна ее производительности. Стэнфордская методология проверяет, раскрывают ли разработчики информацию в таких областях, как обучающие данные, оценка моделей, сценарии использования, поддерживаемые протоколы агентов и предполагаемое поведение. В отчете Стэнфорда о компании WRITER, например, отмечаются раскрытие информации о сборе данных, тот факт, что клиентские данные не используются для обучения Palmyra X5, поддержка протоколов MCP и A2A, а также оценки возможностей модели.
Для нас более широкий принцип важнее самого рейтинга. Предприятия должны ожидать от поставщиков моделей документирования того, как их модели создаются, тестируются и как они должны себя вести. Мы считаем, что это обязательство приобретает все большую важность по мере того, как модели становятся все более мощными и внедряются в агентов, способных совершать действия с реальными последствиями.
Но прозрачность модели — это фундамент, а не вся система целиком. Карточка модели сообщает вам, чем является модель. Она не говорит о том, что будет делать агент, созданный на базе этой модели, то есть какие инструменты он может вызывать, к каким данным получать доступ, какие защитные механизмы его ограничивают или какой контекст формирует его решения. Для получения этого более широкого обзора вам необходима структура (framework).
Агентский пакт (The Agentic Compact): структура для обеспечения прозрачности агентных систем
Агентский пакт — это разработанная WRITER структура для оценки систем агентного ИИ. Она расширяет прозрачность от базовой языковой модели до особенностей проектирования и работы агента, охватывая выбор модели, окружающую модель систему, формирующий поведение контекст и свидетельства действий агента. Пакт охватывает шесть областей: системную безопасность и изоляцию, фундаментальную прозрачность, действенную объяснимость, непрерывную наблюдаемость, развитие и обучение персонала, а также мандат человека. Данная статья посвящена фундаментальной прозрачности: видимости, которая необходима предприятиям до того, как агент будет запущен в производство.
Для руководителей предприятий Пакт ставит четыре вопроса:
1. какую модель использует этот агент и почему?
Правильная модель зависит от задачи: качество рассуждений, задержка (latency), стоимость и требования безопасности сужают круг выбора, и предприятиям требуется достаточно информации о возможностях и ограничениях модели, чтобы понимать, подходит ли она для поручаемой ей работы.
2. Что за «обвязка» окружает эту модель, позволяя ей или ограничивая ее в действиях?
Обвязка (harness) — инструкции, инструменты, разрешения и защитные механизмы вокруг модели — определяет, что агент может и чего не может делать. Две системы, использующие одну и ту же модель с разной обвязкой, не являются в полной мере одним и тем же агентом.
3. Какой контекст формирует его поведение?
Агенты опираются на внутренние знания, бизнес-правила, данные клиентов и постоянную память. Происхождение этого контекста (то есть откуда он взялся, является ли он актуальным и кто может его исправить) становится столь же важным, сколь и происхождение самой модели.
4. Какие у нас есть свидетельства о действиях и решениях, принимаемых самой моделью, и почему?
Предприятиям требуется гораздо больше, чем просто карточка модели с описанием основной большой языковой модели (LLM). Предприятиям нужны доказательства на уровне действий: логи о том, что сделал агент, какие инструменты он вызывал, к каким данным получал доступ и почему он принял именно такие решения.
Прозрачность должна выходить за рамки простого раскрытия информации, обеспечивая видимость, необходимую для принятия обоснованных решений и сохранения контроля на всех этапах — от выбора модели до подбора обвязки, подключения данных и шагов, приведших к финальному результату.
Какую модель использует этот агент и почему?
Независимо от результатов бенчмарков или броских маркетинговых кампаний, не существует универсальной «лучшей» модели. Есть лишь модель, наиболее подходящая для конкретной задачи и набора ограничений.
Для одной рабочей нагрузки на первый план может выходить качество рассуждений. Для другой критическим ограничением может стать задержка. В высокоинтенсивном рабочем процессе решающим фактором может оказаться стоимость. В регулируемых средах требования к безопасности и обработке данных способны еще больше сузить круг вариантов.
Агентский пакт начинается с выбора модели и ее происхождения. Руководители должны понимать, что лежит в основе агента, что известно о возможностях и ограничениях этой модели и подходит ли она для поручаемой ей работы.
Когда мы представили Palmyra X6, мы также обновили платформу WRITER, чтобы команды могли работать с несколькими моделями, а не ограничиваться семейством Palmyra. Palmyra X6 остается моделью по умолчанию, но администраторы могут включать модели от других провайдеров, кроме того, предприятия могут использовать модели через такую инфраструктуру, как AWS Bedrock, Microsoft Azure и NVIDIA NIM.
Хотя платформа, позволяющая выбирать между моделями, — это отличный старт, этого недостаточно. Предприятиям требуется достаточно информации, чтобы понимать, почему эта модель подходит для данной рабочей нагрузки и не справилась ли бы другая модель с работой более эффективно.
Этот последний фактор приобретает все большую важность по мере того, как расходы на ИИ растут, а токеномика, подобно затратам на облачные выслуги в прошлом, становится отдельной дисциплиной. Каждый топ-менеджер, в ведении которого находится бюджет на ИИ, — хочет он того или нет — также начинает отвечать за бюджет на токены.
Самая дешевая модель не обязательно является самым дешевым способом выполнения задачи. Более дешевая модель, которой требуются повторяющиеся попытки, вызовы большего числа инструментов или которая потребляет значительно больше токенов, может в итоге обойтись дороже в расчете на выполненную задачу, чем более мощная модель. И наоборот, бессистемное использование самой дорогой фронтирной модели может превратить рутинную работу в неоправданно большой счет.
Недавняя статья моего коллеги Матана-Пола Шетрита (Matan-Paul Shetrit) по токеномике проводит здесь полезное различие: предприятиям следует оптимизировать экономику выполненной работы, а не рассматривать интеллект модели или стоимость токена как изолированные метрики. Поддержка нескольких моделей дает компаниям возможность действовать на основе того, что они узнают о производительности, стоимости, безопасности и эффективности. Это также позволяет избежать привязки к одному поставщику (vendor lock-in), гарантируя, что данные и рабочие процессы, созданные в ходе непрерывного внедрения ИИ в компании, не будут изолированы у единственного провайдера.
Что окружает модель?
Выбор правильной модели — это лишь часть того, что имеет значение.
Одна и та же модель может вести себя совершенно по-разному в зависимости от ее «обвязки» (harness): получаемых ею инструкций, инструментов, которые она может вызывать, систем поиска и памяти, питающих ее информацией, прав, в рамках которых она работает, и защитных механизмов, ограничивающих ее действия.
Именно эта обвязка все чаще определяет большую часть производительности агента.
Когда мы выпустили Palmyra X6, мы также представили масштабные обновления для обвязки агентов WRITER (WRITER Agent harness). Модель и агент разрабатывались совместно, а сама обвязка была спроектирована так, чтобы улучшить планирование и выполнение сложной многоэтапной работы. Инженерная команда WRITER опубликовала технический документ, показывающий, что модернизированная система снизила затраты и повысила скорость выполнения задач для всех протестированных моделей.
Если в двух системах используется одна и та же базовая модель, но она окружена разными промптами, инструментами, защитными механизмами и логикой оркестрации, они не являются в значимом смысле одним и тем же агентом. Следовательно, руководителям предприятий необходима прозрачность не только в отношении того, какая модель задействована, но и того, что ее окружает. В этом и заключается разница между простой прозрачностью моделей и полной прозрачностью системы.
Если ваша модель — это двигатель автомобиля, то обвязка — это механизм, который превращает ее базовые возможности в инструмент, подходящий для текущей задачи. Следующий вопрос, который необходимо рассмотреть: помимо двигателя и его механизмов, что служит топливом? Это требует изучения информации, которая через него проходит.
Какой контекст формирует поведение агента?
Модель — это лишь один из источников интеллекта внутри корпоративного агента.
Агенты все чаще опираются на внутренние знания компании, бизнес-правила, данные клиентов, инструкции, предыдущую работу и постоянную память. По мере того как этот контекст становится богаче, его происхождение (провенанс) приобретает такое же значение, как и происхождение самой модели.
Манифест определяет три базовых вопроса, на которые предприятия должны уметь отвечать: К каким источникам знаний агент имеет доступ? Как эта информация обрабатывается и защищается? И как система решает, какая информация относится к рабочему контексту агента?
Недавний запуск Enterprise Brain от WRITER развивает эту идею дальше. Enterprise Brain — это управляемый контекстный слой, предназначенный для сбора институциональных знаний, логики принятия решений, стандартов бренда и комплаенса, а также актуальных бизнес-данных, с последующим предоставлением этого контекста для команд и агентов.
Память агента (Agent Memory) — это система, которая создает, управляет и извлекает сохраненную информацию для каждого агента, оснащенного Enterprise Brain. Инженерный подход WRITER далек от того, чтобы рассматривать память лишь как хранилище индивидуальных предпочтений, он делает акцент на той рабочей информации, которая больше всего необходима нашим корпоративным клиентам: задачах, требованиях, результатах, командных соглашениях и организационных знаниях, накапливаемых с течением времени.
Добавление такой системы, как Enterprise Brain с Agent Memory, меняет требования к прозрачности. Теперь нам нужно уметь отвечать на следующие вопросы:
- Откуда взялся этот контекст?
- Является ли он актуальным?
- Это персональные знания, знания на уровне команды или организации?
- Кто может исправить его или заменить?
- Каким агентам разрешено его использовать?
- Что происходит, когда два источника сохраненного контекста противоречат друг другу?
Мощная модель, работающая на устаревшем, непрозрачном или некорректном контексте, по-прежнему остается ненадежной системой. В агентном ИИ провенанс контекста становится столь же важным, как и провенанс модели.
Заключение
Прозрачность ИИ раньше в основном сводилась к моделям и их базовому дизайну. Сегодня масштаб того, что предприятию необходимо наблюдать и понимать, стал шире и глубже, охватывая все, что окружает основную LLM, данные, с которыми она работает, а также другие модели и системы, хранящие и извлекающие данные за пределами основной LLM.
Предприятиям необходимо знать, какая модель используется для конкретной задачи и почему. Им нужна прозрачность в отношении набора промптов, инструментов, разрешений и защитных механизмов вокруг нее. Им нужно понимать, какой корпоративный контекст и память формируют ее поведение. Наконец, им нужна значимая информация о самой модели.
Цель состоит в обретении автономности через прозрачность: возможности инспектировать систему, сравнивать альтернативы, понимать, что лежит в основе ее поведения, и делать иной выбор при необходимости.
— Ден Бикель (Dan Bikel) возглавляет направление ИИ в WRITER. Он руководил командой, создавшей нашу новейшую базовую модель Palmyra X6, сыграл ключевую роль в разработке подхода WRITER к агентной памяти и руководит командой, проводящей передовые исследования для создания продуктов и услуг как сейчас, так и в будущем. Ранее Ден работал старшим техническим руководителем в организации GenAI в Meta, где возглавлял команду, создавшую агентную память и новые методы для контекстуального интеллекта. До этого Ден был научным сотрудником в Google Research, где занимался новыми методами приобретения и организации знаний, обнаружения новых сущностей, ответов на вопросы, синтаксического анализа запросов, транскрипции речи для видео на YouTube и многим другим.







