Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Chto esli by u gallyutsinatsiy vashego agenta byl byudzhet kak nachat ispolzovat 2
Dev48

© 2026 · All rights reserved.

Что если бы у галлюцинаций вашего агента был бюджет? Как начать использовать SLO для поведения агентов

Источник: Grafana Labs

Что если бы у галлюцинаций вашего агента был бюджет? Как начать использовать SLO для поведения агентов

Источник: Grafana Labs

Как узнать, действительно ли хорош ИИ-агент? Попробуйте применить инструментарий наблюдаемости Grafana Labs к его поведению — это по-настоящему понятный способ оценки качества агентов.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

В Grafana Labs наблюдаемость — это наша профессия. Поэтому, когда мы начали создавать ИИ-агентов, мы вполне естественно применили те же принципы, которые используем для любых систем: измеряй, устанавливай цели и делай надежность предметом точного расчета, а не слепой надежды.

Этот подход привел нас к неожиданно полезному результату. Оказывается, одна из старейших концепций в инженерии надежности — бюджет ошибок — идеально ложится на одну из новейших проблем в разработке ПО: как понять, действительно ли ИИ-агент хорош?

Именно это мы обнаружили, применив наш инструментарий наблюдаемости к поведению агентов. Нам кажется, что это исключительно элегантный способ оценки качества агентов, и мы хотим поделиться им с вами.

Та часть агента, которую вы не видите

У вас могут быть настроены все привычные сигналы: задержка, количество токенов, частота ошибок, трассировки каждого вызова инструментов. И ни один из них не отвечает на главный для агента вопрос: хорош ли он?

Ответ может вернуться за 800 миллисекунд, стоить почти ничего, не выдать ни одной ошибки и при этом быть уверенно и бегло неверным.

Этот пробел имеет критическое значение, потому что любое изменение вашего агента превращается в слепую лотерею, когда вы не можете измерить качество. Изменили промпт и надеетесь на лучшее; переключили модель и скрестили пальцы; выкатили в продакшн и ждете, пока кто-нибудь начнет жаловаться. Это именно те слепые зоны, для устранения которых и существует наблюдаемость.

Превращаем поведение в число с помощью оценок

Поэтому мы измеряем поведение напрямую с помощью оценок — точно так же, как когда-то превратили вопрос «Работает ли сайт?» в простой процент.

В конце концов, именно этим evaluation и является. Вы просите судью — часто другую языковую модель — прочитать диалог, отдельное сообщение или один вызов инструмента и выставить оценку.

Основано ли это на предоставленном контексте или выдумано? Действительно ли агент выполнил то, о чем просил пользователь? Было ли сообщение токсичным? Произошла ли утечка личных данных? Попался ли агент на промпт-инъекцию? Судья выносит вердикт: пройдено/не пройдено или оценку по шкале, и внезапно то, что нельзя было измерить, обретает числовое выражение.

Для некоторых проверок вам даже не нужна модель. Самое скромное регулярное выражение отлично знает, произошла ли утечка ключа API или упоминание конкурента. В Grafana Cloud's Agent Observability простые детерминированные проверки и более изощренные судьи на базе моделей прекрасно уживаются бок о бок.

Стоит сразу оговориться: качество не сводится к единственному числу. «Хорошо» на самом деле означает набор различных паттернов поведения, которые могут давать сбои независимо друг от друга. Агент может работать с идеальным контекстом и при этом тормозить. Он может быть полезным и время от времени токсичным. Он может дать идеальный ответ и незаметно обойтись втрое дороже, чем должен.

Поэтому вместо того, чтобы гнаться за единым усредненным показателем точности, лучше выделить несколько действительно важных для вашего агента поведенческих метрик и установить для каждой отдельное измерение. Обоснованность. Полнота выполнения. Токсичность. Задержка. Стоимость. Каждая характеристика становится самостоятельной метрикой, и каждая получает собственный бюджет.

Вы можете откалибровать судью так, чтобы он оценивал поведение в соответствии с вашими требованиями. Иногда достаточно простого промаха или попадания. В других случаях более информативной будет шкала оценки, и это абсолютно нормально. Например, если вы оцениваете обоснованность по шкале от одного до пяти, просто проведите черту для установления целевого значения: скажем, все, что выше четырех, считается успешным прохождением. В любом случае на выходе вы получаете показатель, с которым можно сверять цель — долю диалогов, преодолевших установленную планку.

Суть в том, что поведение, которое казалось слишком неопределенным для измерений, теперь стало метрикой. Вы сделали качество агента измеримым, и в тот же миг оно оказалось у вас перед глазами, готовое к управлению.

А начать этот путь в Grafana Cloud можно с простого запроса: попросите Grafana Assistant создать оценку для важного для вас поведения.

По мере того как он будет обрабатывать реальные диалоги, вы начнете видеть, как часто ваш агент справляется с задачей.

После этого Assistant создаст и включит правила оценки, специфичные для каждого конкретного агента.

Только лишь числа недостаточно

На этом этапе сказывается опыт работы с наблюдаемостью, ведь мы уже сталкивались с этой ловушкой раньше.

Одинокий показатель качества на дашборде приводит к предсказуемой проблеме. Возможно, вы начнете реагировать на каждое незначительное падение или слишком часто поднимать ложную тревогу. Не успеете оглянуться, как все вокруг тихо научатся игнорировать этот график. У всех нас есть тот самый канал в Slack с предупреждениями, которые никто не читает. Новая блестящая метрика агента легко может превратиться в еще один такой график.

Чему не хватает этого числа, так это решения. Именно это добавляет объектив уровня сервиса, или SLO.

Эта идея проще, чем аббревиатура. Вы берете свои измерения и берете на себя обязательство достичь определенной цели. В данном случае предположим, что вы хотите измерять долю диалогов, которые судья считает выполненными успешно, и устанавливаете цель на уровне 95% за 30 дней. Самое интересное здесь — это остаток. Если вы стремитесь к 95%, оставшиеся 5% — это не сбой. Это бюджет.

Этот небольшой сдвиг меняет восприятие ситуации в целом. Ненадежность до определенного предела перестает быть тем, что нужно искоренять, и становится тем, что можно тратить.

Бюджет — это разрешение, а не давление

Лучшая часть этой идеи кроется не в математике, а в разрешении.

Когда у вас есть остаток бюджета, сигнал понятен: действуйте. Попробуйте амбициозный промпт, протестируйте новую модель или рискните, потому что вы заложили в план небольшую неудачу. Когда бюджет подходит к концу, сигнал меняется с точностью до наоборот: сбавьте обороты с новыми функциями, качеству нужно уделить внимание. Красный свет, зеленый свет — только в роли светофора выступают ваши собственные данные, а не интуиция на совещании.

Есть замечательный фрагмент из одного эпизода подкаста «Grafana's Big Tent», где специалист по SRE называет бюджет ошибок предохранителем. Никто не думает о нем круглыми сутками, говорит он, но он возвращает вас к реальности, когда вы совершаете ошибку. Именно такую атмосферу мы хотим видеть в команде агентов: никакого страха, никаких резких торможений в ту секунду, когда судья зафиксировал колебания качества, лишь спокойное «все в порядке, продолжайте создавать», подкрепленное числом, которое похлопает вас по плечу, когда придет время замедлиться.

Бюджет работает в обе стороны. Прежде чем отправить в продакшн новый промпт или модель, вы можете прогнать их по уже известным вам диалогам и убедиться, что они по-прежнему укладываются в целевые показатели, поэтому изменения, которые незаметно ломают один из аспектов поведения, никогда не дойдут до пользователей. Агентам эта система безопасности нужна больше, чем большинству других программ, потому что давление необходимости двигаться быстро огромно, и так велико искушение просто выкатывать все «на вайбе».

Тихий дрифт — вот о чем стоит беспокоиться

Как только вы начинаете мыслить категориями бюджетов, ваше внимание смещается. Вы перестаете зацикливаться на форме каждого отдельного графика и начинаете следить за тем, с какой скоростью расходуете ресурсы. Этот сдвиг имеет огромно значение именно для агентов.

Резкий всплеск из-за тяжелого дня неудачных диалогов заметен сразу и привлекает к себе внимание. В сравнении с 30-дневным бюджетом он может едва оставить след, и это действительно полезно знать, поскольку спасает вас от паники из-за того, что вы легко переживете.

На самом деле следить стоит за противоположным: за медленным, тихим тлением. За крошечным, неуклонным спадом, когда ни один отдельный разговор не выглядит тревожным, но каждый день качество понемногу утекает. Возможно, какой-то промпт постепенно устарел. Возможно, обновление модели незаметно ухудшило работу в вашем сценарии использования. Возможно, ваши пользователи постепенно начинают просить о другом. Агенты устроены так, что почти скрывают это, поскольку их ответы остаются беглыми и правдоподобными, даже когда они отклоняются от нормы, и никакой простой пороговый фильтр это не поймает. Но бюджет поймает, потому что он измеряет накопление, а не какой-то отдельный момент.

Именно поэтому оповещения на основе бюджета заслуживают доверия. Когда они срабатывают, обычно что-то действительно идет не так, и на это стоит обратить внимание. В мире, который уже устал от шумных оповещений, такое душевное спокойствие дорогого стоит.

Но какую же цель вообще выбрать?

Обычно это следующий честный вопрос: к какому числу вы стремитесь? Хорошо ли выполнять задачи на 85%? Нереально ли на 95%? Это действительно сложнее, чем выбор целевого показателя времени безотказной работы, поскольку интуитивного понимания того, чего можно достичь с помощью агента, меньше.

Вам не нужно брать ее с потолка. Как только ваши оценки проработают достаточно долго, чтобы собрать полезную выборку, попросите Assistant порекомендовать целевые показатели SLO на основе их оценок. В вашей собственной среде Grafana Cloud это даст вам отправную точку, основанную на реальном поведении вашего агента. Затем вы можете попросить Assistant создать SLO, превратив эти измерения в целевые показатели и бюджеты.

Дальше решать вам. Поднимите целевой показатель, если можете позволить себе быть строже, или опустите, если вам нужно больше свободы. Молодой агент, стремительно осваивающий новое пространство, может спокойно смириться с вероятностью 50 на 50 не достичь своей цели, в то время как агенту, работающему с платящими клиентами, может потребоваться лишь 5-процентный шанс на сбой. Суть в том, чтобы делать выбор с открытыми глазами.

Эту часть нам не нужно изобретать заново

Удивительно, но если отстраниться и посмотреть на картину в целом, оказывается, что в этом мало что действительно нового. Команды разработчиков агентов сталкиваются с вопросом, над которым специалисты по надежности ломали голову годами: как двигаться быстро, идти на реальный риск и при этом сохранять доверие людей? Ответ всегда заключался в том, чтобы сделать то, что вас волнует, измеримым, выбрать цель и рассматривать разницу как бюджет, который можно потратить. И этот же подход удивительно хорошо применим к сегодняшнему дню. Единственная новая составляющая — это измерение, и оценки дают нам именно это.

Таким образом, все элементы аккуратно соединяются воедино. Оценки превращают поведение в число, для числа задается цель, а разница становится бюджетом: разрешением на эксперименты, ранним предупреждением о регрессиях и общим языком, на котором могут говорить как продакт-менеджер, так и дежурный инженер. Ничто из этого не требует от вас изобретать новую философию программного обеспечения — нужно лишь применить то, что наблюдаемость уже дала вашему агенту.

Итак, задайте поведению вашего агента числовое значение, установите для этого числа бюджет и затем, в рамках этого бюджета, стройте чуть более свободно. Мы искренне хотели бы услышать, как у вас дела.

От поведения к бюджетам, с небольшой помощью

Все, что мы описали, звучит полезно, но это также звучит как работа. Решите, какое поведение имеет значение. Создайте для него оценки. Следите за результатами. Выберите разумные цели. Превратите эти цели в SLO.

Как мы уже убедились по ходу дела, Assistant может помочь вам собрать эти элементы воедино. Вы можете просто попросить его создать оценки для одного из ваших агентов или для всех сразу. Позвольте этим оценкам поработать какое-то время и сформировать полезную выборку реальных данных. Затем попросите Assistant порекомендовать цели и создать SLO на основе того, что он видит.

Вы выбираете то, что важно для ваших агентов, а Assistant помогает с настройкой. От вашей первой оценки до целей и бюджетов, основанных на реальных разговорах, вы можете начать работу, просто сделав запрос.

Оказывается, даже вашим агентам может пригодиться небольшая помощь со стороны агента.

Grafana Assistant — это самый простой способ начать работу с метриками, логами, трейсами, дашбордами и многим другим в Grafana Cloud. У нас есть щедрый бесплатный тарифный план навсегда и планы для любых сценариев использования. Зарегистрируйтесь бесплатно прямо сейчас!

Теги

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от Grafana Labs

Как мониторить Cypress-тесты с помощью Grafana Cloud
Grafana Labs

Как мониторить Cypress-тесты с помощью Grafana Cloud

Пользовательские метки в Grafana Cloud Synthetic Monitoring: новые обновления для обеспечения согласованности и удобства
Grafana Labs

Пользовательские метки в Grafana Cloud Synthetic Monitoring: новые обновления для обеспечения согласованности и удобства

Мониторинг цифрового опыта (DEM) в Grafana Cloud: запись сеансов, синтетические проверки и ускоренное расследование инцидентов
Grafana Labs

Мониторинг цифрового опыта (DEM) в Grafana Cloud: запись сеансов, синтетические проверки и ускоренное расследование инцидентов

Grafana Alerting: Масштабирование маршрутизации оповещений без увеличения сложности с помощью нескольких политик уведомлений
Grafana Labs

Grafana Alerting: Масштабирование маршрутизации оповещений без увеличения сложности с помощью нескольких политик уведомлений