В каждой серьезной области, использующей ИИ, существуют способы его измерения. В программировании это HumanEval и SWE-bench. В медицине — MedQA. В юриспруденции — юридический бенчмарк Harvey; это оценка на основе документов, которая проверяет, справляется ли ИИ с реальными задачами, которые выполняют юристы, а не просто с абстрактными вопросами о праве.
В маркетинге не было ничего подобного.
Без бенчмарка утверждение «этот ИИ хорош в маркетинге» не имеет реального смысла. Любой поставщик может это заявить. Нет общего стандарта, чтобы возразить, и нет способа узнать, действительно ли модель сильна в контент-стратегии или просто лучше создает видимость этого.
Чем дольше вы об этом размышляете, тем больше это заставляет ваш мозг работать, а глаза — задумчиво щуриться.
Это Mark-Bench, маркетинговый ИИ-бенчмарк от Optimizely. И мы здесь, чтобы рассказать, что это такое, как это работает и почему это важно.
Почему маркетинговые бенчмарки сложнее создать, чем кажется
Причина, по которой маркетингового бенчмарка не существовало, заключается не в том, что никто об этом не думал. А в том, что создать его правильно — действительно сложно.
Первая проблема: нет общепринятой карты того, что охватывает маркетинг. В программировании есть четко определенные типы задач. В юриспруденции — устоявшиеся категории документов. Маркетинг же охватывает стратегию бренда, планирование кампаний, SEO, CRO, PR, креативное производство, аналитику, email, выездные мероприятия, платную рекламу, персонализацию... список можно продолжать. Каждый поставщик охватывает разный сегмент. Некоторые фокусируются на рекламе, другие на клиентском опыте, третьи на повседневных рабочих процессах маркетолога. Ничто не охватывает всё от начала до конца.
Вторая проблема: качество в маркетинге субъективно, в отличие от качества кода или права. Фрагмент кода либо компилируется и работает правильно, либо нет. Брифинг кампании оценить сложнее. Вам нужны рубрики — четкие, конкретные критерии — и вам нужно несколько оценщиков, чтобы предпочтения одной модели не стали стандартом.
Третья проблема: бенчмарки можно «взломать». Компании создают модели, чтобы получить высокие баллы в своих собственных тестах. Бенчмарк, разработанный той же командой, которая выпускает модель, — это скорее демонстрация продукта, чем бенчмарк.
Мы создали Mark-Bench, учитывая эти три проблемы.
Что такое Mark-Bench?
Mark-Bench — это стандартизированная оценка производительности ИИ в маркетинговых задачах.
Он постоянно развивается, в настоящее время оценивает более 297 задач и сценариев, 17 функций и 3564 критерия (после сокращения и добавления более строгих из V1), все из которых основаны на опыте реальных маркетологов и разработаны так, чтобы отражать то, что маркетологи делают на самом деле, а не то, что поставщики программного обеспечения хотели бы, чтобы они делали.
Для каждого домена Mark-Bench дает ИИ-агенту реалистичный сценарий: реальный бриф, исходные файлы, которые ему действительно понадобятся (руководства по бренду, стилистические руководства, исходные данные), и четкий формат ожидаемого результата. Затем этот результат оценивается по рубрике из 12–30 критериев, оцениваемой несколькими судьями-LLM (как Claude, так и Gemini), чтобы предпочтения ни одной модели не могли исказить результаты.
Результат: четкая, сопоставимая оценка по моделям и задачам. Вы можете увидеть, какие модели хорошо справляются с какими задачами. Вы можете увидеть, где «обвязка» — то есть система и контекст, в которых работает ИИ — имеет значение. Вы наконец можете выразить числом, что такое «хорошо» в маркетинге.
Как мы это создали и чему научились
Прежде чем вы сможете оценивать маркетинг, вам нужна полная карта того, что он охватывает. Такой карты не существовало в готовом виде. Поэтому команда создала ее самостоятельно, опираясь на четыре различных источника:
ИИ занимался первоначальным извлечением, люди проверяли всё. Этот шаг, как выразилась команда, не подлежал обсуждению.
Прежде чем мы перейдем к тому, как это было создано, позвольте нам быстро представить Прогго Пратика, менеджера по продукту и разработчика Mark-Bench. (Пожалуйста, аплодисменты.)
Для структуры задач Прогго использовал юридический бенчмарк Harvey в качестве структурного ориентира. Подход Harvey — построение оценок вокруг реалистичных документов и брифов задач, а не абстрактных вопросов — хорошо переносится на маркетинг.
Команда начала с 15 доменов, 13 из которых прошли первый отбор. После запуска бенчмарка и анализа результатов они удалили управление данными, объединили один домен с email-маркетингом и добавили креативное производство, PR и коммуникации, а также полевой маркетинг. Теперь в бенчмарке 17 доменов.
Один ранний урок был усвоен быстро: рубрики версии 1 были слишком простыми. Из примерно 7000 отдельных критериев модели прошли более 95%. Реальное различие проявилось только в показателе «все пройдено» (прошла ли модель все критерии в сценарии), который варьировался от 40% до 60% в зависимости от модели. В версии 1.5 были удалены критерии, которые проходили все модели, и заменены более сложными. «Мы продолжали делать это, — говорит Прогго, — пока разрыв между хорошей и плохой моделью не стал четко виден».
Что он измеряет (и почему это различие важно)
Mark-Bench работает двумя способами. Зафиксируйте «обвязку» и переключайте модели, и вы получите производительность между моделями; какой ИИ действительно лучше всего справляется с вашими маркетинговыми задачами. Зафиксируйте модель и переключайте «обвязку», и вы поймете, насколько ваш контекст, промптинг и настройка рабочего процесса выполняют работу. У этого есть стоимостной аспект, но об этом в следующем разделе. 👀
Это второе измерение более значимо, чем кажется. Большинство команд оценивают ИИ-модели изолированно, как будто модель — единственная переменная, которая имеет значение. На практике «обвязка» (инструкции, контекст, инструменты, к которым модель имеет доступ) может изменять результаты так же драматично. Знание того, какая переменная движет производительностью, определяет, куда вы инвестируете.
Шафкат видит гранулярность на уровне задач как ключевой фактор:
Видение «от начала до конца» — это автоматическая маршрутизация моделей. Вместо того чтобы просить маркетологов выбирать правильный ИИ для работы, продукт выбирает за них, основываясь на доказательствах.
Что Mark-Bench говорит нам о стоимости
Выбор правильной модели — это не только вопрос качества, это вопрос стоимости. И цифры здесь значительны.
Никита Бокил, часть продуктовой команды Optimizely, провела прямое сравнение, используя одну и ту же модель в трех разных конфигурациях. Результат: «обвязка» Optimizely работала на 88% дешевле за задачу, чем обращение к «сырой» модели (Opus 5X-High) напрямую — $4.91 за задачу против $40.52 — и при этом показала более высокое качество (67% против 65%). Дешевле и лучше благодаря уровню вокруг модели, а не самой модели.
Это не незначительный прирост эффективности. Это разница на порядок, обусловленная исключительно тем, насколько разумно «обвязка» использует модель; какой контекст она передает, что она направляет в другое место и для чего она вообще пропускает LLM.
Именно здесь данные Mark-Bench на уровне задач становятся практически полезными. Не каждой маркетинговой задаче нужна одна и та же модель — некоторым нужна лишь малая часть мощности. Интеллект заключается в том, чтобы знать, что есть что, и соответствующим образом направлять запросы.
Используя собственный стек ИИ-продуктов Optimizely в качестве иллюстрации того, как этот спектр работает на практике:
Простой запрос в чат-бот: маркетолог спрашивает, что означает метрика, или запрашивает краткое резюме контента. С этим справляется легкая, быстрая модель. Низкая стоимость, почти мгновенный ответ, не требуется тяжелых рассуждений.
Агентская задача: Агент по генерации идей для экспериментов (Experiment Ideation Agent), создающий гипотезы для тестирования на основе результатов вашей текущей программы. Модель среднего уровня с расширенным контекстом и возможностями рассуждения, ориентированная на один четко определенный результат.
Агент рабочего процесса: Агент по составлению брифов для кампаний (Campaign Brief Agent), выполняющий многоэтапную последовательность действий: исследование, структурирование, черновик, проверка. Система распределяет различные этапы между разными моделями. Для этапов планирования используются более мощные модели, а для форматирования результатов — более легкие. Маркетологу не нужно настраивать ничего из этого.
Виртуальные коллеги: Маркетинговый аналитик, выполняющий ночное обнаружение аномалий и отмечающий падение эффективности еще до того, как кто-либо успел войти в систему. Система автономно принимает решения о маршрутизации каждой подзадачи, сопоставляя модель с типом задачи в режиме реального времени. Маркетолог не просил об этом — работа просто была выполнена.
Суть не в том, что дешевле — значит лучше, потому что это не так. Суть в том, что правильная модель для конкретной задачи — это всегда лучше. Виртуальным коллегам, работающим в масштабе и выполняющим сотни подзадач в рамках рабочего процесса, необходим встроенный интеллект маршрутизации. Без него вы либо переплачиваете за простые задачи, либо используете недостаточно мощные инструменты для сложных. Mark-Bench предоставляет нам доказательную базу для правильной настройки этой маршрутизации.
Как точно подметил в своем анализе Никита: маркетологи не должны быть экспертами по токеномике. Система берет это на себя. Mark-Bench — это то, что подсказывает нам, какая модель где должна применяться, используя данные, а не догадки.
Что это значит для тех, кто выполняет работу
Для старшего вице-президента по продукту Кевина Ли последствия выходят за рамки выбора правильной модели. Машиночитаемая рубрика не просто помогает людям делать лучший выбор, она дает ИИ цель, к которой нужно стремиться.
В большинстве современных рабочих процессов с ИИ для улучшения результатов требуется участие человека: он читает результат, решает, что не так, переписывает промпт и пробует снова. Этот цикл дорого стоит и не масштабируется. Рубрика меняет уравнение. Когда критерии качества записаны в форме, которую может проверить машина, система может запускать собственные циклы улучшения — пробовать варианты, сохранять те, что получили более высокие оценки, и отбрасывать остальные.
Что это значит для маркетологов на практике: меньше времени на перефразирование промптов, больше времени на работу, которая действительно требует человеческого суждения.
О честности в этом вопросе
«Подгонка» под бенчмарки — известная проблема в оценке ИИ. Модели дообучаются так, чтобы показывать хорошие результаты в конкретных тестах. Бенчмарк перестает отражать реальную производительность и начинает отражать лишь то, сколько усилий команда потратила на оптимизацию под него. В результате получаются цифры, которые выглядят хорошо, но ничего не говорят.
Команда, работающая над Mark-Bench, прямо заявляет, что не занимается этим. Цель состоит в том, чтобы пропустить каждую модель через один и тот же тест — включая модели, которые Optimizely не создавала, — и опубликовать результаты, которые действительно полезны всем, кто пытается понять, что работает для маркетингового ИИ.
Человеческая проверка — это часть того, как они поддерживают честность. «Вы можете использовать ИИ для создания бенчмарка, но если у вас нет профильных экспертов, проверяющих домены, задачи и рубрики, вы в конечном итоге получите еще больше мусора», — говорит Шафкат. «Именно человеческое суждение в цикле делает бенчмарк хоть сколько-нибудь ценным».
Что дальше
Mark-Bench — это «живой» бенчмарк. Рубрики будут усложняться по мере совершенствования моделей. Новые модели будут тестироваться по мере их появления, включая те, что были выпущены после этой публикации. Результаты будут публиковаться открыто, и мы делаем сам Mark-Bench проектом с открытым исходным кодом: задачи, рубрики, система оценки. Запускайте, проверяйте, разбирайте на части.
Следующая версия уже в разработке. Рубрика будет сложнее, результаты будут другими, и команда поделится ими, когда они будут готовы. В этом, собственно, и смысл.



