Как решить, какую модель использовать? Давайте рассмотрим рабочую нагрузку, развертывание, регулируемые среды и другие критерии для выбора подходящей ИИ-модели.
В ИИ-приложении модель — это обученный компонент, который получает входные данные и выдает сгенерированный результат, такой как текст или структурированные данные. Модели, которые мы рассматриваем, — это большие языковые модели (LLM), способные интерпретировать язык и возвращать текст или структурированные данные (например, GPT, Claude, Llama, Mistral).
Модель может отлично показывать себя в прототипе и при этом оставаться неправильным выбором для продакшена, поскольку сопутствующие требования меняют представление о том, что считать хорошим решением.
Например, проверка безопасности может показать, что запросы не должны пересекать региональные границы, а нагрузочное тестирование может выявить, что модель не укладывается в бюджет времени отклика функции. Стоимость при прогнозируемом трафике и способность команды обслуживать развертывание также могут стать причиной исключения моделей из рассмотрения.
В этой статье мы рассмотрим практические критерии, которые определяют выбор модели. Мы сосредоточимся на соответствии рабочей нагрузке и требованиях к развертыванию, включая ограничения, связанные с регулируемыми средами.
Что должна делать модель
Прежде чем сравнивать модели, нам нужно четкое описание задачи. Высокий результат в тесте на общие способности к рассуждениям не говорит о том, сможет ли модель работать с нашими форматами документов или возвращать аргументы для инструментов, которые принимает наш бэкенд.
Оценочный набор, созданный на основе реальных входных данных, дает нам надежный способ сравнения кандидатов. Каждый тест требует ожидаемого результата или правила оценки, чтобы мы могли оценивать каждую модель по одним и тем же требованиям.
Для каждой модели мы можем задать четыре вопроса:
- Производит ли она полезный и точный результат?
- Может ли она работать с требуемой длиной контекста и языками?
- Соответствуют ли ее структурированные ответы схемам, которые ожидает наше приложение?
- Выбирают ли ее вызовы инструментов правильную операцию и предоставляют ли допустимые аргументы?
Для классификации документов может хватить модели поменьше, в то время как агенту, выбирающему инструменты, могут потребоваться более развитые способности к рассуждениям. Публичные бенчмарки и карточки моделей могут помочь нам найти кандидатов до того, как мы запустим эти тесты. В карточке модели описаны предполагаемые варианты использования и ограничения, а также лицензия и опубликованные результаты оценки. Эти результаты дают отправную точку, в то время как наши собственные входные данные показывают, подходит ли модель для функции, которую мы планируем выпустить.
Где работает модель
Как только мы убедились, что модель справляется с задачей, следующим вопросом становится то, где она будет запускаться. Запуск модели для получения результата называется инференсом, и инфраструктура, которая выполняет эту работу, становится частью решения о выборе.
При использовании размещенного API модели провайдер управляет стеком обслуживания. Модель с самостоятельным хостингом возлагает ответственность за этот стек на нашу команду в облачном аккаунте или локальной среде.
Модель с самостоятельным хостингом может работать в нашем облачном аккаунте или в нашем собственном дата-центре. Когда она работает в нашем дата-центре, развертывание является локальным (on-premises).
Существует четыре распространенных варианта, каждый из которых предоставляет разный уровень контроля и операционной ответственности:
Если мы выбираем самостоятельный хостинг, нам нужен доступ к весам модели (численным значениям, полученным в ходе обучения, которые помогают определять ее результат) по лицензии, разрешающей наше предполагаемое использование. Нам также необходимо подтвердить, что модель работает с ПО обслуживания, которое наша команда может поддерживать, и помещается в доступную емкость графических процессоров при обычной и пиковой нагрузке.
Поскольку развертывание влияет на производительность и стоимость, нам следует сравнивать кандидатов в той конфигурации, которую мы планируем использовать. Размещенный эндпоинт и развертывание той же модели собственными силами могут различаться по времени отклика и общей стоимости при продакшн-трафике.
Выбор моделей в регулируемых средах
Выбор вариантов развертывания становится более специфическим, когда функция обрабатывает регулируемые данные. Применимые правила и оценка рисков нашей организации дают нам конкретные требования к тому, где может выполняться инференс и как должны обрабатываться его данные.
В сфере здравоохранения руководство HHS по HIPAA и облачным вычислениям гласит, что охватываемая организация может использовать облачный сервис для обработки защищенной электронной медицинской информации при наличии требуемого соглашения с бизнес-партнером и мер защиты HIPAA. Организации по-прежнему необходимо понимать облачную среду и провести собственный анализ рисков.
Для брокеров-дилеров руководство FINRA по облачным технологиям гласит, что перенос инфраструктуры в облако не снимает с компании регуляторных обязанностей. Развертывание по-прежнему должно обеспечивать надзор за поставщиками и ведение учета.
Это означает, что нам нужно нечто большее, чем просто модель с хорошей производительностью. Прежде чем использовать ее с регулируемыми данными, мы должны иметь возможность ответить на некоторые дополнительные практические вопросы:
- Где обрабатываются промпты и результаты, и может ли провайдер использовать их для обучения?
- Как данные сохраняются и удаляются, и какие записи о доступе и аудитах мы можем экспортировать?
- Какие контракты регулируют деятельность провайдера и используемых им субподрядчиков?
- Как утверждаются изменения модели и можем ли мы восстановить более раннюю версию?
Сделать окончательный выбор
Как только у нас появился короткий список, соответствующий требованиям к рабочей нагрузке и развертыванию, мы можем сделать окончательный выбор, ответив на четыре вопроса:
- Соответствует ли модель рабочей нагрузке? Модель должна преодолевать порог качества на репрезентативных входных данных и поддерживать возможности, используемые функцией.
- Можем ли мы развернуть ее в пределах требуемого периметра? Ее лицензия и контракты должны разрешать наше предполагаемое использование, а правила работы с данными должны удовлетворять соответствующим политикам.
- Укладывается ли она в бюджет времени выполнения? Время отклика и общая стоимость должны оставаться в пределах бюджета при обычном трафике и пиковых нагрузках.
- Сможем ли мы обеспечить поддержку развертывания? Обязанности должны быть четко распределены, включая то, кто управляет емкостью и изменениями моделей.
В совокупности эти вопросы не позволяют нам выбирать модель исключительно на основе качества. Фиксация ответов также показывает, почему она была выбрана, и дает нам полезную отправную точку при изменении рабочей нагрузки или среды развертывания.
Итоги
Выбор модели начинается с работы, которую она должна выполнять, и того, где может запускаться инференс. Исходя из этого, мы можем сравнить оставшихся кандидатов с бюджетом времени отклика и стоимостью предполагаемого развертывания.
Размещенная модель все еще может хорошо подходить для регулируемой рабочей нагрузки, если ее контракты и средства контроля удовлетворяют требованиям. Когда инференс должен оставаться в пределах управляемой нами инфраструктуры, самостоятельный хостинг может обеспечить необходимый контроль. Правильная модель — это та, которая подходит как для самой функции, так и для среды, в которой нам необходимо ее запустить.
Дополнительную информацию о создании приложений и агентов на базе ИИ с помощью Progress можно найти в следующих ресурсах:
- Платформа разработки агентов | Progress Telerik
- Progress Forge — разработка ПО с помощью ИИ
- Progress Agentic RAG











