Введение
Сегодня мы запускаем Inference platform — платформу для создания непрерывно самообучающихся ИИ-моделей.
Inference platform — это полнофункциональная платформа, объединяющая мониторинг, оценку, обучение и развертывание в едином продукте. Она создана специально для команд, желающих оптимизировать ИИ-приложения в рабочей среде. Это не инструмент для общих исследований в области ИИ.
Основная идея проста: вместо создания синтетических сред, пытающихся имитировать реальность, Inference platform собирает производственный трафик вашего приложения и использует его для обучения моделей посредством контролируемой донастройки (supervised fine-tuning). Ваши производственные данные — это ваша среда обучения.
Сегодня Inference platform способна обучать специализированные языковые модели, которые соответствуют качеству передовых моделей или превосходят его при стоимости до 95% ниже.
Как работает Inference platform
Inference platform устанавливается в ваш репозиторий как обычный инструмент трассировки LLM. Она работает с существующими провайдерами, совместимыми с OpenAI и Anthropic — просто замените базовый URL и добавьте несколько заголовков запроса. Inference Gateway располагается между вашим приложением и провайдером модели, записывая, анализируя и сохраняя производственный трафик.
Добавьте Inference platform в свой проект одной командой. Из корня вашего проекта:
Эта команда использует ИИ-агента для анализа вашей кодовой базы и внесения изменений, необходимых для маршрутизации запросов через Inference platform с правильными метаданными. После этого вы запускаете свое приложение в обычном режиме. Каждый вызов LLM фиксируется и отображается на панели управления Inference.net.
Для получения дополнительной информации о начале работы обратитесь к нашей документации.
Рабочий процесс Inference platform
Как только трафик начинает поступать, рабочий процесс становится довольно простым:
Создание наборов данных из трафика. Inference platform превращает записанные вами вызовы LLM в наборы данных для обучения и оценки. Реальный трафик означает, что ваши обучающие данные соответствуют фактическому распределению сценариев, с которыми столкнется ваша модель.
Оценка с помощью LLM-as-judge. Нельзя улучшить то, что нельзя измерить. Inference platform помогает создавать наборы оценок, начиная с данных, которые у вас уже есть. Вы устанавливаете базовый уровень производительности для вашей текущей модели, а затем измеряете каждый последующий цикл обучения относительно него.
Обучение. Рецепты (Recipes) в Inference platform предлагают предварительно настроенные правила обучения с базовой моделью, оптимизированными параметрами и вычислительными ресурсами. Платформа берет на себя выбор базовой модели, гиперпараметры и инфраструктуру обучения. Оценки выполняются автоматически до, во время и после обучения для измерения качества.
Развертывание. Обученные модели развертываются на выделенной GPU-инфраструктуре. Переключение вашего приложения на кастомную модель требует изменения всего одной строки кода. Веса модели полностью принадлежат вам; развертывайте их на нашей инфраструктуре или размещайте на собственном частном VPS.
Далее цикл продолжается: Inference platform управляет процессом обучения. Она поглощает свежие производственные данные, генерирует наборы данных для обучения и оценки, запускает задачи обучения и сравнивает полученные модели с производственным эталоном. Когда новые модели готовы, они подготавливаются для финальной проверки и развертывания.
Inference platform в производстве
Стоимость циклов обучения в Inference platform варьируется в зависимости от размера базовой модели, которую вы обучаете, и объема данных, необходимых для обучения. Стоимость запусков обучения варьируется от 25 до нескольких тысяч долларов. Inference platform уже обеспечивает работу кастомных моделей в производственных средах:
- Самообучающиеся модели программирования для проприетарных языков, используемые сотнями инженеров в публичном финансовом учреждении
Самообучающиеся модели программирования для проприетарных языков, используемые сотнями инженеров в публичном финансовом учреждении
- Модели извлечения данных, соответствующие производительности Opus 4.6 с задержкой p50 150 мс при 5% стоимости
Модели извлечения данных, соответствующие производительности Opus 4.6 с задержкой p50 150 мс при 5% стоимости
- Модели оценки калорийности, превосходящие передовые модели по качеству, задержке и стоимости
Модели оценки калорийности, превосходящие передовые модели по качеству, задержке и стоимости
- Модели извлечения HTML-в-JSON, такие как Schematron-8b, используемые некоторыми из крупнейших компаний по веб-скрейпингу в мире
Модели извлечения HTML-в-JSON, такие как , используемые некоторыми из крупнейших компаний по веб-скрейпингу в мире
- Агенты для глубоких исследований, превосходящие текущую границу Парето по соотношению стоимости и точности.
Агенты для глубоких исследований, превосходящие текущую границу Парето по соотношению стоимости и точности.
В ближайшие недели мы поделимся новыми историями о наших клиентах и моделях, которые они обучили с помощью Inference platform.
Inference platform против RL
Доминирующий сегодня подход к пост-тренировке начинается не с того конца. Сначала вы неделями строите среду, которая пытается имитировать реальную работу, с которой столкнется ваша модель после развертывания. Затем вы тратите еще больше времени на создание критериев, ужесточение оценок и попытки помешать модели усвоить неправильные уроки. После обучения вы обнаруживаете, что модель нашла способ оптимизировать оценку, а не работу, и процесс начинается заново.
Это дорого, медленно и хрупко именно так, как ненавидят инженеры: вы можете сделать все правильно в «песочнице» и при этом почти ничего не узнать о том, как система будет вести себя в производстве. ИИ-системы нельзя оптимизировать в вакууме. Если цель — улучшить производственную систему, источником истины должна быть сама производственная среда.
Мы создали Inference platform, потому что считаем, что текущие парадигмы, продвигаемые RL, излишне сложны, малоэффективны и недоступны для большинства команд. Если вы запускаете ИИ-приложение в производстве, вы уже генерируете данные, необходимые для обучения модели передового качества для вашей системы. Инструментов, необходимых для сбора этих данных, оценки и обучения на них без создания среды RL, до сегодняшнего дня просто не существовало в одном месте.
Доступно сегодня
Inference platform доступна в публичной бета-версии уже сегодня. Мы покрываем расходы на обучение и развертывание во время бета-тестирования, поэтому, если вы уже используете приложение или агента в производстве, вы можете бесплатно попробовать полный цикл «наблюдение-обучение-развертывание».
У нас большие планы на Inference platform. Со временем Inference platform возьмет на себя большую часть цикла улучшения, сокращая путь от «живого» трафика до лучшей модели. Если ваша ИИ-система уже работает в производстве, у вас уже есть все необходимое для начала.










