Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem langsmith fine tuning
Dev48

© 2026 · All rights reserved.

Представляем LangSmith Fine-Tuning

Источник: LangChain

Представляем LangSmith Fine-Tuning

Источник: LangChain

LangChain представляет LangSmith Fine-Tuning и mithtune — интерфейс командной строки (CLI), созданный для пост-тренировки моделей. Обучайте специализированные модели, не создавая конвейеры данных вручную.

25 сентября 2026 г.

Сегодня мы запускаем LangSmith Fine-Tuning и smithtune — CLI, который помогает командам превращать траектории LangSmith в специализированные дообученные модели для своих агентов. Он управляет всем процессом дообучения через один интерфейс: создание и подготовка наборов данных из траекторий LangSmith, обучение с помощью Fireworks или Baseten и оценка с помощью LangSmith. Вы можете запускать smithtune напрямую или работать со своим агентом-кодировщиком для выполнения команд и проверки результатов.

smithtune создан для пост-тренировки моделей. В настоящее время он поддерживает контролируемое дообучение (SFT), которое обучает модель на примерах правильного поведения. Вы предоставляете модели входные и выходные данные, и она учится, обновляя веса модели, чтобы имитировать это поведение. Данные траекторий LangSmith разработаны для поддержки SFT, а smithtune помогает превратить эти траектории в полезные обучающие данные.

Это дает командам возможность обучать специализированные модели, не создавая конвейер данных вручную. Модель, обученная на ваших примерах, часто может работать так же хорошо или лучше, чем универсальная передовая модель в конкретных задачах, зачастую с меньшими затратами и задержками.

Попробуйте LangSmith Fine-Tuning на GitHub и позвольте вашему агенту-кодировщику управлять процессом дообучения от начала до конца, установив навык smithtune из репозитория.

Одним из главных факторов повышения эффективности дообучения является выбор данных. С запуском smithtune стало проще замкнуть этот цикл — от курируемых производственных трассировок в LangSmith до управляемого обучения и развернутой модели на Fireworks. Команды могут беспрепятственно переходить от данных к обучению и развертыванию, не создавая при этом инфраструктуру. Это путь, который мы рады строить вместе с LangChain.
– Пранав Джайн, ведущий специалист по продукту в Fireworks
Интеграция smithtune с Baseten Loops позволяет командам легко переходить от сбора данных к проведению экспериментов по дообучению за считанные минуты. Разработчики могут постоянно собирать и курировать более качественные данные для создания лучших моделей с течением времени благодаря полностью управляемой инфраструктуре обучения, которую предоставляет Loops, что позволяет им сосредоточиться на проектировании для своих важнейших клиентских сценариев.
– Аарон Эллис-Блур, прикладной исследователь в Baseten

Траектории агентов и пост-тренировка

Прежде чем погрузиться в возможности, предоставляемые smithtune, давайте сначала обсудим траектории агентов.

Траектория — это упорядоченная последовательность сообщений, вызовов инструментов и результатов инструментов, которая показывает, как агент справлялся с задачей. LangSmith собирает эту последовательность из трассировки или потока, приводит поддерживаемые форматы сообщений к общему представлению, сохраняет определения инструментов и удаляет дублирующуюся историю.

Формат траектории LangSmith был разработан с учетом пост-тренировки. Для SFT модели-ученику нужен именно тот контекст, который был у модели-учителя, когда она выдала успешный результат. В сложных долгоживущих агентах контекст доступности инструментов часто меняется по мере работы агента (например, отложенная загрузка инструментов), и простое экспортирование списка сообщений теряет этот нюанс. Формат траектории LangSmith точно записывает то, что модель видела на каждом этапе, поэтому smithtune может связать каждое действие с его истинным контекстом.

smithtune использует траектории на протяжении всего рабочего процесса. Вы курируете успешные примеры траекторий, подготавливаете их для выбранной модели и обучаете на их записанных ответах и вызовах инструментов. Траектории, исключенные из обучающей выборки, обеспечивают контекст и эталонные действия для оценки.

Пошаговое руководство

Создайте свой набор данных

Набор данных содержит «золотые» траектории, которым будет соответствовать целевая модель. Эти данные являются основой для контролируемого дообучения.

При создании набора данных с помощью smithtune есть несколько ключевых этапов:

  • Извлечение набора данных: smithtune извлекает траектории из проекта трассировки LangSmith в локальный каталог DIR с дополнительными фильтрами.
  • Разметка трассировок: smithtune работает с людьми (и их агентами) для определения характеристик «хороших» трассировок, создания рубрикатора на этой основе, а затем отправляет совет агентов для проверки и фильтрации траекторий, которые являются хорошими кандидатами для SFT.
  • Хранение постоянного набора данных: smithtune гарантирует, что любые данные, используемые для обучения, могут быть проверены позже как постоянный артефакт. Он загружает согласованный набор золотых траекторий в набор данных LangSmith для обучения и оценки.

В процессе smithtune обрабатывает такие детали, как:

  • обеспечение совместимости траекторий с выбранной моделью путем фильтрации трассировок, длина которых превышает заданную длину последовательности
  • разделение данных на обучающую/валидационную/тестовую выборки для последующей оценки

Обучение модели

Перед началом обучения smithtune plan помогает людям просмотреть свои настройки, такие как выбранная модель, количество примеров для обучения и гиперпараметры, такие как скорость обучения, размер пакета и количество эпох.

Вы можете настроить эти параметры перед запуском smithtune train, чтобы начать процесс дообучения. smithtune отправляет задание в управляемую SFT Fireworks или Baseten Loops, которые поддерживают обучение LoRA на ваших подготовленных траекториях. С вашей стороны не требуется выделение GPU или управление инфраструктурой обучения. Во время обучения smithtune также проверяет производительность на валидационном наборе и выбирает сохраненную контрольную точку с наименьшими потерями при валидации.

Оценка результата

После завершения обучения запустите smithtune evaluate, чтобы сравнить выбранную контрольную точку с базовой моделью.

smithtune использует встроенную оценку воспроизведения для тестирования базовой модели в сравнении с дообученной. Модели оцениваются по способности выполнять действия из золотой траектории, а судья оценивает эти прогнозы в сравнении с истинными записанными примерами.

CLI возвращает ссылку на сравнение в LangSmith, результаты появляются по мере выполнения оценки. Вы можете сравнивать оценки, проверять отдельные ответы и выбор инструментов, а также видеть, где дообучение помогло или привело к регрессии.

Развертывание вашей модели

Если вы довольны результатами оценки, используйте smithtune deploy, чтобы развернуть настроенную модель и подключить ее к своему приложению.

Если результаты не те, что вы ожидали, уточните набор данных или настройте параметры обучения, а затем снова обучите и оцените. Вы можете просмотреть сравнение в LangSmith вместе со своим агентом-кодировщиком, чтобы определить, какие ответы или выбор инструментов требуют доработки.

Результаты практического применения

Чтобы оценить качество нашего потока smithtune, мы применили его к двум часто используемым агентам в LangChain:

  • Engine анализирует трассировки агентов, чтобы найти сбои и сгруппировать связанные проблемы. Используя упрощенную версию одного из агентов в Engine, мы проверили, может ли SFT улучшить его способность выявлять и организовывать эти проблемы.
  • OpenSWE Review проверяет изменения кода в наших реальных репозиториях. Мы проверили, может ли SFT сохранить качество проверки, сокращая при этом работу, необходимую для поиска ошибок.

Engine: более высокая производительность задач за счет специализации

Мы отобрали набор хороших траекторий и использовали их для дообучения базовой модели Kimi K3. Базовая модель Kimi уже была сильной, но мы исчерпали свои возможности по ее улучшению или улучшению GPT-5.6 Sol с помощью инженерии подсказок. Дообученная модель показала результаты значительно выше, чем базовая Kimi и GPT-5.6 Sol, на подмножестве IssueBench, нашем внутреннем бенчмарке для обнаружения и группировки проблем.

Обзор OpenSWE: сопоставимое качество при меньшем числе вызовов

Мы также протестировали модель Qwen-3.8-27B на внутреннем тестовом наборе реальных пулл-реквестов, который используется для оценки качества код-ревью и обнаружения багов. В этом сравнении метод SFT увеличил показатель F1 с 48,9% до 53,7%, при этом количество вызовов модели сократилось на 29,8%, а количество запросов к инструментам — на 29,4%.

Более ранний и менее избирательный обучающий набор привел к снижению метрики F1 после SFT. Затем мы вернулись к нашему конвейеру отбора данных и добавили этап проверки для каждого трейса (Trace), стремясь передискретизировать трейсы, в которых агенты действительно предполагали наличие потенциальных проблем.

Практическая польза заключается в сопоставимом качестве ревью при меньшем количестве вызовов модели и инструментов. Это означает более низкую стоимость одного ревью и более высокую скорость проверки пулл-реквестов.

Рекомендации по дообучению (post-training)

Когда SFT имеет смысл

SFT особенно полезна, когда ваше приложение выполняет повторяющиеся задачи и у вас есть примеры того, как оно должно себя вести. Ищите устойчивые паттерны, которым должна научиться модель, такие как следование рабочим процессам, использование результатов работы инструментов для принятия дальнейших решений и проверка собственных результатов.

Мы рекомендуем командам начинать с проектирования окружения (harness engineering), чтобы понять, обеспечивает ли улучшенная обвязка хорошую производительность. Если агенты по-прежнему совершают повторяющиеся ошибки в задачах, и у вас есть траектории, демонстрирующие правильное выполнение этих задач, то SFT — отличный кандидат для тестирования.

Отбор данных

Мы постоянно убеждаемся, что самые успешные запуски дообучения получаются благодаря инвестициям времени в отбор данных для обучения. smithtune напрямую помогает пользователям анализировать свои данные с помощью агентов, и мы видим, что привлечение экспертов предметной области к работе с агентами для проверки трейсов под SFT повышает вероятность успешного дообучения.

Начало работы с LangSmith Fine-Tuning

Инструмент LangSmith Fine-Tuning теперь доступен в режиме публичного бета-тестирования. Для начала работы вам понадобятся:

  • Учетная запись LangSmith с трейсами от вашего агента
  • API-ключ для Fireworks или Baseten
  • Интерфейс командной строки smithtune

Попробуйте smithtune на GitHub и расскажите нам, что вы бы хотели увидеть в следующих версиях. Мы будем рады вашим отзывам по мере совершенствования процессов дообучения в LangSmith.

Начните работу с LangSmith Fine-Tuning на GitHub.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактовПресса
OpenAI

В течение нескольких месяцев рои агентов OpenAI атакуют онлайн-базы данных в поисках малоизвестных фактов

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержекПресса
Tesla

Tesla наконец переходит к электрификации грузоперевозок после десятилетия работы и задержек

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в НевадеПресса
Tesla

Tesla готовится к масштабному производству тяжелых грузовиков Semi с открытием завода в Неваде

Ещё от LangChain

Создание производственных агентов с помощью Jev и LangGraph
LangChain

Создание производственных агентов с помощью Jev и LangGraph

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов
LangChain

LangSmith Custom Apps: создавайте пользовательские интерфейсы для данных ваших агентов

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое
LangChain

Новое в LangSmith: Engine v2, Managed Deep Agents, дообучение (Fine-Tuning) и многое другое

Новое в LangSmith Engine: red teaming и автоматизированное тестирование
LangChain

Новое в LangSmith Engine: red teaming и автоматизированное тестирование