Open Jarvis: заставляем локальные LLM работать в качестве агентов

Источник: Lambda

Open Jarvis: заставляем локальные LLM работать в качестве агентов

Источник: Lambda

Запуск модели с открытыми весами — это лишь половина дела. Вторая половина — это обвязка: то, что говорит модели, что делать, какие инструменты использовать и как учиться на своих ошибках.

•Обновлено: 30 сентября 2026 г.

Запуск модели с открытыми весами — это лишь половина дела. Вторая половина — это обвязка (harness): то, что говорит модели, что делать, какие инструменты использовать и как учиться на своих ошибках.

Проект Open Jarvis начался с вопроса: что сегодня мешает персональному ИИ работать локально? Модели с открытыми весами выпускаются постоянно, так почему же они не позволяют людям владеть собственным интеллектом?

Если использовать модель с открытыми весами в стеке, настроенном под облачную модель, производительность падает. Именно эту проблему решает Open Jarvis.

В статье это показано наглядно. Замените передовую облачную модель в агентской системе на модель с открытыми весами объемом 9 млрд параметров, и производительность снизится. В тесте PinchBench, который измеряет эффективность LLM в качестве «мозга» агентов OpenClaw, точность упала с 96,0% у Claude Opus 4.6 до 62,3% у Qwen3.5-9B. Если перенастроить спецификацию под локальную модель с помощью Open Jarvis, точность восстанавливается до 88,4%, устраняя 77% разрыва только за счет настройки обвязки — еще до применения какой-либо оптимизации поиска спецификаций.

Падение производительности происходит из-за того, что обвязка оптимизирована под другую модель. Именно эта система «обвязка/модель» превращает языковую модель в агента, способного планировать встречи, писать и запускать код, искать информацию в сети, управлять файлами и запоминать контекст между сессиями. Без этого локальные модели не могут полностью раскрыть свой потенциал.

Что на самом деле делает Open Jarvis

Open Jarvis построен на основе спецификации, уникальной для конкретной модели и оборудования, на котором она работает. Спецификация содержит пять независимо настраиваемых примитивов, каждый из которых может быть перенастроен под любую выбранную модель. Учитывая выбранные «Интеллект» (Intelligence) и «Движок» (Engine), поиск спецификаций под управлением LLM использует передовую облачную модель для диагностики сбоев в развернутой спецификации и предлагает правки по всем четырем редактируемым примитивам: «Интеллект», «Движок», «Агент» и «Инструменты и память», принимая только те изменения, которые повышают производительность, не вызывая регрессий в других местах.

  • Интеллект. Какая модель запущена, с какой квантованием, с какими настройками генерации — например, переход с модели 9B на 35B.
  • Движок. Среда выполнения вывода (Ollama, vLLM, llama.cpp) и ее аппаратные настройки. Mac Mini и рабочая станция NVIDIA могут вписаться в эту логику; меняется только этот уровень.
  • Логика агента. Цикл рассуждений, системные промпты, примеры few-shot и стратегия вызова инструментов. Именно здесь локальные модели требуют наибольшей перенастройки; облачные промпты часто предполагают наличие возможностей, которых нет у меньших моделей.
  • Инструменты и память. Что может делать агент: поиск в интернете, выполнение кода, доступ к календарю и электронной почте, ввод-вывод файлов и постоянная память между сессиями. В задачах исследования и вызова инструментов правки инструментов составляют наибольшую долю принятых улучшений при оптимизации спецификаций.
  • Обучение. Как система улучшается с течением времени посредством LoRA-дообучения, оптимизации промптов или автоматизированного поиска спецификаций под руководством передовой модели-учителя.

Почему разделение ответственности — ключевой инсайт

Многие агентские обвязки создаются вокруг конкретной модели. Когда весь фреймворк становится редактируемым, одна и та же агентская система может работать как с легковесной моделью, так и с моделью 100B+, работающей на большом кластере. Различаются только поля «Интеллект» и «Движок», а остальные примитивы оптимизируются в соответствии с ними.

Эксперимент Open Jarvis показывает следующее: благодаря представлению всех пяти примитивов в виде отдельных полей конфигурации — четыре из которых («Интеллект», «Движок», «Агент», «Инструменты и память») совместно оптимизируются поиском спецификаций, а «Обучение» работает отдельно — локальные модели достигают точности облачных на большинстве бенчмарков персонального ИИ при стоимости запроса примерно в 800 раз ниже и задержке в 4 раза ниже на локальном оборудовании персональных устройств. Лучшая отдельная локальная модель, Qwen3.5-122B, в среднем по восьми бенчмаркам отстает от Claude Opus 4.6 всего на 3,2 процентных пункта.

Что это значит, если вы строитесь на Lambda

GPU-инстансы Lambda на базе NVIDIA предоставляют вычислительные мощности. Хорошо спроектированная обвязка — это то, что заставляет их выполнять надежную агентскую работу. Три практических вывода:

  • Вы можете использовать этот фреймворк для переработки своей агентской системы.
  • Вы можете использовать передовую модель для улучшения своей обвязки, а не для каждого запроса. Однократный поиск спецификаций с использованием облачного учителя стоит около 15 долларов, что намного дешевле, чем маршрутизация каждого запроса в облако на любом значимом горизонте развертывания.
  • Относитесь к обвязке как к изменяемой сущности. Обвязка — это конфигурация (выбор модели, настройки среды выполнения, промпты, определения инструментов и бэкенд памяти), и вы можете итерировать ее, как любую другую конфигурацию.

Экосистема моделей с открытыми весами сокращает разрыв с передовыми облачными моделями быстрее, чем ожидалось. Для большинства команд модель больше не является «узким местом» — им является обвязка.

Чтобы сделать это конкретным, вот как выглядит оптимизация на уровне обвязки при работе на собственной инфраструктуре Lambda.

Как это выглядит на инстансе NVIDIA HGX B200 в Lambda

  • На одном узле NVIDIA HGX B200 модель Kimi K2.6 может обслуживать 32 пользователя одновременно, выдавая в общей сложности около 1286 токенов вывода в секунду, или ~40 токенов/с на пользователя.
  • Это составляет 121,7 млн токенов в день на одной системе NVIDIA HGX B200.

Мы также оценили Kimi K2.6 в сравнении с Claude Fable 5.1 на PinchBench, используя нативную обвязку OpenHands и CLI для оценки Open Jarvis. (Claude Opus 4.5 оценивает результаты PinchBench в качестве модели-судьи; Claude Opus 4.6 — это отдельный передовой базовый уровень, упомянутый ранее в этой статье — это две разные роли, а не несоответствие версий.)

Агентские оценки используют инструменты, которые замедляют чистый вывод из-за выполнения кода, поиска и т. д. В этом бенчмарке Fable 5.1 достигла более высокого среднего балла по 75 общим задачам: 0,8216 против 0,7301 у Kimi.

Для сравнения стоимости 75 задач: если оценить 2,90 часа суммарного агентского времени Kimi по полной ставке узла, получается стоимость вывода 155,19 долл., или 2,07 долл. за задачу, по сравнению с 235,48 долл. через API Claude, или 3,14 долл. за задачу — примерно на 34% дешевле.

Разбивка стоимости:

Средний балл

Время работы агента

Стоимость

За задачу

Fable 5.1

0.8216

3.30 ч

$235.48 (API)

$3.14

Kimi K2.6

0.7301

2.90 ч

$155.19 (GPU)

$2.07

Для рабочих нагрузок, где качество Kimi соответствует требованиям приложения, самостоятельный хостинг предлагает практическое сочетание более низкой оценочной стоимости вывода, конкурентоспособной задержки выполнения задач и контроля над моделью и стеком обслуживания.

Мы проводили оценки с помощью:

Инструкции по установке

Если вы исследователь или разработчик, вам стоит присоединиться! Мы призываем вас строить решения на базе OpenJarvis. Мы приветствуем PR, расширяющие экосистему.

Самый быстрый способ начать:

О чём эта статья

Что-то непонятно? Спросите по статье — объясню простыми словами.

Не хотите разбираться сами? Мы поможем.

Ещё в разделе «AI и машинное обучение»

Все →

Ещё от Lambda