Агент может сделать один сложный запрос для планирования задачи и еще десятки для ее выполнения. В этих последующих запросах происходит чтение файлов, выбор инструментов, проверка результатов и принятие решений о дальнейших действиях. NVIDIA создала Nemotron 3.5 Lightning именно для этой высокочастотной части рабочего процесса.
Nemotron 3.5 Lightning — это модель смесевых экспертов (Mixture-of-Experts) с 30 миллиардами параметров, которая активирует около 3 миллиардов параметров для каждого токена. Она поддерживает вызовы инструментов, задачи программирования, следование инструкциям и другие четко ограниченные шаги агента.
Это название легко спутать с Nemotron 3 Ultra, однако эти две модели созданы для разных этапов рабочего процесса агента. Выбор между ними влияет на стоимость, задержку и надежность всего процесса выполнения.
Краткий обзор Nemotron 3.5 Lightning
Лимиты эндпоинтов и функции в этой таблице актуальны для наших страниц моделей по состоянию на 11 сентября 2026 года. Проверяйте страницу стандартной модели или бесплатной модели перед проектированием системы с учетом конкретных ограничений.
Что означает архитектура MoE 30B с 3B активными параметрами?
Nemotron 3.5 Lightning — это разреженная модель смесевых экспертов (sparse MoE). Она содержит в общей сложности 30 миллиардов параметров, но не задействует каждого эксперта для каждого токена. Маршрутизатор выбирает меньшую подгруппу экспертов при обработке каждого токена моделью, что доводит количество активных параметров примерно до 3 миллиардов. Вы также можете встретить обозначение 30B-A3B, что означает 30 миллиардов общих параметров и около 3 миллиардов активных.
Такой подход дает модели большую общую емкость по сравнению с плотной моделью на 3B без задействования всех 30 миллиардов параметров для каждого токена. Именно так Lightning сочетает относительно большой чекпоинт с пропускной способностью, необходимой для частых вызовов агента.
Количество активных параметров не является полной спецификацией вычислительной мощности или памяти. Полную модель все равно необходимо хранить, а общие слои также задействуются во время инференса. Требования к оборудованию зависят от точности (precision), длины контекста, механизма инференса, стратегии батчинга и конфигурации кэша.
Кроме того, в Lightning используется гибридная архитектура, а не чистый стек Transformer. В модели NVIDIA описаны чередующиеся слои Mamba-2 и MoE с избранными слоями внимания (attention). Она также поддерживает настраиваемые рассуждения (reasoning), поставляется с предсказанием нескольких токенов (multi-token prediction) и двумя проекторами для спекулятивного декодирования — DSpark и DFlash — для более быстрой генерации, а также содержит оптимизированный для инференса чекпоинт NVFP4.
Для чего предназначена Nemotron 3.5 Lightning?
Долго работающие агенты совершают множество запросов к модели. Некоторые запросы требуют сложного планирования. Большая часть работы носит более узкий характер, например выбор инструмента, генерация аргументов, проверка результата, редактирование файла или определение дальнейших действий.
NVIDIA позиционирует Lightning как модель для этого слоя выполнения. Эта модель подходит, если ваша рабочая нагрузка обладает следующими характеристиками:
- Агент совершает множество запросов, и задержка или стоимость суммируются по ходу выполнения.
- Каждый запрос имеет четкую цель и достаточный контекст для ее завершения.
- Модели необходимо использовать инструменты, следовать инструкциям или возвращать структурированные данные.
- Вам нужны открытые веса, которые можно настроить под конкретную предметную область или цель развертывания.
Например, агент-программист может использовать более крупную модель с возможностями рассуждения для изучения репозитория и составления плана реализации. Затем Lightning может выполнять отдельные шаги, такие как поиск символа, редактирование одного файла, запуск инструмента и интерпретация результата.
Сравнение Nemotron 3.5 Lightning с Nemotron 3 Ultra
NVIDIA distilled Lightning from Nemotron 3 Ultra, однако эти две модели не являются взаимозаменяемыми. Lightning — это меньшая модель для высокочастотного выполнения задач агента. Ultra — более крупная модель для сложных рассуждений и оркестрации.
NVIDIA сообщает, что Lightning достигает пропускной способности, в четыре раза превышающей показатели аналогичных по размеру открытых моделей. В тестах NVIDIA PinchBench она выполнила 10 000 задач агента на 30% быстрее при сопоставимой точности. Это результаты, заявляемые производителем, поэтому обязательно тестируйте пропускную способность и выполнение задач на собственной рабочей нагрузке.
Разница заключается в сложности и последствиях вызова. Ultra лучше подходит, когда шаг требует глубоких рассуждений в рамках неоднозначной проблемы, создает план для долгого рабочего процесса или принимает решение, которое дорого отменить. Lightning лучше подходит, когда задача четко очерчена и повторяется достаточно часто, чтобы задержка и стоимость имели значение.
Вам не обязательно закреплять одну модель за всем агентом. Направляйте сложные вызовы на Ultra, а частые запросы на выполнение — на Lightning. Затем оцените, улучшает ли такое сочетание стоимость выполненной задачи без снижения надежности.
Маршрутизация между двумя моделями на OpenRouter
Если вы предпочитаете доверить выбор модели нам, используйте Auto Router. Укажите openrouter/auto в качестве идентификатора модели, и Auto Router выполнит классификацию промпта перед выбором модели на основе типа задачи, возможностей модели, поддержки инструментов и стоимости. Настройка cost_tier задает ценовой диапазон — от минимального до максимального. Она не повышает уровень беседы с более дешевой модели до более дорогой. Если вы хотите, чтобы Auto Router выбирал только между Lightning и Ultra, ограничьте его выбор с помощью параметра allowed_models.
Маршрутизация между двумя моделями за пределами OpenRouter
Реализация NeMo Switchyard от NVIDIA представляет собой шаблон маршрутизации в виде слоя оркестрации с открытым исходным кодом. Маршрутизатор эскалации начинает каждый диалог с более дешевой модели, а судья на базе LLM переводит сеанс на более мощную модель при обнаружении постоянных трудностей. В оценке LangChain для 145 многошаговых задач агента маршрутизация между Lightning и Claude Opus 4.8 снизила стоимость на 74% по сравнению с базовым вариантом, использующим только передовые модели, при этом на передовую модель отправлялось около 7% запросов. Точность оказалась примерно на шесть пунктов ниже. Этот результат демонстрирует компромисс при маршрутизации на данном бенчмарке. Он не является бенчмарком комбинации Lightning и Ultra. Протестируйте любую схему маршрутизации на собственных задачах, прежде чем полагаться на экономию.
Какова длина окна контекста?
Nemotron 3.5 Lightning поддерживает до 1 миллиона токенов на уровне модели. Контекст, доступный вашему приложению, зависит от обслуживающего ее эндпоинта.
По состоянию на 11 сентября 2026 года каждый провайдер, стоящий за стандартным ID модели, предоставляет окно контекста в 262 144 токена. Ограничения на генерацию различаются в зависимости от провайдера и составляют от 32 768 до 235 929 токенов. Эндпоинт :free предоставляет полное окно контекста в 1 миллион токенов и ограничивает генерацию 65 536 токенами.
Если запросу требуется более 262 144 токенов, только бесплатный эндпоинт в настоящее время предоставляет полный контекст модели в 1 миллион токенов на OpenRouter. Уведомление NVIDIA для этого эндпоинта указывает, что использование регистрируется в целях безопасности и для улучшения продуктов и услуг NVIDIA, а также просит не загружать конфиденциальную информацию или личные данные. Для конфиденциальных рабочих нагрузок с длинным контекстом или рабочих нагрузок в продакшене выбирайте другой эндпоинт или модель.
Эта разница имеет значение при переключении между двумя идентификаторами моделей. Запрос, который успешно выполняется на бесплатном эндпоинте, может превысить лимит контекста стандартного эндпоинта. На бесплатном эндпоинте также указана поддержка вызова инструментов, но не указаны response_format или структурированные выходы.
Проверяйте страницу модели вместо того, чтобы воспринимать максимальный контекст архитектуры как обещание от каждого провайдера. На странице модели мы показываем текущие лимиты и поддерживаемые параметры для каждого эндпоинта.
Открытые веса и локальное развертывание
NVIDIA публикует под лицензией OpenMDW-1.1. Карточка модели описывает релиз BF16 как отправную точку для дообучения, адаптации под домен, исследований и создания оптимизированных вариантов. NVIDIA также публикует данные обучения и рецепты для настройки и оценки, а в карточке модели указано, что релиз готов к коммерческому использованию.
Для прямого инференса NVIDIA рекомендует свой релиз NVFP4. Она также предоставляет чекпоинт GGUF для поддерживаемых локальных систем. В руководстве по BF16 для развертывания на одном графическом процессоре указаны H100 80GB или A100 80GB. Оптимизированные релизы ориентированы на такое железо, как RTX 5090, RTX PRO 6000 и DGX Spark.
Запуск модели локально не означает, что каждая машина способна обслуживать окно контекста на 1 миллион токенов. В текущем руководстве NVIDIA по Ollama контекст по умолчанию масштабируется в зависимости от доступной видеопамяти. Он составляет 4K при объеме менее 24 ГБ, 32K от 24 ГБ до менее 48 ГБ и 256K при 48 ГБ и более. Пример для llama.cpp использует около 40K. Вы можете увеличить эти лимиты, однако это может потребовать больше памяти или выгрузки на CPU.
Веса находятся в открытом доступе, и определение «модель с открытыми весами» является наиболее точным. Ознакомьтесь с лицензией OpenMDW-1.1, прежде чем распространять модифицированную модель или принимать решения о развертывании в соответствии с ее условиями.
Как вызывать Nemotron 3.5 Lightning на OpenRouter
Если вы не хотите выделять GPU или управлять движком инференса, вызывайте Lightning через OpenRouter. Стандартный ID модели сохраняет тот же API, пока мы перенаправляем запросы между доступными провайдерами для этой модели.
Установите SDK OpenRouter для TypeScript.
Установите OPENROUTER_API_KEY в вашей среде, а затем отправьте запрос с ID модели Lightning. Стандартная модель поддерживает структурированные выводы, поэтому вы можете запросить JSON-схему и добиться того, чтобы ответ ей соответствовал.
Когда мы выполнили этот запрос 11 сентября 2026 года, модель вернула {"category": "Bug (Payment Checkout)", "priority": "medium"}. Выборочные результаты могут отличаться от запуска к запуску, причем запрос гарантирует именно соблюдение схемы, а не конкретные значения.
Поддержка провайдерами response_format и структурированных выводов различается в рамках одной и той же модели. По умолчанию мы отдаем предпочтение провайдерам, поддерживающим отправляемые вами параметры tools и response_format, в то время как провайдер, не поддерживающий какой-либо параметр, просто игнорирует его. Установка параметра require_parameters в значение true, как показано в примере, ограничивает круг провайдеров только теми, которые поддерживают каждый входящий в него параметр. Полное описание поведения см. в документации по маршрутизации провайдеров.
Чтобы протестировать бесплатный эндпоинт, измените ID модели на nvidia/nemotron-3.5-lightning:free. Бесплатный эндпоинт не поддерживает response_format, поэтому исключите это поле и проверяйте JSON самостоятельно. Он полезен для оценки и экспериментов с небольшим объемом данных, а его лимиты и доступность отличаются от стандартного эндпоинта.
Не передавайте конфиденциальную информацию или персональные данные через бесплатный эндпоинт. На его странице модели размещено уведомление NVIDIA о том, что использование логируется в целях безопасности и для улучшения продуктов и услуг NVIDIA. Ознакомьтесь с этим уведомлением, прежде чем принимать решение о том, какие промпты отправлять.
По умолчанию мы распределяем нагрузку для стандартной модели между ее провайдерами, упорядочивая их по цене. Два варианта изменяют этот порядок сортировки. nvidia/nemotron-3.5-lightning:nitro сортирует провайдеров по пропускной способности, а nvidia/nemotron-3.5-lightning:exacto отдает предпочтение провайдерам с более высокими показателями качества вызова инструментов. Для модели, выбранной за низкую задержку и работу с инструментами, Nitro и Exacto — это два варианта, о которых стоит знать.
Lightning принимает инструменты (tools) и параметр tool_choice, поэтому вы также можете использовать ее внутри цикла агента. Полное описание запроса, выполнения инструментов и цикла итераций см. в нашем руководстве по циклу агента с вызовом инструментов.
Стоит ли использовать Nemotron 3.5 Lightning?
Nemotron 3.5 Lightning заслуживает оценки, когда вам нужна быстрая модель с открытыми весами для частых и четко определенных шагов агента. Ее архитектура 30B-A3B, поддержка инструментов и низкая заявленная стоимость за токен делают ее отличным кандидатом на роль исполнительной модели для агентов, которые в противном случае отправляли бы каждый вызов гораздо более крупной модели рассуждений.
Используйте название модели как отправную точку, а не как готовое решение. Сформируйте набор для оценки на основе вызовов инструментов и задач, которые выполняет ваш агент. Измеряйте успешность выполнения задач, количество повторных попыток, задержку и общие затраты за весь прогон. Более дешевый вызов не поможет, если агент повторяет его или слишком часто эскалирует результат, сводя на нет всю экономию.
Начните с nvidia/nemotron-3.5-lightning или используйте nvidia/nemotron-3.5-lightning:free для тестирования модели перед добавлением платного трафика.
Часто задаваемые вопросы
Что такое Nemotron 3.5 Lightning?
Nemotron 3.5 Lightning — это языковая модель NVIDIA с открытыми весами и смесью экспертов (MoE), имеющая 30 млрд параметров в общей сложности и около 3 млрд активных параметров на токен. NVIDIA позиционирует ее для высокопроизводительного выполнения задач агентами, использования инструментов, написания кода, следования инструкциям и специализированных задач.
Является ли Nemotron 3.5 Lightning тем же самым, что и Nemotron 3 Ultra?
Нет. Nemotron 3.5 Lightning имеет 30 млрд общих и 3 млрд активных параметров. Nemotron 3 Ultra имеет 550 млрд общих и 55 млрд активных параметров. Lightning предназначена для частых шагов выполнения. Ultra предназначена для сложных рассуждений и оркестрации.
Что означает 30B-A3B?
30B-A3B означает, что модель имеет 30 миллиардов параметров в общей сложности и активирует около 3 миллиардов параметров на токен. Маршрутизатор смеси экспертов выбирает подмножество экспертов модели для каждого токена, вместо того чтобы задействовать каждого эксперта.
Поддерживает ли Nemotron 3.5 Lightning вызов инструментов и структурированные выводы?
Стандартная модель OpenRouter, nvidia/nemotron-3.5-lightning, перечисляет tools, tool_choice, response_format и структурированные выводы среди поддерживаемых параметров. Поддержка зависит от провайдера, поэтому установите require_parameters в значение true, если ваш запрос зависит от какого-либо из них. Бесплатная модель поддерживает tools и tool_choice, но не response_format или структурированные выводы.
Существует ли бесплатный API Nemotron 3.5 Lightning?
Да. Мы предлагаем nvidia/nemotron-3.5-lightning:free, обслуживаемый NVIDIA без взимания платы за токены. Бесплатные модели имеют другие лимиты скорости и доступность по сравнению с платными, а этот эндпоинт сопровождается уведомлением NVIDIA о данных. Не отправляйте через него конфиденциальную информацию или персональные данные.
Могу ли я запустить Nemotron 3.5 Lightning локально?
Да. NVIDIA публикует веса BF16, NVFP4 и GGUF под лицензией OpenMDW-1.1. Эталонный чекпоинт BF16 ориентирован на один GPU H100 или A100 на 80 ГБ. Релизы NVFP4 и GGUF предназначены для поддерживаемого локального оборудования, такого как RTX 5090, RTX PRO 6000 и DGX Spark. Перед выбором варианта развертывания ознакомьтесь с актуальной карточкой модели и лицензией NVIDIA.










