NVIDIA продвигается дальше в сторону агентных моделей ИИ с запуском Nemotron 3.5 Lightning — новой открытой модели, созданной специально для постоянно работающих, высоконагруженных задач, которые теперь круглосуточно обрабатывают автономные ИИ‑агенты. Одновременно компания выпустила NeMo Switchyard — инструмент маршрутизации с открытым исходным кодом, предназначенный для отправки каждого запроса ИИ в ту модель, которая сможет обработать его быстрее и дешевле всего. Вместе эти два релиза обозначают очередную попытку NVIDIA сделать агентные ИИ‑системы не только умнее, но и по‑настоящему эффективными при масштабной эксплуатации.
Summary
Ключевые выводы
- NVIDIA выпустила Nemotron 3.5 Lightning — открытую модель типа mixture-of-experts с 30 миллиардами параметров, созданную для высоконагруженных агентных ИИ‑задач.
- Модель обеспечивает до 4 раз более высокую скорость генерации и на 30% более быстрое завершение задач по сравнению с сопоставимыми моделями своего класса.
- NVIDIA также запустила NeMo Switchyard — библиотеку маршрутизации с открытым исходным кодом, которая может сократить стоимость выполнения задач почти до одной трети по сравнению с использованием одной передовой модели.
- Nemotron 3.5 Lightning запускается локально на ПК с NVIDIA RTX, DGX Spark, DGX Station и Jetson, а также масштабируется до дата‑центров и облака.
- Оба релиза являются открытыми, настраиваемыми и уже поддерживаются партнёрами экосистемы, включая CrowdStrike, Harvey, CodeRabbit и Lila Sciences.
NVIDIA запускает Nemotron 3.5 Lightning для агентных ИИ‑нагрузок
Nemotron 3.5 Lightning — новейшее дополнение к семейству Nemotron 3 от NVIDIA, и компания описывает её как самую эффективную модель в своём классе для длительно работающих агентных задач. Она выходит после Nemotron 3 Nano и продолжает линию, которой NVIDIA следует в каждом релизе Nemotron: приоритет открытых весов, настройки и «сырой» скорости над простым увеличением размера модели.
30‑миллиардная модель, созданная для скорости
Nemotron 3.5 Lightning — это модель типа mixture-of-experts с 30 миллиардами параметров, что означает, что она активирует только те части своей сети, которые нужны для конкретной задачи, вместо того чтобы каждый раз запускать всю модель целиком. Этот архитектурный выбор напрямую отражается на производительности: NVIDIA утверждает, что модель обеспечивает до 4 раз более высокую скорость вывода, что приводит к на 30% более быстрому завершению агентных задач по сравнению с другими моделями того же размера. Согласно внутренним бенчмаркам PinchBench, на которые ссылается NVIDIA, эти приросты скорости достигаются без потери точности относительно аналогичных моделей.
Модель создана для конкретной роли внутри более крупных многоагентных систем. Вместо того чтобы самостоятельно планировать весь рабочий процесс, Nemotron 3.5 Lightning предназначена для узких, повторяющихся, высокочастотных задач — того типа работы, который быстро накапливается, когда ИИ‑агент работает непрерывно, а не отвечает лишь на редкие запросы.
Настройка и постобучение для отраслевой точности
Поскольку Nemotron 3.5 Lightning является открытой, организации могут проводить её постобучение с помощью NVIDIA NeMo на собственных доменных данных, внутренних инструментах и рабочих процессах. Такая открытая настройка ИИ‑модели — ключевой элемент позиционирования релиза NVIDIA: вместо универсальной модели «для всех» предприятия получают базу, которую можно адаптировать под конкретную задачу — будь то разбор юридических контрактов или выявление сигналов безопасности.
Ряд компаний уже сделали именно это. CrowdStrike настраивает модель под кибербезопасностные нагрузки, Harvey совместно с Trajectory работает над приложениями для юридических услуг, а CodeRabbit использует её вместе с Baseten для автоматизированного ревью кода. Lila Sciences применяет модель для улучшения рассуждений в задачах по физическим и биологическим наукам, в то время как Fastino Labs сообщает о лидирующей точности после настройки модели под задачи разработки ПО, финансов и здравоохранения. NVIDIA отмечает, что модель разрабатывалась с учётом вклада коалиции Nemotron Coalition, участники которой предоставили методики оценки, ПО для инференса и наборы данных, повлиявшие на финальный релиз.
NeMo Switchyard приносит умную маршрутизацию в ИИ‑агенты
NeMo Switchyard решает проблему, которая усугубляется по мере масштабирования агентных систем: опора на одну модель по умолчанию либо приводит к перерасходу средств на задачах, не требующих сложных рассуждений, либо ухудшает качество, когда от лёгкой модели требуют слишком многого. Ответ NVIDIA — библиотека с открытым исходным кодом, которая автоматически, для каждого запроса, решает, какая модель должна выполнить задачу.
Снижение затрат за счёт динамического выбора модели
NeMo Switchyard направляет каждый шаг рабочего процесса агента в ту модель, которая лучше всего подходит и экономически наиболее эффективна для конкретной задачи, без необходимости для разработчиков переписывать свои приложения. Разработчики могут настраивать или заменять алгоритм маршрутизации в зависимости от того, что для них важнее — задержка, качество или стоимость. Внутренние бенчмарки NVIDIA показывают, что такой подход маршрутизации NeMo Switchyard сохраняет точность, близкую к передовым моделям, при этом снижая стоимость завершения задач почти до одной трети от того, что потребовалось бы при прогоне всего через одну Opus 4.8.
Эта разница имеет значение. В системах, где агенты работают непрерывно, разрыв между умной маршрутизацией и использованием одной модели по умолчанию быстро накапливается на тысячах ежедневных задач — превращая кажущийся умеренным прирост эффективности в существенное снижение операционных затрат со временем.
Интеграция по всему ИИ‑экосистеме
NVIDIA уже сотрудничает с широким кругом партнёров, чтобы встроить такую маршрутизацию прямо в инструменты, которыми разработчики пользуются ежедневно. Первые результаты этой работы в экосистеме показывают, насколько сильно маршрутизация может изменить стоимость и производительность:
- Boomi достигла 100% точности доменной маршрутизации, направляя при этом 59% трафика в до 5 раз более быструю дообученную модель, сократив задержку на последующих шагах на 21%.
- Cognition интегрировала поэтапный роутер в Devin Desktop, снизив среднюю стоимость на 28% по сравнению с маршрутизацией всего трафика в одну передовую модель.
- LangChain сократила затраты на 74% по 145 многошаговым задачам Deep Agents, отправляя лишь 7% вызовов в передовую модель, при этом пожертвовав точностью всего на 6%.
- Ramp достигла производительности на уровне передовой модели, одновременно сократив затраты на 58% и время выполнения на 33% в тестах SWE-Bench.
- Classmethod сообщила о снижении затрат на 27% при сохранении качества по своим нагрузкам opencode и Fireworks.
Kong, LiteLLM, Nous Research, Cadence и Siemens также интегрируют или тестируют NeMo Switchyard в своих платформах — от ИИ‑шлюзов до формальной верификации чипов и инженерных агентов.
Гибкость развёртывания на оборудовании NVIDIA
Одно из главных преимуществ этого релиза — где именно может работать Nemotron 3.5 Lightning. Она поддерживает локальное и облачное развёртывание на ПК с NVIDIA RTX, DGX Spark, DGX Station и устройствах Jetson, позволяя организациям использовать уже имеющееся оборудование, а не переносить всё в облако. Оттуда модель масштабируется до рабочих станций RTX PRO, пограничных устройств, дата‑центров и полноценных облачных сред для более крупных корпоративных развёртываний.
Такая гибкость даёт организациям реальный контроль над конфиденциальностью и задержками. Запуск модели локально или в периметре предприятия подходит для высокочастотных специализированных задач, которым нужны быстрые ответы и более строгий контроль над данными, в то время как облачное развёртывание остаётся доступным для нагрузок, требующих масштабирования по запросу.
Открытые данные и доступность платформ
Как и в каждом релизе Nemotron, NVIDIA заявляет, что публикует столько обучающих данных и методик, сколько позволяет лицензирование, предоставляя внешним исследователям возможность отслеживать, аудировать и даже обучать другие модели на тех же материалах. Одновременно с Lightning NVIDIA выпускает Nemotron-RL-Agentic-Terminal-Pivot — набор данных для агентного обучения с подкреплением, использованный для постобучения модели под задачи кодирующих агентов.
Nemotron 3.5 Lightning уже доступна на Hugging Face, ModelScope и OpenRouter, а также на build.nvidia.com как микросервис NVIDIA NIM, с более широким доступом через NVIDIA Cloud Partners, платформы постобучения и дополнительных облачных провайдеров. NeMo Switchyard уже доступен на GitHub, при этом ожидается скорое появление поддержки на большем числе партнёрских платформ.
FAQ
Что такое Nemotron 3.5 Lightning и чем она отличается?
Nemotron 3.5 Lightning — это открытая ИИ‑модель с 30 миллиардами параметров, оптимизированная для высоконагруженных агентных ИИ‑задач, обеспечивающая до 4 раз более быстрый вывод и на 30% более быстрое завершение задач по сравнению с сопоставимыми моделями.
Как NeMo Switchyard повышает эффективность ИИ?
NeMo Switchyard — это библиотека маршрутизации с открытым исходным кодом, которая динамически направляет ИИ‑запросы в наиболее подходящую модель, снижая стоимость завершения задач примерно до одной трети по сравнению с опорой на одну модель.
Можно ли настроить Nemotron 3.5 Lightning под конкретные потребности организации?
Да. Nemotron 3.5 Lightning можно постобучить на данных самой организации с помощью NVIDIA NeMo, чтобы повысить точность для специализированных, отраслевых задач.
На каких платформах доступно развёртывание Nemotron 3.5 Lightning?
Nemotron 3.5 Lightning поддерживает локальное и облачное развёртывание на ПК с NVIDIA RTX, системах DGX, устройствах Jetson и пограничных устройствах, а также доступна на платформах, включая Hugging Face, ModelScope, OpenRouter и NVIDIA Cloud Partners.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Что такое Nemotron 3.5 Lightning и чем она отличается?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Nemotron 3.5 Lightning — это открытая ИИ‑модель с 30 миллиардами параметров, оптимизированная для высоконагруженных агентных ИИ‑задач, обеспечивающая до 4 раз более быстрый вывод и на 30% более быстрое завершение задач по сравнению с сопоставимыми моделями.»}},{«@type»:»Question»,»name»:»Как NeMo Switchyard повышает эффективность ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»NeMo Switchyard — это библиотека маршрутизации с открытым исходным кодом, которая динамически направляет ИИ‑запросы в наиболее подходящую модель, снижая стоимость завершения задач примерно до одной трети по сравнению с опорой на одну модель.»}},{«@type»:»Question»,»name»:»Можно ли настроить Nemotron 3.5 Lightning под конкретные потребности организации?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Да. Nemotron 3.5 Lightning можно постобучить на данных самой организации с помощью NVIDIA NeMo, чтобы повысить точность для специализированных, отраслевых задач.»}},{«@type»:»Question»,»name»:»На каких платформах доступно развёртывание Nemotron 3.5 Lightning?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Nemotron 3.5 Lightning поддерживает локальное и облачное развёртывание на ПК с NVIDIA RTX, системах DGX, устройствах Jetson и пограничных устройствах, а также доступна на платформах, включая Hugging Face, ModelScope, OpenRouter и NVIDIA Cloud Partners.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

