Nvidia представила Switchyard и Nemotron 3.5 Lightning для оптимизации затрат на агентские AI-задачи

Nvidia анонсировала NeMo Switchyard — открытую библиотеку маршрутизации задач для AI-агентов, которая динамически перенаправляет этапы работы к наиболее подходящей модели. В комплекте с ней вышла Nemotron 3.5 Lightning — 30-миллиардная открытая модель с архитектурой mixture-of-experts, ориентированная на специализированные и высоконагруженные агентские задачи.
По данным Nvidia, Lightning демонстрирует до четырёхкратного ускорения по сравнению с аналогами и выполняет агентские задачи примерно на 30% быстрее, чем Qwen3.6-35B при сопоставимой точности. Совместное использование Lightning и Switchyard позволяет сохранить уровень выполнения задач на уровне передовых моделей, снижая при этом затраты до трети стоимости работы с Opus 4.8.
Switchyard решает проблему статичного выбора модели, адаптируя маршрутизацию к изменяющемуся состоянию агента в процессе выполнения задачи. Это позволяет учитывать ошибки, простоту этапов и другие параметры, а также напрямую включать в решение данные о стоимости и объёме генерируемых токенов, что оптимизирует расходы.
Nvidia интегрировала Switchyard с рядом партнёров, включая Cognition, LangChain, Nous Research, Kong, LiteLLM и OpenRouter, чтобы упростить внедрение технологии в существующие агентские инфраструктуры.
Результаты тестирования Switchyard в девяти компаниях показывают значительное снижение затрат: LangChain зафиксировала сокращение расходов на 74% при 6% снижении точности, Ramp снизила стоимость на 58% и время выполнения на 33%, а Cognition добилась 28%-го снижения средней стоимости при сохранении близкой к передовой производительности.
Nemotron 3.5 Lightning построена на гибридной архитектуре Mamba-Transformer, впервые представленной в декабре 2025 года, и позиционируется как модель для быстрого и экономичного решения специализированных задач, а не как универсальный ИИ. По общему индексу Artificial Analysis Intelligence Index Lightning набирает 24 балла, уступая лидерам, но превосходит по скорости выполнения при сопоставимой точности на реальных агентских тестах PinchBench.
Nvidia подчёркивает, что сочетание открытых моделей и открытых маршрутизаторов, контролируемых одним вендором, — ключ к снижению затрат на агентские AI-системы. Это отличается от подходов, где либо модель, либо маршрутизатор предлагаются отдельно.
В условиях активного выпуска конкурентных открытых моделей из Китая и других стран, включая Alibaba, Moonshot AI, Zhipu, DeepSeek и Meta с их Muse Glimmer, Nvidia занимает позицию, предлагая комплексное решение для динамического распределения задач между моделями.
Таким образом, для корпоративных пользователей становится важнее не только выбор самой модели, но и эффективность системы маршрутизации, которая оптимизирует баланс между стоимостью и производительностью в реальном времени.
По данным VentureBeat.
