Nvidia запускает NeMo Switchyard, чтобы сократить расходы на модели искусственного интеллекта на 74%

20.08.2026

Nvidia выпустила маршрутизатор NeMo Switchyard с открытым исходным кодом, который направляет каждый запрос искусственного интеллекта на выбранную языковую модель и требует меньших затрат, чем использование только моделей frontier.

По словам представителей Nvidia, этот инструмент позволяет сократить расходы на 74% по сравнению с моделью, работающей только на frontier, при снижении точности на 6%.

NeMo Switchyard находится между приложением и пулом языковых моделей, решая, какая модель должна выполнять задачу для каждого запроса или за один ход. Оно разработано для того, чтобы избежать использования более крупных и дорогих моделей для упрощения работы.

Программное обеспечение принимает запросы OpenAI, Anthropic и Responses API. Оно также выполняет перевод между ними и записывает выбранную модель, обоснование решения, использование токенов и задержку для каждого вызова.

В качестве одного из примеров небольших моделей, которые можно использовать для специализированных задач, Nvidia привела Nemotron Parse, модель с миллиардом параметров, разработанную для извлечения структуры из PDF-файлов.

Этот релиз выводит Nvidia на рынок, который уже включает в себя RouteLLM, LiteLLM и OpenRouter, а также внутренние системы маршрутизации в таких компаниях, как OpenAI и AT&T.

В ходе тестирования Nemotron 3.5 Lightning компания LangChain сообщила, что на судейскую модель, используемую для определения того, остается ли агент на верном пути после каждого хода, приходится до 21,2% от общей стоимости. По словам LangChain, в ходе тестирования это было второе место после затрат на Claude Opus 4.8.

По словам LangChain, более оптимизированная модель judge могла бы еще больше сократить накладные расходы, но сам процесс проверки увеличивает затраты, поскольку модель judge считывает выходные данные на каждом этапе.

LangChain также сообщил, что маршрутизация сократила средние затраты по сравнению с использованием только Opus 4.8, но затраты по-прежнему варьировались от 2,16 до 3,61 доллара в зависимости от того, когда запросы были расширены до более крупной модели. По оценкам, Switchyard увеличивает задержку примерно на 700 миллисекунд, и пользователям рекомендуется избегать ее при работе с короткими или чувствительными к задержке нагрузками.

Nvidia предлагает Switchyard как упакованный продукт с открытым исходным кодом и широкой интеграцией на фрагментированном рынке. Компания заявила, что такой подход может изменить подход к моделям с меньшим весом, работающим на оборудовании, которое уже есть у предприятий.

Рекомендуемое изображение.

>

Читать на сайте источника »