Статья

Почему маленькая модель часто лучше большой

Почему маленькая модель часто лучше большой

ProfileProfile·15 ч назад·
9
··0·
12 августа Nvidia показала штуку, которая на первый взгляд звучит скучно: программный маршрутизатор NeMo Switchyard. Он встаёт между приложением и нейросетями и решает, кому отдать конкретный запрос. Скучно ровно до момента, пока не открываешь замеры.

Один тест, три способа его пройти

Замер прогнали на 145 агентских задачах: поддержка клиентов, разбор инцидентов, автоматизация рутины в почте и мессенджерах. Каждая задача — не один вопрос, а цепочка в среднем из 6,3 обращений.
Дальше три строчки, ради которых всё и затевалось. Тяжёлая Claude Opus 4.8 в одиночку: 86% верных решений, 11,45 доллара за прогон. Лёгкая Nemotron 3.5 Lightning на 30 миллиардов параметров: 77,7% и 72 цента. Смешанный режим, где наверх уходило всего 7% обращений: 80% и три доллара.
Вчитайтесь в разрыв. По качеству — восемь пунктов. По деньгам — примерно в шестнадцать раз.
Тот же набор задач, пройденный тремя способами: в одиночку топовой, в одиночку лёгкой и в смешанном режиме

Где именно начинается разница

Восемь пунктов — это не «маленькая тупая». Это значит, что на большинстве шагов обе справляются одинаково, а расходятся они на узкой полосе сложного.
Пересказать страницу, придумать заголовок, вытащить таблицу из PDF, разложить письма по папкам, переписать текст вежливее — здесь лёгкая ошибается не чаще. У Nvidia есть отдельный разборщик документов на миллиард параметров, и её инженер описал его ровно так: маленькая, но очень хороша в одной задаче.
Просить топовую модель сделать титульную карточку или пересказать сайт — перебор.
Разница вылезает там, где нужна длинная цепочка рассуждений: понять, почему падает тест, найти причину сбоя в куче логов, довести многошаговый расчёт до конца, не потеряв нить на середине. Чем длиннее цепочка, тем заметнее преимущество тяжёлой — на длинных рассуждениях лёгкие теряют контекст и уплывают.
Отсюда и смысл маршрутизатора: он не выбирает раз и навсегда, а раскидывает шаги внутри одной задачи. Простое — вниз, спорное — наверх. В том замере наверх уходило семь обращений из ста, а денег на топовую всё равно уходило две трети бюджета.

Экономика, которая всё это двигает

Самый честный аргумент здесь не научный, а бухгалтерский. Оператор AT&T пропускает в среднем 45 миллиардов токенов в день и гоняет их через собственный «умный роутер», который подбирает под каждую задачу самый дешёвый подходящий движок.
Результат компания называет прямо: в отдельных приложениях перевод с закрытых моделей на открытые дал экономию 80–90%. Сейчас на открытых работает около четверти нагрузки, в планах на ближайшие годы — 70–80%.
На таких объёмах восемь пунктов качества на сложных задачах — это цена, которую считают, а не принцип, за который умирают.

Как выбирать под задачу

Начинайте снизу

Правило простое и противоположное привычке: берите самую лёгкую и поднимайтесь, только когда она правда не тянет. Обычный рефлекс обратный — включить топовую «чтобы наверняка». Она честно отработает и ваш вопрос про запятую, и просьбу переписать абзац, просто в несколько раз дороже и медленнее.
Грубая, но рабочая развилка: слева задачи, где лёгкая не проигрывает, справа — где разрыв реально виден

Считайте на своих задачах, а не по чужим таблицам

Любой бенчмарк — средняя температура. У вас в работе обычно три-четыре типовые операции, и именно на них надо смотреть. Возьмите двадцать своих реальных запросов, прогоните на лёгкой и на тяжёлой, положите ответы рядом. Как правило выясняется, что разница видна в одном сценарии из четырёх — вот его и поднимайте наверх, остальное оставьте внизу.
Это ровно та же история, что с характеристиками техники: красивая цифра в таблице и польза в вашей руке — разные вещи.

Скорость — это тоже качество

Есть вещи, где ответ через полторы секунды полезнее, чем чуть более гладкий ответ через двадцать. Подсказка в поиске, автозаголовок, черновик комментария — тут задержка убивает пользу быстрее, чем неточность.
И наоборот: там, где решение потом кто-то исполнит и за него придётся отвечать, экономить не стоит. Отдельный разговор — задачи, которые ИИ выполняет сам, без вашего просмотра.

Как это устроено у нас

В Schai GPT несколько уровней, и базовая — самая лёгкая. Она отвечает на обычные вопросы, держит переписку, помогает с текстом. Тяжёлые — Claude Opus, Fable, Grok, Gemini, старшие GPT — лежат рядом в меню и включаются одним тапом, когда задача того стоит.
Чтобы выбор был осознанным, у каждой модели в меню стоит бейдж: во сколько раз быстрее относительно базовой тратится баланс. Списывается по факту — по реальным токенам той модели, которой вы ответили, а не по средней ставке. Так что переключиться наверх на один сложный вопрос и вернуться вниз — нормальная тактика, а не хитрость.

Коротко

Разговор «какая модель умнее» почти всегда бесполезен, потому что умнее — не про модель, а про задачу. На простом лёгкая не хуже и в разы дешевле. На длинных цепочках рассуждений тяжёлая отрывается, и там за неё стоит платить. Всё остальное — вопрос дисциплины: не гонять тяжёлую артиллерию по воробьям просто потому, что кнопка рядом.
Если хочется послушать подробный разбор о том, как маленькие модели справляются с узкими задачами, есть хорошая лекция на эту тему.
0

Пока нет комментариев

Маленькая модель против большой: как выбрать