Статья

ИИ подорожал в России втрое: из чего складывается счёт

ИИ подорожал в России втрое: из чего складывается счёт

ProfileProfile·4 ч назад·
3
··0·
20 августа 2026 года по отраслевым лентам разошлась цифра, которая многих неприятно удивила: по подсчётам MWS Cloud (входит в МТС Web Services), средняя стоимость минимального набора ускорителей NVIDIA для запуска одной большой языковой модели в России выросла за год в 2,8 раза — с 13,7 млн рублей в 2025-м до 38,8 млн рублей в 2026-м. При этом мировые цены на токены за тот же год местами обвалились. Разбираемся, почему эти две правды не противоречат друг другу и что из них следует для человека и небольшой компании.

Что именно подорожало

Цифра, с которой начался разговор

MWS Cloud сравнила требования моделей, вышедших весной и летом 2025 и 2026 годов: в первой выборке — Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2, во второй — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro и V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3. Считали не подписку, а железо: сколько стоит минимум ускорителей, на котором модель вообще запустится. Разброс внутри выборки огромный. Самая тяжёлая модель 2026 года, Kimi K3, требует набора примерно на 80 млн рублей, а Cotype Pro 3 укладывается в 3 млн — ровно как и её прошлогодняя версия. То есть подорожал не «ИИ вообще», а верхняя полка.
Разброс стоимости входного билета: между самой лёгкой и самой тяжёлой моделью 2026 года — 26 раз. Данные MWS Cloud, август 2026, оценки ориентировочные

Дорожает не ИИ, а вход в него

Средняя цифра выросла по двум причинам. Первая — модели стали крупнее: больше параметров, длиннее контекстное окно, выше требования к видеопамяти. Вторая — подорожали сами ускорители. Аналитики MWS ждут, что во втором полугодии 2026-го GPU прибавят ещё 10–25%, а H200 будет уходить по 75–90 тысяч долларов; 47% опрошенных ими компаний рассчитывают на дальнейший рост. Все эти оценки ориентировочные: официальных прайсов на дата-центровые чипы NVIDIA не публикует, и рынок живёт по котировкам поставщиков.
Одновременно цена готового ответа по API падает. В конце июля 2026-го OpenAI срезала тариф младшей GPT-5.6 Luna на 80% — до 0,20 доллара за миллион входных токенов, а Terra подешевела на 20%, до 2 долларов. Открытые модели ушли ещё ниже: Qwen3.7 Flash появился на маршрутизаторах по 0,03 доллара. Вилка налицо: содержать модель у себя стало дороже, а покупать её работу — дешевле.

Почему счёт растёт именно здесь

Видеопамять уехала в дата-центры

Корень подорожания не в софте, а в памяти. Больше 95% мирового производства DRAM держат три компании — Samsung, SK hynix и Micron, — и все три переводят мощности на HBM, быструю память для ИИ-ускорителей: с одной пластины она приносит выручки в три-пять раз больше. Итог предсказуем: по данным TrendForce, контрактные цены на обычную DRAM в первом квартале 2026-го подскочили примерно на 80% к предыдущему кварталу, а на третий квартал прогнозируется ещё 13–18%. HBM3E у Samsung и SK hynix на 2026 год подорожала почти на 20%. Заодно пострадали и игровые карты: NVIDIA сократила выпуск RTX 50-й серии на 30–40% в первом полугодии — те же линии кормят HBM.

Курс, логистика и посредники

К мировой цене в России добавляются три слоя. Курс: 20 августа 2026 года ЦБ установил доллар на уровне 85,13 рубля при средневзвешенном за месяц около 82,2 — любое движение сразу отражается на смете. Логистика: карты едут длинным путём, и в цену закладывается не только перевозка, но и риск, страховка, предоплата. Наконец, посредники: официальных каналов поставки нет, значит, между заводом и покупателем стоит цепочка, где каждое звено берёт свою маржу. Тот же слой возникает и в доступе к зарубежным сервисам: платить напрямую сложно, и комиссия за проведение платежа спокойно добавляет к счёту двузначные проценты.

Из чего вообще состоит стоимость

Разовые вложения против платы за токены

У любого ИИ-решения есть две разные экономики. Первая — капитальная: вы покупаете карты, ставите в стойку, платите за электричество и за человека, который всё обслуживает. Деньги уходят сразу и большие, зато каждый следующий запрос почти бесплатен. Вторая — переменная: платите только за токены, то есть за объём текста на входе и выходе. Вход дешевле выхода в разы: у GPT-5.6 Sol это 5 против 30 долларов за миллион, у Terra — 2 против 12. Ноль на старте, но счёт растёт вместе с использованием. Сравнивать эти экономики в лоб бесполезно: считать надо на горизонте года.

Считайте цену задачи, а не запроса

Цена одного обращения к модели почти ничего не говорит. Реальная единица — задача целиком: уточняющие вопросы, повторные прогоны, ручная доводка результата. Возьмите разбор трёхсот отзывов о продукте. Прогон на младшей модели стоит копейки — порядка 0,19 доллара, около 16 рублей. Тот же прогон на средней — примерно 1,9 доллара, около 160 рублей. Разница десятикратная, но суммы такие, что важнее другое: если младшая модель дала кривую сводку и человек потратил час на переделку, этот час стоит дороже всей годовой экономии на токенах.
Поэтому в чате Schai GPT сделаны три уровня модели, а не один: лёгкий — на черновики, перечисления и однотипный разбор, средний — на рабочие тексты и письма, старший — туда, где нужна длинная цепочка рассуждений. Переключение уровня под задачу и есть главный рычаг в счёте.
Экономия на токенах имеет смысл ровно до той границы, за которой начинается экономия на времени человека.

Своё железо или облако: считаем на примере

Небольшая компания, двадцать человек

Все цифры ниже — ориентировочные, на август 2026 года. Двадцать сотрудников, у каждого около 40 обращений к модели в рабочий день: письма, выжимки, черновики. Средний запрос — 3 тысячи токенов на входе и 700 на выходе. За месяц выходит примерно 17,6 тысячи запросов: около 53 млн входных и 12 млн выходных токенов. По тарифу средней модели (2 и 12 долларов за миллион) это примерно 250 долларов в месяц — около 21 тысячи рублей по августовскому курсу, порядка 260 тысяч рублей в год.
Теперь альтернативы. Аренда H100 в российском облаке в 2026 году идёт примерно от 340–350 рублей в час, H200 — от 420–430; при круглосуточной работе это 3–3,7 млн рублей в год, скидки за длинный срок сбивают цену на 10–50%. Своя H200 при цене в 75–90 тысяч долларов — 6,4–7,7 млн рублей только за карту, без сервера, стойки, электричества и администратора.
Разрыв не на проценты, а на порядок: платить за токены выходит в десять с лишним раз дешевле аренды и в двадцать с лишним — дешевле покупки. Причём расчёт ещё оптимистичен для железа: купленная карта окупается только при постоянной загрузке, а у обычной компании она простаивает ночами и в выходные.

Когда своя карта всё-таки окупается

Такие случаи есть. Первый — данные, которые нельзя выпускать наружу: медицина, персональные данные, закрытые контуры; тогда вопрос не в деньгах вовсе. Второй — большой и ровный поток однотипных запросов: классификация, разметка, извлечение полей из документов круглые сутки. Третий — небольшая открытая модель, которой хватает потребительской видеокарты: здесь вход измеряется не миллионами, а десятками тысяч рублей, и арифметика меняется целиком.

Что реально снижает счёт

Пять приёмов, которые снижают счёт, и один, который только выглядит экономией. Тарифы поставщиков на август 2026, ориентировочно

Модель под задачу, а не самая умная на всё

Самая частая утечка денег — привычка гонять всё через флагман. Разница между младшим и старшим уровнем сегодня — 25 раз по входу (0,20 против 5 долларов за миллион) и столько же по выходу. Переписать письмо, сделать выжимку, разложить список по категориям — работа для младшей модели, и качество не проседает. Флагман нужен там, где ошибка дорого стоит: разбор договора, архитектурное решение, код, который пойдёт в продакшн.

Короткий контекст и кэш

Второй источник перерасхода — контекст. Многие интерфейсы по умолчанию отправляют всю историю переписки в каждом запросе, и вы платите за неё заново на каждом ходу. Отрезайте лишнее: держите инструкцию и несколько последних реплик, а документ подкладывайте фрагментом, а не целиком. Сменилась тема — начните новый диалог, это дешевле, чем тянуть за собой сорок сообщений.
Если общее начало запроса повторяется — системная инструкция, прайс-лист, регламент, — включайте кэширование промпта. У линейки GPT-5.4–5.6 кэшированный вход тарифицируется примерно по 10% от обычного, то есть повторяющаяся часть обходится в десять раз дешевле. Кэш живёт недолго, порядка получаса, поэтому выгоден при плотном потоке запросов, а не при одном письме в день.

Пакеты и открытые модели

Если результат нужен не сию секунду — используйте пакетный режим. Batch API даёт ровно −50% и на входе, и на выходе в обмен на ожидание до суток, а на практике задания выполняются быстрее. Ночная обработка отзывов, разметка базы, генерация описаний товаров — идеальные кандидаты, и скидки складываются: кэш и пакет применяются вместе.
И последнее: для простых массовых операций посмотрите открытые модели. Qwen3.7 Flash по 0,03 доллара за миллион входных токенов или DeepSeek V4 Flash по 0,14 — другой ценовой класс. К концу июля 2026 года китайские модели набрали на открытых маршрутизаторах около 66,5% объёма токенов — в основном как раз на такой рутине.

Чего экономия не стоит

На сложном рассуждении дешёвая модель обходится дороже

У экономии есть зеркальная сторона. На задачах с длинной цепочкой рассуждений — свести бюджет, найти противоречие в договоре, отладить нетривиальный код — младшая модель ошибается чаще, и каждая ошибка стоит нового прогона плюс времени человека. Три попытки на дешёвой модели по цене одной попытки на дорогой — это уже не экономия, а размен денег на ваше внимание по невыгодному курсу. Правило простое: если результат придётся проверять построчно, берите уровень выше сразу; если результат — черновик, который вы и так перепишете, берите ниже.
Не стоит экономить и на длине ответа там, где нужны детали: обрезанный лимит выходных токенов даёт оборванную мысль, и вы платите второй раз — за продолжение. Ложная экономия и собирать инфраструктуру «на всякий случай»: железо стареет, а простаивающая карта не возвращает вложенное.

Что сделать на этой неделе

Короткий порядок действий, который окупается быстрее любых закупок. Первое — посмотрите, что вы гоняете через самый дорогой уровень, и переведите половину на средний или младший: в Schai GPT это одно переключение перед отправкой. Второе — сократите контекст. Третье — вынесите несрочное в пакетный режим. Четвёртое — включите кэш на повторяющемся начале запроса. Пятое — прежде чем считать закупку железа, честно посчитайте годовой объём токенов: почти всегда окажется, что покупать нечего.
Подорожание входного билета — реальная история, но она про тех, кто строит инфраструктуру. Для тех, кто моделями просто пользуется, год вышел противоположным: работа ИИ подешевела, а разница между аккуратным и неаккуратным счётом теперь больше, чем разница между поставщиками.
0

Пока нет комментариев

ИИ в России подорожал втрое: разбор счёта