14 августа Alibaba выложила в открытый доступ Qwen3.8-27B — модель на 27 миллиардов параметров, которую после сжатия можно запустить на домашней видеокарте. За первые же выходные её скачали больше трёх миллионов раз, ещё до появления независимых замеров. Мы в Schai делаем облачный сервис и зарабатываем именно на нём, поэтому постараемся быть максимально честными: разберём без восторгов, что такое «открытая модель», какое железо ей нужно на самом деле, что она делает не хуже облака, где отстаёт — и кому вся эта затея реально сэкономит время и деньги, а кому нет.
Повод: модель, которая помещается в одну карту
Что именно выложили
Qwen3.8-27B — «плотная» модель на 27 миллиардов параметров, изначально мультимодальная: она принимает текст, изображения и видео. Родное контекстное окно — 262 144 токена, с расширением примерно до миллиона специальным приёмом растяжения. Лицензия — Apache 2.0: веса можно скачать, использовать в коммерческих продуктах, дообучать и перераспространять без отдельного разрешения. Это не флагман семейства: старшая модель Alibaba на 2,4 триллиона параметров живёт только на серверах и дома не запускается ни при каких условиях. Открыли именно «младшую», и в этом весь смысл новости.
Почему это заметили
Открытые модели выходят почти каждую неделю, но обычно приходится выбирать: либо она умная и требует стойку с серверными ускорителями, либо запускается на ноутбуке и заметно глупее. 27 миллиардов параметров — редкая точка равновесия. В сжатом виде файл занимает около 17,8 ГБ и целиком влезает в карту с 24 ГБ видеопамяти, то есть в RTX 3090 или 4090, которые стоят у многих просто ради игр. Отсюда и волна скачиваний: люди проверяли не бенчмарки, а сам факт «оно у меня заработало».
Открытая модель — это не открытый исходный код
Что вам отдают на самом деле
Почти всё, что в новостях называют «open source ИИ», на самом деле open weights — открытые веса. Вам отдают готовый результат обучения: многогигабайтный файл чисел, который можно скачать и запустить. Не отдают обучающий код, состав и происхождение данных, детали процедуры обучения. Повторить такую модель с нуля вы не сможете, изучить, на чём она училась, — тоже. Это как получить скомпилированную программу без исходников: пользоваться можно, разобраться в устройстве — нет.
Формальная планка существует: в октябре 2024 года Open Source Initiative опубликовала определение открытого ИИ, где требуются и параметры, и код обучения, и достаточные сведения о данных. Ему соответствуют единицы — например, OLMo и Pythia. Ни Llama, ни Qwen, ни DeepSeek, ни Gemma под это определение не подпадают, хотя все они регулярно так называются.
Лицензия — единственное, что стоит прочитать
Разница между «открытыми» моделями практически целиком сводится к лицензии, и она бывает существенной. Apache 2.0 и MIT — свободные условия: делайте что хотите, включая коммерческое использование. Так выложены Qwen, DeepSeek и gpt-oss от OpenAI. А вот у Llama действует собственная лицензия сообщества, где компаниям с аудиторией свыше 700 миллионов пользователей в месяц нужно отдельное разрешение, и Meta вправе отказать. Для частного человека разница нулевая, для бизнеса — принципиальная. Так что перед тем как встраивать модель в продукт, стоит потратить пять минут на файл LICENSE, а не на обзоры.
Что нужно железу
Видеопамять — главный ограничитель
Первое, что нужно понять: решает не мощность видеокарты, а объём и скорость её памяти. Модель должна поместиться в видеопамять целиком — тогда она работает быстро. Если не помещается, часть слоёв уезжает в обычную оперативную память, и скорость падает не на проценты, а в разы. Ровно поэтому старая RTX 3090 с 24 ГБ часто оказывается практичнее свежей карты с 12 ГБ: важнее не то, насколько быстро считает чип, а то, влезло ли всё.

Квантование: как модель ужимают
В исходном виде веса Qwen3.8-27B хранятся в 16-битном формате и требуют около 61 ГБ видеопамяти — это уровень серверных ускорителей. Квантование уменьшает точность каждого числа: вместо 16 бит на вес — 8, 5, 4 или даже 2. Модель при этом слегка «тупеет», но занимает кратно меньше места. Практические ориентиры для 27B такие: 8 бит — около 33 ГБ, нужна рабочая станция; 5 бит — 22 ГБ, впритык на 24-гигабайтной карте; 4 бита — примерно 19 ГБ, тот самый рабочий вариант для домашнего ПК. Есть и 2-битные сборки на 9,4 ГБ, формально влезающие в 16 ГБ, но качество там проседает заметно — обычно разумнее взять модель поменьше в честном 4-битном виде, чем большую в раздавленном.
Отдельно про контекст: цифры выше — это только веса. Диалог тоже занимает память, и чем он длиннее, тем больше. Заявленные 262 тысячи токенов на 24-гигабайтной карте недостижимы: с полным контекстом та же 4-битная версия потребует под 38 ГБ. На домашнем железе работают с окном в несколько десятков тысяч токенов — этого хватает для большинства задач, но «загрузить весь рабочий архив» не выйдет.
Что будет на слабой машине

На RTX 4090 с 5-битной сборкой получается около 33 токенов в секунду — быстрее, чем вы читаете. Мини-ПК на Ryzen AI Max+ 395 с общей памятью выдаёт до 24,5 токенов в секунду, чего тоже вполне достаточно. А вот при частичной выгрузке в оперативку остаётся 1–3 токена в секунду: ответ на короткий вопрос будет собираться минуту, и пользоваться этим ежедневно невозможно. На Mac ситуация мягче — там память общая, и 4-битная сборка под Apple Silicon укладывается примерно в 15 ГБ, так что решает объём памяти в конфигурации.
Если в компьютере 8 ГБ видеопамяти, о 27B стоит просто забыть и посмотреть на модели в 7–8 миллиардов параметров: они в 4-битном виде дают порядка 40 токенов в секунду и вполне справляются с бытовыми задачами. Если дискретной карты нет вовсе и есть только 8 ГБ системной памяти, реалистичный потолок — модели на 3–4 миллиарда параметров. И здесь важно не путать две разные вещи: 8 ГБ видеопамяти обслуживают только модель, а 8 ГБ оперативной памяти делятся между ней, операционной системой и всеми открытыми вкладками.
Что она делает не хуже облака, а что заметно хуже
Где разницы почти нет
Локальная модель уровня 27B уверенно тянет весь «черновой» слой работы с текстом: переписать абзац, сократить, сменить тон, составить письмо, сделать краткий пересказ документа, вытащить из накладной структурированные поля, перевести, разложить заметки по темам. Отдельно хорошо получается работа с личными файлами: поиск по своим документам и вопросы к ним — задача, где важнее аккуратность и контекст, чем эрудиция. Ещё она годится как «резиновая утка» для кода — объяснить незнакомый фрагмент, набросать функцию, найти опечатку в конфиге.
Где отставание видно сразу
Первое — свежие знания. Локальная модель знает мир по состоянию на дату обучения и не ходит в интернет, пока вы сами не приделаете ей поиск. Второе — длинные рассуждения: там, где нужно удержать десяток условий и не потерять нить, разрыв с крупными облачными моделями всё ещё честный. Третье — длинные задачи целиком: сложный рефакторинг на несколько файлов, разбор большого договора, многоходовые расчёты. Четвёртое — инструменты. В облаке модель окружена инфраструктурой: поиском, исполнением кода, доступом к вашим сервисам, памятью между сессиями. В Schai GPT ассистент, например, умеет собрать черновик поста, посмотреть статистику или найти файл на диске — не потому что модель умнее, а потому что вокруг неё выстроена обвязка, которую дома придётся собирать самому.
И ещё одно, общее для обоих вариантов: локальность не лечит выдумывание фактов. Модель на вашем ноутбуке ошибается ровно с той же уверенной интонацией, что и облачная, а иногда чаще — сжатие весов бьёт в первую очередь по редким фактам и точным числам. Проверять придётся так же.
Ради чего это затевают
Четыре настоящие причины
Приватность. Текст не покидает компьютер — ни в какой форме, ни в каких логах. Для медицинских записей, юридических черновиков, чужих персональных данных и коммерческой тайны это не паранойя, а иногда прямое требование регламента.
Отсутствие подписки. Заплатили один раз за железо — дальше платите только за электричество. Правда, окупаемость честнее считать вдумчиво: видеокарта на 24 ГБ стоит как несколько лет облачной подписки, и если вы задаёте три вопроса в неделю, экономии не будет.
Работа без интернета. Самолёт, дача, объект без связи, закрытый контур предприятия — здесь у локальной модели просто нет конкурентов.
Свобода настройки. Никто не поменяет модель без предупреждения, не отключит её и не введёт новые ограничения. Вы фиксируете конкретную версию, дообучаете её на своих данных, настраиваете системный промпт как хотите. Для тех, кого раздражает, что привычный инструмент внезапно начал отвечать иначе, это главный аргумент.
Кому попробовать, а кому проще платить за облако
Стоит попробовать, если
У вас уже есть карта на 16–24 ГБ или Mac с большим объёмом памяти — тогда эксперимент стоит только вечера времени. Вы работаете с данными, которые нельзя отправлять наружу. Вам нужен предсказуемый инструмент, не меняющийся от обновления к обновлению. Вы разработчик и хотите встроить модель в свой продукт без счёта за каждый токен. Или вам просто интересно, как это устроено, — это, кстати, вполне достаточная причина, и порог входа сегодня низкий: Ollama или LM Studio ставятся в пару кликов, модель скачивается одной командой.
Проще платить, если
Вы пользуетесь ИИ время от времени — подписка выйдет дешевле железа на годы вперёд. Вам нужны свежие данные, поиск, работа с почтой и календарём, генерация картинок и голос — дома всё это придётся собирать и поддерживать вручную. Вам важно максимальное качество на сложных задачах. Или у вас ноутбук без дискретной карты: 1–3 токена в секунду не станут рабочим инструментом, сколько ни настраивай.
Локальная модель — это не «бесплатный ChatGPT». Это отдельный инструмент со своим профилем: приватнее и надёжнее в автономности, слабее в знаниях и обвязке.
Разумный сценарий для большинства — не выбирать, а совмещать. Черновики, личные документы и всё чувствительное — локально, на своей машине. Сложные задачи, свежие данные, работа с сервисами и совместные проекты — в облаке, где вокруг модели уже собрана инфраструктура; у нас это Schai GPT, у кого-то другой сервис. Хорошая новость августа не в том, что облако стало не нужно, а в том, что нижняя планка поднялась: то, что год назад требовало серверной стойки, теперь запускается на игровом компьютере. И это, пожалуй, важнее любых бенчмарков.


Пока нет комментариев