В начале августа разработчик под ником SlvDev показал фокус, который пару лет назад сошёл бы за розыгрыш: языковая модель заработала на микроконтроллере ESP32-S3 — плате примерно за десять долларов. Не «подключилась к серверу», а считала сама. Около 9,9 токена в секунду — примерно скорость неспешной человеческой печати.
Модель — TinyStories на 28,9 миллиона параметров, её когда-то собрали в Microsoft Research. Чтобы она влезла, веса урезали до четырёх бит: файл похудел с 60 мегабайт до 14,9. Потом применили приём из линейки Gemma — часть таблиц, ещё около 25 миллионов параметров, вынесли во флеш-память, откуда они подтягиваются по мере надобности. В активной памяти осталось примерно два мегабайта.
Умеет — но что именно
Тут важно не залипнуть на цифре, а спросить: что эта штука делает? Ответ отрезвляет. TinyStories пишет короткие связные рассказы на английском — на уровне детской книжки. Ни диалога, ни кода, ни работы с вашими файлами. Это не карманный ChatGPT, это доказательство, что нижняя граница ушла очень глубоко.
Настоящая история про телефоны — в другом месте. В те же дни компания Liquid AI выложила LFM2.5-2.6B: 2,69 миллиарда параметров, контекст в 131 тысячу токенов, вызов инструментов из коробки. На смартфоне помещается меньше чем в 2,5 гигабайта памяти и выдаёт около 30 токенов в секунду, на топовом ноутбучном чипе — до 220. Вот это уже похоже на помощника, который живёт внутри устройства.
И сразу оговорка от самих авторов: для программирования и задач, где нужны широкие знания о мире, они свою разработку не рекомендуют. Её сила в другом — узкие повторяющиеся дела. Разобрать письмо, дёрнуть календарь, вызвать нужный инструмент.

Потолок — не «мощность», а скорость памяти
Обычно предел объясняют так: «в телефоне слабый процессор». Это неточно. Нейроблоки свежих мобильных чипов выдают десятки триллионов операций в секунду — по сырым числам уровень серверных ускорителей середины прошлого десятилетия. Проблема в другом.
Генерируя текст, модель на каждый токен вычитывает свои веса из памяти. Значит, упирается она не в счёт, а в то, как быстро память эти веса отдаёт. У мобильных устройств пропускная способность около 50–90 гигабайт в секунду, у серверных карт — 2–3 терабайта. Разрыв в тридцать-пятьдесят раз, и никакая оптимизация его не отменяет.
Локальная модель ограничена не тем, сколько успевает посчитать, а тем, сколько успевает прочитать.
Отсюда всё остальное. И почему крупная модель в карман не лезет, и почему при долгой генерации корпус греется, а заряд тает на глазах: непрерывное чтение памяти — самая дорогая по энергии часть работы.

Что уже происходит без вашего ведома
Локальные модели тем временем расползаются по технике тихо. Весной выяснилось, что Chrome кладёт на диск компьютера четырёхгигабайтный файл — для встроенных функций вроде «помоги написать» и распознавания мошеннических страниц. Удалите — браузер скачает заново. Многие узнали об этом, только когда пошли искать, куда девалось место.
Это к вопросу о приватности с неожиданной стороны. «Считается на устройстве» действительно значит, что текст никуда не уходит. Но оно же значит, что модель у вас уже стоит — просто вы её не заказывали.
Почему тяжёлое всё равно уезжает на сервер
Есть задачи, которые в телефон не поместятся ни при каком прогрессе ближайших лет. Генерация видео — самая наглядная: она идёт минутами, требует на порядки больше памяти и упирается ровно в тот же разрыв по пропускной способности.
У нас это устроено честно и заметно. Когда вы просите Schai GPT сделать видео, задача считается не в браузере и даже не в памяти конкретного процесса — она сразу записывается в базу. Поэтому её не убивает ни обновление страницы, ни выкатка новой версии сайта: любой живой сервер подхватит задачу и доведёт до конца. Ровно того, чего локальная модель дать не может — она умирает вместе со свёрнутым приложением.
Что с этого обычному человеку
Приватность
Реальная, но узкая. Локально считаются вычитка, пересказ, распознавание речи, подсказки клавиатуры — и это уже немало. Но как только задаче нужны свежие факты или длинная цепочка рассуждений, она уходит наружу. И приватность снова становится вопросом доверия к сервису, а не к железу в руках.
Скорость
На коротких ответах телефон выигрывает: ждать сеть не нужно, первые буквы появляются почти мгновенно. На длинных проигрывает вчистую — те самые тридцать токенов в секунду против сотен на сервере.
Работа без сети
Здесь польза бесспорна. Помощник в кармане не зависит ни от вышки в глухом районе, ни от роуминга, ни от перегруженного вайфая в кафе. Заодно это повод пересобрать свой офлайн-набор целиком.
Простое правило
Коротко, часто и лично — оставляйте на устройстве. Долго, тяжело и редко — отдавайте серверу. Гибрид тут не компромисс от бедности, а нормальная инженерия: одно железо не бывает лучшим сразу для всего.
И держите в голове неприятную мелочь: маленькая модель ошибается охотнее большой. Фактов в неё помещается меньше, а уверенности в голосе столько же.


Пока нет комментариев