Статья

Голосом или текстом: когда диктовать ассистенту быстрее, чем печатать

Голосом или текстом: когда диктовать ассистенту быстрее, чем печатать

ProfileProfile·1 ч назад·
3
··0·
Идёте по улице, в голове сложилась мысль, которую жалко потерять. Достаёте телефон, тыкаете в клавиатуру одним пальцем, автозамена превращает «релиз» в «рельс». Пока боретесь с экраном, мысль уже не та. Рядом — кнопка микрофона, и каждый решает на ощупь: наговорить или всё-таки набрать.
Ответ зависит не от привычки, а от типа текста. Разберём по цифрам и по практике.

Откуда взялось «втрое быстрее»

Самое известное измерение сделали в Стэнфорде в 2016 году: 32 участника набирали короткие сообщения на iPhone, а те же фразы наговаривали в систему распознавания. Наговорить оказалось примерно втрое быстрее — около 161 слова в минуту против 53 при наборе, — и ошибок в итоговом тексте было на 20% меньше. На китайском разрыв составил 2,8 раза.
Второй ориентир — исследование Aalto, Кембриджа и ETH Zürich 2019 года: 37 тысяч добровольцев показали среднюю скорость на смартфоне 36 слов в минуту. На физической клавиатуре большинство людей держится в диапазоне 30–60 слов. А обычный темп русской речи — 100–120 слов в минуту, причём это спокойная разборчивая речь, а не скороговорка.
Голос выигрывает не потому, что вы говорите быстро, а потому что печатаете медленно. Разрыв создаёт клавиатура.
Слов в минуту: речь против набора, и какие задачи кому отдать
Важная поправка: в лабораторных тестах меряют короткие фразы. В реальной работе к надиктованному добавляется правка, и именно она решает, останется ли выигрыш.

Где диктовка честно выигрывает

Длинные заметки на ходу

Самый очевидный сценарий: руки заняты, экран мелкий, а сказать нужно абзацев на пять. Вышли со встречи и пересказали её вслух, пока помните детали; идёте с прогулки и надиктовали план на неделю. Тут скорость набора — это буквально скорость мысли, а клавиатура становится узким горлышком.

Черновики писем и постов

Устная речь честнее письменной: вы объясняете так, как объяснили бы человеку, без канцелярита и без вылизывания первой фразы. Получается сырой, но живой текст, который потом легко причесать. Просить ассистента сделать письмо «с нуля» почти всегда хуже: он не знает контекста, и вы получаете красивую пустоту.

Выгрузить кашу из головы

Отдельный жанр — сумбурный монолог на три минуты: тревоги, идеи, обрывки задач. Печатать такое лень, а наговорить легко. Дальше ассистента можно попросить разложить сказанное по пунктам и вернуть список дел — исходную кашу разбирать вам уже не придётся.

Где голос проигрывает

Первое — точные данные. Номера счетов, суммы, даты, адреса почты, пароли. Одна перепутанная цифра стоит дороже, чем весь сэкономленный час, а на слух ошибка почти не видна: строка выглядит правдоподобно. Такие фрагменты набирайте руками, даже если весь остальной текст надиктован.
Второе — код, команды и ссылки. Символы вроде подчёркивания, слеша и скобок в речи не живут, и попытка их проговаривать выходит медленнее набора. Третье — структурированные списки: диктуя, легко потерять уровень вложенности и получить сплошное полотно, которое потом дольше разбирать, чем написать заново.
Четвёртое — шум. Он бьёт по точности измеримо: в сравнении русских распознавателей 2025 года лучшая из проверенных моделей давала 15,5% ошибок на чистой записи и 21,8% на зашумлённой, а другая популярная система проседала с 16,4% до 28,2%. В метро, кафе или машине с открытым окном диктовка превращается в редактуру.

Имена и термины: главная слабость распознавания

На обычной речи современные русские системы ошибаются в единицах процентов: на открытом наборе Common Voice у свежих моделей выходит около 1% ошибок, у зарубежного Whisper large-v3 — 5,5%. Но эти проценты про обычные слова. Фамилии, названия компаний, продуктовые термины и аббревиатуры в обучающих данных редки, поэтому система подставляет похожее по звучанию: бренд превращается в бытовое слово, а термин — в набор знакомых корней.
Что с этим делать. Не бороться во время речи: остановки на каждое имя убивают весь выигрыш. Проговорите текст потоком, а потом замените неверные слова поиском — их обычно два-три на страницу. Если название повторяется часто, задайте его один раз в начале сообщения: «Дальше везде, где слышится „озвен“, пиши Ozven латиницей». Числа и даты диктуйте отдельной короткой фразой и сразу перечитывайте — глазами это быстрее, чем потом искать ошибку в готовом письме.

Править, а не переписывать заново

Типичная ошибка новичка: увидел кривую расшифровку, стёр всё и набрал руками. После этого кажется, что голос бесполезен, хотя проблема в подходе.
Работает другое. Наговаривайте блоками по два-три предложения, а не десятиминутной лентой: короткий кусок легче проверить и переговорить. Чините только смысловые ошибки — имена, цифры, перепутанные слова. А стилистику отдайте ассистенту отдельной просьбой: «причеши это в письмо клиенту, ничего не добавляя от себя и не выдумывая фактов». Формулировка про «не добавляя» здесь ключевая — иначе в текст приедут детали, которых вы не говорили.

Как это устроено в Schai GPT

В поле ввода есть кнопка микрофона. Распознавание идёт средствами браузера, язык — русский, а текст появляется прямо в поле по мере того, как вы говорите, и дописывается к тому, что уже было набрано. Одно нажатие — одна реплика: после паузы запись останавливается сама, нажмите ещё раз, чтобы продолжить.
Ничего не отправляется автоматически: сначала вы правите текст, потом жмёте отправку. Это и есть главное преимущество над «голосовым помощником» — между речью и результатом остаётся шаг, на котором можно всё исправить. Работает не везде: браузеры без поддержки распознавания речи честно сообщат, что голосовой ввод недоступен, и останется клавиатура.

Короткое правило

Голос — для объёма и черновиков: длинная заметка, пересказ, сырой текст письма. Клавиатура — для точности: цифры, код, ссылки, структура. Смешанный режим нормален и почти всегда оптимален: наговорили абзац, дописали реквизиты руками, попросили ассистента собрать всё в чистовик.
И ещё один нюанс, который экономит время: если ассистент уже знает ваш контекст — проекты, имена, тон писем, — надиктованное превращается в готовый текст с меньшим числом правок. Настройка помощника под себя окупается именно здесь.
0

Пока нет комментариев

Голосом или текстом: когда диктовать быстрее