Как перевести аудио в текст бесплатно

Бесплатных способов несколько: диктовка встроенными средствами телефона, готовые субтитры площадки, онлайн-сервисы распознавания, офисные инструменты с голосовым вводом и телеграм-боты. Быстрее всего с телефона — отправить запись боту @homyak_video_bot и нажать «Текст»: субтитры часовой записи приходят за 8 секунд, а распознавание речи работает бесплатно и без регистрации, только тяжёлые операции идут по очереди. Текст приходит без знаков препинания.

Три источника текста: откуда берётся расшифровка

Задача всегда звучит одинаково — есть запись, нужен текст. А поводы разные:

Сразу уберём путаницу в слове «перевести»: речь про перенос звучащей речи в буквы, а не про перевод на другой язык. Транскрибация аудио в текст, расшифровка аудиофайла и «перевод записи в текст» — три названия одного действия.

Технически текст берётся всего из трёх мест, и от этого зависит, какой способ вам подойдёт:

  1. Текст уже существует. У ролика на площадке есть субтитры, у встречи в сервисе видеозвонков — автоматический протокол. Распознавать нечего, готовый текст просто забирается.
  2. Машина слушает запись. Распознавание речи, оно же нейросеть для транскрибации: на входе аудиофайл, на выходе поток слов. Быстро, бесплатные варианты есть, но результат приходится вычитывать.
  3. Человек слушает и печатает. Медленно, зато на плохом звуке точнее любой машины.

Всё остальное — оболочки вокруг этих трёх путей: приложение на телефоне, сайт в браузере, бот в мессенджере. Дальше — шесть способов, которыми люди реально пользуются, с честными минусами каждого.

Способ 1. Встроенная диктовка в телефоне

Самый дешёвый вариант, потому что он уже у вас в кармане. На клавиатуре телефона есть значок микрофона: нажимаете и говорите, слова появляются в поле ввода. Отдельная программа для перевода голоса в текст тут не нужна — распознавание встроено в систему.

  1. Откройте любое поле ввода: заметки, мессенджер, почту.
  2. Нажмите значок микрофона на клавиатуре и разрешите доступ к записи звука, если система спросит.
  3. Говорите обычным темпом, короткими фразами, с паузами между предложениями.
  4. Проверьте текст и поправьте руками — имена, термины и цифры машина слышит хуже всего.

Где удобен. Надиктовать заметку, письмо, черновик поста, список покупок. Работает мгновенно, ничего не грузится на чужой сервер, стоит ноль.

Где неудобен. Главное ограничение обычно выясняется через минуту: диктовка распознаёт только живую речь в микрофон прямо сейчас. Скормить ей готовый аудиофайл нельзя. Хитрость «поднести телефон к колонке и включить запись» работает плохо: динамик даёт эхо, распознавание сыпется на первых же фразах. Плюс экран должен быть включён, а на длинной диктовке ввод рвётся на паузах.

Итог: годится, когда текст рождается прямо сейчас, и почти бесполезен, когда запись уже лежит файлом.

Способ 2. Готовые субтитры площадки — если запись оттуда

Если аудио взято из ролика на видеоплощадке, текст, возможно, уже существует. Автор мог загрузить субтитры сам, а площадка — сгенерировать их автоматически. Это самый быстрый путь из всех: распознавать ничего не надо, текст просто скачивается. Часовой стрим превращается в текст примерно за 8 секунд.

Где удобен. Лекции, вебинары, стримы, интервью, подкасты — всё, что опубликовано открыто. Ноль ожидания, ноль лимитов.

Где неудобен:

Практический вывод: если запись с площадки, начинать надо отсюда. Проверить наличие субтитров можно в самом плеере — там есть режим просмотра расшифровки рядом с видео. Забрать текст целиком проще ботом: он сначала ищет готовые субтитры и берётся за распознавание, только если их нет.

Способ 3. Онлайн-сервисы распознавания речи

Категория, которую чаще всего и ищут по запросу «расшифровка аудио онлайн»: открываете сайт, загружаете файл, ждёте, забираете текст. Внутри у всех примерно одно и то же — нейросеть, обученная на речи.

Где удобны. Работают с готовым файлом, ничего не надо устанавливать, многие расставляют базовую пунктуацию и таймкоды, отдают результат сразу в нескольких форматах. Для одной записи в браузере на компьютере это спокойный вариант.

Где неудобны, если говорить честно:

Отдельная деталь про размер. Если исходник — видео, а нужен только голос, разумно сначала вытащить аудиодорожку: часовая запись звуком весит 25-30 МБ против 600-900 МБ у видео в 1080p. Загрузка ускоряется в десятки раз, а распознаванию картинка не нужна.

Способ 4. Офисные и облачные инструменты

Здесь речь про то, что уже входит в рабочий набор и часто просто не замечается.

Текстовые редакторы с голосовым набором. И настольные, и облачные офисные пакеты умеют печатать под диктовку прямо в документ. Логика та же, что у телефонной диктовки: слушается микрофон, готовый файл подсунуть нельзя. Зато текст сразу оказывается там, где вы будете его править.

Сервисы видеовстреч с автоматическим протоколом. Расшифровка ведётся во время встречи, после неё текст лежит рядом с записью — часто ещё и разложенный по участникам, что для совещания важнее любой пунктуации. Минусы: работает только для встреч в этом самом сервисе, чужую запись задним числом туда не загрузишь, а сама функция нередко живёт в платных тарифах.

Корпоративные облачные хранилища. Некоторые распознают речь в загруженных медиафайлах и делают её доступной для поиска. Полезно, когда записей много и нужно найти нужную, а не вычитать одну.

Кому подходит. Тем, кто и так живёт в этом наборе: аккаунт есть, платить отдельно не надо, ничего искать не нужно. Для разовой задачи с телефона — перебор, потому что придётся заводить учётную запись ради одной записи.

Способ 5. Расшифровка вручную

Способ, который не стоит списывать со счетов. Бывают записи, где машина проигрывает всухую: несколько человек говорят одновременно, сильный акцент, специальная терминология, шум стройки за окном, диктофон лежал в кармане. Плюс случаи, где ошибка недопустима в принципе, — юридически значимая запись или интервью для публикации под именем спикера.

Чтобы это не растянулось на выходные:

  1. Выньте из видео звуковую дорожку и работайте с аудиофайлом — так проще перематывать и меньше нагрузка на устройство.
  2. Возьмите плеер, где есть замедление и откат на несколько секунд одной клавишей.
  3. Поставьте скорость в районе 0,7-0,8 — на замедленной речи успеваешь печатать почти синхронно.
  4. Печатайте блоками по 15-20 секунд, не возвращаясь за каждым словом.
  5. Сначала прогоните черновик целиком, вычитку и знаки препинания оставьте на второй проход.
  6. Проставляйте таймкоды у важных мест — потом не придётся искать цитату на слух.

Что стоит. Денег — ноль, времени — в разы больше, чем длится сама запись. Час беседы вручную за час не расшифровывается никогда.

Разумный компромисс, которым пользуются профессионально: машина делает черновик, человек его вычитывает. Это быстрее чистой ручной работы и точнее чистой машинной.

Способ 6. Телеграм-бот: когда нужно быстро и с телефона

Вариант, который выигрывает ровно в одной ситуации: телефон в руке, запись под рукой, текст нужен сейчас. Ставить нечего, регистрироваться негде, всё происходит в мессенджере, который и так открыт.

  1. Откройте бота @homyak_video_bot.
  2. Отправьте ссылку на ролик — или сразу файл: видео, аудио, голосовое сообщение, видеокружок.
  3. Дождитесь карточки с названием, длительностью и размером.
  4. Нажмите «Текст».
  5. Заберите расшифровку из чата. Она остаётся в переписке и находится обычным поиском.

Внутри работает та самая логика из начала статьи: сначала бот проверяет, нет ли готовых субтитров у площадки, и только если их нет, включает распознавание речи. Поэтому лекция с ютуба превращается в текст почти мгновенно, а надиктованная в машине заметка — за время распознавания.

Что это стоит

Ничего: ни оплаты, ни регистрации, ни ввода карты — аккаунт в Telegram у вас и так есть. Рядом с расшифровкой под карточкой лежат и остальные кнопки: если кроме текста нужна сама запись, её можно забрать видео целиком или только звуковой дорожкой.

Разница между двумя путями к тексту чувствуется именно здесь. Готовые субтитры площадки — это скачивание готового файла, оно почти ничего не стоит и потому происходит за секунды. Распознавание речи — работа вычислительная, задачи идут по одной, общей очередью на всех пользователей, поэтому в час пик ответ приходит не мгновенно. Ждать у экрана не нужно: текст падает в чат сам.

Кроме полной расшифровки есть краткая выжимка содержания и разделение двоих говорящих по репликам — обе функции работают, но пока в состоянии беты.

Голосовое сообщение в текст

Отдельный частый случай, ради которого люди и ищут программу для перевода голосового сообщения в текст. Ставить ничего не нужно: перешлите голосовое боту и нажмите ту же кнопку. Так же обрабатываются видеокружки и присланные кем-то аудиофайлы — формат определяется по содержимому, а не по расширению.

Где бот неудобен

Разделение трёх и более участников — то, что нужно для протокола совещания, — пока в работе и появится позже. Двоих собеседников бот уже разводит по репликам, но функция свежая.

Сравнение способов: что выбрать под свою задачу

Способ Что нужно Работает с готовым файлом Сколько бесплатно Главное неудобство
Диктовка в телефоне ничего ставить не надо нет, только живая речь в микрофон полностью бесплатно запись файлом не подсунуть
Готовые субтитры площадки ссылка на ролик нет, только опубликованное без ограничений субтитры есть не у всех роликов
Онлайн-сервис распознавания браузер и загрузка файла да ограниченно, дальше подписка долгая загрузка, файл уходит на чужой сервер
Офисные и облачные инструменты аккаунт в этом наборе частично зависит от тарифа привязка к своей экосистеме
Расшифровка вручную плеер и клавиатура да бесплатно, кроме времени занимает в разы больше, чем длится запись
Телеграм-бот Telegram, ссылка или файл да бесплатно, без регистрации текст без знаков препинания, очередь в час пик

Кому что подходит

Что влияет на качество расшифровки

Одна и та же машина на разных записях выдаёт разный результат. Заранее ухудшают дело:

Отсюда простое правило: качество текста закладывается в момент записи. Микрофон ближе к говорящему, окно закрыто, собеседники по очереди — и любой из перечисленных способов сработает заметно лучше.

Про знаки препинания

Ни одна бесплатная машинная расшифровка не отдаёт готовый вычитанный документ. Распознавание разбирает слова, но не интонацию, поэтому текст приходит сплошным потоком, а точки и запятые в нём приходится расставлять самому. Что с этим делают на практике:

Так что честный ответ на вопрос «можно ли перевести аудио в текст бесплатно» звучит так: получить текст — да, легко и несколькими путями. Получить готовый к публикации текст без единой правки — нет, ни за какие деньги. Разница между способами не в том, дадут ли вам буквы, а в том, сколько работы останется после.

Пришлите запись Хомяку — он вернёт её текстом в тот же чат.

Открыть Хомяка в Telegram

Частые вопросы

Можно расшифровать аудио онлайн бесплатно и без регистрации?
Да, такие варианты есть, но чем меньше от вас требуют, тем жёстче ограничение по длине записи. У бота @homyak_video_bot регистрации нет вообще: готовые субтитры площадки приходят за секунды, распознавание речи тоже работает бесплатно, и карту никто не спрашивает.
Сколько ждать расшифровку часовой записи?
Если это ролик с площадки и у него есть субтитры, текст часового стрима приходит примерно за 8 секунд — распознавать ничего не нужно, готовый текст просто забирается. Если субтитров нет, работает распознавание речи, и время зависит от длины записи и очереди.
Почему в расшифровке нет знаков препинания?
Так устроено распознавание речи: машина слышит слова, но не слышит точек и запятых. Текст приходит сплошным потоком, и знаки расставляются потом руками или текстовым редактором. Это общее свойство машинной расшифровки, а не особенность конкретного сервиса.
Что можно отправить на расшифровку, кроме ссылки?
Свой файл: видео, аудио, голосовое сообщение, видеокружок. Формат бот определяет по содержимому, а не по расширению, поэтому переименованные и странные файлы тоже понимает. Если под рукой большое видео, разумнее сначала забрать из него только звук.
А если запись длинная — на час или на два?
Отправляйте как есть. Распознавание длинной беседы просто занимает больше времени, чем расшифровка пятиминутного войса, а в час пик к этому добавляется общая очередь. Если запись опубликована на площадке и у неё есть субтитры, текст приходит за секунды — распознавать нечего.
Бот различает, кто из собеседников говорит?
Разделение двоих говорящих есть, но функция свежая, в состоянии беты — работает, однако пока обкатывается. Разделение трёх и более участников — например, для записи совещания — появится позже.
Расшифровка переводится на другой язык?
Нет. Текст приходит на языке оригинала записи. Перевод на другой язык бот не делает — для этого нужен отдельный переводчик, куда готовую расшифровку можно вставить.