Содержание
Рейтинг ИИ-инструментов для субтитров по точности
Точность распознавания речи измеряют показателем WER — долей слов, которые модель записала неправильно, пропустила или добавила лишними. Чтобы цифра стала ощутимой, переведу её в работу: в среднем человек произносит около 140 слов в минуту. Значит, 2% WER — это примерно три ошибки на каждую минуту видео, а 10% — уже четырнадцать.
Рейтинг Artificial Analysis составлен на восьми часах аудио из трёх наборов: разговоры с голосовыми ассистентами, выступления в Европарламенте и финансовые конференц-звонки. Состояние на сентябрь 2026 года:
| Движок распознавания | Ошибочных слов (AA-WER) | Правок на минуту видео, ориентировочно | Цена за 1000 мин |
|---|---|---|---|
| Microsoft MAI-Transcribe-2 | 2,0% | ~3 | $1,67 |
| ElevenLabs Scribe v2 | 2,2% | ~3 | $3,67 |
| Google Gemini 3.5 Transcribe | 2,6% | ~4 | $5,00 |
| OpenAI GPT Transcribe | 3,3% | ~5 | $4,50 |
| AssemblyAI Universal | 3,8% | ~5 | $2,50 |
| OpenAI GPT-4o Transcribe | 4,0% | ~6 | $6,00 |
| Whisper Large v3 (fal.ai) | 4,1% | ~6 | $1,15 |
| Speechmatics Melia | 4,9% | ~7 | $4,00 |
| Deepgram Nova-3 | 5,2% | ~7 | $4,30 |
| Whisper Large v3 (Replicate) | 10,1% | ~14 | $4,23 |
Одна оговорка, о которой редко говорят: эти наборы данных преимущественно англоязычные. Лидер английского не обязательно лидер украинского, и для нашего языка порядок в таблице может быть другим.
Лидеры в рейтинге меняются буквально каждый месяц, поэтому перед выбором стоит взглянуть на актуальную версию.
Почему одна и та же модель даёт разную точность
Посмотрите на две строки с Whisper Large v3. Модель одна и та же, а ошибок 4,1% у одного провайдера и 10,1% у другого — разница больше чем вдвое.
Причина в реализации: как аудио делят на фрагменты, как обрабатывают тишину, какие настройки декодирования используют. Для вас из этого следует практический вывод. Надпись «работает на Whisper» в описании сервиса ничего не гарантирует. Два приложения на одной модели могут давать совершенно разный результат, и проверять нужно сам инструмент, а не модель под капотом.

Какой сервис точнее всего распознаёт украинский язык для субтитров
Независимого рейтинга именно для украинского, к сожалению, нет. Ориентироваться приходится на тесты разработчиков и на собственную проверку.
- ElevenLabs Scribe — лучший опубликованный результат: 3,1% ошибок на FLEURS. Разработчик относит украинский к группе языков с «отличной точностью» (менее 5% ошибок).
- Автосубтитры YouTube поддерживают украинский с 2022 года и бесплатны для собственных видео.
- Instagram на старте функции автосубтитров поддерживал 17 языков, и украинского среди них не было. Проверьте, появился ли он в вашем аккаунте, прежде чем на это рассчитывать.
- CapCut, TikTok, видеоредакторы — список языков для автосубтитров зависит от версии приложения, поэтому проверяйте в настройках, а не по описанию в магазине приложений.
Теперь о ловушке, о которой стоит знать. FLEURS — это набор, где люди читают вслух подготовленные предложения: чётко, без шума, без сленга. Живое видео с суржиком, английскими терминами и музыкой на фоне даст заметно больше ошибок, чем 3,1%, у любого инструмента.
Поэтому мой рабочий способ выбора прост: беру 2-3 минуты реального ролика клиента, прогоняю через два-три сервиса и считаю, сколько слов приходится исправлять. Это занимает полчаса и даёт более точный ответ, чем любой рейтинг.
Если вам нужна расшифровка не видео, а звонков и встреч — там другие инструменты и другие критерии, и о них есть отдельная статья: «ИИ-инструменты для транскрибации звонков».
Лучший генератор субтитров на основе ИИ: что выбрать под задачу
Лучшего инструмента «для всего» нет. Есть лучший под конкретную задачу:
| Задача | Что выбрать | Почему |
|---|---|---|
| Ролик на украинском для YouTube | автосубтитры YouTube + правка в Студии | бесплатно, украинский поддерживается, сразу отдельный файл |
| Вшитые субтитры для Reels и TikTok | видеоредактор с автосубтитрами | стилизация, анимация слов, сразу в кадре |
| Максимальная точность, большие объёмы | движки из таблицы через API: Scribe, Gemini, AssemblyAI | верх рейтинга, оплата за минуты |
| Бесплатно, без лимитов, конфиденциально | Whisper через Subtitle Edit на своём компьютере | файл не покидает ваше устройство |
| Бесплатно онлайн, несколько роликов в день | TurboScribe | не нужно ничего устанавливать |
| Интервью и подкасты с несколькими спикерами | движок с разделением говорящих | подписывает, кто именно говорит |
Для команды, которая делает контент сразу для нескольких платформ, самая удобная схема такая: сгенерировать субтитры один раз в точном сервисе, вычитать, сохранить файлом SRT и уже его импортировать в редактор под каждую платформу. Так правки делаются один раз, а не трижды.
Лучшие бесплатные генераторы субтитров
| Инструмент | На чём работает | Лимит | Украинский | Экспорт |
|---|---|---|---|---|
| YouTube Studio | распознавание Google | без лимита для собственных видео | да | файл субтитров для скачивания |
| Subtitle Edit | Whisper, локально | без лимита | да | SRT и другие форматы |
| TurboScribe | Whisper Large v3 | 3 файла в день до 30 мин каждый | да | SRT, TXT, DOCX, PDF |
У каждого из трёх свой компромисс:
- YouTube — самый простой, но работает только с теми видео, которые вы загрузили на канал. Для Reels придётся сначала загрузить ролик на YouTube как приватный.
- Subtitle Edit — больше всего свободы: открытая программа, модели Whisper загружаются автоматически при первом запуске, и видео никуда не отправляется. Минус — скорость зависит от вашего компьютера, на слабом ноутбуке часовой ролик может обрабатываться долго.
- TurboScribe — самый удобный онлайн, но лимит в три файла в день подходит блогеру, а не агентству.
Почему ИИ ошибается в субтитрах
Ошибки распознавания не случайны. Они концентрируются в нескольких предсказуемых местах, и если знать эти места, вычитывать субтитры становится вдвое быстрее.

Галлюцинации на паузах и музыке
Самый неприятный тип ошибки — когда модель пишет фразу, которой в аудио не было вообще. Исследователи из нескольких американских университетов проверили Whisper и обнаружили, что примерно 1% транскрипций содержал полностью выдуманные фразы или предложения. Причём 38% таких выдумок были не нейтральными, а вредными: с агрессивной лексикой, ложными утверждениями или фальшивыми ссылками на авторитет. Чаще всего галлюцинации возникали там, где в речи были долгие паузы.
Практический вывод:
- Генерируйте субтитры до наложения фоновой музыки. Музыка под тихим голосом и паузы — самая благоприятная среда для выдумок.
- Вычитывайте места после пауз внимательнее, чем остальной текст: именно там модель чаще всего «дорисовывает» то, чего не слышала.
Имена собственные, термины и цифры
Название бренда, фамилия гостя, технический термин — модель подставит ближайшее знакомое ей слово. Цифры она может записать и словами, и числом, причём непоследовательно в пределах одного ролика.
Часть сервисов позволяет заранее задать список специфических слов или подсказку с контекстом. Если вы регулярно снимаете об одном продукте или отрасли, это самый эффективный способ сократить правки: пять минут на словарь экономят десятки исправлений в каждом ролике.
Распознаёт ли ИИ несколько языков в одном видео
Плохо, и для украинского контента это одна из самых распространённых проблем.
Whisper, на котором работает значительная часть бесплатных инструментов, определяет язык в начале записи и дальше привязывает один язык к каждому 30-секундному фрагменту. Если ролик начинается на украинском, а посередине спикер переходит на английский, модель может записать английские фразы украинскими буквами или перевести их. Суржик и английские термины внутри украинского предложения ломают распознавание ещё сильнее: там язык меняется несколько раз в пределах одной фразы.
Что помогает:
- Указывайте язык вручную, а не полагайтесь на автоопределение, особенно если первые секунды ролика — музыка, интро или другой язык.
- Разбивайте видео на части по языкам, если в нём есть длинные фрагменты на разных языках.
- Закладывайте больше времени на вычитку роликов, где английские термины звучат внутри украинских предложений. Такое смешение остаётся сложным для всех моделей.
Часто задаваемые вопросы (FAQ)
От чего зависит качество автоматической транскрипции?
Больше всего — от звука. Петличный микрофон на расстоянии 15–20 см ото рта, отдельная звуковая дорожка без музыки и отсутствие эха в помещении дают больший прирост точности, чем переход на более дорогой сервис.
Почему ни один ИИ не даёт 100% точность субтитров?
Потому что разговорная речь неоднозначна даже для людей: профессиональные транскрибаторы на телефонных разговорах ошибаются примерно в 5% слов. Нечёткое произношение, наложение голосов и слова, которые звучат одинаково, не имеют одного правильного ответа.
Как выбрать инструмент для субтитров под конкретную платформу (YouTube, Instagram, TikTok)?
Для YouTube — отдельный файл субтитров, сгенерированный в Студии или загруженный из другого сервиса. Для Instagram и TikTok — вшитые субтитры из видеоредактора, потому что ленту часто листают без звука и субтитры должны быть в самом кадре.
Вшитые субтитры или отдельный файл — что лучше?
Отдельный файл зритель может выключить, его можно исправить без перемонтажа и дополнить переводом. Вшитые видно всегда и можно оформить в стиле бренда, но любая ошибка в них требует нового рендера видео.
В каком формате сохранять субтитры: SRT или VTT?
SRT — если нужна максимальная совместимость: его открывают почти все редакторы и платформы. VTT — веб-формат, который дополнительно поддерживает стили и расположение текста на экране.
Сколько символов должно быть в строке субтитров?
Стандарт стриминговых платформ — до 42 символов в строке и не больше двух строк на экране. Для вертикального видео строки делают короче, потому что ширина кадра уже.
Можно ли автоматически перевести субтитры на другой язык?
Да, YouTube переводит субтитры автоматически, а у большинства сервисов есть функция перевода. Качество будет ниже оригинальной транскрипции, потому что ошибки распознавания накладываются на ошибки перевода, поэтому исходный текст стоит вычитать до перевода.
Безопасно ли загружать видео в онлайн-сервисы для субтитров?
Для публичного контента — да. Для записей с коммерческой тайной или личными данными лучше использовать Whisper локально через Subtitle Edit: файл не покидает ваш компьютер.
Умеет ли ИИ правильно расставлять знаки препинания и заглавные буквы?
Не всегда, и рейтинги точности этого не показывают: WER обычно считают после того, как текст приведён к строчным буквам и очищен от пунктуации. Модель с низким процентом ошибок может плохо ставить запятые, поэтому для субтитров это нужно проверять отдельно.
комментариев