Субтитры на видео
Распознаём речь, показываем реплики в редакторе, вшиваем в ролик — всё на вашем устройстве
Распознаём речь, показываем реплики в редакторе, вшиваем в ролик — всё на вашем устройстве
Сервис делает субтитры для видео и аудио без сторонних программ и без серверов — всё считается прямо в браузере.
Коротко о главном: размер кадра не меняется. Загрузили 4К — скачаете 4К, загрузили вертикальный ролик с телефона — он останется вертикальным. Меняется только контейнер и сжатие.
| Что | Как отдаёт сервис |
|---|---|
| Формат видео | Всегда MP4: картинка H.264, звук AAC. Загрузили MOV, WebM или MKV — скачаете MP4. К имени файла добавляется «-sub» |
| Разрешение и частота кадров | Как в исходнике: 720p, 1080p, 4К, вертикальное или горизонтальное |
| Качество картинки | Видео пересжимается — иначе текст в кадр не вписать. Битрейт подбирается под размер кадра: около 4,4 Мбит/с для 1080p и около 17 Мбит/с для 4К при 30 кадрах в секунду |
| Звук | Переносится как есть, без пересжатия. Если скопировать дорожку нельзя, она кодируется в AAC 128 кбит/с |
| HDR | Не сохраняется: HDR-ролики с телефона на выходе становятся обычными, 8 бит |
| Файлы субтитров | SRT, VTT, ASS и TXT — со всеми вашими правками из редактора |
| Если загружен звук | Вшивать не во что, поэтому отдаются только файлы субтитров |
| Водяные знаки | Нет |
Скорость и точность расшифровки зависят от выбранной модели Whisper. Ниже — честные замеры, снятые на стационарном компьютере; на смартфоне обработка занимает больше времени.
| Характеристика | «Быстрая» whisper-base | «Точная» whisper-small | «Самая точная» large-v3-turbo |
|---|---|---|---|
| Объём модели | 76 МБ | 240 МБ | 760 МБ |
| Время подготовки | ~8 секунд | ~18 секунд | ~62 секунды |
| Вычислительный множитель | ×0,09 | ×0,41 | ×2,8 |
| 1 минута записи | ~13 секунд | ~43 секунды | ~3,5 минуты |
| 10 минут записи | ~1 минута | ~4,5 минуты | ~29 минут |
Ручной выбор языка вместо «Определить» экономит самой точной модели около полутора минут — иначе она отдельно прогоняет начало записи, чтобы угадать язык. Эта же модель самая тяжёлая: на телефоне ей, скорее всего, не хватит памяти.
Мы прогнали распознавание в разных акустических условиях и замерили долю ошибок по словам.
| Акустическая обстановка | Модель «Точная» | Модель «Самая точная» |
|---|---|---|
| Чистая студийная запись | 5 % ошибок | 5 % ошибок |
| Сжатый телефонный канал | 5 % ошибок | — |
| Постоянный шум вровень с голосом | 5 % ошибок | — |
| Шум громче полезного голоса | 40 % ошибок | 10–15 % ошибок |
| Сильно гулкая комната | 30 % ошибок | 5 % ошибок |
| Шум вдвое громче голоса | 95 % ошибок | 60 % ошибок |
Самое интересное здесь — эхо. Гулкая комната сбивает «Точную» сильнее любого шума, а «Самая точная» её попросту не замечает.
Тайминги слов подтягиваются к границам реального голоса: сервис строит огибающую звука с частотой 100 кадров в секунду, находит отрезки речи и сдвигает к ним слова, которые иначе загорелись бы в тишине.
В тестах 0 слов из 20 стартуют в тишине против 3 без подгонки. Остаточный промах — 10–30 мс, тогда как человек замечает рассинхрон примерно от 100 мс.
На компьютере для русской и английской речи есть ещё один шаг: отдельная модель сверяет каждое слово со звуком и уточняет его время. На телефоне этот шаг пропускается, чтобы вкладке хватило памяти.
Быстрое вшивание. Обычные ролики с телефона и камеры — MP4 и MOV с картинкой H.264 и звуком AAC — собирает встроенный кодировщик браузера: работу берёт на себя видеочип, поэтому выходит в разы быстрее, а качать отдельный движок не нужно. Поворот кадра, который телефон записывает в файл, учитывается.
Запасной путь. Всё остальное — WebM, MKV, ролики в HEVC — пересобирается движком FFmpeg, собранным в WebAssembly, силами процессора вашего устройства. Картинка кодируется libx264 в режиме ultrafast с качеством crf 26 и цветом yuv420p. Звуковая дорожка копируется без пересжатия, а при технической невозможности кодируется в AAC 128 кбит/с. Текст рисует библиотека libass с подгрузкой шрифта прямо в сборку.
Работа с диска. Тяжёлые исходные файлы не занимают оперативную память целиком: они монтируются в движок напрямую через виртуальную файловую систему WORKERFS.
Никаких серверов. Распознавание речи нейросетью Whisper и вшивание субтитров через FFmpeg происходят исключительно внутри вашего браузера. Ни видео, ни звук, ни полученный текст не передаются в сеть.
Автономная работа. Интернет нужен для первой загрузки модели, движка и шрифта — дальше браузер держит их у себя, и повторные запуски идут без сети.
<track> у HTML-видео.От веса файла — нет: благодаря виртуальной файловой системе WORKERFS движок монтирует видео напрямую с диска, а не грузит его в оперативную память. Но распознавание разворачивает весь звук в памяти — час записи это около 230 МБ, — а вшивание пересобирает видео целиком силами процессора, и готовый файл всё это время копится в памяти браузера. Для часовой записи надёжнее скачать SRT и подключить его в плеере или монтажной программе.
Это заслуга внутренней калибровки таймингов. Сервис анализирует огибающую звуковой волны со скоростью 100 кадров в секунду, находит моменты, где речь действительно началась, и притягивает к ним маркеры фраз — погрешность остаётся в пределах 10–30 миллисекунд, незаметных для человека.
Всегда в MP4 (H.264 и AAC), какой бы файл вы ни загрузили. Разрешение и частота кадров остаются исходными: 4К остаётся 4К, 1080p — 1080p. Картинка при этом пересжимается, потому что текст вписывается прямо в кадр, а звук переносится без изменений. HDR не сохраняется.
Да. Загрузите видео, выберите «Есть файл субтитров» и укажите SRT, VTT или ASS — реплики откроются в редакторе. Там же можно поправить время, выбрать стиль и анимацию, а потом скачать ролик с уже вшитым текстом.
Незачем. Выберите «У меня есть текст» и вставьте сценарий: слова останутся вашими, без ошибок распознавания, а сервис сам найдёт, когда каждое из них звучит. Сейчас это работает для русской и английской речи.
На чистой записи одного говорящего — хорошо. Хуже становится от музыки на фоне, нескольких голосов разом, сильного акцента и плохого микрофона. Имена, названия и термины модель часто пишет по-своему: их стоит проверить глазами. Поэтому здесь и есть редактор — результат распознавания это черновик, а не готовый файл.
После окончания распознавания нажмите кнопку «SRT» в ряду форматов — файл скачается сразу. Он распознаётся творческой студией YouTube, плеерами VLC, ВКонтакте, Rutube и видеоредакторами.
Только чтобы скачать модель, движок и шрифт в первый раз. Дальше распознавание и вшивание идут без сети.
Да. Сервис полностью бесплатен, работает без ограничений по количеству файлов, не накладывает водяных знаков на готовое видео и не требует регистрации.