Блог

Представляем AI Subtitle Studio

· 4 мин чтения

Как мы объединяем компьютерное зрение, распознавание речи и LLM, чтобы разместить каждый субтитр там, где нужно.

Зачем ещё один сервис субтитров?

Большинство инструментов автосубтитров ограничиваются транскрибацией. Они кидают блок текста внизу экрана — и часто перекрывают лицо спикера или тот самый объект, о котором идёт речь.

AI Subtitle Studio относится к субтитрам как к задаче дизайна, а не только текста. Наш пайплайн понимает, что происходит на экране и что говорят, и размещает субтитры так, чтобы они не мешали видео.

Пайплайн

Каждая стадия — изолированный сервис с возможностью повторного запуска:

  1. Загрузка — видео и аудио извлекаются и хранятся как неизменяемые артефакты.
  2. Транскрибация — Whisper (OpenVINO) создаёт точные сегменты транскрипта.
  3. Выравнивание — wav2vec2 расставляет таймкоды слов с точностью до миллисекунды.
  4. Зрение — YOLO находит людей, лица и объекты на каждом кадре.
  5. Граф сцены — семантический слой объединяет транскрипт, тайминги и детекции.
  6. LLM — анализ эмоций и акцентов подбирает стили и выделения.
  7. Раскладка — отдельный движок вычисляет безопасные позиции без коллизий.
  8. Экспорт — SRT, ASS, WebVTT или вшитые субтитры MP4 / MOV.

Золотое правило

LLM никогда не вычисляет координаты. Она выполняет только семантический анализ.

Позиционирование, избегание коллизий и безопасные зоны — задача layout-движка, который знает точные bounding box'ы всего на экране. Именно это разделение делает результат стабильным и воспроизводимым.

Попробуйте

Откройте редактор, загрузите ролик и начните стилизацию. Выберите шрифт, настройте обводку и наблюдайте, как превью обновляется в реальном времени.