Scribe — это отдельный инструмент ElevenLabs для преобразования речи в текст. Если Text to Speech делает из текста голос, то Scribe работает наоборот: принимает аудио или видео и возвращает расшифровку.
В 2026 году Scribe поддерживает более 90 языков, включая русский, умеет разделять спикеров, добавлять точные таймкоды и распознавать дополнительные звуки.
Что умеет ElevenLabs Scribe
Основные возможности Scribe:
- распознавание речи более чем на 90 языках;
- русская транскрибация;
- таймкоды на уровне отдельных слов;
- разделение нескольких спикеров;
- определение неречевых звуков;
- автоматическое определение языка;
- работа с длинными аудио- и видеофайлами.
Scribe подходит для интервью, подкастов, лекций, созвонов, роликов YouTube и любых записей, которые нужно быстро превратить в текст.
Как перевести аудио в текст
Откройте Speech to Text в ElevenLabs и загрузите аудиофайл.
Дальше сервис анализирует запись и создаёт транскрипт. В зависимости от режима можно получить текст с таймкодами и разметкой спикеров.
Общий порядок:
- откройте Speech to Text;
- загрузите аудио или видео;
- выберите нужные параметры;
- запустите транскрибацию;
- проверьте результат;
- скопируйте или экспортируйте текст.
Работает ли Scribe с русским языком
Да. Русский входит в официальный список поддерживаемых языков Scribe v2.
Качество распознавания зависит от записи. Чистый голос одного человека распознаётся лучше, чем разговор на фоне музыки, улицы или сильного эха.
Что такое diarization
Diarization — это автоматическое разделение записи по спикерам.
Например, если в интервью разговаривают ведущий и гость, Scribe может определить, где говорит один человек, а где другой, и разбить текст на отдельные реплики.
По актуальной документации Scribe поддерживает до 32 спикеров.
Это особенно полезно для:
- интервью;
- подкастов;
- совещаний;
- групповых звонков;
- панельных дискуссий.
Зачем нужны таймкоды
Scribe умеет ставить таймкоды на уровне слов. Это удобно, если расшифровка нужна не только как текст, но и для монтажа, субтитров или поиска конкретного момента в записи.
Например, можно быстро найти фразу в длинном интервью и перейти к нужной секунде ролика.
Что нового в Scribe v2
В Scribe v2 появились дополнительные возможности для более сложной транскрибации.
Среди них:
- keyterm prompting — подсказки с важными терминами и именами;
- распознавание сущностей;
- более точная работа с разными голосами и языками;
- реалтайм-режим для потоковой речи.
Keyterm prompting полезен, если в записи много брендов, фамилий, профессиональных терминов или нестандартных названий.
Можно ли расшифровать видео
Да. Если загрузить видеофайл, Scribe извлечёт речь и создаст текстовую расшифровку.
Если ваша задача не просто получить текст, а перевести ролик на другой язык и сразу переозвучить его, лучше использовать другой инструмент ElevenLabs — Dubbing.
Можно ли использовать Scribe для субтитров
Да. Таймкоды делают Scribe удобным источником для подготовки субтитров.
После транскрибации текст всё равно стоит проверить вручную, особенно если:
- в записи много имён;
- есть профессиональные термины;
- несколько людей перебивают друг друга;
- звук записан некачественно.
Чем Scribe отличается от обычной расшифровки в ChatGPT или других сервисах
Сильная сторона Scribe — именно специализированная работа со звуком: точные таймкоды, diarization, определение звуков и отдельный API для Speech to Text.
Поэтому он особенно интересен не только для разовой расшифровки, но и для проектов, где транскрибация встроена в постоянный рабочий процесс.
Сколько стоит Scribe
Speech to Text входит в экосистему ElevenLabs и расходует общий баланс кредитов. Доступность и лимиты зависят от тарифа.
Начать можно даже с Free, а при регулярной работе имеет смысл сравнить платные планы.
Когда Scribe действительно полезен
Scribe стоит использовать, если вам регулярно нужно:
- расшифровывать интервью;
- делать текст из подкастов;
- получать конспекты из записей;
- готовить субтитры;
- разбирать длинные видео;
- автоматизировать транскрибацию через API.
Итог
Scribe превращает ElevenLabs из сервиса для генерации голоса в полноценный инструмент работы с речью в обе стороны. Он особенно полезен там, где важны не только слова, но и таймкоды, разделение спикеров и структурированная расшифровка длинных записей.
