Проще один раз услышать. Ниже одна и та же фраза, синтезированная дважды. Разница между записями только в одном: во второй перед текстом стоит подсказка в квадратных скобках.
Это не разные голоса и не ручная правка звука. Один и тот же голос, один и тот же текст, одна и та же кнопка «Преобразовать». Добавилось одно слово в скобках, и поменялась подача целой фразы. Темп, напор, то, как проглатываются окончания.
Почему раньше так было нельзя
Классический синтез собирали из студийных записей диктора. Человек часами читал текст в микрофон, и главным требованием было читать ровно. Нейтральным тоном, без всплесков, чтобы потом из этих кусочков склеивались любые фразы и стыки не резали слух.
Эмоций в исходном материале не было по замыслу, их вычищали специально. Отсюда и узнаваемое звучание автоответчиков, где технически всё чисто, а живого не осталось.
Новые голоса устроены иначе. Они выросли на живой речи, той самой, какой люди разговаривают в жизни. С паузами, ускорениями, усталостью под вечер, смешком посреди фразы. В таком материале интонация есть всегда, и отделить её от слов невозможно.
Поэтому новому голосу не нужно изображать эмоцию. Она у него уже есть, а подсказка в скобках только выбирает, какую именно достать.
Как это выглядит на практике
Пометка ставится прямо в тексте, перед той частью, к которой относится. Вслух она не произносится.
Здравствуйте! [радостно] Ваш заказ уже в пути, курьер будет через час.
Списка допустимых слов у нас нет. Подойдёт почти любое, которым вы описали бы манеру речи живому человеку.
- [радостно]
- [грустно]
- [шёпотом]
- [устало]
- [строго]
- [смеюсь]
- [удивлённо]
- [спокойно]
- [взволнованно]
Экспериментировать тут стоит. Модель понимает описания, которых мы никогда не проверяли, а синтез стоит копейки. Дешевле попробовать три варианта и выбрать лучший, чем гадать.
Самый сильный эффект, на наш слух, даёт шёпот. Он меняет не только громкость, но и всю манеру.
Где это действительно помогает
Напоминание о записи, прочитанное ровным голосом, воспринимается как уведомление от системы. Тот же текст, сказанный спокойно и по-человечески, ближе к звонку администратора клиники. Второе дослушивают чаще.
С хорошими новостями то же самое. «Ваш заказ готов» с радостной интонацией и без неё воспринимается как два разных сообщения, хотя слова одинаковые.
Отдельная история с личными обращениями. Поздравления, приглашения, благодарности постоянным клиентам. Ровный тон работает здесь хуже всего, потому что механическое поздравление обижает сильнее, чем его отсутствие.
Где не стоит использовать эмоции
Хуже всего работает давление интонацией. Злой или встревоженный голос в холодном обзвоне читается как манипуляция. Человек не знает вашу компанию, и первое, что он слышит — напор. Такие обзвоны собирают жалобы быстрее любых других, а пожаловаться на звонок у нас можно в пару кликов.
Рядом с этим стоит имитация срочности. «Взволнованно» в сообщении о задолженности слишком похоже на приём мошенников, и люди считывают это мгновенно. Вместе с доверием к сообщению теряется доверие к отправителю.
А если фраза служебная — время, адрес, код подтверждения, — то ровный нейтральный тон и есть правильный. Радость в озвучке кода из SMS звучит странно, а не дружелюбно.
Два ограничения, о которых лучше знать заранее
Эмоции понимают не все голоса, классические этого не умеют. В личном кабинете подсказка
появляется под списком только у поддерживающих голосов, а через API это видно по полю
emotions в ответе GET /sounds/voices. Если поставить пометку
неподдерживающему голосу, она вырежется перед синтезом. Текст озвучится без неё,
ошибки не будет.
В элементе «Сказать текст» эмоции тоже не работают. Такой текст озвучивается прямо во время разговора, и для скорости там используется классический голос. Новый синтезировался бы несколько секунд, и абонент слушал бы тишину. Если эмоция нужна в сценарии, подготовьте аудиозапись заранее на странице «Аудиозаписи» и вставьте её элементом «Проиграть аудио». Заодно услышите результат до того, как его услышат клиенты.
Частые вопросы
Как добавить эмоцию в синтезированную речь?
Поставьте подсказку в квадратных скобках перед фразой, например «Здравствуйте! [радостно] Ваш заказ уже в пути». Подсказка задаёт, как произнести следующую часть текста, и вслух не читается. Работает почти любое слово, от «радостно» и «устало» до «шёпотом» и «смеюсь».
Все ли голоса поддерживают эмоции?
Нет, только новые. В личном кабинете подсказка появляется под списком, когда
выбран поддерживающий голос, а через API это видно по полю
emotions в ответе GET /sounds/voices. У классических
голосов пометки вырезаются перед синтезом. Текст озвучится без них, ошибки не
будет.
Почему старые голоса так не умеют?
Классический синтез собирали из студийных начиток диктора, записанных нарочно ровным тоном, чтобы фразы можно было склеивать между собой. Эмоций в этом материале просто не было. Новые голоса выросли на живой речи, где интонация есть всегда, поэтому им не нужно её изображать. Достаточно указать, какую именно достать.
Работают ли эмоции в элементе «Сказать текст» в сценарии?
Нет. Такой текст озвучивается прямо во время разговора, и для скорости используется классический голос. Новый синтезировался бы несколько секунд, и абонент слушал бы тишину. Пометки там вырезаются автоматически. Если эмоция нужна в сценарии, подготовьте аудиозапись заранее и вставьте её элементом «Проиграть аудио».
Сколько стоит синтез с эмоциями?
Столько же, сколько обычный синтез по вашему тарифу. Пометка интонации считается частью текста, а не отдельной услугой, и на стоимость не влияет.
Попробовать можно прямо сейчас. Как устроена озвучка, рассказывает страница голосовых рассылок, а в личном кабинете достаточно открыть «Аудиозаписи», выбрать новый голос и написать текст с любой пометкой в скобках. Результат слышно сразу, до отправки кому бы то ни было.