Технологии

Клонирование голоса для обзвона: что под капотом и почему это не кнопка в интерфейсе

← Все статьи

Вопрос, который нам задают чаще всего после демонстрации ИИ-агента: «А можно, чтобы клиентам звонил мой голос?». Технически — да, это работает и работает хорошо. В интерфейсе AutoCall.kz такой кнопки нет, и в тарифах напротив клонирования голоса стоит «Ограниченный доступ».

Это не кокетство и не «фича в разработке». Ниже — честный разбор: что умеют современные модели, какие из них вообще можно использовать в платном сервисе, что отдельно ломается на русском и казахском и почему нормальный клон голоса начинается не с пяти секунд записи, а с сессии в студии.

Что умеет технология сегодня

Современные модели делятся на два класса, и разница между ними — это ровно разница между «вау, похоже» и «можно пускать на клиентов».

Zero-shot клонирование. Модели вроде Chatterbox копируют тембр по образцу длиной пять-шесть секунд, без всякого обучения. Вы даёте кусочек записи — она сразу говорит похожим голосом. Именно эти демо и разлетаются по соцсетям.

Дообучение под голос. Модель тренируют на записях конкретного человека — десятки минут материала, часы вычислений на GPU. Получается не просто похожий тембр, а манера: паузы, характерные интонации, то, как человек тянет гласные и добирает воздух.

Разница слышна не на первой фразе, а на третьей минуте разговора. Zero-shot держит тембр, но интонационно плоский: он не знает, как именно этот человек задаёт вопрос или сомневается. На коротком уведомлении разницы почти нет. На живом диалоге с ИИ-агентом — есть, и заметная.

Почему это не кнопка в интерфейсе: лицензии

Вот главная причина, о которой почему-то не пишут в обзорах «топ-10 нейросетей для клонирования голоса». Лучшие открытые модели запрещено использовать коммерчески.

Не «нужно упомянуть авторов», не «нужно купить подписку», а прямо нельзя — лицензия разрешает только некоммерческое применение. Любой сервис, который берёт за это деньги, нарушает условия.

Модель Лицензия Можно ли в платном сервисе
XTTS-v2 Coqui CPML Нет. И отдельная деталь: компания Coqui закрылась в январе 2024, поэтому коммерческую лицензию сейчас не у кого купить в принципе.
F5-TTS CC-BY-NC-4.0 Нет. NC в названии — это Non-Commercial. Русские дообучения сообщества наследуют ту же лицензию.
Fish Speech Fish Audio Research Нет. Исследовательская лицензия, нужен отдельный договор с правообладателем.
Chatterbox MIT Да. Zero-shot по ~5 секундам, управление эмоцией, версия Turbo даёт задержку в районе 200 мс.
Orpheus 3B Permissive Да. Построена на Llama-3B, умеет zero-shot и управляемую эмоцию.
CosyVoice 3 см. релиз Да, с оговоркой. Важна тем, что русский в списке поддерживаемых языков и есть кросс-языковое клонирование.
Qwen3-TTS Apache 2.0 Да. Вышла в январе 2026, архитектура StyleTTS2/ISTFTNet, работает быстрее реального времени.

Лицензии меняются от релиза к релизу, и модель, которая вчера была под Apache, завтра может выйти под исследовательской. Перед тем как что-то ставить в прод, лицензию конкретной версии весов надо перечитывать заново — а не полагаться на статью полугодовой давности, включая эту.

Отсюда и «ограниченный доступ». Развернуть у себя XTTS-v2 и брать за это деньги — быстрый способ построить сервис на юридической мине. Мы выбираем из правой части таблицы, и выбор там заметно у́же, чем кажется по обзорам.

На чём мы строим это у себя

Развёртывание идёт на своих серверах, не через чужое API. Причина простая: голос клиента — это биометрия, и отправлять его в сторонний сервис, чтобы там «полежало на всякий случай», мы не готовы. Вся наша инфраструктура и так стоит в Казахстане, и для голосовых слепков это принципиально.

Базовый выбор — Chatterbox под MIT для быстрых демо и проверки гипотезы, и CosyVoice 3 либо Qwen3-TTS под продовые голоса, потому что у них нормально с русским и с кросс-языковым переносом. Под конкретный проект стек уточняется: то, что лучше звучит на женском голосе в тихой студии, не всегда выигрывает на мужском с региональным акцентом.

Железо: инференс требует видеокарты. Это не та задача, которую можно повесить на общий сервер приложений рядом с базой, — под неё нужен отдельный GPU-узел, и в стоимости проекта это заметная строка.

Русский язык ломается там, где не ждёшь

Допустим, лицензия чистая, GPU куплен, голос записан. Дальше начинается специфика языка, и для русского она злее, чем для английского.

Ударения. Модель должна знать, где в слове ударный слог. Английскому проще — там ударение почти всегда предсказуемо по форме слова. В русском для этого нужен отдельный препроцессор вроде RUAccent, который расставляет ударения до того, как текст уйдёт в синтез.

Омографы. Слова, которые пишутся одинаково, а читаются по-разному: за́мок и замо́к, бо́льшая и больша́я, до́рог и доро́г. Их в русском больше десяти тысяч, и полностью задача до сих пор не решена даже большими нейросетями — Национальный корпус покрывает не все случаи. Отдельная нерешённая подзадача — слова, где всё зависит от «ё»: все́ и всё, узна́ем и узнаём.

И это стоит времени. На процессоре расстановка ударений может занимать дольше, чем сам синтез речи. То есть узкое место оказывается не в нейросети, которая рисует звук, а в скучном модуле, который решает, куда поставить палочку над буквой.

Практический вывод для заказчика: если в вашем тексте есть фамилии, названия компаний, топонимы или профессиональные термины — их произношение придётся задавать вручную. Ни одна модель не догадается сама, как читается название вашего ЖК или фамилия директора.

Казахский язык: базы почти нет

С казахским ситуация честнее описывается словом «дефицит». Это низкоресурсный язык: данных для обучения на порядки меньше, чем для английского, и большинство мировых моделей его просто не поддерживают.

Хорошая новость в том, что основной открытый корпус сделан в Казахстане. KazakhTTS2 от ISSAI Назарбаев Университета — 271 час записей, пять профессиональных дикторов, оценка качества MOS выше 4, открытые данные и рецепт обучения на ESPnet.

Но важно понимать, что это корпус и рецепт, а не готовая модель клонирования. На нём можно обучить хороший синтез с голосами тех самых пяти дикторов. Чтобы получить казахский голос конкретного заказчика, модель придётся дообучать под него отдельно — а значит, и материала записывать надо больше, чем для русского.

Сегодня в голосовых рассылках мы закрываем казахский готовыми дикторскими голосами. Клонирование казахского — это отдельный проект со своим бюджетом, и мы честно предупреждаем об этом на входе.

Сколько нужно записать на самом деле

Демо в интернете обещают клон по пяти секундам. Формально не врут. Но между «узнаваемо» и «клиент не понял, что говорил робот» лежит примерно вот такая разница.

Демо · 5 секунд
  • тембр узнаётся
  • интонация плоская
  • эмоции не передаются
  • на длинной фразе «плывёт»
  • годится показать идею
Прод · сессия записи
  • от 30–40 минут чистого звука
  • тихое помещение, один микрофон
  • текст с разметкой эмоций
  • вопросы, отказы, извинения
  • имена и термины отдельно

Практически это выглядит так: заказчику выдаётся сценарий на несколько страниц, где реплики размечены по интонации, и он читает их вслух под запись. Не «прочитайте что-нибудь», а именно набор ситуаций — потому что модель научится только тому, что услышит.

— Здравствуйте! (доброжелательно, чуть быстрее обычного)
  Вас беспокоит компания «Пример».

— Подскажите, вам удобно сейчас говорить? (вопрос, интонация вверх)

— Понимаю. (сочувственно, медленнее) Тогда не буду отвлекать.

— К сожалению, заявку пришлось отклонить. (нейтрально, без извиняющегося тона)

— За́мок открывается ключом, а замо́к стоит на горе. (омографы: контрольная пара)

Последняя строка не шутка. Такие пары специально включают в сценарий записи, чтобы модель услышала оба варианта произношения и не путала их потом в бою.

Обратная сторона: этим уже пользуются мошенники

Тот же инструмент, который позволяет директору не тратить день на озвучку уведомлений, позволяет позвонить его матери голосом сына и попросить денег. Схема «родственник в беде» существовала и до нейросетей, но раньше её выдавал чужой голос в трубке. Теперь не выдаёт.

Материала для клона нужно немного: голосовое сообщение, сторис, запись выступления, подкаст. У публичного человека образец есть у любого желающего.

Что с этим делать на бытовом уровне. Договоритесь с близкими о контрольном вопросе, ответ на который не гуглится. Если голос в трубке просит денег или диктует коды — положите трубку и перезвоните сами по номеру из телефонной книги. И помните, что на номере может стоять переадресация, из-за которой ваш обратный звонок уйдёт не туда — это стоит проверить отдельно.

Именно поэтому мы не делаем клонирование самообслуживаемой функцией. Кнопка «загрузите любой файл с голосом и обзванивайте» — это не продукт, это инструмент для мошенничества, который через неделю работы принесёт больше проблем, чем денег.

Как получить доступ у нас

Клонирование голоса в AutoCall.kz доступно по индивидуальному запросу, под проект. Порядок такой:

  1. Заявка и задача. Кому звоним, что говорим, какой объём. От этого зависит, нужен ли вообще клон или хватит готового дикторского голоса — иногда хватает, и мы об этом скажем прямо.
  2. Подтверждение прав на голос. Владелец голоса даёт письменное согласие. Если голос принадлежит не заказчику, а, например, сотруднику или приглашённому диктору — согласие нужно от него лично. Это не формальность, это условие работы.
  3. Запись материала. Сценарий с разметкой, сессия записи, проверка качества звука.
  4. Обучение и приёмка. Слушаем результат на реальных текстах вашей рассылки, а не на демо-фразах.
  5. Запуск. Голос доступен только в вашем аккаунте.

Сроки и стоимость считаются под задачу: они зависят от языка, объёма материала и того, нужен ли отдельный GPU-узел под ваш проект. Казахский дороже русского — по причинам, описанным выше.

Если задача проще, чем кажется, — например, нужен просто приятный человеческий голос, а не именно ваш собственный, — начните с обычного синтеза: он доступен сразу, стоит копейки и в половине случаев закрывает вопрос полностью.

Нужен свой голос в обзвоне?

Опишите задачу — посчитаем, нужен ли клон или хватит готового голоса.

Попробовать бесплатно →