Вопрос, который нам задают чаще всего после демонстрации ИИ-агента: «А можно, чтобы клиентам звонил мой голос?». Технически — да, это работает и работает хорошо. В интерфейсе AutoCall.kz такой кнопки нет, и в тарифах напротив клонирования голоса стоит «Ограниченный доступ».
Это не кокетство и не «фича в разработке». Ниже — честный разбор: что умеют современные модели, какие из них вообще можно использовать в платном сервисе, что отдельно ломается на русском и казахском и почему нормальный клон голоса начинается не с пяти секунд записи, а с сессии в студии.
Что умеет технология сегодня
Современные модели делятся на два класса, и разница между ними — это ровно разница между «вау, похоже» и «можно пускать на клиентов».
Zero-shot клонирование. Модели вроде Chatterbox копируют тембр по образцу длиной пять-шесть секунд, без всякого обучения. Вы даёте кусочек записи — она сразу говорит похожим голосом. Именно эти демо и разлетаются по соцсетям.
Дообучение под голос. Модель тренируют на записях конкретного человека — десятки минут материала, часы вычислений на GPU. Получается не просто похожий тембр, а манера: паузы, характерные интонации, то, как человек тянет гласные и добирает воздух.
Разница слышна не на первой фразе, а на третьей минуте разговора. Zero-shot держит тембр, но интонационно плоский: он не знает, как именно этот человек задаёт вопрос или сомневается. На коротком уведомлении разницы почти нет. На живом диалоге с ИИ-агентом — есть, и заметная.
Почему это не кнопка в интерфейсе: лицензии
Вот главная причина, о которой почему-то не пишут в обзорах «топ-10 нейросетей для клонирования голоса». Лучшие открытые модели запрещено использовать коммерчески.
Не «нужно упомянуть авторов», не «нужно купить подписку», а прямо нельзя — лицензия разрешает только некоммерческое применение. Любой сервис, который берёт за это деньги, нарушает условия.
| Модель | Лицензия | Можно ли в платном сервисе |
|---|---|---|
| XTTS-v2 | Coqui CPML | Нет. И отдельная деталь: компания Coqui закрылась в январе 2024, поэтому коммерческую лицензию сейчас не у кого купить в принципе. |
| F5-TTS | CC-BY-NC-4.0 | Нет. NC в названии — это Non-Commercial. Русские дообучения сообщества наследуют ту же лицензию. |
| Fish Speech | Fish Audio Research | Нет. Исследовательская лицензия, нужен отдельный договор с правообладателем. |
| Chatterbox | MIT | Да. Zero-shot по ~5 секундам, управление эмоцией, версия Turbo даёт задержку в районе 200 мс. |
| Orpheus 3B | Permissive | Да. Построена на Llama-3B, умеет zero-shot и управляемую эмоцию. |
| CosyVoice 3 | см. релиз | Да, с оговоркой. Важна тем, что русский в списке поддерживаемых языков и есть кросс-языковое клонирование. |
| Qwen3-TTS | Apache 2.0 | Да. Вышла в январе 2026, архитектура StyleTTS2/ISTFTNet, работает быстрее реального времени. |
Лицензии меняются от релиза к релизу, и модель, которая вчера была под Apache, завтра может выйти под исследовательской. Перед тем как что-то ставить в прод, лицензию конкретной версии весов надо перечитывать заново — а не полагаться на статью полугодовой давности, включая эту.
Отсюда и «ограниченный доступ». Развернуть у себя XTTS-v2 и брать за это деньги — быстрый способ построить сервис на юридической мине. Мы выбираем из правой части таблицы, и выбор там заметно у́же, чем кажется по обзорам.
На чём мы строим это у себя
Развёртывание идёт на своих серверах, не через чужое API. Причина простая: голос клиента — это биометрия, и отправлять его в сторонний сервис, чтобы там «полежало на всякий случай», мы не готовы. Вся наша инфраструктура и так стоит в Казахстане, и для голосовых слепков это принципиально.
Базовый выбор — Chatterbox под MIT для быстрых демо и проверки гипотезы, и CosyVoice 3 либо Qwen3-TTS под продовые голоса, потому что у них нормально с русским и с кросс-языковым переносом. Под конкретный проект стек уточняется: то, что лучше звучит на женском голосе в тихой студии, не всегда выигрывает на мужском с региональным акцентом.
Железо: инференс требует видеокарты. Это не та задача, которую можно повесить на общий сервер приложений рядом с базой, — под неё нужен отдельный GPU-узел, и в стоимости проекта это заметная строка.
Русский язык ломается там, где не ждёшь
Допустим, лицензия чистая, GPU куплен, голос записан. Дальше начинается специфика языка, и для русского она злее, чем для английского.
Ударения. Модель должна знать, где в слове ударный слог. Английскому проще — там ударение почти всегда предсказуемо по форме слова. В русском для этого нужен отдельный препроцессор вроде RUAccent, который расставляет ударения до того, как текст уйдёт в синтез.
Омографы. Слова, которые пишутся одинаково, а читаются по-разному: за́мок и замо́к, бо́льшая и больша́я, до́рог и доро́г. Их в русском больше десяти тысяч, и полностью задача до сих пор не решена даже большими нейросетями — Национальный корпус покрывает не все случаи. Отдельная нерешённая подзадача — слова, где всё зависит от «ё»: все́ и всё, узна́ем и узнаём.
И это стоит времени. На процессоре расстановка ударений может занимать дольше, чем сам синтез речи. То есть узкое место оказывается не в нейросети, которая рисует звук, а в скучном модуле, который решает, куда поставить палочку над буквой.
Практический вывод для заказчика: если в вашем тексте есть фамилии, названия компаний, топонимы или профессиональные термины — их произношение придётся задавать вручную. Ни одна модель не догадается сама, как читается название вашего ЖК или фамилия директора.
Казахский язык: базы почти нет
С казахским ситуация честнее описывается словом «дефицит». Это низкоресурсный язык: данных для обучения на порядки меньше, чем для английского, и большинство мировых моделей его просто не поддерживают.
Хорошая новость в том, что основной открытый корпус сделан в Казахстане. KazakhTTS2 от ISSAI Назарбаев Университета — 271 час записей, пять профессиональных дикторов, оценка качества MOS выше 4, открытые данные и рецепт обучения на ESPnet.
Но важно понимать, что это корпус и рецепт, а не готовая модель клонирования. На нём можно обучить хороший синтез с голосами тех самых пяти дикторов. Чтобы получить казахский голос конкретного заказчика, модель придётся дообучать под него отдельно — а значит, и материала записывать надо больше, чем для русского.
Сегодня в голосовых рассылках мы закрываем казахский готовыми дикторскими голосами. Клонирование казахского — это отдельный проект со своим бюджетом, и мы честно предупреждаем об этом на входе.
Сколько нужно записать на самом деле
Демо в интернете обещают клон по пяти секундам. Формально не врут. Но между «узнаваемо» и «клиент не понял, что говорил робот» лежит примерно вот такая разница.
- тембр узнаётся
- интонация плоская
- эмоции не передаются
- на длинной фразе «плывёт»
- годится показать идею
- от 30–40 минут чистого звука
- тихое помещение, один микрофон
- текст с разметкой эмоций
- вопросы, отказы, извинения
- имена и термины отдельно
Практически это выглядит так: заказчику выдаётся сценарий на несколько страниц, где реплики размечены по интонации, и он читает их вслух под запись. Не «прочитайте что-нибудь», а именно набор ситуаций — потому что модель научится только тому, что услышит.
— Здравствуйте! (доброжелательно, чуть быстрее обычного) Вас беспокоит компания «Пример». — Подскажите, вам удобно сейчас говорить? (вопрос, интонация вверх) — Понимаю. (сочувственно, медленнее) Тогда не буду отвлекать. — К сожалению, заявку пришлось отклонить. (нейтрально, без извиняющегося тона) — За́мок открывается ключом, а замо́к стоит на горе. (омографы: контрольная пара)
Последняя строка не шутка. Такие пары специально включают в сценарий записи, чтобы модель услышала оба варианта произношения и не путала их потом в бою.
Обратная сторона: этим уже пользуются мошенники
Тот же инструмент, который позволяет директору не тратить день на озвучку уведомлений, позволяет позвонить его матери голосом сына и попросить денег. Схема «родственник в беде» существовала и до нейросетей, но раньше её выдавал чужой голос в трубке. Теперь не выдаёт.
Материала для клона нужно немного: голосовое сообщение, сторис, запись выступления, подкаст. У публичного человека образец есть у любого желающего.
Что с этим делать на бытовом уровне. Договоритесь с близкими о контрольном вопросе, ответ на который не гуглится. Если голос в трубке просит денег или диктует коды — положите трубку и перезвоните сами по номеру из телефонной книги. И помните, что на номере может стоять переадресация, из-за которой ваш обратный звонок уйдёт не туда — это стоит проверить отдельно.
Именно поэтому мы не делаем клонирование самообслуживаемой функцией. Кнопка «загрузите любой файл с голосом и обзванивайте» — это не продукт, это инструмент для мошенничества, который через неделю работы принесёт больше проблем, чем денег.
Как получить доступ у нас
Клонирование голоса в AutoCall.kz доступно по индивидуальному запросу, под проект. Порядок такой:
- Заявка и задача. Кому звоним, что говорим, какой объём. От этого зависит, нужен ли вообще клон или хватит готового дикторского голоса — иногда хватает, и мы об этом скажем прямо.
- Подтверждение прав на голос. Владелец голоса даёт письменное согласие. Если голос принадлежит не заказчику, а, например, сотруднику или приглашённому диктору — согласие нужно от него лично. Это не формальность, это условие работы.
- Запись материала. Сценарий с разметкой, сессия записи, проверка качества звука.
- Обучение и приёмка. Слушаем результат на реальных текстах вашей рассылки, а не на демо-фразах.
- Запуск. Голос доступен только в вашем аккаунте.
Сроки и стоимость считаются под задачу: они зависят от языка, объёма материала и того, нужен ли отдельный GPU-узел под ваш проект. Казахский дороже русского — по причинам, описанным выше.
Если задача проще, чем кажется, — например, нужен просто приятный человеческий голос, а не именно ваш собственный, — начните с обычного синтеза: он доступен сразу, стоит копейки и в половине случаев закрывает вопрос полностью.