
В России научили ИИ говорить живее всех живых
Принципиальное отличие от предыдущих подходов в том, как система понимает текст. Раньше синтез работал по принципу «собери звуки в слова, а слова в предложения». Теперь большая языковая модель (LLM) сначала осмысливает реплику, она оценивает о чём идёт речь, в каком тоне, что важнее подчеркнуть, где уместна пауза, а где — ускорение. Только после этого диффузионная модель формирует сам звук — рисует спектрограмму, учитывая тембр, ритм и те самые интонационные акценты, которые определила языковая модель. Получается, что текст и его звучание рождаются не по отдельности, а в едином процессе.
Это даёт эффект, который сложно описать, но легко услышать. Представьте, вам звонит робот из банка, чтобы напомнить о просроченном платеже. Стандартный бот говорит это монотонно и сухо, клиент часто раздражается, бросает трубку. Новый голос звучит спокойно и без давления, без торопливости, с мягкими паузами, поэтому абонент невольно отвечает в том же тоне. Это не просто приятнее — это меняет поведение человека на другом конце провода.
Эмоциональная окраска робота теперь настраивается под конкретную задачу. Для банка нужна сдержанность, нейтральный темп, никаких излишних эмоций, потому что речь идёт о деньгах и давить на клиента недопустимо. Для медицинской клиники, где робот помогает записаться к врачу или подтвердить приём, нужна мягкость и деликатность, ведь человек может звонить в состоянии тревоги, и резкий голос только усилит дискомфорт. В ритейле, наоборот, нужен лёгкий, дружелюбный тон: «Здравствуйте! У нас как раз появилась скидка на то, что вы искали». Звучит по-человечески, и собеседник не закрывает беседу на пятой секунде.
Параметров настройки несколько: темп речи, логические паузы, эмоциональный фон. Их можно комбинировать. Один и тот же голос может звучать как спокойный банковский консультант по утрам и как бодрый промоутер вечером, для этого достаточно переключить профиль.
Платформа Neuro TTS поддерживает потоковую генерацию. Первые аудиоданные передаются примерно через 120 миллисекунд после запроса. Для пользователя это означает, что в диалоге с голосовым ассистентом нет неловких пауз перед каждой репликой. Робот отвечает почти мгновенно, как живой собеседник, который просто обдумывает одну-две секунды.
Технически платформа доступна через REST API и WebSocket, что позволяет встраивать её в существующие сервисы контакт-центров без перестройки инфраструктуры. По данным компании, система способна обрабатывать до 5000 одновременных голосовых каналов, а это уровень крупного федерального оператора или банка с миллионами клиентских обращений в месяц.