Перейти на главную
22.09.2026Светина Майя
В России научили ИИ говорить живее всех живых

В России научили ИИ говорить живее всех живых

Россияне ежедневно разговаривают с голосовыми роботами — звонят в банк, записываются к врачу или уточняют доставку. И почти каждый раз слышат один и тот же монотонный механический голос с паузами в странных местах. Такая интонация выдаёт машину с первого слова. Компания Neuro.net представила технологию синтеза речи нового поколения — Neuro TTS. В ней большие языковые и диффузионные модели работают вместе. В результате голос робота стал звучать, как живой человек с интонацией, паузами и своим характером.

Принципиальное отличие от предыдущих подходов в том, как система понимает текст. Раньше синтез работал по принципу «собери звуки в слова, а слова в предложения». Теперь большая языковая модель (LLM) сначала осмысливает реплику, она оценивает о чём идёт речь, в каком тоне, что важнее подчеркнуть, где уместна пауза, а где — ускорение. Только после этого диффузионная модель формирует сам звук — рисует спектрограмму, учитывая тембр, ритм и те самые интонационные акценты, которые определила языковая модель. Получается, что текст и его звучание рождаются не по отдельности, а в едином процессе.

Это даёт эффект, который сложно описать, но легко услышать. Представьте, вам звонит робот из банка, чтобы напомнить о просроченном платеже. Стандартный бот говорит это монотонно и сухо, клиент часто раздражается, бросает трубку. Новый голос звучит спокойно и без давления, без торопливости, с мягкими паузами, поэтому абонент невольно отвечает в том же тоне. Это не просто приятнее — это меняет поведение человека на другом конце провода.

Эмоциональная окраска робота теперь настраивается под конкретную задачу. Для банка нужна сдержанность, нейтральный темп, никаких излишних эмоций, потому что речь идёт о деньгах и давить на клиента недопустимо. Для медицинской клиники, где робот помогает записаться к врачу или подтвердить приём, нужна мягкость и деликатность, ведь человек может звонить в состоянии тревоги, и резкий голос только усилит дискомфорт. В ритейле, наоборот, нужен лёгкий, дружелюбный тон: «Здравствуйте! У нас как раз появилась скидка на то, что вы искали». Звучит по-человечески, и собеседник не закрывает беседу на пятой секунде.

Параметров настройки несколько: темп речи, логические паузы, эмоциональный фон. Их можно комбинировать. Один и тот же голос может звучать как спокойный банковский консультант по утрам и как бодрый промоутер вечером, для этого достаточно переключить профиль. 

Платформа Neuro TTS поддерживает потоковую генерацию. Первые аудиоданные передаются примерно через 120 миллисекунд после запроса. Для пользователя это означает, что в диалоге с голосовым ассистентом нет неловких пауз перед каждой репликой. Робот отвечает почти мгновенно, как живой собеседник, который просто обдумывает одну-две секунды.

Технически платформа доступна через REST API и WebSocket, что позволяет встраивать её в существующие сервисы контакт-центров без перестройки инфраструктуры. По данным компании, система способна обрабатывать до 5000 одновременных голосовых каналов, а это уровень крупного федерального оператора или банка с миллионами клиентских обращений в месяц.