你好,非常好的工作,有几个问题想要请教下: 1. 整个agent-based的TTS合成数据的流程比单独用MOSS-TTSD合成的数据用于模型预训练的话,模型的性能是会好很多吗,大概有多少提升呀 2. 如果将5min的chunk进行聚类,得到整个长音频的全局说话人,整个性能会有多大变化呢(cpWER),alimeeting, aishell-4, ami等等这些测试集上
你好,非常好的工作,有几个问题想要请教下: