问题
使用 SoulX-Podcast-1.7B-dialect 生成粤语语音时,部分字存在系统性发音错误。具体表现为:多音字选错读音、普通话/粤语读音混淆、韵母偏移。
环境
- 模型:SoulX-Podcast-1.7B-dialect
- dialect_prompt:
<|Yue|>
- temperature: 0.3
- 输入文本:繁體粤語口語
- via ComfyUI custom nodes (flybirdxx/ComfyUI-SoulX-Podcast)
具体残字(5 例)
| 字/词 |
正确粤拼 |
SoulX 错读 |
错误类型 |
| 站(黃埔站) |
zaam6 |
赞(zaan3) |
多音字选错(zaam6 vs cyun5) |
| 校(校網) |
haau6 |
教(gaau3) |
多音字选错(haau6 vs gaau3) |
| 泳(泳池) |
wing6 |
勇(jung) |
韵母混淆(wing → ung) |
| 流(一流) |
lau4 |
疔(Mandarin liu) |
普通话读音替代粤语 |
| 尺/呎(680呎) |
cek3 |
齐(cai4) |
普通话读音替代粤语 |
这些字在香港房地产场景中是高频词(地铁站/校網/泳池/实用面积呎数),影响较大。
当前 workaround
- 换字/加上下文:站→地鐵站,校→小學校網,泳→游泳池(加上下文帮 LLM 消歧多音字)
- 换同义词:一流→頂級(避开残字)
问题
- SoulX 是否计划支持 Jyutping(粤拼)输入?如果能像 ACE-Step 那样接受音素级输入(
language=yue + Jyutping phonemes),就能精确控制每个字发音,根治残字。
- dialect_prompt 是否支持发音提示?例如在
<|Yue|> 后加 尺讀cek3, 站讀zaam6,LLM 会看到这些 token——是否影响 speech token 生成?实测有效的话就不用换字了。
- 这些字的错误是否是训练数据不足导致?粤语多音字(站/校)和普通话-粤语混淆(流/尺)是已知的 TTS 难点——是否有针对性的训练数据补充计划?
感谢这个优秀的开源模型!粤语发音如果能进一步提升,对香港本地应用场景帮助很大。
问题
使用 SoulX-Podcast-1.7B-dialect 生成粤语语音时,部分字存在系统性发音错误。具体表现为:多音字选错读音、普通话/粤语读音混淆、韵母偏移。
环境
<|Yue|>具体残字(5 例)
这些字在香港房地产场景中是高频词(地铁站/校網/泳池/实用面积呎数),影响较大。
当前 workaround
问题
language=yue+ Jyutping phonemes),就能精确控制每个字发音,根治残字。<|Yue|>后加尺讀cek3, 站讀zaam6,LLM 会看到这些 token——是否影响 speech token 生成?实测有效的话就不用换字了。感谢这个优秀的开源模型!粤语发音如果能进一步提升,对香港本地应用场景帮助很大。