Skip to content

粤语发音问题:部分字系统性误读(残字),是否有 Jyutping/音素输入计划? #72

Description

@vinsunfeng

问题

使用 SoulX-Podcast-1.7B-dialect 生成粤语语音时,部分字存在系统性发音错误。具体表现为:多音字选错读音、普通话/粤语读音混淆、韵母偏移。

环境

  • 模型:SoulX-Podcast-1.7B-dialect
  • dialect_prompt: <|Yue|>
  • temperature: 0.3
  • 输入文本:繁體粤語口語
  • via ComfyUI custom nodes (flybirdxx/ComfyUI-SoulX-Podcast)

具体残字(5 例)

字/词 正确粤拼 SoulX 错读 错误类型
站(黃埔站) zaam6 赞(zaan3) 多音字选错(zaam6 vs cyun5)
校(校網) haau6 教(gaau3) 多音字选错(haau6 vs gaau3)
泳(泳池) wing6 勇(jung) 韵母混淆(wing → ung)
流(一流) lau4 疔(Mandarin liu) 普通话读音替代粤语
尺/呎(680呎) cek3 齐(cai4) 普通话读音替代粤语

这些字在香港房地产场景中是高频词(地铁站/校網/泳池/实用面积呎数),影响较大。

当前 workaround

  1. 换字/加上下文:站→地鐵站,校→小學校網,泳→游泳池(加上下文帮 LLM 消歧多音字)
  2. 换同义词:一流→頂級(避开残字)

问题

  1. SoulX 是否计划支持 Jyutping(粤拼)输入?如果能像 ACE-Step 那样接受音素级输入(language=yue + Jyutping phonemes),就能精确控制每个字发音,根治残字。
  2. dialect_prompt 是否支持发音提示?例如在 <|Yue|> 后加 尺讀cek3, 站讀zaam6,LLM 会看到这些 token——是否影响 speech token 生成?实测有效的话就不用换字了。
  3. 这些字的错误是否是训练数据不足导致?粤语多音字(站/校)和普通话-粤语混淆(流/尺)是已知的 TTS 难点——是否有针对性的训练数据补充计划?

感谢这个优秀的开源模型!粤语发音如果能进一步提升,对香港本地应用场景帮助很大。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions