Skip to content

声音克隆配音

换一种语言,也不必让所有说话人变成同一个声音

通用 TTS 可以翻译文字,却常常丢掉“是谁在说”。WaveShift 会从源视频中为说话人建立可用的声音参考,再据此生成目标语言句子;源音条件允许时,新语音仍能与原说话人保持可辨认的联系。

更新于 2026 年 8 月 29 日 · WaveShift 团队

符合资格的新用户最多获赠 15 分钟。请只在具备必要同意和权利时使用声音克隆。

按说话人

保持声音身份

不同人物不必被压成同一个通用旁白。

10 种

目标语言

同一来源可在支持的语言集合中审听。

单句

可独立修复

修正一条目标语句,不必重做整条视频。

配音工作流里的声音克隆是什么

用于配音时,声音克隆不只是挑一个合成音色预设。系统会先找出某个说话人可用的源语音,建立声音参考,再用这个参考生成翻译后的句子。

目标是延续说话人身份,而不是承诺在每种语言里都百分之百复制口音、情绪或表演细节。

  • 按说话人建立参考,减少所有人都像同一个旁白的问题。
  • 带时间轴的字幕让新语音仍对应原场景。
  • 原始背景音轨帮助目标语音留在原视频环境里。

源音质量决定上限

干净且长度足够的声音样本,比一小段埋在响亮音乐下的语音提供更多有效信息。重叠说话、喊叫、耳语、强混响和过短发言,都可能降低相似度或可懂度。

WaveShift 会自动挑选并处理源材料,但无法恢复原录音里从未清楚出现的声学细节。多人视频尤其应该尽早检查主讲人和次要说话人。

  • 尽量使用没有削波的清晰语音。
  • 既检查主讲人,也检查发言较短的第二说话人。
  • 分别听发音与音色,它们是两个不同的质量维度。

翻译和声线都需要人工审听

熟悉的音色不会让翻错的人名自动变正确。声线、发音、含义、时间对齐和背景平衡应该分开检查。

如果问题只在一句话,编辑目标字幕并重新生成该句即可。这样能保留周围已经完成的结果,也更容易判断一次有意的发音调整。

授权与负责任使用

只有在你拥有录音,或获得说话人许可并有权制作翻译版本时,才应该克隆声音。不要用它冒充他人、误导受众,或规避应有的披露。

WaveShift 是制作工具,不能替代同意、版权清理,以及你所在市场和发布平台要求的标注规则。

常见问题

当源素材能提供可用参考时,WaveShift 会生成与说话人相关的目标语音,而不是给所有人同一个通用音色。相似度会受源音和目标语言影响。

声音克隆负责说话人身份;转写、翻译、时间轴和语音生成是完整配音流程中的不同步骤。

可以编辑对应目标字幕并重新生成该句。人名和专业术语仍可能需要有意识地改写或做读音调整。

需要。只在具备必要同意和权利时使用录音与声音,并遵守适用的披露和反冒充规则。

用你自己的视频验证

符合资格的新用户最多获赠 15 分钟。请只在具备必要同意和权利时使用声音克隆。

尝试说话人配音