Skip to content

用自己的声音给学生做范读:15秒克隆音色,TaiWe帮林老师实现了 ​

痛点:AI发音再好听,终归不是自己的声音 ​

林老师用 Edge TTS 生成了几十段课文范读音频,质量确实不错。但发到家校群后,有家长私聊她说:"林老师,音频是你录的吗?听着不太像你的声音。"

林老师哭笑不得——确实是 AI 读的,不是她自己的声音。

"我知道 AI 读得比我好,"林老师说,"但学生听到的是'林老师'的范读,不是'林老师'的声音。亲近感是不一样的。"

解决方案:声音克隆,15秒克隆你的声音 ​

林老师找到 TaiWe 小助手:"有没有办法用我自己的声音来读?"

小助手告诉她:有。CosyVoice-0.5B 支持声音克隆,只需要 15 秒录音,就能生成一个"林老师专属"的音色,以后所有课文范读都是林老师自己的声音。

准备工作:什么样的录音适合克隆? ​

克隆效果好,录音质量是关键。TaiWe 给林老师发了录音指南:

✅ 适合克隆的录音条件:

  • 时长:15 秒以上(越长越好,建议 30 秒)
  • 环境:安静,无背景噪音(空调声、窗外车声越小越好)
  • 设备:手机录音即可,无需专业麦克风
  • 内容:朗读一段话,语速自然,音量稳定
  • 格式:mp3 / wav / m4a 均可

❌ 不适合克隆的录音:

  • 有背景音乐
  • 录音断断续续
  • 多人同时说话
  • 网络通话录音(压缩严重)

林老师在一个周六上午,办公室无人的时候,用手机录了 30 秒:"Good morning, class. Today we are going to learn about..."

开始克隆:3步搞定 ​

第一步:上传录音并告诉小助手对应的文字

林老师把录音文件发给小助手,并附上录音对应的文字内容:

这是我录的30秒音频,对应的文字是:
"Good morning, class. Today we are going to learn about the concept of cultural diversity. In our increasingly interconnected world, understanding different cultures has become more important than ever."

请帮我克隆这个声音。

第二步:等待克隆完成

小助手执行克隆命令:

powershell
$python = "$env:USERPROFILE\.taiwe\pyen\Scripts\python.exe"
$script = "scripts/txt2voice/cosyvoice_clone.py"

& $python $script --ref_audio "林老师录音.mp3" --ref_text "Good morning, class..." --voice_id "lin_teacher"

克隆过程约 2-3 分钟(需要下载 5-7GB 的 CosyVoice-0.5B 模型,首次使用)。

第三步:保存专属音色

克隆成功后,音色 ID 为 lin_teacher,可以保存为默认音色。之后所有 TTS 生成都自动使用林老师的声音。

生成范读:和自己读的一模一样 ​

林老师让小助手生成一段英语课文的范读:

powershell
$python = "$env:USERPROFILE\.taiwe\pyen\Scripts\python.exe"
$script = "scripts/txt2voice/cosyvoice_infer.py"

& $python $script --text "The concept of cultural diversity has become increasingly important..." --voice lin_teacher --output "范读_Unit1_Reading.mp3"

林老师试听:"声音跟我本人几乎一模一样!连语调的起伏都保留了。"

她把这段范读发到家校群,这次家长群里没有问"这是不是老师自己录的"了。

声音克隆的实际效果 ​

对比项Edge TTS(Aria)林老师声音克隆
声音来源微软标准音色林老师本人
学生亲近感一般明显更高
适合场景通用范读持续性系列范读
配置要求零配置需 4GB+ 显存

林老师说:"声音克隆特别适合以下几种情况——"

  1. 持续性范读系列:一个学期每篇课文都用林老师的声音,学生熟悉度高
  2. 个性化辅导:给不同水平学生发不同版本,用的都是林老师的声音
  3. 双语班/国际班:需要中英双语范读,全部统一用班主任/任课老师声音

进阶:克隆不同场景的声音 ​

林老师后来还探索了更多玩法:

给语文老师用:语文老师克隆自己的声音朗读古诗文,学生听着老师的声音背课文效率更高。

给班主任用:班主任克隆自己的声音录制班会课通知,发到家长群,家长一听就是班主任本人。

给家长用:有条件的学校,可以帮家长也克隆自己的声音,用于亲子共读材料。

FAQ ​

Q:克隆的声音和我本人完全一样吗? A:相似度很高,但不会100%一样。CosyVoice会保留音色、语调特点,但生成音频的流畅度和某些音素可能会有轻微差异。多用几次后会越来越自然。

Q:克隆需要什么样的电脑配置? A:需要至少 4GB 显存的无独显电脑(或者有独立显卡)。没有独显或显存不足的电脑建议用 Edge TTS(零配置,但无法克隆)。

Q:克隆的音色可以给别人用吗? A:建议仅本人使用。CosyVoice 的商业使用需遵守其开源协议,具体请查阅 ModelScope 上的模型说明。

Q:15秒录音够吗? A:15秒是最低要求。30秒以上效果会更好,1分钟以上克隆质量最佳。


相关阅读 ​


来源:TaiWe 种子用户实测 N=1(高中英语林老师)| 最后更新:2026-09-28

TaiWe - 教师AI工作助手