今天發點適合做音色復刻的東西。
說實話,現在做 AI 語音最煩的地方,是生成的音頻裏只想改幾個詞,卻不得不重新錄、重新配、重新剪。
今天這個 GitHub 的 ViiTorVoice-NAR 項目就很適合這種場景:給一段原始音頻和對應文案,直接把裏面的局部內容改掉,聲線、語氣、節奏還能保留原來的感覺。

01. 項目簡介
ViiTorVoice-NAR 是 viitor-ai 開源的非自迴歸語音生成系統,主要面向語音克隆、局部語音編輯、情感控制和副語言控制。
項目地址:https://github.com/viitor-ai/viitor-voice-nar
ViiTorVoice-NAR 的核心思路是把語音生成從逐 token 接龍改成離散音頻 token 填空。
傳統自迴歸 TTS 往往按順序生成音頻 token,前面生成完才能繼續後面;ViiTorVoice-NAR 使用 masked language model 方式,在離散 codebook 空間裏補全被 mask 的音頻片段。

這個結構很適合語音局部編輯,比如把一句話裏的 Friday 改成 Monday,只需要定位並重合成被修改的局部區域,不必整段音頻重新生成。
ViiTorVoice-NAR 的核心能力:
- 語音克隆:輸入一段提示音頻,模型生成目標文本對應的語音,並儘量保留提示音頻中的說話人音色。
- 局部語音編輯:輸入原始音頻、原始文本和編輯後的完整文本,系統會先對文本做 diff,再結合強制對齊結果找到需要替換的音頻區域,最後只重合成那一小段音頻。
- 情感和副語言控制:文本條件裏可以插入情感標籤或副語言標籤,比如情緒、笑聲、停頓、語氣等。
- 低延遲推理:項目支持 first block 推理模式。模型可以先生成第一塊音頻 token,用來縮短首幀等待時間。
02. 項目實測
項目需要安裝 git 、uv 和英偉達的顯卡,只需要 8G 顯存就夠了,12G 使用起來會更流暢一點。
環境裝好直接克隆項目到一個英文路徑:
1 cd D:\
2 git clone https://github.com/viitor-ai/viitor-voice-nar.git viitor-voice-nar
3 cd D:\viitor-voice-nar
然後創建創建 Python 3.12 虛擬環境,並安裝依賴:
1 uv venv --python 3.12
2 uv pip install --python .venv\Scripts\python.exe -r requirements-grpc.txt
3 uv pip install --python .venv\Scripts\python.exe -r requirements-alone.txt
4 uv pip install --python .venv\Scripts\python.exe protobuf==4.25.3
下載模型,模型有 10 多個 G,大家留好空間:
1 New-Item -ItemType Directory -Force local_models
2 $env:PYTHONIOENCODING="utf-8"
3 .venv\Scripts\hf.exe download ZzWater/ViiTorVoice-NAR --local-dir local_models
最後啓動就可以開始用了:
1 cd D:\viitor-voice-nar
2 .\run_grpc_v2.ps1 start all -- --no-warmup
case 1 語音克隆
1 Copy-Item "被克隆的語音位置" "D:\viitor-voice-nar\input_voice_clone.mp3" -Force
2
3 curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
4 -F "ref_audio=@D:\viitor-voice-nar\input_voice_clone.mp3" `
5 -F "text=你好,這是一次語音克隆測試。" `
6 -F "language=zh" `
7 -F "allow_missing_ref_text=true" `
8 -F "output_format=wav" `
9 -F "num_steps=32" `
10 --output "語音克隆輸出位置" `
11 --write-out "HTTP %{http_code} size %{size_download}`n"
原版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-01.m4a
克隆版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-02.m4a
可以看出克隆版不僅音色比較像,還帶了一點說唱的味道。
case 2 局部改詞
1 Copy-Item "被克隆的語音位置""D:\viitor-voice-nar\input_liziming.mp3" -Force
2
3 curl.exe -X POST http://127.0.0.1:7861/v1/text-local-edit `
4 -F "source_audio=@D:\viitor-voice-nar\input_liziming.mp3" `
5 -F "original_text=請注意三年六班李子明,李子明同學,你媽媽拿了兩罐旺仔牛奶要給你。" `
6 -F "edited_text=請注意三年六班克勞德,克勞德同學,你媽媽拿了兩份迪普斯科要給你。" `
7 -F "language=zh" `
8 -F "input_format=wav" `
9 -F "output_format=wav" `
10 -F "align_granularity=word" `
11 -F "expand_mask_ratio=1.5" `
12 -F "num_steps=32" `
13 --output "語音克隆輸出的位置" `
14 --write-out "HTTP %{http_code} size %{size_download}`n"
原版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-03.m4a
改詞版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-04.m4a
除了需要改動的地方,其他地方基本沒有什麼變動。
case 3 情緒控制
1 Copy-Item "被克隆的語音位置""D:\viitor-voice-nar\input_sad_ref.wav" -Force
2
3 $Text = "你好,這是一次悲傷情緒的語音生成測試。"
4
5 curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
6 -F "ref_audio=@D:\viitor-voice-nar\input_sad_ref.wav" `
7 --form-string"text=<|emotion-sad|>$Text" `
8 -F "language=zh" `
9 -F "allow_missing_ref_text=true" `
10 -F "emotion_guidance_scale=6.0" `
11 -F "nvv_guidance_scale=2.0" `
12 -F "output_format=wav" `
13 -F "num_steps=32" `
14 --output "語音克隆輸出的位置" `
15 --write-out "HTTP %{http_code} size %{size_download}`n"
原版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-05.m4a
悲傷版:
https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-06.m4a
情緒很到位了,音色也沒有隨着情緒的變動而被改變。
03. 挖一挖
AI 語音正在進入內容生產裏最費時、也最費錢的部分:改稿。
Monotype 2025 年調研了 1008 名創意專業人士,57% 的創意團隊每週超過四分之一時間花在非創意工作上,包括素材管理、合規檢查和流程瓶頸。

短視頻口播、廣告素材、課程旁白、遊戲語音、客服播報,經常只改一個人名、日期、品牌詞或價格,傳統流程卻要重新錄音、重新剪輯、重新審一遍。
ViiTorVoice-NAR 的語音克隆負責生成新內容,局部語音編輯負責改掉舊音頻裏的幾個詞,情緒控制負責補上語氣變化,改版更輕鬆。
省下來的不只是配音費,還有來回溝通、等待排期和反覆剪輯的時間。
個人創作者可以拿來做音頻整活和口播改稿,公司可以做內部配音工具,還可以圍繞授權聲音資產搭一套更低成本的生產流程。
AI 語音真正進入生產,不靠一次生成多驚豔,靠的是每次改稿都少折騰一點。
原文鏈接:GitHub 低星精品,免費的音色復刻項目