ViiTorVoice-NAR實測 – 開源免費的語音克隆工具

AI教程9小時前發佈新公告 AI管理員
0 0

今天發點適合做音色復刻的東西。

說實話,現在做 AI 語音最煩的地方,是生成的音頻裏只想改幾個詞,卻不得不重新錄、重新配、重新剪。

今天這個 GitHub 的 ViiTorVoice-NAR 項目就很適合這種場景:給一段原始音頻和對應文案,直接把裏面的局部內容改掉,聲線、語氣、節奏還能保留原來的感覺。

ViiTorVoice-NAR實測 – 開源免費的語音克隆工具

 

01. 項目簡介

 

ViiTorVoice-NAR 是 viitor-ai 開源的非自迴歸語音生成系統,主要面向語音克隆、局部語音編輯、情感控制和副語言控制。

項目地址:https://github.com/viitor-ai/viitor-voice-nar

ViiTorVoice-NAR 的核心思路是把語音生成從逐 token 接龍改成離散音頻 token 填空。

傳統自迴歸 TTS 往往按順序生成音頻 token,前面生成完才能繼續後面;ViiTorVoice-NAR 使用 masked language model 方式,在離散 codebook 空間裏補全被 mask 的音頻片段。

ViiTorVoice-NAR實測 – 開源免費的語音克隆工具

這個結構很適合語音局部編輯,比如把一句話裏的 Friday 改成 Monday,只需要定位並重合成被修改的局部區域,不必整段音頻重新生成。

ViiTorVoice-NAR 的核心能力:

  • 語音克隆:輸入一段提示音頻,模型生成目標文本對應的語音,並儘量保留提示音頻中的說話人音色。
  • 局部語音編輯:輸入原始音頻、原始文本和編輯後的完整文本,系統會先對文本做 diff,再結合強制對齊結果找到需要替換的音頻區域,最後只重合成那一小段音頻。
  • 情感和副語言控制:文本條件裏可以插入情感標籤或副語言標籤,比如情緒、笑聲、停頓、語氣等。
  • 低延遲推理:項目支持 first block 推理模式。模型可以先生成第一塊音頻 token,用來縮短首幀等待時間。

 

02. 項目實測

 

項目需要安裝 git 、uv 和英偉達的顯卡,只需要 8G 顯存就夠了,12G 使用起來會更流暢一點。

環境裝好直接克隆項目到一個英文路徑:

1  cd D:\
2  git clone https://github.com/viitor-ai/viitor-voice-nar.git viitor-voice-nar
3  cd D:\viitor-voice-nar

然後創建創建 Python 3.12 虛擬環境,並安裝依賴:

1  uv venv --python 3.12
2  uv pip install --python .venv\Scripts\python.exe -r requirements-grpc.txt
3  uv pip install --python .venv\Scripts\python.exe -r requirements-alone.txt
4  uv pip install --python .venv\Scripts\python.exe protobuf==4.25.3

下載模型,模型有 10 多個 G,大家留好空間:

1  New-Item -ItemType Directory -Force local_models
2  $env:PYTHONIOENCODING="utf-8"
3  .venv\Scripts\hf.exe download ZzWater/ViiTorVoice-NAR --local-dir local_models

最後啓動就可以開始用了:

1  cd D:\viitor-voice-nar
2  .\run_grpc_v2.ps1 start all -- --no-warmup

case 1 語音克隆

1  Copy-Item "被克隆的語音位置" "D:\viitor-voice-nar\input_voice_clone.mp3" -Force
2  
3  curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
4    -F "ref_audio=@D:\viitor-voice-nar\input_voice_clone.mp3" `
5    -F "text=你好,這是一次語音克隆測試。" `
6    -F "language=zh" `
7    -F "allow_missing_ref_text=true" `
8    -F "output_format=wav" `
9    -F "num_steps=32" `
10   --output "語音克隆輸出位置" `
11   --write-out "HTTP %{http_code} size %{size_download}`n"

原版:


https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-01.m4a

克隆版:

https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-02.m4a

可以看出克隆版不僅音色比較像,還帶了一點說唱的味道。

case 2 局部改詞

1  Copy-Item "被克隆的語音位置""D:\viitor-voice-nar\input_liziming.mp3" -Force
2  
3  curl.exe -X POST http://127.0.0.1:7861/v1/text-local-edit `
4    -F "source_audio=@D:\viitor-voice-nar\input_liziming.mp3" `
5    -F "original_text=請注意三年六班李子明,李子明同學,你媽媽拿了兩罐旺仔牛奶要給你。" `
6    -F "edited_text=請注意三年六班克勞德,克勞德同學,你媽媽拿了兩份迪普斯科要給你。" `
7    -F "language=zh" `
8    -F "input_format=wav" `
9    -F "output_format=wav" `
10   -F "align_granularity=word" `
11   -F "expand_mask_ratio=1.5" `
12   -F "num_steps=32" `
13   --output "語音克隆輸出的位置" `
14   --write-out "HTTP %{http_code} size %{size_download}`n"

原版:

https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-03.m4a

改詞版:

https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-04.m4a

除了需要改動的地方,其他地方基本沒有什麼變動。

case 3 情緒控制

1  Copy-Item "被克隆的語音位置""D:\viitor-voice-nar\input_sad_ref.wav" -Force
2  
3  $Text = "你好,這是一次悲傷情緒的語音生成測試。"
4  
5  curl.exe -X POST http://127.0.0.1:7861/v1/voice-clone `
6    -F "ref_audio=@D:\viitor-voice-nar\input_sad_ref.wav" `
7    --form-string"text=<|emotion-sad|>$Text" `
8    -F "language=zh" `
9    -F "allow_missing_ref_text=true" `
10   -F "emotion_guidance_scale=6.0" `
11   -F "nvv_guidance_scale=2.0" `
12   -F "output_format=wav" `
13   -F "num_steps=32" `
14   --output "語音克隆輸出的位置" `
15   --write-out "HTTP %{http_code} size %{size_download}`n"

原版:

https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-05.m4a

悲傷版:

https://ai-bot.cn/wp-content/uploads/2026/07/ViiTorVoice-NAR-06.m4a

情緒很到位了,音色也沒有隨着情緒的變動而被改變。

 

03. 挖一挖

 

AI 語音正在進入內容生產裏最費時、也最費錢的部分:改稿。

Monotype 2025 年調研了 1008 名創意專業人士,57% 的創意團隊每週超過四分之一時間花在非創意工作上,包括素材管理、合規檢查和流程瓶頸。

ViiTorVoice-NAR實測 – 開源免費的語音克隆工具

短視頻口播、廣告素材、課程旁白、遊戲語音、客服播報,經常只改一個人名、日期、品牌詞或價格,傳統流程卻要重新錄音、重新剪輯、重新審一遍。

ViiTorVoice-NAR 的語音克隆負責生成新內容,局部語音編輯負責改掉舊音頻裏的幾個詞,情緒控制負責補上語氣變化,改版更輕鬆。

省下來的不只是配音費,還有來回溝通、等待排期和反覆剪輯的時間。

個人創作者可以拿來做音頻整活和口播改稿,公司可以做內部配音工具,還可以圍繞授權聲音資產搭一套更低成本的生產流程。

AI 語音真正進入生產,不靠一次生成多驚豔,靠的是每次改稿都少折騰一點。

原文鏈接:GitHub 低星精品,免費的音色復刻項目

© 版權聲明

相關文章

暫無評論

暫無評論...