Spark-Audio-1.0-Preview是什麼
Spark-Audio-1.0-Preview是科大訊飛推出的全國產語音基座大模型,採用0.65B音頻編碼器+30B-A3B MoE語言模型架構,用1300萬小時音頻及大量文本數據基於純國產算力訓練完成。模型能直接理解語音中的語義、情緒與場景,支持99種語言、202種方言識別及語音轉寫、翻譯、說話人識別、情感分析、音頻問答等任務,在高噪聲、小音量等複雜場景表現領先,可廣泛應用在客服、車載、醫療等場景。

Spark-Audio-1.0-Preview的主要功能
-
語音轉寫:將語音直接轉爲文字,支持99種語言和202種方言識別。
-
多語言翻譯:實現語音到語音/文本的跨語言翻譯,保留語氣語調等韻律信息。
-
多方言識別:覆蓋202種方言,粵語、溫州話等均能聽懂。
-
環境音識別:能同時聽懂人聲與環境背景音,理解聲音發生的場景。
-
說話人識別:自動區分誰在說話,適用於會議轉寫、紀要生成等。
-
情感分析:捕捉語音中的語氣與情緒,讓交互更”有溫度”。
-
音頻問答:基於複雜音頻內容進行理解與問答,從”聽清”走向”聽懂”。
Spark-Audio-1.0-Preview的技術原理
- 端到端語音理解架構:不同於傳統”先轉文字再交給大模型”的級聯方案,模型採用0.65B音頻編碼器搭配30B-A3B大語言模型,文本與語音雙模態直接輸入同一模型,一次性聽懂人聲、環境音、音樂及其語義、情緒和場景,避免了級聯鏈路中信息丟失和錯誤累積的問題。
- 音頻編碼器預訓練:通過音頻編碼器預訓練逐步擴展其表徵能力,再用預訓練和後訓練提升模型基礎能力、複雜場景泛化性及多任務效果,最終在高噪聲、小音量等真實複雜場景下取得優異成績。
- 全國產算力訓練:模型基於純國產算力集羣,用1300萬小時音頻和大量文本數據訓練完成,是業界首個基於全國產算力訓練的語音基座大模型,證明了國產算力可訓出業界領先水平的語音模型。
- 可微調的基座體系:類似訊飛星火大模型1+N體系,Spark-Audio作爲語音基座可進一步微調,開發出語音識別、語音同傳、語音交互等專用模型或系統,便於在各類語音業務中落地。
如何使用Spark-Audio-1.0-Preview
- 打開官方體驗頁面:訪問模型體驗地址 https://iflytekresearch.iflytek.com/experience/spark-audio 。
- 在線體驗模型能力:在頁面上輸入文本或語音,體驗語音轉寫、翻譯、方言識別、音頻問答等功能。
Spark-Audio-1.0-Preview的核心優勢
-
全國產算力訓練:業界首個基於純國產算力集羣訓練的語音基座大模型,證明國產算力可訓出業界領先水平模型。
-
端到端直接理解語音:擺脫”先轉文字再理解”的級聯方案,不丟失語氣、情緒、環境音等關鍵信息,消除鏈路割裂與延遲卡頓。
-
多語言多方言覆蓋廣:支持99種語言和202種方言識別,在同尺寸模型對比中多語言、多方言識別效果佔優。
-
複雜場景表現領先:在高噪聲、小音量等真實應用類任務上有明顯領先優勢,抗噪能力突出。
-
對標更大模型不落下風:與尺寸高一個數量級的Qwen3.5-omni-plus效果接近,Fleurs中文測試集取得SOTA,多項評測得分超過Gemini-3.1 Pro。
-
文本能力不降智:在通用知識、數學與代碼等文本任務上未出現明顯降智,克服了語音基座模型的常見難點。
-
架構高效:採用0.65B音頻編碼器+30B-A3B MoE架構,小尺寸實現接近更大閉源模型的表現。
Spark-Audio-1.0-Preview的同類競品對比
| 對比維度 | Spark-Audio-1.0-Preview | Qwen3.5-Omni-Flash |
|---|---|---|
| 模型架構 | 0.65B(Dense)音頻編碼器 + 30B-A3B(MoE)語言模型,端到端單模型理解語音 | Thinker–Talker架構,音視頻文本統一編碼,多碼本編解碼器實現單幀即時語音合成 |
| 參數規模 | 30B-A3B(MoE激活約3B) | 35B-A3B(MoE,訊飛文章同尺寸對比基準) |
| 訓練算力 | 純國產算力集羣(業界首個) | 未公開 |
| 訓練數據 | 1300萬小時音頻 + 大量文本 | 未公開 |
| 語言覆蓋 | 99種語言、202種方言識別 | 語音識別覆蓋113種語言和方言,語音合成36種語言 |
| 上下文/輸入長度 | 未公開 | 最大輸入19.6萬tokens、上下文26.2萬tokens,支持10小時以上音頻 |
| Fleurs多語言ASR(WER↓) | 中文子集SOTA(官方口徑) | 平均10.75%,粵語3.1%(官方技術報告) |
| S2TT語音翻譯(BLEU↑) | 支持多語言翻譯 | Fleurs top59平均29.4分 |
| 實時交互延遲 | 未公開 | 首包延遲約235ms(音頻輸入),支持語義打斷和語音克隆 |
Spark-Audio-1.0-Preview的應用場景
-
智能客服:識別用戶的情緒和表達方式,讓對話更連貫、更有溫度,提升服務體驗。
-
汽車座艙:在車載嘈雜環境中準確識別駕駛員指令,支持方言交互,打造更自然的車內語音交互體驗。
-
實時翻譯與跨語言會議:進行語音同傳和多語言翻譯,同時保留語氣、語調等韻律信息,帶來更自然的跨語言交流體驗。
-
會議轉寫與紀要生成:自動區分說話人、提取關鍵決策點,並生成結構化紀要,幫助工作人員減少重複整理工作。
-
醫療電子病歷與內容審覈:通過語音完成病歷記錄與內容審覈,在醫療等專業場景中降低人工錄入負擔、提高效率。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...