
阿里巴巴雲計算正式推出 Qwen Audio 3.0 TTS,這是一個面向生產環境的語音合成系統,為需要高品質、可定制文本轉語音的用戶帶來了重大技術進展。最新版本在內容一致性、說話人相似度、韻律自然性、音訊品質、可控性、多語言覆蓋、整體效率與穩健性方面都實現了顯著提升。該系統整合了 12.5 Hz 低幀率語音 tokenizer,降低推理延遲,同時採用五階段漸進式訓練範式,緊密協調語言與頻率建模優化。

多語言支援與長篇幅合成能力
Qwen Audio 3.0 TTS 支援 16 種語言、20 個中文方言地區,並提供一次性長篇幅合成功能,最長可生成 3 分鐘的語音輸出。這種廣泛的語言覆蓋使其成為全球內容創作者與企業的理想選擇。系統採用自由風格自然語言指令跟隨與細粒度內聯標籤功能,為各種部署場景提供生產級別的控制能力。即使在面對嘈雜、混響或不清晰的參考音訊源時,Qwen Audio 3.0 TTS 也能保持高性能表現,展現了其強大的魯棒性。
該模型在多項評估中取得了最先進的成果,包括 SEED-TTS-Eval、CV3-Eval、指令跟隨、長篇幅與聲學穩健性測試。它還在獨立的 Artificial Analysis 文本轉語音排行榜上名列前茅,證明了其在業界的領先地位。

生產級別控制與應用場景拓展
Qwen Audio 3.0 TTS 的推出滿足了企業對高品質語音合成的日益增長的需求。無論是內容創作、客服自動化、教育應用還是無障礙服務,該系統都能提供可靠的解決方案。自然語言指令跟隨功能使用戶能夠用自然語言描述語音風格與特性,而無需複雜的技術配置。細粒度控制能力則允許開發者精確調整語音輸出的各個方面,從說話速度到情感表達。
AI 語音技術的持續創新與市場領導
Qwen Audio 3.0 TTS 的發布展現了阿里巴巴在 AI 語音技術領域的持續創新與市場領導力。隨著 AI 應用的不斷擴展,高品質文本轉語音技術變得越來越重要。Qwen Audio 3.0 TTS 在效率、品質與可控性方面的優勢使其成為企業與開發者的首選。未來,我們可以期待更多創新的語音合成應用,包括實時翻譯、個性化語音助手與沉浸式多媒體體驗。
新聞資料來源
https://alternativeto.net/news/2026/7/alibaba-launches-qwen-audio-3-0-tts-for-efficient-robust-and-consistent-text-to-speech/
https://funaudiollm.github.io/qwen-audio-3.0-tts/
https://the-decoder.com/alibabas-qwen-audio-3-0-tts-plus-tops-the-competition-in-the-text-to-speech-rankings/
