Black Forest Labs 推出 Flux 3!首個支援原生音訊的多模態視頻生成模型

Flux 3 多模態模型

德國 AI 新創公司 Black Forest Labs 正式推出 Flux 3,這是其首個多模態模型,能夠生成長達 20 秒的視頻並具有原生同步音訊。該基礎模型在圖像、視頻與音訊上進行了聯合訓練,代表了 AI 生成技術的重大進步。Flux 3 支援文本轉視頻、圖像轉視頻、視頻轉視頻與關鍵幀控制轉場,能夠生成多語言對話、匹配音訊與物理事件,並產生更自然的面部表情。

Flux 3 視頻生成

多模態生成與序列創建能力

用戶可以透過代理控制的轉場連接生成的鏡頭,創建更長的視頻序列。這種靈活性使內容創作者能夠製作複雜的多場景視頻,而無需依賴多個工具或手動編輯。Flux 3 的多模態特性使其能夠理解與生成複雜的視覺與聲音組合,提供了前所未有的創意可能性。

在 Black Forest Labs 的內部基準測試中,Flux 3 在 93% 的比較中優於 Luma Ray 3.2,在 77% 的比較中優於 Runway Gen 4.5,並超過了包括 Grok Imagine Video、Kling v3 Pro 與 Happy Horse 在內的多個模型。與 Seedance 2.0 與 Gemini Omni Flash 的結果更為接近,但尚未獲得獨立驗證。Flux 3 Video 現已推出,而 Flux 3 Image 將很快進入早期存取階段。該公司還計畫將模型的開源權重主幹發布為 Flux 3 Dev,進一步推動開源 AI 生態的發展。

Flux 3 性能對比

AI 視頻生成技術的新紀元

Flux 3 的推出標誌著 AI 視頻生成技術進入新的發展階段。原生音訊支援消除了對外部音訊工具的需求,簡化了視頻製作工作流程。隨著越來越多的 AI 工具支援多模態生成,內容創作者將能夠更快速、更高效地製作高品質視頻。Flux 3 的推出預示著 AI 生成視頻將逐漸成為主流內容製作工具,改變數位內容創作的方式。

新聞資料來源

https://alternativeto.net/news/2026/7/black-forest-labs-launches-flux-3-its-new-multimodal-model-for-video-and-audio-generation/
https://bfl.ai/blog/flux-3
https://decrypt.co/374189/black-forest-labs-flux-3-image-video-robot-hands

返回頂端