從多種資料學習真實世界的運作方式
Black Forest Labs 近日發表新一代多模態基礎模型FLUX 3,目前已開放搶先體驗。不同於先前主要聚焦影像生成的FLUX模型,FLUX 3從訓練初期便在同一套架構中,能夠同時學習影像、影片與聲音等不同形式的資料。
Black Forest Labs 認為,單獨使用任何一種資料,都不足以完整呈現真實世界。靜態影像可以記錄特定時間點的物體結構與空間關係;影片加入時間變化,能讓模型學習物體如何移動,以及事件之間的因果關係;聲音則能補充畫面未必能直接呈現的資訊,例如碰撞、機械運轉或其他物理事件所產生的聲響。語言則負責將這些感知資訊與使用者的目標、概念及指令連結起來。
透過同時學習不同形式的資料,模型可以交叉比對彼此之間的關係,例如聲音是否與畫面中的撞擊同步、物體的移動是否符合重量與慣性,以及後續畫面是否能合理銜接先前發生的事件。Black Forest Labs 希望能藉此建立能理解現實世界運作方式的模型,使其不只能生成內容,也能進一步預測事件與控制實體設備。
FLUX 3建立在B lack Forest Labs 開發的Self-Flow方法之上。Self-Flow的重點,是在同一套模型架構內整合多模態內容生成與資訊表徵學習。Black Forest Labs以此為基礎,擴大運算資源與訓練資料規模,讓FLUX 3能同時學習影片、影像及聲音,而不是分別訓練不同模型。
單次生成最長20秒含聲影片
FLUX 3可以整合不同形式的輸入與輸出,根據純文字指令,或使用影像及影片作為參考資料,生成靜態影像及包含聲音的影片。
在影片功能方面,FLUX 3單次最多可生成20秒的影片,並同步產生聲音。主要功能包括文字生成影片、影像生成影片、參考影片轉換、接續既有影音內容,以及根據指定關鍵影格產生過渡畫面。
模型也支援多語言對話、不同畫面比例及多種視覺風格,從手持攝影機風格、動畫到電影感畫面皆包含在內。此外,FLUX 3還能將多個短片段接續成包含多個鏡頭的長篇內容,並利用參考影像維持不同場景中的角色一致性。
Black Forest Labs 公布的初步評測,是以10秒、720p並含聲音的文字生成影片進行比較。在兩兩比較的偏好測試中,FLUX 3相較Grok Imagine Video最高獲得69%的偏好率,相較Kling v3 Pro為60%,相較Runway Gen-4.5及Luma Ray 3.2則分別為77%及93%。
不過,這些結果來自 Black Forest Labs 自行進行的初期評測,模型與測試系統仍在開發中,因此不能直接解讀為FLUX 3已全面超越其他影片生成模型。官方表示,目前FLUX 3在人物表情、聲音與物理事件的對應,以及多語言內容生成方面,已有較突出的表現。
除了影片生成之外,FLUX 3也支援不同風格、畫面比例與解析度的影像生成及編輯。Black Forest Labs表示,在模型訓練中期進行的初步測試中,FLUX 3處理複雜指令及生成圖片中文字的能力,相較先前版本已有明顯改善,並能更準確呈現多種語言的文字。
除了目前已開放搶先體驗的FLUX 3 Video,Black Forest Labs也將推出專門提供圖片生成與編輯功能的FLUX 3 Image,預計在未來幾週內開放測試。
與mimic robotics合作投入實體AI
FLUX 3對現實世界動態的理解,也被延伸至機器人動作預測與控制。開發團隊目前採取兩種做法:第一種是直接將動作預測能力加入FLUX 3;第二種則是使用預先訓練的影片模型作為基礎,再利用較少量的特定任務資料,訓練專門控制機器人動作的模型。
Black Forest Labs也與德國機器人公司mimic robotics合作開發FLUX-mimic。這套影片與動作模型以FLUX 3為基礎,結合mimic robotics在機器人學習、精細操作及工廠部署方面的技術,用於處理零件擺放、組裝、電子控制單元安裝,以及電纜、密封件等柔性材料操作。
根據Black Forest Labs與mimic robotics的說法,FLUX-mimic目前已在Audi的實際生產與物流環境中進行測試與部署,用來處理傳統工業用機器人較難完成的複雜操作。
影像影片與模型權重將陸續開放
Black Forest Labs計畫在未來幾週至幾個月內,將分階段開放FLUX 3的各項功能。每項功能都會有搶先體驗階段,以收集使用者意見、改善服務穩定性並進行安全測試。
FLUX 3 Video將提供影片與聲音生成及編輯功能,並透過API和特定合作方式提供非公開模型權重。FLUX 3 Image同樣會提供API及非公開權重存取。機器人動作預測功能則會先提供給部分研究機構與商業合作夥伴,包括FLUX-mimic及FLUX 3 Action。
此外,Black Forest Labs也計畫推出FLUX 3 Dev,開放多模態基礎模型的權重,讓開發者研究影音內容生成與動作預測應用。這與FLUX 3 Video及FLUX 3 Image提供的非公開權重存取方式並不相同。
Black Forest Labs也表示,未來將持續整合影像與聲音感知、動作預測及語言能力,讓同一套模型能應用於互動式影音編輯、環境模擬、電腦操作及實體AI等領域。
首圖由 Nano Banana AI 生成







