
圖像生成模型 —— 生成式 AI 的常用子集 —— 可以解析并理解書面語言,然后將文字轉換為幾乎任何風格的圖像。
Black Forest Labs 的一系列新模型代表了圖像生成領域的前沿技術 —— 現在可在 PC 和工作站上試用 —— 在 GeForce RTX 和 NVIDIA RTX GPU 上的運行速度最快。
流暢的功能
FLUX.1 AI 是由 Black Forest Labs 開發的文本生成圖像模型套件。這些模型基于 Diffusion Transformer(DiT)體系架構而構建,以便大參數量的模型保持高效運行。Flux 模型在擁有 120 億個參數的模型上進行訓練,以生成高質量圖像。
DiT 模型屬于高效的計算密集型模型 —— NVIDIA RTX GPU 對于處理這些新模型至關重要,其中最大規模的模型如果不進行重大調整,將無法在非 RTX GPU 上運行。Flux 模型現在支持 NVIDIA TensorRT 軟件開發套件,該套件可將這些模型的性能提升高達 20%。用戶可以在 ComfyUI 中借助 TensorRT 試用 Flux 和其他模型。

提示:“一張雜志照片:在暴風雪中,一只猴子在溫泉中沐浴,水面上飄著蒸汽?!?/span>
此圖片由 FLUX.1 生成。來源:NVIDIA
Flux 的優勢
FLUX.1 在生成高質量、多樣化的圖像方面表現卓越,其出色的指令遵循性意味著 AI 能夠準確理解并執行指令。提示依從性較高,意味著生成的圖像與文本提示描述的元素、風格和情緒高度匹配。提示依從性較低會導致圖像可能部分或完全偏離給定的指令。
FLUX.1 以能夠精確渲染人體解剖結構(包括手部和人臉等具有挑戰性的復雜特征)而著稱。FLUX.1 還顯著改進了在圖像中生成易讀文本的過程,解決了文本轉圖像模型的另一個常見挑戰。這使得 FLUX.1 模型非常適合需要精確文本表示的應用,例如宣傳材料和書籍封面。
FLUX.AI 具有三種變體,可為用戶提供最適合其工作流的選擇,而不會犧牲質量:
FLUX.1 pro:為企業用戶提供最高質量的模型;可通過應用編程接口訪問。
FLUX.1 dev:FLUX.1 pro 的免費精華版本,仍然具有較高質量。
FLUX.1 schnell:運行速度最快的模型,非常適合本地開發和個人使用;具有寬松的 Apache 2.0 許可證。
dev 和 schnell 模型為開源版本,Black Forest Labs 在流行平臺 Hugging Face 上提供對其關鍵功能的訪問。這一做法得到社區廣泛認可。
得到社區廣泛認可
自發布以來,Flux 模型的 dev 和 schnell 變體已在 Hugging Face 上被下載 200 多萬次。
FLUX.1 的強大功能受到用戶廣泛贊譽,稱其能夠生成具有非凡細節和逼真度、視覺效果令人驚艷的圖像,并且可以處理復雜的提示,而無需調整大量參數。

提示:“一張細節豐富的專業特寫照片:一只變形孟加拉虎身穿白色無袖背心,戴著太陽鏡,脖子上掛著耳機,爪子放在舞臺上的唱盤上,在伊比沙島晚間的戶外電子舞曲音樂會上擔任 DJ;派對氣氛,少量煙霧與焦散光照?!?/span>
此圖片由 FLUX.1 生成。來源:NVIDIA

提示:“一張攝影品質圖像:雨夜,繁華的城市街道上,一輛黃色出租車停在路邊,前燈亮著,照射在潮濕路面上。一位身著紅色外套的女性撐著一把亮綠色雨傘,看著她的智能手機。左側有一家咖啡店,霓虹燈標志牌上面顯示著藍色字母‘Café Mocha’。咖啡店裝著大窗戶,從中可以看到人們在享受飲料。路燈照亮了該區域,在整個場景上投射出溫暖的光芒,而雨滴在空中產生了霧霾效果。背景中,一座高樓上的大型數字時鐘顯示時間為下午 8 點 45 分?!?/span>
此圖片由 FLUX.1 生成。來源:NVIDIA
此外,FLUX.1 還善于處理各種藝術風格,并能夠快速高效地生成圖像,因此是完成個人和專業項目不可或缺的重要工具。
入門指南
用戶可以使用 ComfyUI 等流行社區網頁訪問 FLUX.1。社區運行的 ComfyUI 維基百科提供了入門分步說明。
許多創作者還提供了有關 Flux 模型的視頻教程,例如 MDMZ 制作的這個視頻教程:
點擊“閱讀原文”或掃描海報二維碼,北京時間 1 月 7 日(星期二)上午 10:30 觀看 NVIDIA CEO 黃仁勛在拉斯維加斯現場發表的 CES 開幕主題演講。
