摘要
- Qwen-Image-3.0 由阿里巴巴的 Qwen 團隊於 7 月 21 日發布,可接受 4,500 個 token 的指令。
- 這使得一次性生成複雜佈局成為可能,例如報紙、故事板和密集的資訊圖表網格。
- 與前代產品不同,此次發布未附帶開放模型權重、基準測試或技術報告;該模型可在 chat.qwen.ai 使用,API 定價尚未公佈。
阿里巴巴的 Qwen 團隊於週二推出了 Qwen Image 3.0,其宣傳重點與輸出結果是否美觀無關,而是關注輸出結果能否真正應用於工作中。
大多數 AI 圖像工具——如 Reve、Nano Banana、Seedream——都專注於特定領域:創意、真實感、編輯能力等。Qwen Image 3.0 則走向了不同的方向。Qwen 團隊在官方公告中寫道:「Qwen-Image-3.0 不僅追求『好看』,更追求『有用』,讓圖像生成成為真正可部署的生產力工具。」
其核心是中國巨頭阿里巴巴所稱的豐富內容。該模型最多可接受 4,500 個 token,是前一代產品處理能力的 4.5 倍。Token 是 AI 讀取的文本單位;可以將一個 token 視為大約一個單詞或單詞的一部分,因此 4,500 個 token 相當於幾頁詳細的指令。
這足以在單一提示中描述九個獨立的資訊圖表面板,並將它們作為一張完整的圖像返回。

「以上整張圖片均由 Qwen-Image-3.0 一次性生成,而非由多張圖片拼接而成。」阿里巴巴在其部落格中寫道。示範中的每個面板都包含自己的圖表、公式、標題和細小文字——全部一次渲染完成,而非後期組裝。
這是唯一能夠在沒有重大錯誤的情況下實現此功能的模型。
在我們的常規測試中,我們會給模型幾句話,並評估它們如何處理。根據阿里巴巴的官方部落格,Qwen Image 3.0 能夠生成下圖。

我們使用該模型最快的配置測試了這項功能。Qwen Image 3.0 能夠重現《Decrypt》的一篇完整文章。執行效果確實令人印象深刻,但結果並非完美無瑕。

Qwen Image 3.0 的第三大支柱是深度知識。根據 Qwen 團隊的說法,該模型「支援 12 種語言的原生渲染,模擬網頁、遊戲和直播等主流介面,並借鑒豐富的世界知識。」它還能連接網際網路獲取即時數據,這意味著針對特定城市和日期的天氣預報視覺化提示,會返回準確的圖形,而非猜測。
例如,阿里巴巴分享了一張葉子上昆蟲的照片。該模型能夠根據對圖像的理解生成相關文字。

阿里巴巴正在向需要大量生產級視覺素材的設計工作室、內容團隊、電商運營人員和教育工作者推銷。
不過值得注意的是,在阿里巴巴自家的 Qwen-Image-Bench 評估(一項針對 18 個模型評分圖像品質、美學和真實感的基準測試)中,上一代旗艦產品 Qwen Image 2.0 Pro 排名第五。OpenAI 的 GPT Image 2 位居榜首。新模型可能表現更好,但此次發布並未提供可衡量的方式來確認這一點,因為它沒有附帶基準測試表、可下載的權重或技術報告。
Qwen Image 1.0 以 Apache 2.0 許可證開源發布,並附帶同日技術報告。而這次沒有。作為阿里巴巴近期 AI 推廣的一部分,這裡的證據完全是公司選擇發布的精選示例圖像。API 試用已在 chat.qwen.ai 開放。定價尚未公佈。




