概要
- Qwen-Image-3.0 由阿里巴巴 Qwen 团队于 7 月 21 日发布,可接受 4500 个 token 的指令。
- 这使得单次生成复杂布局成为可能,例如报纸、故事板和密集的信息图网格。
- 与前代产品不同,此次发布未附带开放模型权重、基准测试或技术报告;该模型可在 chat.qwen.ai 使用,API 定价尚未公布。
阿里巴巴的 Qwen 团队于周二发布了 Qwen Image 3.0,其宣传重点与输出图像的美观程度无关,而在于输出结果是否能在工作中实际使用。
大多数 AI 图像工具——如 Reve、Nano Banana、Seedream——都旨在特定领域表现出色:创意、逼真度、编辑能力等。Qwen Image 3.0 则走向了不同的方向。Qwen 团队在官方公告中写道:“Qwen-Image-3.0 不仅追求‘好看’,更追求‘有用’,使图像生成成为真正可部署的生产力工具。”
其核心是这家中国巨头阿里巴巴所称的丰富内容。该模型最多可接受 4500 个 token,是上一代处理能力的 4.5 倍。Token 是 AI 读取的文本单位;可以将一个 token 视为大约一个单词或单词的一部分,因此 4500 个 token 相当于几页详细的指令。
这足以在单个提示中描述九个独立的信息图面板,并一次性将它们作为完整图像返回。

“以上整张图片由Qwen-Image-3.0一次性生成,而非由多张图片拼接而成,”阿里巴巴在其博客中写道。演示中的每个面板都包含自己的图表、公式、标题和细字文本——一次性渲染完成,而非后期拼合。
这是唯一能够做到这一点且没有重大错误的模型。
在我们常规测试中,我们会给模型几个句子,评估它们的处理能力。根据阿里巴巴官方博客,Qwen Image 3.0能够生成下图。

我们使用模型的最快配置测试了此功能。Qwen Image 3.0 能够复现 Decrypt 的一篇完整文章。执行效果确实令人印象深刻,但结果并非完美无瑕。

Qwen Image 3.0 的第三大支柱是深度知识。据 Qwen 团队介绍,该模型“支持 12 种语言的原生渲染,模拟网页、游戏和直播等主流界面,并借鉴了丰富的世界知识。”它还能连接互联网获取实时数据,这意味着针对特定城市和日期的天气预报视觉提示会返回准确的图形,而非猜测。
例如,阿里巴巴分享了一张叶子上的昆虫照片。该模型能够根据对图像的理解生成相关文本。

阿里巴巴正在向设计工作室、内容团队、电商运营人员以及需要批量生产级视觉素材的教育工作者推销该产品。
不过值得注意的是,在阿里巴巴自己的Qwen-Image-Bench评估中——该基准测试对18个模型的图像质量、美学效果和真实感进行评分——上一代旗舰产品Qwen Image 2.0 Pro排名第五。OpenAI的GPT Image 2位居榜首。新模型可能表现更好,但此次发布没有提供可衡量的方式来确认这一点,因为它没有附带基准测试表、可下载的权重或技术报告。
Qwen Image 1.0以Apache 2.0许可证开源发布,并附带了当天的技术报告。而这次没有。作为阿里巴巴近期AI推动的一部分,这里的证据完全来自公司选择发布的精选示例图像。API试用已在chat.qwen.ai开放。定价尚未公布。




