千问正式发布第三代图像生成模型 Qwen-Image-3.0,最大支持 4.5k Token 输入,重点提升复杂版面、细小文字和知识型图像的生成能力。新模型能够通过一条长指令生成报纸、试卷、短剧分镜和九宫格信息图等多样化内容。
正文解读
开发者展示了模型在同一张图中处理多个主题的能力,可同时生成公式、图表、人物及中英文文字。官方示例中,一张九宫格图包含了九类独立内容,对应的描述指令长度约为 3.7k Token。文字渲染能力得到显著加强,模型可清晰生成小至 10px 的文字,并处理 LaTeX 公式、上下标、手写批注和报纸密集排版,同时毛孔、发丝、纸张和绘画纹理等细节也更加真实。
Qwen-Image-3.0 原生支持 12 种语言、100 多种艺术风格和多类 UI 界面。除常规图像生成外,官方还展示了联网生成天气图、修复传统绘画以及制作专业信息图等实用场景。相比只追求视觉美观的上一代,该模型更强调 PPT、教育材料、设计和内容制作等实际应用价值。
原创文章,作者:admin,如若转载,请注明出处:https://www.23btc.com/203037/



