阿里正式推出全新一代图像生成基础模型Qwen-Image-3.0,在多语言支持、复杂信息处理和编辑能力方面实现突破性进展。该模型支持最长4.5k token的超长文本输入,能够一次性生成融合公式符号、几何图形与逻辑推导步骤的复合型知识图解,同时覆盖12种语言和20余种字体的原生渲染,显著降低影视分镜、多语言海报等商业素材的制作成本。
作为千问系列第三代图像模型,Qwen-Image-3.0在文本承载能力上较前代提升4.5倍,特别优化了影视短剧分镜、产品说明页等需要长提示词的场景。用户现在可以像撰写需求文档般详细描述画面结构、文字排版和视觉风格,模型能精准还原复杂指令,减少反复生成和人工调整的环节。测试显示,该模型可同时生成包含9个不同领域知识的9宫格图解,每个图例的文字清晰度与内容准确性均达到专业水准。
在逻辑理解层面,新模型展现出强大的指令解析能力。当用户要求"在VSCode界面通过千问App生成发布于聊天窗口的手冲咖啡海报"时,模型能准确拆解多层UI嵌套关系,依次生成编程界面、应用界面、聊天窗口和海报四个层级的内容,连手机截图中的时间数字和10像素级小字都清晰可辨。这种跨场景的组合生成能力,为复杂视觉内容的创作提供了全新解决方案。
技术架构方面,Qwen-Image-3.0创新采用"生图编辑一体化"设计,将文生图阶段的文字渲染精度、细节表现力和世界知识,无缝迁移至图像编辑场景。古画修复、全景图生成、手绘转PPT等复杂任务均可通过单一模型完成,避免传统工具切换导致的风格断层和细节损失。开发者无需在不同工具间来回切换,即可实现从初稿生成到精细化编辑的全流程操作。
目前,阿里云百炼平台和千问AI官网已开放Qwen-Image-3.0的API邀测通道,Qwen Studio专业工作站和千问移动端应用即将上线供用户免费体验。这款模型在商业设计、教育科普和影视制作等领域展现出广泛应用潜力,有望推动AI图像生成技术向专业化、精细化方向演进。















