阿里近日正式推出其最新一代图像生成基础模型——Qwen-Image-3.0。这款模型在输入长度、多语言支持和复杂场景生成能力方面实现了显著突破,能够一次性处理包含公式、几何图形、逻辑推导等多元素融合的复杂内容,并支持12种语言和20余种字体的原生渲染,为商业海报、影视分镜等场景提供了高效解决方案。
作为千问系列图像模型的第三代产品,Qwen-Image-3.0在文本输入长度上较前代提升4.5倍,最大支持4.5k token的超长输入。这一特性使得用户在影视分镜设计、产品说明页制作等需要详细描述的场景中,无需压缩需求,可直接以文档形式提供画面结构、文字内容、视觉风格等指令,大幅降低反复生成和人工调试的成本。模型还能一次性生成包含9个不同领域知识的9宫格图解,确保每个图解的文字清晰、内容准确。
在复杂指令理解方面,Qwen-Image-3.0展现出强大的逻辑嵌套能力。例如,当用户要求“在VSCode编程界面中通过千问App生成一张发布在聊天界面的手冲咖啡海报”时,模型能精准解析多层UI嵌套关系,依次生成编程界面、应用界面、聊天窗口和咖啡海报,并保持各层界面的结构与风格一致性,甚至能清晰呈现手机截图中的时间数字等微小细节。
该模型采用“生图编辑一体化”架构,将文生图阶段的文字渲染能力、细节质感和世界知识无缝迁移至编辑场景。用户可通过单一工具完成古画修复、全景图生成、手绘草图转PPT等复杂任务,无需在生成与编辑间切换,且能避免风格偏差或细节丢失。模型支持局部改写、内容扩展和风格迁移,确保图像创作从单次生成迈向可持续迭代的完整流程。
目前,阿里云百炼平台和千问AI平台已开放Qwen-Image-3.0的API邀测,Qwen Studio和千问APP也将于近期上线供用户免费体验。















