阿里Qwen-Image-3.0图像模型发布:超长输入精准生成,复杂编辑一键搞定

   发布时间:2026-07-23 21:07 作者:周伟

阿里近日正式推出其最新一代图像生成基础模型——Qwen-Image-3.0。这款模型在输入长度、多语言支持和复杂场景生成能力方面实现了显著突破,能够一次性处理包含公式、几何图形、逻辑推导等多元素融合的复杂内容,并支持12种语言和20余种字体的原生渲染,为商业海报、影视分镜等场景提供了高效解决方案。

作为千问系列图像模型的第三代产品,Qwen-Image-3.0在文本输入长度上较前代提升4.5倍,最大支持4.5k token的超长输入。这一特性使得用户在影视分镜设计、产品说明页制作等需要详细描述的场景中,无需压缩需求,可直接以文档形式提供画面结构、文字内容、视觉风格等指令,大幅降低反复生成和人工调试的成本。模型还能一次性生成包含9个不同领域知识的9宫格图解,确保每个图解的文字清晰、内容准确。

在复杂指令理解方面,Qwen-Image-3.0展现出强大的逻辑嵌套能力。例如,当用户要求“在VSCode编程界面中通过千问App生成一张发布在聊天界面的手冲咖啡海报”时,模型能精准解析多层UI嵌套关系,依次生成编程界面、应用界面、聊天窗口和咖啡海报,并保持各层界面的结构与风格一致性,甚至能清晰呈现手机截图中的时间数字等微小细节。

该模型采用“生图编辑一体化”架构,将文生图阶段的文字渲染能力、细节质感和世界知识无缝迁移至编辑场景。用户可通过单一工具完成古画修复、全景图生成、手绘草图转PPT等复杂任务,无需在生成与编辑间切换,且能避免风格偏差或细节丢失。模型支持局部改写、内容扩展和风格迁移,确保图像创作从单次生成迈向可持续迭代的完整流程。

目前,阿里云百炼平台和千问AI平台已开放Qwen-Image-3.0的API邀测,Qwen Studio和千问APP也将于近期上线供用户免费体验。

 
 
更多>同类内容
全站最新
热门内容
本栏最新