首页/新闻资讯/正文详情

拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度

发布时间:2026/9/26 4:04:26 来源:云帆数科 栏目:资讯中心
拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度
视觉生成模块仅7B生图、改图、透明素材装进了同一个模型。AI 写代码的能力经常能让开发者「双手离开键盘」但对于设计师而言AI 生成的图片距离能交稿总是差了好几步。在图像设计的工作流中人物需要抠图、素材需要改字、各种商品的摆放要时不时调整但包装上的字、瓶身的形状不能跟着变。如果需求不停调整还得继续修改局部让整张图保持协调。这些细节决定了 AI 生图能否进入真正的创作流程。对设计师、电商运营和内容创作者来说如今图像模型的瓶颈在于每一次提出的修改指令能否准确完成。本周日阿里千问正式开源图片生成模型 Qwen-Image-2.1以小模型的体量解决了大部分生产力难题它实现了文生图与图像编辑一体化原生支持透明图生成最高可以接收 10 张参考图还进一步强化了局部编辑、人像与商品保真。它成为了千问图像系列当前最平衡、性价比最高开源生图模型。公开评测结果显示Qwen-Image-2.1 取得开源模型第一得分甚至超过了 Nano Banana 2.0。要知道这个模型的视觉生成部分参数量仅为 7B。在 X 等平台上已经有提前获得体验资格的用户放出了生成结果大家一阵好评。有包含大量文字内容的效果图生成出真实照片质感图片的也有尝试各种不同滤镜、打光风格的人们认为 Qwen-Image-2.1 在指令遵循、抽卡成功率以及实际效果上都令人印象深刻。基于新模型的能力我们已经可以串起素材生成、组合与修改的工作流用 AI 来解决很多复杂的修图问题。能力与效率据介绍Qwen-Image-2.1 的视觉生成部分采用 20 层 Single-Stream DiT参数量为 7B原生支持 2K。该模型在评测基准中实现了超越体量的水平Qwen-Image-2.1 的总分为 60.28。相比之下Nano Banana 2.0 为 59.82GPT Image 1.5 为 59.65。它已经能够与多款闭源图像模型同场竞争。Qwen-Image-Bench 评测图表。视觉生成部分仅有 7B 参数也让这样的能力水平更值得关注其在较小的生成模块中同时容纳了生图、透明素材生成与多图编辑能力生成和编辑统一管线为开发者部署和定制图像工具提供了更轻量的起点。性能不错的同时Qwen-Image-2.1 还对模型的推理过程进行了优化核心思路是减少不必要的重复计算。在一次图像编辑中输入的参考图和编辑指令不会随着每一步生成而改变。因此新模型使用混合粒度注意力结构文本部分系统前缀、编辑指令遵循传统 Token 级因果掩码逐词进行严格的序列计算以保证语义逻辑理解的连贯性图像生成部分则采用 Chunk 级掩码并通过 KV Cache 的机制在首步计算后缓存这些静态上下文供后续生成步骤复用。这意味着 AI 现在会先处理好参考材料在逐步生成目标图片时重复利用已有结果这种优化在多图片输入时效果更为明显有助于提升推理效率、降低显存开销。因为现在 Qwen-Image-2.1 最多支持 10 张参考图了这项优化就显得至关重要。输入内容越丰富如何处理参考信息、控制重复计算就越值得关注。至于具体能节省多少时间和显存还需要结合硬件、精度、分辨率与输入数量来判断。直接生成可用透明素材要说新版本 Qwen-Image 最贴近设计需求的能力那就是透明图生成了。常规的图片素材通常带有完整背景。要把其中的主体用到海报、商品详情页或另一张图片里往往需要先抠图处理轮廓、缝隙和边缘。透明图片则包含额外的透明度信息能让背景从主体周围或部分区域透出来方便后续叠放和组合。Qwen-Image-2.1 原生支持透明图生成可以依据提示词自动决定生成的是普通图片还是透明图用户在描述素材时就能提出透明背景的要求。目前展示的样例包括节庆插画、人物素材、装饰元素以及由多个对象构成的复杂组合对应的都是设计工作里常见的素材需求。我们也尝试了一下对于创作者来说这是个好消息现在我们可以得到直接可用的素材了工作直接少了几道工序。当然这些透明素材生成之后也能继续修改。比如同一个插画人物可以调整表情图片中的文字可以修改内容。编辑对象既可以是人物的视觉细节也可以是素材中的文字。这与设计时的真实修改需求很接近活动名称换了图案仍然需要保留表情要更轻松一些人物仍然要能被识别为同一个角色。生成与编辑被放进同一模型后这些后续要求也有了统一的处理入口。当然Qwen-Image-2.1 支持对已有照片进行处理。官方给出了从真实照片中提取所需内容、得到 RGBA 透明图的案例。其中的 A 代表透明度通道用来描述图片各处的透明程度。可见这项能力既服务于从零开始生成也覆盖了已有图片的再利用。创作者可以先提供照片再要求模型提取其中需要的主体作为后续设计的素材。Qwen-Image 系列此前曾推出独立的 Qwen-Image-Layered探索透明图相关能力。此次 Qwen-Image-2.1 则将原生透明图生成与编辑整合进通用图像模型进一步提升了便利性。多图编辑需要的准确开源 AI 模型也有了当一张图的需求来自多个对象编辑任务会进一步复杂化。例如如果想把指定的衣服、鞋子、包包和帽子穿戴到同一位模特身上每一张参考图都有不同作用模型就需要区分人物与商品将它们放到合理的位置并尽可能保留各自的特征。Qwen-Image-2.1 最高支持 10 张参考图输入。我们试了试让奥特曼和达里奥坐下来谈谈。使用了 7 张图片两个人对峙的照片改个表情、背景房间、单人沙发、咖啡杯倒上咖啡、落地灯、电壁炉、矮桌最终生成一张完整的效果图。不同的衣饰穿戴现在也能快速给一个人穿搭上看效果你现在也能把不同的单人拍照组合成多人合照。技术上它们考验的不只是 AI 模型能接收多少张图片的输入还包括参考对象能否在最终画面中各就其位比例、位置和整体风格是否协调。组合出了整体画面接下来通常还有局部调整。Qwen-Image-2.1 提供圈选、涂抹和独立掩码等方式让用户更明确地表达编辑位置。比如你可以用几种颜色标出不同区域要求一次修改同时去掉照片中人物的部分穿戴、把头发改色。这种交互让空间位置与文字要求建立起对应关系。对于涉及多个区域的编辑用户可以分别指出哪里需要删除、哪里需要替换以及希望改成什么。涂抹方式则适合直接标出新增对象的位置但直接在原图上圈选或涂抹也会遮住一部分画面。为此模型还支持通过额外的掩码图片指定编辑区域这让原图信息能够完整地输入模型。对于包含人物和商品的设计来说这种保留能力尤为关键。文字准确性、画面质感换了发型或场景人像仍应保有原来的身份特征商品换了摆放环境包装文字、纹理和形状也需要尽可能一致。否则画面即使好看也可能无法用于原本的展示任务。Qwen-Image-2.1 重点介绍了人像与商品两类场景的编辑保真能力看起来效果还不错。我们尝试了一下比如让它把小学《信息科技 三年级上册》的这页截图里面DeepSeek的欢迎语「我是DeepSeek很高兴见到你」改成「你好我能帮上什么忙吗」再把深度思考R1改成最新版本的深度思考按钮再点亮在生成和编辑之外Qwen-Image-2.1 也继续改善了在文字与人物上的表现。不论是文字密集的图文页面、信息图、论文配图内容的准确性和排版美观程度都被提升到了一个可观的程度。人像部分Qwen-Image-2.1 进一步增强了光影与细节表现。现在 AI 生成的图像不论是人物的发丝、服装纹理、面部细节还是环境光线都变得更加协调画面质感更加细腻了。另外还有更好的全景图生成、信息图、三视图、分镜图生成能力它们拓展了静态图像生成和编辑的应用范围为角色展示、视觉策划等任务提供了更多可能。我们试了一下使用社区制作的 Qwen 二次元形象生成一系列分镜插画这些能力组合在一起让 Qwen-Image-2.1 覆盖了更为完整的图片处理链条现在我们可以基于一个 AI 模型完成大量工作先使用多张参考图组织画面再对区域进行调整同时尽量保留人物与商品的关键特征。一个视觉生成部分仅有 7B 的开源 AI 最终能把返工减少到什么程度将是后续实测中值得关注的问题。应用空间有多大Qwen-Image-2.1 的发布让我们看到图像模型正在覆盖创作流程中更多的细化环节而且这个趋势在变得越来越快。不论是透明素材的输出多图参考、局部编辑与保真度能力的提升都增加了 AI 模型进入实际工作流程的可能性。对于创作者而言这意味着更多的素材制作和调整工作都可以通过更简单的方式交给开源生图模型完成而对开发者们来说新模型开源也为围绕这些能力构建设计工具、应用和定制工作流提供了新的基础。我们可以大胆预测下随着 Qwen-Image-2.1 这类图像模型的开源社区还会进一步把生成与编辑能力融入更多内容制作场景让更多人用上适合自己需求的创作工具。当这些 AI 能力成为日常软件中随手可用的功能从想法到视觉作品的门槛或许就能再次大幅降低。原文链接拿下开源生图第一千问Qwen-Image-2.1把生图卷出新高度-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink

相关推荐

Java 泛型是怎么实现的?从类型擦除讲起
Java 泛型是怎么实现的?从类型擦除讲起

Java 5 之前,集合里存的都是 Object,放进去的时候没人管你放的是什么,取出来的时候靠开发者自己保证强转的类型是对的: List list new ArrayList(); list.add("hello"); Integer i (Integer) list.get(0);这三行能正常… · 2026/9/26 4:04:26

什么是扩散模型(Diffusion Model)?
什么是扩散模型(Diffusion Model)?

扩散模型(Diffusion Model)是一类通过「逐步加噪声再逐步去噪」来学习数据分布的生成模型,核心思想在 2015 年由 Sohl-Dickstein 等人提出,并在 2020 年 DDPM 论文后真正引爆。它如今是 Stable Diffusion、DALLE 2、Midjourney 等… · 2026/9/26 4:04:20

小白程序员必看:如何让大模型真正“能办事”?
小白程序员必看:如何让大模型真正“能办事”?

文章指出,尽管大模型能判断,但它们需要运行机制才能改变世界。文章介绍了Harness(执行环境)在模型运行中的关键作用,包括上下文管理、工具接口、约束、验证和纠正。ReAct方法强调“想、做、看、再想”的循环过程。文章… · 2026/9/26 4:04:20

Claude Code模板库搭建指南:用预置上下文终结“裸奔式”AI编程
Claude Code模板库搭建指南:用预置上下文终结“裸奔式”AI编程

聊一下claude-code-templates。如果你用过Claude Code,大概率经历过这种场景:装好之后兴奋地跑起来,然后发现每次让它干活都得从零开始描述需求背景、约束条件、期望输出格式,有时扯了半天,它还是给你一份“漂亮但不实… · 2026/9/26 6:03:04

吴传生微积分PPT课件:从自学备考到二次改制的完整指南
吴传生微积分PPT课件:从自学备考到二次改制的完整指南

简介:《微积分》(吴传生版)配套高等数学PPT课件,聚焦空间解析几何入门知识,适合大学低年级学生及备考者系统学习。课件以空间直角坐标系为主线,介绍坐标原点、三条坐标轴和三个坐标面的划分规则&#xff0c… · 2026/9/26 6:03:04

视频号批量下载与去水印技术实现全解析
视频号批量下载与去水印技术实现全解析

1. 这不是“下载狗”,而是一套视频资源本地化工作流的起点“下载狗去水印”这个标题,第一眼容易让人联想到某款带动物名的第三方工具——但真正有经验的人看到“视频号都可以下载”“批量下载也支持”这两句,立刻会意识到:这背后不… · 2026/9/26 6:03:04

Ubuntu安装MySQL完整指南:从版本选型到问题排查
Ubuntu安装MySQL完整指南:从版本选型到问题排查

最近又有朋友在群里问,Ubuntu上面怎么装MySQL,装到一半卡住了怎么处理,还有人说装完之后密码不对进不去。这些场景我太熟悉了,从最早在大学用VMware开Ubuntu虚拟机折腾,到后来在公司负责Linux服务器的数据库部署&#… · 2026/9/26 6:03:04

Substrate不是AI Agent框架,而是区块链可信执行底座
Substrate不是AI Agent框架,而是区块链可信执行底座

1. Substrate 是什么:不是“AI Agent 框架”,而是区块链底层的“操作系统级基建” Substrate 这个词最近在中文技术社区里被严重误读了。你搜“substrate agent”“substrate oci”“substrate gvisor”,出来的结果八成是混淆——把 Substra… · 2026/9/26 6:03:04

纯HTML/CSS/JS个人主页实战:响应式、可访问性与暗色模式
纯HTML/CSS/JS个人主页实战:响应式、可访问性与暗色模式

简介:这是一套面向前端初学者与网页设计爱好者的HTML个人主页模板合集,提供四种风格迥异的可直接运行的响应式主页方案,解决个性化主页快速搭建与视觉优化难题。资源包含162个文件,主体为42个SCSS/LESS样式源文件(支持… · 2026/9/26 6:02:58

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码