主 题:阿里 70 亿参数图像模型Qwen-Image-2. 1 开源发布,号称以瘦身之躯叫板闭源巨头
发 布 者:mp4a1
标签分类: 日常
时 间:2026-09-21 12:19:02
内容预览:阿里通义千问最近又整活了,直接放出了开放权重的图像生成/编辑模型 Qwen-Image-2.1。最离谱的是,这货视觉生成部分只有 70亿参数,官方自测却敢说能压过一票闭源模型。当然,第三方评测还没完全跟上,究竟是真猛还是“自家跑分快乐榜”,还得等社区验货。硬件要求倒挺亲民,RTX 3090 级别的显卡就能跑,不用动不动先掏几万块买服务器。它比较骚的一招是多人合照合成:把不同人的单人照片塞进去,模型能给你拼成一张看起来比较自然的群像,多少有点“全家福现场P图师”的意思。更关键的是原生支持 RGBA透明图,不仅能直接把物体抠出来,还能在透明图层上改文字、排版,后期少折腾不少。参考图也挺能吃,一次最多 10张,虚拟试衣、房间设计、多人合成统统能玩。局部修改也不用整张重画,圈一下、涂个遮罩,告诉它“就改这儿”,基本属于哪里不爽改哪里。官方还说用了架构优化和KV缓存,参考图越多,速度提升越明显。目前 Hugging Face、GitHub、ModelScope 都能找到,官方也准备了在线Demo。不过有个坑得注意:研究许可,明确不能商用。个人折腾、学习研究随便玩,真拿去接单赚钱或者公司项目落地,就得先找千问团队申请商业授权。一句话总结:70亿参数、3090能跑、能拼人、能抠图、能改字,还能一次塞10张参考图。看起来确实挺能打,不过到底是“王炸”还是“官方宣传片”,还得等第三方玩家把它拉出来遛一遛。
直达链接: https://www.nodeseek.com/post-940092-1
发 布 者:mp4a1
标签分类: 日常
时 间:2026-09-21 12:19:02
内容预览:阿里通义千问最近又整活了,直接放出了开放权重的图像生成/编辑模型 Qwen-Image-2.1。最离谱的是,这货视觉生成部分只有 70亿参数,官方自测却敢说能压过一票闭源模型。当然,第三方评测还没完全跟上,究竟是真猛还是“自家跑分快乐榜”,还得等社区验货。硬件要求倒挺亲民,RTX 3090 级别的显卡就能跑,不用动不动先掏几万块买服务器。它比较骚的一招是多人合照合成:把不同人的单人照片塞进去,模型能给你拼成一张看起来比较自然的群像,多少有点“全家福现场P图师”的意思。更关键的是原生支持 RGBA透明图,不仅能直接把物体抠出来,还能在透明图层上改文字、排版,后期少折腾不少。参考图也挺能吃,一次最多 10张,虚拟试衣、房间设计、多人合成统统能玩。局部修改也不用整张重画,圈一下、涂个遮罩,告诉它“就改这儿”,基本属于哪里不爽改哪里。官方还说用了架构优化和KV缓存,参考图越多,速度提升越明显。目前 Hugging Face、GitHub、ModelScope 都能找到,官方也准备了在线Demo。不过有个坑得注意:研究许可,明确不能商用。个人折腾、学习研究随便玩,真拿去接单赚钱或者公司项目落地,就得先找千问团队申请商业授权。一句话总结:70亿参数、3090能跑、能拼人、能抠图、能改字,还能一次塞10张参考图。看起来确实挺能打,不过到底是“王炸”还是“官方宣传片”,还得等第三方玩家把它拉出来遛一遛。
直达链接: https://www.nodeseek.com/post-940092-1