0.18 元出一张图,阿里这款文生图想抢商用饭碗

阿里千问系列的图像生成模型,正在从文生图赛道的“追赶者”切换成“商用猎手”。8 月 5 日,Qwen-Image-3.0 在千问 AI 平台全量上线,旗舰版 Qwen-Image-3.0-Pro 与标准版 Qwen-Image-3.0-Standard 同时开放 API,国内文生图起步价压到 0.18 元一张,海外 QwenCloud 上 Pro 版 0.04 美元、Standard 版 0.03 美元。

模型参数规模为 200 亿,约为 FLUX 的两倍,技术架构采用 MMDiT(多模态扩散变换器),把文本和图像做端到端联合建模。单看参数和架构只是纸面功夫,真正让它跳出“AI 画画玩具”定位的是三个落地能力:

内容丰实。 提示词输入上限拉到 4.5k token,是前代的 4.5 倍。过去用户得把需求压缩成一句话,现在可以像写设计需求文档那样,把画面结构、文字内容、视觉风格、排版细节一次性写进去。报纸版面、影视分镜、数学试卷、PPT 等复杂版式,模型声称可以一次成图。

细节真实。 官方给出的关键指标是支持 10px 小字精准渲染,毛孔、发丝这类微观质感也能还原。对人像摄影、古籍拓片、商品实拍等对细节敏感的场景,这意味着 AI 生图不再是“远看惊艳、放大露馅”。

知识厚实。 模型原生支持 12 种语言和 20 多款字体,提示词里同时出现中文、英文、韩文等多语种文字也能稳定输出,减少缺字、乱码、错位的问题。公式符号、几何图形、逻辑推导步骤这类知识图解,以及网页、游戏、直播界面仿真,都是它想切中的商用场景。

另一个值得注意的设定是,文生图(T2I)和图生图/图像编辑(I2I)被合并进同一个模型接口,用户不再需要为出图和改图分别调不同模型。输出分辨率可在 512×512 到 2048×2048 之间选择,默认由模型根据提示词自动推荐。

在 Arena.ai 最新的文生图评测榜单中,Qwen-Image-3.0 位列国内第一。阿里近两周的模型节奏也很密集:7 月 19 日刚放出 2.4 万亿参数的 Qwen3.8-Max 预览版,紧接着就是 Qwen-Image-3.0 全量开放。

从文生图市场的竞争格局看,低价 API 和中文/多语言小字渲染能力,是这款产品最明显的差异化切口。教育机构批量生成试卷、出海团队做多语言海报、出版社做古籍修复与知识图解,都是过去 AI 生图“做不到”或“做不好”的细分需求。0.18 元的起售价加上全量 API,至少把试错门槛压到了足够低。

来源:综合自 QwenCloud、阿里云百炼文档、aitop100.cn 报道