阿里巴巴的新Qwen图像3人工智能希望变得有用,而不仅仅是好看。

CN
Decrypt
關注
3 小時前

阿里巴巴的Qwen团队在周二推出了Qwen Image 3.0,而其推介与输出效果的美观无关。关键在于输出能否真正用于工作。


大多数AI图像工具——Reve、Nano Banana、Seedream——都是针对特定领域进行优化:创造力、现实感、编辑能力等。Qwen Image 3.0则走了不同的方向。Qwen团队在官方公告中写道:“Qwen-Image-3.0不仅追求‘好看’,还追求‘实用’,将图像生成变成一个真正可部署的生产力工具。”





核心是阿里巴巴所称的丰富内容。该模型接受多达4500个令牌,约是上一代模型的4.5倍。令牌是AI读取的文本单位;把一个令牌想象成大约一个单词或部分单词,因此4500个令牌是几页详细指令的内容。


这足够在一个提示中描述九个单独的信息图面板,并以一个完整的图像返回。




阿里巴巴在其博客中写道:“上面的整个图像是通过Qwen-Image-3.0一次生成的,而不是从多张图像拼接而成。”演示中的每个面板都包含自己的图表、公式、标题和小字文本——是一气呵成的,而不是事后组合的。


这是唯一一个能够实现这一点而没有重大错误的模型。


第二部分是公司所称的真实细节。根据阿里巴巴的说法,该模型“支持小至10px的文本精准渲染,生动再现毛孔、发丝等细节,微观级别展现。”十个像素就是细小的印刷文本——您会在药品免责声明中看到的那种。该模型还准确处理LaTeX——研究人员用来书写复杂数学方程的符号系统,能够在整个学术论文模拟中实现。


在我们的常规测试中,我们给模型几句话并评估它们的处理方式。根据阿里巴巴的官方博客,Qwen Image 3.0能够生成如下图像。




我们尝试在模型的最快配置下使用此功能。Qwen Image 3.0能够重现Decrypt的一整篇文章。执行确实令人印象深刻,但结果并不完美。




Qwen Image 3.0的第三个支柱是深厚的知识。根据Qwen团队的说法,该模型“支持12种语言的本地渲染,模拟网页、游戏和直播等主流接口,并利用丰富的世界知识。”它还连接到互联网以获取实时数据,这意味着针对特定城市和日期的天气预报视觉提示将返回准确的图形,而不是猜测。


例如,阿里巴巴分享了一张昆虫在叶子上的照片。该模型能够根据其对图像的理解生成相关文本。




阿里巴巴将此推向需要批量生产即用视觉资产的设计工作室、内容团队、电商运营及教育工作者。


但值得注意的是,在阿里巴巴自己的Qwen-Image-Bench评估中——一个对18个模型进行图像质量、美学和现实忠实度评分的基准——前一代旗舰Qwen Image 2.0 Pro排名第五。OpenAI的GPT Image 2位居榜首。新模型可能表现更好,但发布时没有提供可测量的方式来确认这一点,因为没有附上基准表、可下载权重或技术报告。


Qwen Image 1.0以Apache 2.0许可证的开放权重发布,并附带同日的技术报告。而这次没有。作为阿里巴巴最近AI推动的一部分,这里的证据完全是公司选择发布的精心挑选的示例图像。API试用目前在chat.qwen.ai开放。定价尚未发布。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接