OpenArt正式上线创意模型竞技场,12张榜单按具体活儿分高下

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

9月15日,创意平台OpenArt推出名为Arena的图像与视频模型评测榜单,试图回答一个技术榜单长期答不好的问题:做广告的、拍电影的、做平面设计的、剪视频的,到底该选哪个模型。与以往给出单一总分的做法不同,Arena按具体生产任务拆出十二张榜单,图像侧包括总榜、电商、电影、平面设计与图像编辑,视频侧包括总榜、广告、电影、动画、动效设计、视频剪辑与唇形同步,用户可以先找到与自己活儿最接近的那张榜再看排名。

盲测两两对决,专家票为什么是普通用户的三倍权重

评测方法上,Arena放弃了让评委给单个作品打分的传统做法,改为把同一提示词下两个未标注来源的输出并排展示,让评委针对某一项明确标准选出更好的那个,左右位置随机,模型身份全程隐藏。每条投票只回答一个问题,而不是笼统地问哪个更好看,最终用统计模型把海量两两对比折算成相对分数。

权重设计是这套体系最受关注的一点。平台披露的评委构成是28位专家与1003位创作者,专家票的权重是普通用户的三倍。官方解释是专家更能判断具体生产场景下的可用性,但这也意味着榜单反映的是专业工作流的偏好,而非大众审美。对面向广告与影视交付的团队,这个取向更贴近实际需求,对面向社交传播的创作者则未必完全对齐。

评委名单也透露了平台取向。官方列出的专家包括艾美奖动画导演、创意技术专家、广告公司全球执行制片人与高校影视学院讲师,覆盖影视、广告与设计三类生产场景。这意味着榜单对交付级质量的判断力较强,对创意探索型玩法的偏好判断则较弱。使用者需要先确认自己的工作更接近哪一端,再决定这张榜的参考权重。

Seedance 2.5拿下视频总榜,Wan 3.0却在剪辑榜反超

首发结果给出的视频总榜中,Seedance 2.5以1081分居首,Wan 3.0以1004分次之,Seedance 2.0以1000分列第三,其后依次是Seedance 2.0 Mini、Google Omni Flash、Flux 3 Video、MiniMax H3、Kling 3.0 Omni、HappyHorse 1.1与Grok Imagine 1.5。榜单同时显示,Seedance 2.5在提示词遵循、美学、物理与运动、一致性四个维度上均处于领先位置。

但把榜单拆到具体任务,排序就发生了变化。在视频剪辑榜上,Wan 3.0反超Seedance 2.5拿到第一,两者分差仅个位数,官方明确提醒在置信区间重叠时不应把这个差距理解为真实优势。这个细节恰恰是分任务评测的价值所在:一个模型可以同时是通用能力最强和特定环节并非最优,生产团队因此更可能需要按环节切换模型,而不是把全部工作流压在一个模型上。

从榜单分布还能看出一个结构性差异:视频侧的头部集中度明显高于图像侧。视频总榜前四名中有三个来自同一家公司的产品线,说明在运动一致性、物理合理性与时长控制这些难点上,头部团队积累的差距仍然明显。图像侧则相反,不同任务的最优解分散在三家以上公司,反映出图像生成的竞争已经进入按细分能力切分的阶段。

图像榜更碎,Seedream 5.0 Pro与GPT Image 2各守一块阵地

图像侧的分裂更明显。综合所有任务看,Seedream 5.0 Pro以1010分领先,GPT Image 2以1000分紧随其后。但切换到具体榜单,GPT Image 2在平面设计与图像编辑两项上排名第一,Seedream 5.0 Pro则在电影感图像上以1014分居首,并在电商图像榜上以1004分小幅领先,谷歌的Nano Banana Pro与Nano Banana 2分别进入前列。

这种碎片化格局给采购带来的启示是,先确认交付物类型再选模型,比追一个总榜排名更有意义。海报与信息图看重文字渲染与版式控制,电影感画面看重光影与氛围,电商图看重商品一致性与细节保真,这三类需求的最优解在首发结果里并不相同。OpenArt同时说明榜单会随模型更新而变动,例如OpenAI近期升级图像模型后,相关排名就需要重新评估。

这种碎片化对模型供应商同样构成压力。过去只要在总榜上排第一就能获得传播优势,如今要面对十几张分榜,任何一块短板都会被单独放大。对采购方来说这是好事,因为选择依据从品牌排名变成了任务匹配度;对供应商来说则意味着必须同时维护多个能力维度,资源有限的团队很难在所有榜单上保持竞争力。

榜单之外,95%置信区间与不公开的活跃提示词

方法论透明度是这类榜单的命门。Arena公布评委构成、评价维度与统计方法,并为每个结果给出95%置信区间,同时声明没有任何模型供应商为入选、排名或优待付费。这几点回应了此前行业对榜单商业化的质疑,也让排名在解释层面更经得起追问。

但平台同时表示会保留一部分活跃提示词不公开,理由是防止模型针对测试集做优化。这构成一对无法同时满足的目标:公开得越多,可信度越高;公开得越少,抗刷榜能力越强。对使用者而言,理性的用法是把这类榜单当作筛选短名单的起点,用自己真实的素材与提示词在小范围内复测,再决定谁进入生产管线。榜单能缩短选型时间,但替代不了自己那一次验证。

把这类平台放进更长的产业脉络看,它反映的是模型供给过剩之后的选型焦虑。当市场上同时存在几十个可用模型、每个季度还有新版本上线,真正稀缺的不是能力,而是判断哪种能力适配自己场景的信息。评测平台的商业价值因此并不在榜单本身,而在于它能否让一次选型从数周缩短到数天,这也是平台把榜单与自家生成服务放在同一入口的原因。

素材来源:OpenArt官方博客、VentureBeat、AI Primer、Superpower Daily 发布时间:2026-09-17