云霞资讯网

Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日

Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。综合榜本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。国产模型在综合榜已有多款进入中上游,具体排名如下:阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。杨幂百花奖座位第一排