Arena(arena.ai)平台公布2026年第34周(8月17日‑8月23日)A1大模型盲测榜单,智谱全新推出的glm‑5.3‑max首次上榜便跻身综合榜Top15,排在第13位,ELO得分为1487分。月之暗面的kimi‑k3‑max由第12名上升至第10名,成功闯进综合榜前十。本周多款国产模型在细分榜单中有着亮眼表现,新入榜模型数量较多,行业竞争格局出现新的变化。
该榜单由Arena平台匿名盲测投票产生,采用ELO计算排名,智能体榜使用百分比信号,结果代表用户主观偏好,并非模型绝对能力。各个分榜相互独立,不适合跨榜单对比,分数差距处于误差范围之内即视作并列,新模型需要积累足够投票数据,才能够正式登上榜单。
综合榜
综合榜头部整体格局较为稳定,claude‑fable‑5以1508分拿下榜首,实现蝉联;claude‑opus‑4‑6‑high、claude‑opus‑4‑7‑high分别取得1504分、1502分,排在第二、第三位。三者分差均不超过30分,处于误差区间,实力水平相近。
本周榜单变动较为明显,新上榜的glm‑5.3‑max直接取得第13名,表现亮眼;kimi‑k3‑max上升2位来到第10名,首次跻身前十;muse‑spark‑1.1上涨3位排至第8名。gpt‑5.5‑instant、claude‑opus‑4‑8两款模型也为本周新入榜,分列第28、29名。qwen3.8‑max排名出现回落,从第8名下滑至第19名。
多款国产模型占据榜单中上游位置,整体发挥平稳:
月之暗面kimi-k3-max,ELO分数1489分,排名第10,相比上周提升2位
智谱glm-5.3-max,ELO分数1487分,排名第13,属于首次登上榜单
阿里qwen3.8-max,ELO分数1481分,排名第19,较上周下跌11位
阿里qwen3.7-max-preview,ELO分数1474分,排名第27,排名基本没有变化
代码榜
代码榜头部出现小幅变动,claude‑opus‑4‑7‑high上升到第一位,ELO分数1552分,claude‑opus‑4‑6‑high排在第二名,原先居首位的claude‑fable‑5落到第三名。三者ELO分差仅有1分,处于误差区间,可视为并列。
智谱glm‑5.3‑max初次登上代码榜就进入前十,排第10名,ELO为1531分,初次登场表现出色。grok‑4.20‑beta1新入榜位列第20名,claude‑sonnet‑4‑5‑20250929‑high‑32k、gpt‑5.5‑high也为本周首次上榜。qwen3.8‑max名次大幅下跌,从第13名降到第25名。
有多款国产模型进入代码榜前三十,详细排名如下:
月之暗面kimi-k3-max,第6名,ELO1542分,排名基本持平
智谱glm-5.3-max,第10名,ELO1531分,首次入榜
阿里qwen3.7-max-preview,第17名,ELO1524分,排名基本持平
阿里qwen3.8-max,第 25名,ELO1520分,较上周下降12位
小米 mimo-v2.5-pro,第 27名,ELO1519分,排名基本持平
前端开发榜
前端开发榜头部格局依旧保持稳定,claude‑opus‑5‑max以1691分守住榜首位置,实现蝉联。国产模型kimi‑k3‑max、qwen3.8‑max稳定拿下第二、三名,ELO分数分别为1674分、1669分,和第一名分差小于30分,在误差范围内实力相近。新上榜的glm‑5.3‑max直接排到第8名,qwen3.8‑27b首次入榜位列第9名,两款国产新模型全部闯入前十,表现十分亮眼。现阶段已有多款国产模型跻身榜单前十五,在前端开发赛道展现出强劲的竞争实力。
AI 生图榜
AI生图榜头部格局保持稳定,gpt‑image‑2 (medium)以1381分继续位居榜首。国产模型seedream‑5.0‑pro稳定排在第8名,qwen‑image‑3.0‑pro位列第9名,两款国产模型双双进入前十,排名没有出现较大起伏。hunyuan‑image‑3.0本周上升至第29名,依旧留在榜单前三十之内。
AI 视频榜
AI视频榜当中,字节跳动全新推出的dreamina‑seedance‑2.5‑720p首次入榜就拿到第4名,ELO分数1477分,排在它的前代版本dreamina‑seedance‑2.0‑720p之后,两款国产模型一同跻身榜单前五,整体表现十分突出。gemini‑omni‑flash依旧以1512分占据榜首位置,flux‑3‑video位列第二名,dreamina‑seedance‑2.0‑720p维持第三名不变。
智能体榜
智能体榜头部依旧由Anthropic旗下模型把持,Claude Opus 5(High)以12.47%的净提升度稳居第一位,Claude Opus 5(Max)上升一位来到第二,Claude Fable 5(High)回落至第三名。三者净提升度差值处于置信区间以内,在误差范围内水平相近。月之暗面Kimi K3(Max)前进一位排到第四,净提升度10.41%,任务确认成功率为17.97%,整体实力已经迈入头部梯队。本周DeepSeek V4 Pro(High)(0813)、Qwen3.8 Max两款国产模型初次登榜,分别位列第14、15名,表现不错。
多款国产模型闯入智能体榜前三十,头部选手已经触及第一梯队的门槛,具体数据如下:
月之暗面KimiK3(Max),排名第4,净提升度10.41%,任务确认成功率17.97%,较上周提升1位
深度求索DeepSeek V4 Pro(High)(0813),排名第14,净提升度6.26%,任务确认成功率13.06%,首次入榜
阿里Qwen3.8Max,排名第15,净提升度6.20%,工具幻觉率仅0.18%,首次入榜
智谱GLM5.2(Max),排名第17,净提升度5.82%,较上周下滑3位
深度求索Deepseek V4 Flash(High)(20260731),排名第 20,净提升度3.99%
本周Arena榜单有不少国产新模型登场,智谱glm‑5.3‑max在综合榜、代码榜以及前端开发榜都拿到不俗名次。月之暗面kimi‑k3‑max成功闯入综合榜前十,在智能体榜也跻身前四。字节跳动全新模型dreamina‑seedance‑2.5‑720p在AI视频榜直接进入前五,国产大模型在多个赛道持续实现突破。后续还会有更多国产大模型新版本推出,榜单的竞争预计会变得更加激烈,值得持续留意。
