
一个流传很广的说法需要一次称重最近半年国产大模型已经全面超越 GPT、超越国际最强的说法在社交平台反复刷屏。情绪很足证据却常常缺位。我做的是求证栏目习惯先把口号拆成可核实的事实。这次我用 LMArena、OpenCompass、SWE-bench、ARC-AGI-2、HLE 等国际公开评测基准的一手数据给国产大模型这个主角做一次分维度称重——不吹不黑只对照数字。先补一个读数常识。Elo 是竞技场类榜单用的胜率积分两个模型匿名对打赢的涨分、输的掉分分数越高代表越受人类偏好。看懂这个后面几张榜才不会眼花。先看综合榜头部已进前 25榜首还在美国评测基准大致分两类一类是人类盲测打分的综合竞技场一类是标准试题的学术综合榜。先把两张总表摊开。LMArena中国头部挤进前 25第三方聚合的 LMArena2026-07里#1 仍是美国闭源模型 Claude Opus 4.61500 Elo中国模型跟得很紧Qwen3.7 Max Thinking 排 #71475、GLM-5.1 #91468、Kimi K2.6 #201455、DeepSeek-V4-Pro #231449。中国头部已经进入前 25与前沿差约 25–50 Elo——这已属互有胜负的接近区间但榜首依然是美国闭源模型。性质要讲清楚LMArena 含厂商自报、且机型名较新引用须注明第三方聚合、含自报、机型版本新以原始榜复核为准不能当铁案。OpenCompass学术综合榜咬到小数点后一位上海 AI 实验室做的第三方独立榜 OpenCompass2026-02综合均分是 Gemini-3-Pro-Preview 81.3 最高接着 GLM-5 79.0中、GPT-5 78.8、Qwen3.5 78.4中、Kimi-K2.5 78.2中、DeepSeek-V3.2 78.2中。中国模型和美国闭源已经咬到小数点后一位。分项里更亮眼Qwen3.5 在 GPQA 拿到 88.4、GLM-5 在 AIME 数学赛拿到 95.8均已追平甚至反超美国闭源。八维度对照矩阵——哪里追平、哪里掉队绿黄红三色状态一目了然这些维度国产已经追平甚至反超把综合榜拆开看真正的反超集中在四个主场。数学与学术国产大模型已追平上面 OpenCompass 的分项已经给出证据Qwen3.5 GPQA 88.4、GLM-5 AIME 95.8对上美国闭源模型不落下风。数学和学术基准是国产模型最先追平的一档也是口碑里变强了最硬的一块。编码能力国产大模型开源已反超先解释术语SWE-bench 是衡量大模型修真实 GitHub bug 的编程基准分数高代表能真正干活。聚合含自报的 SWE-bench Verified 上Claude Opus 4.8 以 88.6% 居首但最佳开源模型是中国的 DeepSeek V4 Pro80.6%之后才是 GLM-5 72.8%、Kimi K2.5 70.8%。更硬的证据在 LiveCodeBench——这是个无污染榜单题目没漏进训练集更能反映真实水平DeepSeek V4 Pro 拿到 93.5%是开源 SOTA压过 Gemini 3 Pro 的 91.7% 和 Kimi K2.6 的 89.6%中。编码这一项中国开源已经反超。智能体中国包揽前二τ²-Bench 测的是模型当智能体调度工具、完成多步任务的能力。GLM-5 以 89.7 排 #1Step-3.5-Flash 以 88.2 排 #2前二都是中国模型。智能体赛道国产领先。中文主场国产大模型断档领先中文本来就是主场。C-Eval 上 Qwen3.5 93.0、DeepSeek V4 Pro Base 93.1已经超过海外最高分 Claude Opus 4.5 的 92.2。SuperCLUE 中文 Web 竞技场更夸张GLM-5.1 拿到 1429.6而 Claude 仅 1201.6、GPT-5.2 只有 971.3。中文理解和表达国产是断档式的领先。优势维度证据——编码/中文/智能体国产模型已压过美国闭源开源生态前排全是国产开源这一栏国产优势最稳。OpenCompass、SuperCLUE 的开源前 5 全部是国产模型LiveCodeBench 和 SWE-bench 的最佳开源也都是 DeepSeek中。闭源最强档留给 Claude、GPT-5、Gemini美国但开源世界里中国模型是门面。差距最大的地方前沿推理追平和反超说完了该看那条最刺眼的鸿沟。ARC-AGI-2落后一个数量级ARC-AGI-2 是什么它是公认的抽象推理试金石题目专挑模型不会套模板的难题专门测真实推理能力。evals.report 汇总官方与厂商数据的结果很残酷GPT-5.5 85%、Gemini 3 Deep Think 84.58%、Claude Opus 4.7 75.83%美对中国这边是 Kimi K2.5 11.81%、GLM-5 4.86%、DeepSeek V3.2 4.03%。中国 4–12%美国 75–85%差距接近一个数量级。HLE博士级综合同样断档HLEHumanity’s Last Exam人类最后考试是面向博士级知识的综合难题集。官方基础榜上 Gemini 3 Pro 38.3% 居首GPT-5 25.3%而中国的 DeepSeek-R1 只有 8.5%。要注意2026 年各聚合榜波动很大比如某榜 Kimi K2.6 一度到 54%引用务必注明榜单版本不能当定论。前沿推理这一维度是中美差距最大、最该清醒的地方。前沿硬基准中美差距——ARC-AGI-2 与 HLE中国 4–12% vs 美国 75–85%结论不是全面超越是分维度追平、前沿仍落后把整张表合上结论其实很清楚。中文、数学、编码、开源、智能体——这几个维度国产已经追平甚至反超有些还是压倒性的。但综合竞技场的榜首、闭源最强档、以及 ARC-AGI-2 和 HLE 这样的最前沿推理基准美国模型依然领先国产在 4–12% 的水平线上挣扎对面是 75–85%。所以再说回开头那句话国产大模型已经全面超越 GPT这个口号经不起数据称重。更准确的说法是——国产大模型分维度追平、前沿仍落后。夸它不必贬它也冤。看清每一栏的分数比喊一句口号更有用。求证栏目的意义不在于站队而在于把情绪还原成数字。如果这篇求证对你有用欢迎点个「在看」或留言说说你最关心的那个维度。