CHINA LLM ARENA / 深度研究 · 实时检索 · 2026.07.03

国产大模型
竞技场 · 2026 年中

从 DeepSeek V4 到 Qwen3.7、GLM-5.2、Kimi K2.7、MiniMax M3 —— 一次覆盖综合能力、编程专项、HTML/设计专项与 Token 费用的多维对比。

4/5
全球开源权重四强,中国占其四
~6
最强国产 vs 西方前沿差距,持续收窄
4.19万亿
国产 Token 日调用量,已超美国
¥0.02/M
最低缓存命中价(DeepSeek V4 Flash)
00

格局速览 · 已整代换血

相比年初,主流旗舰已全面迭代。中国实验室占据全球开源四强中的四席 —— GLM-5、Qwen3.5、Kimi K2.5、DeepSeek V4 各在不同维度领跑;小米 MiMo、美团 LongCat 等新玩家也已进入主流评测。

深度求索 DeepSeek
V4 Pro / Flash
推理·算法之王 + 价格屠夫。自研 DSA 稀疏注意力,长上下文越用越强。纯文本,看不懂图。
阿里 Alibaba
Qwen 3.7-Max /3.6/3.5
最全能、开源生态最强。编程 + 原生多模态双强,尺寸最全,出海多语言唯一解。
智谱 Zhipu
GLM-5.2 /5.1/5V
Agent 与长程编程最稳(24h+ 不崩),OpenClaw 原生,设计导向前端强。
月之暗面 Moonshot
Kimi K2.7 /K2.6
Agent 集群(数百子 agent,12h 自主)+ 视觉→代码,长文本老牌强者。
字节 ByteDance
豆包 Seed 2.0
SuperCLUE 中文综合国内第一、数学推理全球第一。多模态王 + 消费级月活第一。
稀宇 MiniMax
M3 新旗舰
前沿 Coding&Agent + 1M 上下文 + 原生多模态三合一。首个"三项能力兼备"的国产开源旗舰。
百度 Baidu
文心 ERNIE 5.1
搜索增强第一、知识时效强,中文润色细腻,企业与办公创作首选。
腾讯 Tencent
混元 HY3
微信 / QQ / 元宝生态整合,稳健均衡的企业级底座。
阶跃 / 讯飞
Step-3.7 · 星火 X2
阶跃主攻多模态;讯飞星火语音交互最强,深耕教育、医疗本地化。
01

综合能力矩阵

色块越亮=越强(金色为优势、珊瑚色为明显短板)。这是综合 SuperCLUE、OpenCompass、LMArena、BenchLM 等多榜 + 实测的定性判断,非精确跑分 —— 请看格局,别抠小数点。

模型综合推理数学编程中文长文本多模态Agent开源性价比
DeepSeek V45.05.05.05.04.52.04.05.05.0
通义 Qwen3.x5.04.55.05.05.05.05.05.04.5
智谱 GLM-5.x4.55.05.04.54.04.05.04.54.0
Kimi K2.x4.54.55.04.55.04.05.04.53.5
MiniMax M32026-05-314.54.04.54.05.04.05.04.04.5
豆包 Seed 2.05.05.03.55.04.05.04.0闭源4.0
文心 ERNIE 54.04.03.55.03.54.04.04.03.5
混元 HY34.04.03.54.53.54.04.04.04.0
5.0 顶尖 4.0 优秀 3.5 良好 短板
中文冠军是豆包,不是 DeepSeek

豆包 Seed 2.0 Pro 在 SuperCLUE 年度榜国内第一、全球第二,数学推理全球第一(87.83);因少参加国际榜而被长期低估。

Agent 规划,阿里更突出

SuperCLUE 5 月智能体维度 Qwen3.6-Max 国内第一(83.41),超过 Kimi K2.6 Thinking 与 DeepSeek V4 Pro。

DeepSeek 的软肋是"看不懂图"

推理单项最强,但主线纯文本 —— 这在下面两个专项里会反复吃亏。传闻 V5 将于 Q3 补上多模态。

02

编程能力专项 DEEP DIVE

编程别只看一个数:真正有区分度的是 SWE-bench Verified(真实仓库改 bug)、Terminal-Bench(终端操作)、SWE-rebench(长程稳定性)与前端专用的 WebDev Arena。⚠️ 跨来源分数受脚手架与测试集污染影响,看家族档位。

编程综合档位 MY SYNTHESIS · 0–100

模型编程档位关键跑分 / 特长截图→代码上下文许可
DeepSeek V4 Pro
BenchLM 代码 89.8 · 算法竞赛级、复杂架构、数学证明最强 ✗ 纯文本1M开源
GLM-5.1 / 5.2
SWE-Verified 77.8 · Terminal-Bench 81(5.2) · 24h+ 不崩、OpenClaw 原生 ✓ GLM-5V200K开源
Kimi K2.6 / K2.7
SWE-Verified ~80.2 · Agent 集群(100–300 子 agent,12h 自主) ✓ K2.5/2.7256KMod. MIT
Qwen3.6-Plus
SWE-Verified ~78.8 · Terminal-Bench 全球第一 · 工具调用/长程 ✓ 原生多模态1MApache 2.0
Qwen3.7-Max
前沿级 · 35 小时自主运行 · Agent 原生 ✗ 纯文本1M开源
MiniMax M3三合一旗舰
SWE-bench Pro 59.0(超 GPT-5.5、Gemini 3.1 Pro,近 Opus 4.7)· Terminal-Bench 66.0 · BrowseComp 83.5(超 Opus 4.7 的 79.3)· Agent Team(Producer+Verifier) ✓ 原生多模态1M开源
DeepSeek V4 Flash
性价比最优(13B 激活)· 高频/子 agent 调度首选 ✗ 纯文本1M开源
豆包 Seed 2.0
代码生成相对短板(官方亦承认待提升),强在中文综合与多模态 ✓ 多模态闭源
MiniMax M3 · 阅读提示

M3 的头条是 SWE-bench Pro 59.0%,而其他模型多引用 SWE-bench Verified(~77–80%) —— Pro 是更难的新一代评测,两者不能直接并列比较。以 Terminal-Bench 为坐标,M3 稳定在 Sonnet 4.6 一档,部分编程/Agent 任务更靠前;与 Opus 4.7、GPT-5.5 仍有可见差距。它真正的价值是把"前沿编程 + 1M 上下文 + 原生多模态"三项能力首次凑齐并开源,MSA 架构让 1M 上下文每 token 算力仅为上代 1/20,长上下文能便宜、快速、稳定地用。发布当日权重承诺 10 天内开放 —— 上生产前请用你自己的任务做 A/B。

编程选型:四个不同的"强" + 一个新的三合一

01硬核逻辑 / 算法 / 数学

DeepSeek V4 Pro —— 竞赛级代码、复杂架构、数学证明与深度推理 Agent 调度。唯一遗憾:看不懂图。

02大型项目 · 长程不崩

GLM-5 —— SWE-rebench 42.1%(长程最稳),24h+ 不崩盘,智谱深度适配 OpenClaw 的原生 Agent 基座。

03大规模并行自动化

Kimi K2.6 / K2.7 —— agent 集群协调数百子 agent、12h 自主;MiniMax M3 的 Agent Team 是同方向对手。

04视觉编程(看懂截图)

Qwen3.6-Plus / Kimi K2.7 / GLM-5V / MiniMax M3 —— 截图→代码。纯文本的 DeepSeek V4、Qwen3.7-Max 做不到。

05成本敏感的高频编程

DeepSeek V4 Flash / MiniMax M2.5 —— 10–13B 激活,Agent 场景性价比最优解。

三项全要(新选项)

MiniMax M3 —— 需要长程 Agent + 大代码库分析 + 多模态、又想开源本地部署时,2026 上半年优先评估项。

03

HTML / 前端设计专项

这和"编程"是两种能力:编程比对错,设计比审美与还原度,主要靠真人盲投评。权威平台:WebDev Arena(7 月 1 日 42 万票、92 模型,分 HTML/React/品牌营销/参考设计子榜)与 Design Arena(含 Website、UI 组件、数据可视化、3D、截图还原)。

WebDev Arena 当前格局

全球第一仍是 Claude Opus 4.7(前五占四),但中国第一梯队已贴着顶端:Qwen3.7-Max(全球第 4,1541 Elo)、GLM-5.1、Kimi K2.6 紧随其后。

模型WebDev Arena设计审美单文件 HTML截图→网页草图→页面Markdown→精美 HTML
Qwen3.7-Max🥇 国产#1 (全球#4)优秀优秀✓ 最推荐
GLM-5.1 / GLM-5V上游优 · 设计导向优秀✓ 草图✓ 最推荐
Kimi K2.6 / K2.5上游审美一流优秀✓ 高还原+动效✓ 很好
Qwen3.6-Plus上游✓ 很好
MiniMax M3待观察中上✓ 原生多模态可用(强在 Agent)
DeepSeek V4中上 · 纯文本一般 · 理工风⚠️ 设计感弱
豆包 Seed 2.0中上可用

针对你的例子:把 Markdown 研究报告转成 HTML

这个任务只需文字进、代码出,不需要图片输入 —— 所以"纯文本"不是障碍,纯拼设计品味与排版功力

国产首选

Qwen3.7-Max(WebDev 盲投国产第一)或 GLM-5.1(设计导向、结构化输出稳、长文档不崩)。

想要精致动效

Kimi K2.6 —— 审美评价最高,擅长带动态效果的视觉呈现。

不限国产的天花板

Claude Opus —— 报告转 HTML 的观感目前仍是全球最强。

Meta · 现场演示

你正在看的这个页面,就是由 Claude 把一份 Markdown 对比报告转成 HTML 的成品 —— 响应式布局、刻度条数据可视化、热力矩阵与配色,均由模型生成。这正是本节所比较的"设计效果"本身。

04

Token 费用对比 RMB / 百万 tokens

条形=输出价(成本大头),越短越便宜。数据采自硅基流动、DeepSeek 官方等(2026 年 6 月前后),标准档。价格月月变,务必以官网为准。

模型输出价(相对)输入输出缓存命中备注
DeepSeek V4 Flash
¥1¥2¥0.02🏆 当前价格屠夫,缓存价便宜到几乎免费
DeepSeek V4 Pro
¥3¥6¥0.025官方永久降价后(原 ¥24 输出)
Qwen3.5(低档)
~¥0.8 起极低,约 Gemini-3-Pro 的 1/18
Qwen3.6-Plus
¥2¥12多模态 + 百万上下文
MiniMax M3
~¥2.1*~¥8.4*~¥0.21*官方 Token Plan(约 Claude 1/5);*M2.5 档参考价
豆包 Seed 2.0 Pro
¥9.6旗舰上探高端;便宜的是 lite 档
Kimi K2.6
~¥6.5~¥27~¥1.1Modified MIT 许可
GLM-5.1
~¥9~¥28Coding Plan(¥49–200/月)更划算
DeepSeek 把价格打到"以分计费"

V4 Flash 缓存命中价 $0.028/M,处理一个普通网页(~5000 token)成本不到 $0.0002。缓存命中价才是真正杀招。

豆包旗舰"反向涨价"

Seed 2.0 Pro 升至 ¥9.6/M,靠中文榜第一走高端。"价格屠夫"的帽子已从豆包转到 DeepSeek V4 Flash 头上。

算力紧、成本转移

阿里云 Coding Plan Lite 已停售转企业 Token Plan;头部在从"技术理想"转向"商业变现"。

05

选型建议 · 按场景

没有人"一款模型打天下"。搭一层模型路由、按子任务切换,是 2026 年的标准做法。

你的场景首选备选
极致性价比 / 高频 / 自建DeepSeek V4 FlashMiniMax M2.5
硬核推理 / 数学 / 算法DeepSeek V4 ProQwen3.7-Max (Thinking)
一站式全能 / 出海多语言通义 Qwen3.x豆包 Seed 2.0
大型项目 Agent 编程(稳)GLM-5Kimi K2.7
大规模并行 / 自动化 AgentKimi K2.6MiniMax M3
长上下文 Coding + 多模态三合一MiniMax M3Qwen3.6-Plus
截图 / 设计稿 → 前端代码Qwen3.6-Plus / Kimi K2.7GLM-5V · MiniMax M3
Markdown 报告 → 精美 HTMLQwen3.7-Max / GLM-5.1Kimi K2.6
中文写作 / 公文 / 搜索时效文心 ERNIE 5.1豆包
消费级 / 多模态 / 语音视频豆包 Seed 2.0混元(微信生态)
语音交互 / 教育医疗讯飞星火