格局速览 · 已整代换血
相比年初,主流旗舰已全面迭代。中国实验室占据全球开源四强中的四席 —— GLM-5、Qwen3.5、Kimi K2.5、DeepSeek V4 各在不同维度领跑;小米 MiMo、美团 LongCat 等新玩家也已进入主流评测。
综合能力矩阵
色块越亮=越强(金色为优势、珊瑚色为明显短板)。这是综合 SuperCLUE、OpenCompass、LMArena、BenchLM 等多榜 + 实测的定性判断,非精确跑分 —— 请看格局,别抠小数点。
| 模型 | 综合 | 推理数学 | 编程 | 中文 | 长文本 | 多模态 | Agent | 开源 | 性价比 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 | 5.0 | 5.0 | 5.0 | 5.0 | 4.5 | 2.0 | 4.0 | 5.0 | 5.0 |
| 通义 Qwen3.x | 5.0 | 4.5 | 5.0 | 5.0 | 5.0 | 5.0 | 5.0 | 5.0 | 4.5 |
| 智谱 GLM-5.x | 4.5 | 5.0 | 5.0 | 4.5 | 4.0 | 4.0 | 5.0 | 4.5 | 4.0 |
| Kimi K2.x | 4.5 | 4.5 | 5.0 | 4.5 | 5.0 | 4.0 | 5.0 | 4.5 | 3.5 |
| MiniMax M32026-05-31 | 4.5 | 4.0 | 4.5 | 4.0 | 5.0 | 4.0 | 5.0 | 4.0 | 4.5 |
| 豆包 Seed 2.0 | 5.0 | 5.0 | 3.5 | 5.0 | 4.0 | 5.0 | 4.0 | 闭源 | 4.0 |
| 文心 ERNIE 5 | 4.0 | 4.0 | 3.5 | 5.0 | 3.5 | 4.0 | 4.0 | 4.0 | 3.5 |
| 混元 HY3 | 4.0 | 4.0 | 3.5 | 4.5 | 3.5 | 4.0 | 4.0 | 4.0 | 4.0 |
豆包 Seed 2.0 Pro 在 SuperCLUE 年度榜国内第一、全球第二,数学推理全球第一(87.83);因少参加国际榜而被长期低估。
SuperCLUE 5 月智能体维度 Qwen3.6-Max 国内第一(83.41),超过 Kimi K2.6 Thinking 与 DeepSeek V4 Pro。
推理单项最强,但主线纯文本 —— 这在下面两个专项里会反复吃亏。传闻 V5 将于 Q3 补上多模态。
编程能力专项 DEEP DIVE
编程别只看一个数:真正有区分度的是 SWE-bench Verified(真实仓库改 bug)、Terminal-Bench(终端操作)、SWE-rebench(长程稳定性)与前端专用的 WebDev Arena。⚠️ 跨来源分数受脚手架与测试集污染影响,看家族档位。
编程综合档位 MY SYNTHESIS · 0–100
| 模型 | 编程档位 | 关键跑分 / 特长 | 截图→代码 | 上下文 | 许可 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro | BenchLM 代码 89.8 · 算法竞赛级、复杂架构、数学证明最强 | ✗ 纯文本 | 1M | 开源 | |
| GLM-5.1 / 5.2 | SWE-Verified 77.8 · Terminal-Bench 81(5.2) · 24h+ 不崩、OpenClaw 原生 | ✓ GLM-5V | 200K | 开源 | |
| Kimi K2.6 / K2.7 | SWE-Verified ~80.2 · Agent 集群(100–300 子 agent,12h 自主) | ✓ K2.5/2.7 | 256K | Mod. MIT | |
| Qwen3.6-Plus | SWE-Verified ~78.8 · Terminal-Bench 全球第一 · 工具调用/长程 | ✓ 原生多模态 | 1M | Apache 2.0 | |
| Qwen3.7-Max | 前沿级 · 35 小时自主运行 · Agent 原生 | ✗ 纯文本 | 1M | 开源 | |
| MiniMax M3新三合一旗舰 | SWE-bench Pro 59.0(超 GPT-5.5、Gemini 3.1 Pro,近 Opus 4.7)· Terminal-Bench 66.0 · BrowseComp 83.5(超 Opus 4.7 的 79.3)· Agent Team(Producer+Verifier) | ✓ 原生多模态 | 1M | 开源 | |
| DeepSeek V4 Flash | 性价比最优(13B 激活)· 高频/子 agent 调度首选 | ✗ 纯文本 | 1M | 开源 | |
| 豆包 Seed 2.0 | 代码生成相对短板(官方亦承认待提升),强在中文综合与多模态 | ✓ 多模态 | — | 闭源 |
M3 的头条是 SWE-bench Pro 59.0%,而其他模型多引用 SWE-bench Verified(~77–80%) —— Pro 是更难的新一代评测,两者不能直接并列比较。以 Terminal-Bench 为坐标,M3 稳定在 Sonnet 4.6 一档,部分编程/Agent 任务更靠前;与 Opus 4.7、GPT-5.5 仍有可见差距。它真正的价值是把"前沿编程 + 1M 上下文 + 原生多模态"三项能力首次凑齐并开源,MSA 架构让 1M 上下文每 token 算力仅为上代 1/20,长上下文能便宜、快速、稳定地用。发布当日权重承诺 10 天内开放 —— 上生产前请用你自己的任务做 A/B。
编程选型:四个不同的"强" + 一个新的三合一
DeepSeek V4 Pro —— 竞赛级代码、复杂架构、数学证明与深度推理 Agent 调度。唯一遗憾:看不懂图。
GLM-5 —— SWE-rebench 42.1%(长程最稳),24h+ 不崩盘,智谱深度适配 OpenClaw 的原生 Agent 基座。
Kimi K2.6 / K2.7 —— agent 集群协调数百子 agent、12h 自主;MiniMax M3 的 Agent Team 是同方向对手。
Qwen3.6-Plus / Kimi K2.7 / GLM-5V / MiniMax M3 —— 截图→代码。纯文本的 DeepSeek V4、Qwen3.7-Max 做不到。
DeepSeek V4 Flash / MiniMax M2.5 —— 10–13B 激活,Agent 场景性价比最优解。
MiniMax M3 —— 需要长程 Agent + 大代码库分析 + 多模态、又想开源本地部署时,2026 上半年优先评估项。
HTML / 前端设计专项
这和"编程"是两种能力:编程比对错,设计比审美与还原度,主要靠真人盲投评。权威平台:WebDev Arena(7 月 1 日 42 万票、92 模型,分 HTML/React/品牌营销/参考设计子榜)与 Design Arena(含 Website、UI 组件、数据可视化、3D、截图还原)。
全球第一仍是 Claude Opus 4.7(前五占四),但中国第一梯队已贴着顶端:Qwen3.7-Max(全球第 4,1541 Elo)、GLM-5.1、Kimi K2.6 紧随其后。
| 模型 | WebDev Arena | 设计审美 | 单文件 HTML | 截图→网页 | 草图→页面 | Markdown→精美 HTML |
|---|---|---|---|---|---|---|
| Qwen3.7-Max | 🥇 国产#1 (全球#4) | 优秀 | 优秀 | ✗ | ✗ | ✓ 最推荐 |
| GLM-5.1 / GLM-5V | 上游 | 优 · 设计导向 | 优秀 | ✓ | ✓ 草图 | ✓ 最推荐 |
| Kimi K2.6 / K2.5 | 上游 | 审美一流 | 优秀 | ✓ 高还原+动效 | — | ✓ 很好 |
| Qwen3.6-Plus | 上游 | 优 | 优 | ✓ | — | ✓ 很好 |
| MiniMax M3新 | 待观察 | 中上 | 良 | ✓ 原生多模态 | — | 可用(强在 Agent) |
| DeepSeek V4 | 中上 · 纯文本 | 一般 · 理工风 | 良 | ✗ | ✗ | ⚠️ 设计感弱 |
| 豆包 Seed 2.0 | 中 | 中上 | 良 | ✓ | — | 可用 |
针对你的例子:把 Markdown 研究报告转成 HTML
这个任务只需文字进、代码出,不需要图片输入 —— 所以"纯文本"不是障碍,纯拼设计品味与排版功力:
Qwen3.7-Max(WebDev 盲投国产第一)或 GLM-5.1(设计导向、结构化输出稳、长文档不崩)。
Kimi K2.6 —— 审美评价最高,擅长带动态效果的视觉呈现。
Claude Opus —— 报告转 HTML 的观感目前仍是全球最强。
你正在看的这个页面,就是由 Claude 把一份 Markdown 对比报告转成 HTML 的成品 —— 响应式布局、刻度条数据可视化、热力矩阵与配色,均由模型生成。这正是本节所比较的"设计效果"本身。
Token 费用对比 RMB / 百万 tokens
条形=输出价(成本大头),越短越便宜。数据采自硅基流动、DeepSeek 官方等(2026 年 6 月前后),标准档。价格月月变,务必以官网为准。
| 模型 | 输出价(相对) | 输入 | 输出 | 缓存命中 | 备注 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash | ¥1 | ¥2 | ¥0.02 | 🏆 当前价格屠夫,缓存价便宜到几乎免费 | |
| DeepSeek V4 Pro | ¥3 | ¥6 | ¥0.025 | 官方永久降价后(原 ¥24 输出) | |
| Qwen3.5(低档) | ~¥0.8 起 | — | — | 极低,约 Gemini-3-Pro 的 1/18 | |
| Qwen3.6-Plus | ¥2 | ¥12 | — | 多模态 + 百万上下文 | |
| MiniMax M3新 | ~¥2.1* | ~¥8.4* | ~¥0.21* | 官方 Token Plan(约 Claude 1/5);*M2.5 档参考价 | |
| 豆包 Seed 2.0 Pro | — | ¥9.6 | — | 旗舰上探高端;便宜的是 lite 档 | |
| Kimi K2.6 | ~¥6.5 | ~¥27 | ~¥1.1 | Modified MIT 许可 | |
| GLM-5.1 | ~¥9 | ~¥28 | — | 走 Coding Plan(¥49–200/月)更划算 |
V4 Flash 缓存命中价 $0.028/M,处理一个普通网页(~5000 token)成本不到 $0.0002。缓存命中价才是真正杀招。
Seed 2.0 Pro 升至 ¥9.6/M,靠中文榜第一走高端。"价格屠夫"的帽子已从豆包转到 DeepSeek V4 Flash 头上。
阿里云 Coding Plan Lite 已停售转企业 Token Plan;头部在从"技术理想"转向"商业变现"。
选型建议 · 按场景
没有人"一款模型打天下"。搭一层模型路由、按子任务切换,是 2026 年的标准做法。
| 你的场景 | 首选 | 备选 |
|---|---|---|
| 极致性价比 / 高频 / 自建 | DeepSeek V4 Flash | MiniMax M2.5 |
| 硬核推理 / 数学 / 算法 | DeepSeek V4 Pro | Qwen3.7-Max (Thinking) |
| 一站式全能 / 出海多语言 | 通义 Qwen3.x | 豆包 Seed 2.0 |
| 大型项目 Agent 编程(稳) | GLM-5 | Kimi K2.7 |
| 大规模并行 / 自动化 Agent | Kimi K2.6 | MiniMax M3 |
| 长上下文 Coding + 多模态三合一 | MiniMax M3 | Qwen3.6-Plus |
| 截图 / 设计稿 → 前端代码 | Qwen3.6-Plus / Kimi K2.7 | GLM-5V · MiniMax M3 |
| Markdown 报告 → 精美 HTML | Qwen3.7-Max / GLM-5.1 | Kimi K2.6 |
| 中文写作 / 公文 / 搜索时效 | 文心 ERNIE 5.1 | 豆包 |
| 消费级 / 多模态 / 语音视频 | 豆包 Seed 2.0 | 混元(微信生态) |
| 语音交互 / 教育医疗 | 讯飞星火 | — |
趋势 · 2026
开源 + 国产算力 = 中国的确定性路线
Qwen3.5 登顶 LM Arena 中国榜(全球第五);DeepSeek V3.2 采用海光+寒武纪芯片脱离 CUDA,成本降 60%;智谱是首个完全在华为昇腾上训练前沿模型、不用任何英伟达硬件的实验室。摆脱英伟达依赖,正从口号变成现实。
Token 成本趋近于零,竞争转向 Agent 与生态
当处理一个网页几乎不要钱,"用不用 AI"不再是成本问题。主战场已是 coding agent、vibe coding、视觉编程、长程自主执行。没有技术壁垒的小厂正被挤压淘汰。
多模态融合 + 视觉编程是下一个分水岭
纯文本模型(DeepSeek V4、Qwen3.7-Max)在"看懂设计稿/截图"上已明显吃亏。MiniMax M3 把三项前沿能力凑齐开源,正是这个方向的信号弹;DeepSeek 传闻 V5 也要补多模态。