国产大模型横评:DeepSeek / Kimi / Qwen / GLM 谁更值得用?
阅读前置:本篇是 P3 前沿系列的收官篇。建议先读 Transformer深度解读 和 大语言模型(LLM)原理,理解”参数/上下文/量化”这些词再来看选型,事半功倍。
2026 年 8 月,国产大模型的”神仙打架”
一个月内,三家头部厂商接连放大招:
- 7/16:Kimi K3 发布(2.8 万亿参数,全球最大开源模型)
- 7/19:Qwen 3.8-Max 预览版上线(2.4 万亿参数,开源回归)
- 7/31:DeepSeek V4-Flash 正式版 API 公测
- 8/3:GLM-5.3 意外泄露(尚未正式发布)
四家神仙打架,我们怎么选?本篇用一张表 + 场景拆解,帮你做决定。
全部数据来自公开报道与基准测试(标注置信度)。AI 领域变化极快,以官方公告为准。
一、四大家族对比总表
| 维度 | DeepSeek V4-Flash | Kimi K3 | Qwen 3.8-Max | GLM-5 |
|---|---|---|---|---|
| 厂商 | 深度求索 | 月之暗面 | 阿里 | 智谱 |
| 总参数 | 130亿激活(未公开总量) | 2.8万亿 | 2.4万亿 | 7440亿 |
| 激活参数 | 130亿 | 约1040亿 | 未公开 | 400亿 |
| 架构 | MoE | MoE(896专家/激活16) | MoE | MoE(slime RL) |
| 上下文 | 长上下文 | 100万token | 128K+ | 200K |
| 开源 | API | ✅完整权重 | 承诺开源 | 部分 |
| 编程能力 | WebDev 1577分 | Frontend Code Arena 1679分(第1) | 编程国产第1 | 日常编码强 |
| 性价比 | 98%缓存命中,极致 | 中 | 高 | 100万token仅$3.2-4.6 |
| 发布时间 | 2026-07-31 | 2026-07-16/27 | 2026-07-19 | 2026-06 |
| 适合场景 | 高频API调用、Agent | 长上下文、复杂推理、研究 | 编程、全模态、生态 | 长时后台任务、低成本 |
置信度:参数/时间线为高(多源一致);基准分数为中高(不同榜单口径不同)。
二、逐家拆解:谁适合你?
🥇 Kimi K3:长文本之王 + 研究者的宝藏
适合谁:处理超长文档、做研究、想私有化部署的人。
- 100 万 token 上下文:单次可处理约 75 万单词——整本《三体》三部曲都能塞进去
- 全球最大开源模型:完整权重开放,配合 WebGPU实战 或本地部署,数据完全私有
- 代码榜第一:Frontend Code Arena 1679 分,超越 Claude Fable 5
注意:模型巨大,本地跑需要多卡集群(适合有算力的人);普通用户走 API。
🥇 DeepSeek V4-Flash:性价比之王 + Agent 首选
适合谁:开发者、高频调用 API、做 AI 应用。
- 98% 缓存命中:同样的功能,成本可能是别人的 1/10
- Agent 能力大幅增强:LLM 原理 里说的”推理时扩展”,它就是标杆
- 原生 Responses API:开发者接入零成本(特别是用 Codex 生态的)
- 130 亿激活参数”以下克上”——小身材大能量
🥇 Qwen 3.8-Max:全模态生态 + 编程新王
适合谁:需要视觉/语音/文本多模态、阿里云生态用户。
- 编程能力国产第一(Arena 编程子榜中国第一)
- 2.4 万亿参数回归开源:阿里旗舰线首次开源(闭源两代后)
- 全模态:文本、图像、视频统一理解(Transformer深度解读 里讲的混合注意力架构)
- 阿里云百炼平台成熟,企业级服务完善
🥇 GLM-5:后台任务长跑冠军
适合谁:长时后台任务、批量处理、预算敏感团队。
- 单次 100 万 token 仅 $3.2-4.6:四家中最低价
- slime RL 框架:强化学习驱动的 MoE,日常编码稳定
- 200K 上下文:长时后台任务(定时摘要、数据清洗)的利器
- GLM-5.3 泄露在即(8/3),值得关注升级版
三、场景选型速查表
| 你的需求 | 推荐 | 理由 |
|---|---|---|
| 聊天/写作/翻译 | DeepSeek V4-Flash | 便宜大碗 |
| 处理整本书/超长合同 | Kimi K3 | 100万上下文碾压 |
| 写代码 | Qwen 3.8-Max / Kimi K3 | 两个编程王者 |
| 做 AI 应用(API) | DeepSeek V4-Flash | 98%缓存命中省成本 |
| 私有化部署 | Kimi K3 / Qwen | 开源权重 |
| 批量后台任务 | GLM-5 | 每百万token最便宜 |
| 多模态(图文视频) | Qwen 3.8-Max | 全模态旗舰 |
| 学习原理/研究 | Kimi K3(读技术报告) | 架构最前沿 |
四、学习者视角:这些模型对我们的意义
1. 学习资源
- Kimi K3 开源三件套(MoonEP 训练框架、FlashKDA 注意力算子、AgentEnv 沙箱)——是 开源项目贡献指南 提到的顶级学习素材
- DeepSeek V4 技术报告——理解”低成本高性能”如何做到的教科书
2. 实践建议
- 先看 大语言模型(LLM)原理 理解架构,再动手
- 想不花钱玩模型?WebGPU实战 让浏览器跑 Qwen2.5 小模型
- 想跑本地大模型?RAG 实战(课程中心路线 B 进阶阶段)
3. 就业信号
四家厂商的竞争焦点从”参数竞赛”转向”应用 + 生态 + 成本“——这意味 AI 应用开发者的黄金时代。方向 C 的 AI双周速递 会持续追踪这个趋势。
五、P3 系列收官:一张图回顾我们学了什么
1 | P3-1 AI双周速递创刊号 → 看见趋势(Kimi K3 / DeepSeek V4 / WAIC) |
从”看见新闻”到”理解原理”到”动手实践”到”做出决策”——这就是 AIJVS 想带你走完的路。
下一步:P3 之后
- 方向 A 项目式:RAG 知识库实战(Docker + Ollama + Milvus)、LlamaFactory 微调你的模型
- 方向 B 评测:中文 Embedding 排行榜、国产 AI 编程助手盲测
- 方向 C 周刊:AI 双周速递第二期(DeepSeek V4-Pro 预计 8 月初发布,敬请期待)
全部内容都会与 课程中心 的路线 A/B 打通,互相引用、层层递进。
六、最终建议(写在最后)
不要纠结”哪个模型最强”——要问”哪个模型最适合我的场景”。
- 预算有限 → DeepSeek V4-Flash
- 长文档 → Kimi K3
- 编程 → Qwen / Kimi
- 私有化 → Kimi K3 / Qwen 开源版
- 批量任务 → GLM
动手才是最好的学习。打开 课程中心快速通道,今天就开始你的第一个 AI 项目。
下一篇速递(8月中下旬),我们会实测 DeepSeek V4-Pro 和 GLM-5.3,用数据说话。如果你有想测的场景,评论区告诉我——我们下一期见!
互动:你现在在用哪家模型?踩过什么坑?评论区分享,帮助更多初学者避坑。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 AIJVS!
评论
