阅读前置:本篇是 P3 前沿系列的收官篇。建议先读 Transformer深度解读大语言模型(LLM)原理,理解”参数/上下文/量化”这些词再来看选型,事半功倍。


2026 年 8 月,国产大模型的”神仙打架”

一个月内,三家头部厂商接连放大招:

  • 7/16:Kimi K3 发布(2.8 万亿参数,全球最大开源模型)
  • 7/19:Qwen 3.8-Max 预览版上线(2.4 万亿参数,开源回归)
  • 7/31:DeepSeek V4-Flash 正式版 API 公测
  • 8/3:GLM-5.3 意外泄露(尚未正式发布)

四家神仙打架,我们怎么选?本篇用一张表 + 场景拆解,帮你做决定。

全部数据来自公开报道与基准测试(标注置信度)。AI 领域变化极快,以官方公告为准。


一、四大家族对比总表

维度 DeepSeek V4-Flash Kimi K3 Qwen 3.8-Max GLM-5
厂商 深度求索 月之暗面 阿里 智谱
总参数 130亿激活(未公开总量) 2.8万亿 2.4万亿 7440亿
激活参数 130亿 约1040亿 未公开 400亿
架构 MoE MoE(896专家/激活16) MoE MoE(slime RL)
上下文 长上下文 100万token 128K+ 200K
开源 API ✅完整权重 承诺开源 部分
编程能力 WebDev 1577分 Frontend Code Arena 1679分(第1) 编程国产第1 日常编码强
性价比 98%缓存命中,极致 100万token仅$3.2-4.6
发布时间 2026-07-31 2026-07-16/27 2026-07-19 2026-06
适合场景 高频API调用、Agent 长上下文、复杂推理、研究 编程、全模态、生态 长时后台任务、低成本

置信度:参数/时间线为高(多源一致);基准分数为中高(不同榜单口径不同)。


二、逐家拆解:谁适合你?

🥇 Kimi K3:长文本之王 + 研究者的宝藏

适合谁:处理超长文档、做研究、想私有化部署的人。

  • 100 万 token 上下文:单次可处理约 75 万单词——整本《三体》三部曲都能塞进去
  • 全球最大开源模型:完整权重开放,配合 WebGPU实战 或本地部署,数据完全私有
  • 代码榜第一:Frontend Code Arena 1679 分,超越 Claude Fable 5

注意:模型巨大,本地跑需要多卡集群(适合有算力的人);普通用户走 API。

🥇 DeepSeek V4-Flash:性价比之王 + Agent 首选

适合谁:开发者、高频调用 API、做 AI 应用。

  • 98% 缓存命中:同样的功能,成本可能是别人的 1/10
  • Agent 能力大幅增强LLM 原理 里说的”推理时扩展”,它就是标杆
  • 原生 Responses API:开发者接入零成本(特别是用 Codex 生态的)
  • 130 亿激活参数”以下克上”——小身材大能量

🥇 Qwen 3.8-Max:全模态生态 + 编程新王

适合谁:需要视觉/语音/文本多模态、阿里云生态用户。

  • 编程能力国产第一(Arena 编程子榜中国第一)
  • 2.4 万亿参数回归开源:阿里旗舰线首次开源(闭源两代后)
  • 全模态:文本、图像、视频统一理解(Transformer深度解读 里讲的混合注意力架构)
  • 阿里云百炼平台成熟,企业级服务完善

🥇 GLM-5:后台任务长跑冠军

适合谁:长时后台任务、批量处理、预算敏感团队。

  • 单次 100 万 token 仅 $3.2-4.6:四家中最低价
  • slime RL 框架:强化学习驱动的 MoE,日常编码稳定
  • 200K 上下文:长时后台任务(定时摘要、数据清洗)的利器
  • GLM-5.3 泄露在即(8/3),值得关注升级版

三、场景选型速查表

你的需求 推荐 理由
聊天/写作/翻译 DeepSeek V4-Flash 便宜大碗
处理整本书/超长合同 Kimi K3 100万上下文碾压
写代码 Qwen 3.8-Max / Kimi K3 两个编程王者
做 AI 应用(API) DeepSeek V4-Flash 98%缓存命中省成本
私有化部署 Kimi K3 / Qwen 开源权重
批量后台任务 GLM-5 每百万token最便宜
多模态(图文视频) Qwen 3.8-Max 全模态旗舰
学习原理/研究 Kimi K3(读技术报告) 架构最前沿

四、学习者视角:这些模型对我们的意义

1. 学习资源

  • Kimi K3 开源三件套(MoonEP 训练框架、FlashKDA 注意力算子、AgentEnv 沙箱)——是 开源项目贡献指南 提到的顶级学习素材
  • DeepSeek V4 技术报告——理解”低成本高性能”如何做到的教科书

2. 实践建议

3. 就业信号

四家厂商的竞争焦点从”参数竞赛”转向”应用 + 生态 + 成本“——这意味 AI 应用开发者的黄金时代。方向 C 的 AI双周速递 会持续追踪这个趋势。


五、P3 系列收官:一张图回顾我们学了什么

1
2
3
4
5
6
7
8
9
10
11
P3-1  AI双周速递创刊号      → 看见趋势(Kimi K3 / DeepSeek V4 / WAIC)

P3-2 Transformer深度解读 → 理解底座(注意力 / MoE / 位置编码)

P3-3 大语言模型原理 → 看懂训练(预训练 / SFT / RLHF / KV Cache)

P3-4 WebGPU实战 → 动手落地(浏览器跑模型,零成本)

P3-5 顶会论文解读 → 触摸前沿(ICML 2026 / CaRE / 注意力进化)

P3-6 国产大模型横评(本篇) → 做出选择(四大家怎么选)

从”看见新闻”到”理解原理”到”动手实践”到”做出决策”——这就是 AIJVS 想带你走完的路。

下一步:P3 之后

  • 方向 A 项目式:RAG 知识库实战(Docker + Ollama + Milvus)、LlamaFactory 微调你的模型
  • 方向 B 评测:中文 Embedding 排行榜、国产 AI 编程助手盲测
  • 方向 C 周刊:AI 双周速递第二期(DeepSeek V4-Pro 预计 8 月初发布,敬请期待)

全部内容都会与 课程中心 的路线 A/B 打通,互相引用、层层递进。


六、最终建议(写在最后)

不要纠结”哪个模型最强”——要问”哪个模型最适合我的场景”。

  • 预算有限 → DeepSeek V4-Flash
  • 长文档 → Kimi K3
  • 编程 → Qwen / Kimi
  • 私有化 → Kimi K3 / Qwen 开源版
  • 批量任务 → GLM

动手才是最好的学习。打开 课程中心快速通道,今天就开始你的第一个 AI 项目。

下一篇速递(8月中下旬),我们会实测 DeepSeek V4-Pro 和 GLM-5.3,用数据说话。如果你有想测的场景,评论区告诉我——我们下一期见!


互动:你现在在用哪家模型?踩过什么坑?评论区分享,帮助更多初学者避坑。