顶会论文解读:ICML 2026 三大趋势与港大 CaRE 持续学习
阅读前置:本篇是 P3 前沿系列的论文解读篇,建议先看 Transformer深度解读 掌握基础概念。
为什么读论文?一个被低估的能力
在 开源项目贡献指南 里我们说过,参与开源社区的第一步是”读代码”。而读论文,是理解 AI 前沿的唯一方式——因为:
- 新闻滞后:等你从新闻看到某个技术,它已经是半年前的研究了
- 博客稀释:二手解读常丢失关键细节
- 论文是源头:所有模型(Kimi K3、DeepSeek V4)的技术报告,本质都是论文
好消息:读论文不需要数学博士。本篇用大白话拆解 2026 年最重要的几篇,并教你一套”5 分钟读懂一篇论文”的方法。
一、ICML 2026 概况
ICML(国际机器学习大会)是机器学习领域最顶级的学术会议。第 43 届 ICML 2026 于 7 月 6 日开幕。
本届亮点(置信度:高)
- 清华团队获最佳论文奖——中国学者在顶会的存在感持续上升
- DeepMind 经典之作拿下时间检验奖——十年前的工作影响至今
- 三大趋势(会议官方总结):
- 新推理模式的模型架构(如混合注意力、状态空间模型)
- 更可靠的智能体(Agent)(长期任务执行、自我纠错)
- 降低训练与推理成本的基础设施(量化、稀疏化、高效并行)
这三条趋势,正好和我们的 AI双周速递·创刊号 完全对上:Kimi K3 的 MoE 是”低成本架构”,DeepSeek V4-Flash 的 Agent 能力增强是”更可靠的智能体”——学术和产业在同一方向上共振。
二、重点论文 1:港大 CaRE——让 AI 持续学习不遗忘
2.1 它解决什么问题?
灾难性遗忘(Catastrophic Forgetting):神经网络学新东西时会”忘掉”旧知识。就像一个人学完法语忘了英语。
传统持续学习(Continual Learning)方法,最多能处理几十个任务。而现实世界的 AI 需要终身学习——今天学写代码、明天学画图、后天学开车,不能学一个忘一个。
2.2 CaRE 怎么做的?
CaRE(Scalable Continual Learner with efficient Bi-Level Routing Mixture-of-Experts),来自香港大学团队,ICML 2026。
核心创新:
- 双层路由 MoE:把专家网络分成两层,上层路由选择”任务群”,下层路由选择”具体专家”。新任务来了,只新增专家,不动旧专家——旧知识不被覆盖,新知识有地方放
- 首次扩展到 300+ 任务:在超长任务序列上大幅超越现有基线
- 开源:代码和数据(OmniBenchmark-1K 评测集)全部公开
1 | 新任务输入 → 上层路由(选任务群) → 下层路由(选专家) → 只更新新专家 → 旧专家冻结 |
2.3 和 MoE 的关系
还记得 Transformer深度解读 里 Kimi K3 的 896 个专家吗?CaRE 是 MoE 在”持续学习”场景的应用——同一个架构思想,不同的用途:
| 场景 | MoE 用途 |
|---|---|
| Kimi K3 推理 | 每 token 只激活 16 专家 → 省算力 |
| CaRE 持续学习 | 新任务只动新专家 → 不遗忘 |
这就是读论文的乐趣:看到同一思想在不同场景的开花结果。
三、重点论文 2:CVPR 2026 UCAN——注意力机制的进化
虽然本篇聚焦 ICML,但 CVPR 2026 的注意力机制论文同样精彩,而且和我们的 计算机视觉入门 直接相关。
UCAN:轻量级超分网络的注意力革新
UCAN(Unified Convolutional Attention Network) 提出三种注意力机制的组合:
- Flash Attention:高效大窗口注意力(计算速度快)
- Hedgehog Attention:新提出的线性注意力变体,解决传统线性注意力的”秩坍塌”(信息丢失)问题
- 混合注意力:局部依赖(卷积)+ 全局依赖(注意力)融合
核心贡献:用更少的计算量,实现了更大感受野的图像超分(把模糊图变清晰)。图像超分是手机摄影、医学影像的关键技术。
这印证了 ICML 2026 的趋势一:”新推理模式的模型架构”——2026 年,注意力机制的创新不再是”堆参数”,而是”用更聪明的结构换效率”。
四、重点论文 3:VLLM 视觉 Token 剪枝研究
《When Token Pruning is Worse than Random》(CVPR 2026):
这篇论文提出了”信息视界”(Information Horizon)概念,发现视觉大模型(VLLM)中,视觉信息在网络深处会均匀消失——超过某一层后,视觉 token 的信息量趋近于零。
实际意义:
- 现有视觉 token 剪枝方法在某些层会失效(效果还不如随机剪枝)
- 为多模态大模型的效率优化提供了理论指导
- 直接影响 图像分类(CIFAR-10) 这类任务的多模态扩展
五、方法:5 分钟读懂一篇论文
这是本篇文章最有价值的部分——一套可复用的论文阅读法:
第一步:看标题+摘要(30秒)
回答三个问题:
- 它解决了什么问题?
- 它用什么方法?
- 效果比谁好多少?
第二步:看图(2分钟)
论文的图表浓缩了 80% 的信息。重点看:
- 架构图:系统长什么样
- 实验表格:比基线好多少
- 可视化:为什么有效
第三步:看结论+Related Work(1分钟)
- 结论:作者认为贡献是什么
- Related Work:这篇论文站在谁的肩膀上(追踪引用链)
第四步:决定是否精读
- 与你研究相关 → 精读方法部分
- 只是了解 → 到此为止
工具推荐
- arXiv:论文源仓库(记得看 AI导航 里的学术工具)
- Hugging Face Papers:带讨论区的论文解读
- Semantic Scholar:引用追踪神器
六、总结与联动
核心记忆点
- ICML 2026 三大趋势:新架构、可靠 Agent、低成本
- 港大 CaRE:双层路由 MoE 破解灾难性遗忘,首次 300+ 任务
- 注意力机制 2026 主旋律是”效率”而非”规模”
- 读论文四步法:摘要→图→结论→精读
联动路径
- 理论基础:Transformer深度解读 → 大语言模型(LLM)原理
- 实战延伸:WebGPU实战:在浏览器里跑大模型(论文方法 → 实际应用)
- 最新动态:AI双周速递·创刊号
- 参与研究:开源项目贡献指南
下篇预告
下一篇 国产大模型横评:DeepSeek / Kimi / Qwen / GLM 谁更值得用?——把理论落到选型,P3 系列收官。
思考题:为什么说”灾难性遗忘”是通往通用人工智能(AGI)的必经之路?人类是怎么做到学新不忘旧的?(提示:睡眠、间隔重复、知识结构化——AI 都还没学会)。评论区见。
