跳转至

大模型前沿论文

大模型前沿论文

本页是 AI 前沿论文的导读入口,不是通识课:专题页按代表论文讲机制、失败模式和不可外推边界,篇幅短于 大模型基础 一类地基页。建立概念依赖请先读 AI 经典论文,再按下面的瓶颈地图进专题。它不追求收录所有论文,而是用研究问题组织一组可以互相对照的路线:模型如何表示位置,如何在长上下文中访问信息,如何分配训练和推理计算,如何从语言走向多模态、Agent、环境预测和物理行动。

文章默认读者已经掌握向量、矩阵乘法、概率分布、梯度下降和基本 Transformer 结构。基础概念见 Transformer 架构模型训练与对齐模型推理与部署多模态理解

研究范围与阅读方式

前沿论文的价值不在于背诵缩写,而在于回答五个问题:

  • 研究者试图消除哪个瓶颈?
  • 方法改变了模型的信息流、记忆位置还是系统执行方式?
  • 实验是在什么模型规模、数据、硬件和预算下进行的?
  • 质量收益是否伴随显存、带宽、通信、延迟或安全代价?
  • 论文结论能否外推到目标产品的真实任务?

专题页按「研究问题 → 代表论文 → 核心机制 → 系统代价与不可外推边界 → 产品判断」组织;机制正文只维护在专题页。本页只提供瓶颈地图、记号、勘误与阅读顺序。基础页负责落地方法。

flowchart LR
    baseline["Transformer 基线"] --> architecture["架构组件"]
    baseline --> systems["推理与训练系统"]
    baseline --> multimodal["多模态与 Agent"]
    baseline --> memory["记忆与替代范式"]
    architecture --> environment["世界模型与具身智能"]
    systems --> reasoning["推理时扩展与 RLVR"]
    multimodal --> environment
    memory --> trust["可解释性与安全"]
    reasoning --> trust

核心关系是:现代 AI 研究同时在改变模型结构、计算预算、外部记忆和交互环境。单项 benchmark 提升不能替代对数据、硬件、任务终态和失败代价的分析。

按瓶颈组织的研究地图

研究瓶颈主要路线进入专题
位置表达与长度外推PE、RoPE、NoPE、YaRN架构组件与训练稳定性
深层优化与数值稳定LayerNorm、RMSNorm、QK-Norm、Pre-Norm、残差变体架构组件与训练稳定性
KV Cache 与解码带宽MHA、MQA、GQA、MLA、CSA、HCA注意力与 KV Cache
注意力计算随长度平方增长Sparse Transformer、SWA、DSA、局部—全局交错稀疏与局部注意力
长序列状态成本Lightning Attention、Mamba、DeltaNet、KDA线性注意力与状态空间
模型容量与单 token 计算绑定MoE、Switch、DeepSeekMoE混合专家模型
固定残差流缺少选择性RC、HC、mHC、AttnRes架构组件与训练稳定性
固定推理预算不足以解决难题Best-of-N、搜索、验证器、test-time scaling推理时扩展
偏好奖励难以验证复杂正确性RLVR、过程监督、GRPORLVR 与 GRPO
理论复杂度无法转化为线上吞吐FlashAttention、PagedAttention、量化、投机解码推理系统与量化
工具调用无法覆盖真实界面GUI grounding、浏览器 Agent、Computer UseAgent 与 Computer Use
模态之间难以对齐和统一生成CLIP、Flamingo、BLIP-2、LLaVA、原生多模态多模态前沿论文
上下文窗口不等于长期记忆RETRO、Memorizing Transformers、模型编辑外部记忆与模型编辑
自回归生成的串行限制Diffusion LM、Masked DiffusionDiffusion Language Model
固定 tokenizer 的语言和符号偏差ByT5、CANINE、Charformer、MegaByteTokenizer-free 模型
模型内部行为难以定位和监控因果追踪、SAE、Activation Steering、Scalable Oversight可解释性与安全前沿
缺少环境预测和物理行动World Models、DreamerV3、VLA世界模型与具身智能

主题索引

架构与序列

推理与训练

Agent 与多模态

记忆与替代范式

可信前沿

读论文前先固定一套记号

对 decoder-only Transformer,设输入隐藏状态为 X ∈ R^(L×d),其中 L 是序列长度,d 是隐藏维度。标准注意力可以写成:

1
2
Q = X W_Q,K = X W_K,V = X W_V
Attention(Q, K, V) = softmax(QKᵀ / √d_k) V

Q 表示当前 token 的查询,K 用于匹配,V 携带被读取的信息。论文改变 MHA、KV Cache、稀疏选择或有限状态时,本质上都在重新安排这三类信息的生成、保存和读取。

模型架构拆解顺序

阅读任何模型技术报告,可以依次检查:

  1. 输入与位置:token 如何构造,位置在哪里注入,训练长度和推理长度是否相同;
  2. Block:归一化位于子层之前还是之后,注意力与 FFN 如何连接,残差是否缩放或动态聚合;
  3. Attention:Q/K/V 头数、KV 头数、缓存形式,是否使用局部或稀疏模式;
  4. FFN 与容量:稠密还是 MoE,激活参数和总参数是多少,路由如何均衡;
  5. 序列记忆:完整注意力、压缩 KV、有限状态或混合层如何分工;
  6. 系统实现:训练并行、通信、kernel、量化、显存和服务吞吐;
  7. 能力边界:长距离检索、代码、数学、多模态和 Agent 任务是否分别退化。

论文证据与来源维护

论文页中的结论分为三类:

  • 机制事实:论文明确提出的结构、公式和训练目标;
  • 实验结果:在指定模型、数据、硬件和 benchmark 设置下报告的数字;
  • 工程推断:基于机制对成本、风险和产品的解释。

三类内容不能混写。尤其是 2025—2026 年 arXiv 预印本,应标注版本和引用日期。链接优先使用 arXiv、正式会议或 DOI,其次使用作者/机构的官方仓库和技术报告。Hugging Face 的 blob/main 文件可能随仓库变化,不能作为唯一来源。

常见来源误写(核对 arXiv 时注意):

  • 1911.02150 的方法是 MQA,不是 MOA;如果讨论 Mixture-of-Agents,应另查 Mixture-of-Agents
  • 2305.13245 的方法是 GQA,不是 GOA;
  • 2010.04245 讨论 QK-Norm,不是 KV-Norm;
  • RMSNorm 使用 arxiv.org/abs/1910.07467,不是错误的 arxwv.org 域名;
  • Switch Transformer 使用 2101.03961,不是包含逗号的编号;
  • 1710.05941 的正式标题是 Searching for Activation Functions,论文研究并提出后来称为 Swish 的自门控激活;
  • DeepSeek-V4 的 CSA/HCA 使用 arXiv:2606.19348 核对,不使用当前不可访问的 Hugging Face PDF;
  • DSA 的 Lightning Indexer 做 token 级 top-k 选择,不能写成块级选择;核心注意力的稀疏收益也不能直接等同于整个系统复杂度。

建议阅读路线

  1. 需要概念依赖时先读 AI 经典论文,再读 Transformer 架构,理解 MHA、位置编码、残差、归一化和三种模型形态;
  2. 架构组件与训练稳定性,建立对位置、尺度、激活和残差的研究谱系;
  3. 根据长上下文问题选择 注意力与 KV Cache稀疏与局部注意力线性注意力与状态空间
  4. 需要理解规模化容量时读 混合专家模型,需要理解真实成本时读 推理系统与量化
  5. 需要理解推理模型时读 推理时扩展RLVR 与 GRPO
  6. 需要理解环境交互时读 世界模型与具身智能Agent 与 Computer Use
  7. 最后用 评估与评测AI 安全与对齐AI 系统架构 把论文结论转化为产品验收。

专题页读什么

给 AI 产品经理的结论

  • 模型名称不能替代架构分析:同样叫长上下文,可能依靠 RoPE 扩展、滑动窗口、稀疏选择、KV 压缩或有限状态;成本和失败模式完全不同。
  • 理论复杂度不能替代系统指标O(L) 只有在 kernel、内存访问和并行通信匹配时才会转化为真实吞吐。
  • 推理预算是产品资源:更长思考、更大采样数和更多验证调用会提高质量,也会增加延迟、成本和失败重试。
  • 记忆位置决定治理方式:上下文、外部数据库、Agent 状态和模型参数需要不同的权限、更新和删除策略。
  • 世界模型不能替代控制系统:预测环境、规划动作、执行控制和安全回退必须分层验收。
  • 闭环成功才是 Agent 和具身智能的最终指标:离线语言或视觉分数只是先决条件,真实环境中的成功率、恢复率、延迟、碰撞率和人工接管率才是产品指标。

来源说明

本文为原创研究地图,引用日期:2026-09-04。机制与论文列表以各专题页为 canonical 来源;本页只维护地图、记号、勘误与阅读顺序。动态论文信息以对应官方页面和指定版本为准。