DOTAFS

Personal learning notes

MODEL NOTE · DEEPSEEK-AI · 2026

DeepSeek-V4:百万上下文背后的新技术

如果你不懂大模型,先不要被 1.6T 参数、FP4、CSA 这些词吓到。这篇文章只追一个问题:DeepSeek-V4 为什么能在更长时间里读、想、调用工具,又为什么它仍然不是一个真正的“长期记忆大脑”?

先给结论:V4 最重要的进步,不只是“模型变大”,而是把长文本的注意力、缓存和训练方式一起重新设计,让 100 万 Token 从一个昂贵的展示数字,变成更适合长期 Agent 使用的工作空间。

Pro
1.6T 总参数,每次约 49B 激活
Flash
284B 总参数,每次约 13B 激活
上下文
两者均为 1M Token
发布
Preview 04-24 · Pro GA 08-13
本文日期
2026-08-16 · 约 20 分钟
01 / THE REAL QUESTION

技术报告的前言到底在解决什么?

过去我们让大模型变聪明,常用一条很直观的路:让它在回答前多想一会儿。复杂数学题、代码修改和 Agent 任务都可能需要更长的推理过程。但模型每多读一个 Token,就要从前文中寻找相关信息;上下文越来越长,普通注意力的计算和缓存也越来越贵。

这会形成一个矛盾:我们希望 Agent 能连续工作几小时,记住代码、终端输出、网页、工具结果和自己的计划;但它的“工作台”越长,运行越慢、显存越容易被 KV Cache 填满。技术报告把核心问题概括为:怎样突破超长上下文的效率瓶颈,让更长的推理和长期任务真正可用?

所以 V4 不是突然发明了一个全新的大模型物种。它仍然是 Transformer,也继承了 DeepSeekMoE 和 Multi-Token Prediction。真正的新工作,是围绕“长上下文效率、深层训练稳定性和 Agent 后训练”做的一整套升级。

输入越来越长

代码库、文档、工具记录和推理痕迹会不断塞进上下文。

普通注意力太贵

每个新 Token 都需要查找过去的信息,长度上升会放大计算与缓存压力。

目标不是只装进去

模型还要能在一百万 Token 中找到信息、推理并继续行动。

V4 的答案

压缩、筛选、局部窗口、低精度和新的训练管线一起工作。

DeepSeek-V4 论文 Figure 1:基准表现,以及不同上下文长度下的计算量和 KV Cache 比较
论文 Fig. 1。左侧是多项知识、推理与 Agent 基准;右侧才是 V4 这篇报告最核心的故事:上下文增长时,V4 的单 Token 计算量和 KV Cache 增长远慢于 V3.2。图中结果由 DeepSeek 官方报告给出。
先记住

V4 的主线不是“模型终于能记住所有东西”,而是“让一个很长的临时工作区更便宜”。上下文是当前会话里的工作记忆,不等于训练后的知识,也不等于跨会话永久记忆。

02 / FOUR BASICS

先补四个基础词:Token、参数、注意力、KV Cache

01

Token

模型读写的基本碎片。一个汉字、英文词的一部分、标点或代码符号都可能是 Token。100 万 Token 不是 100 万个汉字,两者不能直接画等号。

02

参数

训练后留下的大量数字,决定模型如何变换信息。参数多不代表每次都全部参与计算;MoE 会只叫醒少量专家。

03

注意力

当前 Token 在回答前,给前文不同位置分配相关性。它像在一张超长会议记录中标记“这一刻应该回看哪里”。

04

KV Cache

模型把前文计算出的线索缓存起来,生成下一个 Token 时不必从头重算。会话越长,缓存通常越大。

可操作例子

拖动上下文长度,观察普通注意力的“要比较多少对位置”和缓存压力为什么迅速变大。

普通全注意力4,096×

教学中的相对比较对数量,按长度平方增长。

压缩 + 稀疏思路64×

概念示意:先压缩,再只精查少量相关块。

教学示意,不是 V4 精确公式或实测曲线。真实 CSA/HCA 还包含压缩倍率、Top-k、滑动窗口、不同精度和混合层配置。论文给出的可引用实测是:在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 为 V3.2 的 27%,KV Cache 为 10%;V4-Flash 分别为 10% 和 7%。

03 / WHAT IS ACTUALLY NEW

哪些是 V4 新技术,哪些只是继承?

技术V4 的身份用人话说
Transformer基础骨架仍然是一层层处理 Token 的主结构
DeepSeekMoE从 V3 系列继承并微调每个 Token 只调用少数专家,避免每次运行全部参数
MTP从 V3 继承,配置不变训练模型同时预测多个后续 Token,也可帮助推理加速
CSA + HCAV4 核心新架构把很长的历史压缩后,再稀疏查找或密集阅读
mHCV4 核心新架构给深层网络增加多条受约束的信息通道
MuonV4 核心训练升级改变参数更新方向的整理方式,提高收敛和稳定性
OPD + Agent 管线V4 后训练升级先练多个专科老师,再把能力蒸馏到统一学生
DeepSeek-V4 论文 Figure 2:总体架构,包含 CSA/HCA、DeepSeekMoE、mHC 与 MTP
论文 Fig. 2。从下向上看:Token 进入 Embedding;注意力层在 CSA/HCA 之间混合,前馈层使用 DeepSeekMoE;mHC 负责层与层之间的信息混合;顶部继续保留语言模型预测头与 MTP 模块。
HYBRID ATTENTION

CSA 像“先把旧记录做成摘要,再用索引找出最相关的几段”;HCA 像“把更大段历史压成更短的概要,然后仍然全部阅读”。两者交错,再补一条最近 Token 的滑动窗口。

04 / CSA + HCA

百万上下文的关键:不是全忘,也不是全看

普通注意力可以想成:你写下一个词之前,把过去每一句话都摊在桌上逐一比较。短对话时没问题;当桌面上有一百万个 Token,逐一比较会变得昂贵。

CSA(Compressed Sparse Attention)做两次减法。第一步,把连续的若干 Token 压成一个 KV 条目;第二步,用 Lightning Indexer 快速打分,只选择 Top-k 个相关压缩块进行核心注意力。它很像先把档案装进有摘要的文件夹,再用目录挑出少数最相关文件夹。

HCA(Heavily Compressed Attention)压得更狠,但不做 Top-k 稀疏选择,而是对压缩后的短序列保持密集注意力。它承担的是更粗粒度的全局视野。与此同时,V4 还保留最近 Token 的滑动窗口,因为刚说过的话往往需要逐字精读。

最近几页滑动窗口

不压缩,保留局部细节。

相关章节CSA

先压缩,再用索引挑 Top-k。

整本书梗概HCA

重度压缩,但保留全局浏览。

DeepSeek-V4 论文 Figure 3:CSA 压缩 KV、Lightning Indexer、Top-k 与滑动窗口结构
论文 Fig. 3。黄色条是历史 KV:底部先做 Token 级压缩;中间的 Lightning Indexer 为压缩块打分并选择 Top-k;左侧额外加入最近的未压缩滑动窗口,最后一起进入共享 Key-Value 的多查询注意力。
最重要的代价

压缩一定会丢细节,稀疏选择也可能选错。因此 V4 不是靠一个技巧取胜,而是让“局部原文、稀疏相关块、重压缩全局”互相补位。报告自己也承认,为追求极致效率保留了许多组件,使架构相对复杂。

05 / TRAINING THE GIANT

mHC、Muon 与 FP4:怎样让巨型模型训得动、跑得动

mHC

把一条信息高速公路扩成多条受控车道

普通残差连接把旧信号直接加回新信号,帮助深层网络别“忘掉前面”。Hyper-Connections 扩宽残差流,但层数一多可能数值不稳定。mHC 把混合矩阵限制在特定数学集合中,使信号不被层层放大,同时保留多路表达能力。

Muon

不只看梯度往哪走,还整理整张参数矩阵的更新方向

训练就是不断修改参数。Muon 会近似正交化矩阵更新,让不同方向不要过度挤在一起。V4 大部分模块用 Muon,Embedding、预测头、归一化等部分仍保留 AdamW。它是混合使用,不是把 AdamW 一刀切掉。

FP4

用更少位数存专家权重,但让模型提前适应误差

V4 在后训练加入量化感知训练,让 MoE 专家权重和 CSA 索引器的一部分路径适应 FP4。最终指令模型的专家权重用 FP4,多数其他参数用 FP8。论文报告 Top-k 选择器获得 2 倍加速,同时保持 99.7% 的 KV 条目召回率。

别误解 FP4

“4 位”不等于整个模型每个地方都只用 4 位,也不等于模型可以塞进普通显卡。V4-Pro 有 1.6T 总参数;即使每次只激活 49B,开放权重仍需要存放全部专家。MoE 节省的是每个 Token 的计算,不会让全部权重凭空消失。

06 / FROM MODEL TO AGENT

后训练的新重点:先练专科老师,再合成一个学生

预训练教模型“世界上有哪些文字和模式”,后训练才把它变成会回答、会推理、会调用工具的助手。V4 先为数学、代码、Agent、指令遵循等领域分别训练专家:先做监督微调,再用 GRPO 强化学习,让不同专家根据各自奖励继续成长。

接着,V4 使用多教师在线策略蒸馏(On-Policy Distillation,OPD)。学生模型先按自己当前能力生成轨迹,相关领域的老师再告诉它“在这些位置上,我会怎样分配下一个 Token 的概率”。超过十个教师的能力最终被蒸馏进一个统一模型,而不是简单把多套权重平均。

STEP 1基础模型32T / 33T Token 预训练
STEP 2领域专家数学 · 代码 · Agent · 指令
STEP 3学生自己生成轨迹保持 on-policy
STEP 4统一 V4对齐多位教师的完整概率分布
可操作例子

选择推理档位,看看它改变的是“本次回答愿意花多少计算”,而不是换了一套基础权重。

适合任务复杂问题、计划与日常 Agent
推理时间
计算预算

模型显式生成更长的思考过程,通常更慢,但在复杂问题上更可靠。

概念教学,不代表固定延迟或固定 Token 数。实际开销取决于问题、服务配置和模型是否提前完成。论文训练了 Non-think、Think High、Think Max 三个推理努力档位。

DeepSeek-V4 论文 Figure 7:使用工具和普通对话时对历史推理内容的不同管理方式
论文 Fig. 7。工具场景会跨多轮保留完整推理历史,使 Agent 不必每次重建计划;普通聊天在新用户消息到来时仍丢弃旧推理,只保留答案,避免上下文无意义膨胀。
07 / EVIDENCE & CAUTION

成绩应该怎么看,而不是只看排行榜第一

官方强证据

长上下文效率确实是论文主贡献

在 1M 上下文下,报告给出相对 V3.2 的 FLOPs 和 KV Cache 大幅下降,并在 MRCR、CorpusQA 等长上下文测试中报告结果。这些结果直接对应它提出的问题。

需要谨慎

很多对比来自官方统一或内部框架

模型、推理预算、工具、上下文管理和提示方式都会影响 Agent 基准。论文中的“领先”应读成特定设置下的报告,不是所有真实任务上的永久排名。

真实反馈

DeepSeek 自己也记录了小错与过度思考

报告中的内部调查覆盖 85 位日常使用者:多数愿意或倾向把 V4-Pro 当主力代码模型,但仍提到低级错误、误解模糊提示和偶尔过度思考。

论文局限

架构有效,但还不够简洁和可解释

作者承认 V4 为降低风险保留了许多已验证组件,使整体较复杂;部分训练稳定技巧的底层原理仍未被充分理解。

你遇到的任务更合适的选择原因
简单问答、改写、短代码V4-Flash / Non-think激活参数少,延迟和成本优先
日常代码 Agent、搜索、规划Flash High 或 Pro High需要工具、推理和较长上下文的平衡
复杂数学、困难调试、长任务Pro Max知识容量和推理预算更高,但最慢
普通个人电脑本地运行不要直接选 Pro/Flash 原始权重总权重规模仍远超消费级单卡
08 / WHAT OPEN-SOURCE MEANS

“开源了”到底意味着什么?

现在真正开放的
  • Pro、Flash 的 Base 与指令模型权重
  • Hugging Face / ModelScope 下载入口
  • MIT 模型权重许可
  • 推理代码、编码格式与技术报告
不能自动推导出的
  • 不代表训练数据全部公开
  • 不代表外部团队能低成本完整复训
  • 不代表普通电脑可以运行原始 Pro
  • 不代表所有官方基准都已独立复现
准确说法

本文采用“开放权重模型”这个更精确的说法。DeepSeek 官方确实提供 MIT 许可的权重与推理材料;但从零训练同等模型所需的数据、算力、工程系统和实验经验,并没有因为下载按钮出现就全部复制给所有人。

09 / OUR EXTENSION TO SAO

它对我们的 SAO 目标意味着什么?

DeepSeek-V4 不是 world model,也不会替代 PBF、GNS、3D 引擎或持久世界数据库。它处理的是 Token 序列,不是直接推进世界里的粒子、碰撞和对象状态。

但它非常适合 SAO 系统里的“语言与任务协调层”:读完整个项目、拆解长期目标、调用建模与代码工具、维护 NPC 的计划、根据世界数据库生成对白,并在许多轮工具调用中保持任务思路。

06语言、规划与 Agent 编排DeepSeek-V4 最适合的位置
05NPC 行为与社会系统可提供高层目标,但需要外部状态与规则
04持久世界状态数据库、事件日志、空间记忆
03世界动力学PBF / GNS / 物理引擎 / world model
023D 场景与实时渲染WebGPU / Unreal / 生成式世界
01身体、感官与接口VR、触觉、追踪与未来神经接口
我们的延伸 / 不是论文结论

百万上下文更像一个更大的“任务工作台”,不是 SAO 世界本身

  1. 让 V4 负责读计划、写代码和调工具。

    它可以长时间处理项目上下文,适合作为构建世界的工程 Agent。

  2. 让权威世界状态留在外部系统。

    门是否打开、物品归谁、NPC 在哪里,应存在数据库或游戏服务器,而不是只写在聊天上下文里。

  3. 只把相关状态检索给模型。

    一百万 Token 仍然有限,也会带来延迟。长期世界需要检索、摘要、分层记忆和事件日志。

  4. 让物理层验证语言层。

    大模型可以提出“推倒墙壁”的计划,但能否发生必须交给物理、规则和权限系统判断。

10 / SUMMARY

读完后应该带走的六件事

  1. 01

    DeepSeek-V4 的主问题是超长上下文效率,不只是继续堆参数。

  2. 02

    MoE 与 MTP 主要从 V3 继承;CSA/HCA、mHC、Muon 和新的后训练管线才是 V4 重点升级。

  3. 03

    CSA 先压缩再稀疏挑选,HCA 重度压缩后密集阅读,滑动窗口保留最近细节。

  4. 04

    一百万 Token 是更大的临时工作区,不等于永久记忆、完全理解或永不遗忘。

  5. 05

    开放权重不等于普通电脑能运行,也不等于训练数据和完整复训条件全部开放。

  6. 06

    面向 SAO,它更适合语言、规划与 Agent 编排层,不能替代世界状态、物理与沉浸接口。