MODEL NOTE · DEEPSEEK-AI · 2026
DeepSeek-V4:百万上下文背后的新技术
如果你不懂大模型,先不要被 1.6T 参数、FP4、CSA 这些词吓到。这篇文章只追一个问题:DeepSeek-V4 为什么能在更长时间里读、想、调用工具,又为什么它仍然不是一个真正的“长期记忆大脑”?
先给结论:V4 最重要的进步,不只是“模型变大”,而是把长文本的注意力、缓存和训练方式一起重新设计,让 100 万 Token 从一个昂贵的展示数字,变成更适合长期 Agent 使用的工作空间。
技术报告的前言到底在解决什么?
过去我们让大模型变聪明,常用一条很直观的路:让它在回答前多想一会儿。复杂数学题、代码修改和 Agent 任务都可能需要更长的推理过程。但模型每多读一个 Token,就要从前文中寻找相关信息;上下文越来越长,普通注意力的计算和缓存也越来越贵。
这会形成一个矛盾:我们希望 Agent 能连续工作几小时,记住代码、终端输出、网页、工具结果和自己的计划;但它的“工作台”越长,运行越慢、显存越容易被 KV Cache 填满。技术报告把核心问题概括为:怎样突破超长上下文的效率瓶颈,让更长的推理和长期任务真正可用?
所以 V4 不是突然发明了一个全新的大模型物种。它仍然是 Transformer,也继承了 DeepSeekMoE 和 Multi-Token Prediction。真正的新工作,是围绕“长上下文效率、深层训练稳定性和 Agent 后训练”做的一整套升级。
代码库、文档、工具记录和推理痕迹会不断塞进上下文。
每个新 Token 都需要查找过去的信息,长度上升会放大计算与缓存压力。
模型还要能在一百万 Token 中找到信息、推理并继续行动。
压缩、筛选、局部窗口、低精度和新的训练管线一起工作。
V4 的主线不是“模型终于能记住所有东西”,而是“让一个很长的临时工作区更便宜”。上下文是当前会话里的工作记忆,不等于训练后的知识,也不等于跨会话永久记忆。
先补四个基础词:Token、参数、注意力、KV Cache
Token
模型读写的基本碎片。一个汉字、英文词的一部分、标点或代码符号都可能是 Token。100 万 Token 不是 100 万个汉字,两者不能直接画等号。
参数
训练后留下的大量数字,决定模型如何变换信息。参数多不代表每次都全部参与计算;MoE 会只叫醒少量专家。
注意力
当前 Token 在回答前,给前文不同位置分配相关性。它像在一张超长会议记录中标记“这一刻应该回看哪里”。
KV Cache
模型把前文计算出的线索缓存起来,生成下一个 Token 时不必从头重算。会话越长,缓存通常越大。
拖动上下文长度,观察普通注意力的“要比较多少对位置”和缓存压力为什么迅速变大。
教学中的相对比较对数量,按长度平方增长。
概念示意:先压缩,再只精查少量相关块。
教学示意,不是 V4 精确公式或实测曲线。真实 CSA/HCA 还包含压缩倍率、Top-k、滑动窗口、不同精度和混合层配置。论文给出的可引用实测是:在 1M 上下文下,V4-Pro 的单 Token 推理 FLOPs 为 V3.2 的 27%,KV Cache 为 10%;V4-Flash 分别为 10% 和 7%。
哪些是 V4 新技术,哪些只是继承?
| 技术 | V4 的身份 | 用人话说 |
|---|---|---|
| Transformer | 基础骨架 | 仍然是一层层处理 Token 的主结构 |
| DeepSeekMoE | 从 V3 系列继承并微调 | 每个 Token 只调用少数专家,避免每次运行全部参数 |
| MTP | 从 V3 继承,配置不变 | 训练模型同时预测多个后续 Token,也可帮助推理加速 |
| CSA + HCA | V4 核心新架构 | 把很长的历史压缩后,再稀疏查找或密集阅读 |
| mHC | V4 核心新架构 | 给深层网络增加多条受约束的信息通道 |
| Muon | V4 核心训练升级 | 改变参数更新方向的整理方式,提高收敛和稳定性 |
| OPD + Agent 管线 | V4 后训练升级 | 先练多个专科老师,再把能力蒸馏到统一学生 |
CSA 像“先把旧记录做成摘要,再用索引找出最相关的几段”;HCA 像“把更大段历史压成更短的概要,然后仍然全部阅读”。两者交错,再补一条最近 Token 的滑动窗口。
百万上下文的关键:不是全忘,也不是全看
普通注意力可以想成:你写下一个词之前,把过去每一句话都摊在桌上逐一比较。短对话时没问题;当桌面上有一百万个 Token,逐一比较会变得昂贵。
CSA(Compressed Sparse Attention)做两次减法。第一步,把连续的若干 Token 压成一个 KV 条目;第二步,用 Lightning Indexer 快速打分,只选择 Top-k 个相关压缩块进行核心注意力。它很像先把档案装进有摘要的文件夹,再用目录挑出少数最相关文件夹。
HCA(Heavily Compressed Attention)压得更狠,但不做 Top-k 稀疏选择,而是对压缩后的短序列保持密集注意力。它承担的是更粗粒度的全局视野。与此同时,V4 还保留最近 Token 的滑动窗口,因为刚说过的话往往需要逐字精读。
压缩一定会丢细节,稀疏选择也可能选错。因此 V4 不是靠一个技巧取胜,而是让“局部原文、稀疏相关块、重压缩全局”互相补位。报告自己也承认,为追求极致效率保留了许多组件,使架构相对复杂。
mHC、Muon 与 FP4:怎样让巨型模型训得动、跑得动
把一条信息高速公路扩成多条受控车道
普通残差连接把旧信号直接加回新信号,帮助深层网络别“忘掉前面”。Hyper-Connections 扩宽残差流,但层数一多可能数值不稳定。mHC 把混合矩阵限制在特定数学集合中,使信号不被层层放大,同时保留多路表达能力。
不只看梯度往哪走,还整理整张参数矩阵的更新方向
训练就是不断修改参数。Muon 会近似正交化矩阵更新,让不同方向不要过度挤在一起。V4 大部分模块用 Muon,Embedding、预测头、归一化等部分仍保留 AdamW。它是混合使用,不是把 AdamW 一刀切掉。
用更少位数存专家权重,但让模型提前适应误差
V4 在后训练加入量化感知训练,让 MoE 专家权重和 CSA 索引器的一部分路径适应 FP4。最终指令模型的专家权重用 FP4,多数其他参数用 FP8。论文报告 Top-k 选择器获得 2 倍加速,同时保持 99.7% 的 KV 条目召回率。
“4 位”不等于整个模型每个地方都只用 4 位,也不等于模型可以塞进普通显卡。V4-Pro 有 1.6T 总参数;即使每次只激活 49B,开放权重仍需要存放全部专家。MoE 节省的是每个 Token 的计算,不会让全部权重凭空消失。
后训练的新重点:先练专科老师,再合成一个学生
预训练教模型“世界上有哪些文字和模式”,后训练才把它变成会回答、会推理、会调用工具的助手。V4 先为数学、代码、Agent、指令遵循等领域分别训练专家:先做监督微调,再用 GRPO 强化学习,让不同专家根据各自奖励继续成长。
接着,V4 使用多教师在线策略蒸馏(On-Policy Distillation,OPD)。学生模型先按自己当前能力生成轨迹,相关领域的老师再告诉它“在这些位置上,我会怎样分配下一个 Token 的概率”。超过十个教师的能力最终被蒸馏进一个统一模型,而不是简单把多套权重平均。
选择推理档位,看看它改变的是“本次回答愿意花多少计算”,而不是换了一套基础权重。
模型显式生成更长的思考过程,通常更慢,但在复杂问题上更可靠。
概念教学,不代表固定延迟或固定 Token 数。实际开销取决于问题、服务配置和模型是否提前完成。论文训练了 Non-think、Think High、Think Max 三个推理努力档位。
成绩应该怎么看,而不是只看排行榜第一
长上下文效率确实是论文主贡献
在 1M 上下文下,报告给出相对 V3.2 的 FLOPs 和 KV Cache 大幅下降,并在 MRCR、CorpusQA 等长上下文测试中报告结果。这些结果直接对应它提出的问题。
很多对比来自官方统一或内部框架
模型、推理预算、工具、上下文管理和提示方式都会影响 Agent 基准。论文中的“领先”应读成特定设置下的报告,不是所有真实任务上的永久排名。
DeepSeek 自己也记录了小错与过度思考
报告中的内部调查覆盖 85 位日常使用者:多数愿意或倾向把 V4-Pro 当主力代码模型,但仍提到低级错误、误解模糊提示和偶尔过度思考。
架构有效,但还不够简洁和可解释
作者承认 V4 为降低风险保留了许多已验证组件,使整体较复杂;部分训练稳定技巧的底层原理仍未被充分理解。
| 你遇到的任务 | 更合适的选择 | 原因 |
|---|---|---|
| 简单问答、改写、短代码 | V4-Flash / Non-think | 激活参数少,延迟和成本优先 |
| 日常代码 Agent、搜索、规划 | Flash High 或 Pro High | 需要工具、推理和较长上下文的平衡 |
| 复杂数学、困难调试、长任务 | Pro Max | 知识容量和推理预算更高,但最慢 |
| 普通个人电脑本地运行 | 不要直接选 Pro/Flash 原始权重 | 总权重规模仍远超消费级单卡 |
“开源了”到底意味着什么?
- Pro、Flash 的 Base 与指令模型权重
- Hugging Face / ModelScope 下载入口
- MIT 模型权重许可
- 推理代码、编码格式与技术报告
- 不代表训练数据全部公开
- 不代表外部团队能低成本完整复训
- 不代表普通电脑可以运行原始 Pro
- 不代表所有官方基准都已独立复现
本文采用“开放权重模型”这个更精确的说法。DeepSeek 官方确实提供 MIT 许可的权重与推理材料;但从零训练同等模型所需的数据、算力、工程系统和实验经验,并没有因为下载按钮出现就全部复制给所有人。
它对我们的 SAO 目标意味着什么?
DeepSeek-V4 不是 world model,也不会替代 PBF、GNS、3D 引擎或持久世界数据库。它处理的是 Token 序列,不是直接推进世界里的粒子、碰撞和对象状态。
但它非常适合 SAO 系统里的“语言与任务协调层”:读完整个项目、拆解长期目标、调用建模与代码工具、维护 NPC 的计划、根据世界数据库生成对白,并在许多轮工具调用中保持任务思路。
百万上下文更像一个更大的“任务工作台”,不是 SAO 世界本身
- 让 V4 负责读计划、写代码和调工具。
它可以长时间处理项目上下文,适合作为构建世界的工程 Agent。
- 让权威世界状态留在外部系统。
门是否打开、物品归谁、NPC 在哪里,应存在数据库或游戏服务器,而不是只写在聊天上下文里。
- 只把相关状态检索给模型。
一百万 Token 仍然有限,也会带来延迟。长期世界需要检索、摘要、分层记忆和事件日志。
- 让物理层验证语言层。
大模型可以提出“推倒墙壁”的计划,但能否发生必须交给物理、规则和权限系统判断。
读完后应该带走的六件事
- 01
DeepSeek-V4 的主问题是超长上下文效率,不只是继续堆参数。
- 02
MoE 与 MTP 主要从 V3 继承;CSA/HCA、mHC、Muon 和新的后训练管线才是 V4 重点升级。
- 03
CSA 先压缩再稀疏挑选,HCA 重度压缩后密集阅读,滑动窗口保留最近细节。
- 04
一百万 Token 是更大的临时工作区,不等于永久记忆、完全理解或永不遗忘。
- 05
开放权重不等于普通电脑能运行,也不等于训练数据和完整复训条件全部开放。
- 06
面向 SAO,它更适合语言、规划与 Agent 编排层,不能替代世界状态、物理与沉浸接口。