尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
DeepSeek系列_国产大模型的技术创新解析
文章目录1. 先把问题讲清楚DeepSeek 路线关注的是能力/成本比2. MoE总参数变大但每个 token 不必用完3. MoE 成本账总参数、激活参数、显存、通信分开看4. MoE 的难点路由和负载均衡5. MLA长上下文的瓶颈是 KV Cache6. MLA 的工程意义长上下文不是只看窗口长度7. MTP训练时不只预测下一个 token8. 推理训练复杂任务不只是“回答风格”问题9. 推理模型的成本答案更好也可能更慢10. 如何评估 DeepSeek 或类似路线的模型11. 常见误区12. 小结大模型视角下一篇摘要DeepSeek 系列的学习价值不在于把 MoE、MLA、MTP、推理训练这些缩写背下来而在于理解它们共同回答的工程问题怎样在成本可控的前提下扩大模型容量、降低长上下文缓存压力、提高训练信号密度并让模型更擅长数学、代码和多步推理。本文不做未经验证的版本排名也不猜测未公开细节而是围绕公开讨论较多的技术方向拆解每个机制解决什么瓶颈、带来什么代价、开发者如何评估。前置知识专栏一 Transformer、 KV Cache、 Scaling Law阅读时间60-75 分钟代码环境Python 3.10示例只依赖标准库读完目标能解释 MoE、MLA、MTP、推理训练分别解决什么问题能区分总参数、激活参数、KV Cache、推理 token 成本和训练评估指标1. 先把问题讲清楚DeepSeek 路线关注的是能力/成本比大模型能力提升通常要付出成本更多参数、更多训练 token、更长上下文、更复杂推理、更高推理延迟。Dense 模型一路变大当然能提升上限但训练和部署成本会迅速变高。DeepSeek 系列公开技术讨论里经常出现的关键词可以放到一个主线下理解怎样提升模型能力同时控制训练和推理成本。拆开看有几条技术线技术方向想解决的问题主要代价MoE扩大总容量但每个 token 只激活部分专家路由、负载、通信、部署复杂MLA降低长上下文 KV Cache 压力注意力结构更复杂工程实现要求高MTP训练时提供更密集的未来 token 信号训练目标更复杂需要验证收益推理训练提升数学、代码、多步推理能力输出更长、训练更复杂、评估更难相对/可验证奖励给推理过程更有效反馈需要可判题任务或高质量偏好数据这篇文章的目标不是把 DeepSeek 神化而是让你能看懂这些设计背后的工程账省了哪里贵在哪里适合什么任务不适合什么任务。2. MoE总参数变大但每个 token 不必用完Dense Transformer 里每个 token 都经过同一套 FFN。模型做大后每个 token 的计算也跟着变贵。MoEMixture of Experts专家混合把部分 FFN 替换成多个专家网络每个 token 只选择少数专家。简化公式y ∑ i ∈ TopK ( r ( x ) ) p i E i ( x ) y \sum_{i \in \text{TopK}(r(x))} p_i E_i(x)yi∈TopK(r(x))∑​pi​Ei​(x)逐项解释x xx某个 token 的隐藏表示r ( x ) r(x)r(x)router对每个专家打分E i E_iEi​第i ii个专家通常是 FFN 分支TopK只选分数最高的 k 个专家p i p_ipi​被选专家的权重y yy多个专家输出加权后的结果。大白话模型准备很多“计算分支”但每个 token 只走其中几个。这样总参数容量可以很大但单 token 计算量可控。用代码模拟 top-2 路由# Python 3.10importmathdefsoftmax(values):mmax(values)exps[math.exp(v-m)forvinvalues]totalsum(exps)return[v/totalforvinexps]scores[0.2,2.1,-0.5,1.4,0.7]probssoftmax(scores)top_k2selectedsorted(enumerate(probs),keylambdax:x[1],reverseTrue)[:top_k]print(probs:,[round(p,3)forpinprobs])print(selected experts:,selected)这段代码体现了 router 的核心同一个 token 不会送给所有专家只送给 top-k 专家。3. MoE 成本账总参数、激活参数、显存、通信分开看MoE 最容易被误解。看到“总参数大”有人以为推理一定按总参数计算看到“激活参数少”有人以为部署一定便宜。这两种都不准确。需要分四个账本成本项含义工程影响总参数所有专家和共享层参数权重存储、加载、分片激活参数单个 token 实际经过的参数每 token 计算量常驻显存推理时需要放在设备上的权重部署容量和量化压力通信成本token 分发到专家再聚合多卡吞吐和延迟写个粗略估算器# Python 3.10defmoe_ffn_params(hidden_size,ffn_size,num_experts,active_experts):# 简化 FFN: up projection down projection不含门控和 biasone_experthidden_size*ffn_sizeffn_size*hidden_size totalone_expert*num_experts activeone_expert*active_expertsreturntotal,active hidden4096ffn14336forexperts,activein[(8,2),(16,2),(64,4)]:total,active_paramsmoe_ffn_params(hidden,ffn,experts,active)print(fexperts{experts}, active{active})print(f total_ffn_params≈{total/1e9:.2f}B)print(f active_ffn_params/token≈{active_params/1e9:.2f}B\n)这个例子说明总容量可以随专家数上升但每 token 激活计算主要由 active experts 决定。真实模型还有共享层、attention、router、负载均衡等开销所以不能只看这一项。4. MoE 的难点路由和负载均衡如果 router 总是把 token 分给少数专家会出现两个问题热门专家过载冷门专家学不到东西。训练时要让路由既能选择合适专家又不能严重失衡。一个负载统计示例# Python 3.10fromcollectionsimportCounter assignments[0,1,1,1,2,1,3,1,2,1,0,0]num_experts4countsCounter(assignments)forexpertinrange(num_experts):print(expert,counts[expert])max_loadmax(counts.values())min_loadmin(counts[e]foreinrange(num_experts))print(load_ratio,round(max_load/max(min_load,1),2))负载不均在训练和推理都会出问题。训练时会造成专家利用不充分推理时热门专家可能成为瓶颈。MoE 的复杂度很多时候不在数学公式而在系统调度。5. MLA长上下文的瓶颈是 KV Cache自回归生成时模型会缓存历史 token 的 Key 和 Value。序列越长、并发越高KV Cache 越容易成为显存瓶颈。先估算普通 KV Cache# Python 3.10defkv_cache_gb(layers,seq_len,kv_heads,head_dim,bytes_per_value2):# Key 和 Value 两份缓存returnlayers*seq_len*kv_heads*head_dim*2*bytes_per_value/1024**3forseq_lenin[4096,32768,131072]:print(seq_len,f{kv_cache_gb(32,seq_len,8,128):.2f}GB)MLAMulti-head Latent Attention的直觉是不要为每个 token 都缓存完整展开后的 Key/Value而是缓存更紧凑的 latent 表示再在注意力计算中使用或恢复需要的信息。可以简化理解为c t W c h t c_t W_c h_tct​Wc​ht​其中h t h_tht​第t tt个 token 的 hidden stateW c W_cWc​压缩投影c t c_tct​更紧凑的 latent 表示。这不是 MLA 的完整实现只是它要解决的问题长上下文下缓存每个 token 的完整 KV 太贵所以要压缩缓存表示。6. MLA 的工程意义长上下文不是只看窗口长度如果一个模型支持很长上下文但 KV Cache 成本太高就会影响1. 单请求最大长度 2. 并发数量 3. 首 token 延迟 4. 显存占用 5. 推理服务成本 6. 多轮对话可承载历史。MLA 类方法的价值在于降低长上下文推理成本。但开发者评估时仍要看三层能力放得下上下文能输入 找得到关键证据能定位 用得对答案能基于证据不被干扰误导。不要把“KV Cache 更省”直接等同于“长文档问答更准”。长文档准确性仍需要 RAG、引用、评估和拒答边界。7. MTP训练时不只预测下一个 token普通语言模型训练目标是 next-token predictionP ( x t 1 ∣ x ≤ t ) P(x_{t1} \mid x_{\le t})P(xt1​∣x≤t​)MTPMulti-Token Prediction多 token 预测的直觉是训练时不只让模型预测下一个 token还让它预测更远的几个未来 token从而提供更密集的训练信号。例如给定快速排序的核心思想是普通目标可能只预测下一个 token“分”。MTP 辅助目标可能同时预测“分 / 治 / 和”。用代码构造多步标签# Python 3.10tokens[快速,排序,的,核心,思想,是,分,治,和,递归]max_future3foriinrange(len(tokens)):future[]forkinrange(1,max_future1):ifiklen(tokens):future.append(tokens[ik])print(tokens[i],-,future)这个例子说明 MTP 的训练信号更密集。但要注意训练时预测多个未来 token不等于推理时一定一次生成多个 token。它可以作为辅助目标帮助模型学习局部未来结构。8. 推理训练复杂任务不只是“回答风格”问题数学、代码、多步推理任务和普通对话不一样。模型需要分解问题生成中间步骤检查候选答案从多个解法中选择更好答案避免看起来合理但实际错误的推理在可验证任务上利用正确/错误反馈。SFT 可以教模型模仿推理格式但不一定能让它真的提高解题正确率。推理训练常常会结合偏好优化、强化学习、拒绝采样、可验证奖励等思路。下面用组内相对优势建立直觉。假设同一个问题采样了 4 个答案每个答案有奖励# Python 3.10rewards[0.2,0.9,0.4,0.1]mean_rewardsum(rewards)/len(rewards)advantages[r-mean_rewardforrinrewards]fori,(r,a)inenumerate(zip(rewards,advantages)):print(i,reward,r,relative_advantage,round(a,3))相对优势为正的答案比组内平均更好训练可以提高这类答案概率为负的答案则相对较差。真实算法会复杂得多但核心思想是不仅告诉模型标准答案还通过比较和奖励告诉它哪种推理更值得保留。9. 推理模型的成本答案更好也可能更慢推理能力增强常伴随更长输出、更高采样成本和更复杂评估。对业务来说要同时看质量和成本。指标为什么重要最终答案正确率推理任务核心指标中间步骤可靠性是否能帮助检查和调试输出长度影响延迟和费用过度思考比例简单问题是否输出过长自我纠错能力能否发现错误并修正安全边界推理能力强也不能越权单位成本收益每提升 1% 正确率付出多少成本比如简单客服 FAQ 不需要长链推理。推理模型可能回答更慢、更长反而影响体验。数学、代码、复杂规划、科研辅助等任务更可能受益。10. 如何评估 DeepSeek 或类似路线的模型建议按任务拆评估而不是只看综合分数学最终答案、步骤一致性、可验证题目正确率 代码单元测试通过率、API 真实性、patch 最小性 长文档证据定位、引用准确、抗干扰 普通问答是否简洁、是否过度推理 工具调用参数合法、权限正确、失败恢复 部署成本首 token、tokens/s、显存、并发、KV Cache 安全越权、危险请求、幻觉、误拒。一个评估结果不要只记 pass/fail最好记录失败原因{task_id:code_fix_042,category:code,passed:false,failure_reason:编造了不存在的 SDK 参数,output_tokens:1240,latency_ms:8300,needs_tool:true}这样才能判断模型问题是推理不够、事实检索不足、工具能力不足还是成本不可接受。11. 常见误区误区一MoE 总参数大所以推理一定同样贵。要区分总参数、激活参数、权重显存和通信成本。误区二激活参数少所以部署一定便宜。MoE 仍需要存储或分片所有专家专家通信和负载均衡也会带来成本。误区三MLA 省 KV Cache所以长文档问答一定更准。KV 成本和证据利用是两个问题仍要评估定位和引用。误区四MTP 训练能直接让推理一次吐多个 token。MTP 更常作为训练辅助信号理解推理形态要看具体实现。误区五推理模型适合所有任务。复杂任务受益简单任务可能被延迟、输出长度和成本拖累。误区六只看榜单就能选型。业务评估、部署成本、权限、安全和可维护性同样重要。12. 小结DeepSeek 系列给开发者的启发是用系统工程方式提升能力/成本比MoE 用稀疏激活扩大容量MLA 面向长上下文 KV Cache 压力MTP 提供更密集的训练信号推理训练让模型更擅长数学、代码和多步问题。这些技术都不是免费午餐它们把成本从一个地方转移到另一个地方路由、通信、训练目标、输出长度、评估和部署复杂度。学习这条路线重点不是背缩写而是能判断这个技术解决的瓶颈是不是我的瓶颈它带来的代价我能不能承受我的评估集能不能证明收益。大模型视角从大模型演进看单纯堆 dense 参数越来越昂贵未来竞争会更关注能力/成本比。稀疏激活、注意力缓存优化、多 token 训练信号和推理强化都是围绕这个目标展开。真正落地时模型能力、推理系统和评估体系必须一起设计。下一篇下一篇会讲 Mistral/Mixtral。我们会继续从高效架构角度理解滑动窗口注意力、GQA 和 MoE 专家混合模型的取舍。
RELATED

相关推荐

战略前瞻是个伪命题,匹配未来才是真功夫

战略前瞻是个伪命题,匹配未来才是真功夫

《战略前瞻是个伪命题,匹配未来才是真功夫》——最危险的不是看不见未来,而是用错了看未来的望远镜未来不是迷雾,是方法本身在决定你能看到多少。先讲一个常见的场面。年底战略会,投影仪上是三十页趋势报告,四个情景故…

📅 2026/10/8 21:50:44
手搓生产级 AI Agent 系统(25):MCP 全链路落地前的架构梳理

手搓生产级 AI Agent 系统(25):MCP 全链路落地前的架构梳理

在构建生产级 AI Agent 的进程中,工具调用与外部数据源集成始终是核心挑战。MCP(Model Context Protocol)作为开放协议,试图通过统一标准降低 LLM 与工具、数据源之间的接入成本。本篇作为系列第 25 篇,不重复具体代码…

📅 2026/10/8 21:50:43
AI Agent Skills 实战指南:从安装配置到开发管理的完整路径

AI Agent Skills 实战指南:从安装配置到开发管理的完整路径

1. 从“skills”这个热词说起:它到底指什么最近一段时间,不管是在技术社区还是各类开发者群组里,“skills”这个词出现的频率高得离谱。很多人第一次看到它,会以为是某个新出的编程语言特性,或者某个框架的插件系统。但…

📅 2026/10/8 21:45:43
MORE NEWS

更多资讯

📰

模型服务规模化:调度、KV Cache 与资源池化的系统之道

SOSP 的 Session 1A 开场就是 Model Serving at Scale,这个安排本身就很能说明问题。这几年我和团队一直在做 LLM 推理服务化,眼看着这个方向从"AI 实验室里的小工具"变成了"真正意义上的系统软件"——调度、缓存、资源池化、故障恢…

📰

AI日报制作全攻略:从信息筛选到判断力训练的实操指南

1. 一份“AI 日报”到底在记录什么每天早上打开电脑,我做的第一件事不是看邮件,而是花二十分钟把过去二十四小时里跟人工智能相关的动态过一遍。这个习惯坚持了快三年,从最开始只是随手记在备忘录里,到后来形成固定格式的日报&…

📰

CodeX 开启 Image Gen 生图功能:config.toml 里 model_providers.custom 怎么配到 TaoToken

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

pstack 合并安全机制:为什么 SHA 一过期就拒绝合并?

pstack 合并安全机制:为什么 SHA 一过期就拒绝合并? 【免费下载链接】pstack-claude Claude Code, Codex, Copilot, Pi, OpenCode, Gemini, and Prime Agent versions of Potetos pstack. Rigorous agent workflows with Cursor primitives translated f…

📰

光通信互联市场重构:数据中心光纤跳线选型与供应模式解析

数据中心机房扩建、企业园区网络改造以及高密算力集群的部署,将物理层布线推向了高频迭代周期。在采购决策过程中,网络工程师与采购团队往往试图通过检索各类口碑清单获取供应商参考。光通信布线涉及单模长距、多模短距互联以及高密MTP/MPO主干等多样化场…

📰

工业视觉选型指南:主流全局曝光高速摄像头路线多维对比

在工业机器视觉、无人驾驶辅助、AI识别及自动化机器人等业务线中,图像采集部件的性能直接影响整套系统的数据分析精度。多数设备制造商在评估全局曝光高速摄像头时,常面临同样的困局:账面参数高度雷同,但在实际设备内置适配与个性…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬