尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
最快MLA内核背后的秘密:TokenSpeed如何在Blackwell上征服Agentic推理
最快MLA内核背后的秘密TokenSpeed如何在Blackwell上征服Agentic推理【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed是一个面向Agentic 推理工作负载的光速 LLM 推理引擎其核心亮点之一是在 NVIDIA Blackwell 上实现了业界最快的MLAMulti-head Latent Attention多头潜在注意力内核。本文带你揭秘这套 MLA 内核凭什么在 Agentic 场景高并发、短步长解码、极低的 next-token 延迟要求中拉开差距以及它背后的三个关键优化技巧。一、为什么MLA内核是Agentic推理的核心战场Agentic智能体负载有两个鲜明特征高频、短解码编码类 Agent 不断发起短 prompt、短输出的请求每一步 decode 的延迟都直接影响思考速度超长 KV 缓存Agent 对话动辄积累 64K~80K token 的历史上下文decode 阶段要反复扫描巨大的 KV cache。MLA 通过把 K/V 压进低秩潜在空间大幅降低了 KV cache 的显存占用——这正是 DeepSeek、Kimi 这类旗舰模型普遍采用它的原因。但省显存之后MLA 注意力内核本身的速度就成了瓶颈。TokenSpeed 的 tokenspeed-mla/ 子项目专为 BlackwellSM100/SM103/SM107即 B200/GB300 一代打磨了完整的 MLA 内核家族内核作用源码位置tokenspeed_mla_prefill变长 ragged prefill无 paddingtokenspeed-mla/python/tokenspeed_mla/mla_prefill.pytokenspeed_mla_decodeFP16/BF16/FP8 三路 decodeSplit-KV 自动 workspacetokenspeed-mla/python/tokenspeed_mla/mla_decode.pymla_kv_pack_quantize_fp8融合的 K/V 打包 FP8 量化 Triton 内核tokenspeed-mla/python/tokenspeed_mla/mla_kv_pack_quantize_fp8.py二、秘密 ①两内核 Split-KV 架构——把长序列拆给整个 GPU主流方案的 MLA decode 常用单内核 swap-AB策略当 KV 序列很长时每个线程块要串行扫完全部 80K 个 keyGPU 大量 SM 空闲等待。TokenSpeed 的 decode 内核采用双内核流水线第一个内核按split_kv把 KV 序列切成多段各线程块并行计算局部注意力partial output LSE第二个内核对分段部分结果做归约合并。split_kv与 workspace 大小由运行时根据batch_size、q_len、max_seq_len自动推导并缓存见 mla_decode.py 中的_get_split_kv_and_workspace_size用户无需手动调参。效果立竿见影测试条件q_len4KV 长 80KFP8以num_heads32为例batch4 时 TensorRT-LLM 需要 176.8μsTokenSpeed 仅 49.5μs约3.6×到 batch16 时差距扩大到 652.9μs vs 148.1μs约4.4×。橙色薄片是归约内核的开销——占比极小说明双内核设计几乎没有额外代价。三、秘密 ②query-token 折叠——消灭小 batch 的 tile 浪费Agentic 场景的 decode 常常是q_len4、num_heads16/32/64这样又小又碎的形状。矩阵乘法单元MMA偏好 M 维度接近 128 的 tile但小 head 数会严重浪费算力。TokenSpeed 的解法是fold_sq_factor折叠实现见 mla_helpers.py运行时找出最大的因子F满足q_len % F 0且num_heads × F ≤ 128把F个 query token 折叠进 head 维度等效形状变为H_eff num_heads × Fq_len_eff q_len / F。举个例子num_heads64, q_len4时取F2——两个 query token 被折叠进 M 维H_eff128tile 刚好填满剩余 query 组交给调度器第二维处理。仅这一个变换就让 M 维度利用率接近 100%正是 token 级 agent 流量的甜点。四、秘密 ③Blackwell 微架构级调优清单除了算法层设计内核还针对 Blackwell 硬件做了一批显微镜下的优化见 tokenspeed-mla/README.md 的 Kernel Capability Summary2-CTA UTCMMA 指令两个线程块协同执行一条 MMA直接砍半 shared memory 占用最少 mbarrier降低同步屏障数量减少 warp 间等待K/V 加载 warp 拆分K 加载完成后 V 已在 L2 缓存下一个 tile 的 K 加载不必等 V 加载完天然隐藏访存延迟epilogue 多阶段 STG 子切片把输出写回切成多个 sub-tile 流水执行FP8 部分结果归约reducer 按 M128/M64 路径选择 1/2/4 个 D512 输出波段避免单元素加载这类隐形开销编译缓存内核以静态配置dtype、d_qk、d_v、causal、LSE 等为 key 缓存 JIT 编译结果避免重复编译拖慢服务启动。Prefill 侧同样可观——开源版 CuTe DSL JIT 实现无 padding 的 ragged varlen在中等序列长度上与 TensorRT-LLM 打平甚至反超长序列场景差距在 3% 以内五、从内核到吞吐Agentic负载下的系统级收益MLA 内核再快也要落到端到端吞吐上才算数。TokenSpeed 把内核、C 有限状态机调度和 KV cache 复用整合成完整引擎在 Kimi K2.5B200上的 Agentic 工作负载基准中在 Agent 实际运行的高吞吐区间持续领先 TensorRT-LLM四张图分别对应 Attn TP4/TP8 × MoE TP/EP 四种并行配置。注意曲线交点右侧——正是高并发 Agent 流量所在的区域TokenSpeed 的千 token/分钟·GPU吞吐全程压过对手。六、上手指南如何跑起来环境要求SM100/SM103/SM107 的 Blackwell GPUSM107 需 CuTe DSL ≥ 4.8.0 及匹配的 CUDA 工具链调用 decode传入query [B, q_len, H, D_qk]、kv_cache [num_pages, page_size, D_total]与block_tables即可split_kv/workspace 全自动完整签名见 README.md 的 Minimal Usage 一节复现性能数据仓库内置了基准脚本例如python ./tokenspeed-mla/python/tokenspeed_mla/mla_decode_fp8.py --batch_size 4 --num_heads 16 ...回归测试PYTHONPATHtokenspeed-mla/python python -m pytest -q tokenspeed-mla/tests/test_mla_decode.py覆盖 packed-query 几何、split-KV 尺寸、FP8/FP16/BF16 输出与 LSE、CUDA Graph 回放、滑动窗口等test_mla_decode.py。总结TokenSpeed 征服 Blackwell 上 Agentic 推理的秘诀并不神秘而是三层优化的叠加️架构层双内核 Split-KV 把 80K 长上下文喂饱整块 GPU调度层query-token 折叠让 MMA tile 在小 batch 下也不浪费⚙️微架构层2-CTA MMA、拆分加载 warp、L2 命中调序等 Blackwell 专属打磨。最终成绩decode 延迟 2~4.4× 领先prefill 与最强闭源方案打平端到端 Agent 吞吐在高并发区间持续占优。对于正在生产环境跑 DeepSeek/Kimi 系 MLA 模型的团队这套内核值得重点关注。【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Agent开发:2026高薪风口,小白也能收藏入局,实现技术逆袭!

Agent开发:2026高薪风口,小白也能收藏入局,实现技术逆袭!

Agent开发是未来三年最值得普通人冲击的技术岗,门槛可控,缺口极大,薪资断层领先。它不是调参或写prompt,而是让AI自主思考、完成任务的后端进阶岗。企业级Agent开发涉及架构搭建、RAG知识库工程化、工具调用与系统对接、异常处理及…

📅 2026/10/8 18:29:24
2026 精选 Java 八股文及答案,全面覆盖,直击面试

2026 精选 Java 八股文及答案,全面覆盖,直击面试

伴随着互联网行业寒冬的到来,各大企业都不敢大肆招聘,都是选择收缩发展,加上程序员内部越来越卷,要求越来越高了,要想在 IT 行业继续发展进阶拿高薪的话,提升自己是必不可少的。 尤其是经历了前不久的裁员…

📅 2026/10/8 18:29:24
浮点数内存分布:C语言

浮点数内存分布:C语言

浮点数存储一、浮点数的三部分结构一个浮点数在内存中被拆成三段,从高位到低位依次排列:--------------------------------------------------------------------------- │S│ │ E │ │ M │------------------------…

📅 2026/10/8 18:29:24
MORE NEWS

更多资讯

📰

Infection Monkey 部署完全指南:从 AppImage、Docker、Windows 到云市场的 Monkey Island 搭建手册

网络安全应用安全 【免费下载链接】monkey Infection Monkey - An open-source adversary emulation platform 项目地址: https://gitcode.com/gh_mirrors/mo/monkey 点击查看 免费下载 本篇指南以 Infection Monkey 官方文档的 Setup 章节为主体,系统梳…

📰

Agora Flat v1.6.0 版本全解析:课件无感切换、Agora 登录与回放交互升级

音视频即时通讯教育前端桌面应用 【免费下载链接】flat Project flat is the Web, Windows and macOS client of Agora Flat open source classroom. 项目地址: https://gitcode.com/gh_mirrors/fl/flat 点击查看 免费下载 本文以 Agora Flat 开源教室项目 v1.6.0 …

📰

ALS1-Camera组件化相机系统:解决复杂动画下的镜头抖动与穿模

1. 从 ALS1-Camera 说起:一个被低估的相机组件扩展第一次看到ALS1-Camera这个命名,我脑子里蹦出来的第一反应是:这大概率是某个 Advanced Locomotion System 衍生项目里的相机模块。后来翻了一圈社区讨论和源码片段,基本印证了这个…

📰

AI编程智能体实战:从零搭建自动化开发流程与避坑指南

1. 为什么“AI 编程智能体”值得普通程序员认真对待1.1 从“写代码”到“指挥智能体写代码”的转变过去十几年,程序员的日常基本围绕三件事转:查文档、写代码、调 Bug。写代码这件事本身,占据了大量时间,尤其是重复性的 CRUD、接口…

📰

UE5 Coop联机开发指南:服务器权威与网络同步核心实践

第一次把单机Demo改造成Coop联机时,我被自己写的"合理逻辑"坑得睡不着。单机模式里,你在BeginPlay生成敌人、把门打开、掉落一把钥匙,所有事情都是确定的;可一旦项目设置里勾上多玩家,同样一段代码在房主、队…

📰

工业级电源路径保护:TPS259483AYWPR+STM32L152ZD硬核方案

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬