尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
page KV-tail浪费核Prefix命中粒度
这两个概念都与大模型推理框架如 vLLM、SGLang在用分页管理PagedAttention分配显存时的“页/块Block大小”密切相关。1. Tail 浪费少减少尾部内部碎片背景显存是以固定大小的Block内存页分配的比如一个 Block 规定存 16 个或 64 个 Token 的 KV Cache。什么是 Tail 浪费用户的 Prompt 长度很难刚好是 Block 大小的整数倍。举个例子假设一个 Block 存64 个 Token。如果用户的请求正好是65 个 Token框架就必须分配2 个 Block总共能存 128 个 Token。此时第 2 个 Block 里只装了 1 个 Token剩下的 63 个 Token 存储空间就被空置浪费了。这种序列末尾没装满的 Block 造成的空间闲置就叫Tail 浪费尾部碎片。“少”的意思如果把 Block 设得更小如 16 个 Token或者使用了MLA使得单 Token 占用的字节数极小那么最后一个 Block 就算没装满浪费的绝对字节数也极微小显存利用率大幅提升。2. Prefix 命中粒度细更精细的前缀缓存复用背景Prefix Caching前缀缓存的作用是让不同请求复用相同的 Prompt比如 System Prompt、提示词模板或多轮对话历史避免重复计算。原理框架通常以 Block 为单位去做哈希对比只有整个 Block 内的数据完全一致才能算“命中缓存”。粒度粗 vs 粒度细粒度粗如 Block 64两个请求的前 63 个 Token 完全一样但第 64 个 Token 不同。因为凑不齐一整个 64 尺寸的 Block这 63 个 Token完全无法复用缓存命中率为 0。粒度细如 Block 16甚至 Token 级前 63 个 Token 一样就能直接打卡命中 3 个完整的 16-Token Block前 48 个 Token 完全复用。核心优势命中粒度越细系统对各种微小差异、短 Prompt 复用的灵敏度就越高Prefix Cache 的总体命中率和首字延迟TTFT优化就越显著。
RELATED

相关推荐

传统Attention VS deepseek MLA

传统Attention VS deepseek MLA

普通 Attention(MHA/GQA)与 MLA(Multi-head Latent Attention)的核心差异在于 KV Cache 的存储与表达形态。标准 Attention 选择按头显式平铺存储 K/VK/VK/V 向量,而 MLA 通过“低秩联合压缩 RoPE 解耦”将 KV Cache …

📅 2026/10/3 11:02:02
FlashDecoding面经-vivj啥关系 vi就是原来的O呗 用LSE是为了防止溢出吗

FlashDecoding面经-vivj啥关系 vi就是原来的O呗 用LSE是为了防止溢出吗

你的这两个直觉全部通透了,完全点到了核心!一、 ViV_iVi​ 和 VjV_jVj​ 啥关系? 这里的 iii 和 jjj 代表了完全不同的两个层级: jjj 代表 Token 层级:VjV_jVj​(或 vjv_jvj​)是当前分块内部第…

📅 2026/10/3 11:02:02
企业级Palworld服务器容器化部署:5种架构方案与生产环境最佳实践

企业级Palworld服务器容器化部署:5种架构方案与生产环境最佳实践

企业级Palworld服务器容器化部署:5种架构方案与生产环境最佳实践 【免费下载链接】palworld-server-docker A Docker Container to easily run a Palworld dedicated server. 项目地址: https://gitcode.com/gh_mirrors/pa/palworld-server-docker Palworld专…

📅 2026/9/8 7:36:18
MORE NEWS

更多资讯

📰

思腾昇腾服务器大模型部署实战:从NPU到MindIE的完整链路

前阵子帮一个做AI应用的朋友折腾算力平台,他买了台思腾装的昇腾服务器,结果用习惯CUDA生态的人第一次上手NPU,连环境都装不利索。我们俩连麦调了两天半,从驱动版本、固件版本到CANN的安装顺序,把网上零散的文档翻了个遍…

📰

昇腾AI芯片技术路线图深度解析:从达芬奇架构到训练推理落地

昇腾的技术路线图被曝出“提前量产”之后,我朋友圈里搞AI Infra的朋友又开始刷屏了。做训练的人关心下一代卡能装多大的模型,做推理的人关心低精度算力还能不能再拉一截,最急的其实是负责技术选型的人,直接跑来问我:“…

📰

FDTD反射率仿真全流程:从材料导入到曲线分析的完整实操指南

上个月帮一位做光伏镀膜的兄弟排查反射率曲线异常,模型结构和光源设置看起来都没毛病,可结果就是跟实验对不上。折腾了两天,最后发现是材料折射率虚部在导入时少了一位小数。这种问题在FDTD(时域有限差分)仿真里太常见…

📰

Jev模型实测:本地部署、Codex集成与代码数据场景深度解析

1. 火的是名字,还是背后的东西:先拆清楚 Jev 到底是什么最近不管是技术交流群、朋友圈还是短视频信息流,都在刷同一个名字:Jev。连带着"Jev 模型官网""Jev 模型申请""Jev 本地部署""Jev 在 Co…

📰

UDS诊断0x11服务深度解析:ECU复位从时序到安全的工程实战

做UDS诊断开发这几年,我踩过最大的一个坑就是在刷写流程最后一步——ECU没反应了,诊断仪一直卡在“正在复位”的界面。后来排查了半天,问题居然出在0x11服务(ECUReset)的时序处理上:复位指令发出去了&#…

📰

从零手写MCP服务:用自然语言处理Excel数据实战

1. 为什么我要自己动手写一个 MCP1.1 从一次崩溃的 Excel 处理说起上个月帮朋友处理一批销售数据,二十多个 Excel 文件,每个文件里都有七八张表,需要按区域拆分、按月份汇总、再统一生成一份带图表的分析报告。我一开始想的是老办法——写个 …

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬