尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Kimi K3 都一百万 token 了,我说 RAG 可以拆了直接塞全文,面试官翻开推理账单:“塞一次多少钱?大海捞针还捞得着吗?”
面试日记 第 22 天面试官把手机推过来屏幕上是 Kimi K3 的发布稿。“一百万 token 上下文。”她看着我“你们那套 RAG是不是该进垃圾桶了”我说不急先把基础分拿了把 RAG 的两大阶段完整讲了一遍离线索引做知识入库清洗、切块、转向量、进 Milvus在线问答处理请求问题向量化、相似度检索、Rerank、拼进 Prompt 让模型生成。她点点头没追问流程把问题推了回来“流程你背得挺熟。那回答我刚才的问题——既然模型自己装得下一百万 token你们为什么还要维护向量库这一套”“其实我们已经不维护了。”我说“上个月就把 RAG 拆了文档直接塞全文。链路短不用调 top_k又快又省事。”她打开自己的笔记本转过来屏幕上是一份推理成本监控。“塞一次全文多少钱”我没答上来。“我替你算。”她指着账单“你们的知识库八十万 token按现在旗舰模型的输入价塞一次全文两块多。一天几千次问答每一轮都把八十万 token 重新塞一遍。省的是你的事费的是公司的钱。”她往下划了一屏是一条召回率曲线。“再看效果。大海捞针测试做过吗上下文塞到几十万 token模型对中间段落的命中率明显往下掉。文档虽然进了上下文关键时刻就是捞不出来。”我辩解“K3 不是号称长上下文很强吗”“强所以人家才把缓存命中做到九成以上。”她把发布稿里那行字圈出来“你猜为什么因为真在用长上下文的团队都在想办法复用已经塞过的内容、少做重复灌入——跟你说的每轮全量重塞恰恰是反的。”我握着笔半天只写出一句“那我把向量库装回来。”“先把题答完整。”她把电脑合上RAG 的完整流程是怎么样的这一次我答的不只是流程名还有每一步省的是什么钱、防的是什么坑。回答重点RAG 的核心就是“先搜后答”整个流程分成离线索引和在线问答两大阶段。离线索引阶段做的是知识入库1把原始文档清洗干净、切成 300-500 字的小块 2用嵌入模型把每个文本块转成向量 3向量存进 Milvus 这类向量数据库建好索引等着被搜在线问答阶段处理用户请求1用户提问进来先把问题也转成向量 2拿这个向量去数据库里做相似度检索捞出最相关的 5-10 个文档块 3对检索结果做重排序把最相关的排前面 4把用户问题和检索到的上下文一起塞给大模型让它基于这些材料生成回答整个流程的精髓在于大模型不再“裸奔”回答问题而是带着检索到的知识去生成既能减少幻觉又能让回答有据可查。扩展知识一百万上下文时代RAG 为什么反而省不掉先算成本账。八十万 token 的知识库按 K3 输入价 3 美元/百万 token 估算每轮问答全量塞入一次约 2.4 美元而走 RAG 每轮只送检索出的 5-10 个块、几千 token两者差着三个数量级。再算效果账大海捞针类测试普遍显示上下文拉长后模型对中间段落的召回会明显衰减“装得下”和“捞得着”是两回事。真正的反常识点在这里上下文窗口越大无脑塞全文越亏。K3 依托 Mooncake 分离式推理架构把编程场景的缓存命中率做到 90% 以上财新报道口径恰恰说明工程上的主力方向是复用已经塞过的上下文、避免重复灌入而不是取消检索。长上下文解决的是轮次之间重复内容的复用RAG 解决的是从百万级语料里选出这次该看的几千 token两者是分工谁也没替代谁。文档分块策略分块是 RAG 效果的关键块太大检索不精准块太小又丢失上下文。常见的三种切法1语义切分用 SemanticSplitter 这类工具保证每个块语义完整独立比如一个问答对不会被切成两半2结构切分HTML、PDF 这种有层级的文档按标题层级切割像 HTMLHeaderTextSplitter 就能保留文档结构3递归切分RecursiveCharacterTextSplitter 先按大的分隔符切切不动了再按小的切兼顾连贯性和长度限制实际项目里300-500 字一块是比较通用的起点具体要根据业务场景调。检索阶段的优化手段单纯靠向量检索其实不够用生产环境通常会做多路召回混合检索特别适合那种用户可能用专业术语搜索的场景纯向量检索容易漏掉精确匹配的结果。11464. 什么混合检索在基于大模型的应用开发中混合检索主要解决什么问题Prompt 组装技巧检索完拿到一堆文档块怎么塞给大模型也有讲究# 典型的 RAG Prompt 模板prompt基于以下参考资料回答用户问题。如果资料中没有相关信息请说明无法回答。 参考资料 {context} 用户问题{query} 回答上下文太长会影响模型效果超过 4000 token 的时候可以考虑做摘要压缩RAPTOR 这类树状摘要方案就是干这个的。面试官追问追问如果检索出来的文档和用户问题不太相关大模型生成的答案会怎样有什么办法缓解回答大模型会硬着头皮用这些不相关的内容去凑答案结果就是回答跑偏或者出现幻觉。缓解手段主要有三个 1加一个相关性打分的环节低于阈值的直接丢掉不给模型 2在 Prompt 里明确告诉模型“如果资料不相关就直接说不知道” 3用 Reranker 做二次排序把真正相关的顶上来追问向量检索和传统的关键词检索各有什么优缺点回答向量检索擅长语义理解用户说“怎么退款”能搜到“退货流程”这种同义词的文档但对精确匹配不敏感搜“iPhone 15”可能漏掉带这个精确词的文档。关键词检索正好反过来精确匹配很强但不懂语义“退款”搜不到“退货”。所以生产环境一般两个一起用取长补短。追问文档块之间有上下文依赖怎么办比如前一段说“它”指的是更前面的某个概念。回答这是分块策略的经典问题。常用的解法是加 overlap相邻的块之间重叠 50-100 字保证上下文不丢。更高级的做法是用 Parent-Child 结构检索的时候匹配小块返回给模型的时候带上它的父块这样既精准又有上下文。回去我把成本监控调出来重新看了一遍RAG 那套离线索引看着笨其实每轮只把最相关的几千 token 送进模型剩下的钱和注意力都省下来了。这道题容易被“上下文窗口”这个数字带偏窗口装得下不等于装得划算、看得过来。完整题解和原始追问已经整理在面试鸭准备大模型应用方向的同学可以顺手把 RAG 这一组题过一遍。
RELATED

相关推荐

Windows 常用命令大全:从入门到精通,提升效率必备

Windows 常用命令大全:从入门到精通,提升效率必备

前言无论是系统管理员、开发人员还是普通用户,掌握 Windows 命令行工具都能极大提升工作效率。本文系统整理了 Windows 系统中最常用、最实用的命令,涵盖文件管理、网络诊断、系统信息、进程服务等核心场景,助你从“小白”进阶为“高手”。一…

📅 2026/9/8 12:43:09
浅谈大数据项目的项目管理

浅谈大数据项目的项目管理

不知不觉间,毕业后从事大数据行业已有6年有余,如果算上大学的几年,从事IT行业已是第11个年头。近些日子,在复盘总结,总结最近几年来的一些模板文档,提炼为个人知识库;总结一些经验心得&#xff…

📅 2026/9/5 2:18:22
商场搞机器人快闪别只让人拍照:让顾客亲手遥控机器人打一局

商场搞机器人快闪别只让人拍照:让顾客亲手遥控机器人打一局

我见过最可惜的商场快闪,是活动结束后照片很好看,问到现场体验了多少人,大家却都答不上来。装置够大,灯光够亮,路人确实停过。可他们拍完照就走了,活动留下的是曝光,不是一次真正的参与。如果下…

📅 2026/8/23 17:21:29
MORE NEWS

更多资讯

📰

Storybook Test Runner 无障碍(a11y)测试配置实战:基于 axe 的 Hook 集成指南

Storybook Test Runner 无障碍(a11y)测试配置实战:基于 axe 的 Hook 集成指南 【免费下载链接】storybook Storybook is the industry standard workshop for building, documenting, and testing UI components in isolation 项目地址: ht…

📰

ZLUDA 实战:把未修改的 CUDA 程序直接跑在 AMD GPU 上

ZLUDA 实战:把未修改的 CUDA 程序直接跑在 AMD GPU 上 【免费下载链接】ZLUDA CUDA on non-NVIDIA GPUs 项目地址: https://gitcode.com/GitHub_Trending/zl/ZLUDA 用 CUDA 写好的程序只能在 N 卡上跑?ZLUDA 就是来解决这件事的:它是一…

📰

`mise plugins uninstall` 完全指南:移除插件、保留工具版本与 `--purge` 深度清理

mise plugins uninstall 完全指南:移除插件、保留工具版本与 --purge 深度清理 【免费下载链接】mise dev tools, env vars, task runner 项目地址: https://gitcode.com/GitHub_Trending/mi/mise mise plugins uninstall 是 mise 中用于移除已安装插件的命令…

📰

容器镜像加速实战指南:5分钟跑通国内镜像拉取

容器镜像加速实战指南:5分钟跑通国内镜像拉取 【免费下载链接】public-image-mirror 很多镜像都在国外。比如 gcr 。国内下载很慢,需要加速。致力于提供连接全世界的稳定可靠安全的容器镜像服务。 项目地址: https://gitcode.com/GitHub_Trending/pu/p…

📰

AI论文写作工具对比:千笔与SpeedAI实战评测

1. 项目背景与痛点分析本科阶段论文写作是每个学生必须经历的学术训练,但现实中存在几个普遍痛点:文献检索效率低、格式规范难以掌握、重复修改耗时耗力。根据2023年高校学术写作调研数据显示,82%的本科生在论文写作过程中经历过3次以上重大修…

📰

VueUse useUrlSearchParams 指南:在 Vue 3 应用中响应式读写 URL 查询参数

VueUse useUrlSearchParams 指南:在 Vue 3 应用中响应式读写 URL 查询参数 【免费下载链接】airi 💖🧸 Self hosted, you-owned Grok Companion, a container of souls of waifu, cyber livings to bring them into our worlds, wishing to a…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬