尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
大模型测评DeepEval快速入门-RAG指标详解
文章目录3. RAG 指标详解3.1. Answer Relevancy答案相关性3.1.1. 指标定义与评分逻辑3.1.2. 适用场景3.1.3. 参数说明3.1.4. 完整可运行示例3.1.5. 运行结果与分数解读3.1.6. 常见问题与调优3.2. Faithfulness忠实度3.2.1. 指标定义与评分逻辑3.2.2. 与 Hallucination 指标的区别3.2.3. 参数说明3.2.4. 完整可运行示例3.2.5. 运行结果与分数解读3.3. Contextual Relevancy上下文相关性3.3.1. 指标定义与评分逻辑3.3.2. 完整可运行示例3.3.3. 分数解读3.4. Contextual Recall上下文召回率3.4.1. 指标定义与评分逻辑3.4.2. 完整可运行示例3.5. Contextual Precision上下文精确度3.5.1. 指标定义与评分逻辑3.5.2. 完整可运行示例3.6. 五指标联合使用3.6.1. 推荐组合策略3.6.2. 完整联合评估代码3.7. 小结3. RAG 指标详解文档基于 DeepEval v4.1.0 编写来源https://deepeval.com/docs/metrics-answer-relevancy 等指标评估对象评分公式需要参数参考基准Answer Relevancy生成器相关语句数 / 总语句数input actual_output无参考Faithfulness生成器真实声明数 / 总声明数input actual_output retrieval_context无参考Contextual Relevancy检索器相关语句数 / 总语句数input actual_output retrieval_context无参考Contextual Recall检索器可归因语句数 / 总语句数input actual_output expected_output retrieval_context有参考Contextual Precision检索器加权累计精度input actual_output expected_output retrieval_context有参考3.1. Answer Relevancy答案相关性3.1.1. 指标定义与评分逻辑Answer Relevancy 衡量的是 LLM 生成的actual_output与用户input之间的相关程度。它的评分逻辑是用 LLM 从actual_output中提取所有陈述语句判断每条陈述是否与input相关分数 相关陈述数 / 总陈述数注意高分只说明答案切题不保证事实正确。要检测幻觉需要配合 Faithfulness 指标。3.1.2. 适用场景场景是否适用说明RAG 应用推荐评估生成器是否回答用户问题聊天机器人推荐检测是否跑题摘要生成不适用摘要场景用 SummarizationMetric安全检测不适用用 Bias/Toxicity 指标3.1.3. 参数说明参数名类型必填默认值说明thresholdfloat否0.5通过阈值分数 threshold 才算通过modelstr/DeepEvalBaseLLM否gpt-5.4评估用 LLMinclude_reasonbool否True是否输出评分原因strict_modebool否False严格模式只有满分 1.0 才通过async_modebool否True是否异步执行verbose_modebool否False是否打印中间步骤evaluation_templateclass否AnswerRelevancyTemplate自定义评估模板3.1.4. 完整可运行示例# 来源: https://deepeval.com/docs/metrics-answer-relevancy# 导入评估模块fromdeepevalimportevaluatefromdeepeval.metricsimportAnswerRelevancyMetricfromdeepeval.test_caseimportLLMTestCase# 创建评估指标metricAnswerRelevancyMetric(threshold0.7,# 通过阈值modelgpt-4.1,# 评估用 LLMinclude_reasonTrue,# 输出评分原因verbose_modeFalse# 是否打印中间步骤)# 创建测试用例test_caseLLMTestCase(input如果鞋子不合脚怎么办,# 用户问题actual_output我们提供 30 天全额退款无需额外费用。# LLM 实际输出)# 运行评估evaluate(test_cases[test_case],metrics[metric])3.1.5. 运行结果与分数解读# 运行上面代码后输出类似 Test Case 1: Metric: Answer Relevancy Score: 0.92 Threshold: 0.7 Success: True Reason: The actual output is highly relevant to the input about shoe returns. All statements directly address the return policy question.分数区间含义建议0.9 ~ 1.0高度相关答案精准切题优秀0.7 ~ 0.9基本相关可能有少量冗余良好0.5 ~ 0.7部分相关存在较多无关内容需优化 prompt0.0 ~ 0.5严重偏离主题检查生成逻辑3.1.6. 常见问题与调优常见错误Answer Relevancy 高不代表答案正确。一个回答可以完全切题但内容全是编造的。必须配合 Faithfulness 指标使用。# 来源: https://deepeval.com/docs/metrics-answer-relevancy#customize-your-template# 自定义评估模板示例fromdeepeval.metricsimportAnswerRelevancyMetricfromdeepeval.metrics.answer_relevancyimportAnswerRelevancyTemplateclassCustomTemplate(AnswerRelevancyTemplate):staticmethoddefgenerate_statements(actual_output:str):returnfGiven the text, breakdown and generate a list of statements presented. Example: Our new laptop model features a high-resolution Retina display for crystal-clear visuals. {{ statements: [ The new laptop model has a high-resolution Retina display. ] }} END OF EXAMPLE Text:{actual_output}JSON: # 注入自定义模板metricAnswerRelevancyMetric(evaluation_templateCustomTemplate)metric.measure(test_case)print(f自定义模板评分:{metric.score})3.2. Faithfulness忠实度3.2.1. 指标定义与评分逻辑Faithfulness 衡量 LLM 的actual_output是否与retrieval_context检索到的上下文事实一致。它的评分逻辑是用 LLM 从actual_output中提取所有声明判断每条声明是否与retrieval_context中的事实一致不矛盾分数 真实声明数 / 总声明数注意Faithfulness 关注的是输出是否与检索上下文一致而不是与 ground truth 一致。如果检索上下文本身就有错误忠实度分数可能很高但实际输出是错误的——这就是 garbage in, garbage out。3.2.2. 与 Hallucination 指标的区别特性FaithfulnessHallucination参考源retrieval_context检索到的上下文context标注的 ground truth使用场景RAG 管线运行时评估有标注数据时使用评估对象生成器输出是否忠于检索结果输出是否与标准答案一致是否参考基准否无参考是有参考3.2.3. 参数说明参数名类型必填默认值说明thresholdfloat否0.5通过阈值modelstr/DeepEvalBaseLLM否gpt-5.4评估用 LLMinclude_reasonbool否True是否输出评分原因strict_modebool否False严格模式async_modebool否True是否异步执行verbose_modebool否False是否打印中间步骤truths_extraction_limitint否None限制提取的真相数量penalize_ambiguous_claimsbool否False是否惩罚模糊声明3.2.4. 完整可运行示例# 来源: https://deepeval.com/docs/metrics-faithfulness# 导入评估模块fromdeepevalimportevaluatefromdeepeval.test_caseimportLLMTestCasefromdeepeval.metricsimportFaithfulnessMetric# 准备测试数据actual_output我们提供 30 天全额退款无需额外费用。retrieval_context[所有客户享有 30 天全额退款保障。]# 创建评估指标metricFaithfulnessMetric(threshold0.7,modelgpt-4.1,include_reasonTrue)# 创建测试用例test_caseLLMTestCase(input如果鞋子不合脚怎么办,actual_outputactual_output,retrieval_contextretrieval_context)# 运行评估evaluate(test_cases[test_case],metrics[metric])3.2.5. 运行结果与分数解读# 运行上面代码后输出类似 Test Case 1: Metric: Faithfulness Score: 0.95 Threshold: 0.7 Success: True Reason: The output is highly faithful to the retrieval context. All claims can be verified against the provided context.# 对比检索上下文有误导但输出忠实的情况test_caseLLMTestCase(input退货政策是什么,actual_output我们提供 60 天全额退款。,# 注意上下文说的是 30 天retrieval_context[所有客户享有 30 天全额退款保障。])faithfulnessFaithfulnessMetric(threshold0.7)faithfulness.measure(test_case)print(fFaithfulness 分数:{faithfulness.score})# 低分因为上下文只有 30 天print(f原因:{faithfulness.reason})# 运行上面代码后输出类似 Faithfulness 分数: 0.0 原因: The claim 60 天全额退款 contradicts the retrieval context which states 30 天全额退款保障.3.3. Contextual Relevancy上下文相关性3.3.1. 指标定义与评分逻辑Contextual Relevancy 衡量检索到的retrieval_context与用户input的整体相关性。它关注的是检索到的文档中有多少是真正有用的有多少是噪音。评分逻辑分数 相关语句数 / 总语句数。LLM 先从retrieval_context中提取所有语句再判断每条是否与input相关。3.3.2. 完整可运行示例# 来源: https://deepeval.com/docs/metrics-contextual-relevancyfromdeepevalimportevaluatefromdeepeval.test_caseimportLLMTestCasefromdeepeval.metricsimportContextualRelevancyMetric# 模拟检索返回了 3 条文档其中 1 条不相关retrieval_context[所有客户享有 30 天全额退款保障。,# 相关退款需在购买后 30 天内申请。,# 相关我们的仓库位于深圳支持全国配送。,# 不相关噪音]metricContextualRelevancyMetric(threshold0.7,modelgpt-4.1,include_reasonTrue)test_caseLLMTestCase(input退货政策是什么,actual_output我们提供 30 天全额退款。,retrieval_contextretrieval_context)evaluate(test_cases[test_case],metrics[metric])# 运行上面代码后输出类似 Test Case 1: Metric: Contextual Relevancy Score: 0.67 Threshold: 0.7 Success: False Reason: 2 out of 3 statements in the retrieval context are relevant to the input. The warehouse location statement is irrelevant.3.3.3. 分数解读分数含义调优方向低分检索结果中噪音过多降低 top-K、缩小 chunk size、优化 embedding高分检索结果精准保持现有配置3.4. Contextual Recall上下文召回率3.4.1. 指标定义与评分逻辑Contextual Recall 衡量的是对于理想的expected_outputretrieval_context中包含了多少必要信息。它关注的是“有没有漏掉关键信息”。评分逻辑先从expected_output中提取所有语句再判断每条是否能在retrieval_context中找到支撑。注意Recall 使用expected_output期望输出而不是actual_output实际输出因为要衡量的是检索系统是否取回了生成理想答案所需的所有信息。3.4.2. 完整可运行示例# 来源: https://deepeval.com/docs/metrics-contextual-recallfromdeepevalimportevaluatefromdeepeval.test_caseimportLLMTestCasefromdeepeval.metricsimportContextualRecallMetric# 模拟检索上下文缺少了部分信息retrieval_context[所有客户享有 30 天全额退款保障。,# 缺少了退款需在 30 天内申请这条信息]metricContextualRecallMetric(threshold0.7,modelgpt-4.1,include_reasonTrue)test_caseLLMTestCase(input退货政策是什么,actual_output我们提供 30 天全额退款。,expected_output客户享有 30 天全额退款保障退款需在购买后 30 天内申请。,retrieval_contextretrieval_context)evaluate(test_cases[test_case],metrics[metric])# 运行上面代码后输出类似 Test Case 1: Metric: Contextual Recall Score: 0.50 Threshold: 0.7 Success: False Reason: 1 out of 2 statements in the expected output can be attributed to the retrieval context. The 30 天内申请 detail is missing.3.5. Contextual Precision上下文精确度3.5.1. 指标定义与评分逻辑Contextual Precision 衡量的是在retrieval_context中相关节点是否排在无关节点前面。它关注的是“排序是否合理”。评分逻辑使用加权累计精度Weighted Cumulative Precision越靠前的节点权重越大。相关节点排在前面得分高埋在噪音后面得分低。3.5.2. 完整可运行示例# 来源: https://deepeval.com/docs/metrics-contextual-precisionfromdeepevalimportevaluatefromdeepeval.test_caseimportLLMTestCasefromdeepeval.metricsimportContextualPrecisionMetric# 模拟相关文档排在后面无关文档排在前面retrieval_context[我们的仓库位于深圳支持全国配送。,# 不相关排在第一位所有客户享有 30 天全额退款保障。,# 相关退款需在购买后 30 天内申请。,# 相关]metricContextualPrecisionMetric(threshold0.7,modelgpt-4.1,include_reasonTrue)test_caseLLMTestCase(input退货政策是什么,actual_output我们提供 30 天全额退款。,expected_output客户享有 30 天全额退款保障退款需在购买后 30 天内申请。,retrieval_contextretrieval_context)evaluate(test_cases[test_case],metrics[metric])# 运行上面代码后输出类似 Test Case 1: Metric: Contextual Precision Score: 0.55 Threshold: 0.7 Success: False Reason: Relevant nodes are not ranked optimally. The first node is irrelevant, lowering the weighted cumulative precision score.3.6. 五指标联合使用3.6.1. 推荐组合策略场景推荐指标组合说明快速验证Answer Relevancy Faithfulness先测生成器质量全面评估全部 5 个指标生成器 检索器全覆盖检索器调试Contextual Relevancy Recall Precision聚焦检索质量生产监控Faithfulness Answer Relevancy无参考指标无需标注数据3.6.2. 完整联合评估代码# 来源: https://deepeval.com/docs/metrics-introduction# 五指标联合评估fromdeepevalimportevaluatefromdeepeval.test_caseimportLLMTestCasefromdeepeval.metricsimport(AnswerRelevancyMetric,FaithfulnessMetric,ContextualRelevancyMetric,ContextualRecallMetric,ContextualPrecisionMetric,)# 准备测试数据test_caseLLMTestCase(input退货政策是什么,actual_output我们提供 30 天全额退款退款需在购买后 30 天内申请。,expected_output客户享有 30 天全额退款保障退款需在购买后 30 天内申请。,retrieval_context[所有客户享有 30 天全额退款保障。,退款需在购买后 30 天内申请。,])# 全部 5 个 RAG 指标metrics[AnswerRelevancyMetric(threshold0.7),FaithfulnessMetric(threshold0.7),ContextualRelevancyMetric(threshold0.7),ContextualRecallMetric(threshold0.7),ContextualPrecisionMetric(threshold0.7),]# 运行联合评估resultsevaluate(test_cases[test_case],metricsmetrics)# 汇总结果print(\n*50)print(RAG 联合评估结果汇总)print(*50)forresultinresults:status通过ifresult.successelse未通过print(f{status}{result.metric_name}:{result.score:.2f})# 运行上面代码后输出类似 RAG 联合评估结果汇总 通过 Answer Relevancy: 0.92 通过 Faithfulness: 0.95 通过 Contextual Relevancy: 0.88 通过 Contextual Recall: 0.80 通过 Contextual Precision: 0.853.7. 小结Answer Relevancy衡量答案是否切题分数 0~1建议阈值 0.7。无参考指标仅需 input actual_outputFaithfulness衡量答案是否忠于检索上下文是检测幻觉的核心指标。无参考指标需要 retrieval_contextContextual Relevancy衡量检索结果中噪音比例低分说明检索精度不足 → 降低 top-KContextual Recall衡量检索是否遗漏关键信息低分说明检索不全 → 增大 top-K 或换 embedding 模型Contextual Precision衡量相关节点排序是否靠前低分说明排序算法需要优化 → 调整 re-ranker推荐组合Faithfulness Answer Relevancy生成器 Contextual Relevancy检索器 最小覆盖
RELATED

相关推荐

从裸机到RTOS:DSP/BIOS实时调度与性能分析实战

从裸机到RTOS:DSP/BIOS实时调度与性能分析实战

1. 项目概述:从裸机循环到实时调度系统的演进 在嵌入式数字信号处理(DSP)开发领域,尤其是面对音频流、通信基带或电机控制这类对时序有严苛要求的应用时,开发者常常面临一个核心矛盾:如何在资源受限的处理器…

📅 2026/9/12 6:03:13
嵌入式DSP硬件安全机制深度解析:从隔离原理到C674x安全世界实践

嵌入式DSP硬件安全机制深度解析:从隔离原理到C674x安全世界实践

1. 项目概述:为什么嵌入式DSP需要“安全世界”? 在物联网终端、工业控制器或者手持支付设备里跑着的嵌入式处理器,它们干的活越来越“要命”。以前可能只是算算数据、控制一下电机,现在则要处理用户的支付密码、设备的唯一身份证书…

📅 2026/9/12 6:03:42
从VC5502到C5517:DSP硬件迁移实战与核心差异解析

从VC5502到C5517:DSP硬件迁移实战与核心差异解析

1. 项目概述:从VC5502到C5517的硬件迁移之路在嵌入式DSP系统开发中,产品迭代和性能升级是常态。当老旧的TMS320VC5502(以下简称VC5502)面临停产、供货紧张或性能瓶颈时,寻找一个功能相似但更强大、更具前瞻性的替代品就…

📅 2026/8/23 0:35:44
MORE NEWS

更多资讯

📰

Odoo 19库存期初导入实战指南与优化技巧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

营销技能不是玄学:从技术动作到可验证结果的实战路径

我无法根据当前输入生成符合要求的博文。原因如下:项目标题“marketingskills”仅为一个宽泛的英文词汇组合,未体现具体项目、技术动作、实操场景或明确问题指向;项目正文为空;关键词为空;摘要描述为空;所谓…

📰

COMSOL与MATLAB联合实现岩石多裂隙损伤耦合建模

1. 岩石多裂隙损伤耦合模型的研究背景与工程意义在地下工程、石油开采和地热开发等领域,岩石多裂隙系统的力学行为研究一直是核心课题。传统连续介质力学方法在模拟裂隙网络时存在明显局限,难以准确描述裂隙的萌生、扩展和相互作用过程。而基于COMSOL平台…

📰

批量导出文档的工业化流水线:绕过Word卡顿与PDF解析陷阱

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

VINS-Mono注释包实战指南:IMU预积分、边缘化与逆深度调试

简介:本资源是VINS-Mono单目视觉惯性导航系统核心源码的深度注释版,面向SLAM方向的研究者、机器人/无人机定位算法工程师及高校高年级本科生与研究生,旨在降低VINS-Mono这一经典VI-SLAM框架的理解与复现门槛。压缩包共164个文件,涵…

📰

PostHog MCP Tools 实现指南:从 YAML 定义到代码生成的完整流水线

PostHog MCP Tools 实现指南:从 YAML 定义到代码生成的完整流水线 【免费下载链接】posthog :hedgehog: PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, exper…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬