尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Agent评测 G-Eval论文分析
本文采用部分原文翻译个人结合AI解读的https://arxiv.org/pdf/2303.16634文章目录G-EVAL: NLG Evaluation using GPT-4 with Better Human AlignmentAbstract1. Introduction2. MethodPrompt for NLG EvaluationAuto Chain-of-Thoughts for NLG EvaluationScoring Function3. Experiments3.1 Implementation Details3.2 Benchmarks3.3 Baselines3.4 Results for Summarization3.5 Results for Dialogue Generation3.6 Results on Hallucinations4. AnalysisG-EVAL: NLG Evaluation using GPT-4 with Better Human Alignment一种拥有更人性化的自然语言生成评估方案AbstractNLGNatual Language Generation自然语言生成BLEUBilingual Evaluation Understudy2002年IBM提出的机器翻译评估指标核心思想是精确率→ \rightarrow→看生成的文本里有多少n-gram在参考文本中出现过局限只看词面匹配不管语义。“The cat sat on the mat” 和 “A kitten rested on the rug” 语义相同但 BLEU 接近 0ROUGERecall-Oriented Understudy for Gisting Evaluation2004年Lin提出的摘要评估指标族核心思想是召回率→ \rightarrow→看参考文本里有多少内容被生成文本覆盖了局限同样只看表面匹配对同义替换、句式重组不敏感文章摘要部分提出NLG系统生成的文本质量很难自动衡量。传统的基于参考答案的指标例如BLEU和ROUGE已被证明与人类判断的相关性相对较低尤其是对于需要创造性和多样性的任务。最近的研究表明使用LLM作为reference-free无参考答案的NLG评估指标其优势在于可应用于缺乏人工参考的新任务。摘要部分提出了一个反常识的转折基于LLM的评估器与人类的一致性低于中等规模的神经评估器说明神经网络大不等于好需要方法设计。文章提出了G-EVAL一种使用大语言模型配合CoT思维链和form-filling paradigm表单填充范式来评估NLG输出质量的框架。并在text summarization压缩性任务和dialogue generation创造性任务这两个生成任务上进行了试验。以gpt-4为骨干模型的g-eval在摘要任务上与人类的spearman相关性达到0.5140.5r0.8中度相关论文也强调了基于LLM的评估器可能对LLM生成文本存在偏见的潜在问题。1. Introduction细化摘要最后提出四点核心贡献LLM-based metrics generally outperform reference-based and reference-free baseline metrics in terms of correlation with human quality judgments, especially for open-ended and creative NLG tasks, such as dialogue response generation.LLM-based metrics are sensitive to the instructions and prompts, and chain-of-thought can improve the performance of LLM-based evaluators by providing more context and guidance.LLM-based metrics can provide a more fine-grained continuous score by re-weighting the discrete scores by their respective token probabilities.LLM-based metrics have a potential issue of preferring LLM-generated texts over human-written texts, which may lead to the self-reinforcement of LLMs if LLM-based metrics are used as the reward signal for improving themselves.创造性任务上LLM评估器有优势传统指标失效LLM对于指令和提示词敏感CoT可以提供更多上下文和指导来提高基于LLM的评估器的性能。LLM是上下文学习者基于LLM的指标可以通过按照各自的标记概率重新加权离散分数来提供更细粒度的连续分数。LLM通常只输出整数1-5但概率加权能产生2.59这样的连续分数更好地区分细微差异基于LLM的指标的潜在问题偏好LLM生成的文本而非人类撰写的文本如果将基于LLM的指标用作改进自身的奖励信号可能导致LLM的自我强化2. MethodG-Eval是一个基于prompt的评估器主要包含三个组件prompt定义“评估什么”CoT解决“怎么评估”Scoring Function实现“如何计算”The prompt should also contain customized evaluation criteria for different NLG tasks and, such as coherence, conciseness, or grammar.Prompt for NLG Evaluationprompt设计原则简洁的自然语言、明确任务、定义标准。直接告诉LLM你要做什么也应该有一些针对不同NLG任务的定制评估标准例如连贯性、简洁性或语法不同任务关注不同维度。例如为了评估文本摘要的连贯性下面是一段论文中提到的提示词内容可以参考下里面The summary should not just be a heap of related information这句话说明了一段好摘要的特点不是信息堆砌而是要有逻辑结构。Evaluation Criteria: Coherence (1-5) - the collective quality of all sentences. We align this dimen- sion with the DUC quality question of structure and coherence whereby ”the summary should be well-structured and well-organized. The summary should not just be a heap of related information, but should build from sentence to sentence to a coherent body of information about a topic.”Auto Chain-of-Thoughts for NLG EvaluationThe chain-of-thoughts (CoT) is a sequence of intermediate representations that are generated by the LLM during the text generation process.思维链是LLM在文本生成过程中间的一系列中间表示对于评估任务一些标准需要超出简单定义的更详细的评估指令而手动为每个任务设计这样的评估步骤非常耗时论文发现LLM自己可以生成这样的评估步骤CoT两重作用1. 提高评估质量提供上下文2. 提高可解释性展示推理过程Auto CoT核心思想就是LLM不仅能评估还能告诉你怎么评估。下面是论文提到的为了评估文本摘要的连贯性在提示词里面添加了一行“Evaluation Steps:”让LLM自动生成了以下的CoT1. Read the news article carefully and identify the main topic and key points. 2. Read the summary and compare it to the news article. Check if the summary covers the main topic and key points of the news article, and if it presents them in a clear and logical order. 3. Assign a score for coherence on a scale of 1 to 5, where 1 is the lowest and 5 is the highest based on the Evaluation Criteria.CoT把“评估连贯性”这个抽象任务分解为三个具体步骤1. 理解原文2. 对比检查3. 打分。这种分解让评估过程更系统更可重复Scoring FunctionThe scoring function calls the LLM with the designed prompt, auto CoT, the input context and the target text that needs to be evaluated.论文提出评分函数的输入是prompt CoT 原文 生成文本这是完整的评估上下文Unlike GPTScore (Fu et al., 2023) which uses the conditional probability of generating the target text as an evaluation metric, G-EVAL directly performs the evaluation task with a form-filling paradigm.与GPTScore不同GPTScore是“生成式”计算LLM生成目标文本的概率而G-EVAL是“判别式”让LLM直接打分。例如对于评估文本摘要的连贯性将prompt、CoT、新闻文章、摘要拼接然后调用LLM根据定义的标准对每个评估方面输出1-5的分数。换句话说输入是完整的上下文输出是结构化分数。但是这种直接评分函数有两个问题1: 分数集中在某个值例如32: LLM通常只输出整数分数即使提示明确小数值这导致评估分数中存在大量并列无法捕捉生成文本之间的细微差异。这两个问题都会降低与人类判断的相关性。To address these issues, we propose using the probabilities of output tokens from LLMs to normalize the scores and take their weighted summation as the final results.解决方案概率加权考虑所有可能分数的概率分布如下所示s c o r e ∑ i 1 n p ( s i ) × s i score\sum_{i1}^np(s_i)\times s_iscorei1∑n​p(si​)×si​也就是说假设LLM输出分数3的概率是0.6输出4的概率是0.4那么最终分数是30.640.43.4这比直接输出3更精细3. Experiments3.1 Implementation DetailsFollowing Zhong et al. (2022), we meta-evaluate our evaluator on three benchmarks, SummEval, Topical-Chat and QAGS, of two NLG tasks, summarization and dialogue response generation.论文在两个NLG任务摘要和对话响应生成的三个基准SummEval、Topical-Chat和QAGS上元评估我们的评估器看评估器与人类判断的相关性。使用OpenAI的GPT系列对比GPT-3.5和GPT-4这两个模型观察模型规模对实验的影响。对于GPT-3.5论文将temperature设置为0提高模型的确定性对于GPT-4由于不支持直接输出概率论文设置n20temperature1top_p1采样20次来估计标记概率这是工程的妥协现在gpt-4支持了这是23年的论文3.2 Benchmarks它使用了三个基准测试集SummEval (Fabbri et al., 2021) is a benchmark that compares different evaluation methods for summarization. It gives human ratings for four aspects of each summary: fluency, coherence, consistency and relevance. It is built on the CNN/DailyMail dataset (Hermann et al., 2015).SummEval这是摘要评估的标准基准它从流畅性、连贯性、一致性、相关性四个维度覆盖了摘要质量的核心方面Topical-Chat (Mehri and Eskenazi, 2020) is a testbed for meta-evaluating different evaluators on dialogue response generation systems that use knowledge. We follow (Zhong et al., 2022) to use its human ratings on four aspects: naturalness, coherence, engagingness and groundedness.Topical-Chat是对话评估的基准在自然性、连贯性、参与度和基于性是否有依据QAGS (Wang et al., 2020) is a benchmark for evaluating hallucinations in the summarization task. It aims to measure the consistency dimension of summaries on two different summarization datasets.QAGS是一个用于评估摘要任务中幻觉的基准衡量两个不同摘要数据集上摘要的一致性维度3.3 Baselines这里列举了一些用于对照的当时最先进的评估器BERTScore、MoverScore、BARTScore、FactCC and QAGS、USR、UniEval、GPTScore3.4 Results for Summarization3.5 Results for Dialogue Generation3.6 Results on Hallucinations这三章从摘要任务结果、对话生成结果、幻觉评估结果在连贯性、一致性、流畅度、相关性几个方面的评分情况衡量了模型的评估和人类标注的打分排序之间的一致性包括Spearman相关系数和Kendall-Tau相关系数发现用G-Eval的评估算法在各方面都是有优势的。4. Analysis论文抛出了一个问题是否G-Eval的LLM评估器偏好LLM输出并设计了实验比较LLM生成和人类撰写的摘要的LLM评估分数。The dataset can be divided in three categories: 1) human-written summaries that are rated higher than GPT-3.5 summaries by human judges, 2) human-written summaries that are rated lower than GPT-3.5 summaries by human judges, and 3) human-written summaries and GPT-3.5 summaries are rated equally good by human judges.数据集分三类1: 人类认为人类更好的摘要2: 人类认为LLM更好的摘要3: 人类认为两者相当的摘要然后让G-Eval-4评分看是否跟人类的判断一致然后发现模型总是给GPT-3.5的摘要打更高的分数论文指出有两种可能原因1:任务本身难人类标注者都难以达成一致2: 模型偏见LLM在生成和评估的时候使用相同的“标准”导致自我偏好 这揭示了LLM-as-Judge的根本局限最后论文通过消融实验证明了它提出的Auto CoTLLM生成评估步骤 form filling让LLM填表直接打分而不是写作文 概率加权所有候选分数加权求和的三步框架 每一步都是有用的而不是花架子。对我们的意义就是用实验数据证明了提出的三步框架的方法论并告诉我们LLM评估器是由自我偏好的偏见的在做评测的时候可以直接用这个方法论并需要注意上述问题
RELATED

相关推荐

当自然语言遇上数据库:Text2Sql.Net的MCP革命如何重新定义开发者与数据的交互方式|TaoToken 统一 Key 实战

当自然语言遇上数据库:Text2Sql.Net的MCP革命如何重新定义开发者与数据的交互方式|TaoToken 统一 Key 实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/10/9 13:55:20
Manus联合创始人拆解:Claude与阿里千问双模型驱动下的TaoToken统一API接入实践

Manus联合创始人拆解:Claude与阿里千问双模型驱动下的TaoToken统一API接入实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/10/9 13:55:20
AI实战:省token妙招之【context-mode】——用SQLite给MCP上下文做减法

AI实战:省token妙招之【context-mode】——用SQLite给MCP上下文做减法

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/10/9 13:55:20
MORE NEWS

更多资讯

📰

数据库原理复习链路:往年卷拆解、SQL作业与课设避坑指南

简介:面向天津大学「数据库应用(原理)」课程的备考者与自学者,资源包集中整理往年试卷、课程大作业与实验报告,内容覆盖SQL语言、关系数据库模型、数据完整性、事务处理、索引构建与查询优化等核心考点,并包…

📰

虚谷数据库迁移工具Windows 64位实战:类型映射、字符集与避坑指南

简介:虚谷数据库迁移工具(Windows 64位)是一款面向数据库管理员与系统运维人员的迁移辅助软件,用于在跨平台或跨版本场景下完成数据搬迁与系统升级,尤其适合从旧数据库替换到新环境或更换数据库管理系统时的数据保障。…

📰

数据库物理模型设计实战:从建表、索引到分区与压测避坑指南

简介:这份文档面向数据库设计初学者与需要梳理建模思路的开发者,聚焦数据库物理模型设计这一关键环节,讲解如何在实际存储系统中落地逻辑模型,以兼顾性能、存储效率与数据管理。内容以四种核心设计模式为主线,重点展开…

📰

银行卡BIN数据实战:从Excel清洗到MySQL查询与风控应用

简介:这套银行卡BIN数据基于银联官方2020年4月25日发布的最新版本整理,共涵盖9868条记录,字段包含银行卡bin、bin长度、发卡行、银行卡名、银行卡类型、银行卡长度等核心信息,适合支付系统开发、金融风控、账户校验、渠道对账等场…

📰

mysql.zip题库导入实战:识别、导入、查题与API封装

简介:面向在线K12教育从业者与题库系统开发人员,这份MySQL数据库资源包围绕数学、物理、化学公式的录入和显示这一在线教育常见痛点,完整演示了试题存储、LaTeX公式渲染、知识点章节建设、题目属性设置等核心环节,并附带可参考的样…

📰

CCNP PDF课程资料学习指南:从理论基础到实验验证的网络工程师进阶路线

简介:思科CCNP课程.pdf是一份根据培训机构内部PPT整理而成的CCNP学习笔记,作者边看边记,适合备考CCNP或负责企业级网络设计、实施与排障的网络工程师。内容覆盖TCP/IP协议回顾、VLAN/Trunk/VTP部署、生成树STP与RSTP、二层与三层交换、链路聚…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬