尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
如何用 GraphRAG 的 prompt-tune 命令生成领域适配的索引提示词?
如何用 GraphRAG 的 prompt-tune 命令生成领域适配的索引提示词【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphragGraphRAG 的索引流水线默认使用一组通用提示词来构建知识图谱。如果你的输入数据集中在某个领域比如环境新闻、太空科学、微生物学prompt-tune命令可以读取你的实际输入数据通过一系列 LLM 调用生成适配该领域的提示词文档建议在执行 Index Run 之前运行这一步以获得更好的索引结果。本文以命令行方式完整走一遍初始化工作区、准备输入、运行prompt-tune、核对生成的提示词文件并把settings.yaml指到新的提示词上。前置条件来自文档Python 3.10–3.12已安装graphrag可从 PyPI 安装已用graphrag init初始化过工作区且.env中的 API Key 已配置input/目录中有待索引的数据文件。初始化工作区并准备输入prompt-tune依赖graphrag init生成的配置文件先在你的项目目录下执行python -m pip install graphrag graphrag init执行过程中按提示选择默认的 chat 与 embedding 模型。init命令会创建以下文件settings.yaml— 流水线配置.env— 环境变量文件包含GRAPHRAG_API_KEYAPI_KEY把API_KEY替换为你自己的 OpenAI 或 Azure API keyprompt-tune 会发起 LLM 调用Key 必须有效prompts/— 存放 GraphRAG 默认提示词的目录。然后把你的数据文件放进input/目录。prompt-tune会读取这个目录下的输入支持的格式包括.csv、.txt、.json、.jsonl、.parquet以及 MarkItDown 支持的文件。文档也提醒GraphRAG 可能消耗大量 LLM 资源建议先用小的教程数据集熟悉流程并用较快、较便宜的模型做实验。运行 prompt-tune命令的完整形式来自 Auto Prompt Tuning 文档graphrag prompt-tune [--root ROOT] [--domain DOMAIN] [--selection-method METHOD] [--limit LIMIT] [--language LANGUAGE] \ [--max-tokens MAX_TOKENS] [--chunk-size CHUNK_SIZE] [--n-subset-max N_SUBSET_MAX] [--k K] \ [--min-examples-required MIN_EXAMPLES_REQUIRED] [--discover-entity-types] [--output OUTPUT]各选项的含义与默认值选项说明默认值--root包含配置文件settings.yaml的项目目录当前目录--domain输入数据的领域如 space science留空时从输入数据自动推断空--selection-method文档选择方法all、random、auto、toprandom--limit使用 random 或 top 选择时加载的 text units 数量15--language处理使用的语言与输入语言不同时 LLM 会翻译空自动检测--max-tokens提示词生成的最大 token 数2000--chunk-size从输入文档生成 text units 使用的 token 块大小200--n-subset-maxauto 选择方法中要嵌入的文本块数量300--kauto 选择方法中选取的文档数量15--min-examples-required实体抽取提示词所需的最少示例数2--discover-entity-types允许 LLM 自动发现并抽取实体类型数据覆盖主题很多或高度随机时建议使用不启用--output保存生成提示词的目录prompts文档给出的两个示例python -m graphrag prompt-tune --root /path/to/project --domain environmental news \ --selection-method random --limit 10 --language English --max-tokens 2048 --chunk-size 256 --min-examples-required 3 \ --no-discover-entity-types --output /path/to/output文档标注的最小配置运行方式suggestedpython -m graphrag prompt-tune --root /path/to/project --no-discover-entity-types示例中的/path/to/project、/path/to/output是占位符替换为你实际的项目目录和输出目录如果已经在项目目录下运行--root可省略默认当前目录--output省略时默认写入prompts目录。内部流程命令先加载输入数据按chunk-size切成 text units再用所选方法抽取样本最后通过 LLM 调用与模板替换生成最终提示词。文档建议直接使用脚本默认值按需再调整。选择文档采样方法--selection-method决定从 text units 中取什么样本来做提示词生成random随机选取默认且文档推荐top取前 n 个 text units配合--limitall使用全部 text units文档明确说只适合小数据集通常不推荐auto把 text units 嵌入低维空间后选取距质心最近的 k 个适合大数据集用于选取有代表性的样本配合--n-subset-max和--k。验证生成的提示词运行结束后检查输出目录默认prompts/中是否写入了三个提示词文件extract_graph.txt— 实体/关系抽取提示词summarize_descriptions.txt— 实体/关系描述汇总提示词community_report_graph.txt— 社区报告提示词。文件名依据 CLI 实现该实现会把三个生成结果写入输出目录并在日志中输出Writing prompts to ...与Prompts written to ...两行记录可据此确认文件写入位置。更新配置以使用新提示词文档的 Modify Config 一节要求运行后修改settings.yaml中以下变量让 index run 使用新提示词extract_graph: prompt: prompts/extract_graph.txt summarize_descriptions: prompt: prompts/summarize_descriptions.txt community_reports: prompt: prompts/community_report.txt文档同时提醒务必把路径更新为生成提示词的实际位置上面示例使用默认prompts路径。这里有一处需要留意的差异文档示例中写的是prompts/community_report.txt而命令实际写入的文件名为community_report_graph.txt且init生成的默认配置中community_reports使用的是graph_prompt: prompts/community_report_graph.txt。修改前请先查看输出目录里的真实文件名再按实际名称填写不要照抄可能与代码不一致的路径。另外如果--output保持默认的prompts生成的三个文件名与init生成的默认配置所引用的路径一致配置可能无需改动即可指向新提示词。下一步提示词就位后就可以启动索引流水线graphrag index关于settings.yaml各字段的更多配置项见 配置文档手动编辑提示词的进阶用法各提示词支持的 token 替换位见 Manual Prompt Tuning。【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphrag创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Web-Dev-For-Beginners 银行应用项目:纯 HTML/CSS/JS 解决方案运行与实现解析

Web-Dev-For-Beginners 银行应用项目:纯 HTML/CSS/JS 解决方案运行与实现解析

Web-Dev-For-Beginners 银行应用项目:纯 HTML/CSS/JS 解决方案运行与实现解析 【免费下载链接】Web-Dev-For-Beginners 24 Lessons, 12 Weeks, Get Started as a Web Developer 项目地址: https://gitcode.com/GitHub_Trending/we/Web-Dev-For-Beginners 本文…

📅 2026/9/11 13:24:11
线性回归驱动的学生就业分析系统开题报告写作指南

线性回归驱动的学生就业分析系统开题报告写作指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/11 13:24:11
前端系统设计面试中如何展现面试官评分看重的信号(需求探索、架构、权衡)?

前端系统设计面试中如何展现面试官评分看重的信号(需求探索、架构、权衡)?

前端系统设计面试中如何展现面试官评分看重的信号(需求探索、架构、权衡)? 【免费下载链接】front-end-interview-handbook Front End interview preparation materials for busy engineers (updated for 2026) 项目地址: https://gitcode.…

📅 2026/9/11 13:24:11
MORE NEWS

更多资讯

📰

使用 Helm 在 Kubernetes 上部署 Cognee:内置 PostgreSQL + pgvector 的完整指南

使用 Helm 在 Kubernetes 上部署 Cognee:内置 PostgreSQL pgvector 的完整指南 【免费下载链接】cognee Cognee is the open-source AI memory platform for agents. Give your AI agents persistent long-term memory across sessions with a self-hosted knowled…

📰

Git Diff 完全指南:从基础用法到分支对比、工作流审计与安全实践(refine 仓库实战解析)

Git Diff 完全指南:从基础用法到分支对比、工作流审计与安全实践(refine 仓库实战解析) 【免费下载链接】refine A React Framework for building internal tools, admin panels, dashboards & B2B apps with unmatched flexibility. 项…

📰

180元预算2小时:从零组装ESP32激光雕刻机新手实操指南

180元预算2小时:从零组装ESP32激光雕刻机新手实操指南 【免费下载链接】arduino-esp32 Arduino core for the ESP32 family of SoCs 项目地址: https://gitcode.com/GitHub_Trending/ar/arduino-esp32 用 arduino-esp32 官方核心做开发底座,你能在…

📰

Node.js全平台安装指南与常见问题解决

1. 为什么需要全系统适配的Node.js安装方案在2023年的开发者生态调查中,Node.js以超过65%的占有率蝉联最受欢迎的后端技术。但新手在安装环节的失败率却高达23%,主要问题集中在系统环境差异导致的安装异常。不同于其他语言的运行时环境,Node.…

📰

基于纳什博弈的多微网电热双层共享策略与Matlab实现

1. 项目背景与核心价值在分布式能源系统快速发展的当下,微电网之间的能源共享成为提升整体效率的关键突破口。传统单微网系统往往面临供需不平衡、可再生能源波动性大等问题,而多微网协同运行能够通过资源互补显著提高能源利用率。但这里存在一个根本矛盾…

📰

Frigate+ 如何提交标注图像并请求你的第一个自定义检测模型?

Frigate 如何提交标注图像并请求你的第一个自定义检测模型? 【免费下载链接】frigate NVR with realtime local object detection for IP cameras 项目地址: https://gitcode.com/GitHub_Trending/fr/frigate Frigate 允许你基于自己摄像头采集的图像训练一个…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬