尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
--cot与--astro如何抉择?MingLi-Bench思维链与命盘注入效果深度对比
--cot与--astro如何抉择MingLi-Bench思维链与命盘注入效果深度对比【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench 是一个评测大语言模型中国传统命理能力的开源基准用 2022–2025 年全球算命师大赛的 160 道选择题检验模型在八字与紫微斗数上的推理水平。运行时最常被纠结的两个开关是--cot思维链推理和--astro命盘注入到底开哪个开几个本文从提示词原理到消融实验带你把这两个参数一次讲透 MingLi-Bench 评测的是什么项目把命题拆解为两类能力排盘能力由生辰信息推导出八字四柱、紫微十二宫星曜分布这是纯计算容易出错推理能力基于命盘做出对人生事件的判断事业、婚姻、财运等十二大类事件。数据与命盘分别存放在文件作用data/data.json160 道标准化选择题2022–2025 年每题对应一个命主案例data/fortune_api_results.json预先排好的八字 / 紫微斗数命盘运行时按case_id与题目关联data/raw/原始赛题文本2022.txt~2025.txt评分采用与标准答案精确匹配的选择题形式可客观复现。快速上手三步跑出第一次评测git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt配置好 README_zh.md 中说明的 API 密钥.env文件后先用--stats自检数据集再跑正式评测。官方推荐的默认姿势是始终同时开启--cot与--astropython -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro 加--sample 10可先抽 10 题冒烟测试--max-workers 8提高并发。--cot 做了什么让模型先推理再作答开启--cot后提示词中的指令从请直接给出答案变为请先分析推理过程然后给出答案见 mingli_bench/benchmark.py 的_prepare_prompt方法模式提示词指令默认结合中国传统命理学进行推算请直接给出答案用答案X的格式加--cot请先分析推理过程然后给出答案。最后用答案X的格式给出你的选择命理题目需要逐级展开大运、流年、宫位关系属于典型的长链推理任务。给模型留出推理空间能显著降低跳步作答、凭直觉蒙答案的概率——这也是思维链Chain-of-Thought在多步推理任务上的经典收益。参数定义见 mingli_bench/cli.py。--astro 做了什么把排好的命盘直接喂给模型开启--astro后框架会把 data/fortune_api_results.json 中预先排好的命盘注入提示词例如八字命盘信息 八字甲寅 戊辰 己亥 壬申 时辰申时 五行局金四局 生肖虎 紫微命盘信息 十二宫位星曜分布 命宫天同 火星 夫妻天梁 左辅 右弼 天钺 地劫 官禄天机 天魁 陀罗 ...这一步的价值在于把排盘与推理解耦模型不必再自己干万年历换算、节气交界等容易出错的手工排盘分数反映的是纯粹的命理推理能力而非日期转四柱的准确性加载逻辑见 mingli_bench/data/loader.py。四种参数组合各测出什么组合测出的能力适用场景均不开启排盘 推理的端到端水平想看模型裸考真实表现仅--cot推理空间充分但排盘误差仍会进入分数对比只加强推理的增益仅--astro排除排盘误差但答案一步给出对比只补充信息的增益--cot--astro✅纯推理能力官方推荐默认日常评测、模型横评如何抉择三个场景给出明确答案日常评测 / 横评模型两个都开。官方文档明确建议始终传入--cot和--astro只有做消融实验时才建议关闭。研究排盘到底拖了模型多少后腿对比仅--astro与均不开启的得分差差值即为排盘误差的影响。严谨的消融实验固定--year与--shuffle-options打乱选项防位置偏差每个模型跑 5 轮独立测试并用多数投票取最终答案排除采样随机性。从基准到高级 Agent为什么官方也强调先给命盘MingLi-Bench 同时是作者 Agentic 命理系统 Tianfu Agent 的评测底座。官方测试显示提供预计算命盘的通用大模型中最佳基线截尾准确率约40%而 Tianfu Agent 通过多智能体协作 不确定性量化将分数推到50%接近人类参赛者 Top-20 的平均水平53.5%这也解释了基准的设计理念命理推理中计算与推理必须分开测量--astro正是这条分界线。读懂评测结果每次运行在logs/下生成三类产物model_results.json每题预测、得分与整体统计model_summary.txt核心指标摘要含 CoT/Astro 开关状态model_responses/每题原始回复含完整 Prompt便于人工复核思维链质量。结果文件里会记录use_cot/use_astro标志见 mingli_bench/benchmark.py 的_calculate_statistics方便你回查每次实验的确切配置。小结拿不准就全开--cot --astro是官方推荐默认测的是纯推理能力想量化排盘误差用仅--astro和均不开启做对照做严谨消融固定年份、打乱选项、多轮投票结论才站得住。跑通一次只需要一条命令而理解--cot与--astro的分工你才能真正读懂每一分提升的来源。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Minimax查询模型用量

Minimax查询模型用量

查询模型用量主要参考官方文档&#xff0c; FAQs - MiniMax API Docs 基本用法如下, 但是要区分是国内API还是国际版API curl --location https://www.minimax.io/v1/token_plan/remains \ --header Authorization: Bearer <API Key> \ --header Content-Type: applica…

📅 2026/10/4 2:47:39
MFC扫雷实现全解析:从消息映射到双缓冲绘制

MFC扫雷实现全解析:从消息映射到双缓冲绘制

简介&#xff1a;基于MFC框架实现的经典扫雷游戏完整项目&#xff0c;压缩包内含可运行的exe与Visual C工程源码&#xff0c;既适合初学Windows编程的开发者阅读&#xff0c;也可直接运行体验游戏。资源共54个文件&#xff0c;压缩后2.96MB&#xff0c;涵盖C头文件与实现文件、…

📅 2026/10/4 2:47:39
教育文本分析实战:学情预警、作文评估与教学反馈的NLP应用

教育文本分析实战:学情预警、作文评估与教学反馈的NLP应用

快码住&#xff01;大数据文本分析在教育领域的应用做了这么多年数据分析&#xff0c;我越来越觉得一个方向被严重低估了&#xff0c;那就是文本分析在教育场景里的落地。大部分人一聊大数据就盯着成绩排名、选课人数、考试通过率这些结构化数据&#xff0c;但教育场景里真正藏…

📅 2026/10/4 2:47:39
MORE NEWS

更多资讯

📰

Silvaco中载流子复合模型实战:SRH与俄歇参数标定指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

插件体系设计指南:从plugin.json到TypeScript SDK的加载机制与排查实践

1. 从“plugins”这个词说起&#xff1a;它到底在解决什么问题但凡折腾过现代开发工具的人&#xff0c;对plugins这个词都不会陌生。它字面意思就是“插件”&#xff0c;但真正理解它的人知道&#xff0c;这背后其实是一整套可扩展架构的设计哲学。你用的编辑器、命令行工具、构…

📰

工程车辆目标检测数据集:从标注格式转换到YOLO训练与部署避坑

简介&#xff1a;这份工程车辆目标检测数据集面向建筑工地智能监控、智能交通与自动驾驶环境感知等方向的算法开发者与院校研究者&#xff0c;聚焦混凝土搅拌车、自卸卡车、挖掘机三类常见工程车辆的识别需求。资源包共902个文件&#xff0c;以450张JPEG实景图片和450个YOLO格式…

📰

ZYNQ嵌入式平台实现OTSU图像分割的硬件加速实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

格拉布斯准则详解:基于Python的异常值检测原理、实现与避坑指南

简介&#xff1a;面向数学建模与美赛的数据预处理需求&#xff0c;压缩包内代码基于格拉布斯准则实现异常值判断&#xff0c;用于识别和修正样本中的极端数据&#xff0c;适合参赛选手或数据分析初学者参考。格拉布斯检验以正态分布为前提&#xff0c;计算最大值与均值的偏差并…

📰

动态AR-KF:用卡尔曼滤波实时校准时间序列模型

简介&#xff1a;本资源是一份面向数据科学初学者与MATLAB实践者的AR时间序列建模与卡尔曼滤波融合学习包&#xff0c;聚焦于AR(1)模型的状态估计与噪声抑制问题&#xff0c;适用于金融预测、信号处理、控制系统等场景。压缩包共2个文件&#xff08;1个MATLAB脚本ARl.m用于实现…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬