尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
探索uncertain_ground_truth:革命性框架如何解决AI评估中的模糊标注难题
探索uncertain_ground_truth革命性框架如何解决AI评估中的模糊标注难题【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth在AI系统的开发与应用中准确的评估和校准至关重要。然而传统方法往往假设标注数据是确定的忽略了实际应用中普遍存在的标注模糊性。uncertain_ground_truth项目应运而生它提供了一套完整的解决方案通过蒙特卡洛保形预测Monte Carlo conformal prediction、似然区域plausibility regions和统计标注聚合技术有效处理AI评估中的不确定标注问题为AI系统的可靠性保驾护航。为什么传统AI评估方法会失效在医疗诊断、图像识别等复杂领域专家标注往往存在显著分歧。例如皮肤科疾病诊断中不同医生对同一病例可能给出不同的判断。传统方法通常通过简单多数投票或平均来聚合标注这种方式不仅忽略了标注的不确定性还可能导致对AI系统性能的错误估计。图展示了在不确定标注情况下传统方法与本项目方法的差异突出了标注模糊性对AI评估的影响。uncertain_ground_truth的核心创新统计标注聚合捕捉标注者的不确定性项目提出了一种基于统计模型的标注聚合方法将标注者的可靠性作为超参数通过后验推理得到每个类别的似然度plausibilities。这种方法能够量化标注不确定性区分标注者分歧和固有不确定性提供更稳健的性能评估指标避免简单多数投票的局限性相关实现可参考pl_samplers.pyPlackett-Luce Gibbs采样器和irn.py概率逆秩归一化。蒙特卡洛保形预测可靠的不确定性量化传统保形预测假设校准集标签是确定的而本项目提出的蒙特卡洛保形预测直接利用标注的似然度通过对每个校准样本生成多个伪标签实现了对真实标签分布的覆盖保证。图蒙特卡洛保形预测的工作原理展示了如何通过采样伪标签来构建可靠的预测集。核心实现位于monte_carlo.py其中calibrate_mc_conformal函数负责阈值校准为后续预测提供基础。似然区域更精细的预测边界项目还引入了似然区域的概念通过对似然度的校准构建出更精细的预测边界。这一方法在plausibility_regions.py中实现predict_plausibility_regions函数可根据校准后的阈值生成每个样本的似然区域为决策提供更全面的不确定性信息。快速上手如何使用uncertain_ground_truth环境准备克隆仓库git clone https://gitcode.com/gh_mirrors/un/uncertain_ground_truth cd uncertain_ground_truth使用Conda创建环境conda env create -f environment.yml conda activate uncertain_ground_truth验证安装python -m unittest discover -s . -p *_test.py数据集介绍项目提供了皮肤科鉴别诊断ddx数据集包含1947个病例的专家标注和模型预测结果data/dermatology_selectors.json专家标注的部分排序data/dermatology_conditions.txt疾病名称与编码的映射data/dermatology_predictions0.txt至data/dermatology_predictions3.txt不同模型的预测结果图皮肤科ddx数据集的示例展示体现了专家标注的复杂性和不确定性。关键实验复现蒙特卡洛保形预测实验运行colab_mccp.ipynb对比标准保形预测与蒙特卡洛保形预测在不同数据集上的表现。标注聚合实验通过colab_pl_sampler.ipynb体验Plackett-Luce Gibbs采样器了解统计标注聚合的过程。不确定性评估使用colab_ua_accuracy.ipynb计算不确定性调整的准确率更真实地评估AI系统性能。实际应用场景与价值医疗AI领域在皮肤疾病诊断等医疗场景中标注的不确定性尤为突出。uncertain_ground_truth能够更准确地评估AI辅助诊断系统的性能提供可靠的不确定性量化帮助医生做出更明智的决策减少因标注分歧导致的误诊风险其他高风险领域该框架同样适用于自动驾驶、金融风控等对可靠性要求极高的领域通过处理标注不确定性提升AI系统的安全性和可信度。总结重新定义AI评估的标准uncertain_ground_truth项目通过创新性的统计标注聚合、蒙特卡洛保形预测和似然区域技术为解决AI评估中的模糊标注难题提供了一套完整的解决方案。它不仅能够更真实地反映AI系统的性能还能提供可靠的不确定性信息为AI系统的安全部署奠定了坚实基础。无论是学术界还是工业界都可以从这个项目中汲取灵感推动AI评估方法的革新让AI系统在面对复杂现实世界时更加稳健和可靠。引用与致谢本项目的成果基于以下论文Stutz et al., Conformal prediction under ambiguous ground truth, TMLR 2023Stutz et al., Evaluating AI systems under uncertain ground truth: a case study in dermatology, ArXiv 2023感谢DeepMind团队的开源贡献让这一重要技术得以广泛应用和进一步发展。【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

终极指南:如何用Loop免费提升Mac窗口管理效率300%

终极指南:如何用Loop免费提升Mac窗口管理效率300%

终极指南:如何用Loop免费提升Mac窗口管理效率300% 【免费下载链接】Loop Window management made elegant. 项目地址: https://gitcode.com/GitHub_Trending/lo/Loop 你是否曾因Mac上杂乱的窗口布局而感到烦躁?当浏览器、文档、代码编辑器和聊天工…

📅 2026/9/28 17:01:53
PTA团体程序设计天梯赛L2真题讲解L2-041-044

PTA团体程序设计天梯赛L2真题讲解L2-041-044

官网:https://pintia.cn/problem-sets/994805046380707840/exam/problems/type/7 文章目录L2-041 插松枝L2-042 老板的作息表L2-043 龙龙送外卖L2-044 大众情人L2-041 插松枝 题目大意 制作松枝的流程包含三个核心对象:推送器(按顺序给出n片…

📅 2026/9/1 10:12:26
globe夜间模式探索:如何用ASCII字符模拟地球昼夜交替

globe夜间模式探索:如何用ASCII字符模拟地球昼夜交替

globe夜间模式探索:如何用ASCII字符模拟地球昼夜交替 【免费下载链接】globe Interactive ASCII globe generator 项目地址: https://gitcode.com/gh_mirrors/glo/globe globe是一款强大的ASCII地球生成工具,它能够通过简单的字符组合在终端中呈现…

📅 2026/8/25 8:23:16
MORE NEWS

更多资讯

📰

superpowers实战:为AI编程助手注入工程化协作能力

如果你最近在终端里用过 Codex CLI 这类 AI 编程助手,大概率会有一种感觉:它很强,但更像一个“听话的实习生”。你每一步都要给它下指令,稍不留神它就跑偏,让它改个东西它可能把不相干的代码也顺手改了。superpowers 这…

📰

Jeepay开源聚合支付系统:Java四方支付底座实战指南

简介:这是一套全开源的Java聚合支付系统(Jeepay),面向中高级Java开发者、支付平台架构师及金融科技领域学习者,用于快速搭建支持多渠道接入的四方支付服务。系统已深度集成微信(V2/V3)、支付宝&…

📰

蓝牙双模配对总翻车?CTKD跨传输密钥派生原理与实测解析

1. 为什么蓝牙耳机配对总让人抓狂我每天早上通勤的固定流程是这样的:从包里掏出真无线耳机,戴上,然后掏出手机解锁——接着在蓝牙设置界面里等着,看它能不能自己连上。大部分时候可以,但总有那么几次,耳机明…

📰

Substrate区块链开发框架详解:从核心概念到自定义链实操

做区块链底层开发这几年,被问得最多的一个问题就是:想自己做一条链,从哪开始?如果放在五年前,答案可能是“先读比特币源码,再读以太坊黄皮书,然后自己造轮子”。现在我的答案很固定:…

📰

Kubernetes、Ray、vLLM 三层调度分工与协同优化

1. 三类调度器不是“谁管谁”,而是各守一段技术栈的边界“Kubernetes、Ray、vLLM 都在调度,它们各自决定了什么?”——这个问题背后藏着一个普遍误解:很多人下意识把这三者当成同一层级的“资源分配工具”,甚至试图比较…

📰

Kubernetes 上构建 Agentic 工作负载的运行时调度层:ax 调度设计与实践

1. 从“ax”这个标题说起:一个被低估的运行时调度命题第一次看到“ax”这个标题,很多人会以为是某个命令行工具的缩写,或者某个内部代号。但把热搜词摊开来看——ax、agentic、orchestration、runtime、Kubernetes——这几个词凑在一起&#…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬