XOR-AttriQA面向跨语言问答归因任务的多语言评测数据集使用指南【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research导读XOR-AttriQA 是 EMNLP 2023 长文《Evaluating and Modeling Attribution for Cross-Lingual Question Answering》配套发布的评测数据集核心用途是训练与评估归因attribution能力——即给定一条查询、一段支撑段落与一个模型预测答案判断该段落是否确实证明了该答案对该查询是正确的。本文档基于仓库内 xor_attriqa/README.md 完整梳理数据集的背景来源、15 个数据字段语义、三种任务用法语内、跨语、论文复现混合设置以及各语言划分规模帮助研究者快速上手并正确复现论文实验设置。数据集背景与归因任务定义XOR-AttriQA 于 EMNLP 2023 以长文形式发表数据集构建基于两个既有工作XOR-TyDiQA提供了多语言问答XOR-QA中的查询与标准答案CoRA 系统提供了模型对查询的预测答案及其检索到的支撑段落。在归因任务中模型面对三元组一条query、一条passage段落与一个answer模型预测需要判定该段落是否确实支持该答案对该问题成立输出 True 或 False。这一任务直接关系到检索增强问答系统的可信度——模型可以检索到相关文档但其生成答案是否真正扎根于所依据的段落正是归因评测要回答的问题。值得注意的是XOR-AttriQA 同时提供了语内in-language与英语in-English两种标注设置使其既可用于单语归因评测也可用于跨语言归因研究。数据字段详解数据集每条样本包含 15 个字段完整说明如下字段含义query来自 XOR-QA 的查询query_language查询的语言answersXOR-QA 提供的查询答案predictionCoRA 系统的预测prediction_correct预测是否被判定与答案匹配query_translated_en翻译成英语的查询answers_translated_en翻译成英语的答案prediction_translated_en翻译成英语的预测passage_in_language原语言段落是否翻译需结合passage_retrieved_language判断passage_en英语段落是否翻译需结合passage_retrieved_language判断passage_retrieved_language检索段落的语言intrepetability_vote标注者对能否理解该预测投票的比例字段名沿用原 README 拼写ais_vote标注者对预测是否可归因于段落与查询投票的比例interpretability标注者能否理解预测的 True/False 判定ais预测是否可归因于段落与查询的 True/False 判定其中aisattribution is satisfied字段是任务的金标准标签gold labelinterpretability字段则记录预测答案的可理解性两个_vote字段保留了投票比例的细粒度信息便于研究者分析标注分歧或按置信度筛选样本。数据获取与目录组织数据通过官方发布链接下载详见原 xor_attriqa/README.md 中的 Data 小节https://storage.googleapis.com/gresearch/xor_attriqa/xor_attriqa.zip。压缩包内包含两个目录in-language目录语内设置的数据标注论文结果对比须使用此目录数据in-english目录英语设置的数据标注论文中仅用于对比两种设置的标注者间一致性inter-annotator agreement仅作参考。因此若目标是复现论文结果请以in-language设置为准。任务用法语内归因与跨语言归因数据集同时支持语内归因与跨语言归因两种用法1. 语内归因In-Language Attribution使用query、prediction、passage_in_language三个字段预测 True 或 False金标准标签为ais字段。此设置要求模型直接使用原语言如孟加拉语、芬兰语等的段落进行判断。2. 跨语言归因Cross-Language Attribution使用query、prediction、passage_en三个字段预测 True 或 False金标准标签同样为ais字段。此设置考验模型在段落被翻译为英语后能否正确完成归因是评估跨语言迁移能力的核心场景。3. 复现论文设置的混合用法论文中的实验采用语内与跨语言归因的混合设置具体使用哪段段落取决于 CoRA 系统实际检索到的段落语言。复现方式为根据passage_retrieved_language字段判断——若检索段落为原语言则选取passage_in_language否则选取passage_en。各划分的数据规模统计语内设置In-Language Setting按语言及训练/验证集统计划分样本数bn孟加拉语1407fi芬兰语659ja日语954ru俄语634te泰卢固语1066train训练集250validation验证集500英语设置In-English Setting按语言统计划分样本数bn567fi812ja1262ru790te443此外官方还提供了一套特殊的训练/验证资源验证集由每种语言各 100 条样本组成5 种语言合计 500 条训练集则精选 50 条高置信度样本所有标注者对ais标签意见一致。这一设计使研究者可以在标注量很小的情况下快速微调或评估归因模型。引用方式若在研究中使用了 XOR-AttriQA请按以下 BibTeX 引用article{muller2023evaluating, title{Evaluating and Modeling Attribution for Cross-Lingual Question Answering}, author{Muller, Benjamin and Wieting, John and Clark, Jonathan H and Kwiatkowski, Tom and Ruder, Sebastian and Soares, Livio Baldini and Aharoni, Roee and Herzig, Jonathan and Wang, Xinyi}, journal{arXiv preprint arXiv:2305.14332}, year{2023} }小结XOR-AttriQA 的价值在于将归因评测从单语场景扩展到多语言与跨语言场景通过passage_in_language/passage_en与passage_retrieved_language的组合研究者可以灵活构建语内、跨语言以及贴近真实检索流程的混合归因任务。配合ais金标准标签、interpretability可理解性标签和按语言/置信度划分的数据结构该数据集既适合作为基准评测也适合作为低资源场景下归因模型训练与研究的起点。【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
3步拆解yoke源码,新手避坑指南助你从零落地实战 3步拆解yoke源码,新手避坑指南助你从零落地实战 看了一堆教程还是不会写项目?这种挫败感我太熟悉了。很多人卡在“看懂了”和“做出来”之间的鸿沟,根本原因在于缺乏对核心源码逻辑的拆解能力,这也是 新手避坑… · 2026/9/23 4:39:52
英伟达显卡排行2024版:一文搞懂选型避坑指南 英伟达显卡排行2024版:一文搞懂选型避坑指南 版本升级后 API 全变了,这大概是无数开发者在配置新环境时最崩溃的瞬间。你刚把 CUDA 12 装好,发现 PyTorch 的旧接口直接报错,或者 TensorFlow… · 2026/9/23 4:39:52
Flutter与OpenHarmony在留守儿童帮扶平台的应用实践 1. 项目背景与核心价值留守儿童帮扶平台作为社会公益类应用的特殊分支,其技术实现需要兼顾功能实用性和情感温度。"最近帮扶记录"模块作为平台的核心功能组件,承担着连接帮扶者与被帮扶者的重要纽带作用。这个模块不仅要实现基础的数据记录功能… · 2026/9/23 4:39:46
google搜索屏蔽3种主流方案对比:新手避坑指南 google搜索屏蔽3种主流方案对比:新手避坑指南 版本升级后 API 全变了,这种痛苦谁懂?上周刚把爬虫集群从 Selenium 4.10 升到 4.15,原本跑得飞快的登录态保持逻辑瞬间失效,报错信息从… · 2026/9/23 21:01:15
微信二次开发如何做客户会话分级?WechatApi 让普通咨询、售后和投诉走不同流程 官网友情链接: wechatapi.net 很多微信机器人项目做到后面,会遇到一个明显瓶颈: 所有客户消息都走同一个流程。
客户问:
“资料在哪里?”
和客户说:
“系统已经影响业务,我要投诉。”
系统… · 2026/9/23 21:01:15
PHPStan 错误标识 `new.trait` 全解析:为什么不能 `new` 一个 Trait,以及如何修复 开发工具代码质量静态分析 【免费下载链接】phpstan PHP Static Analysis Tool - discover bugs in your code without running it! 项目地址: https://gitcode.com/gh_mirrors/ph/phpstan 点击查看 免费下载 new.trait 是 PHPStan 静态分析器(phpstan&… · 2026/9/23 21:01:15
3个案例讲透腐败巨人观性能优化 3个案例讲透腐败巨人观性能优化 复制来的代码跑不通,不知道哪里卡住,这是无数开发者深夜加班时的真实写照。面对【腐败巨人观】这类复杂场景,很多新人只会盲目改参数,却忽略了底层逻辑的 性能优化… · 2026/9/23 21:01:08
D365升级踩坑实录:3个API变更让新手避坑指南 D365升级踩坑实录:3个API变更让新手避坑指南 凌晨三点,服务器告警刷屏。刚把 Dynamics 365 环境从 v9 升到 v9.1,前端页面直接白屏。控制台报的错密密麻麻,全是 ReferenceError: window.Xrm… · 2026/9/23 21:01:01
蘑菇识别系统源码实战:从图像分类到PyTorch模型训练全流程解析 简介:这份Python蘑菇识别系统源码是一套基于深度学习的完整图像识别项目,面向熟悉Python基础、希望系统学习图像分类与计算机视觉的开发者,也适合生物、农业领域需要自动化识别蘑菇种类的技术人员作为参考。压缩包共54个文件、大小约31MB&… · 2026/9/23 21:00:46
3招搞定手机怎么下载微信面试难题实战项目解析 3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29