数据目录AI Agent人工智能知识管理示例工程【免费下载链接】knowledge-catalogGoogle Cloud Knowledge Catalog Tools and Samples项目地址https://gitcode.com/gh_mirrors/kn/knowledge-catalog点击查看免费下载bad_question_flag_ratio不良提问标记率是 knowledge-catalog 仓库中 Stack Overflow 知识包okf/bundles/stackoverflow提供的一项社区治理指标它衡量问题被标记为垃圾广告Spam或攻击性内容Offensive的标记在所有标记/投票中的占比。本文以该指标的 原始参考文档 为核心骨架结合votes表结构、VoteTypeId枚举查表以及仓库中的连接Join参考讲解指标含义、SQL 计算公式、底层字段依据并给出可在 BigQuery 上直接运行的实际查询示例帮助读者在 Stack Overflow 公开数据上复现该指标用于追踪垃圾信息攻击波次或内容违规趋势。指标概述什么是 bad_question_flag_ratio在 Stack Overflow 的公开数据模型中votes表记录了对帖子的所有投票与标记行为其中vote_type_id是标识投票/标记类型的整型枚举。根据 Vote Types Reference 查表VoteTypeId 4表示Offensive攻击性/辱骂内容VoteTypeId 12表示Spam垃圾广告。这两类都属于内容不当标记与普通的质量投票如 UpMod/DownMod性质不同。bad_question_flag_ratio正是基于上述两类标记定义的比率型指标它计算标记为垃圾广告或攻击性内容的标记数量占该问题全部标记votes 记录数量的比例。从原始文档的定义看该指标的价值在于它是一个内容健康度的早期预警信号——当某个问题或某个时间窗口内的该比率显著升高时往往意味着正在经历垃圾信息攻击波次spam attack waves或者存在高度不当的内容趋势highly inappropriate content trends可用于指导审核资源调度与社区治理决策。该指标在仓库中的定位如下定义于 okf/bundles/stackoverflow/references/metrics/bad_question_flag_ratio.mdfrontmatter 标注type: Reference、tags: [metric, votes, moderation]被 votes 表文档 的 Metrics 一节引用作为基于 votes 数据可直接计算的治理指标与其并列的另一个指标是 Accepted Answer Rate二者共同构成该知识包 references/metrics 目录下的指标集见 metrics 索引。指标公式SQL 定义逐行解读原始文档给出的公式如下SAFE_DIVIDE( COUNTIF(VoteTypeId IN (4, 12)), COUNT(Id) )逐部分拆解片段含义说明COUNTIF(VoteTypeId IN (4, 12))分子统计vote_type_id为 4Offensive或 12Spam的标记数量COUNT(Id)分母统计votes表或分组后的问题中所有投票/标记记录总数SAFE_DIVIDE(...)除法保护BigQuery 标准函数当分母为 0 时返回NULL而非抛出除零错误保证查询可稳定运行需要说明两点使用前提字段命名公式中的VoteTypeId与Id采用驼峰写法对应 Stack Overflow 公开数据转储dump与 SEDEStack Exchange Data Explorer的 schema 命名习惯而在 BigQuery 公开数据集中votes 表 的实际列名为小写下划线风格id、creation_date、post_id、vote_type_id。因此在实际查询时需要做对应的字段名映射见下文实际查询示例。指标含义原始文档将其描述为问题上的垃圾/攻击性标记占全部标记的比例ratio of spam and offensive flags to overall votes/flags。要将其限定在问题粒度需要借助 posts ↔ votes 连接ON votes.post_id posts.id与 posts_questions 表 关联才能只统计问题帖子而非答案、wiki 等其他帖子类型。底层数据依据votes 表与 VoteTypeId 枚举该指标的数据基础是 BigQuery 公开数据集bigquery-public-data.stackoverflow中的votes表。根据 votes 表文档其 schema 包含id投票/标记的唯一标识符creation_date投票发生时间隐私原因时间信息被截断为00:00:00post_id被投票帖子的标识符可连接posts_questions、posts_answers等表获取帖子详情vote_type_id投票/标记的类型需配合枚举查表解码。而 Vote Types Reference 提供了完整的VoteTypeId查表目录共 37 个枚举值与本指标直接相关的两个关键值如下VoteTypeIdNameDescription4OffensiveFlagged as offensive or abusive被标记为攻击性或辱骂内容12SpamFlagged as spam被标记为垃圾广告其余枚举值如2 UpMod点赞、3 DownMod点踩、1 AcceptedByOriginator采纳、8/9 BountyStart/BountyClose悬赏等与本指标无关但在进行比率对比分析时可以作为整体 votes的构成参考——这正是分母COUNT(Id)统计全部记录的意义所在该比率本质上刻画的是不当标记在全部投票行为中的异常占比。此外Stack Overflow 公开数据集的整体背景可参考 数据集文档该数据集位于 BigQuery 的US多区域数据最后更新于 2022-11-25之后不再由原始来源主动更新。这意味着基于该数据集计算出的指标反映的是截至 2022 年 11 月的数据快照适用于历史分析与方法演示不适合作为实时监控指标。实际查询示例在 BigQuery 上复现该指标结合上述字段映射与连接路径下面给出三种可直接在 BigQuery 控制台运行的实际查询。1. 全局粒度整个数据集的不良标记比率SELECT SAFE_DIVIDE( COUNTIF(vote_type_id IN (4, 12)), COUNT(id) ) AS bad_question_flag_ratio FROM bigquery-public-data.stackoverflow.votes2. 问题粒度仅统计问题帖子的标记比率借助 posts ↔ votes 连接votes.post_id posts.id与 posts_questions 表其中post_type_id 1表示问题见 Post Types Reference 的枚举语义SELECT SAFE_DIVIDE( COUNTIF(v.vote_type_id IN (4, 12)), COUNT(v.id) ) AS bad_question_flag_ratio FROM bigquery-public-data.stackoverflow.votes AS v JOIN bigquery-public-data.stackoverflow.posts_questions AS q ON v.post_id q.id3. 时间趋势按年观察垃圾信息攻击波次由于该指标在文档中被定位为追踪垃圾信息攻击波次或高度不当内容趋势的信号按时间分组观察变化趋势是更贴近实战的用法注意votes 表的creation_date时间被截断到00:00:00按年聚合不受影响SELECT EXTRACT(YEAR FROM v.creation_date) AS vote_year, COUNTIF(v.vote_type_id IN (4, 12)) AS bad_flags, COUNT(v.id) AS total_votes, SAFE_DIVIDE( COUNTIF(v.vote_type_id IN (4, 12)), COUNT(v.id) ) AS bad_question_flag_ratio FROM bigquery-public-data.stackoverflow.votes AS v GROUP BY vote_year ORDER BY vote_year关于 SAFE_DIVIDE 的健壮性说明当某个分组如某一年、某个问题没有任何 votes 记录时分母COUNT(id)为 0此时普通除法会抛出Division by zero错误。公式使用SAFE_DIVIDE会在这种情况下返回NULL从而保证查询在任何分组粒度下都能稳定执行。若业务上希望将无记录分组显示为 0 而不是 NULL可在外层再包一层IFNULL(...)或COALESCE(...)处理。指标解读与治理应用建议结合文档定位与仓库中的相关参考使用该指标时有几点实践建议作为相对信号而非绝对值使用bad_question_flag_ratio反映的是不当标记占全部投票的比例其绝对值受社区整体投票活跃度影响更稳健的做法是比较同一时间窗口内的相对变化环比/同比识别异常抬升。结合时间维度追踪攻击波次垃圾广告通常以短时突发的形式出现按天/按周/按月聚合比率可帮助识别 spam attack waves 的起止时间窗为审核队列调度提供数据支撑。配合问题过滤条件聚焦内容治理通过 join posts_questions 并利用post_type_id 1、tags标签以|分隔等字段可以进一步分析哪些标签、哪些时间段的问题更容易出现不当内容。注意数据集时效性BigQuery 中的 Stack Overflow 公开数据集最后更新于 2022-11-25见 数据集文档任何基于该数据的结论都应注明时间范围如需实时治理监控应基于 Stack Overflow API 或 SEDE 的增量数据自行构建。仓库中的实现与文档组织方式该指标文档是 knowledge-catalog 仓库中 Stack Overflow 知识包的一部分其组织方式体现了 Open Knowledge FormatOKF的规范每篇参考文档带有 YAML frontmattertype、resource、title、description、tags、generated、sources正文包含定义与公式。从源码角度补充两点可验证的事实文档的generated字段by: reference_agent/gemini-3.5-flash、at: 2026-07-10T23:02:4400:00表明该指标定义由仓库中的 reference_agent 工具链自动生成其 frontmatter 解析、校验逻辑实现在 okf/src/reference_agent/bundle/document.pyOKFDocument.parse负责解析 YAML frontmatter 与正文。该文档对VoteTypeId取值的引用4 Offensive、12 Spam与 Vote Types Reference 查表完全一致后者又引用了 Meta Stack Exchange 的公开 schema 文档作为来源形成指标 → 枚举查表 → 原始 schema 文档的证据链。如何在仓库中查看与使用该指标指标定义okf/bundles/stackoverflow/references/metrics/bad_question_flag_ratio.md指标索引okf/bundles/stackoverflow/references/metrics/index.md数据表依据votes 表枚举依据Vote Types Reference连接路径posts ↔ votes数据集背景Stack Overflow 公开数据集知识包入口okf/bundles/stackoverflow/index.md读者可以直接基于本文第三节的 SQL 示例在 BigQuery 控制台对bigquery-public-data.stackoverflow数据集运行查询复现bad_question_flag_ratio指标并开展社区内容健康度分析。赞分享数据目录AI Agent人工智能知识管理示例工程【免费下载链接】knowledge-catalogGoogle Cloud Knowledge Catalog Tools and Samples项目地址https://gitcode.com/gh_mirrors/kn/knowledge-catalog点击查看免费下载相关推荐Gitingest 贡献指南从环境搭建到 Pull Request 的完整开发工作流Gitingest 贡献指南从环境搭建到 Pull Request 的完整开发工作流 本篇技术指南以仓库根目录的 CONTRIBUTING.md https:数据目录AI Agent人工智能知识管理示例工程FunASR OpenAI 兼容 API 低代码工作流接入指南Dify、n8n、HTTP 节点与 Webhook Worker 实战配方FunASR OpenAI 兼容 API 低代码工作流接入指南Dify、n8n、HTTP 节点与 Webhook Worker 实战配方 导读 本文面向希望让数据目录AI Agent人工智能知识管理示例工程Sa-Token 搭建 OAuth2-Server从零实现授权码、隐式、密码与客户端凭证四种授权模式Sa Token 搭建 OAuth2 Server从零实现授权码、隐式、密码与客户端凭证四种授权模式 本文基于 Sa Token 开源权限认证框架完整演示如数据目录AI Agent人工智能知识管理示例工程上一篇CANN Ascend C向量左移API下一篇国产模型性能终极对决MiniCPM3-4B与Yi-6B全方位评测指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
中层领导用人管人实战:从知人到善任的决策框架与验证闭环 简介:这份PDF资料聚焦中层管理者的用人管人难题,面向企业中层干部、团队负责人及希望提升领导力的职场人,系统讲解如何以“知人”为用人前提,做到人尽其才、驾驭人性。内容围绕知人善任展开,涵盖识人原则、考察人才的基… · 2026/9/25 5:50:52
雅思写作高分技巧:逻辑与论证的黄金法则 1. 雅思写作的本质认知误区破除第一次接触雅思写作的考生往往陷入三个典型误区:认为复杂词汇等于高分、长难句决定分数上限、模板化结构能保底6分。实际上,这些认知偏差恰恰是阻碍突破7分的隐形屏障。我在雅思写作教学中反复验证的核心规律是:… · 2026/9/25 5:50:52
AI生成代码安全审查:三条信任边界与实操指南 1. 为什么“看代码对不对”这条路走不通了1.1 从人工审查到AI生成代码的范式转移过去我们审查代码,核心逻辑是“找bug”——变量有没有初始化、循环边界对不对、异常有没有捕获、SQL有没有拼接。这套方法论建立在一个人写代码、另一个人读代码的基础上,审… · 2026/9/25 6:24:24
家教APP选师引擎设计:三层证据链驱动的信任推荐系统 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 6:24:24
AI PLC落地指南:新设备选型与存量产线智能升级全攻略 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 6:24:18
HDDSuperClone 数据克隆实战:坏盘扇区级备份与 Rust 跨平台工具解析 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 6:24:18
华为昇腾Atlas 300V部署YOLO全流程:从环境配置到性能调优 熟悉Atlas这块东西的朋友,应该都遇到过这种场面:一说“atlas”,搞数据库的想到360开源的那个MySQL中间件,玩机器人的想到波士顿动力的双足机器人,做地图的甚至能想到Meta的内部地图项目。但如果你最近在AI推理圈子混&a… · 2026/9/25 6:24:18
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37