首页/新闻资讯/正文详情

AutoBangumi 解析器配置指南:RSS 标题解析引擎、语言与全局过滤规则

发布时间:2026/9/27 7:57:21 来源:云帆数科 栏目:资讯中心
AutoBangumi 解析器配置指南:RSS 标题解析引擎、语言与全局过滤规则
后端前端音视频【免费下载链接】Auto_BangumiAutoBangumi - 全自动追番工具项目地址https://gitcode.com/gh_mirrors/au/Auto_Bangumi点击查看免费下载AutoBangumi 的解析器Parser负责从 RSS 条目标题中抽取结构化的番剧元数据标题、季、集数、字幕组等是「RSS 订阅 → 自动下载 → 自动重命名」整条自动化链路的第一环。本文以官方文档 Parser Settings 为主体结合仓库源码深入讲解 WebUI 与config.json中的rss_parser配置段、Classic 与 Universaltokenizer两套解析引擎的差异、语言偏好与全局过滤规则的底层实现。读完本文你将掌握如何按番剧源、标题语言和下载需求精确调优解析行为并能理解为何某些标题会被解析器接纳、另一些会被过滤或拒绝。解析器在整条流水线中的定位RSS 源里每一条 item 的title并非结构化数据而是类似[字幕组] 作品名 S02E05 1080p HEVC这样的自由文本。解析器的职责就是把这条文本拆解为可落库的字段官方标题、原始标题、季度season、集数episode、字幕组group、分辨率resolution、片源source、字幕语言subtitle等供后续的 Bangumi 管理模块完成剧集匹配与重命名。自 v3.1 起每个 RSS 源的解析器source parser在新增或编辑该订阅时单独配置本页Parser 设置页不再决定某个源用哪个解析器而是控制以下四类全局行为全局开关Enable标题解析引擎Title parserClassic 或 Universal/Preview解析语言偏好Language全局排除规则Exclude即过滤关键字。这一职责划分意味着如果你需要针对不同 RSS 源使用不同解析器应回到「新增 / 编辑 RSS」界面操作而页面上的四项设置会作为所有订阅的默认基调生效。WebUI 配置项详解解析器设置页提供四个配置项Enable是否启用 RSS 解析。关闭后新拉取的 RSS 条目将不再走标题解析流程也就无法生成可订阅的番剧条目。Title parser标题解析器Classic parser (Stable)经典解析器保持既有行为兼容性最稳Universal parser (Preview)通用解析器预览新增对**剧集区间episode ranges、OVA、剧场版movies与混合合集mixed collections**的支持。两种引擎永远不会静默互相回退即选择了 Classic 就只会用 Classic 的结果选择了 Universal 就只会用 Universal 的结果不存在「解析失败自动切换引擎」的隐式行为。Language语言解析器偏好语言支持zh、jp、en三个取值用于决定抽取出的多语言标题中哪一个作为「官方标题official title」。Exclude排除全局过滤规则支持纯字符串与正则表达式命中规则的 RSS 条目会被直接丢弃不会进入解析与下载流程。注意rss_parser配置段在 3.1.x 时代还包含type、custom_url、token、enable_tmdb等字段这些字段已在配置迁移逻辑中被移除旧配置文件加载时会自动清洗见 conf/config.py。config.json中的rss_parser配置段config.json中对应配置段为rss_parser与 WebUI 字段一一对应Key描述类型WebUI 字段默认值enable启用 RSS 解析器booleanEnabletrueengine标题解析引擎classic或tokenizerstringTitle parserclassicfilter全局过滤规则string arrayExclude[720, \\d-\\d]language解析语言stringLanguagezh配置模型定义于 models/config.py 中的RSSParser各字段含义与默认值均可在源码中确认。一个完整的config.json片段示例{ rss_parser: { enable: true, engine: classic, filter: [720, \\d-\\d], language: zh } }其中filter的默认值[720, \\d-\\d]表达了两个语义720排除所有标题含720的条目默认偏好 1080p 及以上资源\d-\d排除形如12-24的剧集区间标题默认不收集整包合集而是按单集收集。配置文件路径遵循项目惯例开发环境DEV_VERSION读取config/config_dev.json正式环境读取config/config.json见 conf/config.py。双引擎机制Classic 与 Universaltokenizer的差异与选择engine字段取值由源码中的ParserEngine类型约束为classic | tokenizer见 analyser/selector.py。引擎选择逻辑位于 selector.py 的_configured_engine()读取settings.rss_parser.engine若取值不在{classic, tokenizer}内则直接抛出ValueError不会静默纠正为合法值——这一点与文档「引擎永不静默互退」的承诺一致。engine getattr(settings.rss_parser, engine, classic) if engine not in {classic, tokenizer}: raise ValueError(fUnsupported RSS parser engine: {engine!r})两条引擎路径分别是classic 引擎对应 tokenizer/classic.py实现为「证据导向」的顺序解析用一系列正则识别季S\d|Season \d|第N季等、集数EP n、第N话、NPre、N(N)等、OVA/OAD/SP、剧场版劇場版、Gekijou-ban、Movie、合集Complete Batch、合集|全集|特典、分辨率720p|1080p|2160p|4K、片源WEB-DL|BDRip|WebRip|Baha|AT-X等并把已消费的片段打掩码后从剩余文本重建标题。经典引擎只做「删除被识别的标记」不会因为某个标记就重分类整个标题片段。tokenizerUniversal/Preview引擎对应 tokenizer/parser.py在 classic 的基础上引入Claims、Candidate与候选解析resolve_candidates额外支持剧集区间如7-12、OVA、剧场版与混合内容集mixed collection并输出ParseTrace诊断轨迹。它同样遵循「记录精确匹配区间、只删除这些区间、用剩余文本重建标题」的原则但候选消解能力让它能处理经典引擎无法区分的边界情况。对大多数用户而言追求稳定、沿用既有订阅行为时选classic遇到区间合集、OVA/剧场版混杂、或希望获得更丰富解析结果时可在预览环境试用tokenizer。需要留意的是两者能力差异不会自动互补——选中某一引擎后另一引擎的结果不会被采纳。从源码结构还可以推断selector.py中的parse_configured_release_title_with_trace会为 tokenizer 引擎附带ParseTrace而 classic 引擎不产生 trace这为调试「某标题为何被解析成这个结果」提供了更细粒度的诊断通道对应 selector.py。language 字段如何决定官方标题language决定解析出的多语言标题title_zh/title_en/title_jp中哪一个被优先采用为official_title。核心逻辑在 title_parser.py 的_resolve_titles()titles { zh: release.title_zh, en: release.title_en, jp: release.title_jp, } title_raw release.title_en or release.title_zh or release.title_jp if titles[language]: official_title titles[language] elif titles[zh]: official_title titles[zh] elif titles[en]: official_title titles[en] elif titles[jp]: official_title titles[jp]即优先使用所选语言的标题若该语言缺失则按zh → en → jp的固定顺序回退title_raw原始标题同样按en → zh → jp取一个非空值兜底。official_title后续还会用于 TMDB 匹配与海报抓取见 title_parser.py 的tmdb_poster_parser()其中使用settings.rss_parser.language作为 TMDB 查询语言。因此若你的媒体库习惯使用中文标题保持默认language: zh即可若以英文名归档可改为en日文原名控则可设为jp。filter 全局过滤规则的底层实现filter是字符串数组在两条路径上生效1. RSS 拉取阶段请求层过滤network/request_contents.py 的get_torrents()在解析 XML 后把settings.rss_parser.filter用|连接成一个正则对每个条目标题执行re.search命中即丢弃_filter |.join(settings.rss_parser.filter) # A blank filter means exclude nothing — re.search(, x) matches # every string, which would otherwise exclude everything. if not _filter or re.search(_filter, _title) is None: torrents.append(Torrent(name_title, urltorrent_url, homepagehomepage))这里有个值得注意的细节过滤列表为空时表示「什么都不排除」——源码注释明确指出如果允许空模式执行re.search(, x)它会匹配任意字符串反而会把所有条目全部排除因此代码对空过滤做了短路处理。2. 番剧级过滤匹配阶段解析并入库的番剧会把全局过滤串存入自身的filter字段见 title_parser.py 中filter,.join(settings.rss_parser.filter)的赋值。在后续种子匹配时rss/engine.py 的_get_filter_pattern()将逗号替换为|编译正则并做了正则合法性兜底若包含非法正则字符如未闭合的[导致编译失败则退化为对每个词条re.escape后做字面匹配raw_pattern filter_str.replace(,, |) try: self._filter_cache[filter_str] re.compile(raw_pattern, re.IGNORECASE) except re.error: terms filter_str.split(,) escaped |.join(re.escape(t) for t in terms) self._filter_cache[filter_str] re.compile(escaped, re.IGNORECASE)因此filter既支持正则如720会命中720p也支持纯字符串且无论哪种写法匹配都是大小写不敏感的。需要补充说明的是只有通过排除过滤的种子才会关联bangumi_id进入收集流程——被过滤掉的种子不会挂在番剧名下以避免它们污染后续的 offset 建议计算见 rss/engine.py 的match_torrent()相关注释。配置迁移与兼容性提示从 3.1.x 升级时旧rss_parser配置中的废弃字段会被自动移除type、custom_url、token、enable_tmdb迁移逻辑位于 conf/config.py 的_migrate_old_config()。仓库测试对迁移行为有明确覆盖test_migration.py断言settings.rss_parser.filter [720, \\d-\\d]得以保留test_config.py亦验证默认过滤项720存在。这意味着升级后enable、filter、language、engine这些有效字段会被原样保留无需手动重配。实战调优建议默认配置即可开箱即用enabletrue、engineclassic、filter[720,\\d-\\d]、languagezh覆盖了大多数常规追番场景——默认排除 720p 与区间合集优先中文标题。需要收集多集打包/区间合集时要么从filter中移除\d-\d全局生效要么在单个 RSS 源/番剧级别调整同时可考虑切换tokenizer引擎以获取更准确的区间、OVA 与剧场版识别。偏好某个字幕组或分辨率版本可在番剧编辑界面设置发布组/分辨率偏好配合filter排除不想要的版本如[720, \\d-\\d, Baha]减少重复下载与后续去重负担。排查解析异常优先检查 RSS 源级别配置的 source parser 是否与全局engine一致若切换引擎后行为变化需接受两引擎不会互退的事实并善用 tokenizer 的解析轨迹进行诊断。解析器配置是整个自动追番体验的「入口把关者」理解rss_parser四项配置与其底层实现能帮你精准控制哪些资源进入媒体库、以什么语言归档从而让 AutoBangumi 的下载与重命名链路更加贴合个人收藏习惯。赞分享后端前端音视频【免费下载链接】Auto_BangumiAutoBangumi - 全自动追番工具项目地址https://gitcode.com/gh_mirrors/au/Auto_Bangumi点击查看免费下载相关推荐AutoBangumi 解析器设置完全指南标题解析引擎、语言偏好与全局过滤规则AutoBangumi 解析器设置完全指南标题解析引擎、语言偏好与全局过滤规则 AutoBangumiAB的解析器是整个自动化追番流水线的核心入口它读取后端前端音视频AutoBangumi 解析器设置完全指南rss_parser 引擎、语言偏好与全局过滤规则AutoBangumi 解析器设置完全指南rss_parser 引擎、语言偏好与全局过滤规则 AutoBangumi 的解析器Parser负责从 RSS后端前端音视频AutoBangumi RSS 订阅设置完全指南Mikan Project 链接获取、过滤规则与解析限制AutoBangumi RSS 订阅设置完全指南Mikan Project 链接获取、过滤规则与解析限制 AutoBangumi 的核心工作模式是自动解析聚后端前端音视频上一篇Foundation Sites与Laravel集成PHP后端的前端分离终极指南下一篇告别空白首屏Vditor服务端渲染的SEO与性能优化指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

换机照片怎么迁移才靠谱?6种方案对比,原图与备份一次讲清
换机照片怎么迁移才靠谱?6种方案对比,原图与备份一次讲清

换手机时,照片迁移最需要关注的不是单纯的“速度”,而是文件有没有完整过去、原始信息有没有变化,以及迁移完成后有没有备用副本。如果只有几百张照片,手机直连通常就能解决;但面对几千甚至上万张照片,尤其… · 2026/9/27 7:57:21

Woodpecker Kubernetes 后端:在 Kubernetes 集群中运行 CI 管道的完整指南
Woodpecker Kubernetes 后端:在 Kubernetes 集群中运行 CI 管道的完整指南

CI/CDDevOps 【免费下载链接】woodpecker Woodpecker is a simple, yet powerful CI/CD engine with great extensibility. 项目地址: https://gitcode.com/gh_mirrors/wo/woodpecker 点击查看 免费下载 Woodpecker 的 Kubernetes(K8s)后端将… · 2026/9/27 7:57:08

ai-marketing-skills 外呼引擎:从 ICP 定义到冷邮件入箱的全自动流程
ai-marketing-skills 外呼引擎:从 ICP 定义到冷邮件入箱的全自动流程

ai-marketing-skills 外呼引擎:从 ICP 定义到冷邮件入箱的全自动流程 【免费下载链接】ai-marketing-skills Open-source AI marketing skills — growth experiments, sales pipeline, content ops, outbound, SEO, and finance automation 项目地址: https://gi… · 2026/9/27 7:57:02

微服务分布式链路灰度发布:基于 Spring Cloud Gateway 与 Ribbon/LoadBalancer 请求头流量染色的全链路隔离
微服务分布式链路灰度发布:基于 Spring Cloud Gateway 与 Ribbon/LoadBalancer 请求头流量染色的全链路隔离

微服务分布式链路灰度发布:基于 Spring Cloud Gateway 与 Ribbon/LoadBalancer 请求头流量染色的全链路隔离在大型分布式微服务集群(包含前端 App、API 网关、中台服务 A、下游服务 B、消息队列 MQ 与底层数据库)中,“全链路灰度发… · 2026/9/27 8:43:26

Operit 主题编辑器草稿验证指南:目标作用域、会话持久化与路由守卫的静态检查与手动回归
Operit 主题编辑器草稿验证指南:目标作用域、会话持久化与路由守卫的静态检查与手动回归

AI Agent人工智能大模型AI 应用工具调用本地部署MCP ClientsAgent 记忆 【免费下载链接】Operit The most powerful AI agent and AI chat software on Android/Operit是一款Android上能力最为强大、发展最久的AI Agent 项目地址: https://gitcode.com/gh_mirrors/o… · 2026/9/27 8:43:14

RemoveWindowsAI 移除 Windows AI:Copilot 和 Recall 能被永久删掉吗?
RemoveWindowsAI 移除 Windows AI:Copilot 和 Recall 能被永久删掉吗?

RemoveWindowsAI 移除 Windows AI:Copilot 和 Recall 能被永久删掉吗? 【免费下载链接】RemoveWindowsAI Force Remove Copilot, Recall and More in Windows 11 项目地址: https://gitcode.com/GitHub_Trending/re/RemoveWindowsAI 你一定遇到这… · 2026/9/27 8:43:08

不良网站举报中心官网搭建避坑:5步搞定域名服务器配置
不良网站举报中心官网搭建避坑:5步搞定域名服务器配置

不良网站举报中心官网搭建避坑:5步搞定域名服务器配置 很多刚接手这类敏感项目的朋友,第一反应就是头大。域名备案卡住、服务器被墙、SSL证书报错,这些“域名服务器搞不懂”的瞬间,足以让一个上线计划推迟半个月。其实,这类涉及公共利益的… · 2026/9/27 8:42:55

如何免费导出并分析全部微信聊天记录:WeChatMsg 使用指南
如何免费导出并分析全部微信聊天记录:WeChatMsg 使用指南

如何免费导出并分析全部微信聊天记录:WeChatMsg 使用指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/We… · 2026/9/27 8:42:43

Chaos Mesh 深入解析:Kubernetes 云原生混沌工程平台的架构、特性与快速上手指南
Chaos Mesh 深入解析:Kubernetes 云原生混沌工程平台的架构、特性与快速上手指南

云原生运维测试可观测性 【免费下载链接】chaos-mesh A Chaos Engineering Platform for Kubernetes. 项目地址: https://gitcode.com/gh_mirrors/ch/chaos-mesh 点击查看 免费下载 Chaos Mesh 是一个开源的、云原生的 Kubernetes 混沌工程平台,它通过 … · 2026/9/27 8:42:43

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码