人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载导读Skill Seekers 是一个面向 AI 系统的数据层开源项目它把文档网站、GitHub 仓库、PDF、视频、Notebook、Wiki 等18 种来源统一转化为结构化知识资产并导出到 Claude、Gemini、OpenAI 等 AI 技能平台以及 LangChain、LlamaIndex、Pinecone 等 RAG 管道与 Cursor、Windsurf、Cline 等 AI 编码助手共22 个导出目标。读完本文你将掌握从安装、抓取、AI 增强到打包、上传、安装进各类 Agent 的完整实战链路并理解其背后基于SkillAdaptor抽象与统一调度器的源码实现原理。1. 项目定位一次准备多处使用Skill Seekers 的核心定位是The data layer for AI systemsAI 系统的数据层。它并不直接提供模型而是负责把人类可读的文档/代码/资料加工成 AI 可以直接消费的结构化知识资产使用场景输出物服务对象AI Skills完整的SKILL.md 参考文件Claude Code、Gemini、GPTRAG 管道带丰富元数据的分块文档LangChain、LlamaIndex、Haystack向量数据库可直接 upsert 的预格式化数据Pinecone、Chroma、Weaviate、FAISS、QdrantAI 编码助手IDE AI 自动读取的上下文文件Cursor、Windsurf、Cline、Continue.dev这一一次准备、四处消费的设计意味着抓取和增强工作只需要做一遍随后任意目标平台都可以直接复用无需重新抓取。2. 安装按需选择 extras项目要求Python 3.10与 Git。基础安装极其简单pip install skill-seekers # 核心抓取、GitHub、PDF、打包 pip install skill-seekers[all-llms] # 所有 LLM 平台 pip install skill-seekers[mcp] # MCP 服务器 pip install skill-seekers[all] # 全部如果拿不准需要哪些能力可以直接运行配置向导skill-seekers-setup项目的安装 extras 采用按需扩展策略下表来自 README.md 并对应仓库内的实现模块安装项额外能力skill-seekers[gemini]Google Gemini 支持skill-seekers[openai]OpenAI ChatGPT 支持skill-seekers[all-llms]全部 LLM 平台skill-seekers[mcp]面向 Claude Code、Cursor 等的 MCP 服务器skill-seekers[video]YouTube/Vimeo 字幕与元数据提取skill-seekers[video-full]额外包含 Whisper 转录与视觉帧提取skill-seekers[jupyter]Jupyter Notebook 支持skill-seekers[pptx]PowerPoint 支持skill-seekers[confluence]Confluence wiki 支持skill-seekers[notion]Notion 页面支持skill-seekers[rss]RSS/Atom feed 支持skill-seekers[chat]Slack/Discord 聊天导出支持skill-seekers[asciidoc]AsciiDoc 支持skill-seekers[all]全部提示视频视觉依赖是 GPU 感知的。安装skill-seekers[video-full]后执行skill-seekers create --setup会自动检测 GPU 并安装匹配的 PyTorch 变体与 easyocr。新手可先阅读 Bulletproof Quick Start 快速上手。3. 快速开始3 条命令产出第一个 SkillSkill Seekers 的完整工作流只需三条命令# 1. 安装 pip install skill-seekers # 2. 从任意来源创建技能自动检测来源类型 skill-seekers create https://docs.djangoproject.com/ # 可选在不创建任何内容的前提下预览来源的检测结果 skill-seekers detect https://docs.djangoproject.com/ --json # 3. 为你的 AI 平台打包 skill-seekers package output/django --target claude执行完毕后当前目录下会得到output/django-claude.zip一个开箱即用的 Claude Skill。默认 AI 增强代理是claude也可以随时切换skill-seekers create https://docs.djangoproject.com/ --agent kimi skill-seekers create https://docs.djangoproject.com/ --agent-cmd my-custom-agent run其中--agent-cmd允许接入任意自定义 CLI 代理为无法直接调用 API 的场景提供了灵活性。3.1 源码视角统一的命令分发入口从源码看所有命令都汇入同一个入口 src/skill_seekers/cli/main.pycreate、detect、scan、doctor、ui采用类式分发Command(args).execute()其余命令enhance、package、upload、install、estimate、quality、workflows、stream、update等通过模块映射分发。这种统一分发表意味着每个子命令既可独立作为skill-seekers-cmd入口运行也能共享主解析器参数。4. 自动检测detect与来源类型判断skill-seekers detect source --json用于不落地任何产物地预览来源类型识别结果非常适合脚本化调用或在 CI 中确认输入类型。自动检测由 src/skill_seekers/cli/source_detector.py 中的SourceDetector类实现它通过 GitHub 仓库名正则owner/repo模式与github.com/...URL 模式识别仓库来源并结合 URL、扩展名与本地路径特征识别 web、local、PDF、config 等类型。值得注意的是从源码注释可以看出Confluence、Notion、Slack/Discord 聊天这类基于 API/导出的来源无法从单个参数自动推断需要走各自专属的子命令--space-key、--database-id、--chat-export-path等。5. 全部 18 种来源类型Skill Seekers 的create命令对输入做统一检测只需把不同类型的源直接当作参数传入skill-seekers create facebook/react # GitHub 仓库 skill-seekers create ./my-project # 本地代码库 skill-seekers create manual.pdf # PDF skill-seekers create report.docx # Word skill-seekers create book.epub # EPUB skill-seekers create notebook.ipynb # Jupyter skill-seekers create openapi.yaml # OpenAPI/Swagger skill-seekers create presentation.pptx # PowerPoint skill-seekers create guide.adoc # AsciiDoc skill-seekers create page.html # 本地 HTML或整个目录 skill-seekers create feed.rss # RSS/Atom skill-seekers create curl.1 # Man page # 视频YouTube、Vimeo 或本地文件——需要 skill-seekers[video] skill-seekers create --video-url https://www.youtube.com/watch?v... --name mytutorial skill-seekers create --setup # 自动安装 GPU 感知的视觉依赖 skill-seekers create --space-key TEAM --name wiki # Confluence skill-seekers create --database-id ... --name docs # Notion skill-seekers create --chat-export-path ./slack-export --name team-chat # Slack/Discord每种来源的详细参数见 Scraping Guide。5.1 源码视角统一调度的来源分派表从 src/skill_seekers/cli/unified_scraper.py 的SOURCE_DISPATCH可以看到多来源抓取是同一套调度逻辑documentation、github、pdf、word、video、local、epub、jupyter、html、openapi、asciidoc、pptx、confluence、notion、rss、manpage、chat各映射到独立的_scrape_*处理函数形成一个统一入口、按类型分发的架构。6. AI 驱动的项目扫描scanscan命令面向已有代码项目让一个 AI 代理读取项目的 manifests、README、Dockerfile/CI 以及采样源码导入语句然后为检测到的每个框架各生成一份配置外加一份针对你自己代码的project-codebase.jsonskill-seekers scan ./my-react-app --out ./configs/scanned/ # → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json skill-seekers create ./configs/scanned/react.json如果某个检测结果没有现成预设AI 会现场生成全新配置退出时还可选择将配置发布回社区注册表。仓库 configs/ 目录中已经存放了多份真实可用的配置示例如 react.json、godot_unified.json、unity-spine.json 等可直接作为skill-seekers create configs/xxx.json的输入。7. 多来源统一配置一份 config 抓取整个知识域create也可以直接接收一份 JSON 配置文件一次性聚合多个来源。以仓库内置的 configs/react.json 为例它同时包含documentationreact.dev 官网带 CSS 选择器、URL 排除规则、主题分类与限速和githubfacebook/react 源码仓库开启代码库分析、issue 与 release 抓取两类来源{ name: react, description: Complete React knowledge base combining official documentation and React codebase insights., version: 1.1.0, merge_mode: rule-based, sources: [ { type: documentation, base_url: https://react.dev/, extract_api: true, selectors: { main_content: article, title: h1, code_blocks: pre code }, url_patterns: { include: [], exclude: [/blog/, /community/] }, categories: { getting_started: [learn, installation, quick-start], components: [components, props, state], hooks: [hooks, usestate, useeffect, usecontext], api: [api, reference], advanced: [context, refs, portals, suspense] }, rate_limit: 0.5 }, { type: github, repo: facebook/react, enable_codebase_analysis: true, code_analysis_depth: deep, fetch_issues: true, max_issues: 100, fetch_changelog: true, fetch_releases: true, file_patterns: [ packages/react/src/**/*.js, packages/react-dom/src/**/*.js ] } ], base_url: https://react.dev/ }merge_mode支持rule-based与ai-enhanced两种合并策略后者对应源码中的AIEnhancedMerger前者对应RuleBasedMerger均位于 src/skill_seekers/cli/merge_sources.py。多来源会先经过冲突检测器conflict_detector.py识别来源间的冲突再进行跨来源配对合成。完整配置格式见 CONFIG_FORMAT.md统一抓取细节见 UNIFIED_SCRAPING.md。8. AI 增强API 模式与 LOCAL 模式所有 AI 调用都通过同一条传输通道完成支持两种模式API 模式Anthropic、Google Gemini、OpenAI、Moonshot/Kimi、MiniMax直接调用云端模型LOCAL 模式Claude Code、Kimi Code、Codex、Copilot、OpenCode 或自定义代理无 API 费用。增强深度由--enhance-level 0-3控制代理选择由--agent指定。最终产出通常是500 行以上、包含示例、模式与指南的SKILL.md。skill-seekers create ./my-project --preset quick # 1–2 分钟浅层 skill-seekers create ./my-project --preset standard # 均衡默认 skill-seekers create ./my-project --preset comprehensive # 深度、穷尽GitHub/代码库分析采用C3.x 三流架构代码流AST、设计模式、测试、文档流README、docs/、wiki、社区流issues、PRs、元数据并内置跨 9 种语言的 10 个 GoF 模式检测器。相关深度文档Enhancement Guide · Enhancement Modes · Multi-Agent SetupPattern Detection · How-To Guides · Test Example Extraction9. 打包导出22 个目标平台package负责把加工好的目录打包成各平台可识别的产物skill-seekers package output/react --target claude # → Claude SkillZIP YAML skill-seekers package output/react --target langchain # → LangChain Documents skill-seekers package output/react --target llama-index # → LlamaIndex TextNodes skill-seekers package output/react --target ibm-bob # → IBM Bob skill 目录完整目标分类如下LLM 平台12 个claude·gemini·openai·minimax·opencode·kimi·deepseek·qwen·openrouter·together·fireworks·markdownRAG 与向量库8 个langchain·llama-index·haystack·chroma·faiss·weaviate·qdrant·pinecone其他2 个atlas·ibm-bob各平台支持细节见 Feature Matrix。9.1 源码视角SkillAdaptor抽象基类22 个目标之所以能共享同一套上游产物是因为它们都实现同一个抽象接口 src/skill_seekers/cli/adaptors/base.py 中的SkillAdaptorABC每个适配器负责平台特定的SKILL.md格式化、打包结构ZIP、tar.gz 等、上传端点与鉴权以及可选的 AI 增强能力。仓库adaptors/目录下的 20 个文件claude.py、gemini.py、openai.py、langchain.py、qdrant.py、weaviate.py等即对应全部导出目标。抓取与增强只需一次打包时按需选择适配器即可。10. 技能内的搜索索引可选skill-seekers create source --index会在生成的技能目录中加入仅依赖标准库的scripts/search.py并基于生成的参考文件构建SQLite FTS5 全文索引。这样 Agent 在通读大型 Markdown 之前可以先通过检索定位到正确的file#anchor显著降低大文档场景的 token 开销。该功能默认关闭且不会改动原始 Markdown 内容。详见 Skill Search Index。11. MCP 集成40 个工具面向主流 IDESkill Seekers 自带 MCP 服务器可接入 Claude Code、Cursor、Windsurf、VS Code Cline、IntelliJ IDEA 等环境# stdio 模式Claude Code、VS Code Cline python -m skill_seekers.mcp.server_fastmcp # HTTP 模式Cursor、Windsurf、IntelliJ python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765启动后即可直接用自然语言驱动整个流水线例如Package and upload the React skill.。从 src/skill_seekers/mcp/server_fastmcp.py 的模块说明可以看到工具按功能划分为配置类generate_config、list_configs、validate_config、抓取类scrape_docs、scrape_github、scrape_pdf、scrape_video等、打包类package_skill、upload_skill、enhance_skill、install_skill、拆分类、来源管理类、市场类与向量库导出类。HTTP 传输的详细用法见 HTTP_TRANSPORT.md。12. 安装到 19 个 AI 编码代理生成的技能可一键安装进19 个 AI 编码代理skill-seekers install-agent output/react/ --agent cursor skill-seekers install-agent output/react/ --agent all # 安装到所有检测到的代理 skill-seekers install-agent output/react/ --agent cursor --dry-run安装位置与作用域对应关系如下摘自 README.md代理路径作用域Claude Code~/.claude/skills/全局Cursor.cursor/skills/项目VS Code / Copilot.github/skills/项目Amp~/.amp/skills/全局Goose~/.config/goose/skills/全局OpenCode~/.opencode/skills/全局Letta~/.letta/skills/全局Aide~/.aide/skills/全局Windsurf~/.windsurf/skills/全局Neovate~/.neovate/skills/全局Roo Code.roo/skills/项目Cline.cline/skills/项目Aider~/.aider/skills/全局Bolt.bolt/skills/项目Kilo Code.kilo/skills/项目Continue~/.continue/skills/全局Kimi Code~/.kimi/skills/全局IBM Bob.bob/skills/项目12.1 上传到 Claudeexport ANTHROPIC_API_KEYsk-ant-... skill-seekers package output/react/ --upload # 打包并上传 skill-seekers upload output/react.zip # 上传已存在的 zip没有 API Key 时也可以打包后手动把output/react.zip上传到 claude.ai/skills。完整流程见 Upload Guide。13. 工作原理五步流水线与 8 大核心模块README 中给出了端到端流水线Scrape → Categorize → Enhance → Package → UploadScrape——提取每个页面优先检查llms.txtCategorize——把内容组织成主题API、指南、教程等Enhance——AI 撰写带示例的完整SKILL.mdPackage——打包为平台就绪产物Upload——可选投递到你的 AI 平台。架构上由8 个核心模块 5 个工具模块约 200 个类组成模块职责CLICoreGit 风格命令分发器、来源自动检测Scrapers18 种来源类型的提取器共享同一构建层Adaptors22 种输出平台格式统一实现SkillAdaptorABCAnalysisC3.x 代码库流水线、10 个 GoF 模式检测器Enhancement通过单一AgentClient传输通道完成 AI 增强Packaging打包、上传与安装技能MCPFastMCP 服务器40 个工具、10 个工具模块Sync文档变更检测与通知深度内容见 UML Architecture含 14 张 UML 图、API Reference 与 Skill Architecture。14. 质量、同步与规模14.1 质量门槛skill-seekers quality output/react/ --threshold 7 # 质量评分 门槛 skill-seekers quality output/react/ --json # JSON 输出供 CI 使用同时提供面向英文的可读性指标仅作参考不影响最终分数。详见 CODE_QUALITY.md。14.2 文档变更同步与超大规模处理sync-config用于检测配置漂移支持文档变更检测、定时重抓取与通知对超大规模文档集1 万–4 万 页提供流式摄入stream与增量更新update详见 Large Documentation。14.3 性能参考来自 README文档规模耗时输出体积小 100 页5–10 分钟~2 MB中100–500 页15–30 分钟~10 MB大500–2,000 页30–60 分钟~40 MB超大10K–40K 页使用stream见 LARGE_DOCUMENTATION15. 故障排查skill-seekers doctor # 诊断安装与环境 skill-seekers doctor --json # 机器可读诊断供 CI 与 Agent 使用 skill-seekers sync-config # 检测配置漂移常见问题见 Troubleshooting Guide 与 TROUBLESHOOTING.md。16. 小结Skill Seekers 用一个统一的数据处理流水线把把文档变成 AI 技能这件事从数天的人工整理压缩到十几分钟来源自动检测 → 多源统一抓取 → 冲突检测与合并 → AI 增强 → 22 目标打包 → 一键安装/上传。其可扩展性来自两处源码设计SkillAdaptor抽象新平台只需新增一个适配器与统一的命令/来源分派表src/skill_seekers/cli/main.py、src/skill_seekers/cli/unified_scraper.py。本文覆盖的完整命令索引见 CLI_REFERENCE.md更多集成方案LangChain、RAG Pipelines、Cursor、Windsurf、Cline见 docs/integrations 目录。赞分享人工智能AI 应用AI 技能RAGMCP 服务网页爬虫【免费下载链接】Skill_SeekersConvert documentation websites, GitHub repositories, and PDFs into Claude AI skills with automatic conflict detection项目地址https://gitcode.com/gh_mirrors/sk/Skill_Seekers点击查看免费下载相关推荐Skill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI SkillSkill Seekers Skill Builder用 MCP 工具链将文档、仓库与 PDF 自动转换为 AI Skill 本文围绕 Skill Seeke人工智能AI 应用AI 技能RAGMCP 服务网页爬虫Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能Skill Seekers 快速上手3 步把文档网站与代码仓库转化为可直接使用的 AI 技能 本文以仓库中的历史文档 QUICKSTART.md https:人工智能AI 应用AI 技能RAGMCP 服务网页爬虫5大关键技术突破HackRF射频开关如何重新定义软件无线电的灵活性边界5大关键技术突破HackRF射频开关如何重新定义软件无线电的灵活性边界 在当今无线通信技术飞速发展的时代软件定义无线电SDR已成为研究和开发的重要工具。人工智能AI 应用AI 技能RAGMCP 服务网页爬虫创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
用Word模板+VBA宏自动化生成2025年日历的完整方案 简介:一份完整的2025年Word日历模板,覆盖全年12个月,采用周日到周六的标准星期布局,日期以阿拉伯数字清晰呈现。面向需要个人时间管理、团队项目里程碑记录及教育机构排课规划的用户,可用来记录会议、约会、生日及项目… · 2026/9/23 2:02:50
项目经理必备的冲突管理艺术:从对抗到共赢 1. 项目概述:为什么项目经理需要"吵架"能力?在大厂做项目经理这些年,我深刻体会到:不会"吵架"的项目经理,就像没有武器的士兵。去年我们团队接了个紧急项目,隔壁部门的技术资源死活协调… · 2026/9/23 2:02:50
猫怎么画手写实现: 3种算法对比, 新手避坑指南 猫怎么画手写实现: 3种算法对比, 新手避坑指南 面试被问原理答不上来,是技术人最尴尬的时刻。很多新手觉得猫怎么画就是画个圆圈加三角形,结果一深究贝塞尔曲线、路径渲染机制,瞬间大脑空白。这时候 新手避坑… · 2026/9/23 5:38:30
Emoji 输入技术全解析:从编码原理到跨平台兼容实践 1. 从输入法候选框到代码仓库:Emoji 输入远不止“点一下”那么简单很多人第一次接触 Emoji 输入,是在手机输入法的候选框里翻两页,找到那个笑脸,点一下,完事。但如果你是一个开发者、一个经常写文档的人,或… · 2026/9/23 5:38:30
dnf勇者之路源码剖析:新手避坑指南与核心逻辑拆解 dnf勇者之路源码剖析:新手避坑指南与核心逻辑拆解 报错一堆看不懂?StackTrace 像天书一样刷在屏幕上,新手直接懵圈。别慌,今天咱们不聊那些虚头巴脑的理论,直接拆解【dnf勇者之路】这类复杂状态机的核心源码逻辑。在掘金技术社区翻过不… · 2026/9/23 5:38:24
PD3.1车充SOC选型指南:IP6558升降压方案设计与调试实战 1. 从一颗芯片看车充行业的暗流:为什么PD3.1和升降压成了绕不开的坎车载充电器这个品类,表面上看起来已经非常成熟了,几十块钱就能买到一个能用的。但如果你拆过几十款车充,就会发现一个很有意思的现象:真正决定一款车… · 2026/9/23 5:38:24
数字电源本质:从模拟稳压到智能供电的系统级跃迁 1. 这不是参数表上的“升级”,而是电源控制逻辑的底层重写你拆过一块老式线性电源吗?里面密密麻麻的电阻、电容、运放芯片,还有那根调压电位器——拧一下,电压就变一点,像老式收音机调台一样,靠的是模拟信号… · 2026/9/23 5:38:24
ESP32-P4 USB高速读卡器开发:TinyUSB MSC协议栈实战与性能优化 1. 项目缘起与核心需求拆解1.1 为什么要在 ESP32-P4 上折腾 USB 读卡器第一次拿到 ESP32-P4 这块芯片的时候,我盯着它的 USB 2.0 OTG 高速接口看了很久。之前用 ESP32-S3 做 USB 相关项目,受限于全速 12Mbps 的带宽,传个大文件能等到打瞌睡。… · 2026/9/23 5:38:18
3招搞定手机怎么下载微信面试难题实战项目解析 3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29