首页/新闻资讯/正文详情

MediaCrawler 快速上手指南:3 步跑通 7 平台社媒数据采集

发布时间:2026/9/27 11:09:56 来源:云帆数科 栏目:资讯中心
MediaCrawler 快速上手指南:3 步跑通 7 平台社媒数据采集
MediaCrawler 快速上手指南3 步跑通 7 平台社媒数据采集【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一款开源的多平台自媒体数据采集工具覆盖小红书、抖音、快手、B 站、微博、贴吧、知乎 7 个平台支持关键词、指定帖子、创作者主页三种采集方式能拿到帖子内容与评论数据适合想低成本获取社媒公开数据做分析的新手。本文按从 0 跑通采集、再把数据用起来的主线走完整流程。 先弄清三个让你犹豫的问题这一节不动环境先消除多数人看到爬虫时最担心的三件事。为什么不用做 JS 逆向多数爬虫项目的门槛在接口签名——平台请求参数经过加密手写逆向耗时且容易失效。MediaCrawler 绕开了这一步基于 Playwright浏览器自动化库把登录态存在浏览器上下文里签名参数通过浏览器内的 JS 表达式直接获取。你只需像普通用户一样扫码登录一次后续请求复用这份状态。登录态怎么保持默认配置开启了 CDP 模式ENABLE_CDP_MODE True程序直接连你本机正在使用的 Chrome版本需 144 以上复用真实的 Cookie 和浏览历史比新启动一个干净浏览器更难被平台风控识别。只有切回标准 Playwright 模式ENABLE_CDP_MODE False时才需要预先执行uv run playwright install安装浏览器驱动。数据存在哪里默认以 JSONL 格式追加写入data/目录。存储格式可用--save_data_option切换支持 jsonl、csv、json、excel、sqlite、mysql、postgres 共 7 种数据量上来后存数据库能获得去重能力。⏱️ 装好环境并跑通首次采集目标拿到第一批数据。前置依赖只有三样——Python 包管理器 uv、Node.js 16 以上抖音和知乎的签名计算靠它执行 JS 脚本、最新版 Chrome。先克隆仓库并进入项目目录git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler接着安装全部 Python 依赖uv sync然后开启 Chrome 远程调试地址栏输入chrome://inspect/#remote-debugging勾选 Allow remote debugging for this browser instance看到Server running at: 127.0.0.1:9222即就绪。最后跑第一条采集命令用小红书 App 扫弹出的二维码完成登录uv run main.py --platform xhs --lt qrcode --type searchdata/目录下出现 JSONL 文件说明首跑成功。️ 改好关键参数选定采集模式所有可调项集中在 config/base_config.py每个参数都有中文注释首次使用只需要盯住下面三处。三个必改参数参数控制什么初始值KEYWORDS关键词搜索词多个词用英文逗号分隔示例词编程副业,编程兼职需换成你自己的CRAWLER_MAX_NOTES_COUNT单次采集的帖子数量上限15CRAWLER_MAX_SLEEP_SEC每次请求之间的休眠秒数2三种采集模式选一种模式由--type决定各自交付的内容不同关键词搜索--type search拿到命中关键词的帖子及其评论需要填KEYWORDS指定帖子--type detail拿到某个帖子的详情与评论需要在各平台配置中填帖子 ID 列表如XHS_SPECIFIED_ID_LIST、BILI_SPECIFIED_ID_LIST创作者主页--type creator拿到某创作者的公开内容与评论需要填创作者 ID。也可以启动可视化界面不想敲命令的话开两个终端分别起后端和前端第二个先cd webui即可在浏览器里配置参数、看实时日志、预览并导出数据。uv run uvicorn api.main:app --port 8080 --reloadnpm run dev建议先用一个平台的 search 模式跑通确认数据文件里的字段完整再扩展其他模式。 给长期采集配好代理池短频快的小任务用自己的 IP 就够了连续跑几个小时时建议启用代理否则本机 IP 受限的风险会明显上升。内置代理池支持快代理、豌豆 HTTP 两类服务商也支持填自己的静态代理地址实现代码在 proxy/ 目录。启用只需两步把ENABLE_IP_PROXY改为True在IP_PROXY_PROVIDER_NAME选服务商kuaidaili/wandouhttp/static再到对应服务商后台开通 IP 提取接口。启动后程序从服务商拉取 IP、存入 Redis 建池请求失败时自动换下一个可用 IP![MediaCrawler 代理 IP 池建池与换 IP 流程图](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler/raw/380b426000aac3d612837ed72c99808347dc94c9/docs/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)服务商开通后提取密钥要通过环境变量填入由 proxy/providers/ 下的服务商配置类读取选型经验低频试用选免费额度即可长期项目选独享或隧道类产品避免与他人共享 IP 被连带封禁流程细节见 代理使用文档。 从关键词监控到词云把数据用起来的两种方式以跟踪某产品口碑为例把KEYWORDS设为产品名打开ENABLE_GET_COMMENTS与ENABLE_GET_SUB_COMMENTS抓全一级与二级评论。之后有两条用法快速看讨论集中在哪把ENABLE_GET_WORDCLOUD设为True项目直接生成评论词云图自定义词组写进CUSTOM_WORDS停用词维护在 docs/hit_stopwords.txt方法见 词云图使用配置做精细分析切换 Excel 导出多工作表、带格式做情感归类或存数据库做反复查询。先用小批量数据试一次词云确认评论字段正确再扩大采集量。 处理高频故障并记住三条使用边界现象 → 先查哪里现象先查哪里抖音/知乎报execjs缺少;Node.js 未安装或版本低于 16小红书扫码后一直卡滑块没连真实浏览器删除项目根目录brower_data缓存后重新登录playwright 30 秒超时本机网络或代理问题检查外网连通性提示连不上 9222 端口Chrome 未运行、远程调试未勾选或版本低于 144之前能跑现在失效账号触发风控调低频率或删除brower_data换账号重新登录更多问题在 常见问题文档 里逐条解答。三条使用边界用途项目许可为非商业学习仅采集公开信息遵守目标平台服务条款与 robots 协议频率默认 2 秒休眠、并发 1 已是保守设置不建议再调激进隐私评论里可能出现他人手机号、住址等信息落库和分享前先脱敏数据仅用于分析。日常维护记住两点Chrome 保持最新版登录态过期时优先用 CDP 复用已有登录而不是反复重扫。 资源入口克隆仓库即可开始git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler仓库内常用文档数据存储指南7 种存储格式的使用示例代理使用文档各服务商的开通与配置步骤词云图使用配置词云生成与自定义词组配置常见问题报错与故障的逐条解答。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

Humanizer 流式日期 API 深度解析:`InDate.Ten` 与“10 天/周/月/年后“的声明式日期计算
Humanizer 流式日期 API 深度解析:`InDate.Ten` 与“10 天/周/月/年后“的声明式日期计算

开发工具 【免费下载链接】Humanizer Humanizer meets all your .NET needs for manipulating and displaying strings, enums, dates, times, timespans, numbers and quantities 项目地址: https://gitcode.com/gh_mirrors/hu/Humanizer 点击查看 免费下载 本指南… · 2026/9/27 11:09:55

米拓cms可以做企业网站吗?一文搞懂避坑指南
米拓cms可以做企业网站吗?一文搞懂避坑指南

米拓cms可以做企业网站吗?一文搞懂避坑指南 网站做好了没人访问,这大概是很多老板和项目经理最头疼的噩梦。钱花了,时间耗了,结果打开后台一看,流量惨淡,转化率更是惨不忍睹。很多人第一反应是推广没做好,但在我看来,80%的问题出在建站初期——… · 2026/9/27 11:09:43

5类建站方案对比评测:网站是否需要备案全解析
5类建站方案对比评测:网站是否需要备案全解析

5类建站方案对比评测:网站是否需要备案全解析 还在为选好的模板网站太丑、功能又不够用而头疼?别急着加钱改代码,先搞清楚一个更根本的问题:你的网站到底 网站是否需要备案… · 2026/9/27 11:09:37

网站建设行业怎么样:3个免费工具搞定备案与部署
网站建设行业怎么样:3个免费工具搞定备案与部署

网站建设行业怎么样:3个免费工具搞定备案与部署 别再对着那些千篇一律的模板网站叹气,真的不够看。很多创业团队负责人跟我抱怨,花了大价钱找外包,做出来的官网像上世纪的产物,既丑又慢,根本留不住客户。更扎心的是,想自己折腾,又觉得域名、服务器、… · 2026/9/27 11:58:49

做网站平台成本一文搞懂:小白避坑指南
做网站平台成本一文搞懂:小白避坑指南

做网站平台成本一文搞懂:小白避坑指南 自己不会代码想做网站,最怕的就是钱花了没效果。别慌,这篇 一文搞懂 做网站平台成本,帮你算清账。很多新手一上来就找开发公司,报价动辄几万,其实大可不必。… · 2026/9/27 11:58:43

本地 AI Agent 平台实测:以 QClaw 为例,聊聊这类工具的优势与局限
本地 AI Agent 平台实测:以 QClaw 为例,聊聊这类工具的优势与局限

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 11:58:37

STM32开发避坑指南:如何高效筛选可信参考方案
STM32开发避坑指南:如何高效筛选可信参考方案

1. 为什么“找参考方案”这件事,比写代码更耗新人三个月刚接触 STM32 的朋友常有个错觉:只要装好 Keil、烧进程序、LED 亮了,就算入门了。我带过十几届电子类毕业设计学生,也帮过上百个嵌入式转岗工程师调试板子,发现一… · 2026/9/27 11:58:31

嵌入式C++开发工具链原理:从交叉编译到STM32调试全解析
嵌入式C++开发工具链原理:从交叉编译到STM32调试全解析

1. “装了四个软件却不知道是干嘛的”——这根本不是你的问题,是嵌入式C入门最真实的挫败感你刚在VS Code里点完“Install”按钮,电脑弹出四个安装窗口:ARM GNU Toolchain、STM32CubeMX、OpenOCD、ST-Link Utility。你照着某篇教程一步步操作… · 2026/9/27 11:58:24

深圳网站推广优化培训全解:新手入门完整流程
深圳网站推广优化培训全解:新手入门完整流程

深圳网站推广优化培训全解:新手入门完整流程 网站做好了没人访问,这是很多深圳中小企业老板最头疼的事。很多新手以为只要找个公司把站建好,流量就会像自来水一样哗哗来,结果上线一个月,百度搜不到,谷歌没排名,客户更是零咨询。这种焦虑背后,往往是因… · 2026/9/27 11:58:24

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码