资讯详情

资讯详情

MediaCrawler 多平台数据采集:改 4 个配置项就有产出,零爬虫代码量

MediaCrawler 多平台数据采集改 4 个配置项就有产出零爬虫代码量【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawlerMediaCrawler 是一款开源的自媒体多平台数据采集工具覆盖小红书、抖音、快手、B 站、微博、百度贴吧和知乎。它支持按关键词搜索、按帖子详情、按创作者主页三种方式抓取内容评论与二级评论均可采集结果可落成 JSONL、JSON、CSV、Excel 或直接写入数据库。做竞品监控、选题调研和舆情分析或者想要一套现成框架而又不想自己啃 JS 逆向的读者直接往下读。能力总览一次看全它都能干什么能力对应开关均在config/base_config.py产出默认状态关键词搜索CRAWLER_TYPE search关键词写在KEYWORDS搜索结果页的内容列表 评论默认模式单帖/单视频抓取CRAWLER_TYPE detail链接填入各平台配置文件单条内容的完整字段 评论需切换创作者主页采集CRAWLER_TYPE creator主页 URL 填入各平台配置文件该账号发布的全部内容需切换一级评论ENABLE_GET_COMMENTS每篇内容下的一层评论开二级评论ENABLE_GET_SUB_COMMENTS评论下的回复层关评论词云ENABLE_GET_WORDCLOUD一张词云 PNG 图关媒体文件下载ENABLE_GET_MEDIA封面、视频、图片文件关代理 IP 池ENABLE_IP_PROXYIP_PROXY_PROVIDER_NAME轮换出口 IP降低风控概率关结果落地SAVE_DATA_OPTIONjsonl / json / csv / excel / sqlite / postgres / dbjsonl所有开关集中在config/base_config.py一个文件里改完直接运行main.py即可不需要碰签名算法。需要 CDPChrome DevTools Protocol浏览器调试协议模式时它复用你日常在用的 Chrome 和登录态让请求看起来就是普通用户在操作。跑起来之前逐项打勾Python确认python --version不低于 3.11低了就先升级解释器。Chrome确认chrome://version显示的版本不低于 144。地址栏进chrome://inspect/#remote-debugging勾选 Allow remote debugging for this browser instance页面出现Server running at: 127.0.0.1:9222才算就绪完整步骤见 CDP模式使用指南。Node.js抖音、知乎两家的签名逻辑跑在 JS 环境里确认node -v不低于 v16没有就去官网装一个。登录态SAVE_LOGIN_STATE保持True登录一次写进本地浏览器数据目录之后免扫码换账号就把brower_data/目录删掉重来。控速CRAWLER_MAX_SLEEP_SEC默认 2 秒批量任务建议 3~5 秒MAX_CONCURRENCY_NUM从 1 起步跑稳了再慢慢加。浏览器收尾AUTO_CLOSE_BROWSER默认在程序结束时关浏览器调试期改成False可以留住现场。媒体下载ENABLE_GET_MEDIA保持False只要元数据就省带宽也省磁盘。最小闭环第一次拿到数据的最短路径装依赖git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler uv syncuv sync一条命令装齐全部依赖。改 4 处配置打开config/base_config.py只动这几行PLATFORM xhs # xhs | dy | ks | bili | wb | tieba | zhihu KEYWORDS 平价精华 # 多个关键词用英文逗号分隔 CRAWLER_TYPE search SAVE_DATA_OPTION jsonlENABLE_CDP_MODE与CDP_CONNECT_EXISTING默认都是True会自动接上你开了远程调试的 Chrome这两行不用碰。目录里各模块的分工可以对照 项目代码结构 一文。跑起来并完成登录验证python main.py首次运行会打开浏览器用账号扫码登录二维码、手机号都支持。登录状态缓存在本地浏览器数据目录下一次运行不再扫码。跑完去data/目录找结果文件文件里有标题、点赞收藏评论数、发布时间、正文评论区也在里面就说明这条链路通了。评论区能直接变成一张词云图吗先把评论抓够再让它自动生成。词云开关ENABLE_GET_WORDCLOUD默认是关的置为True才会出图。CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES控制单篇内容最多抓多少条评论默认 10 条图会更饱满一些把这个值调大。想要回复层的语料再把ENABLE_GET_SUB_COMMENTS置为True默认关闭。停用词表默认指向docs/hit_stopwords.txt一行一个词品牌词、产品词建议加进CUSTOM_WORDS让整词被当作一个单元统计而不是被拆散。生成完的 PNG 落在data/目录汇报时用户到底在讨论什么一页就能说清。采集结果怎么落地文件还是数据库SAVE_DATA_OPTION一个开关切换出口形态取值特点适合文件·默认jsonl每行一个 JSON 对象追加写入性能最好后续用 Python 处理文件·表格excel/csv带格式的多工作表打开即看给非技术同事文件·单文件json单 JSON 文件小批量、直接读数据库sqlite/postgres/dbMySQL自动建表、天然去重长期反复采同一批对象首次入库前执行一次python main.py --init_db sqlite完成建表就不会撞上表不存在的报错。一次性分析选文件长期监控同一批账号选数据库导出细节见 数据存储指南。三个实操任务照着填就行任务一小红书竞品声量摸底要做的事摸清竞品品牌词下热度最高的笔记以及评论区的情绪方向改哪里PLATFORM xhs、CRAWLER_TYPE search、KEYWORDS 竞品品牌名,品类词CRAWLER_MAX_NOTES_COUNT调到 50顺手开ENABLE_GET_WORDCLOUD跑完看什么data/里的笔记字段文件 一张评论区词云图任务二B 站账号更新监控要做的事盯住竞品账号的发布节奏和内容方向变化改哪里PLATFORM bili、CRAWLER_TYPE creator主页 URL 填入config/bilibili_config.py对应列表跑完看什么视频标题、播放量、发布时间列表定期跑一次做对比任务三知乎话题答案采集要做的事收集某话题下的高赞回答和讨论热度改哪里PLATFORM zhihu、CRAWLER_TYPE search评论抓取数量调大SAVE_DATA_OPTION换成sqlite跑完看什么按发布时间排序的入库数据用来做话题热度趋势排障速查表现象、原因、处理步骤现象最常见原因处理步骤CDP 连不上Cannot connect to existing browser on port 9222或playwright TimeoutError远程调试未开启或 Chrome 未打开确认 Chrome 处于打开状态且版本 ≥ 144回chrome://inspect/#remote-debugging检查开关和Server running at: 127.0.0.1:9222提示若弹出确认框点接受程序最多等 60 秒人工确认扫码后反复弹滑块登录卡死无真实浏览器特征触发风控确认ENABLE_CDP_MODE、CDP_CONNECT_EXISTING均为True别用无痕窗口HEADLESS设为False后重启在弹出的浏览器里手动过一次滑块仍不行就删除brower_data/重登execjs或 JS 相关报错抖音、知乎Node.js 未装或版本过低确认node -v≥ v16没有就装对应系统的安装包重启终端后再跑前几天正常现在突然抓不到数据账号触发平台风控先降强度调大CRAWLER_MAX_SLEEP_SEC、减小单次采集条数再开代理池换 IP最后删brower_data/换账号重登代理池通过ENABLE_IP_PROXY True和IP_PROXY_PROVIDER_NAMEkuaidaili/wandouhttp/static两个开关控制服务商密钥的传递方式见 代理使用文档。整张表里最容易被忽略的一点多数突然失效是账号层面的风控不是代码层面的故障换账号比改代码更快见效。接下来怎么走选一个平台、一个关键词按最小闭环跑通第一条链路确认data/目录有文件产出。在稳定运行的任务上叠加评论词云和二级评论把数据从有变成能分析。需要上量时再引入代理 IP 池和 sqlite/postgres 存储让同一批对象可以长期反复采集而自动去重。改一处配置就能出数据的工具已经摆在手上了先把第一个任务跑起来再说。【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 评论爬虫、微博帖子 评论爬虫、百度贴吧帖子 百度贴吧评论回复爬虫 | 知乎问答文章评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →