一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

專案同時把斷點續爬、多帳號加代理池、移除 Playwright 依賴等能力放在 MediaCrawlerPro,開源版功能邊界需要使用者分清楚

Python · ⭐ 61,942 · 🍴 12,121 · 🔥今日 +236

中文摘要

MediaCrawler 是多平台自媒體公開資料採集工具,支援小紅書、抖音、快手、B 站、微博、百度貼吧、知乎等平台,功能表列出關鍵字搜尋、指定帖子 ID、二級評論、創作者主頁、登入態快取、IP 代理池與評論詞雲。技術路線不是做 JS 逆向,而是用 Playwright/Chrome CDP 保存登入態,透過瀏覽器上下文取得簽名參數,README 也提供 WebUI、API 伺服器與前端開發啟動方式。專案同時把斷點續爬、多帳號加代理池、移除 Playwright 依賴等能力放在 MediaCrawlerPro,開源版功能邊界需要使用者分清楚。

一龍馬判讀

做輿情、內容研究或資料蒐集的人會看到很低的上手成本,但 README 以醒目免責聲明禁止商業與違法使用,也提醒大規模爬取平台資料存在法律、帳號與平台風控風險。

原文節錄

NanmiCoder/MediaCrawler

# 🔥 MediaCrawler - 自媒体平台爬虫 🕷️ ### 🤝 特别感谢白金赞助商 BrowserAct 支持从任意网站提取数据。只需描述所需数据,BrowserAct 就会在真实浏览器中探索并测试网页,生成可靠、可复用的数据采集 Bot,并返回结构化结果。内置隐身浏览和验证码处理,并提供高质量住宅代理。

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫

收錄日期
2026-08-13
來源
github.com/trending
抓取時間
2026/08/13 05:50(台北)
來源資料
Python · ⭐ 61,942 · 🍴 12,121 · 🔥今日 +236