MediaCrawler

开源社交媒体爬虫,自动抓取小红书、抖音、微博等平台的公开笔记、视频和评论,支持关键词搜索和ID精准采集。

Github 🎁 分层付费 🔓 开源
✨ 开源免费,支持主流社交平台✨ 浏览器自动化,无需JS逆向✨ 支持关键词搜索和ID精准采集✨ 一键生成评论词云可视化✨ 断点续爬和多账号(Pro版)
🌐 访问官网 →

产品概述

MediaCrawler 是一款开源社交媒体数据采集工具,专为抓取小红书、抖音、快手、微博、Bilibili 等主流平台的公开内容而设计。它能够自动获取用户发布的笔记、视频、图文、评论以及用户信息(如昵称、ID、粉丝数),支持 CSV、JSON、SQLite、MySQL 等多种输出格式,方便后续数据分析与存储。

核心优势

MediaCrawler 最大的技术亮点是采用 Playwright 模拟真实浏览器操作,通过直接执行平台前端的 JS 代码获取请求签名参数,绕过了传统的 JS 逆向过程,大幅降低了爬虫开发门槛。同时,它支持二维码或 Cookie 登录,并能持久化登录状态,避免频繁扫码。内置 IP 代理池和滑块验证码处理机制,有效应对反爬策略。 工具还提供了断点续爬功能,意外中断后可继续采集,提升效率。Pro 版本额外支持多账号轮换、Linux 守护进程、Docker 部署等企业级特性,适合大规模或商业使用。此外,可视化插件可一键生成评论词云,快速发现热点话题。

适用场景