Day 16 · dxy-crawler
404 字
2 分钟
Day 16 · dxy-crawler
今天把新项目 dxy-crawler 推上 GitHub 了——丁香园论坛的热榜爬虫,外加一个可视化的管理界面。
起因
今天老师给我布置了个活:做一个丁香园论坛的热榜爬虫。听完需求大概理解了——后面要拿这些抓下来的帖子数据,自动化发到小红书上搞流量,老师直接撂下一句”之后的目标就是想办法去搞钱”。
得,那既然要做就做完整点。光抓个数据存起来没法看,老师也要看效果,所以连 Web 界面也一起撸了。
实现
整体方案是 Python + Playwright 跑详情页,热榜接口直接走 HTTP 拿列表。中间踩了限流的坑,最后干脆把合规限制硬写进代码里:
- 默认采集间隔 5 分钟,改小直接拒绝启动
- 启动时拉一次 robots.txt,被 Disallow 就退出
- 触发人机验证就停下来等
这块我觉得该立的规矩还是要立好,毕竟是抓人家站,规矩做好了大家都舒服。
成果
项目放 GitHub 上了:Jaye-520/dxy-crawler,MIT 开源。部署这块我比较推荐走 Docker,一条命令拉起来,不用再单独装 Python 和 Playwright 环境:
docker compose up -d跑完之后访问 http://localhost:8000 就能看到仪表盘了。数据和日志通过 volume 挂到宿主机的 data/ 和 logs/,容器重建也不丢,配置可以用环境变量或者挂自定义 config.yaml 来覆盖。
明天继续搞小红书自动化那部分,争取把整条链路打通。
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!
相关文章智能推荐
1
Day 15 · 消费日
日记动物园里的辛玛王国玩了一天,晚上去石家庄吃饭还看了电影《八仙》
2
Day 13 · 暑暑生活
日记暑假原本想专心搞电脑,结果被拉去搬快递、给我爸顶班
3
Day 14 · 去舅舅家玩
日记早上下了阵雨,跟着舅舅一家吃了顿丰盛午饭,下午窝着刷视频看小说,惬意的一天。
4
Day 11 · 文件包含漏洞学习笔记
日记学习文件包含漏洞(File Inclusion)的原理与利用方法,订单班网络安全课程笔记
5
Day 05 · 开站日记
日记这篇日记,诞生于网站建成当晚的瓢泼大雨之中。
随机文章随机推荐













