Day 16 · dxy-crawler

404 字
2 分钟
Day 16 · dxy-crawler

今天把新项目 dxy-crawler 推上 GitHub 了——丁香园论坛的热榜爬虫,外加一个可视化的管理界面。

起因#

今天老师给我布置了个活:做一个丁香园论坛的热榜爬虫。听完需求大概理解了——后面要拿这些抓下来的帖子数据,自动化发到小红书上搞流量,老师直接撂下一句”之后的目标就是想办法去搞钱”。

得,那既然要做就做完整点。光抓个数据存起来没法看,老师也要看效果,所以连 Web 界面也一起撸了。

实现#

整体方案是 Python + Playwright 跑详情页,热榜接口直接走 HTTP 拿列表。中间踩了限流的坑,最后干脆把合规限制硬写进代码里:

  • 默认采集间隔 5 分钟,改小直接拒绝启动
  • 启动时拉一次 robots.txt,被 Disallow 就退出
  • 触发人机验证就停下来等

这块我觉得该立的规矩还是要立好,毕竟是抓人家站,规矩做好了大家都舒服。

成果#

项目放 GitHub 上了:Jaye-520/dxy-crawler,MIT 开源。部署这块我比较推荐走 Docker,一条命令拉起来,不用再单独装 Python 和 Playwright 环境:

Terminal window
docker compose up -d

跑完之后访问 http://localhost:8000 就能看到仪表盘了。数据和日志通过 volume 挂到宿主机的 data/logs/,容器重建也不丢,配置可以用环境变量或者挂自定义 config.yaml 来覆盖。

明天继续搞小红书自动化那部分,争取把整条链路打通。

支持与分享

如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!

打赏
Day 16 · dxy-crawler
https://www.linglog.cc/posts/diary-16/
作者
Jaye
发布于
2026-08-26
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
Jaye
风儿是自由的,它路过山河,路过我,却从不停留
公告
这里主要记录生活日常,偶尔也写点技术相关的内容,写得不好还请见谅——比起做技术博客,我更想把这里当成留住回忆的地方。
分类
标签
最新动态
站点统计
文章
37
分类
4
标签
78
总字数
41,997
运行时长
0
最后活动
0 天前
站点信息
构建平台
Vercel
博客版本
LingLog v6.15.9
文章许可
CC BY-NC-SA 4.0