简历文本
本文最后更新于:2026年7月24日 晚上
1 | |
新闻类通用爬虫
基于scrapy-redis,gne,dateprarse 用于抓取境外新闻网站的爬虫
- 定义了一系列handler 可以根据不同网站的反扒,快速重写某个handles 中的不同方法做到快速开发。
- 魔改gne 代码在原来的基础上添加了一些meta,针对不同语言的时间进行处理,添加了从
提取时间的功能。 - 使用svm 训练网页,做到识别一个网页是列表还是详情页,做到板块也面提取。
- 使用asyncio 和 requests 做中间件使得scrapy 中可以支持socks5 类型的代理。
- 针对付费的cloudflare防火墙 使用DrissionPage渲染 csr 服务基于broweserless 进行渲染
- 使用postlight/parser 进行页面详情页提取
搜索引擎爬虫
抓取根据关键词搜索出来的结果
搜索引擎主要包括谷歌,bing,daum,naver,goo,谷歌新闻,谷歌快讯,duckduckgo 等网站
- 基于python 中的gevent 实现并发
- 基于ansible 进行爬虫的统一部署
tw社媒爬虫
逆向tw 的guest token 生成,根据关键词进行搜索,日爬虫数量在1.5亿条
基于mutiprocess+gevent 实现并发
基于ansible 进行爬虫的统一部署
rsshub 爬虫
该项目主要用来做反爬虫措施比较严格的网站的获取数据。
基于开源rsshub 进行改进,提交到自己的代码仓库中。
该项目反爬虫基于cloudflare的warp 网络,部署在国外服务器上。
基于nodejs pupeetter 实现页面渲染
使用cheerio 进行页面提取
基于feedparser 中的订阅内容进行解析入库
其他爬虫
TG 社媒爬取
根据Telethon + tg API 的二次开发,外加 tg 频道群组的监控
gt
根据逆向api 接口参数进行关键词爬取
简历文本
https://kingjem.github.io/2026/07/24/简历文本/