简历文本

本文最后更新于:2026年7月24日 晚上

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15

掌握基本css、xpath等语法,熟练书写正则表达式;
有大规模通用解析经验,魔改的GeneralNewsExtractor 在生产环境稳定运行;
熟练使用mitmproxy,fiddler,charles,Postern,小黄鸟,进行抓包;
熟练使用frida些安卓层的hook,熟练使用frida-rpc 了解sekiro rpc;
熟悉linux常用命令,熟练使用git,熟练使用docker,ansible,进行项目部署。有过服务端迁移经验;
熟悉selenium、scrapy等包的用法,熟悉开源爬虫框架,scrapy-splash,browserless;
熟悉mysql,redis,elasticsearch等常用组件,有airflow框架使用经验;
熟练python 多线程多进程,gevent协程,asyncio异步编程;
了解Django,Flask,FastAPI 项目开发;
熟悉uiautomator 和 appnium 的使用; 了解unidgb的使用;
熟悉js逆向;
其他编程语言熟悉nodejs;
熟悉魔法上网工具

新闻类通用爬虫
基于scrapy-redis,gne,dateprarse 用于抓取境外新闻网站的爬虫

  1. 定义了一系列handler 可以根据不同网站的反扒,快速重写某个handles 中的不同方法做到快速开发。
  2. 魔改gne 代码在原来的基础上添加了一些meta,针对不同语言的时间进行处理,添加了从 提取时间的功能。
  3. 使用svm 训练网页,做到识别一个网页是列表还是详情页,做到板块也面提取。
  4. 使用asyncio 和 requests 做中间件使得scrapy 中可以支持socks5 类型的代理。
  5. 针对付费的cloudflare防火墙 使用DrissionPage渲染 csr 服务基于broweserless 进行渲染
  6. 使用postlight/parser 进行页面详情页提取

搜索引擎爬虫

抓取根据关键词搜索出来的结果
搜索引擎主要包括谷歌,bing,daum,naver,goo,谷歌新闻,谷歌快讯,duckduckgo 等网站

  1. 基于python 中的gevent 实现并发
  2. 基于ansible 进行爬虫的统一部署

tw社媒爬虫

  1. 逆向tw 的guest token 生成,根据关键词进行搜索,日爬虫数量在1.5亿条

  2. 基于mutiprocess+gevent 实现并发

  3. 基于ansible 进行爬虫的统一部署

rsshub 爬虫

该项目主要用来做反爬虫措施比较严格的网站的获取数据。

  1. 基于开源rsshub 进行改进,提交到自己的代码仓库中。

  2. 该项目反爬虫基于cloudflare的warp 网络,部署在国外服务器上。

  3. 基于nodejs pupeetter 实现页面渲染

  4. 使用cheerio 进行页面提取

  5. 基于feedparser 中的订阅内容进行解析入库

其他爬虫

TG 社媒爬取

根据Telethon + tg API 的二次开发,外加 tg 频道群组的监控

gt

根据逆向api 接口参数进行关键词爬取


简历文本
https://kingjem.github.io/2026/07/24/简历文本/
作者
Ruhai
发布于
2026年7月24日
许可协议