Python爬虫工程师
职位描述
该职位来源于猎聘 PURPOSE OF THE JOB(required for supervisory/managerial job): Summarize why this job exists and the contribution it makes to the overall business of the company 负责公司自研数据采集能力建设,聚焦高价值企业工商数据的增量补充与校验(日采集规模 ≤ 1 万家),通过 Python/Playwright 浏览器自动化、前端分析与接口逆向等手段,构建稳定、可监控的采集链路,支撑企业主档建设与数据质量提升。保障采集 7×24 稳定运行,协同数据治理与应用团队完成多源校验与入库规范对接,并评估外部 RPA/第三方数据源作为补充。当前阶段聚焦可行性验证与生产化落地,暂不追求分布式爬虫集群与大规模代理池建设。 PRINCIPAL ACCOUNTABILITIES: Describe the major activities of the job, emphasizing the end results which must be achieved (suggest listing from the most important task) 1. 采集系统建设与维护 设计并实现基于 Python + Playwright 的浏览器自动化采集服务 建设企业待更新库、任务队列、失败重试、采集监控告警等核心模块 负责采集结果的结构化解析、清洗、入库,对接 ODS / 企业主档数据规范 保障采集链路 7×24 稳定运行,对成功率、时效性、数据质量负责 2. 前端分析与接口逆向 熟练使用 Chrome DevTools(Network / Sources / Application)进行断点调试、请求抓包与调用栈分析 独立分析 Ajax / Fetch / XHR 请求链路,还原参数来源、Header、Cookie、Token 及调用时序 定位接口签名/加密逻辑(sign、timestamp、nonce、token 等),在 Python 中复现并实现稳定接口调用 处理 WebSocket、GraphQL、动态接口(接口地址/参数随页面或会话变化)等非标准 HTTP 采集场景 分析 JS 混淆、Webpack / Vite 打包代码,通过断点、Hook 或反混淆手段还原关键逻辑 优先采用「接口采集替代页面采集」:在逆向可行时,用 Requests / httpx 等替代浏览器渲染,降低成本、提升稳定性与并发 建立页面采集到接口采集的迁移机制:先页面验证可行性,再逆向固化接口方案,接口失效时具备降级回退能力 3. 反爬与稳定性应对 处理滑块验证、图片验证码、行为验证等常见风控手段 设计代理 IP 轮换、请求频率控制、浏览器指纹随机化等策略 应对 webdriver 检测、环境指纹、请求重放校验等前端防护机制 快速响应目标站点页面改版、DOM/JS 变更、接口变更、字段规则变化,缩短故障恢复时间 建立采集异常分类与自动/半自动重试机制 建立故障定位、脚本修复、降级回退与数据回补机制,确保因页面、接口或字段规则变更导致的采集中断能够及时恢复 4. 数据质量与业务协作 按业务优先级采集工商基础信息、变更记录、股东/人员、经营异常等高价值字段 与数据治理、数据应用团队协同,参与多源数据校验、字段映射、主档对齐 输出采集覆盖率、准确率、失败原因等日常运营报表 确保数据采集方案符合目标站点使用规则、公司内部数据合规及信息安全要求,在效率、稳定性与合规之间建立可持续的采集机制
- 技术演进 评估并对接外部RPA/第三方数据源,与自研采集形成互补 将逆向成果产品化(配置化接口模板、签名模块、失效告警) 保障采集能力持续迭代;视业务规模逐步优化架构,当前阶段不追求分布式爬虫集群与大规模代理池 在有限代理、计算与运维资源条件下,持续优化采集策略、调度机制和运行成本,提升采集稳定性、成功率与资源使用效率 6. 参与不定期发版、晚间值守或紧急支持 7. 上级主管或公司要求员工执行的与岗位相关的其他工作内容 MAJOR PROBLEMS / CHALLENGES (required for supervisory/managerial job): Describe 2 or 3 of the most difficult challenges or problems typically encountered in this job 1. 反爬与风控对抗 目标站点普遍存在滑块验证、图片验证码、行为验证等多层风控 IP 封禁(403)、频率限制、webdriver 检测、环境指纹等导致采集中断 需在有限代理资源下维持稳定采集,成本与成功率需平衡 2. 前端逆向与接口稳定性 接口签名/加密逻辑隐藏在混淆 JS 或 Webpack 打包代码中,逆向难度大、维护成本高 WebSocket、GraphQL、动态接口等场景增加分析与复现复杂度 目标站点接口或 JS 逻辑变更频繁,接口方案易失效,需快速定位并修复或降级回退 3. 页面与数据结构变更 目标站点页面改版、DOM/JS 变更、字段规则变化导致解析失败 需在较短时间内完成故障定位、脚本修复与数据回补 4. 数据质量与业务对齐 高价值企业增量更新(日采集 ≤ 1 万家)需在覆盖率、准确率、时效性之间取得平衡 5. 资源与架构约束 独立完成从验证到生产化的全链路建设 当前阶段不建设分布式爬虫集群与大规模代理池,需在轻量架构下保障 7×24 稳定运行 6. 合规与风险控制 采集行为需符合目标站点规则及公司内部数据合规要求 需在效率、稳定性与合规之间找到可持续方案 职位要求: EXPERIENCE, KNOWLEDGE, SKILLS, ABILITIES:
对这个职位感兴趣吗?