python数据爬虫工程师招聘_上海博为峰信息技术有限公司招聘 - 智联招聘
Technology
上海博为峰信息技术有限公司1周前截至 2026/9/25
职位描述
一、岗位职责
- 结合大模型训练需求,设计和优化高效、智能化的爬虫系统,进行多源(文本、语音、视觉)数据采集。
- 针对大模型数据预处理要求,优化爬虫数据格式和质量,提升爬取数据对训练和推理的适用性。
- 结合大模型场景,构建半自动/自动化定向抓取能力,推进数据抓取工作平台化建设。
- 跟进最新的反爬技术与反制策略,持续优化爬虫架构和性能,保障数据采集的稳定性与持续性。
- 负责数据存储方案设计与基础查询优化,确保大规模数据的高效存取。
二、职位要求
- 本科及以上学历,计算机科学、人工智能、网络安全等相关专业,具备多年爬虫开发相关工作经验。
- 精通Python 编程语言,熟练掌握 Scrapy、BeautifulSoup、Selenium、Playwright 等爬虫相关框架与工具。
- 熟悉并能绕过常见的反爬技术,具备独立解决IP 代理、验证码识别、动态渲染、JS 加密等反爬问题的能力。
- 熟悉HTTP/HTTPS 协议及常见 Web 前端技术(HTML、CSS、JavaScript),能分析动态网页加载逻辑,对复杂数据进行高效提取和清洗。
- 熟悉大模型训练和数据处理流程,能够根据模型需求灵活调整数据抓取策略。
- 熟悉MySQL、MongoDB 等数据库的使用,能完成数据的存储与基本的查询优化。
- 具备良好的问题排查能力、沟通协作能力和责任心,有较强的学习能力和技术钻研精神。
三、加分项
- 有大规模数据抓取与处理经验,尤其是针对大模型训练数据的采集和优化。
- 有大模型或AI 相关领域的爬虫应用经验,能够理解和支持模型数据需求。
- 熟悉数据加密与解密技术,能够破解复杂的加密算法。
具备AI 或大模型领域的技术背景,对模型训练全流程有深入理解。
Keywords
PythonSQL数据采集数据挖掘HadoopHiveScrapyFlask人工智能HTML5Apache HadoopMongodbJavaScriptHtmlSelenium
对这个职位感兴趣吗?