Skip to main content

python数据爬虫工程师招聘_上海博为峰信息技术有限公司招聘 - 智联招聘

Technology
上海博为峰信息技术有限公司
1周前截至 2026/9/25

职位描述

一、岗位职责

  • 结合大模型训练需求,设计和优化高效、智能化的爬虫系统,进行多源(文本、语音、视觉)数据采集。
  • 针对大模型数据预处理要求,优化爬虫数据格式和质量,提升爬取数据对训练和推理的适用性。
  • 结合大模型场景,构建半自动/自动化定向抓取能力,推进数据抓取工作平台化建设。
  • 跟进最新的反爬技术与反制策略,持续优化爬虫架构和性能,保障数据采集的稳定性与持续性。
  • 负责数据存储方案设计与基础查询优化,确保大规模数据的高效存取。

二、职位要求

  • 本科及以上学历,计算机科学、人工智能、网络安全等相关专业,具备多年爬虫开发相关工作经验。
  • 精通Python 编程语言,熟练掌握 Scrapy、BeautifulSoup、Selenium、Playwright 等爬虫相关框架与工具。
  • 熟悉并能绕过常见的反爬技术,具备独立解决IP 代理、验证码识别、动态渲染、JS 加密等反爬问题的能力。
  • 熟悉HTTP/HTTPS 协议及常见 Web 前端技术(HTML、CSS、JavaScript),能分析动态网页加载逻辑,对复杂数据进行高效提取和清洗。
  • 熟悉大模型训练和数据处理流程,能够根据模型需求灵活调整数据抓取策略。
  • 熟悉MySQL、MongoDB 等数据库的使用,能完成数据的存储与基本的查询优化。
  • 具备良好的问题排查能力、沟通协作能力和责任心,有较强的学习能力和技术钻研精神。

三、加分项

  • 有大规模数据抓取与处理经验,尤其是针对大模型训练数据的采集和优化。
  • 有大模型或AI 相关领域的爬虫应用经验,能够理解和支持模型数据需求。
  • 熟悉数据加密与解密技术,能够破解复杂的加密算法。

具备AI 或大模型领域的技术背景,对模型训练全流程有深入理解。

Keywords
PythonSQL数据采集数据挖掘HadoopHiveScrapyFlask人工智能HTML5Apache HadoopMongodbJavaScriptHtmlSelenium

对这个职位感兴趣吗?