Infra/DevOps Engineer | DevOps/运维/基础设施工程师
视界之外(上海)科技有限公司职位描述
【岗位定位】 - 负责 AI 训练/推理 GPU 集群的日常运维与扩缩容,搭建基于 K8s 的 CI/CD、监控告警等基础设施,是公司 AI 基础设施的稳定性守门人。 【岗位职责】 - GPU 集群运维:负责 AI 训练/推理 GPU 集群的日常运维、扩缩容、驱动与框架版本管理。 - 云原生体系建设:搭建基于 K8s 的 CI/CD、监控告警、日志采集、自动伸缩等基础设施。 - 稳定性保障:制定容灾与故障恢复预案,主导线上 P0/P1 故障的快速定位与恢复。 - 容器与编排:深入理解 Docker/Kubernetes 原理,有大规模集群运维和定制化开发经验。 【硬性条件】 - 学历:985/211 院校全日制本科及以上。 - 专业:计算机科学(CS)相关专业(如计算机科学与技术、软件工程、信息安全、人工智能、网络工程等)。 - 经验:3-10 年技术相关工作经验(>3 年且 <10 年)。 - 创业心态:具备 All in 意愿,能接受早期不确定性,愿意高强度投入;对新技术学习速度快,能适应创业公司 0→1 快速迭代的节奏。 【专业能力】 - GPU/AI 生态:熟悉 NVIDIA CUDA 生态(Driver、Container Toolkit、MIG)或 ROCm 等异构方案。 - 可观测性:熟练使用 Prometheus、Grafana、ELK、OpenTelemetry 等监控与日志工具链。 - IaC 能力:熟悉 Terraform/Ansible 等基础设施即代码工具,能实现环境的标准化自动化交付。 - 深度学习框架部署:有 PyTorch/TensorFlow 生产环境大规模部署与性能调优经验。 【通用能力】 - 7×24 响应:对线上稳定性有极强的责任感,能接受早期 on-call 轮值,快速响应故障。 - 自动化思维:遇到重复性问题优先思考的是'写脚本/建平台',而非手工处理。
对这个职位感兴趣吗?