Skip to main content

初级驻场GPU服务器运维工程师

Technology
上海泛思信息科技有限公司
上海市, 中国¥6,000 - ¥10,000 /月3周前截至 2026/8/27
全职

职位描述

该职位来源于猎聘 【岗位职责】 1. 硬件运维与资产管理(IDC现场工作)

  • 设备上下架:负责GPU服务器、交换机等网络设备的收货、开箱、上架、物理连线(电源线、网线、光纤、IB线)及标签规范化化张贴。
  • 硬件排障:熟练通过BMC/IPMI等带外管理工具或现场排查,定位服务器硬件故障。负责内存、硬盘、电源、风扇及GPU加速卡的拔插、更换与测试。
  • 厂商对接:配合服务器硬件厂商(如浪潮、新华三、戴尔、NVIDIA等)工程师进行现场部件更换,追踪维修进度。
  • 资产盘点:维护IDC机房现场的硬件资产台账(CMDB),确保实物与系统数据一致,管理现场备品备件库。 2. 系统与环境部署
  • OS安装:负责大批量GPU服务器的Linux操作系统安装(Ubuntu/CentOS等)及基础网络配置。
  • 驱动与环境:负责NVIDIA GPU显卡驱动(Driver)、CUDA Toolkit、cuDNN等基础深度学习运行环境的安装与初步配置。
  • 基础测试:使用nvidia-smi、nvddl、gpu-burn 等工具对新上架或维修后的GPU服务器进行压力测试和健康度检查。 3. 日常巡检与监控响应
  • 现场巡检:每日按SOP执行机房现场巡检(温湿度、异响、报警灯状态、动环系统状态),填写巡检日志。
  • 告警响应:监控Zabbix/Prometheus等告警平台,对服务器死机、网络中断、GPU掉卡/过热等初级告警进行第一层响应(L1 Support)。
  • 升级跟进:对于无法独立解决的复杂系统级或网络级故障,快速收集日志并准确升级至高级SRE工程师或网络工程师,配合完成故障恢复(保障SLA目标)。 【任职要求】 1. 基本要求
  • 统招大专及以上学历,计算机科学、网络工程、电子信息等相关专业优先。
  • 1年以上IDC数据中心运维或Linux系统运维经验(优秀的应届毕业生亦可考虑)。
  • 能够适应IDC机房环境(噪音、低温),接受一定程度的倒班或周末值班安排(7x24小时响应要求)。 2. 专业技能
  • 系统基础: 熟悉Linux操作系统基础命令,了解文件权限、进程管理、系统日志查看及基本网络配置(IP/路由/DNS)。
  • 硬件知识: 熟悉X86服务器内部架构,了解CPU、内存、RAID阵列卡、NVMe SSD的工作原理。
  • GPU认知: 了解GPU服务器与普通CPU服务器的物理区别,对主流NVIDIA GPU(如A100/H100/RTX 4090等)、PCIe与SXM架构有一定认知者优先。
  • 网络基础: 了解基础网络拓扑,认识常见的光模块、光纤线、DAC线缆,了解交换机基本连线规则。 3. 软性素质
  • 极强的执行力和责任心,做事严谨细致(机房操作无小事,需严格遵守SOP规范)。
  • 具备良好的沟通表达能力及服务意识(需对接客户及二线技术团队)。
  • 具备一定的抗压能力,在突发故障时能保持冷静并按流程处理。

Keywords
monthsOfExperience: 12CUDALinuxUbuntu

对这个职位感兴趣吗?