AI 平台运维工程师-外企驻场
职位描述
该职位来源于猎聘 岗位职责 日常运维与 ITIL 流程管理:负责日常 AI 运维请求与故障(Incidents)处理,在 AI/ML 平台全景中覆盖生产及非生产环境的事件管理、问题管理与变更管理流程。为各类 AI 平台、模型、流水线及业务场景(包括但不限于大语言模型/生成式 AI 服务、模型推理端点、机器学习训练流水线、数据科学、向量数据库、RAG 应用、MLOps 工具链等)提供咨询、平台建议与运营支持。 模型即服务 (MaaS) 运营:负责 MaaS 产品的全生命周期管理,包括模型与端点的接入、API 网关与配额/限流管理、多租户访问控制、版本管理与回滚、容量规划,以及跨团队和跨业务场景的成本消耗追踪与分摊(Chargeback)。 可观测性体系建设:为 AI/ML 工作负载设计并构建可观测性体系,涵盖指标、日志、链路追踪及模型专属遥测数据(如 Prompt/Response 日志、推理延迟、Token 消耗、GPU 利用率、向量嵌入质量等);监控 AI/ML 服务、模型端点及推理流水线的健康度、性能、延迟、吞吐量与成本。 监控告警与 SLO 管理:使用 Grafana、Prometheus、Datadog、Splunk、ELK、OpenTelemetry 等工具搭建与调优监控仪表盘及告警规则;定义并维护 AI 服务的 SLI/SLO/SLA 及错误预算(Error Budget),配置主动式告警以在影响用户前发现异常。 模型性能监控与反馈闭环:建立模型性能监控机制(涵盖模型漂移、数据漂移、准确率下降、幻觉率、偏见/公平性指标),构建持续优化的反馈闭环;排查并解决模型相关问题,如配额耗尽、GPU/算力饱和及推理质量下降等。 AIOps 与自动化运维:推动 AIOps 落地,利用自动化及机器学习技术实现异常检测、告警关联、降噪、根因分析及预测性/自愈运维;自动化常规运维任务(健康检查、应急预案、扩缩容、故障切换、重训练触发等),减少人工事务(Toil)并降低平均修复时间(MTTR)。 基础设施即代码 (IaC) 与 CI/CD:使用 Terraform、Ansible、Python 等工具构建和维护自动化脚本、流水线及 IaC 配置;支持 MLOps/LLMOps 的 CI/CD 流水线,确保模型及 AI 应用部署的可靠性、可观测性与可重复性。 文档与知识库管理:维护产品文档与知识库(如 GitLab Markdown、Confluence、GitHub Pages、Google Sites、Backstage 等),编写并完善 AI 服务的应急预案(Runbooks)、事故复盘报告(Postmortems)及运维手册。 统筹与优化:统筹日常运维工作,协调资源解决疑难问题,持续提升 AI 运营水平。 任职资格与要求 核心硬性技能 优秀的英语读写能力。 熟悉 AI 模型全生命周期管理。 熟悉 Grafana 及 Prometheus 监控体系。 客户侧个人能力要求 1. AI 技术应用与落地 工程化与流程:熟悉 Harness / Loop 工程及人工介入(HITL)机制。 生成式 AI 生态:精通 GenAI / RAG / GraphRAG 及向量数据库(如 Milvus, pgvector, Qdrant)。 智能体架构:具备 Agentic Workflows 及多智能体编排能力。 协议与集成:熟悉模型上下文协议(MCP)服务器的集成与开发。 安全合规:具备 AI 护栏(Guardrails)与合规工程能力。 可观测性:具备业务场景的可观测性与全链路追溯分析能力。 评估体系:掌握提示词工程(Prompt Engineering)及系统化的模型评估框架。 数据能力:具备结构化与非结构化数据报表能力;熟悉数据建模(知识图谱、数据湖、Data Vault、数据仓库)。 行业与软技能:具备医疗健康领域专业知识与沟通能力;具备良好的项目管理能力。 2. AI 平台管理与后端开发 基础设施:熟悉 AWS、阿里云及本地私有云(On-Premises)基础设施。 云原生与 IaC:精通 IaC(基础设施即代码)、Kubernetes。 数据库与调度:熟悉 PostgreSQL、MySQL、Redshift 等数据库;熟悉 Kubernetes、Celery、SLURM 等调度系统。 微服务与鉴权:具备微服务与 REST API 开发经验;熟悉 IAM 集成(Ping Federation, AD, Centrify, Azure AD, Okta)及 RBAC 权限模型。 系统管理:熟悉 Linux 操作系统管理(包括 RedHat Satellite、驱动及包管理)。 AI 框架:熟悉 vLLM、Kubeflow、SGLang 等主流 AI/ML 框架。 3. 前端开发 框架与语言:熟悉 React/Vue/Angular/OpenWebUI 等前端框架;掌握 JavaScript/TypeScript/HTML/CSS/ES6 等技术。 集成与构建:具备后端 API 及 REST API 集成能力;熟悉 Webpack/Vite 等构建工具。 自动化与数据:具备端到端自动化测试框架经验;熟悉数据建模与数据库。 4. 运维框架与软技能 方法论:熟悉 DevOps、敏捷开发框架及工具集;掌握 ITIL、SDLC 及各类运维框架。 协作与文档:具备全球化团队协作能力,能胜任方案设计与故障排查;具备专业的英文技术文档撰写能力。
对这个职位感兴趣吗?