高级云基础设施 / DevOps 工程师
猎聘(昌都)有限责任公司职位描述
Knowledge Stack 做的是企业级知识管理与分析平台。企业攒了多年的文档、数据和经验散在各个系统里,真要用的时候找不到,找到了也不太敢信,我们做的就是把这件事解决掉。技术上跑 Kubernetes、向量数据库、LLM 推理和全套可观测性;产品既有公有云 SaaS,也要打包交付到客户内网做私有化部署,工程问题都挺具体。团队不大,节奏快,架构定下来这周就能上线。公司还在往上走,岗位边界会跟着一起长,我们想找能长期做下去、把这套系统当成自己作品的人。 职位简介 这个岗位是基础设施负责人,怎么设计、用什么技术、按什么节奏演进都由你主导!具体范围: •云基础设施与交付链路:以 IaC 管理多云与裸金属环境;建设并维护 CI/CD 流水线与 GitOps 工作流 •Kubernetes 集群运营:3 套集群(2 套生产 + 1 套预发),单集群约 5–10 个节点、约 100 个容器,集群里跑的所有东西归你 •应用打包:编写与维护 Helm Chart,持续优化 Dockerfile 的构建速度、镜像体积、缓存命中和安全基线 •稳定性与成本:可观测性全栈、告警与值班流程(打通 Slack)、容量规划,以及任务队列的自动伸缩 •GPU 与私有化交付:GPU 容器与单卡本地推理容器(OCR 等);客户内网部署所用的 docker-compose 编排 •版本发布与回滚:面向多云环境与私有化部署的容器版本发布、更新与回滚体系 •专项课题:Qdrant 集群调优、ClickHouse 集群运维、Langfuse 扩展到支撑超大规模流量 前 3 个月的重点 •搭建性能监控与告警体系,能主动发现系统问题 •为任务队列做自动伸缩 •部署 OCR 等 GPU 推理负载 •用 IaC 完成多套云环境的部署 •优化私有化部署包 •建立可扩展的版本发布、更新与回滚体系,把容器更新推送到多个云环境与私有化部署 必备条件 •5 年以上:云基础设施 / SRE / DevOps 生产环境经验,有独立负责整套基础设施的经历 •Kubernetes 深度实战:Helm、RBAC、Ingress、存储与网络、资源配额、HPA/VPA 与队列驱动伸缩(KEDA 等)、故障排查与版本升级 •GitOps 与 CI/CD:ArgoCD 或 Flux 的生产落地经验;GitLab CI / GitHub Actions / Jenkins 任一体系能从零设计流水线;熟悉蓝绿 / 金丝雀发布与回滚机制 •IaC:Terraform / Pulumi / Ansible 等,习惯把基础设施全部以代码管理 •容器工程:多阶段构建、镜像瘦身与构建缓存优化,理解容器运行时与安全基线 •可观测性:Prometheus / Grafana / Loki 或 ELK / OpenTelemetry,能自行设计指标与告警规则 •多云与裸金属:熟悉主流公有云(阿里云 / AWS / GCP 等)与裸金属部署;扎实的 Linux 与容器技术功底,能排查网络、存储与性能问题 •英文读写熟练:能无障碍阅读英文技术文档、issue 和源码,并用英文书面沟通 •能独立作战:习惯自己查文档、自己做决定、自己收尾,无需逐步指导 加分项 •向量数据库(Qdrant / Milvus 等)与 OLAP 引擎(ClickHouse 等)的生产运维经验 •LLM 可观测性(Langfuse 等)或大规模 LLM 应用基础设施经验 •GPU 基础设施:NVIDIA Docker、CUDA 驱动栈,以及 vLLM / SGLang 等推理框架 •制品与镜像仓库管理(Harbor 等),以及离线交付包的构建与分发 •熟悉 Service Mesh、Cilium / eBPF 等 CNI 插件,以及密钥与安全管理(Vault / SOPS) •等保 / ISO27001 / SOC2 合规实践;数据库与中间件运维(PostgreSQL、Redis、Temporal 等) •开源项目贡献或可展示的个人项目;英文口语流利;初创公司经历
对这个职位感兴趣吗?