该职位来源于猎聘 岗位职责: 1、负责开源大模型(如Kimi K2、DeepSeek V3、Llama等)在海外GPU集群上的推理部署与性能优化,对模型服务的成本、吞吐、延迟和输出质量负责; 2、使用vLLM、SGLang、TensorRT-LLM等推理框架进行深度调优,优化Continuous Batching、Prefix Cache、Speculative Decoding等关键推理技术,持续提升单位GPU的Token产出效率; 3、针对MoE(Mixture of Experts)模型设计Expert Parallelism策略,优化GPU间通信与路由效率,降低推理成本; 4、实施量化部署(FP8/INT4/W4A8等),在保证模型输出质量的前提下最大化吞吐量与性价比; 5、搭建自动化Benchmark体系,覆盖吞吐(tok/s)、延迟(TTFT/TPOT)、成本($/M tokens)、效果(任务评测)四个维度,以数据驱动优化决策; 6、管理海外GPU集群(H100/H200),优化Spot实例混部策略,降低算力获取成本; 7、将优化后的模型服务发布到OpenRouter等API平台,对接计费、路由、监控等平台能力; 8、跟踪开源模型与推理框架的最新进展(如新模型发布、vLLM新特性、量化算法迭代),快速评估并引入有价值的优化方案。 任职条件: (一)必备条件: 1、本科及以上学历,计算机、人工智能、电子工程等相关专业; 2、3年以上LLM推理或GPU高性能计算相关经验,有vLLM/SGLang/TensorRT-LLM等推理框架的深度使用与调优经验; 3、熟悉CUDA编程模型与GPU并行计算,理解Tensor Parallelism、Pipeline Parallelism、Expert Parallelism等并行策略; 4、有量化部署实操经验(FP8/INT4/GPTQ/AWQ等),能独立完成量化前后的效果评测与Trade-off分析; 5、熟悉Docker/Kubernetes等容器化部署,有大规模GPU集群管理与运维经验; 6、具备Benchmark驱动的工作习惯,能用数据说话,系统化地定位性能瓶颈并优化; 7、具备良好的英文技术文献阅读与沟通能力,能跟踪海外开源社区最新进展。 (二)优先条件: 1、有OpenRouter/Together AI/Fireworks等Token API平台部署经验,了解其计费与路由机制; 2、有MoE模型(如DeepSeek V3、Kimi K2等)推理优化经验,熟悉Expert Parallelism与路由优化; 3、有Speculative Decoding(EAGLE/DSpark等)或Prefix Cache优化的实战经验与可验证的吞吐提升数据。
对这个职位感兴趣吗?