大模型后训练工程师(Coding Agent)(A94569)
Marketing
中国集团
北京市, 中国2周前截至 2026/10/23
全职
职位描述
该职位来源于猎聘 我们正在构建面向游戏开发的下一代 AI Coding Agent,探索大语言模型在代码生成、工具调用、环境交互和复杂软件开发任务中的智能化能力。团队聚焦 LLM Post-training、Agentic Reinforcement Learning、Code Agent 和 Agent Evaluation 等前沿方向,希望打造能够自主完成 Unity 游戏开发任务的智能开发助手。 - 负责 Coding Agent 后训练数据体系建设,主导 数据构建、质量评估、数据配比优化和训练数据迭代,持续提升模型在游戏开发任务中的能力。 - 负责模型后训练与合版工作,推动 Base Model → SFT Model → RL Model → Production Model 的完整演进流程,包括模型选择、能力分析、checkpoint 管理、模型 merge 以及效果验证。 - 建立面向 Agent 能力提升的数据闭环,通过分析模型失败案例,定位数据缺陷和能力瓶颈,设计针对性的训练数据和优化策略。 - 面向 Unity 游戏开发场景(Shader、粒子、UI、场景构建、性能分析等),负责领域能力增强方案设计,包括数据策略、训练方法和模型评估。 - 与 Agent 工程团队协作,优化主 Agent + SubAgent 架构中的模型能力分工和协作策略。 职位要求 - 本科及以上学历,计算机、人工智能、数学等相关专业,硕博优先。 - 具备 大模型后训练团队工作经验,深入参与过 LLM 数据构建和模型训练迭代流程。 - 具备丰富的 训练数据工程经验,包括但不限于:
- SFT 数据构造、清洗、过滤和质量控制;
- Preference / RL 数据设计;
- 多轮 Agent Trajectory 数据生产;
- 数据混合比例设计和效果分析。 - 具备 模型合版(Model Merge)经验,熟悉:
- 不同训练阶段 checkpoint 分析;
- SFT、RL 模型能力对比;
- 多能力模型融合和效果验证;
- 模型能力回退和遗忘问题分析。 - 熟悉 LLM 后训练完整流程,包括 SFT、RLHF、DPO、GRPO 等训练方法,并有实际落地经验。 - 具备 Agent、Function Calling、Tool Use 或 Code LLM 相关经验。 - 熟悉分布式训练框架(DeepSpeed、FSDP、Megatron等),有大规模训练调优经验。 - 具备较强实验分析能力,能够从数据、训练策略和模型结构多个角度定位问题。 加分项 - 有大模型后训练团队实习/工作经历。 - 有Code LLM、Coding Agent的训练经验。 - 有大规模 Agent Trajectory 数据生产和自动化评测经验。 - 有模型能力分析、Benchmark 构建或数据驱动模型优化经验。
Keywords
DeepSpeedCodingUnity
对这个职位感兴趣吗?