西安量子智能科技有限公司一、岗位职责: 1、负责强化学习相关算法研究与应用,针对四足机器人、人形机器人控制、路径规划、任务执行等场景,设计并实现有效的强化学习解决方案; 2、参与问题建模与算法选择,包括状态表示、动作空间设计、奖励函数设计、训练环境构建及策略优化流程; 3、负责强化学习模型的训练、调优、实验验证与效果分析,持续提升智能体决策性能和训练稳定性; 4、结合真实业务或仿真场景,推动强化学习算法从实验研究到工程落地; 5、与机器人、算法、软件工程等团队协作,完成从数据采集、环境搭建、模型训练到部署验证的全流程工作; 二、岗位要求: 1、具备强化学习相关理论基础,熟悉MDP、动态规划、价值函数近似、策略梯度、Actor-critic等核心概念; 2、熟悉PPo(Proximal Policy Optimization)原理,理解其clipped objective、优势函数估计、KL约束、策略更新稳定性等关键设计思想; 3、具备独立开展强化学习项目的能力,能够完成环境搭建、奖励设计、训练流程实现、参数调优和实验结果分析; 4、具备至少一个真实强化学习项目或研究经验,能够独立负责从问题定义到算法实现、模型训练、实验验证的全过程;熟悉Python及深度学习框架,如PyTorch,能够实现并调试 pPO、DaN、TRPo等常见强化学习算法; 5、具备工程实践能力,能够解决训练过程中的不稳定性、收敛问题、奖励稀疏问题及算法调参问题; 6、对智能体学习、机器人控制、决策优化、强化学习仿真环境等方向有较强兴趣和实践基础; 7、具备良好的科研与工程思维,能够独立分析实验问题,形成结论并持续迭代优化。 三、优先条件: 1、有强化学习项目经验,尤其是PPo、sAC、DQN、Actor-critic相关算法的实现与实践经验; 2、具有机器人、自动驾驶、控制、智能调度、决策优化等方向强化学习应用经验; 3、熟悉OpenAI Gym、MwloCo、Isaac Gym、IsaacLab等强化学习环境或训练平台; 4、参与过真实智能体训练、仿真平台构建、模型部署或在线学习相关工作者优先; 5、有算法创新、研究论文、比赛获奖、创新项目或相关科研经历者优先; 6、对强化学习与机器人结合、复杂决策系统、长期任务学习有较深理解者优先。 四、任职资格: 1、计算机、自动化、机器人、控制、数学、人工智能等相关专业优先; 2、具备较强编程能力和工程执行力,能够独立完成研究验证和项目落地; 3、具有较强的学习能力和跨领域协作能力,能与研究、工程团队高效沟通。
对这个职位感兴趣吗?