大模型安全算法工程师/专家(Agent)
北京熠序科技有限公司职位描述
我们正在建设面向 AI Agent 的运行时安全和免疫系统,希望通过 AI 管理 AI:理解 Agent 的长程行为,识别风险,生成或选择控制策略,并通过数据、评测和模型迭代持续提升安全能力。 这个岗位不是单纯调用大模型 API、做 Prompt 工程或内容审核,而是需要围绕行为轨迹、风险识别、攻击生成、安全对齐和策略判断,完成数据、模型、评测与上线闭环。 岗位职责: 1. 建设 Agent 行为轨迹、攻击样本、正常样本和策略反馈的数据体系。 2. 设计风险识别、异常检测、长程行为理解、攻击生成或安全策略模型。 3. 建立 baseline、评测指标、误差分类、消融实验和回归测试体系。 4. 探索监督微调、偏好优化、强化学习、Judge/Reward Model 等技术在 Agent 安全中的应用。 5. 将模型接入 Agent Runtime 和产品平台,联合优化准确率、误报率、延迟、成本和可解释性。 6. 分析线上 bad case、数据分布变化和模型失效原因,持续迭代数据与模型。 7. 与安全研究团队共同把攻击经验转化为数据、评测任务和模型能力。 任职要求: 1. 具备扎实的机器学习、深度学习或大模型后训练能力。 2. 至少完整负责过一个从问题定义、数据、baseline、实验到部署或验收的模型项目。 3. 能清楚说明本人负责的数据、代码、训练、评测和关键技术决策。 4. 理解数据泄漏、标签质量、分布偏移、指标选择、因果归因和过拟合等问题。 5. 具备良好的工程意识,愿意把模型接入真实产品,而不是停留在 notebook、论文复现或 Prompt 调参阶段。 6. 对 Agent、模型安全或 AI 行为治理有兴趣,能够主动形成判断并快速学习新方向。 加分项: 1. 有大模型对齐、安全评测、强化学习、Judge/Reward Model 或 post-training 经验。 2. 有轨迹建模、异常检测、风控、可解释性或多步决策经验。 3. 有 Agent 规划、评测、多模态、长上下文或 ML Systems 经验。 4. 有高质量论文、开源代码、可复现实验或模型上线经验。 5. 做过内容安全、风控或推荐算法,并能将能力迁移到行为、工具调用和长程轨迹问题。 我们重点关注候选人是否真正理解数据、baseline、实验、误差和上线约束,不以“大模型”“强化学习”等关键词数量判断能力。
对这个职位感兴趣吗?