Skip to main content

Agent评测工程师

Technology
上海易宝软件有限公司深圳分公司
北京市, 中国¥13,000 - ¥18,000 /月3周前截至 2026/10/18
全职

职位描述

该职位来源于猎聘 岗位职责 1、负责大模型 Agent 系统评测体系搭建与落地,围绕工具调用、多轮规划、长程任务、多模态交互、记忆反思等方向开展评测工作; 2、搭建 Agent 评测任务体系,覆盖单 / 多工具调用编排、长链路任务执行、异常场景恢复等场景;搭建模拟沙箱环境、Mock 接口、模拟数据库,支撑标准化评测; 3、设计评测评判标准,搭建自动化评测流程,实现任务运行、日志采集、指标统计、版本回归对比、可视化报告输出; 4、持续迭代评测指标:任务成功率、工具调用准确率、幻觉率、响应时延、合规安全性等,针对失败案例开展深度分析; 5、协同算法、产品团队定位模型问题,沉淀评测基准数据集与标准化评测方法论;跟进行业 Agent、大模型评测前沿技术,落地前沿评测方案。 任职要求 1、本科及以上,计算机、人工智能、数学、统计等相关专业;2 年以上 LLM/NLP/Agent 评测、算法、数据工程相关经验; 2、熟悉主流大模型、Agent 框架,理解 Function Calling、ReAct、Plan-and-Execute 等经典智能体范式; 3、熟练使用 Python;掌握 LangSmith、Ragas、Promptfoo、DeepEval 等至少一类评测工具,具备数据处理与可视化能力; 4、逻辑清晰,具备完整实验思维,可独立完成「需求定义 - 数据集搭建 - 指标设计 - 自动化实验 - 结论输出」全流程; 5、具备中英文文献阅读能力,能够跟进、复现业内前沿评测方案。 优先加分项 1.法律 / 金融 / 办公 / 代码等垂直领域评测数据集搭建经验,熟悉专家标注流程 2.掌握 LLM-as-a-Judge、竞技场对比评测、人机协同标注方案,了解评测偏差优化 3.有开源评测 Benchmark 贡献、AI 相关论文、算法竞赛获奖经历

Keywords
monthsOfExperience: 24ReactOSPythonReact.js

对这个职位感兴趣吗?