岗位职责: 1.建立 LLM / Agent / 多模态应用的评测指标、评测集和回归流程。 2.设计并维护覆盖核心用户场景的 benchmark 和 bad case 库。 3.建设自动化评测能力,支持模型、prompt、Agent 策略和产品版本对比。 4.组织人工标注、质量抽检、误差分析和问题归因。 5.搭建质量看板,跟踪效果、稳定性、成本、延迟和安全相关指标。 6.与 Agent、平台、产品团队共同制定上线门槛和发布验收标准。 任职资格: 1.3 年以上数据、算法、评测、AI 应用或质量工程相关经验。 2.熟悉 LLM eval、Agent eval、benchmark、标注规范、样本构