Skip to main content

Agent稳定性测试工程师

Technology
美团
4天前截至 2026/10/26
全职

职位描述

基础研发平台是美团的核心技术平台,立足于“零售+科技”的战略定位,通过打造人工智能、大数据、云计算、安全等核心技术能力,以及研发效能平台、企业应用平台等公共服务,为业务提供稳定安全、扩展易用、技术领先的平台技术和产品服务。 在这里,我们会参与到最前沿的技术研发和探索;能够接触超规模集群、海量数据,挑战高复杂业务场景,有机会与业界一流的工程师一起并肩前行。 在这里,我们有超强的技术氛围,持续向社区贡献业界实践,加速行业技术发展;我们有完善的互联网学习生态圈,重视底层逻辑和方法论,助力职业生涯的非线性成长。 真诚地邀请你,和我们一起驱动技术发展,创造行业价值。 岗位职责 负责 CatPaw Agent 稳定性测试和评测体系建设,设计并实现覆盖 Skill/Plugin、工具调用、端到端任务完成度的评测框架与自动化测试基建,支撑模型与策略选型决策,以及持续量化并提升开发者体验。 面向 CatPaw 多智能体集群构建运行时评测能力,针对路由调度、会话管理、记忆系统等模块设计场景化用例集与回归基线,识别多轮长链路下的能力衰减与稳定性风险。 主导长程任务 harness 效果评估工作,围绕Prompt 工程、tool Calling 、上下文管理、以及memory能力建立指标体系,评测驱动Agent持续优化。 主导CatPaw Agent产品需求交付质量保障、AI自动化测试开发,保障Agent产品的高质量高效上线。 覆盖 IM/社交/办公等多端渠道及浏览器自动化场景的真实链路验收,badcase分析,沉淀可复用的场景数据集与自动化巡检能力,推动线上质量可观测,以及数据飞轮建设。 参与安全与合规评测,针对多租户权限隔离、数据沙箱、越权与提示注入等风险构建红队用例与对抗性评测方案,保障系统安全性与稳定性。 岗位基本需求 大学本科及以上学历,3 年以上研发或质量工程经验,精通 TypeScript/Node.js 或 Python,具备较强的工程实现能力。 重度 AI Coding 用户,熟练使用 CatPaw/NoCode/Cursor/CC/CodeX 等 AI 编程工具完成日常开发与评测脚本建设。 深入理解 LLM 应用开发,掌握 Prompt 设计、Tool Use、RAG 等核心技术,理解其常见失效模式与对应的评估手段。 熟悉大模型评测方法论,包括自动化评测、LLM-as-a-Judge、人工标注与抽样、A/B 实验与统计显著性判断,能设计出可复现、低噪声的评测流程。 具备平台或框架级系统设计能力,能独立完成评测平台核心模块的架构与实现,并推动数据驱动的质量改进落地。 具备自驱力,善于与 AI 协作,主动探索技术边界并推动结论转化为产品迭代。 具备以下者优先 有 Agent 平台、AI-IDE 或 CLI 工具链的评测/质量保障经验。 熟悉浏览器自动化技术(如 Playwright/CDP),能用于构建端到端评测与线上巡检。 参与过公开或自建 Benchmark(如 SWE-bench、AgentBench、GAIA 类任务集)的建设、复现或评测数据集标注。 负责过Agent产品:WorkBuddy、QoderWork、Claude的测试质量保障工作 搭建过 AI 助理并投入日常使用,对 Agent 的真实体验瓶颈有及时判断。 岗位亮点 参与构建下一代 AI Agent 开发框架的评测标准与质量体系,结论直接影响框架演进方向,技术影响力广泛。 深度使用 AI 工具进行开发与评测,鼓励高效人机协作。 与前沿 AI 技术团队共同探索多智能体系统、浏览器自动化等创新方向的评估难题。 扁平化工作环境,支持技术自主决策与快速迭代。 工作地点位于成都市,享受优质科技人才生态与生活环境。

Keywords
3-5年Plug-inCodingTypescriptNode.jsCursorJavaScriptC++ChromecastPythonNode

对这个职位感兴趣吗?