Skip to main content

豆包大模型场景评测算法工程师(Agent/Coding) - 火山方舟

Sales
字节跳动
北京市, 中国3天前截至 2026/10/8
全职

职位描述

职位描述

团队介绍:火山方舟是火山引擎推出的一站式大模型服务平台,是中国大模型市场产品和份额领跑者。平台提供模型推理、评测、精调等全流程服务。方舟搭载了豆包及业界主流大模型,提供丰富的插件生态和AI应用开发服务,并通过稳定可靠的安全互信方案、专业的算法技术服务,全方位保障企业级AI应用落地。

1、深入理解企业客户的大模型应用场景,将客户问题与反馈抽象为可复现、可量化的评测任务,建立从业务目标到评测指标的映射;

2、围绕Agent工具调用、RAG检索、多轮对话、Coding等复杂链路,设计并建设端到端评测Pipeline,覆盖任务构造、自动执行、结果判定与版本对比,基于真实Workflow构建高质量评测集与案例体系,持续治理样本覆盖度、难度分层、数据质量和评测稳定性;

3、设计结果与过程指标,包括任务完成率、工具调用准确率、检索质量、代码通过率、多步规划成功率等,定位模型在链路中的具体失败环节;

4、分析评测结果与失败案例,形成可解释的根因判断,并与模型、产品、解决方案和客户团队协作,推动模型及产品能力迭代;

5、建设评测自动化与效率工具,探索LLM-as-a-Judge、规则/执行器判定、人机协同评测等方法,提高复杂场景评测的规模、效率与可信度。

职位要求

1、本科及以上学历,计算机、软件工程、人工智能或相关专业;

2、具备扎实的Python编程和工程实现能力,能够独立完成数据处理、接口调用、自动化测试或评测Pipeline建设;

3、深入使用过主流大模型及Agent/Coding类产品,理解上下文、工具调用、RAG、规划、代码生成等能力边界与常见失败模式;

4、具备数据分析与实验意识,能够进行指标设计、样本分层、误差分析和根因定位,并以数据支持判断;

5、具备良好的业务理解和跨团队协作能力,能够把模糊客户需求转化为清晰、可执行的技术任务;

6、自驱、务实,能够在快速变化的模型和工具环境中持续学习并推动方案落地。

加分项

1、有大模型评测、Agent/RAG应用、AI Coding、测试平台或模型质量体系的实际建设经验;

2、熟悉OpenAI Evals、LangSmith、Langfuse、RAGAS、DeepEval、SWE-bench、HumanEval等评测框架或基准中的一项或多项,并理解其适用边界;

3、有To B客户项目、解决方案、开发者平台或企业AI应用落地经验;

4、有LLM-as-a-Judge、一致性校准、自动判分器、合成数据或评测集治理经验。

Keywords
Coding

对这个职位感兴趣吗?