AI Agent 评测任务设计与交付运营 at Compass 2.0、即信数科 (2026-06 – Present)
项目制 | AI Agent 任务设计、材料核验、质量评估与交付闭环
- 需求拆解|按任务包组织 query、inputs、golden solution 与 expert notes,梳理业务主体、现场问题、关键数据、限制条件、交付要求和验收口径;信息不足时记录待确认项,不补编业务事实。
- 工作流设计|按输入、交付物、操作步骤、判断点和质量要求编写 workflow,将复杂任务拆解为可执行步骤,核对任务描述、输入材料、参考交付和专家判断口径是否一致。
- 质量评估|对 M1/M2/M3 产物按任务完成度、事实正确性、专业深度、可执行性、格式适配和专业表达 6 个维度检查与排序,输出结构化评估结果。
- 材料与数据检查|核验来源真实性、公开或私有属性、脱敏状态、附件可读性和跨文件依赖;对专利、政策和论文类 PDF 检查文本层,发现扫描件或不可检索文件后替换为同源可用版本。
- 交付优化|整理 Word、Excel、HTML、Markdown、JSON 等交付物,完成杨消_data_001—024 共 24 条可追溯记录;依据质检反馈处理来源缺失、格式错误、结构不匹配和同质化问题,记录修订动作与版本。
大模型场景数据构建与人工评测 (2024-10 – 2025-02)
- 测试设计|围绕信息抽取、内容生成、多任务执行和复杂约束跟随等场景设计并整理百余条有效测试用例,明确输入、期望输出、限制条件和检查点。
- 规模化评测|按准确性、逻辑性、完整性、指令跟随度、可执行性和稳定性等维度完成千余条人工评测,并参与异常样本复核。
- 绩效差距识别|将问题归类为事实错误、逻辑缺失、步骤遗漏、格式偏差和执行不稳定等类型,比较不同结果之间的质量差异,整理问题归因和改进优先级。
- 结论输出|形成参考答案、评分说明、异常记录和优化建议,建立任务设计、样本生产、人工评分、异常复核和结论输出的完整方法。
康研·智护健康数据分析与 AI 应用原型 (2025-03 – 2025-06)
课程实训
- 业务与数据建模|梳理注册登录、健康档案、血压心率、AI 报告、就医推荐、医院资源、医生和预约等流程,建立用户、指标、报告、医院、科室、医生与预约之间的数据关系。
- 指标与分析口径|统一时间、收缩压、舒张压、心率、风险等级、评估状态、报告类型和推荐理由等字段,使用 SQL/MySQL、Python/Pandas 和 Excel 分析异常次数、状态占比、风险分布与结果归因。
- AI 工具原型|使用 uni-app/Vue3、Node.js/Express、MySQL 和 REST API 搭建移动端课程原型;使用 AI 编程工具生成初稿,再人工核对字段、类型、流程、接口、页面状态和运行结果。
- 流程与体验|实现普通用户、医生、管理员三类角色和预约状态流转,围绕必填项、空数据、异常数值、权限边界和取消/确认/完成等路径检查用户体验与数据一致性。
- 上线准备|整理本地运行方式、演示账号、接口地址和验收说明,明确健康指标为模拟数据、报告及建议由规则生成,不涉及真实设备或医疗诊断。
智慧校园图书管理系统 (2024-06 – 2024-09)
- 数据库与接口|使用 Java、Spring Boot、MyBatis 和 MySQL 实现用户、图书和借阅记录等基础模块,完成表结构、CRUD 接口、数据校验和借阅状态处理。
- 问题定位|使用 Postman 检查请求参数和返回结果,结合 MySQL 记录排查空值、重复借阅、字段错误和状态不一致等问题。
- AI Coding 验证|对 AI 工具生成的代码进行人工阅读、运行和修改,以接口结果、数据变化和异常场景处理作为验收依据。