岗位描述(节选)
1. 评测体系驱动
● 将业务需求转化为可执行、可评测的Agent任务,明确能力边界、风险和验收标准。
● 建设离线与在线评测体系,包括任务分级、评测数据集、回归测试和真实轨迹分析;设计任务成功率、工具调用准确率、人工接管率、执行步数、延迟及Token成本等指标。
● 建立失败归因机制,区分模型、规划、工具、上下文和系统问题,驱动Prompt、Skill、模型及Harness持续优化。
2. 长程任务规划、决策与强化学习
● 负责多步骤、多工具、跨系统任务的拆解、规划、执行与验证,设计Planner–Executor–Verifier、任务图及动态Replan机制。
● 建设状态持久化、检查点、断点续跑、幂等执行和失败恢复能力,解决计划漂移、循环调用、上下文污染及长程任务信用分配问题。
● 构建Agent RL训练闭环,包括轨迹采集、环境回放、奖励设计和策略评估;熟悉SFT、DPO、GRP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。