岗位描述(节选)
1、发现有价值的能力问题。 从用户需求、专业工作和生活场景中识别现有模型的能力缺口,将模糊的“体验不好”拆解为可研究、可验证的具体问题。
2、设计原创复杂任务。 围绕真实约束、信息不完整、多轮沟通、多模态理解和长流程协作等情境,构建有明确目标、合理难度及能力区分度的任务,避免单纯依赖冷知识或文字陷阱。
3、建设独立黑盒评测集。 参与任务采集、研究、编写、试测和迭代,核验资料与答案依据,维护样本质量、独立性及保密边界。
4、制定可执行的评分标准。 编写任务说明、参考答案或解题要点、分维度评分细则及边界案例;对没有唯一答案的问题,明确可接受范围与关键判断依据。
5、开展专家评审与一致性校准。 深入比较模型表现,识别看似流畅但缺乏事实、推理或实际价值的回答;组织案例讨论,分析分歧,提高评价的可解释性与可复现性。
6、开展 Agent 轨迹分析与失败归因。 阅读多轮对话、任务计划、工具调用参数与返……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。