岗位描述(节选)
核心职责:自动化评测集建设能力
1. 建设面向产品Agentic场景(Search Agent、Office Agent、对话Agent、生活服务Agent等)的端到端评测集,量化模型在真实产品链路中的表现,并拆解到模型原子能力,确保评测粒度可拆解至独立能力维度;
2. 基于评测数据产出结构化的模型能力诊断报告,明确优势与短板,形成可执行的优化建议,辅助算法团队确定模型迭代方向;
3. 持续追踪业界前沿Benchmark与评测方法论,保持评测集的先进性和行业对标能力;
【任职要求】
1. 有1年以上大语言模型评测、AI产品质量评估或相关领域工作经验优先
2. 深入理解大语言模型的能力边界与常见评测范式,具备独立设计完整评测方案的能力
3. 熟悉Agent/Agentic应用场景的评测方法,了解工具调用、多轮对话、任务规划等能力的评估要点
4. 优秀的逻辑思维和结构化表达能力,能将评测发现……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。