岗位描述(节选)
评测体系建设:面向用户交互场景,设计覆盖基座模型、端到端Agent、用户体验等场景的评测框架和标准,保障评测可解释可复现,并主导Benchmark数据集构建与持续迭代,防控数据污染与评测失效;
搭建自动化评测工程:通过judge model等自动评测流水线,设计多评委协作机制,控制评测偏见,持续提升自动评测与人工标注的一致性,推动评测提效
数据生产与质量管控:主导评测/训练数据合成方案设计,建立标注规范与质检体系,同时与数据团队协作,保障大规模数据生产的稳定性与准确性
模型迭代支撑:输出结构化评测报告,将评测结论转化为可落地的优化建议,与模型训练团队深度协作,建立"评测→优化→再评测"闭环
沉淀团队评测方法论,输出可复用框架与工具
【任职要求】
计算机、人工智能、统计学、数学或相关专业,本科及以上学历,3年大模型评测工作经验以上优先
熟悉业界主流评测工具集和评测集,有独立设计评测框架和评……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 1658 个北京运营岗位,其中 43 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 16K,最低 5K、最高 35K。
在招岗位较多的企业:字节跳动 909 个京东 211 个快手 168 个美团 123 个长鑫科技 39 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。