岗位描述(节选)
1、建设端到端模型评测体系。 面向预训练、多模态、Agent、Coding 及应用与模型行为等方向,设计能力分层、任务协议、数据规范、指标体系与评测流程;建设统一、可扩展的评测框架,支持不同模型、任务和评测方法的接入与横向比较。
2、研究自动评分与验证算法。 研发基于规则、可执行验证器(Verifier)、模型裁判(LLM-as-a-Judge)及学习式评估器的评分方法,结合结果正确性、过程质量和任务约束进行多维度评价;通过人工校准、偏差分析和一致性检验,提高评分可靠性。
3、研究高区分度与泛化能力评测。 与能力评测师及各方向算法团队协作,开展任务生成、样本筛选、难度分层、数据去重及污染检测,建设独立测试集与持续回归集,研究评测覆盖度、区分度和跨场景泛化能力。
4、研发能力诊断与统计分析方法。 基于分层评测、置信区间、显著性检验、消融实验及轨迹分析,识别模型收益与回退,区分模型能力、采样策……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。