岗位描述(节选)
我们希望你参与
* 建设可持续演进的大模型评测体系;
* 提升评测自动化程度与评测效率;
* 推动评测数据、评测框架与评测方法持续迭代;
* 用系统化评测驱动模型能力提升。
1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系;
2. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化;
3. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度;
4. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制;
5. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平;
6. 参与模型训练与迭代过程中的评测建设,支撑模……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 2674 个上海技术研发岗位,其中 300 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 25K(25~75 分位),中位约 20K,最低 4K、最高 100K。
在招岗位较多的企业:字节跳动 362 个拼多多 181 个米哈游 161 个哈啰出行 141 个阿里巴巴集团(含高德/阿里云) 110 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。