岗位描述(节选)
1、场景化评测执行: 负责大模型/Agent在真实生产力应用场景下的实际效果评测。具备真实用户行为分析能力和评测转化能力,熟悉 Rubrics 评测方法与质量判断,具备评测结果分析能力,熟悉大模型/Agent问题归纳逻辑,包括但不限于逻辑推理、工具调用、内容生成等。
2、竞品分析与对比: 关注市面上优秀的C端/B端AI产品,定期进行竞品对比评测。从用户体验和产品功能角度出发,输出对比报告,帮助团队发现自身产品的差距与优化方向。
数据生产与标准落地: 根据评测需求,执行高质量评测体系的搭建工作。将场景需求转化为清晰、可操作的Rubrics评分标准与标注规则,跟进评测数据构建流程,确保交付数据的准确性和一致性。
3、外部团队组织与质量把控:组织并管理外部评测/标注团队及各领域专家人力,统筹作业排期与分工,对产出的数据集和评测结果进行质量把控,针对执行过程中发现的流程卡点,积极推动优化,保障项目……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。