岗位描述(节选)
1. 产品迭代评估方案与用户满意度量化
2. 跟随千问APP产品能力迭代节奏,针对新功能、新场景制定对应的评估方案和评分标准,明确评估维度和指标,并选择最合适的评估方法(自动评测、人工评估、众测、A/B实验等),兼顾效率与准确性;
3. 建立人工评估结果与线上众测数据、实验指标(留存率、使用率、满意度评分等)的对齐机制,确保离线评估结论能有效预测线上用户体验,将主观体验转化为可追踪、可对比的量化指标,支撑产品决策;
【任职要求】
1. 有1年以上大语言模型评测、AI产品质量评估或相关领域工作经验优先
2. 深入理解大语言模型的能力边界与常见评测范式,具备独立设计完整评测方案的能力
3. 熟悉Agent/Agentic应用场景的评测方法,了解工具调用、多轮对话、任务规划等能力的评估要点
4. 优秀的逻辑思维和结构化表达能力,能将评测发现转化为清晰的诊断报告和可执行建议
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。