岗位描述(节选)
1.评测集自动构建技术:研究跨模态通用的评测集自动生成方法,构建不同模态(文本/图像/视频/音频/3D 等)评测集生产框架;研究动态评测集与抗污染技术,解决各模态静态评测集被"刷榜"后失效的通用问题;探索面向模型弱点的定向探测数据生成,通过错误模式分析自动生成针对性测试样本。
2.自动裁判技术:构建多模态通用的自动评判算法框架,统一支撑文本质量评判、生成内容质量评估、交互过程评估等不同评判范式,设计可插拔的评判策略组件;研究LLM as a judge及Agent as a judge,支撑 Agent 轨迹的中间步骤质量评估、推理链路正确性验证、世界模型的时序物理一致性检验等既需要结果评分也需要过程评分的评判场景。
3.Agent评测技术:设计Coding Agentic应用的端到端评估算法,包括多轮对话质量建模、用户意图满足度预测、任务完成率估计等;研究评测信号与用户真实体验的对齐技术……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 17204 个北京岗位(全城各职能合计),其中 2004 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 6.6K ~ 20K(25~75 分位),中位约 11K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3986 个小米集团 1154 个快手 1016 个阿里巴巴集团(含高德/阿里云) 671 个滴滴 617 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。