岗位描述(节选)
1. 负责音视频 Caption 中音频内容的评测体系建设,覆盖语音、环境声、声音事件、音乐、复杂声景及声画关系。
2. 主导评测数据集建设,包括任务定义、场景设计、样本采集、标注规范、质量控制和难例补充。
3. 建立 Caption 评测标准,重点评估内容正确性、信息完整性、描述粒度、时间与声源定位、声画一致性,以及幻觉、遗漏和错误归因等问题。
4. 设计人工评测与自动评测相结合的方案,建设自动化评测链路,并持续验证自动评分与人工判断的一致性。
5. 开展模型对比、版本回归和典型案例分析,识别模型能力边界,输出清晰、专业、可执行的评测报告。
6. 与模型研发、数据和产品团队协作,将评测结论转化为数据补强、模型训练及产品体验优化建议。
【任职要求】
1. 本科及以上学历,声学、语言学、计算机、多媒体等相关专业优先。
2. 具备音频、多模态或大模型评测相关经验,有评测体系、评测数据集或规模……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 2283 个北京技术研发岗位,其中 174 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 20K,最低 2K、最高 70K。
在招岗位较多的企业:字节跳动 687 个理想汽车 236 个长鑫科技 143 个阿里巴巴集团(含高德/阿里云) 106 个小米集团 95 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。