岗位描述(节选)
1. 深入理解语言、多模态大模型的原理及应用场景,设计算法评测方案,参与编写并执行算法评测工作,对算法的准确性、安全性等方面进行评估,记录并分析测试过程中出现的异常情况,撰写评测报告。
2. 协助开展性能测试、稳定性测试等工作,使用专业工具或自建工具模拟高并发场景,测试大模型在不同负载下的响应速度、吞吐量等性能指标,分析测试结果,产出测试报告。
3. 负责测试资产的整理与维护,包括迭代测试方案、构造测试数据集、归档测试报告等。
4. 对标国内外主流评测基准,基于行业通用 Benchmark 评测体系,搭建大模型 / 智能体算法基准测试框架,设计标准化评测数据集与指标体系,开展模型版本回归、准出验收与效果对比,输出 Benchmark 横向评测报告,支撑算法迭代与上线决策。
5. 学习并掌握大模型相关技术和测试方法,跟踪行业前沿动态,结合业务场景优化测试流程与方法,提升评测效率、精准度与整体……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 2283 个北京技术研发岗位,其中 174 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 20K,最低 2K、最高 70K。
在招岗位较多的企业:字节跳动 687 个理想汽车 236 个长鑫科技 143 个阿里巴巴集团(含高德/阿里云) 106 个小米集团 95 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。