岗位描述(节选)
1. 深入优化大模型端到端训练链路,系统分析计算、通信、内存、数据供给与集群运行效率,解决大规模训练中的性能瓶颈,提升算力利用率与训练迭代速度。
2. 参与不同计算硬件的训练框架适配与性能优化,推动模型、框架、通信和硬件之间的协同设计。
3. 跟踪分布式训练与高性能计算领域的前沿技术,推动性能优化方案从原型验证走向生产落地,形成可复用的技术方案、内部工具与工程实践沉淀。
【任职要求】
1. 硕士及以上学历,计算机、人工智能、数学等相关专业,3年以上工作经验
2. 具有生产级大模型训练系统研发经验,有deepspeed,Megatron等使用经验,实际解决过训练吞吐、规模扩展、Loss异常、任务长尾、节点故障、OOM或断点恢复等问题。
3. 具备良好的技术判断和跨团队推动能力,能够与算法、模型、集群、硬件等团队协作,推动复杂系统问题形成闭环。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。