岗位描述(节选)
1、万卡级 GPU 调度系统建设: 参与大规模 GPU 集群调度系统建设,围绕 Quota、优先级、抢占、弹性伸缩、碎片整理、拓扑感知调度等能力提升资源效率。
2、训推统一调度: 面向大模型训练、后训练、推理服务等不同负载,设计训推统一调度、潮汐混部、在线离线协同和资源弹性策略。
3、资源利用率治理: 建设 GPU 资源利用率分析体系,基于真实负载数据识别低效资源、资源碎片、潮汐空闲和调度瓶颈。
4、LLMOps 平台融合: 参与构建面向大模型训练、微调、推理、部署全流程的 LLMOps 能力,与云原生平台深度融合,支撑大模型生产链路稳定高效落地。
5、集群稳定性建设: 与云原生、IDC、网络、存储和业务团队协作,提升大规模 AI 集群的故障恢复能力、资源周转效率和任务稳定性。
6、前沿技术探索: 持续关注 Kubernetes、Volcano、Kueue、Ray、GPU 虚拟化、弹性调度……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。