岗位描述(节选)
我们是专注于大模型服务平台的技术团队,我们的核心业务是提供高效稳定的大模型推理服务API,帮助各行各业轻松利用大模型的强大能力,正在寻找一位有实力的Site Reliability Engineer (SRE) 加入我们,共同打造更可到的大模型服务平台。
负责AI基础设施算力资源的规划、运营管理与精细化数据体系建设。通过系统化、数据化方法提升GPU资源利用率、周转率与成本效益,保障AI训练/推理任务的高效稳定运行,支撑业务快速发展。
【工作职责】
1.大模型服务和平台的稳定性保障与体系建设:负责大模型相关核心业务系统和模型服务的稳定性建设工作,提升业务可用性与可靠性;
2.高并发流量治理:高并发场景下的流量治理方案设计与实施,包括熔断、限流、降级等容灾策略,确保业务弹性与鲁棒性;
3.GPU算力资源规划与运营管理:包含不限于优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。