岗位描述(节选)
• 负责万卡超算集群、多云、多集群环境的高可用性、稳定性和性能保障。
• 构建和优化监控、告警、日志、追踪、容量规划及自动化运维体系。
• 支撑训练、推理和资产管理平台的端到端可靠性和性能优化。
• 接触前沿技术:Prometheus/Grafana、Loki、K8s Operator、自动化运维、云原生平台。
【任职要求】
精通 Linux 系统、Shell/Python/Go 脚本,熟悉集群管理和运维工具。
• 熟悉 Kubernetes、容器化部署、网络和存储管理。
• 有大型 HPC/AI 超算集群或云原生平台 SRE 运维经验优先。
加分项:
• 熟悉 GPU/AI 作业调度与性能优化。
• 有多云、多集群环境下监控、告警和容量管理经验。
• 有自动化运维、CI/CD、SLO/SLA 制定与落地经验
本站当前在招 2283 个北京技术研发岗位,其中 174 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 20K,最低 2K、最高 70K。
在招岗位较多的企业:字节跳动 687 个理想汽车 236 个长鑫科技 143 个阿里巴巴集团(含高德/阿里云) 106 个小米集团 95 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。