岗位描述(节选)
负责司内AI平台和AI算力的日常运维、故障处理、资源管理和稳定性保障工作。
负责AI相关配套资源的运维和管理支持工作,与供应商对接问题,保证资源服务可用性。
建设算力/存储/网络/CPU 的 SLO 追踪与告警监控,推动利用率提升与低效治理。
参与SRE运维平台建设,集成多集群的服务监控、资源管理、可观测等能力和定制化需求开发。
保障 Dots 大模型推理服务高可用,覆盖部署、升级、发布准出、容灾演练全流程。
【任职要求】
本科及以上,计算机相关专业,5 年左右 SRE / 运维 / 基础设施研发经验;
精通 Linux / Kubernetes/网络等基本知识,熟悉主流云厂商云服务与控制台操作
熟悉至少一种以上开发语言(Python/Shell/Go),具备独立开发运维平台或自动化工具的能力;
熟悉 GPU 基础知识(型号、算力、显存、GPU 网络),有故障发现和排障能力;
对大模型推……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。