岗位描述(节选)
1、负责大模型高性能推理核心技术研究与优化,面向 Dense、MoE 等不同模型架构,围绕吞吐、时延、显存/内存利用率及资源效率开展系统性优化,持续提升大模型在线推理服务性能。
2、负责大模型推理框架优化,深入研究 vLLM、SGLang等主流推理框架,开展调度策略、并行策略、显存管理、模型加载、通信及计算优化,推动推理框架在 GPU、NPU 等异构算力平台上的高效适配与落地。
3、负责 KV Cache 体系及长上下文推理优化,研究 Prefix Cache、多级 KV Cache、HBM/DRAM 分层缓存、Cache-aware/Affinity Scheduling 等关键技术,提升长上下文及高前缀复用场景下的缓存命中率与推理效率。
4、负责大模型分布式推理架构研究,探索 Prefill-Decode 分离、TP/DP/EP 并行、MoE Expert Parallel、动态专家负……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。