岗位描述(节选)
强化学习(RL)是 Qwen 系列基础模型持续演进的重要技术方向,被广泛应用于提升模型在复杂任务中的推理、规划、编码、工具调用与长程决策能力。我们持续探索 RL 在长程代码任务、视觉交互、真实环境执行、数学与代码竞赛等场景中的应用,推动模型在复杂开放任务中的自主性与执行表现。欢迎对大模型与强化学习方向有经验和热情的同学加入。
工作内容包括:
1. 研究 PPO、GRPO 等强化学习算法,提升训推分离场景下大规模 RL 训练的稳定性与效率;探索 RL scaling law、长程训练、多任务融合与系统优化等方向,提升模型持续训练收益与泛化能力。
2. 优化端到端 Agentic RL 链路,提升算法与系统整体效率,增强 agent 在推理、长程规划、代码生成与工具调用等场景中的能力;结合 critic model 与过程奖励机制,对 agent 行为进行有效引导,提升 scaffold 泛化……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。