进入工作台 →

LLM Post-train 算法研究员 - Varsapura

米哈游📍 上海招聘
🎯 社招 来源:米哈游招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1)后训练算法研发:参与游戏内容、角色扮演等场景下大模型的后训练(Post-training)算法研发工作,涵盖 SFT、RLHF、DPO 等对齐方法的实现与优化,提升模型在剧情生成、角色一致性、对话连贯性、情感表达等维度的能力 2)奖励模型与对齐信号:设计和训练 Reward Model,探索多维度奖励信号的构建(如指令遵循、对话连贯性、创意性、安全性等),减少 Reward Hacking 和偏差问题,为强化学习提供高质量训练信号 3)强化学习训练与优化:基于 PPO/GRPO 等强化学习算法完成模型对齐训练,探索可规模化(Scalable)的 Verifier 信号与 RL 策略,提升训练稳定性与效率,推动模型在复杂多轮对话和开放域场景中的推理与生成能力 4)高质量数据工程:负责后训练阶段的数据治理,包括 SFT 数据构建、偏好数据采集与清洗、合成数据生成、数据混合策略设计,结合业务…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。

上海技术研发岗位行情

本站当前在招 2674 个上海技术研发岗位,其中 300 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 25K(25~75 分位),中位约 20K,最低 4K、最高 100K。
在招岗位较多的企业:字节跳动 362 个拼多多 181 个米哈游 161 个哈啰出行 141 个阿里巴巴集团(含高德/阿里云) 110 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。

上海 其他在招岗位

按城市浏览招聘

© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像