岗位描述(节选)
视频生成基座,参与自动驾驶多模态视频生成基座模型的研发,覆盖数据 pipeline、tokenizer / VAE、DiT 架构设计、大规模预训练与后训练,并推动 scaling 上的真实收益。
可交互世界模型,研究 action-conditioned / 可控生成,攻克长时序一致性、可干预性与因果可控性;探索几何与语义约束(3D Occupancy、3DGS、Scene Graph)与生成模型的融合方式。
推理加速与规模化可用性,推动生成模型的推理效率优化,包括一致性 / 蒸馏、few-step 采样、量化与算子层优化,把世界模型的采样成本压到数据合成与仿真规模化可用的量级。
【任职要求】
计算机视觉、机器学习、计算机科学等相关专业硕士及以上学历,博士优先;毕业 3 年以内(在校期间的长期实习经历可计入相关经验)。
以下两类经验至少具备其一,且是深度参与而非调用或下游微调:
视频 /……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。