岗位描述(节选)
1、负责视觉大模型基座架构优化、视觉编码器CLIP性能优化和视觉编码器训练(图像编码器和视频编码器);
2、负责CLIP模型小型化优化,包含模型蒸馏效果优化、端侧轻量化模型架构设计、模型裁剪和稀疏训练(结构化稀疏和非结构化稀疏)、对比学习训练调优等;
3、参与视觉大模型实际训练和项目落地,主导高效视觉编码器的架构设计和端侧推理性能优化。
4、负责部分图文对数据集生产和构建、模型评测等任务
【任职要求】
1.硕士及以上学历,自动化、计算机等相关专业;
2.必须有视觉VIT基座优化经验或者VLM、VLA相关项目落地交付经验;
3.优秀的代码技术功底,熟练掌握CLIP编码器的From Scratch训练、VLM多模态预训练和强化学习训练等内容。
4.有VIT视觉基座模型的架构设计经验,能针对硬件特性设计高性价比的模型架构。
具备以下条件优先:
1.在NeurlPS/ICLR/ACL/EMNLP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 2283 个北京技术研发岗位,其中 174 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 20K,最低 2K、最高 70K。
在招岗位较多的企业:字节跳动 687 个理想汽车 236 个长鑫科技 143 个阿里巴巴集团(含高德/阿里云) 106 个小米集团 95 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。