岗位描述(节选)
1. 围绕多模态视频理解开展前沿研究,融合视觉、语音与文本信息,提升模型对视频内容、时序关系及事件的理解与推理能力。
2. 面向视频检索、内容摘要、事件定位及长视频问答等场景,研究跨模态对齐、长时序建模与关键信息提取,提升实际任务效果。
3. 研究文本生成视频、图像生成视频及视频编辑技术,提升生成内容的画面质量、时序一致性、运动自然度与指令遵循能力。
4. 结合业务场景开展多模态模型后训练与微调,探索模型压缩、推理加速及本地部署,兼顾效果与资源开销。
5. 建立视频理解与生成评测体系,跟踪前沿技术,推动研究成果在实际产品中落地。
【任职要求】
1. 计算机视觉、人工智能、计算机等相关方向的应届博士毕业生,具备扎实的机器学习、深度学习及计算机视觉理论基础。
2. 在多模态学习、视频理解、视频生成等一个或多个方向有深入研究,具备独立开展科研、设计实验和分析问题的能力。
3. 熟悉视觉语言模型……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 1102 个深圳技术研发岗位,其中 92 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 28K(25~75 分位),中位约 20K,最低 6K、最高 100K。
本岗位标注月薪 20K ~ 28K,高于该范围约 67% 的在招岗位。
在招岗位较多的企业:字节跳动 206 个中国平安 47 个迈瑞医疗 45 个富士康 41 个阿里巴巴集团(含高德/阿里云) 39 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。