岗位描述(节选)
1、研发前沿的音频大模型 (Audio-LLM),实现语音识别 (ASR)、语音合成 (TTS) 与音频理解的端到端融合。
2、优化多语种、情感化及高表现力的语音生成,提升在复杂环境(噪声、多人交谈)下的语义提取鲁棒性。
3、设计并优化多模态音乐生成模型,涵盖风格、韵律、和声、节奏等多维度生成任务。
4、探索音频 Tokenizer 优化,实现音频与 LLM 符号空间的对齐。
【任职要求】
1、熟悉主流音频架构(如 Whisper, VITS, AudioLM, Vall-E,CosyVoice);
2、精通音频信号处理及神经编解码器(Neural Codec);
3、有全双工、超低延迟流式语音交互系统(Real-time Interactive Voice)的落地经验者优先。
本站当前在招 18762 个北京岗位(全城各职能合计),其中 2681 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 10K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3945 个小米集团 1146 个快手 1017 个阿里巴巴集团(含高德/阿里云) 780 个理想汽车 485 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。