岗位描述(节选)
1、针对多种数据源(包括GitHub代码库、网页爬取的code以及通用文本数据)设计并实现代码及通用数据清洗pipeline。
2、开发并迭代基于LLM的数据过滤策略,以提高预训练语料库的数据质量。
3、开发、维护并优化数据pipeline,确保其在大规模场景下的性能和可靠性。
【任职要求】
1、精通大规模数据处理框架,如Apache Spark或Ray。
2、扎实的Python编程能力,熟悉分布式计算。
3、数据sense强,能够分析并处理不同代码和文本语料中的边界情况。
【加分项】
1、具有预训练数据处理pipeline的经验,特别是code数据方面。
2、具备vLLM或SGLang等LLM推理框架的实际使用经验。
本站当前在招 2674 个上海技术研发岗位,其中 300 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 25K(25~75 分位),中位约 20K,最低 4K、最高 100K。
在招岗位较多的企业:字节跳动 362 个拼多多 181 个米哈游 161 个哈啰出行 141 个阿里巴巴集团(含高德/阿里云) 110 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。