岗位描述(节选)
岗位定位
负责大语言模型(LLM)的工程化落地、部署优化、推理加速及服务架构搭建,解决模型生产环境中的高并发、低延迟、高可用问题,推动LLM技术从研发到规模化应用的落地,支撑业务线LLM能力接入与迭代。
岗位职责
负责LLM的本地化部署、微调与推理优化,搭建高效、稳定的LLM推理服务,优化模型响应速度,可用性以及资源利用率。
主导LLM模型工程化优化,包括模型量化(INT4/INT8)、剪枝、蒸馏等压缩技术落地,平衡模型性能与推理精度,适配不同部署场景。
设计并实现LLM服务平台架构,基于vLLM、SGLang、llamacpp等工具搭建多模型统一调用接口,支持动态负载均衡、弹性伸缩,保障服务有限资源下的高可用。
熟悉vLLM、SGLang、llama.cpp等不同推理框架,能够推动KV Cache 优化、连续批处理、异构硬件适配(GPU/CPU)、显存Offloading相关技术的产品化……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。