推理 Infra开发工程师 北京 社招 全职 职位 ID:A130192 职位描述 团队定位:为公司模型迭代提供基建与保障,降本增效——降低算力成本,提高模型开发效率。岗位定位:负责业务场景下的大模型推理部署、运维与性能优化,在保障服务稳定性的前提下持续压低推理成本,让每一分算力跑出最大价值。岗位职责:1、负责各业务场景的大模型部署、运维与推理优化,持续配合业务对模型推理的使用需求,不断提高模型服务稳定性、降低整体推理成本;2、推理效率优化:调研前沿技术并持续跟进开源社区进展,负责推理加速方法的工程实现与落地,包括但不限于模型量化(FP8 / W8A8 / W4A16 / INT8)、投机解码、PD 分离、动态 batch、KV cache 优化等;3、在各个业务场景下制定并推行标准化的压测手段与性能基线,做到上线即有数、优化可衡量;4、负责推理服务的稳定性体系建设:监控告警、容量治理、大小卡替换与低利用率治理。 职位要求 1、熟悉主流推理引擎(SGLang / vLLM / TensorRT-LLM 等)的架构与源码,有实际的部署与调优经验;2、理解 LLM 推理的性能瓶颈模型(计算 / 显存带宽 / KV cache / 调度开销),能针对不同卡型(A100 /