AI推理部署工程师 深圳 全职 销售 - 销售支持 职位描述 1、推理服务部署运维:负责GPU服务器、AI算力集群环境部署调试,管理NVIDIA驱动/CUDA/NCCL/容器工具链版本兼容;基于 vLLM / SGLang / LMCache搭建推理服务,部署 Qwen / DeepSeek / GLM / MiniMax 等主流大模型(单机/多节点),支持私有化内网交付。2、推理性能优化:评测 TTFT、TPOT、吞吐量、显存占用等指标;设计 TP/PP/DP/EP 并行方案;围绕 KV cache、量化(FP16/BF16/FP8/AWQ/GPTQ/GGUF/INT4/INT8)、长上下文、MoE 路由等方向,持续优化推理吞吐与延迟。3、工程化交付:完成从裸机环境到模型API的完整交付链路;将推理系统部署进客户受控内网;协同网络工程师调试 NCCL 跨节点通信。4、文档与监控:输出部署文档、API手册、测试报告、故障复盘;搭建 Prometheus/Grafana 监控体系,实现异常告警与自动恢复。 职位要求 必备条件:1、计算机、AI 等相关专业,本科及以上,2年以上 GPU 服务器 /