AI模型部署与性能优化工程师 深圳 社招 全职 数字技术 - 芯片研发 本科及以上 3-5 年 职位描述 1. 负责将客户常见辅助驾驶算法模型(CNN,Transformer,LLM,多模态等)部署到公司大算力芯片平台,解决过程中可能涉及的算子不支持、模型规格不匹配的兼容性问题。2. 运用性能分析工具对模型进行全栈性能剖析,识别计算、内存、调度瓶颈,通过图融合、算子替换、内存优化以及其他软硬件优化技术,提升推理速度和吞吐量。3. 配合客户实施PTQ/QAT量化方案,定位并解决量化或其他过程引入的精度损失问题。4. 系统性地诊断并解决单模型部署和多模型并发场景下的稳定性问题。深入定位Core Dump / Crash的根本原因(内存越界、资源竞争等)并推动解决。5. 深入理解客户需求,提供部署、性能调优方案和建议。建设并维护车载/机器人场景 Model Zoo,输出最佳实践案例文档,降低客户使用门槛。 职位要求 1. 硕士以上学历,具备2年以上AI模型在端/边/云平台部署优化经验。有车载或机器人芯片平台项目经验者优先。2. 精通Python和C++编程,熟悉PyTorch、TensorFlow、ONNX等深度学习框架中的一种或多种。3. 熟悉TensorRT、TVM、ONNX Runtime、vLLM、llama.cpp等主流推理引擎中的一种或多种。4. 熟悉常见网络模型结构和算子,具备模型部署、算子开发和调优经验。掌握系统级别和算子级别 Debug & Profiling 实战技能,熟悉Nsight Systems、perf、Vtune等性能分析工具。5. 熟悉GPGPU或NPU等AI加速芯片硬件特性、了解AI软件栈,有软硬协同经验者优先。6. 积极主动,勇于承担, 具备良好的团队合作精神、沟通协调能力和技术推动力。 投递...
具身智能模型推理架构师 深圳 全职 智能机器人板块 职位描述 1、主导具身智能模型推理系统的架构设计、核心开发与落地,制定模型运行、适配、优化和部署的整体技术方案;2、建设统一的模型推理 Runtime 与服务框架,完善模型加载、执行、并发、生命周期管理及标准化接口,支撑不同模型快速接入;3、建立模型压缩、量化与精度对齐能力,在性能、精度、内存与功耗之间进行系统优化,保障模型在小鹏自研芯片平台上的精度一致性与稳定运行;4、设计端侧异构算力与多模型调度机制,优化 CPU、GPU、NPU 等计算资源的分配和协同,提升复杂任务下的资源利用率与推理效率;5、从模型设计阶段介入部署可行性与性能评估,建设覆盖模型转换、量化、性能基准、端侧验证和发布的标准化工具链,协同算法、芯片及业务团队推动模型稳定量产。 职位要求 1、计算机、人工智能、自动化等相关专业本科及以上学历;2、具备端侧模型部署、推理框架、大模型推理服务、AI 芯片工具链或模型压缩优化中的一类或多类工程经验;3、精通 C++,熟练使用 Python,具备扎实的 Linux 系统编程、并发编程和性能分析能力;4、深入理解模型推理全流程,包括模型转换、运行时执行、内存管理、并发调度、性能评测及问题诊断;5、在以下至少一个方向具备深入经验:推理 Runtime、内存管理或并发执行优化;PTQ、QAT、混合精度等模型量化与精度对齐;嵌入式 NPU 模型适配、部署与性能优化;异构资源调度、内存优化或多模型协同运行;6、理解 Transformer、VLM、VLA 等模型的计算与访存特性,能够结合硬件特点分析性能瓶颈;7、有复杂模型从算法原型到产品部署的完整实践,能够协同算法、芯片和业务团队推动量产落地。加分项:有机器人、自动驾驶或智能硬件端侧推理平台建设经验;有 VLM、VLA、多模态模型或端侧语言模型部署与优化经验;熟悉 vLLM、SGLang、TensorRT-LLM、llama.cpp、MLC LLM 等大模型推理框架,或有主流芯片大模型推理 SDK 使用与优化经验;熟悉 KV Cache 管理、连续批处理、推测解码等大模型推理优化技术;有自研或嵌入式芯片平台适配、功耗优化、模型部署工具链或自动化精度回归体系建设经验。我们期望你具备的特质:系统权衡能力:能够在性能、精度、内存、功耗与交付效率之间做出合理取舍;工程落地能力:能够深入模型、运行时和硬件平台定位问题,将优化方案稳定落到产品中;协同推动能力:能够连接算法、芯片与业务团队,推动模型从原型验证走向规模化部署。 投递...