优才-模型推理AI Infra开发工程师-中央研发部 上海、北京 正式 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架 投递...
AI模型部署与性能优化工程师 深圳 社招 全职 数字技术 - 芯片研发 本科及以上 3-5 年 职位描述 1. 负责将客户常见辅助驾驶算法模型(CNN,Transformer,LLM,多模态等)部署到公司大算力芯片平台,解决过程中可能涉及的算子不支持、模型规格不匹配的兼容性问题。2. 运用性能分析工具对模型进行全栈性能剖析,识别计算、内存、调度瓶颈,通过图融合、算子替换、内存优化以及其他软硬件优化技术,提升推理速度和吞吐量。3. 配合客户实施PTQ/QAT量化方案,定位并解决量化或其他过程引入的精度损失问题。4. 系统性地诊断并解决单模型部署和多模型并发场景下的稳定性问题。深入定位Core Dump / Crash的根本原因(内存越界、资源竞争等)并推动解决。5. 深入理解客户需求,提供部署、性能调优方案和建议。建设并维护车载/机器人场景 Model Zoo,输出最佳实践案例文档,降低客户使用门槛。 职位要求 1. 硕士以上学历,具备2年以上AI模型在端/边/云平台部署优化经验。有车载或机器人芯片平台项目经验者优先。2. 精通Python和C++编程,熟悉PyTorch、TensorFlow、ONNX等深度学习框架中的一种或多种。3. 熟悉TensorRT、TVM、ONNX Runtime、vLLM、llama.cpp等主流推理引擎中的一种或多种。4. 熟悉常见网络模型结构和算子,具备模型部署、算子开发和调优经验。掌握系统级别和算子级别 Debug & Profiling 实战技能,熟悉Nsight Systems、perf、Vtune等性能分析工具。5. 熟悉GPGPU或NPU等AI加速芯片硬件特性、了解AI软件栈,有软硬协同经验者优先。6. 积极主动,勇于承担, 具备良好的团队合作精神、沟通协调能力和技术推动力。 投递...
模型推理AI Infra开发工程师 上海 校招 正式 技术族 - 算法类 职位 ID:A125373 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术; 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架; 投递...
Super Sparks-校招-高性能AI推理平台研究员/工程师 上海、圣何塞 校招 正式 数字技术 - 算法 硕士及以上 Super Sparks 招聘计划 职位 ID:A47632 职位描述 AI 推理引擎与模型优化-在车规级 SoC(含 NPU、DSP、GPU 等异构计算单元)上进行大模型(LLM/VLM/VLA)的推理部署与极致性能调优,包括低功耗优化、模型量化(INT4/INT8)、剪枝、蒸馏、算子融合等;-针对 RTOS/Linux/QNX 等操作系统及中间件层深度优化 AI 推理引擎(如 TensorRT、ONNX Runtime、llama.cpp 等),提升端侧推理的实时性与稳定性;-参与具身智能场景下的端到端模型推理链路设计,将 VLA 大模型的推理能力高效部署到车端嵌入式平台,支撑物理世界精准闭环操作。AI 原生的车控与 SOA 场景-将 AI 推理能力原生融入车控系统、车身控制等业务场景,设计 AI 驱动的智能控制策略;-参与 SOA 架构下的 AI 原生智能服务开发,将算法模型封装为标准化的服务组件,支持多场景动态调度;-探索 AI Agent 在车控场景中的应用,实现基于大模型的智能决策与实时控制闭环。车云协同与数据智能-设计并优化车云协同 AI 推理架构,包括端侧推理与云端大模型协同调度、通信协议优化、数据传输效率与安全性保障;-参与车端数据上云后的 AI 智能分析与挖掘(如故障预测、驾驶行为分析、能耗优化等),构建数据驱动的
端云协同 AI Infra 专家 / 工程师 北京 社招 全职 技术 - 基础架构 职位 ID:A25180 职位描述 1. 负责端云协同 AI 架构设计,明确云侧模型、私有化服务、边缘节点、端侧设备之间的职责边界、数据流、控制流和安全边界。2. 围绕面壁miniCPM等系列产品,面向运营商营业厅、客服坐席、现场运维、企业办公终端、边缘网关等场景,建设端云协同的数字员工能力。3. 与 Infra 团队协作,打通云侧模型服务、RAG、Workflow、权限审计、日志监控和端侧运行环境。4. 负责端侧资源约束下的性能优化,包括量化、KV Cache、批处理、缓存策略、网络降级、异构算力调度和功耗控制。5. 沉淀端云协同部署规范、设备适配清单、性能 benchmark、故障排查手册和行业交付模板。 职位要求 1. 本科及以上学历,计算机、电子信息、自动化、通信、人工智能等相关专业。2. 3 年以上端侧 AI、边缘计算、推理优化、嵌入式系统、客户端基础架构或云边端协同系统经验。3. 熟悉 C/C++、Python,了解端侧或边缘设备上的性能调优、资源管理和系统问题排查。4. 熟悉至少一种推理框架或部署工具,如 llama.cpp、ONNX Runtime、TensorRT、SGLang 等。5. 理解模型量化、剪枝、蒸馏、KV
Company: Qualcomm China Job Area:Sales, Business Development & Marketing Group, Sales, Business Development & Marketing Group Product Marketing - SIP General Summary: Qualcomm is a leading supplier of chipset platforms for automotive infotainment. In this role,
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Machine Learning Engineering General Summary: About us: We are Qualcomm AI Research that are advancing AI to make its core capabilities – perception, reasoning, and action – ubiquitous across devices.
vla模型部署优化实习生 上海 实习 职位描述 - 参与PC和端侧AI应用的原型开发与测试,包括数据采集,标注,预处理、模型选型适配、模型训练加速、推理性能调优;- 协助团队完成基于PC和Jetson系列开发板(如Jetson Nano、Orin、Thor等)的模型训练、部署、优化工作;- 配合完成相关技术文档的撰写,如部署手册、测试报告、技术总结等;- 协助解决项目中遇到的PC端和端侧部署相关技术问题,跟进技术方案的落地验证;- 完成领导交办的其他模型部署与开发相关的辅助工作。 职位要求 - 在读本科及以上学历,计算机相关专业(计算机科学与技术、电子信息工程、自动化、人工智能等);- 具备扎实的Python/C++编程基础,了解Linux操作系统(Ubuntu优先)的基本使用;- 对模型量化,剪枝,蒸馏有一定了解的优先。- 了解深度学习基础理论,熟悉至少一种深度学习框架(PyTorch、TensorFlow等);- 对Jetson端侧部署有一定了解,熟悉TensorRT、ONNX等模型优化与转换工具者优先;-了解vla模型,熟悉cuda编程,熟悉vllm, trtllm, llama.cpp的优先- 具备良好的学习能力、问题解决能力和团队协作精神,工作积极主动,责任心强; 投递...
具身大模型推理性能优化实习生 上海 实习 职位描述 1. 参与到面向具身机器人本体亲和的轻量化、高性能推理框架模块化开发;2. 基于GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 3. 开发模型解析、转换、性能剖析、可视化profiling工具;4. 洞察算子融合、低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术并复现开发;5. 调研VLA、世界模型、空间智能等最新算法架构趋势; 职位要求 1. 熟练掌握C/C++,具备汇编(ARM/x86)或CUDA/OpenCL优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp);3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ 等)及相关工具链;4. 熟悉常见算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax 等);5. 具备端上 profiling 能力(perf、简单性能计数器、硬件事件、功耗测量); 投递...
【27届校招】大模型端侧Infra工程师 北京、上海、广州 正式 研发 - 算法 通用智能板块 职位描述 1.负责支持小鹏VLA2.0、智能座舱、具身等新一代大模型的部署架构设计和开发,不同芯片上架构统一。2.负责新一代大模型的端侧量产部署,解决各种端侧实际部署问题。3.负责在大模型自驾芯片上的性能优化,充分挖掘芯片性能,确保大模型的端侧软件性能表现满足量产需求。4.探索未来大模型和推理芯片上的新一代的软件架构和部署方案。 职位要求 1.2027届应届毕业生,计算机科学与技术、电子工程、自动化及相关领域专业。2.熟练掌握C/C++编程、熟悉Linux操作系统、熟悉各种AI生产力工具。3.熟悉并行计算概念、熟悉一门并行编程框架(如CUDA)、有TensorRT或其他深度学习高性能推理框架的使用经验。4.熟悉各种大模型基本框架优先,有基于CPP的嵌入式芯片模型部署经验优先。5.责任心强,具备优秀的学习能力、独立分析能力和良好的团队沟通能力,有良好的工作文档习惯。 投递...
知识算法工程师(本体论设计、知识图谱构建方向) 北京 全职 研发 - 算法 职位描述 1. 负责大规模OCR识别结果的数据清洗、纠错与结构化处理,提升文本抽取的准确率与可用性; 2. 设计并构建面向垂直领域的知识图谱,包括实体识别、关系抽取、属性融合、图谱对齐等核心环节; 3. 基于业务场景对开源或自研大语言模型(LLM)进行领域适配与高效微调(如LoRA、QLoRA、Prompt Tuning等),提升模型在特定任务(如问答、推理、信息补全)上的表现; 4. 运用本体论(Ontology)方法设计领域知识体系,定义概念层级、语义关系与逻辑约束,支撑高质量知识建模与推理; 5. 探索多模态(图像+文本)信息融合策略,将OCR输出与视觉上下文结合,增强知识抽取与语义理解能力; 6. 与产品、数据及工程团队紧密协作,推动知识驱动型AI系统在内容理解、智能检索、风险识别等场景中的落地。 职位要求 1. 计算机、人工智能、软件工程、数学或相关专业本科及以上学历,3年以上算法或AI工程经验; 2. 熟练掌握Python及主流深度学习框架(PyTorch/TensorFlow),具备扎实的算法实现与调试能力; 3. 在以下至少两个方向有深入实践: - OCR后处理与文本数据清洗(如模糊匹配、规则引擎、语言模型纠错); - 知识图谱构建(使用Neo4j、Apache Jena、DGL-KE等工具链); - 大模型微调与部署(熟悉HuggingFace Transformers、vLLM、Llama.cpp等生态); - 本体建模与语义网技术(熟悉OWL、RDF、SPARQL、Protégé等);4. 熟悉NLP基础技术,如命名实体识别(NER)、关系抽取(RE)、文本分类、向量表示等; 5.
软件开发工程师 北京 社招 全职 职位 ID:A74944 职位描述 岗位职责:1.依据产品需求与技术方案,完成软件工具的具体开发、编程、调试与集成测试2.制定测试计划,执行功能、性能及稳定性测试,确保工具达到质量要求,并支持产品上线部署3.负责工具的现场部署、维护、故障排查及一线使用培训,收集反馈并及时响应优化4.持续跟进工具使用情况,进行性能提升、体验优化与成本改进的专项开发 职位要求 1、本科及以上学历,计算机、软件或通信相关专业;2、精通C++,熟悉.NET框架或现代C++标准,熟练掌握QT、MFC等UI框架;3、熟悉Windows底层机制,对内存管理、多线程并发、网络通信(HTTP/WebSocket)有深刻理解,;4、熟悉开源大模型(如Llama、ChatGLM等)的部署、微调和训练流程,掌握端侧模型推理框架(如llama.cpp、ONNX Runtime等)的应用。5、对AI等前沿技术有浓厚兴趣,具备优秀的快速学习能力和创新性思维。6.拥有良好的沟通能力,有较强的项目推动力; 7.有电子/通讯行业的工业软件开发经验优先(MES、PLM、APS、SCADA、QMS等) 投递...
Super Sparks-校招-智能体原生OS研究员/工程师 上海、圣何塞 校招 正式 数字技术 - 算法 硕士及以上 Super Sparks 招聘计划 职位 ID:A211923 职位描述 职位介绍 (Position Overview)我们正在定义和构建下一代智能体原生操作系统(Agent Native OS),致力于将操作系统的核心服务对象从“传统应用”向“AI 智能体”转移。由于该前沿领域横跨底层系统架构(OS Internals)与人工智能基础设施(AI Infra)两大硬核学科。我们正在寻找在 操作系统底层 或 AI 基础设施 (MLSys) 任意一端具备深厚学术积累的顶尖博士人才。您将在我们拥有互补背景的跨学科团队中,主导前沿技术的探索与原型验证,攻坚大模型运行时调度、原生 AI 内存管理以及系统级安全隔离等底层基座难题,逐步跨界成长为下一代 Agent OS 的核心架构领军者。岗位职责 (Responsibilities)下一代智能体系统基座验证: 针对多智能体高并发与强隔离的需求,在系统架构(如基于 seL4 等微内核及其 User-mode VMM
端侧智能软件开发工程师 北京 社招 全职 技术 - 开发 职位 ID:A216933 职位描述 岗位职责概括:构建高性能、可靠的端侧(Edge)智能软件栈与 AI Agent 运行框架,使模型与智能体在资源受限设备(机器人、本车、边缘盒子、可穿戴、工业终端等)上实现低时延、稳定、可扩展的智能行为。主要工作内容(可选以下的一种或多种):1. 端侧智能系统开发 - 负责 AI Agent 在端侧的整体软件架构设计与模块实现(感知、规划、决策、工具调用、记忆管理等)。 - 设计与实现多模态数据(视频/语音/传感器)采集、缓存、预处理管线。 2. 模型部署与性能优化 - 将 NLP / CV / 多模态 / 具身策略模型在端侧芯片(如 NVIDIA Jetson、瑞芯微、Qualcomm、MTK 等之一)上进行移植、裁剪、量化、算子优化与内存/带宽调优。 - 使用某种端侧推理框架(如TensorRT
大模型端侧推理实习生 北京 实习 互联网 / 电子 / 网游 职位描述 1. 负责大模型在端侧推理的SDK研发;2. 负责大模型与端侧平台的高效适配与推理优化;3. 参与端侧大模型研发的整体规划,协同配合大模型端侧落地 职位要求 1. 硕士学历(优秀者本科亦可),计算机类专业,基础知识扎实2. 有较强的工程能力、创新能力、学习能力;3. 熟悉C++编程,掌握Git、CMake等常见工具,有良好的软件工程习惯;4. 熟悉一种或多种端侧部署框架或工具链,如QNN、llama.cpp、Metal等;5. 熟练阅读英文文档;6. 有端侧算法落地、移动端开发经验优先。 投递...