高性能计算工程师(CUDA方向) AD内推 蔚来自动驾驶研发团队 北京 社招 全职 数字技术 - 软件研发 本科及以上 3-5 年 职位描述 岗位职责: 基于 NVidia GPU 架构特性,完成深度学习算子,CV 、点云计算库的开发及优化 职位要求 基本要求:1、计算机、软件工程、自动化等相关专业硕士及以上;2、熟悉 Nvidia GPU 体系结构,理解CUDA与硬件底层映射关系,掌握 CUDA 编程模型,熟悉常用 CUDA 优化方法,熟悉基于 TensorCore 编程方法; 3、熟悉常用算法、数据结构,有较强的 C/C++ 编程能力; 5、具备 C/C++和CUDA程序性能分析、问题定位、调试的能力,掌握对应调试分析工具的使用; 6、良好的编程风格习惯、文档撰写能力,团队沟通协作能力;
异构AI编译软件栈开发 上海 全职 芯片板块 职位描述 1、GPGPU特定的指令编译方案设计与开发,包含指令选择、指令调度等;2、针对大模型的下一代AI编译器设计与开发,包括图编译、Cost-Model、低bit量化算法等;3、Triton、Tilelang、Cutlass/Cute、Cute DSL/CuTile、Torch(torch.compile)等AI生态软件适配与支持; 职位要求 1、熟悉Clang与LLVM编译框架,熟悉SIMT编译优化经验,熟悉CUDA C兼容是加分项;2、熟悉Triton/IREE/Torch-MLIR/ONNX-MLIR/TPU-MLIR等是加分项;3、熟悉Tilelang/MLC-LLM/Relay/Relax/Ansor等是加分项;4、熟悉Cutlass/Cute/Cute DSL/CuTile/TensorRT/TensorRT-LLM等是加分项;5、熟悉大模型编译部署优化,尤其是跨级优化如图算融合、算子-指令编译融合等优化是加分项;6、自我驱动能力强,对技术有追求,工作细致,有编程竞赛获奖是加分项;岗位介绍:1、对于这个岗位,您将参与针对自研指令集及架构的完整的编译工具链设计与开发;2、工作范围涉及图编译、算子与指令编译,Pythonic DSL及其编译器设计与开发,完整的编程语言与编译器配套软件开发;3、与相关领域专家一起深度程参与自研芯片项目架构设计、硅前硅后AI大模型测试验证、汽车与机器人等场景量产部署全流程。 投递...
大模型推理架构师 上海 社招 全职 互联网 / 电子 / 网游 职位描述 1. 参与 Soul 大模型、多模态模型、推荐模型等核心 AI 任务的训练与推理基础设施建设,提升模型从实验到线上部署的整体效率。2. 负责大规模分布式训练系统的性能优化,包括数据并行、张量并行、流水线并行、专家并行、参数/梯度/优化器状态切分、显存优化、通信调度等方向,提升 GPU/NPU 集群利用率。3. 参与高性能推理引擎建设,围绕大模型在线服务中的低延迟、高吞吐、弹性扩缩容、多租户隔离、KV Cache 管理、批处理调度、量化部署等问题进行系统优化。4. 针对 Soul 的实时社交、多模态内容理解、AIGC 互动等场景,设计和优化端到端 AI 系统架构,降低训练和推理成本,保障核心业务的稳定性和体验质量。5. 参与异构计算算子优化和计算图优化,包括 CUDA、Triton、CUTLASS、Ascend C、TileLang 等方向,针对 Attention、MoE、Embedding、推荐模型特征交互、多模态编码等关键模块进行性能调优。6. 参与 AI 编译器和模型编译优化相关工作,围绕