高性能计算研究员 北京 全职 本科及以上 职位描述 1. 主导科学智能领域核心项目的高性能优化工作,重点突破OpenLAM系统级性能瓶颈,包括: - 面向上亿级科学数据的大模型训练场景,优化分布式训练框架的通信效率与计算资源利用率; - 软硬结合优化算子效率,极限压榨硬件性能; - 探索CUDA内核级优化与PyTorch计算图编译技术的前沿应用; - 构建超大规模晶体材料数据库(亿级原子体系)的高效数据预处理与并行计算方案;2. 深度参与AI for Science基础设施体系建设: - 将优化成果沉淀为通用加速组件,持续提升DeePMD-kit等开源软件的计算效率; - 构建面向材料、能源等领域的端到端加速方案,驱动工业级科学软件的研发。 职位要求 - 计算机/应用数学/计算材料学等相关专业硕士及以上学历(非常优秀的本科生也可考虑),2年以上HPC优化经验- 精通CUDA编程与GPU性能分析工具(Nsight/VTune),有PyTorch/TensorFlow框架层优化经验- 掌握MPI/OpenMP并行编程技术,具有千卡级分布式训练实战经验者优先- 熟悉典型AI模型计算特征(Attention/卷积/稀疏计算),能针对性设计内存/通信优化方案 职位信息 部门: OpenLAM 投递...
2027校招-推理框架工程师(上海/成都/北京) 北京、上海、成都 校招 正式 职位描述 分布式推理系统开发1、设计并实现大规模AI模型(如LLM、多模态模型)的分布式推理框架,优化吞吐量(Throughput)和延迟(Latency)。2、开发模型并行(Tensor/Pipeline Parallelism)、动态批处理(Dynamic Batching)和连续批处理(Continuous Batching)策略。3、解决多节点、多GPU环境下的负载均衡和通信瓶颈问题。4、优化计算图执行(如使用TensorRT、ONNX Runtime、vLLM等工具)。5、实现量化(FP8/INT8)、KV Cache优化、Flash Attention等加速技术。 职位要求 精通 Python/C++,熟悉PyTorch/TensorFlow推理生态。深入理解分布式系统(NCCL/RPC通信、GPU Direct RDMA)和 并行计算(CUDA、OpenMP)。熟悉推理加速技术(量化、剪枝、算子融合)和框架(TensorRT、vLLM 、Sglang)。 投递...