Infra开发工程师 上海 全职 职位描述 - 负责公司级AI Infra平台建设,为智能驾驶场景提供数据闭环、算力平台、AIOps等基础能力支持。 - 负责数据闭环的构建,建立高效的数据流转设施,搭建稳定的数据闭环链路 - 负责AI平台的设计与研发,建设GPU及异构加速卡的资源池化、任务调度与虚拟化能力。 - 负责向量检索、图数据库等AI基础能力的构建与性能优化。 - 探索并落地面向智能汽车行业的前沿AI Infra技术演进方案。 职位要求 - 具有计算机、人工智能、软件工程、电子信息等相关学科本科/硕士学历。 - 具备以下一项或多项经验: 1. 具备数据闭环、数据链路的开发经验;2. 大规模分布式训练/推理系统、AI平台、资源调度系统、向量检索或图数据库的设计与研发经验;3. 熟悉Linux环境下的Python与C++语言,具备良好的工程与代码规范;4. 熟悉PyTorch/TensorFlow等深度学习框架,具备底层优化或二次开发经验; - 具有良好的工作态度、团队合作精神、主观能动性和跨团队沟通能力。符合以下条件者优先: - 熟悉LLM、图像、多模态或VLA/VLM等模型的训练与推理优化; - 具备自动驾驶、机器人或智能汽车相关领域软件系统开发经验; - 有大模型预训练、RL训练或高性能推理引擎(如vLLM、TensorRT-LLM)的实战经验; - 具备高性能网络、分布式存储或集群调度系统经验。 投递...
优才-具身智能算法工程师(后训练 Infra 方向)-觅蜂子公司 上海 正式 职位描述 1. 负责具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力。2. 深入理解强化学习、模仿学习、在线学习等后训练算法(PPO/SAC/DAgger/RLHF 等),基于算法特性设计高效的训练架构与数据流。3. 设计并实现云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练架构,支撑从单机到百台规模的扩展。4. 构建多种后训练算法的统一框架支撑,实现新算法低成本快速接入与验证。5. 负责云边通信体系设计(权重同步、数据回传、时延隐藏),保障大规模分布式训练的效率与稳定性。6. 跟进后训练领域前沿进展(π0.6 / RLT / flow matching RL 等),具备快速复现并工程化落地新算法的能力。 职位要求 1. 计算机、AI、机器人等相关专业硕士及以上学历。2. 具备扎实的 Python/C++ 编程能力,熟悉分布式系统设计与实现。3. 熟悉强化学习算法(PPO/SAC/DAgger 等),深入理解 on-policy / off-policy / online
优才-模型推理AI Infra开发工程师-中央研发部 上海、北京 正式 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架 投递...
优才-训练AI Infra系统优化工程师-中央研发部 上海、北京 正式 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战 投递...
具身智能算法实习生(预训练 Infra 方向) 上海 实习 职位描述 1. 参与具身智能统一预训练框架的设计与迭代,支撑 VLA、大模型、世界模型、大小脑等多种模型架构的高效训练。2. 理解 VLA、多模态大模型、世界模型等前沿算法,参与基于算法特性的框架优化方案设计与实现。3. 参与多模态数据加载体系的开发,支持图片、视频、点云、触觉等多种数据格式的高效接入与预处理。4. 参与分布式并行策略(数据并行、模型并行、流水线并行等)的开发与测试。5. 参与数据全生命周期闭环能力建设,包括数据版本管理、质量筛选、配比策略等工具链开发。6. 跟进预训练领域前沿进展,参与新算法的复现与工程化验证。 职位要求 - 计算机、AI 等相关专业硕士在读或优秀本科生。- 熟悉 Python,熟练使用 PyTorch,有深度学习项目经验。- 对多模态模型(VLM/VLA)、视频生成、世界模型等方向有基础理解或强烈兴趣。- 具备良好的工程意识与代码规范,愿意深入理解底层原理。- 实习 3 个月以上优先,能长期实习更佳。加分项- 有分布式训练框架使用或开发经验(DeepSpeed / Megatron / FSDP 等)。- 有论文复现或相关研究经验。- 有开源项目贡献经历。 投递...
具身智能算法实习生(后训练 Infra 方向) 上海 实习 职位描述 1. 参与具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力。2. 理解强化学习、模仿学习等后训练算法(PPO/SAC/DAgger 等),参与基于算法特性的训练架构设计与实现。3. 参与云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练系统开发。4. 参与多种后训练算法的框架侧适配与验证。5. 参与云边通信模块开发(权重同步、数据回传、时延隐藏)。6. 跟进后训练领域前沿进展,参与新算法的复现与工程化验证。 职位要求 - 计算机、AI、机器人等相关专业硕士在读或优秀本科生。- 熟悉 Python,熟练使用 PyTorch,有深度学习项目经验。- 对强化学习(PPO/SAC/DAgger 等)有基础理解或强烈兴趣。- 具备良好的工程意识与代码规范,愿意深入理解底层原理。- 实习 3 个月以上优先,能长期实习更佳。加分项- 有分布式系统或通信框架(RPC / gRPC / ZMQ 等)使用经验。- 有真机强化学习或仿真器(RoboSuite /
大模型平台 & Infra 工程师 深圳、北京、上海 全职 智能机器人板块 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、本科及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有 2 年以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和
AI infra架构师 上海 全职 芯片板块 职位描述 1. 基于新一代并行计算架构,负责设计、开发和优化底层算子库,以提升底层芯片的执行性能。2. 与芯片/架构团队紧密配合,持续优化算子性能,逐步完善软硬件架构。3. 分析算子/网络的性能瓶颈,提出性能优化策略,达成性能目标。4. 深入优化平台的性能和硬件资源使用效率,优化AI模型的存储和计算资源利用,包括GPU/TPU、内存、带宽、存储等,提升系统的可靠性、性能和扩展性。5. 持续关注并追踪学术成果和前沿技术,通过对业务需求的理解,推进并行计算架构在深度学习领域的应用。 职位要求 1. 具备优秀的工程实现能力,熟练掌握 C/C++、Python 等常用开发语言,编码规范与工程化意识良好。2. 熟悉主流深度学习框架(TensorFlow、PyTorch 等),具备实际项目开发与性能调优经验。3. 熟悉并行/异构计算体系结构,在 TPU/NPU/GPU 至少一种平台有 5 年及以上的开发与优化经验。4. 有业界常用高性能库(CUDA、cuDNN、TensorRT、OpenCV 等)的开发或性能优化经验者优先。5. 理解指令流水与计算机体系结构,具备面向性能的系统级思维与问题定位能力。6. 具备良好的团队协作与沟通能力,能够清晰表达技术方案,与跨团队成员高效配合推进项目落地。 投递...
【27届校招】AI Infra 工程师 北京、上海、广州 正式 研发 - 算法 通用智能板块 职位描述 1.负责自动驾驶系统基础设施的搭建与优化,包括模型训练、serving和数据挖掘等;2.与其他团队紧密协作,将机器学习方案部署到嵌入式或者云端测试平台;为自动驾驶算法和应用提供良好运行环境。配合算法工程师配置硬件和软件环境,解决算法运行中的基础设施相关问题;3.承担自动驾驶系统的数据闭环工作相关工作,提高数据的数量和质量;4.参与自动驾驶系统的集成与测试。配合其他工程师进行模块集成,确保系统兼容性,制定测试计划对基础设施进行性能和压力测试等;5.编写和维护相关技术文档,记录基础设施设计、搭建和优化过程,为团队成员提供参考。职位要求 职位要求 1.2027 届应届毕业生,计算机科学与技术、电子工程、通信工程、自动化等相关专业;2.具有扎实的计算机基础知识,包括操作系统、计算机网络、数据库等;3.熟悉至少一种编程语言,如 C/C++、Python 等,具备一定编程能力;4.了解云计算、大数据相关技术和概念,有实践经验者优先;5.对自动驾驶技术有浓厚兴趣和热情,愿意投身该领域基础设施建设工作;6.具备良好团队合作精神和沟通能力,能与不同专业背景人员协同工作;7.有较强学习能力和问题解决能力,能快速适应新技术新环境;8.注重细节,有责任心,具备良好抗压能力,能承担一定工作压力。 投递...
【27届校招】AI Infra 部署工程师 广州、北京、上海 正式 研发 - 算法 通用智能板块 职位描述 职位描述:设计、实现与维护自动驾驶软件系统框架,优化系统的性能、延时、稳定性与算法工程师合作,完成端到端大模型的转换与部署,以及模型的预处理/后处理等开发工作负责模型的KPI评测与对齐工作负责功能开发完成后的实车联调、测试及迭代优化等工作 职位要求 岗位要求:计算机、电子信息等相关专业的硕士或博士精通C++、Python,具有良好的代码书写规范和文档编写能力熟悉多线程编程,深入理解计算机体系结构和高性能计算有Linux系统性能优化经验,熟悉常用调试工具具备优秀的问题分析、沟通及协作能力 加分项:熟悉 CUDA 内核与 TensorRT有实际的深度学习模型部署、性能优化经验有自动驾驶或机器人行业相关经验 投递...
【27届校招】AI Infra 推理优化工程师 广州、北京、上海 正式 研发 - 算法 通用智能板块 职位描述 职位描述:我们正在寻找一名专注于模型推理与模型优化的机器学习工程师。你将从模型结构和算法层面出发,对大规模深度学习模型进行优化,使其能够高效部署在小鹏定制的 AI 加速器上。我们通过数据驱动的模型压缩与结构改造,在保证精度的前提下显著降低推理延迟和内存占用。从模型和算法层面对深度学习模型进行推理优化,支持其在小鹏定制 AI 加速器上的高效部署我们的使命是解决自动驾驶,具身职能这一世界级难题。你将与机器学习工程师、编译器工程师和研究科学家紧密合作,将前沿的大模型研究成果转化为可落地的工程方案。 职位要求 职位要求:CS/CE/EE硕士学位,或同等学历,行业经验精通 Python 和 PyTorch,具备良好的研究型和工程型代码能力。对大模型结构(如 Transformer 及其变体)有深入理解。对模型推理框架和工具(onnx,TensorRT, TRT-LLM等)有深入了解。扎实的深度学习基础和推理流程认知。具备模型优化经验,如量化、剪枝、稀疏化、蒸馏等。具备较强的自主学习和论文阅读能力,能够独立推动问题解决。对挑战性和不确定性问题有好奇心,责任感和执行力。 投递...
训练AI Infra系统优化工程师 上海 校招 正式 技术族 - 软件类 职位 ID:A46765 职位描述 1. 大规模分布式训练系统:在千卡级GPU/NPU集群上构建稳定、高效的分布式训练系统,支持VLA、WM等具身大模型的预训练与微调;2. 训练数据加载流水线:构建从存储到GPU/NPU显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的I/O Stall;3. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 职位要求 1.熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 2. 熟悉PyTorch 分布式训练机制(DDP/FSDP),熟悉DeepSpeed或Megatron-LM等大规模训练框架的原理与使用;3. 熟悉并行策略:深入理解 多维并行(DP/TP/PP/EP/CP等)的实现原理与适用场景,能够根据模型特点设计最优并行策略;4. 具备性能分析与调优能力:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈;5. 深刻理解典型预训练、持续训练、RL训练等算法原理以及在技术实现时软硬件系统层面挑战; 投递...
模型推理AI Infra开发工程师 上海 校招 正式 技术族 - 算法类 职位 ID:A125373 职位描述 1. 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构;2. 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略;3.对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略;4. 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度);5. 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术; 职位要求 1. 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验;2. 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构;3. 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链;4. 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等);5. 熟悉MLIR、IREE、Triton、TileLang等至少一中AI编译框架; 投递...
具身智能算法工程师(预训练 Infra 方向)-觅蜂子公司 上海 校招 正式 技术族 - 算法类 职位 ID:A97791 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责具身智能统一预训练框架的设计与迭代,支撑 VLA、大模型、世界模型、大小脑等多种模型架构的高效训练。2. 深入理解 VLA、多模态大模型、世界模型、视频生成等前沿算法,基于算法特性设计框架层面的训练策略与优化方案。3. 设计并实现多模态数据加载体系,支持图片、视频、点云、触觉等多种数据格式的高效接入与预处理。4. 设计并实现多种分布式并行策略(数据并行、模型并行、流水线并行、混合并行等),适配从百亿到千亿级参数模型的训练需求。5. 构建数据全生命周期闭环能力,包括数据版本管理、质量筛选、配比策略,打通从数据采集到模型训练的完整链路。6. 跟进预训练领域前沿进展,具备快速复现并工程化落地新算法的能力。 职位要求 1. 计算机、AI 等相关专业硕士及以上学历。2. 具备扎实的 Python/C++ 编程能力,熟悉 PyTorch 内部机制(分布式训练、自动微分、算子调度等)。3. 对多模态模型(VLM/VLA)、视频生成模型、世界模型等有深入理解,熟悉其训练范式、数据需求与常见优化技巧。4. 熟悉主流训练框架及分布式训练技术(DeepSpeed / Megatron / FSDP
具身智能算法工程师(后训练 Infra 方向)-觅蜂子公司 上海 校招 正式 技术族 - 算法类 职位 ID:A176440 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责具身智能后训练框架的设计与迭代,构建支撑真机强化学习的规模化训练能力。2. 深入理解强化学习、模仿学习、在线学习等后训练算法(PPO/SAC/DAgger/RLHF 等),基于算法特性设计高效的训练架构与数据流。3. 设计并实现云端多机多卡训练 + 边缘多机多本体 rollout 的分布式异步训练架构,支撑从单机到百台规模的扩展。4. 构建多种后训练算法的统一框架支撑,实现新算法低成本快速接入与验证。5. 负责云边通信体系设计(权重同步、数据回传、时延隐藏),保障大规模分布式训练的效率与稳定性。6. 跟进后训练领域前沿进展(π0.6 / RLT / flow matching RL 等),具备快速复现并工程化落地新算法的能力。 职位要求 1. 计算机、AI、机器人等相关专业硕士及以上学历。2. 具备扎实的
系统研发实习生—AI Infra(工单智能化方向) 上海 校招 实习 研发 - 后端开发 职位描述 加入 AI 基础设施团队,你将在导师指导下参与工单系统的迁移、建设与智能化升级,并逐步承担系统的日常研发和维护工作。1、工单迁移与数据治理: 参与历史工单及相关流程从旧系统向新系统迁移,完成数据清洗、字段映射、校验、回滚方案和迁移工具开发,保障数据完整性与业务连续性;2、工单系统建设: 参与工单系统前后端功能、流程引擎、权限、通知及数据看板等模块的开发、测试、上线和维护,持续改善稳定性与使用体验;3、工单智能化: 基于历史和新增工单,参与数据集构建、知识整理、模型评测,并探索小模型、RAG 或 Agent 在工单分类、摘要、分派、相似案例检索、解决方案推荐和自动跟进等场景的应用;4、工作流优化: 分析工单流转数据和实际处理过程,识别重复操作与效率瓶颈,将有效方案沉淀为可配置、可观测、可持续迭代的自动化工作流;5、系统长期负责: 在导师和团队支持下,逐步负责工单系统的需求对接、技术方案、开发交付、监控告警、问题排查和文档沉淀,建立对系统全生命周期的理解;6、跨团队协作: 与算法、调度、运维及其他基础设施团队协作,理解 AI Infra 场景中的资源与服务流程,推动实际需求落地。你将收获:1、完整参与工业级工单系统从数据迁移、功能建设到智能化升级的全过程,而不只是完成单一功能;2、在真实业务数据和场景中实践 LLM、小模型、RAG、Agent 与评测体系,理解 AI 能力如何可靠地进入生产工作流;3、提升 Go / Python / TypeScript 等工程能力,并积累微服务、数据库、数据治理、可观测性和系统稳定性经验;4、在导师指导下逐步建立系统 owner 意识,锻炼需求分析、方案设计、项目推进和跨团队协作能力。 职位要求 1、在读学生: 本科或硕士在读,计算机、软件工程、人工智能、数据科学等相关专业;能够稳定实习
端云协同 AI Infra 专家 / 工程师 上海 社招 全职 技术 - 基础架构 职位 ID:A41424 职位描述 1. 负责端云协同 AI 架构设计,明确云侧模型、私有化服务、边缘节点、端侧设备之间的职责边界、数据流、控制流和安全边界。2. 围绕面壁miniCPM等系列产品,面向运营商营业厅、客服坐席、现场运维、企业办公终端、边缘网关等场景,建设端云协同的数字员工能力。3. 与 Infra 团队协作,打通云侧模型服务、RAG、Workflow、权限审计、日志监控和端侧运行环境。4. 负责端侧资源约束下的性能优化,包括量化、KV Cache、批处理、缓存策略、网络降级、异构算力调度和功耗控制。5. 沉淀端云协同部署规范、设备适配清单、性能 benchmark、故障排查手册和行业交付模板。 职位要求 1. 本科及以上学历,计算机、电子信息、自动化、通信、人工智能等相关专业。2. 3 年以上端侧 AI、边缘计算、推理优化、嵌入式系统、客户端基础架构或云边端协同系统经验。3. 熟悉 C/C++、Python,了解端侧或边缘设备上的性能调优、资源管理和系统问题排查。4. 熟悉至少一种推理框架或部署工具,如 llama.cpp、ONNX Runtime、TensorRT、SGLang 等。5.
AI院-推理Infra工程师(量化算法研究/推理框架优化/GPU优化) 北京、上海 全职 互联网 / 电子 / 网游 职位描述 【方向一】量化算法研究员-职位描述通过前沿的模型量化、压缩与推理加速技术,显著降低大语言模型及多模态模型的存储占用与计算成本,推动 LLM 的大规模部署。-工作内容1、研发及改进 PTQ(训练后量化)、QAT(量化感知训练)、混合精度量化等核心算法,针对LLM/VLM(大语言模型/视觉语言模型)设计定制化量化方案,持续优化模型精度与推理效率的平衡;2、探索并实践低比特量化(如INT8/INT4/FP8/FP4)、权重稀疏化、知识蒸馏等协同压缩技术,提升压缩率同时控制精度损失;3、开发及优化量化工具链,完成对 GLM 系列模型的转换、量化校准及部署集成;4、 跟踪学术界与工业界前沿量化技术,通过论文复现、实验对比推动技术迭代。-职位要求1、计算机科学、电子工程、数学等相关专业硕士及以上学历,3 年以上模型量化或推理加速经验;或优秀本科生具备扎实项目履历;2、深入理解 Transformer 架构及 LLM 推理流程,精通 Python,熟悉常见的开源 LLM 推理框架(sglang/vllm/trtllm 等);3、掌握量化原理(校准策略、量化粒度、误差分析)及主流算法(如GPTQ、AWQ);4、具有 CUDA/Triton 编程经验,能自主实现高性能算子或优化内核计算加分。【方向二】推理框架优化工程师-职位描述1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术集成与应用:研究并应用业界前沿的优化技术(如模型量化QAT/PTQ、算子融合、动态形状支持、FlashAttention等),并将其集成至推理/训练引擎。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。【方向三】GPU优化工程师-职位描述利用对 cuda 生态软件和底层体系结构的了解,帮助团队优化训练和推理的计算效率。-工作内容1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率、多流并行协同等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术选型:对 GPU 领域相关的 DSL/编译器(例如 triton/cuteDSL/tilelang)等进行尝试和了解,确定团队内的 DSL/编译器的技术选型,为未来的迭代做好技术储备。-职位要求1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式。 职位要求 -
AI院-训练Infra工程师 北京、上海 全职 互联网 / 电子 / 网游 职位描述 1、负责大规模预训练框架的研发、优化和维护,根据业务需求持续改进训练框架和策略,提升模型训练效率2、分析和定位训练中的性能瓶颈,实施针对性优化措施,提升训练效率和稳定性3、跟进业界技术进展,不断同步与集成最新训练优化策略 职位要求 1、对自然语言处理、计算机视觉和多模态算法有深入理解,熟悉主流的 LLM 和 VLM 模型架构,有分布式训练经验2、精通 Python 编程语言,熟悉 PyTorch 深度学习框架和 Megatron 分布式训练框架3、有大规模预训练优化 / MoE 训练优化经验的优先考虑加分项:1、在ACM、NOI、IOI、超算比赛中有获奖经历者优先2、具有 cuda 算子优化/profiling 能力者优先 投递...
Data Infra Tech Lead 北京、上海、苏州 全职 研发 - 高级技术职位 职位描述 1、负责自动驾驶 & 通用大模型双赛道的数据底层基建全链路架构设计与研发,搭建支撑 VLM 大模型、视频生成、自动驾驶世界模型、端到端智驾模型训练的高性能、高可扩展数据生产平台;2、打通图像、视频、激光雷达点云、多传感器时序数据全生命周期链路,构建行业领先的数据治理体系,用 AI 工程化能力反哺数据生产全流程,持续驱动模型迭代效率与数据质量上限。 职位要求 1、经验门槛:具备扎实的大规模分布式系统架构设计、底层数据平台基建开发经验,具备完整复杂系统从 0 到 1 架构搭建与迭代优化经验;2、编程能力:精通 Python,熟练掌握 Go/C++ 至少一门主力开发语言,具备优秀的工程化设计、代码架构与性能调优能力;3、大数据基建功底:深度精通分布式数据处理技术,拥有TB/PB 级海量多模态数据存储、计算、调度、流水线开发经验,熟悉湖仓一体、对象存储、分布式计算生态技术栈;4、大模型全流程认知:深度熟悉大模型训练全流程,完整了解预训练、SFT 微调、RLHF 对齐全链路,理解大模型训练对数据体系、数据质量、数据供给链路的核心诉求。加分项:1、具备自动驾驶领域数据基建经验优先,熟悉激光雷达点云、车载多传感器融合数据处理、智驾场景数据挖掘、自动驾驶世界模型 / 端到端大模型数据体系建设经验优先;2、有长视频数据处理、3D 数据基建、大规模预训练数据集构建经验优先。 投递...