高性能推理优化算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、高性能算子开发与优化:负责AI模型(尤其是大语言模型及多模态模型)在GPU上的核心算子(Kernel)的设计、开发与极致性能优化,支撑训练和推理场景的高效运行。2、性能分析与调优:深入分析GPU应用程序的性能瓶颈,通过优化内存访问模式、线程调度、执行效率等手段,显著提升计算密集型任务的吞吐量和降低延迟。3、技术集成与应用:研究并应用业界前沿的优化技术(如模型量化QAT/PTQ、算子融合、动态形状支持、FlashAttention等),并将其集成至推理/训练引擎。 职位要求 1、编程能力:具备3年及以上GPU编程与高性能计算优化经验,深入理解GPU架构、并行计算原理、计算机体系结构,具备高性能计算内核的开发与优化经验。2、精通C/C++,具备扎实的编程基础、良好的编程风格和丰富的调试经验;熟练掌握Python;熟悉Linux开发环境。3、性能优化经验:能够熟练使用Nsight Compute、Nsight Systems等GPU性能分析工具,有实际的性能优化案例和成果,能独立定位和解决复杂的性能问题。4、算法基础:熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法,了解深度学习常见算子的计算方式 投递...
端到端算法工程师实习生 北京 校招 实习 软件研发类 职位描述 1. Develop quantization, sparsity, pruning, and distillation techniques to enhance the production-level autonomous driving models.2. Optimize, convert, and deploy autonomous driving models (e.g., ONNX models) that operate efficiently on diverse
自动驾驶 - 大模型部署优化算法工程师(实习)-2027届 北京 校招 实习 算法类 职位描述 1. 负责自动驾驶端侧大模型的部署和优化工作2. 参与模型部署&优化工具链的研发3. 对大模型部署优化技术展开研究,并落地到自动驾驶,包括算子实现和优化、投机采样、AI 优化 Kernel 等 职位要求 1. 有参与模型部署优化的经验,有高性能计算经验者优先2. 扎实的(Python/C++)编程基础与良好的工程习惯,熟悉常用的数据结构及算法3. 熟悉 NV GPU 硬件架构与 CUDA 编程模型4. 熟悉 Claude/Codex/OpenCode 等 Agentic Coding 工具 投递...
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Machine Learning Engineering General Summary: About us: We are Qualcomm AI Research that are advancing AI to make its core capabilities – perception, reasoning, and action – ubiquitous
C++实习生 - 性能优化 - 北京海淀 北京 实习 职位描述 1. 负责自动驾驶系统感知在线模块的性能优化;2. 使用AI等工具分析感知模块,定位性能瓶颈并推动CPU、GPU等多维度优化落地。 职位要求 1. 计算机或相关专业本科以上学历;2. 优秀的编程能力,Linux开发经验、扎实的C++基础;3. 扎实的数据结构与算法基础;4. 有较强的独立解决问题能力,学习能力,动手能力及沟通能力。若能满足如下条件的其中一个,会适当加分1. 具备良好的代码风格、代码品味与工程化意识;2. 了解常用的 CPU/GPU 性能分析方法或工具,如 gprof、Nsight System、perf等;3. 了解多线程优化、并发性能优化、 GPU 编程模型、显存管理、kernel 调优等相关知识;4. 在自动驾驶行业有实习经验、或由高性能计算工程项目;5. 实习期6个月及以上,能尽快入职。 投递...
AI Infra实习生(日常实习) 北京 实习 研发 - 基础架构 千寻智能2025年秋季校园招聘项目 职位描述 1、负责构建支撑具身智能体的核心机器学习系统,开发面向机器人场景的VLA大模型训练与推理系统,支撑多模态感知、运动控制、任务规划等核心能力的持续进化;2、研发新一代具身智能系统工具链,涵盖数据采集、仿真训练、物理部署、持续优化全生命周期。 职位要求 1、计算机、人工智能、软件工程等相关专业,硕士及以上学历,2026年及之后毕业; 2、熟练使用C++/Python/Pytorch/CUDA开发生态,具有嵌入式系统开发经验者优先;3、能至少保障3个月以上的实习时间,每周4天以上出勤;4、加分项:在以下一个或多个领域有深度实践: a. 大模型训练推理:多模态大模型分布式训练、端上推理加速、Transformer模型优化; b. 高性能计算:GPU Kernel编写,高性能通信(NCCL、RDMA),AI编译器(TVM、Triton),模型量化等; c. 机器人系统:ROS2、运动控制算法、传感器数据处理pipeline。 投递...
We are now looking for a Deep Learning Performance Software Engineer! We are expanding our research and development for deep learning. We seek excellent Software Engineers and Senior Software Engineers to join our team. We specialize
NVIDIA has been transforming computer graphics, PC gaming, and accelerated computing for more than 25 years. It’s a unique legacy of innovation that’s fueled by great technology—and amazing people. Today, we’re tapping into the unlimited potential
NVIDIA networking designs and manufactures high-performance networking equipment that enable the most powerful super computers in the largest data centers in the world. With a distributed collection of NVIDIA GPUs inter-connected by networking solutions such as
About A1 There are over 5 billion users using basic applications today such email, notes, tasks that are not AI-native. Our mission is to build a proactive smart assistant for everyday users to bring intelligence to
AI基建-大模型推理框架开发工程师 北京 社招 全职 职位 ID:A252073 职位描述 - 负责基于 vLLM、SGLang 等技术的大模型推理框架的开发工作,包括但不限于设计和实现高效的推理引擎架构,优化推理过程中的计算流程,提高推理性能,以满足不同规模大模型的实时推理需求- 复杂大模型框架性能评估和调优工作,构建并完善性能监控体系,通过实时监测训练指标,定位性能瓶颈,提出优化方案,确保在不同硬件上达到最优性能。- 负责Cuda Kernel优化,开发高性能的GPU算子, 提升大模型推理性能 职位要求 - 硕士及以上学历,计算机、软件工程、数学等相关专业,具备扎实计算机理论基础和丰富编程经验,在深度学习领域有深入研究与实践。- 精通 Python,熟练掌握至少一种深度学习框架(如 PyTorch),理解深度学习原理算法,有丰富模型开发与调优经验,能独立搭建复杂模型并优化性能。- 熟悉 C++ 和 CUDA 编程,具备代码优化能力,能针对 GPU 等硬件高效编写和优化代码,了解硬件体系结构并进行针对性优化。- 熟悉大模型推理框架的基本原理和流程,了解 vLLM、SGLang 等大模型推理框架的核心技术和实现优先- 有良好团队协作与沟通能力,能与不同背景成员有效沟通协作,责任心强、敬业热情,能承受工作压力,保证项目按时高质量交付。 投递...
VLA训练infra算法工程师 - XiaomiRobotics 北京 社招 全职 职位 ID:A243642 职位描述 1. 基于 PyTorch 生态(FSDP / DeepSpeed / Megatron 等)设计并实现 VLA 模型的分布式训练方案(DP / TP / PP / MoE),构建稳定高效的训练框架2. 推动混合精度(BF16 / FP8)与算子融合(FlashAttention / Triton kernel)3. 构建高吞吐数据pipeline,设计数据格式与 shard 策略,实现高效的数据加载4. 支持大规模实验追踪、管理、指标可视化 职位要求
新业务部-多媒体驱动软件工程师 北京、西安 社招 全职 职位 ID:I9060 职位描述 1、负责Android平台多媒体(GPU、Display、Camera、NPU、Vcodec)相关软件架构设计与开发,相关媒体模块的优化;2、负责上述媒体相关的IP的FPGA验证工作,与芯片沟通、及时发现并解决相关问题,保证相关硬件的功能正常;3、负责上述媒体相关的IP在Android平台上面的Bring Up、移植、深度优化,以及相关驱动的开发和维护;4、 负责上述媒体相关的IP的PQ算法验证及相关HAL及驱动开发和维护;5、负责Linux平台相关媒体模块的驱动开发与维护。 职位要求 1、信号处理、自动化、通信、电子工程、数学、计算机类,本科及其以上学历,3年及以上相关工作经验;2、熟练使用C/C++等编程语言,有Android Framework相关开发经验优先,熟悉Linux驱动开发;3、有Android媒体相关(GPU、Display、Camera、NPU、Vcodec)模块开发经验优先,熟悉相关模块的HAL以及Kernel驱动流程者优先;4、主动积极并具有团队合作精神,自我激励能力,并有良好的沟通技巧。 投递...