端侧工程-异构计算实习生 北京 社招 实习 数字技术 - 算法 本科及以上 工作年限不限 职位描述 1. 负责自动驾驶算法车端的工程优化2. 负责现有异构计算模块的runtime优化 职位要求 1. 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;2. 熟练掌握 C/C++和Python,有良好的代码编写习惯;3. 熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;4. 以下掌握其一优先 1. 熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库; 2. 熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架 3. 熟悉NEON等SIMD指令5. 优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;6. 有深度学习、计算机视觉、自动驾驶背景优先 投递...
Company Description At Canva, were building a future powered by AI thats as magical as it is impactful. As a Research Scientist at Canva, youll be responsible for advancing the future of AI by experimenting with
2026校招-芯片数学库开发工程师-北京 北京 校招 正式 职位描述 岗位职责:1.跟踪业界数学库领域前沿技术和实现方法;2.和算法开发团队配合,进行数学库的高效理论实现方案选取;3.负责数学库算法在自研硬件上的并行方案设计和最终实现;4.和芯片团队合作持续进行数学库性能测评,分析性能瓶颈并提出优化方案。 职位要求 岗位要求:1.熟悉基础数学函数、线性代数、矩阵运算、数值计算等数学库相关算法;2.熟悉lapack、mkl、CUDA等数学开源库者,有相关开发经验者优先;3.熟悉计算机体系结构(x86/ARM);4.熟练掌握Python/C/C++等编程语言一种或多种;5.参与过并行计算,分布式存储开发并具有相关经验者优先; 投递...
2026校招-IP设计工程师(GPGPU)-北京 北京 校招 正式 职位描述 1. 参与微架构设计、RTL、综合/STA到测试交付全流程。接触计算前端模块(SM计算控制、调度器、Cache、一致性等)与功耗优化;2. 根据规范完成微架构设文档计与RTL 实现;3. 联合 DV 搭建 UVM 接口、断言(SVA)并参与仿真回归;4. 与架构/算法团队协作,对指令发射、存储层次和一致性协议提出实现约束。 职位要求 1. 硕士以上学历,电子信息/计算机体系结构/微电子等相关专业或有相关实习经验;2. 扎实数字电路基础,熟练 SystemVerilog/Verilog,了解 SVA/UVM;会 Python/TCL 脚本;3. 理解综合/STA/功耗分析基本方法;4. 对 CUDA/SIMT/warp、共享内存、coalescing/bank 冲突有直观理解;5. 加分项:有 GPU/CPU IP 实现或片上网络/一致性协议经验。 投递...
2026校招-计算前端算法分析工程师(GPGPU)-北京 北京 校招 正式 职位描述 1. 面向性能架构关键算法进行深度分析,以基准→度量→瓶颈→优化为主线;聚焦少量关键方向:图优化/不规则 workload、调度与分发、分歧/均衡等;2. 剖析与定位:使用性能分析工具与 Python 脚本定位瓶颈(内存层次、调度/分发、分歧/原子、并发重叠);3. 策略与验证:在刨析基础代表性场景(如 frontierbased 图遍历、稀疏 gatherscatter)上,评估设备级队列/优先级/ Graphs 等调度与负载均衡策略,并给出数据驱动的算法改进报告和策略;4. 协同与沉淀:与架构/编译器/库/驱动协作,确定算法实现边界。形成可复现实验、优化建议与报告。 职位要求 1. 硕士以上学历,计算机科学与技术/体系结构/电子信息等专业;2. 编程与电路设计:C++/Python,熟悉主流并行计算编程;熟悉数字电路;3. 性能方法:对关键性能/功耗指标有一定概念;4. 工具与平台:能撰写清晰的实验与结论文档;5. 问题域理解:有对图/不规则 workload 或调度模式有演进一定了解;6.加分项:有数字电路设计基础,了解 CUDA Graphs/动态并行、任务图执行;或接触过 CUTLASS/Triton等。 投递...
2026校招-底层引擎开发工程师-北京 北京 校招 正式 职位描述 岗位职责1.基于自研内核架构,进行高性能算子及算子库的开发;2.基于自研SoC架构,进行高性能通信库开发;3.配合业务部门需求,进行主流AI模型调试和算子开发适配;4.解决客户问题,构建生态; 职位要求 岗位要求1.熟悉Pytorch、Tensorflow等框架,有算子适配和调试经验;2.熟悉CUDA或国内类似自研架构算子开发和调优方法;3.熟悉国内自研架构通信库开发方法;4.有钻研精神,对于性能极致优化有热情。 投递...
2026校招-软件开发工程师-北京 北京 校招 正式 职位描述 岗位职责:1.根据需求和设计文档,开发和维护C++跨平台应用程序和系统组件;2.实现和优化算法及数据结构,确保程序的性能和稳定性;3.编写和执行单元测试模块,确保程序的健壮性; 4.撰写技术文档/设计文档,记录系统架构、功能实现和使用方法。 职位要求 岗位要求:1.熟练掌握C/C++编程语言,包括面向对象编程和常用数据结构;2.理解C++的内存管理机制,包括指针和引用的使用;3.理解并发编程的基本概念,如线程、进程、同步与互斥、死锁等;4.能够使用Linux GDB等调试工具进行程序调试,排查程序运行时出现的问题和异常;5.计算机科学、软件工程或相关领域的本科及以上学历,硕士优先;6.有过CUDA编程或者高性能计算编程相关的实习经验或项目经验优先。 投递...
2026校招-研发测试工程师-北京 北京 校招 正式 职位描述 1、系统板卡/计算加速卡/芯片相关的功能、性能、兼容与可靠性测试(含上电SOP、接口/外设、PCIe/AXI 拓扑、错误注入与恢复);2、BMC/BIOS/驱动/固件的版本验证与回归,记录并复现问题,推动闭环;3、搭建并维护测试环境(Linux、驱动、工具链、网存/并行存储、JTAG/串口等);4、产出标准化测试用例/报告/SOP,并沉淀自动化脚本与仪表板。 职位要求 1、硕士学历,计算机/电子/通信/自动化等;2、掌握Linux基础命令与Shell/Python脚本;3、了解计算机组成、PCIe/以太网/NVMe基础,能阅读英文数据手册与日志;4、动手能力强,善于排障与记录;沟通清晰,愿意长期在工程场景磨炼;5、有硬件实验、驱动/固件课程设计或竞赛经历优先;6、会使用示波器/万用表/逻辑分析仪优先;7、熟悉任一方向优先:BMC/IPMI、BIOS设置、RDMA/RoCE、CUDA/OpenCL、性能基准(STREAM/fio/iperf)。 投递...
提前批-产品系统工程师(智能辅助驾驶体验优化) 北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A04337 职位描述 1 用户体验洞察: 深入理解用户在高速、城市复杂场景下的驾驶痛点,结合竞品分析与用户调研,主导领航辅助(NOP/Pilot)及相关功能的产品体验定义。2 数据驱动的交付闭环运营: 基于数据挖掘与实时监控平台,利用AI辅助编程工具,建立可量化的产品体验指标体系。通过A/B测试、埋点分析及用户画像,驱动产品快速迭代决策,持续提升用户对智能辅助驾驶产品的激活率、使用频次与满意度。3 跨部门协同与敏捷落地: 高效联动项目管理、算法研发、硬件工程及现场测试等多个团队,扮演“技术”与“用户”之间的翻译官,推动技术创新向优质用户体验的高效转化与规模化落地。4 前瞻性技术预研: 追踪全球智能辅助驾驶技术演进路径与用户行为变迁,协助开展前瞻性技术预研与应用场景探索,保持产品方案的领先性与差异化竞争力。 职位要求 教育背景硕士及以上学历,2027届应届生,计算机/软件/AI/自动化/电子等相关专业必备能力Linux/Git:熟练Linux开发环境,熟悉Git及CI/CD基本流程C++:熟悉C++11/14/17标准,掌握内存模型、智能指针、STL、多线程编程Python:熟悉多进程/多线程/协程,理解GIL与内存管理机制PyTorch:熟悉PyTorch及分布式训练基本概念,有课程/项目实操经历加分项CUDA/GPU加速实践经历了解LMDB/Arrow/WebDataset等数据格式了解DDP/FSDP/DeepSpeed/Megatron等分布式策略接触过Perf/Nsight/Triton/ ASan等性能工具有训练框架阅读或小改动经历有智能辅助驾驶/机器人/大模型训练相关项目或竞赛经历 投递...
提前批-AI推理引擎开发工程师 北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A242397A 职位描述 参与大模型推理引擎的设计和研发,支撑自研以及开源模型的快速部署和高性能推理;通过各种技术手段持续优化性能,降低推理成本,包括但不限于:算子/编译优化、异构推理、分布式并行等;学习并应用业界前沿的推理优化技术,KV Cache优化、模型量化(Quantization)、剪枝(Pruning),跨机分布式推理优化等。对 Transformer 架构及主流大模型(如GPT、Llama、Qwen等)的推理特性有基本理解,了解大模型推理的基本流程和常见挑战(如延迟、吞吐、内存占用);在资深工程师指导下,参与优化内存管理、计算资源分配与调度策略,提升模型推理速度和资源利用率。学习并使用性能分析工具(如Nvidia Nsight)进行瓶颈定位和优化; 职位要求 熟练掌握 C++ 和 Python 编程语言,具备扎实的数据结构、算法和操作系统基础熟悉至少一种主流的深度学习框架(如 PyTorch、TensorFlow),了解其基本实现原理了解GPU编程(如 CUDA)或并行计算,有相关的课程项目或实验经验;有开源大模型推理框架(vllm/sglang/trt-llm)使用和优化经验者优先;有cuda或triton开发优化gpu算子经验者优先;有NVIDIA 等算力芯片优化经验者优先;有大模型推理相关从业经验者优先。 投递...
后端开发实习生(Golang) 北京 实习 互联网 / 电子 / 网游 日常实习生 职位描述 设计并落地大规模自动驾驶仿真平台能力,面向真实业务场景和用户需求交付高效产品。基于用户优先级与任务紧急程度进行资源分配和排队策略,规划仿真调度架构与策略,提升集群计算资源利用率。 职位要求 1. 计算机基础扎实:操作系统、并发/线程模型、网络协议(TCP/HTTP);能独立识别并解决线程交互与网络异常问题。2. 精通 Golang 与 Shell,具备生产级服务开发经验与性能调优能力。3. 熟练使用 git、make,具备良好的编码规范与文档能力。4. 熟悉 Kubernetes 及容器网络(CNI/Service/Ingress/DNS 等),能够排查调度与网络故障,保障集群稳定性。5. 自动驾驶行业经验,仿真平台或任务调度相关经验优先。6. GPU/CUDA 编程经验,或有 GPU 资源调度/优化实践优先。 投递...
提前批-大模型训练框架开发工程师 北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A86427 职位描述 参与智能辅助驾驶大模型训练链路的工程优化,主力支持以下一个或多个方向:训练性能优化:分布式训练调优(显存/通信/IO),前后处理环节加速(解码/增强/加载),GPU/CPU异构计算优化训练框架维护:内部训练框架迭代与模块化重构(数据加载/模型/优化器/日志解耦),支持增量学习与持续训练数据链路优化:大规模数据读取链路设计(WebDataset/LMDB/TFRecord),预处理流程优化,解决分布式IO瓶颈CI/CD与质量体系:自动化构建、测试与回归验证流程建设,训练效率与稳定性度量系统问题攻关:内存/显存/日志/profiling专项优化,定位解决OOM、卡死、通信超时等系统级问题 职位要求 教育背景硕士及以上学历,2027届应届生,计算机/软件/AI/自动化/电子等相关专业必备能力Linux/Git:熟练Linux开发环境,熟悉Git及CI/CD基本流程C++:熟悉C++11/14/17标准,掌握内存模型、智能指针、STL、多线程编程Python:熟悉多进程/多线程/协程,理解GIL与内存管理机制PyTorch:熟悉PyTorch及分布式训练基本概念,有课程/项目实操经历加分项CUDA/GPU加速实践经历了解LMDB/Arrow/WebDataset等数据格式了解DDP/FSDP/DeepSpeed/Megatron等分布式策略接触过Perf/Nsight/Triton / ASan等性能工具有训练框架阅读或小改动经历有智能辅助驾驶/机器人/大模型训练相关项目或竞赛经历 投递...
提前批-数据挖掘工程师 北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A188280 职位描述 1. 参与智能辅助驾驶数据闭环相关系统的开发与维护,包括任务工作流、数据生产系统、数据挖掘平台;2. 深入理解行车、泊车等业务场景,基于多源数据进行问题分析,向量库、知识图谱及检索引擎构建;3. 通过Prompt Engineering、大模型Agent Skills等手段进行数据筛选、统计分析及异常样本挖掘;4. 协助构建问题数据集,支持模型评测与迭代优化;5. 优化数据处理流程,提升数据生产与使用效率。 职位要求 教育背景硕士及以上学历,2027届应届生,计算机/软件/AI/自动化/电子等相关专业必备能力Linux/Git:熟练Linux开发环境,熟悉Git及CI/CD基本流程C++:熟悉C++11/14/17标准,掌握内存模型、智能指针、STL、多线程编程Python:熟悉多进程/多线程/协程,理解GIL与内存管理机制PyTorch:熟悉PyTorch及分布式训练基本概念,有课程/项目实操经历加分项CUDA/GPU加速实践经历了解LMDB/Arrow/WebDataset等数据格式了解DDP/FSDP/DeepSpeed/Megatron等分布式策略接触过Perf/Nsight/Triton / ASan等性能工具有训练框架阅读或小改动经历有智能辅助驾驶/机器人/大模型训练相关项目或竞赛经历 投递...
Job Description SummaryResponsible for designing and programming a small module or a large component and designing a feature, set of features, or whole feature area. She/he will work independently and contribute to the immediate team and
AI院-GLM团队-预训练算法工程师 北京 全职 研发 - 算法 职位描述 职位描述1. 参与数学或代码大模型预训练的研发工作,包括模型的预训练、对齐和评测等2. 负责构建和优化数学或代码的预训练和对齐数据,提升模型在数学或代码任务上的效果3. 探索针对数学或代码任务的数据合成方法,提升模型在数学或代码任务上的泛化能力 职位要求 职位要求1. 自然语言处理、机器学习等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Pytorch、Huggingface、DeepSpeed等框架;4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先;加分项:1. 在ACL,NeurIPS,ICLR,EMNLP等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先;3. 熟悉CUDA编程/Triton编程,有相关算子加速经验者优先; 投递...
智能辅助驾驶大模型工程实习生 北京 实习 数字技术 职位 ID:A132275 职位描述 车端工程链路开发云端离线验证链路开发单元测试开发实车调试与性能分析 职位要求 熟练使用使用C++ or Python熟悉在linux平台下的开发工作有自驱解决问题的能力熟悉Git/Shell对算法,数据结构和操作系统有较好理解加分项CUDA开发Gitlab CICD精通C++ or Python高性能编程有ROS或者Cyber相关经验熟悉GTest等单元测试框架【实习时间】1. 每周至少现场4天(Base北京) 2. 实习至少六个月,可尽快入职者优先 投递...
算法工程化实习生 北京 实习 数字技术 职位 ID:A224879 职位描述 负责自动驾驶算法车端的工程优化;负责现有异构计算优化和监控工具链的开发。 职位要求 计算机、软件工程、自动化、通信、电子等相关专业本科及以上;熟练掌握 C/C++和Python,有良好的代码编写习惯;熟悉Arm-Linux,计算机体系架构,熟悉多进程,多线程编程,并具有相应调试经验;以下掌握其一优先:熟练掌握 CUDA 并行编程模式,熟悉 CUDA toolkit/TensorRT库;熟悉 TVM/XLA//NCNN/MNN/ONNX 等 DL 编译栈/推理框架熟悉NEON等SIMD指令优秀的编程风格习惯、文档撰写能力,团队沟通协作能力;有深度学习、计算机视觉、自动驾驶背景优先。 投递...
高性能计算实习生 北京 实习 数字技术 职位 ID:A148157 职位描述 基于 Nvidia GPU/ARM CPU 等架构特性完成深度学习算子、CV 算法及计算库的开发及优化;与深度学习引擎前端团队一起,共同完成深度学习引擎在端侧落地,保证算法运行的高效性及实时性。 职位要求 岗位职责:基本要求:熟悉 ARM/DSP/CUDA 并行编程模型;熟悉 C/C++ 编程,了解常用算法及数据结构;了解 Nvidia GPU/ARM CPU 处理器体系结构,理解软件与硬件底层映射关系。加分项:熟悉程序性能分析、问题定位及调试方法熟悉深度学习算法或常见 CV 算法;熟悉深度学习量化方法。 投递...
AI 院-MOE 训练/推理Infra工程师 北京 全职 互联网 / 电子 / 网游 职位描述 我们正在寻找一位经验丰富的 MOE 训练/推理 Infra 开发工程师,负责设计、实现并优化我们的 MOE(Mixture of Experts)训练和推理框架。该职位需要您具备扎实的分布式系统、高性能计算、深度学习框架以及硬件加速优化的相关知识,能够解决 MOE 训练和推理过程中的各种技术难题,并与算法团队紧密合作,确保算法的顺利实现。主要职责:1、设计并实现高效的 MOE 训练/推理框架:•设计并开发支持大规模分布式训练和推理的 MOE 框架,确保其在各种硬件配置下的高效运行;•优化训练和推理性能,通过算法优化、并行计算、缓存策略等方式,缩短训练和推理时间,提高效率;2、解决 MOE 训练/推理过程中的技术难题:•针对专家网络的选择问题,研究和实现有效的专家选择算法,确保模型在训练和推理过程中的稳定性和准确性;• 解决负载均衡问题,通过动态调整专家网络的负载分配,提高系统资源的利用率,避免过载或空闲状态;• 优化通信过程,减少分布式训练和推理中的通信开销,提高数据传输效率,缩短训练和推理时间3、与算法团队密切合作:•与算法团队保持密切沟通,了解算法需求,根据需求调整和优化训练和推理基础设施,确保算法的顺利实现;•跟踪业界最新技术动态,引入适合项目需求的新技术、新方法,提升团队整体技术水平; 职位要求 关键技能:分布式训练技术:•掌握分布式训练框架(如 Horovod、PyTorch Distributed)的使用和优化。•具备设计和实现高效分布式训练系统的能力。硬件加速优化:•熟悉 GPU、TPU 等硬件架构,能够进行硬件级性能调优。•了解 CUDA、cuDNN 等相关技术,能够利用硬件加速提升训练和推理效率。模型优化技术:•了解量化、剪枝、压缩等模型优化方法,以提升推理效率•能够在实际项目中应用这些技术,优化模型大小和推理速度•负载均衡与通信优化•能够设计高效的负载均衡策略和通信机制,以应对
AI院-GLM团队-训练/推理infra算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 岗位职责 1. 与算法团队深度协作,参与 下一代 GLM 大模型架构设计与系统实现 ,推动模型结构与系统效率的协同优化2. 构建 大模型推理成本分析与模拟系统 ,从算力、通信、KV cache、并行策略等维度优化推理效率3. 设计与优化 超大规模训练基础设施(万卡级) ,提升训练稳定性、资源利用率与训练效率4. 探索 MoE、Sparse Attention、长上下文等新架构在训练与推理系统中的高效落地 你将参与 * 下一代 GLM 系列基础模型(百亿到万亿参数级) 的系统设计* 万卡规模训练系统 的优化与稳定性工程* 推理系统的 极致效率优化(吞吐