RDMA NIC 研发专家 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、在总体架构和产品规格指导下,负责RDMA NIC关键子系统或模决的微架构设计与研发交付,包括TX/RX数据通路、QP与上下文管理、WQE/CQE处理、DMA与地址转换、队列调度及完成机制等;2、负责RoCEv2或InfiniBand相关协议功能的设计实现与问题闭环,包括Read/Write/Send、Atomic、Ordering、ACK/Retry、异常处理以及PFC、ECN、DCQCN等流控与拥塞控制机制;3、开展模块级性能分析与优化,量化带宽、时延、队列深度、缓存利用率及PPA约束,定位并解决数据通路、内存访问和跨接口交互中的性能瓶颈;4、协同验证、固件、驱动、操作系统及系统团队,完成模块验证、子系统集成、芯片Bring-up、问题定位和规模化环境下的性能调优。 职位要求 1、RDMA协议与数据通路研发能力:熟悉QP、MR、WQE、CQE、Doorbell和RDMAVerbs,理解RDMA传输状态、顺序、可靠传输及拥塞控制机制,能够独立承担相关模块设计与周试;2、主机接口、DMA与队列管理能力:熟悉PCIe、DMA Engine、Descriptpr、MSI-X、IOMMU、ATS/PASID或SRIOV中的一种或多种技术,具备地址转换、内存保护、队列调度或虚拟化模块研发经验;3、ASIC实现与软硬件协同能力:具备模块微架构、RTL实现、架构验证或性能建模能力,能够完成时序、面积和功耗权衡;熟悉固件或Linux RDMA驱动接口,具备前后硅问题定位经验。关键经历学历背景:微电子、电子工程、计算机、通信等相关专业,具备数字电路、计算机体系结构、操作系统和网络基础;岗位经历:具备5年以上NIC、SmartNIC、DPU、RDMA或高性能网络芯片研发经历,独立承担过协议处理、队列管理、DMA、主机接口或收发数据通路中的一个或多个关键模块成功经验:参与过至少一款网络适配器或高性能网络芯片从现格、设计验证到流片、Bring-up的研发过程,并完成国所负责模块的性能或可靠性问题闭环。 投递...
2026校招-研发测试工程师-北京 北京 校招 正式 职位描述 1、系统板卡/计算加速卡/芯片相关的功能、性能、兼容与可靠性测试(含上电SOP、接口/外设、PCIe/AXI 拓扑、错误注入与恢复);2、BMC/BIOS/驱动/固件的版本验证与回归,记录并复现问题,推动闭环;3、搭建并维护测试环境(Linux、驱动、工具链、网存/并行存储、JTAG/串口等);4、产出标准化测试用例/报告/SOP,并沉淀自动化脚本与仪表板。 职位要求 1、硕士学历,计算机/电子/通信/自动化等;2、掌握Linux基础命令与Shell/Python脚本;3、了解计算机组成、PCIe/以太网/NVMe基础,能阅读英文数据手册与日志;4、动手能力强,善于排障与记录;沟通清晰,愿意长期在工程场景磨炼;5、有硬件实验、驱动/固件课程设计或竞赛经历优先;6、会使用示波器/万用表/逻辑分析仪优先;7、熟悉任一方向优先:BMC/IPMI、BIOS设置、RDMA/RoCE、CUDA/OpenCL、性能基准(STREAM/fio/iperf)。 投递...
云原生研发工程师-觅蜂子公司 上海、北京 校招 正式 技术族 - 系统架构类 职位 ID:A209974 职位描述 觅蜂科技(Maniformer)是全球领先的一站式物理AI数据服务平台,致力于打造具身智能数据的 “平台型供给” 基础设施,实现数据的体系化、标准化、规模化供给。1. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台核心系统的设计、开发和维护,包括多云管理、边缘集群管理、私有化部署、资源管理、GPU 设备管理及优化、容器编排调度、运行时优化等方向中的一项或多项,持续提升平台产品的资源利用率、稳定性和易用性。2. 负责混合云场景下基于 Kubernetes 的 Genie Studio 平台基础服务的搭建、开发和维护,如:a. 网络:容器网络、RDMA、API 网关等b. 存储:分布式文件存储、对象存储等c. 边缘节点:大规模机器人节点管理、网络通信优化等d. 调度编排:训练、推理、云边联合任务、工作流等3. 与实施交付的 SRE 沟通协调,参与系统优化及问题定位,保证项目顺利部署实施。4. 跟踪云原生生态发展趋势,推动云原生 Genie Studio
大模型推理架构师 上海 社招 全职 互联网 / 电子 / 网游 职位描述 1. 参与 Soul 大模型、多模态模型、推荐模型等核心 AI 任务的训练与推理基础设施建设,提升模型从实验到线上部署的整体效率。2. 负责大规模分布式训练系统的性能优化,包括数据并行、张量并行、流水线并行、专家并行、参数/梯度/优化器状态切分、显存优化、通信调度等方向,提升 GPU/NPU 集群利用率。3. 参与高性能推理引擎建设,围绕大模型在线服务中的低延迟、高吞吐、弹性扩缩容、多租户隔离、KV Cache 管理、批处理调度、量化部署等问题进行系统优化。4. 针对 Soul 的实时社交、多模态内容理解、AIGC 互动等场景,设计和优化端到端 AI 系统架构,降低训练和推理成本,保障核心业务的稳定性和体验质量。5. 参与异构计算算子优化和计算图优化,包括 CUDA、Triton、CUTLASS、Ascend C、TileLang 等方向,针对 Attention、MoE、Embedding、推荐模型特征交互、多模态编码等关键模块进行性能调优。6. 参与 AI 编译器和模型编译优化相关工作,围绕
提前批-车载AI网络技术架构工程师 上海 校招 正式 数字技术 - 软件测试 博士及以上 2027届校园招聘-技术提前批 职位 ID:A112366 职位描述 车载数字系统架构师,深度参与车载AI网络技术的软硬件研发与创新工作,具体职责包括但不限于:车载AI网络架构设计与研究研究并设计面向智能辅助驾驶与智能座舱的车载AI网络体系架构,包括车载以太网、TSN(时间敏感网络)、5G-V2X、CAN-FD等融合通信方案探索软件定义网络(SDN)在车载场景的应用,构建可动态重构的车载网络资源调度机制研究车云协同AI推理网络架构,优化端-边-云协同的模型分发与推理链路车载AI硬件与计算平台研发参与车载AI计算平台(域控制器/中央计算单元)的硬件架构设计,包括AI加速器选型、互联总线设计、功耗与热管理优化研究车载AI芯片的网络接口与数据通路优化,提升片上与片间通信带宽利用率车载AI软件栈与网络通信研究研发面向车载AI应用的网络通信中间件,支持车载SOA相关协议的高效数据传输优化AI模型在车载网络环境下的分布式部署,研究模型压缩、量化、蒸馏及边缘推理加速技术构建车载AI网络的可观测性与QoS保障体系,保障智能辅助驾驶和智能车控任务的实时性与可靠性前沿技术研究与学术影响力建设跟踪车载AI网络领域的国际前沿技术(如6G-V2X、光电融合车载网络、神经形态计算等)参与国内外行业标准组织(如IEEE、3GPP、CCSA、C-SAE)的技术提案与标准制定跨团队协作与技术落地与智能辅助驾驶算法、传感器融合、功能安全、车云平台等团队深度协作,推动AI网络技术在实际车型项目中的落地 职位要求 学历背景博士研究生应届毕业生专业方向:计算机科学、电子工程、通信工程、自动化、车辆工程、人工智能、网络空间安全等相关领域研究方向契合博士期间研究方向需与以下至少一个领域高度相关:车载网络通信(车载以太网、TSN、V2X、5G/6G车联网)AI计算系统与网络(分布式AI训练/推理系统、AI加速器互联、RDMA网络)智能辅助驾驶与智能座舱AI系统边缘计算与端-边-云协同AI架构车载嵌入式实时系统与功能安全技术能力扎实的网络通信理论基础,熟悉TCP/IP、车载通信协议、实时网络调度理论熟练掌握至少一种编程语言(C/C++/Python/Rust),具备扎实的工程实现能力熟悉至少一种深度学习框架(PyTorch/TensorFlow/JAX),理解模型部署与优化原理对AI计算硬件(GPU/NPU/ASIC/FPGA)有基本理解,了解其网络互联架构综合素质具备强烈的技术好奇心与钻研精神,能够独立驱动研究课题优秀的跨团队沟通能力与中英文表达能力责任心强,能在高压下保证交付质量加分项有车载行业实习或项目经验,了解整车电子电气架构(EEA)熟悉ISO 26262功能安全、ISO/SAE 21434网络安全标准有AI芯片或车载SoC硬件设计经验有开源社区贡献记录有顶级学术竞赛或工业界挑战赛获奖经历有标准组织参与或提案经验 投递...
Software has moved to play a central role in network technology. From outstanding routing implementations like Bird and FRR to overlay networking technology such as OVN/OVS and Cilium, from kernel with SwitchDev to userspace with DPDK,
机器学习平台研发工程师 北京 全职 互联网 / 电子 / 网游 - 研发 职位描述 -负责机器学习平台与算力基础设施的研发与演进,为模型训练、推理、评测及数据处理等流程提供稳定、高效、可扩展的平台能力,主要包括:- 参与并主导大规模算力平台的设计与研发,覆盖资源调度、任务编排、容器与运行时管理等关键方向,持续提升集群整体资源利用率,保障训练与推理场景的稳定运行;- 基于 Kubernetes、Docker 等云原生技术,参与调度器扩展及 CRD/Controller 等核心能力建设,支撑大规模分布式训练与推理场景。- 持续推进平台的易用性与性能优化,完善工具链与开发体验,降低算法与模型团队的使用门槛,提升整体研发效率。 职位要求 - 本科及以上学历,3 年及以上研发经验,有大规模容器集群或平台型系统建设经验,有千卡及以上规模集群管理或调度经验者优先;- 熟练掌握 Golang,具备扎实的数据结构与算法基础,能够独立定位和解决复杂系统问题;- 熟悉 Kubernetes 核心机制与组件(如调度、网络、存储、Controller/CRD 等),了解容器运行时及云原生相关技术体系;- 熟悉常见分布式数据处理或计算框架(如 Ray / Spark / Flink 等),理解其架构设计与运行模型;-
【27届校招】大模型训练推理框架工程师 深圳、北京 正式 研发 - 算法 智能机器人板块 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、硕士及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有丰富以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和 RL
【27届校招】高性能通信工程师 深圳、上海 正式 研发 - 算法 智能机器人板块 职位描述 负责人形机器人内部和外部通信系统的架构设计与性能优化,保障多芯片、多设备间的高速可靠数据传输。1、设计和实现机器人内部多芯片(XP5-A/B/C、HRU)之间的高性能以太网通信架构,保障控制指令和传感器数据的低延迟传输;2、深度优化机器人在 5G、WiFi 等无线网络环境下的通信性能,解决网络适配、带宽瓶颈、信号稳定性等问题;3、设计和开发 DDS Bridge 系统,支持 WebSocket/UDP/WebRTC 等多协议到 DDS 总线的高效桥接;4、主导无线图传系统的架构设计与延迟优化(端到端采集→编码→传输→解码→渲染),支撑遥操作和远程监控场景;5、制定通信协议规范和测试标准,建立通信链路的自动化测试和监控体系。 职位要求 职位要求1、本科及以上学历,计算机、通信工程、电子工程等相关专业;2、精通 TCP/IP 协议栈,掌握网络通信系统开发;3、熟悉 DDS(FastDDS/CycloneDDS/自研 xDDS)或类似发布-订阅中间件;4、有以下至少一项深入经验:- 实时音视频传输(WebRTC/RTP/H.264/H.265 编解码);- 高性能网络编程(epoll/io_uring/DPDK/RDMA);- 无线网络优化(5G/WiFi 6/蓝牙);5、精通 C/C++,熟悉 Linux 网络子系统。 投递...
数据中心芯片软件架构师 上海、杭州、深圳 全职 研发 - 电子 / 半导体 职位描述 1、负责分析和设计数据中心SoC的芯片软件架构,参与产品需求分析并定义关键技术栈的软硬件结合特性2、设计和实施各类系统优化方法,提升SoC芯片的端到端应用表现和竞争力水平3、与芯片研发团队协作,通过仿真、原型等方法在芯片设计早期发现芯片设计问题、验证芯片在各种用户场景下的表现4、参与芯片生命期维护工作,解决芯片在应用中出现的各类问题 职位要求 1、本科及以上学历,计算机、电子、软件等相关专业,熟悉主流服务器系统架构和软硬件技术栈,熟悉云计算场景下的关键业务应用特征,理解数据中心对各类SoC芯片的需求,5年以上数据中心芯片软件研发经验2、具备良好的计算机体系结构基础,熟悉软硬件结合的系统开发和优化方法,丰富的芯片级软件开发调试经验3、精通以下一个或多个软件领域:操作系统、设备驱动、虚拟化和云基础设施、安全技术、RAS/监控/芯片稳定性保障、大数据应用栈、数据库技术、多媒体编解码应用栈、AI和大模型技术栈、内核/用户态网络及RDMA技术、存储技术栈4、良好的沟通、文档和团队协作能力5、以下经验是加分项: - 同时具备ARM和x86服务器研发经验 - GPGPU/NPU或AI基础设施研发经验 - 熟悉CUDA软件栈 - DPU研发经验 - 主流开源社区经验 - Java程序/JVM调优经验 - 二进制翻译/编译器相关研发经验 投递...
SoC系统软件工程师/专家 杭州、上海 全职 研发 - 电子 / 半导体 职位描述 职位描述1、负责芯片BSP/驱动等底层软件设计开发;2、负责硅前硬件仿真平台上的软硬件联调验证,硅后芯片Bring-up;3、负责RISC-V服务器平台数据中心应用分析和优化,如大数据 存储 数据 虚拟化计算等应用场景移植适配和产品化应用;4、负责RISC-V软硬件生态构建; 职位要求 职位要求1、计算机相关专业,本科及以上学历,5年以上相关工作经验;2、熟练掌握Linux内核驱动开发调试,熟悉Debug/Trace的工具与技术,具备内核调优能力;3、熟悉数据中心和云场景下典型应用,如存储 大数据和数据,具备TOP-DOWN分析的视野和能力;4、符合以下要求其中一条或以上:a、熟悉RISC-V SOC体系架构,熟悉片上互联,IOMMU,低功耗等模块,熟悉各模块对应的Linux内核驱动和内核代码;b、熟悉常见高速接口,包括PCIe/DDR/USB/CXL/高速以太网/RDMA/MIPI/display port,熟悉接口Linux内核驱动和底层硬件问题分析定位;c、有RISC-V BootROM开发经验,熟悉RISC-V Bringup流程,熟悉UEFI/opensbi优先;d、熟悉Linux网络子系统或RDMA软件栈;e、熟悉互联网或云计算软硬件生态,有RISC-V软硬件生态构建相关经验者。加分项:1、有参与过实际的芯片研发项目,特别是云端服务器场景的芯片项目,熟悉芯片架构和开发流程;2、熟悉FPGA/ZeBu/Palladium等硬件仿真平台的使用和调试。 投递...
机器学习系统研发工程师-2027 届 上海、北京 校招 正式 互联网 / 电子 / 网游 - 研发 2027届校园招聘 职位描述 1. 参与 MiniMax 机器学习平台的研发,设计和实现机器学习相关的基础设施/算法框架/工具链等,关注机器学习研发过程的稳定性、资源利用率等问题;2. 基于机器学习系统、云原生、云计算架构等多个角度做技术问题解决和探索;3. 覆盖机器学习系统多个子方向领域的工作,包括:资源调度、任务编排、模型训练、模型管理、数据集管理、工作流编排、ML for System等; 职位要求 1. 熟悉Linux平台下的分布式系统的开发及运维;2. 具有Golang/Python/C/C++等一种高级语言开发经验;3. 熟悉计算机组成、操作系统原理;4. 熟悉分布式系统原理,参与过大规模分布式系统的设计、开发和维护优先;5. 熟悉容器技术,具有Docker、Kubernetes开发或使用经验6. 有机器学习平台研发经验, 有大规模训练任务和推理服务的编排、在离线混部及资源调度经验者优先7. 了解 Pytorch/Tensorflow/JAX/PaddlePaddle/Mindspore等机器学习框架、GPU/NPU/ARM等最新异构计算系统与架构、RDMA高性能网络, 有相关系统研发经验者优先 投递...
具身大模型训练框架工程师-觅蜂子公司 上海 校招 正式 技术族 - 算法类 职位 ID:A83406 职位描述 可以选择以下一个或多个方向深入参与:建设具身智能统一训练框架,支撑 VLA、世界模型、分层决策模型等具身基础模型的预训练与后训练,覆盖从十亿级到百亿 / 千亿级参数规模,并面向 300B+ 模型持续演进。建设大规模分布式训练系统,包括数据并行、张量并行、流水线并行、混合并行、MoE、长上下文、低精度训练与推理等,支撑万卡 GPU 集群上的稳定训练。建设规模化后训练与强化学习系统,涵盖模仿学习、在线 / 离线 RL、真机 RL,以及云端训练 + 边缘异步 rollout 的云边协同架构。建设训练效率优化体系,围绕数据、计算、异步、通信全链路进行度量与优化,包括 IO、算子融合、CUDA Graph、计算通信 overlap、梯度同步、性能 profiling 等。与算法团队协作,快速复现并工程化落地 VLA、世界模型、flow matching、RL 等前沿算法。 职位要求 计算机基础扎实,学习能力强,愿意深入复杂系统和底层细节。代码能力强,代码品味好,能熟练使用
多模态Infra负责人 急招 北京 社招 全职 技术 - 基础架构 职位 ID:A64486 职位描述 1. 负责多模态训练基础设施的整体架构设计与技术规划,主导Infra方案的落地实施;2. 搭建并优化大规模训练系统,确保千/万卡级别集群的高效稳定运行;3. 主导训练框架的选型、优化与二次开发,持续提升训练效率与资源利用率;4. 带领团队解决训练过程中的系统瓶颈问题,包括通信、存储、调度等关键环节;5. 与算法团队紧密协作,推动训练流程的工程化与自动化建设。 职位要求 1. 本科及以上学历,计算机、软件工程等相关专业,有大规模训练项目经验;2. 深入理解大模型预训练原理,熟悉Transformer架构及主流大模型训练流程;3. 精通分布式训练原理,熟悉Megatron-LM、FSDP等主流分布式训练框架;4. 熟悉GPU集群架构、高性能网络(RDMA/InfiniBand)、并行存储系统;5. 熟悉NCCL/Gloo等通信库原理,有通信优化经验;6. 具备较强的技术视野和团队管理能力,能够带领团队攻克技术难题。加分项1. 有开源社区贡献或技术影响力。 投递...
At Roche you can show up as yourself, embraced for the unique qualities you bring. Our culture encourages personal expression, open dialogue, and genuine connections, where you are valued, accepted and respected for who you are,
RDMANIC架构师 北京、上海、杭州、中国香港 全职 互联网 / 电子 / 网游 - 研发 职位描述 1、关注RDMA NIC、SmartNIC/DPU、RoCEv2、InfiniBand及GPU Direct通信技术,判断AI集群网络对吞吐、时延、扩展性和可靠性的演进需求;2、定义NIC端到端产品架构,包括PCIe主机接口、DMA与地址转换、收发数据通路、队列与完成机制、RDMA传输、拥塞控制、虚拟化、安全隔离和可观测性;3、建立面向训练、推理和存储负载的性能模型,量化带宽、时延、队列、缓存及PPA约束,识别跨主机、芯片和网络的系统瓶颈;4、驱动架构规格和验证方案落地,协同ASIC、固件、驱动、操作系统及AI通信软件,完成前后仿真、芯片Bring up和规模化系统调优。 职位要求 1、网络适配器及RDMA协议架构能力:深入理解QP、MR、WQE、CQE、Doorbell和RDMAVerbs,掌握Read/Write/Send、Atomic、Ordering、ACK/Retry、丢包恢复以及PFC、ECN、DCQCN等流控与拥塞控制机制;2、主机互联、DMA与虚拟化能力:熟悉PCIe、DMA Engine、Descripptor、MSI-X、IOMMU、ATS/PASID和SR IOV,能够定义地址转换、内存保护、设备虚拟化、缓存与一致性边界及多租户隔离方案3、芯片微架构与软硬件协同能力:能够划分TX/RX、队列管理、调度、缓存和内存访问等模块,完成性能、面积、功耗权衡;理解固件、Linux RDMA驱动及通信库边界,具备仿真建模和前后硅调试能力。 投递...
AI Infra实习生(日常实习) 北京 实习 研发 - 基础架构 千寻智能2025年秋季校园招聘项目 职位描述 1、负责构建支撑具身智能体的核心机器学习系统,开发面向机器人场景的VLA大模型训练与推理系统,支撑多模态感知、运动控制、任务规划等核心能力的持续进化;2、研发新一代具身智能系统工具链,涵盖数据采集、仿真训练、物理部署、持续优化全生命周期。 职位要求 1、计算机、人工智能、软件工程等相关专业,硕士及以上学历,2026年及之后毕业; 2、熟练使用C++/Python/Pytorch/CUDA开发生态,具有嵌入式系统开发经验者优先;3、能至少保障3个月以上的实习时间,每周4天以上出勤;4、加分项:在以下一个或多个领域有深度实践: a. 大模型训练推理:多模态大模型分布式训练、端上推理加速、Transformer模型优化; b. 高性能计算:GPU Kernel编写,高性能通信(NCCL、RDMA),AI编译器(TVM、Triton),模型量化等; c. 机器人系统:ROS2、运动控制算法、传感器数据处理pipeline。 投递...
高级存储工程师 惠州 全职 职位描述 1. 全栈存储运维管理对象存储、块存储、分布式存储、云存储(AWS S3/阿里云OSS)及高性能存储(Lustre/GPFS),涵盖部署、监控、调优与故障处理针对传统业务与HPC场景(CAE仿真/AI训练)优化存储架构,提升IO效率与资源利用率2. 性能与可靠性保障建立跨平台监控体系,分析IOPS/延迟/吞吐量等指标,实施QoS策略与负载均衡设计PB级数据容灾方案,包括备份恢复、多活架构及超算存储容灾标准3. 技术演进规划推动混合云/多云存储落地,探索超算与云存储融合架构(如热数据分级迁移)研究存储新技术(软件定义存储/STaaS/NVMe-oF)并推动试点 职位要求 1. 5年以上存储运维经验,含2年超算/HPC存储管理(Lustre/GPFS/BeeGFS)2. 精通以下至少两个领域:云存储集成(Terraform/AWS EBS)、HPC优化(MPI-IO调优/RDMA网络/元数据扩展)、容灾方案(Veeam/异地多活)3. 熟练使用Python/Shell实现运维自动化优先条件:1. 有PB级存储集群管理经验,熟悉超算硬件(DDN/HPE Apollo)2. 持云平台存储认证(AWS/Azure)或HPC认证(Intel HPC Academy)3. 熟悉容器存储(Kubernetes CSI)及AI训练数据管道 投递...
智驾训练平台研发工程师 上海 全职 职位描述 1、岗位概述负责智驾端到端大模型训练平台建设与迭代,覆盖训练任务调度、MLOps/数据闭环、训练性能优化与可观测,面向千卡级GPU集群,支撑大规模分布式训练(PyTorch/NCCL)高效、稳定、低成本运行。2、岗位职责调度与资源:设计实现AI训练场景集群调度(K8s/Volcano/自研);落地Gang、队列、优先级、配额、多租户隔离;建设GPU/网络拓扑感知调度(NVLink/RDMA)及vGPU等细粒度资源分配。训练平台与闭环:建设实验管理、训练/评测流水线、模型注册与发布、版本回滚;统一镜像与制品管理;打通数据版本一训练+评测一反馈闭环,保障可复现与全链路追溯。性能与可观测:推动训练框架集成与性能优化(混合精度等);建Metrics/Logs/Traces,完善告警、容量评估与故障定位;治理0OM、训练卡住、GPU利用率低等问题。 职位要求 1、本科及以上,计算机相关专业。精通Golang,熟悉Python(Shell优先)良好的API设计、测试与文档习惯,能跨团队推进需求。2、精通K8s,理解Pod资源模型、调度与队列;熟悉Docker、镜像仓库;有调度/批处理/工作流平台经验。3、熟悉PyTorch训练链路;了解分布式训练与GPU资源治理;熟悉MySQL/TiDB、Redis、对象存储。 投递...
We are looking for Engineers to join NVIDIAs network R&D team. NVIDIA is a fast-growing company with positive energy that emanates from our team members internal aim to develop, market, sell, and support cutting-edge products and