AI算力平台后端开发实习生 上海 实习 职位描述 负责公司AI算力平台的业务后端开发,构建高性能、可扩展的AI任务调度与资源管理服务,支撑大规模模型训练与推理业务的稳定运行。工作职责:1. AI算力平台后端研发:基于Java技术栈,设计并实现面向AI算力资源的管理、调度、监控等核心业务系统,打造高可用、高吞吐的后端服务。2. 任务调度引擎开发:构建统一的AI任务调度引擎,支持训练、推理、数据处理等多种作业类型的生命周期管理,实现资源配额、优先级、排队等调度策略。3. 算力资源管理:设计与开发异构算力(GPU、NPU、CPU)资源的抽象、分配、回收及计量系统,支持多租户场景下的资源隔离与动态调配。4. 推理服务集成与优化:协同底层引擎团队,将vLLM、TensorRT-LLM等推理框架以标准化的服务形式接入平台,实现推理服务的快速部署、弹性伸缩与性能调优。5. 多集群调度能力:构建跨数据中心、跨云的多集群统一调度后端,支持全局算力编排与联邦资源视图。6. 平台可观测性:设计并实现平台的监控、告警、审计与计量计费系统,保障平台稳定运营。7. 架构演进:结合业务发展,持续优化后端架构,解决高并发、大数据量下的性能瓶颈,推动平台技术栈演进。 职位要求 1. 基础能力:计算机、人工智能、数学、通信等相关专业,本科及以上学历,有后端开发经验。2. Java功底:扎实的Java编程能力,熟悉JVM原理、并发编程、网络编程、内存模型,有良好的数据结构和算法基础。3. 主流框架:熟练掌握Spring Boot / Spring Cloud框架,熟悉微服务架构设计,有实际的项目经验。4. 数据库与中间件:熟悉MySQL、PostgreSQL等关系型数据库,有Redis、Kafka、RabbitMQ等中间件的使用经验,理解分布式系统的基本原理。5. 分布式系统经验:有分布式系统设计或开发经验,理解CAP、一致性、负载均衡等概念,有高并发系统的实际调优经验。6. 调度系统理解:了解至少一种调度系统(如Kubernetes、Volcano、YARN、Mesos或自研调度器)的基本原理,对任务排队、资源分配、优先级抢占等机制有认知。7. AI领域知识:对AI训练、推理的基本流程有认知,了解GPU等异构计算资源的特性,能与算法、运维团队高效协作。8. 学习与沟通:有较强的学习能力和自驱力,善于跨团队沟通协作,能推动问题解决。加分项- 有Kubernetes或Volcano的二次开发或深度使用经验,熟悉Operator/Controller编程模式。- 有AI平台或大数据平台(如Kubeflow、MLflow、Airflow)的后端开发经验。- 有vLLM、SGLang、TensorRT-LLM等推理框架的使用或集成经验。- 有资源调度算法或队列管理(如多级队列、Fair Share、DRF等)的实践经验。- 有多租户计费、配额管理、审计系统的开发经验。 投递...
Flex is the diversified manufacturing partner of choice that helps market-leading brands design, build and deliver innovative products that improve the world. A career at Flex offers the opportunity to make a difference and invest in
K8S研发工程师-集群管理方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。二、为什么这个岗位重要Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。三、你将负责什么1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。 职位要求 四、我们期望你具备1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。2. 至少熟练掌握 Go、Python、Java、C++ 中一门语言,能够独立完成编码、调试与测试;coding