AI算力平台后端开发实习生 上海 实习 职位描述 负责公司AI算力平台的业务后端开发,构建高性能、可扩展的AI任务调度与资源管理服务,支撑大规模模型训练与推理业务的稳定运行。工作职责:1. AI算力平台后端研发:基于Java技术栈,设计并实现面向AI算力资源的管理、调度、监控等核心业务系统,打造高可用、高吞吐的后端服务。2. 任务调度引擎开发:构建统一的AI任务调度引擎,支持训练、推理、数据处理等多种作业类型的生命周期管理,实现资源配额、优先级、排队等调度策略。3. 算力资源管理:设计与开发异构算力(GPU、NPU、CPU)资源的抽象、分配、回收及计量系统,支持多租户场景下的资源隔离与动态调配。4. 推理服务集成与优化:协同底层引擎团队,将vLLM、TensorRT-LLM等推理框架以标准化的服务形式接入平台,实现推理服务的快速部署、弹性伸缩与性能调优。5. 多集群调度能力:构建跨数据中心、跨云的多集群统一调度后端,支持全局算力编排与联邦资源视图。6. 平台可观测性:设计并实现平台的监控、告警、审计与计量计费系统,保障平台稳定运营。7. 架构演进:结合业务发展,持续优化后端架构,解决高并发、大数据量下的性能瓶颈,推动平台技术栈演进。 职位要求 1. 基础能力:计算机、人工智能、数学、通信等相关专业,本科及以上学历,有后端开发经验。2. Java功底:扎实的Java编程能力,熟悉JVM原理、并发编程、网络编程、内存模型,有良好的数据结构和算法基础。3. 主流框架:熟练掌握Spring Boot / Spring Cloud框架,熟悉微服务架构设计,有实际的项目经验。4. 数据库与中间件:熟悉MySQL、PostgreSQL等关系型数据库,有Redis、Kafka、RabbitMQ等中间件的使用经验,理解分布式系统的基本原理。5. 分布式系统经验:有分布式系统设计或开发经验,理解CAP、一致性、负载均衡等概念,有高并发系统的实际调优经验。6. 调度系统理解:了解至少一种调度系统(如Kubernetes、Volcano、YARN、Mesos或自研调度器)的基本原理,对任务排队、资源分配、优先级抢占等机制有认知。7. AI领域知识:对AI训练、推理的基本流程有认知,了解GPU等异构计算资源的特性,能与算法、运维团队高效协作。8. 学习与沟通:有较强的学习能力和自驱力,善于跨团队沟通协作,能推动问题解决。加分项- 有Kubernetes或Volcano的二次开发或深度使用经验,熟悉Operator/Controller编程模式。- 有AI平台或大数据平台(如Kubeflow、MLflow、Airflow)的后端开发经验。- 有vLLM、SGLang、TensorRT-LLM等推理框架的使用或集成经验。- 有资源调度算法或队列管理(如多级队列、Fair Share、DRF等)的实践经验。- 有多租户计费、配额管理、审计系统的开发经验。 投递...