Refine Reset All
Sort by
Location
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Controller Java Jobs In China - 3 Job Positions Available

Top Cities:
1 – 3 of 3 jobs
智元创新(上海)科技有限公司 jobs

AI算力平台后端开发实习生 上海 实习 职位描述 负责公司AI算力平台的业务后端开发,构建高性能、可扩展的AI任务调度与资源管理服务,支撑大规模模型训练与推理业务的稳定运行。工作职责:1. AI算力平台后端研发:基于Java技术栈,设计并实现面向AI算力资源的管理、调度、监控等核心业务系统,打造高可用、高吞吐的后端服务。2. 任务调度引擎开发:构建统一的AI任务调度引擎,支持训练、推理、数据处理等多种作业类型的生命周期管理,实现资源配额、优先级、排队等调度策略。3. 算力资源管理:设计与开发异构算力(GPU、NPU、CPU)资源的抽象、分配、回收及计量系统,支持多租户场景下的资源隔离与动态调配。4. 推理服务集成与优化:协同底层引擎团队,将vLLM、TensorRT-LLM等推理框架以标准化的服务形式接入平台,实现推理服务的快速部署、弹性伸缩与性能调优。5. 多集群调度能力:构建跨数据中心、跨云的多集群统一调度后端,支持全局算力编排与联邦资源视图。6. 平台可观测性:设计并实现平台的监控、告警、审计与计量计费系统,保障平台稳定运营。7. 架构演进:结合业务发展,持续优化后端架构,解决高并发、大数据量下的性能瓶颈,推动平台技术栈演进。 职位要求 1. 基础能力:计算机、人工智能、数学、通信等相关专业,本科及以上学历,有后端开发经验。2. Java功底:扎实的Java编程能力,熟悉JVM原理、并发编程、网络编程、内存模型,有良好的数据结构和算法基础。3. 主流框架:熟练掌握Spring Boot / Spring Cloud框架,熟悉微服务架构设计,有实际的项目经验。4. 数据库与中间件:熟悉MySQL、PostgreSQL等关系型数据库,有Redis、Kafka、RabbitMQ等中间件的使用经验,理解分布式系统的基本原理。5. 分布式系统经验:有分布式系统设计或开发经验,理解CAP、一致性、负载均衡等概念,有高并发系统的实际调优经验。6. 调度系统理解:了解至少一种调度系统(如Kubernetes、Volcano、YARN、Mesos或自研调度器)的基本原理,对任务排队、资源分配、优先级抢占等机制有认知。7. AI领域知识:对AI训练、推理的基本流程有认知,了解GPU等异构计算资源的特性,能与算法、运维团队高效协作。8. 学习与沟通:有较强的学习能力和自驱力,善于跨团队沟通协作,能推动问题解决。加分项- 有Kubernetes或Volcano的二次开发或深度使用经验,熟悉Operator/Controller编程模式。- 有AI平台或大数据平台(如Kubeflow、MLflow、Airflow)的后端开发经验。- 有vLLM、SGLang、TensorRT-LLM等推理框架的使用或集成经验。- 有资源调度算法或队列管理(如多级队列、Fair Share、DRF等)的实践经验。- 有多租户计费、配额管理、审计系统的开发经验。 投递...

Premium Full-time Spring
智元创新(上海)科技有限公司  28 days ago
Flex jobs

Flex is the diversified manufacturing partner of choice that helps market-leading brands design, build and deliver innovative products that improve the world. A career at Flex offers the opportunity to make a difference and invest in

Flex  13 days ago
MiniMax jobs

K8S研发工程师-集群管理方向 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。二、为什么这个岗位重要Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。三、你将负责什么1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。 职位要求 四、我们期望你具备1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。2. 至少熟练掌握 Go、Python、Java、C++ 中一门语言,能够独立完成编码、调试与测试;coding

MiniMax  12 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

controller java

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Location
Job Type
Employer/Recruiter