资深运维开发工程师 热招 上海 全职 研发 职位描述 我们正在寻找一位兼具 稳定性治理能力 与 运维开发能力 的资深工程师,加入云端 SRE 团队,负责支撑业务增长阶段下的多云、多集群云原生基础设施稳定运行与持续优化。你将面向业务增长带来的稳定性、性能、容量和成本挑战,参与 Kubernetes 集群治理、Elasticsearch 等关键基础组件优化、线上故障治理、容量规划和变更风险控制。同时,你也将推动自动化运维平台和工具链建设,将线上问题沉淀为平台能力、工程规范和长期机制,提升研发、数据、安全、合规等团队的协作效率。1. 稳定性治理:负责云端基础设施及关键基础组件的稳定性建设,定位并解决线上性能瓶颈、容量风险和可用性问题,保障业务系统稳定运行;2. 性能优化:针对 Elasticsearch 等核心组件开展性能调优、容量评估、资源治理和架构优化,提升系统吞吐、查询效率和服务可靠性;3. 云原生基础设施:负责 Kubernetes 集群及 CNCF 云原生生态组件的日常运维、架构优化和稳定性提升,支撑并保障多个 Kubernetes 集群的可靠运行;4. 多云平台治理:参与阿里云 ACK、AWS EKS、GCP GKE 等多云托管 Kubernetes 环境的运维、治理和优化,提升多云环境下的可观测性、弹性、成本效率和运维一致性;5. 故障与变更管理:负责线上告警处理、故障应急、根因分析、复盘改进和生产变更管理,建立可持续的稳定性改进机制;6. 自动化与平台建设:开发和维护自动化运维平台、工具链和流程系统,提升发布、变更、巡检、告警、权限、资源交付等环节的自动化水平;7. 跨团队协作:与后端研发、数据、安全、合规等团队紧密协作,推动基础设施问题定位、流程规范、权限治理、合规要求和稳定性改进落地。 职位要求
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
运维开发工程师 武汉、西安、上海 校招 正式 运维类 2027届校园招聘计划 职位描述 岗位描述: 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps 和 Google SRE的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 任职要求: 1、熟练C/C++/Java/【Go】至少一种编程语言,有Ruby/Python/Bash经验更好;2、熟悉Linux/Unix系统/【K8s 生态】;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括: 产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...
大模型系统研发工程师-应届生-TOP Talent 上海、北京 校招 正式 互联网 / 电子 / 网游 - 研发 MiniMax Top Talent人才计划 职位描述 部门介绍:https://vrfi1sk8a0.feishu.cn/wiki/HQq7wUuO3i2uKskL93jcCPCnnVg这是一个面向关键大模型系统演进的核心岗位,如果你对性能调优、极致可扩展性、系统稳定性有偏执般的追求,我们在这里等你:(对下列任意一个方向感兴趣即可投递)1. 参与构建高性能、高可用的大规模分布式训练与推理系统,支撑万卡规模的高效稳定训练,面向数万卡、多集群部署场景下的在线推理系统进行极致优化。系统需在低延迟、高吞吐、强鲁棒性之间取得工程最优解,将硬件性能榨取到极致,承载模型从训练到上线全流程的性能闭环。2. 参与性能相关的算法问题的解决,追求优化算法的实际落地和一定程度的可解释性。针对算法与工程的复合问题,可以在架构上给出能达到上限的解决方案。在算法上完成足够解决或者解释问题的实验。3. 在机器学习系统、云原生架构、编排调度、资源调优等多个技术方向持续攻坚,推动系统架构在规模化和复杂性中的不断演进。你需要具备系统视角和极强的工程实现能力,能够在跨层级、跨组件的协同中识别瓶颈、重构路径、突破边界。4. 参与自建公司级机房、SRE&Devops体系建设,保障多个核心系统的可靠性,包括但不限于GPU/CPU资源、存储、高性能网络研发、业务网关接入、组件稳定性、成本优化等方向 职位要求 1. 理工科背景,包括但不限于计算机科学与技术、软件工程、电子信息、数学、物理等;2. 扎实的计算机基础,具备优秀的工程实现能力和良好的代码风格;3. 理解深度学习基本原理,有相关系统的二次开发经验者优先;4. 对技术充满热情与好奇,具备责任心与良好的自驱力。加分项:1. 在相关竞赛中取得优异成绩(如 OI、MO、PhO、ICPC、CCPC、ASC、ISC、CHO、BO 等);2. 具有突出的开源项目贡献或社区参与经历。 投递...