Refine Reset All
Sort by
Employer/Recruiter
Salary Estimate
Date Posted
Company
Location
Job Type
Employer/Recruiter
Salary Estimate
All Filters

Sre Jobs In China - 69 Job Positions Available

1 – 20 of 69 jobs
Momenta jobs

运维开发/SRE实习生 北京、苏州 实习 互联网 / 电子 / 网游 日常实习生 职位描述 岗位职责:1、负责各产品线服务的稳定、高效运行,跟踪用户体验,优化运维架构;2、及时响应各类故障报警,快速解决问题恢复业务; 职位要求 岗位要求:1、计算机相关专业,就读于211/985院校,可稳定工作6个月及以上,每周出勤不少于4天;2、熟练掌握 Linux 基本操作和相关命令,了解 Linux 操作系统基本原理;3、熟悉 Elk、Prometheus、Grafana 等监控日志工具使用;4、熟悉虚拟化和容器技术,如 Esxi、Docker、Kubernetes,了解其原理并能够熟练配置;5、熟悉 Python 开发及常用 web 框架的使用,如 Flask、SQLAlchemy 等,能够熟练进项项目编码;6、对 Kubernetes 有深入了解者优先 投递...

Momenta  27 days ago
DXC Technology jobs

SRE

Job Description: • 具备大型数据平台及云环境(如Azure、AWS、Snowflake、Databricks)架构和管理经验,具备敏捷、DevOps和DataOps实践的实际知识。 • 熟练使用容器化和云自动化工具(Docker、Kubernetes、Terraform等),并对数据生命周期管理和数据治理最佳实践有深刻理解。 • 云计算平台(如AWS、Azure、GCP) • 基础设施即代码(IaC)工具(如 Terraform、CloudFormation) • Kubernetes和容器化(例如Docker) • CI/CD工具(例如,Jenkins、GitLab CI、GitHub Actions) • 脚本和编程语言(例如 Python、Go 语言) • 系统架构与设计 • 解决问题和故障排除 • 沟通与协作 At DXC Technology, we believe strong connections and community

DXC Technology  25 days ago
Z.ai jobs

AI院-GLM团队-SRE运维工程师 北京 全职 研发 - 运维 职位描述 岗位职责:1.负责TOC相关业务的稳定性建设,包括但不限于Web服务、APP后端、API网关2.负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、资源利用率优化3.设计高可用架构,解决APIServer性能瓶颈、etcd存储压力等大规模集群特有问题。4.主导容器化架构调优(如Pod调度策略、网络插件选型、存储方案设计),优化资源请求/限制配置以减少资源争用。5.建立容器安全防护体系,包括漏洞扫描、运行时安全监控(如Falco)、合规审计。5.深度参与自动化运维工具链建设,CI/CD流水线混沌工程测试、智能扩缩容(HPA/VPA)推动Al0ns落地,其于时字数据合析预洲售群负裁并实现自愈。7. 解决生产环境疑难问题(如 OOM、网络延迟、存储性能瓶颈),输出标准化SOP文档车8.协同研发团队优化微服务架构,推动ServiceMesh等新技术落地, 职位要求 1.教育背景-统招本科及以上学历,计算机、软件工程、云计算相关专业优先。2.工作经验-3年以上容器运维经验,主导或深度参与过千级 Pod规模的集群维护。-熟悉生产环境容器化全生命周期管理,包括部署、监控、扩缩容、故障恢复等场景。-有多云环境/混合云管理经验-头部互联网/云计算大厂优先3.技术能力精通Kubernetes架构及生态工具(如Etcd、Calico、Istio),具备集群性能调优经验(如APIServer负载均衡、节点调度优化);熟练使用Docker、Prometheus、Grafana、ELK、CI/CD等工具链,熟悉云原生安全体系(如镜像扫描、RBAC策略、网络策略);具备运维开发能力,能使用Python/Go开发自动化工具(如自定义Operator、监控告警脚本)。 投递...

Z.ai  21 days ago
Z.ai jobs

MaaS-SRE/DBA 北京 全职 互联网 / 电子 / 网游 职位描述 【岗位职责】1. 稳定性保障(核心):负责MySQL、Redis等核心存储组件的稳定性,建设全方位的监控告警体系(Prometheus/Grafana),实现故障的早发现、快止损,保障MaaS平台在高并发场景下的99.99%可用性。2. 架构治理与演进: 主导数据库架构升级,包括读写分离、冷热分离、分库分表及异地多活(双活)容灾体系的建设。3. 深度调优与质量管控: 建立标准化的SQL审核与发布流程,负责慢 SQL 治理、大表治理及数据库参数深度调优,解决数据库性能瓶颈。4. 自动化平台建设: 基于SRE理念,开发数据库自动化运维平台(Python/Go),实现备份恢复、高可用切换、自动扩缩容及账号权限管理的自动化。5. 应急响应与预案: 负责突发故障(如宕机、带宽拥塞)的应急响应,制定并定期演练标准化恢复预案(SOP),降低故障平均恢复时间(MTTR)。6. 容量规划与成本管理: 结合业务增长模型进行容量预测与压测,优化资源利用率,制定降本增效策略。【岗位要求】1. 学历与经验: 本科及以上学历,计算机相关专业;3 年以上大规模互联网数据库管理(DBA)或 SRE 经验,有高并发、大流量系统保障经验者极佳。2. 数据库精通: 精通 MySQL 原理(InnoDB 引擎、事务锁机制、索引优化、主从复制),精通 Redis(集群模式、缓存一致性、热 Key/大 Key 处理);熟悉其高可用架构(MHA/Orchestrator/Sentinel/Cluster)。3. SRE 与编程能力: 具备良好的编码能力,熟练掌握

Z.ai  21 days ago
小米科技 Xiaomi Technology jobs

SRE实习生-2027届 南京 校招 实习 软件研发类 职位描述 1、负责小米各业务的SRE工作,比如AIoT、小米商城、互联网业务、小米手机核心应用、视频技术等2、工作涵盖容量管理、灾备管理、活动重保、日常Oncall、troubleshooting、业务巡检、故障预案、架构优化、技术运营等;3、与DEVS共同设计产品后端架构,实现分布式、全球集群化运维管理,制定并实施相关运维技术方案,确保服务高效、稳定的运行; 4、研发设计自动化运维工具,减少日常重复性工作,用DevOps工具化思维解决业务问题,提升运维效率; 5、通过技术手段进行成本控制及优化,通过工具化及流程提升服务管理效率。 职位要求 1、熟练至少一种编程语言:Go/Python/Bash/C/C++/Java;2、熟悉Linux/Unix系统;3、乐于分享、开源,具备服务精神,良好的沟通能力和团队合作精神;4、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time
小米科技 Xiaomi Technology  19 days ago
Bambu Lab jobs

SRE工程师 热招 深圳 全职 研发 热招职位 职位描述 1、负责业务基础环境建设与维护,保障系统稳定运行;2、推进DevSecOps,协同安全部门落实安全要求与政策,提升企业安全水平;3、维护容器平台稳定性,完善监控与应急机制,确保故障快速定位与恢复;4、建设与优化流量治理、可观测和应急响应体系;5、通过自动化工具链与平台的构建,持续优化并提升交付效率与质量。 职位要求 1. 本科及以上学历,计算机科学、软件工程或相关专业优先;2. 3年以上系统运维/SRE/DevOps经验;有大规模容器集群管理或云环境项目经验者优先,制造业/全球分布式系统背景加分;3. 容器与编排:精通K8s,具备大规模集群管理、升级/迁移经验(如100+节点环境),熟悉Helm/Kustomize包管理;4、掌握安全集成方法,如容器安全基线(CIS Benchmarks)、CI/CD安全插件(SonarQube、Trivy)、配置管理安全(Secrets管理、RBAC);5、熟悉AWS(EKS/ECS)、阿里云(ACK)或GCP(GKE)等主流服务,包括云网络、存储与安全配置;有混合云部署经验优先;6、掌握至少一门脚本语言(如Python/Go/Shell),用于工具开发、API集成与自动化运维(如Ansible playbook、Python监控脚本);7、软性素质: - 高度责任心:对系统可靠性有强主人翁感,能主动识别风险并推动改进; - 沟通协作能力:跨团队(开发、安全、业务)高效协调,善于根因分析与问题复盘; - 应对挑战:高压环境下保持冷静,快速学习新技术,支持24/7 on-call(轮值响应)。 投递...

Bambu Lab  15 days ago
Momenta jobs

SRE运维工程师 北京、苏州、上海 全职 研发 - 运维 职位描述 1. 负责各产品线服务的稳定、高效运行,跟踪用户体验,优化运维架构;2. 推动运维自动化/标准化方案设计,自动化工具及平台研发,提升运维效率;3. 及时响应各类故障报警,快速解决问题恢复业务; 职位要求 1. 计算机相关专业,五年以上工作经验;2. 熟悉Linux操作系统,了解Linux操作系统基本原理;3. 熟悉Elk、Prometheus、Grafana等监控日志工具使用;4. 熟悉虚拟化和容器技术,如Esxi、Docker、Kubernetes,了解其原理并能够熟练配置;5. 熟悉 至少一种主流CI/CD工具(GitLab Ci/Jenkins/ArgoCD等),有大规模实践经验;6. 熟悉Python,Go中的至少一门语言,能够编写运维脚本;7. 对Kubernetes有深入了解者优先。8. 熟悉Ansible、Terraform等流行自动化运维开源工具优先;9. 强烈的工程化思维和自动化意识; 投递...

Premium Full-time
Momenta  14 days ago
Mediastorm影视飓风 jobs

SRE 工程师 18-25KCNY/月 杭州 全职 支持 大专及以上 职位描述 1. 负责服务器、网络、存储等基础设施的部署、运维、监控、故障处理与优化,保障系统稳定运行;2. 负责容量规划、性能调优和架构优化,提升系统可用性并支撑业务增长;3. 开发自动化工具和运维平台,推动配置管理、服务部署、任务编排等工作标准化、自动化;4. 维护和优化监控告警体系,提升问题发现、定位和处理效率; 5. 负责公司防火墙及 WAF 的日常运维、策略配置与持续优化,保障基础网络与应用访问安全;6. 编写和维护技术文档、操作流程及故障复盘,推动运维体系持续改进。 职位要求 1. 熟练掌握 Python、Go、Shell、Node.js 中至少一种,具备自动化开发能力;2. 熟悉 Linux 操作系统及常见网络协议,具备较强的问题排查能力;3. 熟悉 Nginx、PostgreSQL、VictoriaMetrics 等常见组件的部署、运维或调优;4. 具备防火墙或 WAF 相关运维经验,能够根据业务需求进行基础安全策略配置与优化;5. 具备良好的文档编写习惯,能够输出清晰的技术方案、架构说明、SOP 和故障复盘文档,并能熟练阅读英文技术文档。加分项1. 有开源项目贡献经验;2. 有大型系统迁移、调优或高可用建设经验;3. 有虚拟化、云原生或安全平台相关经验。

Premium Full-time Linux Waf 25,000 CNY
Mediastorm影视飓风  7 days ago
Desay SV jobs

AI 智算基础设施 SRE(集群可观测 / 存储治理 / 资源整合) 上海 全职 职位描述 1.可观测与告警:使用Prometheus、Grafana等组件、搭建集群资源监控大盘和告警机制;2.存储治理:治理分布文件系统存储、对象存储,挂载规范、目录分层、配额与容量巡检;3.集群维护: 参与集群维护、任务调度组件、监控组件日常维护与排障修复。 职位要求 1.本科及以上,计算机、网络相关专业,熟练 Shell/Python;会使用 Helm、Ansible 等做组件部署与配置管理;2.熟悉 K8s 运维:节点、Pod 资源模型、存储(PV/PVC、HostPath)、调度现象与排障;3.熟练使用 Prometheus/Grafana:PromQL、大盘设计、告警规则与运营;4.熟悉 NFS 与对象存储(S3/MinIO):AI 训练场景下的挂载、权限、容量与 IO 问题排查;5.有生产 K8s 集群运维、监控平台建设或 AI 训练集群 SRE 经验。加分项1.Ceph、Lustre、GPFS 或大规模并行文件系统经验;2.Elasticsearch、Loki、Jaeger 等组件部署调优;3.智驾 / 大规模 AI 训练基础设施背景。

Premium Full-time IO AI NFS
Desay SV  6 days ago
Li Auto jobs

AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4.

Li Auto  4 days ago
HSBC jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC  1 day ago
上海得物信息集团有限公司 jobs

【27届校招】SRE(系统可靠性工程师) 上海 正式 技术类 2027届秋季校园招聘项目 职位描述 1、负责公司业务系统运维工作,提升业务稳定性和工程效率,与业务方保持高效沟通,建立良好合作关系;2、负责应用上线评审、上线交付、配置变更、状态监控、容量管理、故障应急响应工作;3、参与业务服务端架构的高可用设计和性能优化,保证高效、可靠的业务迭代;4、负责线上重大问题排查,紧急事故处理,后续事故分析与优化;5、负责应用故障演练、应急预案、SOP手册编写工作,确保故障时业务能快速恢复;6、负责应用高可用建议及管理,包括限流、降级,容错、容灾,同城多活,确保应用质量;7、建立SLA评估标准,计算故障对SLA影响,并对SLA后续改进措施进行跟进;8、负责运维规范、流程文档编制,并将其工具化、平台化,确保运维安全,提升运维效率;9、探索 AI 在稳定性领域的应用,包括辅助故障根因分析、告警降噪运维工作智能化。 职位要求 1、2027届毕业生,本科以上学历,计算机类、软件类、通信类等相关专业优先;2、扎实的编程基础,至少掌握一门开发语言,熟悉Golang, python优先;3、对主流操作系统熟悉比如Linux,Debian等;4、熟悉容器技术、云原生;5、具备使用 AI 编程工具(如 Claude Code、Cursor)辅助开发和调试的实践经验;6、了解大模型/Agent 基本原理,对 AIOps、混沌工程自动化等方向有一定了解或探索优先。 投递...

Premium Full-time AI
上海得物信息集团有限公司  1 day ago
Xiaomi jobs

SRE工程师 武汉、北京、南京、上海 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...

Premium Full-time AI
Xiaomi  1 day ago
ZEGOCLOUD jobs

业务运维岗(SRE) 深圳 全职 互联网 / 电子 / 网游 职位描述 职位描述1. 负责实时音视频业务日常运维工作,对突发事件的快速响应、定位及处理,排除故障,保障系统稳定性;2. 负责实时音视频业务稳定性保障工作并持续优化,包括服务质量提升、架构优化、容灾预案、精细化监控、问题/故障处理及规避等;3. 负责运维工作的标准化,自动化和智能化实践;4. 负责业务系统客户问题持续跟进、分析和解决。 职位要求 职位要求1、计算机及相关专业本科及以上学历2、熟悉linux,掌握常用数据结构、算法、设计模式,熟练掌握编程语言者优先(Java、PHP、Golang、Python等)3、熟练使用shell,3-5年运维经验4、熟悉SRE的主要职责,对可用性保障工作有深刻理解和认同5、熟悉Jenkins、SaltStack、Ansible、prometheus、Grafana、ELK等主流开源软件6、对AI有一定的理解和实际场景的应用 投递...

Premium Full-time
ZEGOCLOUD  23 hours ago
HSBC Group jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC Group  1 day ago
HSBC Group jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC Group  27 days ago
HSBC Group jobs

The Opportunity The Principal Engineer in Asia & Middle East Tech (AMET) is a senior technical leader who uplifts engineering capability, efficiency and productivity across multiple teams. You’ll set technical direction, accelerate adoption of modern engineering

HSBC Group  27 days ago
HSBC Group jobs

Some careers have more impact than others. If you’re looking for a career where you can make a real impression, join HSBC and discover how valued you’ll be. We are currently seeking an experienced professional to

HSBC Group  27 days ago
NIO jobs

提前批-AI 中间件研发工程师 上海 校招 正式 数字技术 - 技术运维 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A13914 职位描述 参与搭建、优化新AI时代基础设施,深度参与AI网关、向量/图数据库、Sandbox安全隔离环境等核心中间件的开发、测试与迭代工作;完成AI基础设施的部署、调试、监控与日常运维,保障核心组件(部分自研)高可用运行,支撑公司AI原生项目(如Agent)规模化落地,践行SRE稳定性保障、成本优化等核心职责;基于现有AI基础设施,持续优化TOD内部基础设施平台,推进PaaS平台“云+AI”一体化升级,提升基础设施交付效率与可运维性;进行技术文档编写、测试用例设计、问题排查复盘等工作,助力团队形成标准化研运流程。 职位要求 2027届硕士毕业生,计算机、人工智能、软件工程等相关专业;具备扎实且深入的计算机学科基础,对操作系统、网络、数据库、分布式系统、计算机体系结构等底层原理有深刻理解;精通至少一种编程语言(Go、Java、Python优先),具备优秀的代码开发、调试及复杂问题排查能力,有高质量项目开发经验或相关开源贡献者优先;对AI基础设施、AI网关、安全沙箱、中间件等领域有浓厚兴趣,学习能力强,具备良好的沟通协作能力和团队配合意识;严谨负责,有较强的问题解决意识和自驱力,能主动跟进任务、配合团队完成各项研运相关工作;优先条件:熟悉云原生相关技术(K8s、Docker)、各类中间件(网关、数据库);有SRE相关实践或学习经历;了解Agent构建相关知识(如RAG、MCP、Skill)。 投递...

Premium Full-time
NIO  27 days ago
NIO jobs

提前批-AI 运维应用工程师 上海 校招 正式 数字技术 - 技术运维 硕士及以上 2027届校园招聘-技术提前批 职位 ID:A237832 职位描述 参与打造SRE数字分身产品,聚焦日常运维工单处理、常规运维场景自动化,参与核心功能开发、调试与性能调优,实现SRE人员能力的数字化沉淀与自动化复用;梳理SRE日常核心运维场景(如故障排查、监控告警、资源调度、变更管控),将SRE运维经验、操作规范转化为数字分身可执行的能力,提升运维自动化率并大幅提升故障处置效率;完成数字分身与现有基础设施、可观测平台(如Langfuse)的对接与联调,优化分身响应效率、准确性与稳定性,支撑SRE运维效率提升;学习AI大模型应用、自动化运维、SRE核心方法论相关技术,完成技术调研、方案验证、代码开发及相关技术文档编写。 职位要求 2027届硕士毕业生,计算机、人工智能、软件工程等相关专业;对SRE工作、数字分身、AI Agent、自动化运维等领域有浓厚兴趣,具备清晰的逻辑思维和较强的问题分析能力。掌握基础的代码开发能力,熟悉至少一种编程语言(Python、Go优先),能配合团队完成简单的功能开发、调试与联调工作。学习能力强,沟通协作良好,有责任心和自驱力,能积极参与项目讨论,主动推进任务落地。优先条件:了解大模型应用(如Prompt工程、模型微调)、自动化运维工具;有Python/Go开发经验;熟悉SRE核心工作流程或有相关实践经历。 投递...

Premium Full-time
NIO  27 days ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

sre

You also might be interested in:

Software Engineer

AI

Associate Director

Automation

Kubernetes

研发工程师

Fostering

Software Engineering

Reliability Engineering

Python

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Employer/Recruiter
Salary Estimate