AVEVA is a global leader in industrial software. Our cutting-edge solutions are used by thousands of enterprises to deliver the essentials of life – such as energy, infrastructure, chemicals and minerals – safely, efficiently and more
AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4.
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
运维开发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 句子互动 DevOps 团队的使命是确保句子秒回和句客宝 24/7 的在不同的环境中高效和可持续性运转。以 ToB 业务为主的句子互动希望为客户提供流畅稳定的部署,使用和更新体验,这就要求 DevOps 团队能够从系统的可用性,扩张性和稳定性出发,组建和维护大规模、高可用、高效能的分布式系统,结合当下最流行的云原生技术,打造全流程自动化的体系。你需要深入句子互动各业务线,在确保基础设施在快速演进的同时,具备高可用以及扩展性,并从稳定性和效能的角度切入到业务研发,为业务研发团队提供高效的开发架构,同时通过建设完善的监控体系,保证业务系统的快速稳定迭代。岗位职责1. 参与句子 DevOps 平台的开发,以服务化、产品化的方式解决海量系统的自动化运维,故障智能定位和自修复2. 参与句子的监控系统的开发,提高监控有效性,覆盖率,提升监控系统的智能化3. 参与搭建句子 DevOps 自动化部署平台,减少因发布导致的业务可用性下降,缩短从代码提交到生产环境部署的时间周期,提高私有部署环境的搭建和维护效率 职位要求 1. 全日制本科,1 年以上工作经验,大型互联网公司或者大型IT企业应用运维经验者优先2. 熟悉 Docker 技术和对应的 PaaS 体系架构。有容器、调度相关经验或了解 Docker、Swarm、Kubernetes等相关技术3. 掌握一门服务端编程语言(Go / Java / Python
资深运维开发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述句子互动 DevOps 团队的使命是确保句子秒回和句客宝 24/7 的在不同的环境中高效和可持续性运转。以ToB业务为主的句子互动希望为客户提供流畅稳定的部署,使用和更新体验,这就要求 DevOps 团队能够从系统的可用性,扩张性和稳定性出发,组建和维护大规模、高可用、高效能的分布式系统,结合当下最流行的云原生技术,打造全流程自动化的体系。你需要深入句子互动各业务线,在确保基础设施在快速演进的同时,具备高可用以及扩展性,并从稳定性和效能的角度切入到业务研发,为业务研发团队提供高效的开发架构,同时通过建设完善的监控体系,保证业务系统的快速稳定迭代。岗位职责1. 设计和实现构建系统测试、系统部署、基础设施管理等系统2. 负责句子 DevOps 平台的设计与实现,以服务化、产品化的方式解决海量系统的自动化运维,故障智能定位和自修复3. 负责句子的监控系统的设计与实现,提高监控有效性,覆盖率,提升监控系统的智能化4. 负责设计和实现持续交付系统,减少因发布导致的业务可用性下降,缩短从代码提交到生产环境部署的时间周期,提高私有部署环境的搭建和维护效率 职位要求 1. 全日制本科,3 年以上工作经验,大型互联网公司或者大型IT企业应用运维经验者优先2. 熟悉容器技术,有大规模容器集群运维经验3. 熟悉 Shell 或 Go,熟练编写各种日常工具,熟悉常用 http 框架4. 精通 linux/unix 操作系统,熟悉 TCP/HTTP 协议,熟悉性能调优,熟悉使用相关压测,监控等工具5. 熟悉多种开源组件:Ansible、MongoDB、Haproxy、Nginx、Jenkins、Git、Elasticsearch、Redis 等6.
毕业时间:2026年9月 - 2027年6月之间毕业的应届 毕业生 工作地点:如果你希望在北京工作,请投递!(上海请搜索职位ID 10490159,深圳 10490165) · 投递须知: 1 填写简历申请时,请把必填和非必填项都填写完整。提交简历之后就无法修改了哦! 2 学校的英文全称请准确填写。中英文对应表,请点击链接查看 https://docs.qq.com/sheet/DVmdaa1BCV0RBbnlR?tab=BB08J2 3 简历不限中英文。 At Amazon Web Services (AWS), we are working to be the most customer-centric company on earth. To get there, we
NVIDIA is looking for Senior Solutions Architect in Beijing. This position is mainly responsible for providing comprehensive technical pre-sales support to CRISP customers. We are dedicated to the most cutting-edge computing hardware and software, leading the
整车控制器系统需求工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 对标与需求定义:负责整车控制器平台及趋势的对标分析、功能部署定义及业务划分,以及原始需求、系统需求、软硬件需求的收集、编写、分析与评审;2. 跨维度需求拆解:从智能驾驶、车辆控制、AI 算法、芯片、服务器等多维度拆解系统级需求,制订专业且灵活的系统级解决方案,覆盖底层功能定义与分配、通讯、诊断、功能安全、信息安全、资源配置、车云协同等方向;3. 系统架构与方案设计:牵头或深度参与整车控制器平台的系统架构设计、技术选型与技术方案研究,并推动落地实施;能与技术团队进行深度技术讨论(不需要写代码,但要理解方案取舍),同时能向非技术方清晰阐述产品价值;4. 开发交付闭环:负责系统需求的设计、开发、测试及 Jira 问题全闭环,管理控制器平台产品开发全生命周期,在高迭代节奏中平衡「快速交付」与「工程质量」;5. 跨团队协同对齐:对接软件架构、硬件、软件、测试 Team,以专题形式快节奏对齐各专业认知,形成共识;负责产品系统需求的解释与澄清拉齐;6. 需求体系建设:建设和维护控制器平台产品需求体系,持续对软、硬件架构设计提出系统性约束与建议,推动迭代质量提升;7. AI 领军:感知前沿 AI 发展,利用 AI 打破现有约束、构建 AI 虚拟团队,基于 LLM 设计高鲁棒性的多 Agent系统,探索记忆管理与上下文优化规则,重构现有系统工作流程。 职位要求 1. 基础背景- 本科及以上学历,人工智能、计算机、电气工程、自动化、机电一体化、车辆工程、电子、软件工程等相关专业;- 3年以上汽车电子系统或AI
系统运维工程师 北京 全职 金融 - 互联网金融 职位描述 保障生产环境系统网络的高可用性,确保业务稳定运作,迅速定位并解决故障。设计与开发自动化运维工具,推进运维工作的标准化、流程化与自动化,减少人工干预,降低误操作风险,提升运维工作效率。依据业务需求和技术发展趋势,设计具备高可靠性与可扩展性的系统网络架构方案,并持续优化现有架构以支持业务增长。评估系统性能和运行状态,建立量化指标,以数据为导向优化架构,提高资源利用率,降低成本。搭建运维管理平台,推动基础设施即代码和DevOps实践的实施。 具备强烈的责任心、自我驱动力强,关注细节,追求卓越。 职位要求 具备五年以上运维/DevOps工作经验,其中至少两年以上架构设计或运维开发经验,计算机相关专业者优先;熟练掌握Python、Shell,熟悉Django/Flask等框架,能够独立开发运维工具;熟练掌握Linux系统管理,熟悉内核调优、性能分析、安全加固等工作;熟练掌握虚拟化(KVM/VMware)、Docker、Kubernetes,具备大规模容器化集群管理经验;能够熟练运用负载均衡技术(HAProxy、Nginx、Keepalived、Pacemaker);具备两年网络维护经验。熟悉主流厂商路由器、交换机、防火墙配置,熟悉公有云网络相关服务。具备较强的排错能力,可以通过抓包分析定位业务问题。拥有高并发低时延系统网络架构设计经验,有开源社区贡献经验者优先;熟悉阿里云、华为云或者AWS 等云平台各类产品使用和维护管理工作优先。 投递...
后台开发实习生 北京 实习 数字技术 职位 ID:A238579 职位描述 职位描述:1. 负责智能辅助驾驶CICD平台的实现和交付,负责CICD平台日常维护;2. 参与测试拦截系统和测试工具及组件的设计及开发,协助测试平台的搭建及维护,提升工具平台稳定性,解决复杂业务问题;3. 负责AI相关的应用落地,探索AI在效率提升方面的应用; 职位要求 职位要求:全日制本科或硕博士在读,计算机、电气工程、自动化、汽车工程等相关专业;具备良好的编程习惯,掌握Go/python/shell等至少一种编程或脚本语言;熟悉Linux,Docker等基本操作,对主流中间件有基本了解;掌握CI/CD或devops等持续集成发布工具;逻辑思维良好,有较强的分析问题和解决问题的能力;实习时间:每周现场时间=4天;Base 北京;实习期=6个月;欢迎硕博士长期实习;欢迎27届毕业生长期实习;加分项:熟练掌握C++/C等编程;有智能辅助驾驶、互联网等方向实习经验者或热爱智能辅助驾驶者优先; 投递...
AI运维工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述1.负责公司IDC、公有云(火山云/腾讯云等)的规划、部署、监控与优化,保障业务高可用性(SLA ≥ 99.9%);2.负责管理公司GPU集群,调配训练平台资源;3.设计并实施自动化运维体系(Ansible/Terraform/Jenkins等),提升系统部署、监控告警、故障处理效率;4.维护大规模Linux服务器集群(CentOS/Ubuntu)、Kubernetes/Docker容器平台及中间件(Nginx/MySQL/Redis等)、大规模数据存储;5.建立全链路监控体系(Zabbix/Prometheus/Grafana),实时分析系统性能瓶颈,预防潜在风险;6.制定并执行容灾备份、安全加固及合规策略,响应安全事件;7.编写运维文档及技术方案,推动DevOps文化落地; 职位要求 职位要求硬性条件:1.本科及以上学历,计算机/通信相关专业,3年以上人工智能科技公司运维经验;2.具备GPU集群管理经验,了解ROS/ROS2生态;3.精通Linux系统管理、Shell/Python脚本开发,熟悉TCP/IP、HTTP等网络协议;4.熟练使用至少一种公有云(火山云/腾讯云/阿里云),有PB级存储搭建经验,具备云资源编排及成本优化经验;5.掌握容器化技术(Docker/K8s)及CI/CD工具链(GitLab/Jenkins);6.熟悉监控日志系统(ELK/Prometheus)及自动化运维工具(Ansible/SaltStack)。加分项:1.有高并发、分布式系统运维经验者优先;2.熟悉网络安全防护(WAF/防火墙/漏洞扫描);3.持有AWS/AliCloud/K8s认证证书;4.有大模型相关基础设施搭建经验;5.了解Infrastructure as Code(IaC)实践。。 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /
SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...