AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
运维开发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 句子互动 DevOps 团队的使命是确保句子秒回和句客宝 24/7 的在不同的环境中高效和可持续性运转。以 ToB 业务为主的句子互动希望为客户提供流畅稳定的部署,使用和更新体验,这就要求 DevOps 团队能够从系统的可用性,扩张性和稳定性出发,组建和维护大规模、高可用、高效能的分布式系统,结合当下最流行的云原生技术,打造全流程自动化的体系。你需要深入句子互动各业务线,在确保基础设施在快速演进的同时,具备高可用以及扩展性,并从稳定性和效能的角度切入到业务研发,为业务研发团队提供高效的开发架构,同时通过建设完善的监控体系,保证业务系统的快速稳定迭代。岗位职责1. 参与句子 DevOps 平台的开发,以服务化、产品化的方式解决海量系统的自动化运维,故障智能定位和自修复2. 参与句子的监控系统的开发,提高监控有效性,覆盖率,提升监控系统的智能化3. 参与搭建句子 DevOps 自动化部署平台,减少因发布导致的业务可用性下降,缩短从代码提交到生产环境部署的时间周期,提高私有部署环境的搭建和维护效率 职位要求 1. 全日制本科,1 年以上工作经验,大型互联网公司或者大型IT企业应用运维经验者优先2. 熟悉 Docker 技术和对应的 PaaS 体系架构。有容器、调度相关经验或了解 Docker、Swarm、Kubernetes等相关技术3. 掌握一门服务端编程语言(Go / Java / Python / Node.js
资深运维开发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述句子互动 DevOps 团队的使命是确保句子秒回和句客宝 24/7 的在不同的环境中高效和可持续性运转。以ToB业务为主的句子互动希望为客户提供流畅稳定的部署,使用和更新体验,这就要求 DevOps 团队能够从系统的可用性,扩张性和稳定性出发,组建和维护大规模、高可用、高效能的分布式系统,结合当下最流行的云原生技术,打造全流程自动化的体系。你需要深入句子互动各业务线,在确保基础设施在快速演进的同时,具备高可用以及扩展性,并从稳定性和效能的角度切入到业务研发,为业务研发团队提供高效的开发架构,同时通过建设完善的监控体系,保证业务系统的快速稳定迭代。岗位职责1. 设计和实现构建系统测试、系统部署、基础设施管理等系统2. 负责句子 DevOps 平台的设计与实现,以服务化、产品化的方式解决海量系统的自动化运维,故障智能定位和自修复3. 负责句子的监控系统的设计与实现,提高监控有效性,覆盖率,提升监控系统的智能化4. 负责设计和实现持续交付系统,减少因发布导致的业务可用性下降,缩短从代码提交到生产环境部署的时间周期,提高私有部署环境的搭建和维护效率 职位要求 1. 全日制本科,3 年以上工作经验,大型互联网公司或者大型IT企业应用运维经验者优先2. 熟悉容器技术,有大规模容器集群运维经验3. 熟悉 Shell 或 Go,熟练编写各种日常工具,熟悉常用 http 框架4. 精通 linux/unix 操作系统,熟悉 TCP/HTTP 协议,熟悉性能调优,熟悉使用相关压测,监控等工具5. 熟悉多种开源组件:Ansible、MongoDB、Haproxy、Nginx、Jenkins、Git、Elasticsearch、Redis 等6. 了解
毕业时间:2026年9月 - 2027年6月之间毕业的应届 毕业生 工作地点:如果你希望在北京工作,请投递!(上海请搜索职位ID 10490159,深圳 10490165) · 投递须知: 1 填写简历申请时,请把必填和非必填项都填写完整。提交简历之后就无法修改了哦! 2 学校的英文全称请准确填写。中英文对应表,请点击链接查看 https://docs.qq.com/sheet/DVmdaa1BCV0RBbnlR?tab=BB08J2 3 简历不限中英文。 At Amazon Web Services (AWS), we are working to be the most customer-centric company on earth. To get there, we need
Tätigkeitsbereich:Forschung & Entwicklung incl. Design Fachabteilung:RD China Gesellschaft:Mercedes-Benz Group China Ltd. Standort:Mercedes-Benz Group China Ltd., Beijing Startdatum:01.09.2026 Veröffentlichungsdatum:07.08.2026 Stellennummer:MER00046VV Arbeitszeit:Vollzeit Bewerben Aufgaben Objectives: Build and continuously optimise an industry‑leading Software Engineering Mgmt. System. for Mercedes-Benz RD
大模型测评工程师 北京 全职 生产 / 制造 / 加工 - 汽车制造 职位描述 岗位职责:1.设计和开发大模型评估体系,根据不同的业务场景和应用需求,制定针对性的评测方案和策略,确保评测结果真实反映模型在实际使用中的表现;2.对候选大模型进行性能测试和评估,包括但不限于模型的语言理解、生成能力、图像识别准确率等,形成对比报告;3.参与AI产品需求分析,给模型训练提供专业意见;4.构建和维护高质量的数据集,用于评估模型,包括:数据清洗、预处理,确保数据的高质量,为模型评测提供可靠的数据基础;5.应用AI技术开发和实现针对大模型评估的工具,实现端到端的CICT测试流程; 职位要求 岗位要求:1.教育背景:具备计算机科学、人工智能、数学、软件工程或相关专业硕士及以上学历;2.有大模型相关测试开发和评测经验,例如大模型训练、评估、应用等;3.具备扎实的算法基础(如强化学习、对抗学习等);4.熟练掌握Python/C++,有PyTorch/TensorFlow实战经验;5.具备前瞻性思考与快速学习能力,能够独立阅读并理解相关研究论文和技术报告,并输出高质量的调研成果。【加分项】有AI领域模型服务化开发、效果体验评估调优、算法研究经验;有DevOps实践经验者优先。 投递...
整车控制器系统需求工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 对标与需求定义:负责整车控制器平台及趋势的对标分析、功能部署定义及业务划分,以及原始需求、系统需求、软硬件需求的收集、编写、分析与评审;2. 跨维度需求拆解:从智能驾驶、车辆控制、AI 算法、芯片、服务器等多维度拆解系统级需求,制订专业且灵活的系统级解决方案,覆盖底层功能定义与分配、通讯、诊断、功能安全、信息安全、资源配置、车云协同等方向;3. 系统架构与方案设计:牵头或深度参与整车控制器平台的系统架构设计、技术选型与技术方案研究,并推动落地实施;能与技术团队进行深度技术讨论(不需要写代码,但要理解方案取舍),同时能向非技术方清晰阐述产品价值;4. 开发交付闭环:负责系统需求的设计、开发、测试及 Jira 问题全闭环,管理控制器平台产品开发全生命周期,在高迭代节奏中平衡「快速交付」与「工程质量」;5. 跨团队协同对齐:对接软件架构、硬件、软件、测试 Team,以专题形式快节奏对齐各专业认知,形成共识;负责产品系统需求的解释与澄清拉齐;6. 需求体系建设:建设和维护控制器平台产品需求体系,持续对软、硬件架构设计提出系统性约束与建议,推动迭代质量提升;7. AI 领军:感知前沿 AI 发展,利用 AI 打破现有约束、构建 AI 虚拟团队,基于 LLM 设计高鲁棒性的多 Agent系统,探索记忆管理与上下文优化规则,重构现有系统工作流程。 职位要求 1. 基础背景- 本科及以上学历,人工智能、计算机、电气工程、自动化、机电一体化、车辆工程、电子、软件工程等相关专业;- 3年以上汽车电子系统或AI Agent相关经验,完整参与过2个及以上量产项目,有预研项目经验者优先;- 具备良好的技术文档能力,能够独立输出SRS、SWS、DDD等文档。2. 专业能力1)汽车电子与系统工程-
运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SRE、DevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...
研发工程师(研发效能方向) 北京 全职 金融 - 互联网金融 职位描述 1、负责研发效能度量体系建设,并推进研发工作规范化、数据化、平台化和智能化。2、建设研发效能的度量和洞察机制,决策改进和系统优化。3、研发效能分析并挖掘效能瓶颈,给出效能改进的系统性解决方案,引导研发效能的持续提升。 职位要求 1、本科及以上学历,具备5年及以上效能度量体系建设及落地经验。2、掌握软件工程、DevOps等理论知识,对效能度量有深刻理解。3、具备大规模研发团队效率提升经验,具备丰富的横向项目落地的成功经验者优先。4、对业界动态和新技术保持敏锐关注和尝试的热情,敢于尝试不同的思路和方法;优秀的沟通能力,与业务工程师对业务场景、问题、需求保持有效沟通。5、有激情,不畏难,乐于挑战,具有良好的团队合作意识、理解沟通能力及独立解决问题的能力。 投递...
后台开发实习生 北京 实习 数字技术 职位 ID:A238579 职位描述 职位描述:1. 负责智能辅助驾驶CICD平台的实现和交付,负责CICD平台日常维护;2. 参与测试拦截系统和测试工具及组件的设计及开发,协助测试平台的搭建及维护,提升工具平台稳定性,解决复杂业务问题;3. 负责AI相关的应用落地,探索AI在效率提升方面的应用; 职位要求 职位要求:全日制本科或硕博士在读,计算机、电气工程、自动化、汽车工程等相关专业;具备良好的编程习惯,掌握Go/python/shell等至少一种编程或脚本语言;熟悉Linux,Docker等基本操作,对主流中间件有基本了解;掌握CI/CD或devops等持续集成发布工具;逻辑思维良好,有较强的分析问题和解决问题的能力;实习时间:每周现场时间=4天;Base 北京;实习期=6个月;欢迎硕博士长期实习;欢迎27届毕业生长期实习;加分项:熟练掌握C++/C等编程;有智能辅助驾驶、互联网等方向实习经验者或热爱智能辅助驾驶者优先; 投递...
AI运维工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述1.负责公司IDC、公有云(火山云/腾讯云等)的规划、部署、监控与优化,保障业务高可用性(SLA ≥ 99.9%);2.负责管理公司GPU集群,调配训练平台资源;3.设计并实施自动化运维体系(Ansible/Terraform/Jenkins等),提升系统部署、监控告警、故障处理效率;4.维护大规模Linux服务器集群(CentOS/Ubuntu)、Kubernetes/Docker容器平台及中间件(Nginx/MySQL/Redis等)、大规模数据存储;5.建立全链路监控体系(Zabbix/Prometheus/Grafana),实时分析系统性能瓶颈,预防潜在风险;6.制定并执行容灾备份、安全加固及合规策略,响应安全事件;7.编写运维文档及技术方案,推动DevOps文化落地; 职位要求 职位要求硬性条件:1.本科及以上学历,计算机/通信相关专业,3年以上人工智能科技公司运维经验;2.具备GPU集群管理经验,了解ROS/ROS2生态;3.精通Linux系统管理、Shell/Python脚本开发,熟悉TCP/IP、HTTP等网络协议;4.熟练使用至少一种公有云(火山云/腾讯云/阿里云),有PB级存储搭建经验,具备云资源编排及成本优化经验;5.掌握容器化技术(Docker/K8s)及CI/CD工具链(GitLab/Jenkins);6.熟悉监控日志系统(ELK/Prometheus)及自动化运维工具(Ansible/SaltStack)。加分项:1.有高并发、分布式系统运维经验者优先;2.熟悉网络安全防护(WAF/防火墙/漏洞扫描);3.持有AWS/AliCloud/K8s认证证书;4.有大模型相关基础设施搭建经验;5.了解Infrastructure as Code(IaC)实践。。 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs / Traces),构建从业务指标到基础设施指标的全链路可观测性。
项目经理 北京 全职 研发 - 技术项目管理 职位描述 【项目管理体系建设】1. 负责项目管理流程、标准与工具的制定、落地和持续优化,提升项目管理成熟度。2. 推动并维护项目全生命周期管理,包括立项、规划、执行、交付及复盘。【多项目/项目组合管控】1. 统筹多个研发项目进度、质量、资源、风险和成本,推动跨团队、跨部门协同,确保项目组合效益最优化。2. 组织定期项目状态review、里程碑评审和高层汇报,及时发现并解决共性与系统性问题。【项目数据与过程监控】1. 搭建和维护项目管理数据看板,负责项目进度、资源、风险、变更等核心数据的收集、分析与可视化展示。2. 基于数据驱动开展项目健康度评估、趋势分析,为决策层提供有力数据支持。【项目管理赋能和培训】1. 对项目经理、研发团队持续开展项目管理最佳实践、知识分享与能力提升活动。2. 推动敏捷、DevOps、自动化等先进项目管理模式在团队持续落地。【流程和工具创新】1. 结合团队开发特性,探索并推广智能化/自动化的管理工具与流程,提高项目协作效率与交付质量。2. 持续关注业界项目管理趋势与创新方法,并引入至团队实践。【战略对齐和业务支撑】1.参与并理解部门产品线的年度/季度规划,引导项目与业务战略一致。 职位要求 1. 本科及以上学历,计算机、软件工程、信息管理等相关专业优先。2. 5年及以上IT/互联网研发类项目管理或大型PMO相关工作经验。3. 熟悉研发工作流程,具备Scrum/敏捷、DevOps等经验,能主导复杂技术项目或项目群管理。4. 熟练掌握项目管理工具与方法论(如PMP、 ACP、项目组合管理、OKR等),具备项目管理体系设计与流程改进经验。5. 优秀的数据分析、逻辑思维及问题解决能力,善于推动跨部门、跨团队合作与冲突管理。6. 熟练使用研发管理自动化工具,以飞书项目优先。 投递...
SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...