AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4.
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
毕业时间:2026年9月 - 2027年6月之间毕业的应届 毕业生 工作地点:如果你希望在北京工作,请投递!(上海请搜索职位ID 10490159,深圳 10490165) · 投递须知: 1 填写简历申请时,请把必填和非必填项都填写完整。提交简历之后就无法修改了哦! 2 学校的英文全称请准确填写。中英文对应表,请点击链接查看 https://docs.qq.com/sheet/DVmdaa1BCV0RBbnlR?tab=BB08J2 3 简历不限中英文。 At Amazon Web Services (AWS), we are working to be the most customer-centric company on earth. To get there, we
About A1 There are over 5 billion users using basic applications today such email, notes, tasks that are not AI-native. Our mission is to build a proactive smart assistant for everyday users to bring intelligence to
NVIDIA is looking for Senior Solutions Architect in Beijing. This position is mainly responsible for providing comprehensive technical pre-sales support to CRISP customers. We are dedicated to the most cutting-edge computing hardware and software, leading the
Tätigkeitsbereich:Forschung & Entwicklung incl. Design Fachabteilung:RD China Gesellschaft:Mercedes-Benz Group China Ltd. Standort:Mercedes-Benz Group China Ltd., Beijing Startdatum:01.09.2026 Veröffentlichungsdatum:07.08.2026 Stellennummer:MER00046VV Arbeitszeit:Vollzeit Bewerben Aufgaben Objectives: Build and continuously optimise an industry‑leading Software Engineering Mgmt. System. for Mercedes-Benz RD
大模型测评工程师 北京 全职 生产 / 制造 / 加工 - 汽车制造 职位描述 岗位职责:1.设计和开发大模型评估体系,根据不同的业务场景和应用需求,制定针对性的评测方案和策略,确保评测结果真实反映模型在实际使用中的表现;2.对候选大模型进行性能测试和评估,包括但不限于模型的语言理解、生成能力、图像识别准确率等,形成对比报告;3.参与AI产品需求分析,给模型训练提供专业意见;4.构建和维护高质量的数据集,用于评估模型,包括:数据清洗、预处理,确保数据的高质量,为模型评测提供可靠的数据基础;5.应用AI技术开发和实现针对大模型评估的工具,实现端到端的CICT测试流程; 职位要求 岗位要求:1.教育背景:具备计算机科学、人工智能、数学、软件工程或相关专业硕士及以上学历;2.有大模型相关测试开发和评测经验,例如大模型训练、评估、应用等;3.具备扎实的算法基础(如强化学习、对抗学习等);4.熟练掌握Python/C++,有PyTorch/TensorFlow实战经验;5.具备前瞻性思考与快速学习能力,能够独立阅读并理解相关研究论文和技术报告,并输出高质量的调研成果。【加分项】有AI领域模型服务化开发、效果体验评估调优、算法研究经验;有DevOps实践经验者优先。 投递...
整车控制器系统需求工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 对标与需求定义:负责整车控制器平台及趋势的对标分析、功能部署定义及业务划分,以及原始需求、系统需求、软硬件需求的收集、编写、分析与评审;2. 跨维度需求拆解:从智能驾驶、车辆控制、AI 算法、芯片、服务器等多维度拆解系统级需求,制订专业且灵活的系统级解决方案,覆盖底层功能定义与分配、通讯、诊断、功能安全、信息安全、资源配置、车云协同等方向;3. 系统架构与方案设计:牵头或深度参与整车控制器平台的系统架构设计、技术选型与技术方案研究,并推动落地实施;能与技术团队进行深度技术讨论(不需要写代码,但要理解方案取舍),同时能向非技术方清晰阐述产品价值;4. 开发交付闭环:负责系统需求的设计、开发、测试及 Jira 问题全闭环,管理控制器平台产品开发全生命周期,在高迭代节奏中平衡「快速交付」与「工程质量」;5. 跨团队协同对齐:对接软件架构、硬件、软件、测试 Team,以专题形式快节奏对齐各专业认知,形成共识;负责产品系统需求的解释与澄清拉齐;6. 需求体系建设:建设和维护控制器平台产品需求体系,持续对软、硬件架构设计提出系统性约束与建议,推动迭代质量提升;7. AI 领军:感知前沿 AI 发展,利用 AI 打破现有约束、构建 AI 虚拟团队,基于 LLM 设计高鲁棒性的多 Agent系统,探索记忆管理与上下文优化规则,重构现有系统工作流程。 职位要求 1. 基础背景- 本科及以上学历,人工智能、计算机、电气工程、自动化、机电一体化、车辆工程、电子、软件工程等相关专业;- 3年以上汽车电子系统或AI
运维研发工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1.负责故障管理、稳定性治理和高可用保障相关工作,参与故障发现、响应、协同处置、复盘改进和机制沉淀,推动故障管理流程标准化、数字化和可度量化。2.参与充电业务高可用建设协作,围绕核心业务链路、关键系统依赖、容量风险、变更风险和应急预案等方向,配合业务、研发、测试、运维等团队识别并推进稳定性改进事项。3.负责重大活动保障中的协调与推动工作,包括保障方案准备、风险排查、监控确认、预案演练、保障值守、问题跟进和活动后复盘,提升活动期间企业数字平台的连续性和可靠性。4.参与系统风险相关工作的数字化建设,协同团队完成风险对象、风险指标、风险事件、治理动作、责任关系、处置状态等数据模型设计,推动风险管理从经验驱动向数据驱动演进。5.结合当前智能化技术趋势,参与系统风险治理的智能化探索,包括风险数据沉淀、规则建模、异常识别、趋势分析、智能推荐、辅助决策等方向,提升稳定性治理的自动化和智能化水平。6.持续沉淀稳定性治理方法论、流程规范、数据标准和工具能力,推动企业 IT 系统稳定性提升,降低故障发生概率和业务影响范围。 职位要求 1.全日制统招本科及以上学历,熟悉运维、SRE、DevOps 或平台工程相关工作方法,理解故障管理、监控告警、应急响应、变更管理、容量管理、稳定性治理等基本体系。2.具备较好的系统化思维,能够围绕业务链路、系统依赖、风险点、治理动作和度量指标进行结构化分析,推动复杂问题拆解和闭环解决。3.具备一定研发能力,熟悉至少一种编程语言,如 Python、Go、Java 或 JavaScript,能够参与运维工具、数据平台、风险治理平台或自动化能力建设。4.了解数据库、接口服务、消息队列、缓存、容器、云平台、监控系统等常见 IT 基础设施和应用架构,能够理解系统运行风险和高可用保障重点。5.具备数据建模和数据分析意识,能够将稳定性、故障、风险、治理动作等工作对象抽象为可管理、可统计、可追踪的数据模型。6.具备良好的跨团队沟通和项目协同能力,能够在故障处置、活动保障、风险治理推进等场景中协调多方资源,推动问题落地解决。7.具备较强的责任心和风险意识,对线上稳定性、业务连续性和用户影响有敏感度,能够在关键保障场景中保持严谨、及时和可追踪的工作方式。8.具备持续改进意识,能够通过复盘、数据分析、流程优化和工具建设,推动稳定性治理能力长期提升。 投递...
AVEVA is a global leader in industrial software. Our cutting-edge solutions are used by thousands of enterprises to deliver the essentials of life – such as energy, infrastructure, chemicals and minerals – safely, efficiently and more
研发工程师(研发效能方向) 北京 全职 金融 - 互联网金融 职位描述 1、负责研发效能度量体系建设,并推进研发工作规范化、数据化、平台化和智能化。2、建设研发效能的度量和洞察机制,决策改进和系统优化。3、研发效能分析并挖掘效能瓶颈,给出效能改进的系统性解决方案,引导研发效能的持续提升。 职位要求 1、本科及以上学历,具备5年及以上效能度量体系建设及落地经验。2、掌握软件工程、DevOps等理论知识,对效能度量有深刻理解。3、具备大规模研发团队效率提升经验,具备丰富的横向项目落地的成功经验者优先。4、对业界动态和新技术保持敏锐关注和尝试的热情,敢于尝试不同的思路和方法;优秀的沟通能力,与业务工程师对业务场景、问题、需求保持有效沟通。5、有激情,不畏难,乐于挑战,具有良好的团队合作意识、理解沟通能力及独立解决问题的能力。 投递...
系统运维工程师 北京 全职 金融 - 互联网金融 职位描述 保障生产环境系统网络的高可用性,确保业务稳定运作,迅速定位并解决故障。设计与开发自动化运维工具,推进运维工作的标准化、流程化与自动化,减少人工干预,降低误操作风险,提升运维工作效率。依据业务需求和技术发展趋势,设计具备高可靠性与可扩展性的系统网络架构方案,并持续优化现有架构以支持业务增长。评估系统性能和运行状态,建立量化指标,以数据为导向优化架构,提高资源利用率,降低成本。搭建运维管理平台,推动基础设施即代码和DevOps实践的实施。 具备强烈的责任心、自我驱动力强,关注细节,追求卓越。 职位要求 具备五年以上运维/DevOps工作经验,其中至少两年以上架构设计或运维开发经验,计算机相关专业者优先;熟练掌握Python、Shell,熟悉Django/Flask等框架,能够独立开发运维工具;熟练掌握Linux系统管理,熟悉内核调优、性能分析、安全加固等工作;熟练掌握虚拟化(KVM/VMware)、Docker、Kubernetes,具备大规模容器化集群管理经验;能够熟练运用负载均衡技术(HAProxy、Nginx、Keepalived、Pacemaker);具备两年网络维护经验。熟悉主流厂商路由器、交换机、防火墙配置,熟悉公有云网络相关服务。具备较强的排错能力,可以通过抓包分析定位业务问题。拥有高并发低时延系统网络架构设计经验,有开源社区贡献经验者优先;熟悉阿里云、华为云或者AWS 等云平台各类产品使用和维护管理工作优先。 投递...
后台开发实习生 北京 实习 数字技术 职位 ID:A238579 职位描述 职位描述:1. 负责智能辅助驾驶CICD平台的实现和交付,负责CICD平台日常维护;2. 参与测试拦截系统和测试工具及组件的设计及开发,协助测试平台的搭建及维护,提升工具平台稳定性,解决复杂业务问题;3. 负责AI相关的应用落地,探索AI在效率提升方面的应用; 职位要求 职位要求:全日制本科或硕博士在读,计算机、电气工程、自动化、汽车工程等相关专业;具备良好的编程习惯,掌握Go/python/shell等至少一种编程或脚本语言;熟悉Linux,Docker等基本操作,对主流中间件有基本了解;掌握CI/CD或devops等持续集成发布工具;逻辑思维良好,有较强的分析问题和解决问题的能力;实习时间:每周现场时间=4天;Base 北京;实习期=6个月;欢迎硕博士长期实习;欢迎27届毕业生长期实习;加分项:熟练掌握C++/C等编程;有智能辅助驾驶、互联网等方向实习经验者或热爱智能辅助驾驶者优先; 投递...
AI运维工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述1.负责公司IDC、公有云(火山云/腾讯云等)的规划、部署、监控与优化,保障业务高可用性(SLA ≥ 99.9%);2.负责管理公司GPU集群,调配训练平台资源;3.设计并实施自动化运维体系(Ansible/Terraform/Jenkins等),提升系统部署、监控告警、故障处理效率;4.维护大规模Linux服务器集群(CentOS/Ubuntu)、Kubernetes/Docker容器平台及中间件(Nginx/MySQL/Redis等)、大规模数据存储;5.建立全链路监控体系(Zabbix/Prometheus/Grafana),实时分析系统性能瓶颈,预防潜在风险;6.制定并执行容灾备份、安全加固及合规策略,响应安全事件;7.编写运维文档及技术方案,推动DevOps文化落地; 职位要求 职位要求硬性条件:1.本科及以上学历,计算机/通信相关专业,3年以上人工智能科技公司运维经验;2.具备GPU集群管理经验,了解ROS/ROS2生态;3.精通Linux系统管理、Shell/Python脚本开发,熟悉TCP/IP、HTTP等网络协议;4.熟练使用至少一种公有云(火山云/腾讯云/阿里云),有PB级存储搭建经验,具备云资源编排及成本优化经验;5.掌握容器化技术(Docker/K8s)及CI/CD工具链(GitLab/Jenkins);6.熟悉监控日志系统(ELK/Prometheus)及自动化运维工具(Ansible/SaltStack)。加分项:1.有高并发、分布式系统运维经验者优先;2.熟悉网络安全防护(WAF/防火墙/漏洞扫描);3.持有AWS/AliCloud/K8s认证证书;4.有大模型相关基础设施搭建经验;5.了解Infrastructure as Code(IaC)实践。。 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs /
项目经理 北京 全职 研发 - 技术项目管理 职位描述 【项目管理体系建设】1. 负责项目管理流程、标准与工具的制定、落地和持续优化,提升项目管理成熟度。2. 推动并维护项目全生命周期管理,包括立项、规划、执行、交付及复盘。【多项目/项目组合管控】1. 统筹多个研发项目进度、质量、资源、风险和成本,推动跨团队、跨部门协同,确保项目组合效益最优化。2. 组织定期项目状态review、里程碑评审和高层汇报,及时发现并解决共性与系统性问题。【项目数据与过程监控】1. 搭建和维护项目管理数据看板,负责项目进度、资源、风险、变更等核心数据的收集、分析与可视化展示。2. 基于数据驱动开展项目健康度评估、趋势分析,为决策层提供有力数据支持。【项目管理赋能和培训】1. 对项目经理、研发团队持续开展项目管理最佳实践、知识分享与能力提升活动。2. 推动敏捷、DevOps、自动化等先进项目管理模式在团队持续落地。【流程和工具创新】1. 结合团队开发特性,探索并推广智能化/自动化的管理工具与流程,提高项目协作效率与交付质量。2. 持续关注业界项目管理趋势与创新方法,并引入至团队实践。【战略对齐和业务支撑】1.参与并理解部门产品线的年度/季度规划,引导项目与业务战略一致。 职位要求 1. 本科及以上学历,计算机、软件工程、信息管理等相关专业优先。2. 5年及以上IT/互联网研发类项目管理或大型PMO相关工作经验。3. 熟悉研发工作流程,具备Scrum/敏捷、DevOps等经验,能主导复杂技术项目或项目群管理。4. 熟练掌握项目管理工具与方法论(如PMP、 ACP、项目组合管理、OKR等),具备项目管理体系设计与流程改进经验。5. 优秀的数据分析、逻辑思维及问题解决能力,善于推动跨部门、跨团队合作与冲突管理。6. 熟练使用研发管理自动化工具,以飞书项目优先。 投递...
Senior Technical Specialist We are looking for a hardworking, intellectually curious individual to play the role of Senior Technical Specialist to design and implement innovative tech solutions for complex business problems. Role Summary: Key Accountabilities: Lead
设计、部署和管理企业级阿里云基础架构环境。 主导或参与阿里云 Landing Zone 的规划、建设及治理工作。 确保云基础架构服务的可用性、安全性、合规性和运营稳定性。 负责 Windows Server 和 Linux 操作系统的管理与技术支持。 配置和管理网络、安全、存储、数据库及负载均衡等基础架构组件。 分析并解决复杂的基础设施、网络及应用相关问题。 通过基础设施即代码(Infrastructure as Code,IaC)推动自动化和标准化建设。 与安全、应用开发及业务团队紧密合作,提供符合企业架构标准的云解决方案。 支持灾备、备份、监控及运营持续改进相关工作。 为技术团队提供技术指导、培训和专业支持。 教育背景及认证要求 计算机科学、信息技术、软件工程或相关专业本科及以上学历。 持有阿里云专业认证(ACP)或专家认证(ACE)优先。 具备云计算、网络、安全等相关认证者优先。 工作经验要求 必备条件 3年以上阿里云平台实施和运维经验。 具备阿里云 Landing Zone 规划及落地实施经验。 熟练掌握 Windows 和 Linux 系统管理。
产品经理 – 机器人端侧软件 北京 社招 全职 职位描述 1、运维工具产品设计与迭代的 - 调研现场运维团队、客户技术支持团队的工具需求,梳理机器人运维全流程的痛点与改进机会。 - 设计并定义运维工具功能,包括远程诊断、日志采集与分析、OTA升级、配置管理、健康监控、告警管理等。 - 输出运维工具的详细PRD,定义功能流程、交互界面、异常处理逻辑。2、基础端侧软件功能设计 - 负责机器人端侧基础软件功能的产品定义,包括系统启动流程、进程管理、资源监控、日志系统、通信管理等。 - 定义端侧软件的配置管理方案,支持不同机型、不同场景的灵活配置。 - 设计端侧软件的升级与回滚策略,确保OTA升级的安全性与可靠性。3、研发跟进与功能验证 - 跟进软件团队的开发进度,参与技术方案评审,确保实现符合产品设计。 - 设计功能测试用例与验收标准,组织功能验收与回归测试。 - 收集内部使用反馈与现场运维数据,驱动工具与功能的持续优化。4、用户体验与效率提升 - 关注运维工具的用户体验,确保运维人员能快速上手、高效操作。 - 分析运维效率数据(如平均故障定位时间、升级成功率等),设定优化目标并推动落地。 - 设计运维自动化方案,减少人工干预,提升运维规模化能力。5、文档与培训支持 - 编写运维工具的用户手册与操作指南,支持运维团队快速掌握工具使用。 - 沉淀常见故障处理流程,形成标准化的运维知识库。
Typical Accountabilities Major Responsibilities Build up the team spirit, including develop team style and behaviour Contribute to efficient SMM organisation and its functioning at country level by working closely with responsible SMM Director Plan and organise