AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。 4. 建设和完善 AI 平台运维体系,包括稳定性治理、故障应急、容量管理、资源运营、SLA 保障等,提升平台规模化运维能力。 5. 推动运维自动化和智能化建设,开发自动化运维工具、巡检工具、故障自愈能力和运维
SummaryDo you want to help build some of the largest and most consequential enterprise and customer technology systems in the world? Join Apple’s Information Systems and Technology (IS&T) organization. IS&T is the engine behind everything Apple
AI运维工程师 北京 全职 互联网 / 电子 / 网游 职位描述 职位描述1.负责公司IDC、公有云(火山云/腾讯云等)的规划、部署、监控与优化,保障业务高可用性(SLA ≥ 99.9%);2.负责管理公司GPU集群,调配训练平台资源;3.设计并实施自动化运维体系(Ansible/Terraform/Jenkins等),提升系统部署、监控告警、故障处理效率;4.维护大规模Linux服务器集群(CentOS/Ubuntu)、Kubernetes/Docker容器平台及中间件(Nginx/MySQL/Redis等)、大规模数据存储;5.建立全链路监控体系(Zabbix/Prometheus/Grafana),实时分析系统性能瓶颈,预防潜在风险;6.制定并执行容灾备份、安全加固及合规策略,响应安全事件;7.编写运维文档及技术方案,推动DevOps文化落地; 职位要求 职位要求硬性条件:1.本科及以上学历,计算机/通信相关专业,3年以上人工智能科技公司运维经验;2.具备GPU集群管理经验,了解ROS/ROS2生态;3.精通Linux系统管理、Shell/Python脚本开发,熟悉TCP/IP、HTTP等网络协议;4.熟练使用至少一种公有云(火山云/腾讯云/阿里云),有PB级存储搭建经验,具备云资源编排及成本优化经验;5.掌握容器化技术(Docker/K8s)及CI/CD工具链(GitLab/Jenkins);6.熟悉监控日志系统(ELK/Prometheus)及自动化运维工具(Ansible/SaltStack)。加分项:1.有高并发、分布式系统运维经验者优先;2.熟悉网络安全防护(WAF/防火墙/漏洞扫描);3.持有AWS/AliCloud/K8s认证证书;4.有大模型相关基础设施搭建经验;5.了解Infrastructure as Code(IaC)实践。。 投递...
校招-AI 智能平台研发工程师 北京 校招 正式 数字技术 - 算法 本科及以上 2027届校园招聘-正式批 职位 ID:A07799 职位描述 AI Agent 业务赋能: 参与基于 LLM 的 AI Agent 应用设计与开发,结合具体业务场景(如视频图像打标、数据BI等)构建智能体,切实提升业务运转效率;AI 应用平台建设:构建领先的agent平台框架、RAG知识中心、向量检索、模型微调SFT等服务,为上层AI应用提供强大AI基座。前沿技术调研与 PoC: 持续追踪业界最前沿的 AI 技术动态与开源方案(如Dify, LangGraph 及其在 DevOps 领域的应用),撰写调研报告,并快速完成概念验证(PoC)开发;效能工具工程化落地: 与资深工程师合作,将具有价值的 AI 创新点转化为稳定可靠的内部工具或平台功能,服务于全体研发团队。 职位要求 背景: 计算机、软件工程、人工智能等相关专业,本科及以上学历(硕优先),热爱且极度关注 AI 领域的前沿发展;编程基础扎实: 熟练掌握 Python,具备良好的数据结构与算法基础;AI 技术栈: 熟悉大语言模型的基本原理,掌握 Prompt Engineering 技巧;了解或使用过
Join our Team AI-Native Development Intern Join Ericsson’s Router 6000 NT&CI team as we build AI-native quality engineering and digital workforce solutions. You will work with experienced engineers to develop AI agents, automation tools, and intelligent workflows that improve
毕业时间:2026年9月 - 2027年6月之间毕业的应届 毕业生 工作地点:如果你希望在北京工作,请投递!(上海请搜索职位ID 10490159,深圳 10490165) · 投递须知: 1 填写简历申请时,请把必填和非必填项都填写完整。提交简历之后就无法修改了哦! 2 学校的英文全称请准确填写。中英文对应表,请点击链接查看 https://docs.qq.com/sheet/DVmdaa1BCV0RBbnlR?tab=BB08J2 3 简历不限中英文。 At Amazon Web Services (AWS), we are working to be the most customer-centric company on earth. To get there, we
About A1 There are over 5 billion users using basic applications today such email, notes, tasks that are not AI-native. Our mission is to build a proactive smart assistant for everyday users to bring intelligence to conversations,
NVIDIA is looking for Senior Solutions Architect in Beijing. This position is mainly responsible for providing comprehensive technical pre-sales support to CRISP customers. We are dedicated to the most cutting-edge computing hardware and software, leading the
Tätigkeitsbereich:Forschung & Entwicklung incl. Design Fachabteilung:RD China Gesellschaft:Mercedes-Benz Group China Ltd. Standort:Mercedes-Benz Group China Ltd., Beijing Startdatum:01.09.2026 Veröffentlichungsdatum:07.08.2026 Stellennummer:MER00046VV Arbeitszeit:Vollzeit Bewerben Aufgaben Objectives: Build and continuously optimise an industry‑leading Software Engineering Mgmt. System. for Mercedes-Benz RD
大模型测评工程师 北京 全职 生产 / 制造 / 加工 - 汽车制造 职位描述 岗位职责:1.设计和开发大模型评估体系,根据不同的业务场景和应用需求,制定针对性的评测方案和策略,确保评测结果真实反映模型在实际使用中的表现;2.对候选大模型进行性能测试和评估,包括但不限于模型的语言理解、生成能力、图像识别准确率等,形成对比报告;3.参与AI产品需求分析,给模型训练提供专业意见;4.构建和维护高质量的数据集,用于评估模型,包括:数据清洗、预处理,确保数据的高质量,为模型评测提供可靠的数据基础;5.应用AI技术开发和实现针对大模型评估的工具,实现端到端的CICT测试流程; 职位要求 岗位要求:1.教育背景:具备计算机科学、人工智能、数学、软件工程或相关专业硕士及以上学历;2.有大模型相关测试开发和评测经验,例如大模型训练、评估、应用等;3.具备扎实的算法基础(如强化学习、对抗学习等);4.熟练掌握Python/C++,有PyTorch/TensorFlow实战经验;5.具备前瞻性思考与快速学习能力,能够独立阅读并理解相关研究论文和技术报告,并输出高质量的调研成果。【加分项】有AI领域模型服务化开发、效果体验评估调优、算法研究经验;有DevOps实践经验者优先。 投递...
整车控制器系统需求工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 对标与需求定义:负责整车控制器平台及趋势的对标分析、功能部署定义及业务划分,以及原始需求、系统需求、软硬件需求的收集、编写、分析与评审;2. 跨维度需求拆解:从智能驾驶、车辆控制、AI 算法、芯片、服务器等多维度拆解系统级需求,制订专业且灵活的系统级解决方案,覆盖底层功能定义与分配、通讯、诊断、功能安全、信息安全、资源配置、车云协同等方向;3. 系统架构与方案设计:牵头或深度参与整车控制器平台的系统架构设计、技术选型与技术方案研究,并推动落地实施;能与技术团队进行深度技术讨论(不需要写代码,但要理解方案取舍),同时能向非技术方清晰阐述产品价值;4. 开发交付闭环:负责系统需求的设计、开发、测试及 Jira 问题全闭环,管理控制器平台产品开发全生命周期,在高迭代节奏中平衡「快速交付」与「工程质量」;5. 跨团队协同对齐:对接软件架构、硬件、软件、测试 Team,以专题形式快节奏对齐各专业认知,形成共识;负责产品系统需求的解释与澄清拉齐;6. 需求体系建设:建设和维护控制器平台产品需求体系,持续对软、硬件架构设计提出系统性约束与建议,推动迭代质量提升;7. AI 领军:感知前沿 AI 发展,利用 AI 打破现有约束、构建 AI 虚拟团队,基于 LLM 设计高鲁棒性的多 Agent系统,探索记忆管理与上下文优化规则,重构现有系统工作流程。 职位要求 1. 基础背景- 本科及以上学历,人工智能、计算机、电气工程、自动化、机电一体化、车辆工程、电子、软件工程等相关专业;- 3年以上汽车电子系统或AI Agent相关经验,完整参与过2个及以上量产项目,有预研项目经验者优先;- 具备良好的技术文档能力,能够独立输出SRS、SWS、DDD等文档。2. 专业能力1)汽车电子与系统工程- 熟悉智能驾驶、车辆控制、底盘、热管理等典型汽车电子业务场景;- 掌握车载通信协议(CAN/LIN/Ethernet)及诊断标准(UDS/OBD);- 熟悉功能安全、信息安全及相关技术法规;-
AVEVA is a global leader in industrial software. Our cutting-edge solutions are used by thousands of enterprises to deliver the essentials of life – such as energy, infrastructure, chemicals and minerals – safely, efficiently and more
后台开发实习生 北京 实习 数字技术 职位 ID:A238579 职位描述 职位描述:1. 负责智能辅助驾驶CICD平台的实现和交付,负责CICD平台日常维护;2. 参与测试拦截系统和测试工具及组件的设计及开发,协助测试平台的搭建及维护,提升工具平台稳定性,解决复杂业务问题;3. 负责AI相关的应用落地,探索AI在效率提升方面的应用; 职位要求 职位要求:全日制本科或硕博士在读,计算机、电气工程、自动化、汽车工程等相关专业;具备良好的编程习惯,掌握Go/python/shell等至少一种编程或脚本语言;熟悉Linux,Docker等基本操作,对主流中间件有基本了解;掌握CI/CD或devops等持续集成发布工具;逻辑思维良好,有较强的分析问题和解决问题的能力;实习时间:每周现场时间=4天;Base 北京;实习期=6个月;欢迎硕博士长期实习;欢迎27届毕业生长期实习;加分项:熟练掌握C++/C等编程;有智能辅助驾驶、互联网等方向实习经验者或热爱智能辅助驾驶者优先; 投递...
你将负责什么 1. 定义 Kimi 业务的稳定性 「稳」是什么、稳到什么程度、怎么衡量——在 Kimi,这些问题的答案由你来写。Kimi 业务正在高速发展,模型高频发布、产品形态快速演进:你不只是在维护一套静态系统,而是深入快速变化的 AI 架构与产品演进路线,在真正的前沿场景里定义可靠性。 与研发团队共建 SLO / SLI 体系,在可用性、延迟与迭代速度之间取得平衡,让可靠性目标与业务影响直接挂钩。 建立信号清晰的告警体系:分级、降噪,实现故障的分钟级发现与精准定位。 主导故障响应与复盘:快速恢复、彻底复盘、系统性改进——让团队从每一次故障中学到东西,确保同类问题不重复发生。 2. 发布工程与变更安全 为高频模型发布与产品迭代设计安全变更框架:灰度、金丝雀、自动回滚、变更可观测性,把「变更导致故障」的概率降至最低。 护航关键发布:发布前 readiness 评估(容量、依赖、回滚路径),发布中值守,发布后复盘。 把发布 runbook 沉淀为工具与流水线,把手工核验变成持续校验——每一次发布,都让 checklist 更短。 3. 可观测性与可靠性工程 与研发共建统一的 Telemetry 标准(Metrics / Logs / Traces),构建从业务指标到基础设施指标的全链路可观测性。
Key responsibilities The Cloud and Data Engineer will be responsible for the development, implementation, operation, maintenance, and support of the data, middleware, and IT infrastructure used by R&D units across Novo Nordisk, both on-premises and in
Join our Team AI-Native Development Intern We build AI-native quality engineering and digital workforce solutions. You will work with experienced engineers to develop AI agents, automation tools, and intelligent workflows that improve software quality, delivery efficiency, and developer experience.
SRE工程师 北京、南京 校招 正式 软件研发类 2027届校园招聘计划 职位描述 1、我们为小米的站点稳定性提供系统和工具,是稳定性工程专家;2、实践DevOps , Google SRE 和 AI Ops 的工程思想;3、站在软件生命周期全局考虑如何保障系统健壮性,稳定性,并通过软件工程技术为站点保驾护航;4、站在用户/工程师的角度提供易用的工具和平台产品,不断完善使用体验;5、负责集团基础软件/工具/平台的设计和研发,维护小米各项业务的稳定运行;6、按照优秀的工程实践完成需求,设计,编码,测试,发布的软件开发流程;7、按照标准编写设计/开发/运维/用户文。 职位要求 1、熟练Go/C/C++/Java/Shell/Python至少一种编程语言,有Ruby/Bash经验更好;2、熟悉Linux/Unix系统;3、熟悉软件开发方法/流程,理解软件设计,开发,测试,发布过程;4、持续学习,不断追求更好,不断挑战自己,包括:产品/架构/方案/流程/编码;5、乐于分享,具备服务精神,良好的沟通能力和团队合作精神;6、优秀的分析和解决问题能力,勇于解决难题,有”问题到我为止“的精神。 投递...