AI 平台工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 建设 AI 平台 MLOps 能力,覆盖训练、评测、推理、数据全流程流水线。2. 设计并落地模型研发流水线:任务编排、参数与产物管理、评测联动、发布、可观测。3. 基于 K8s、Workflow、调度系统,构建可扩展、可复用的平台能力,提升研发效率与资源利用率。4. 推动 Agent 工程化方向,参与 OpenClaw / Claude Code / Agent CLI 等工具链在研发与运维流程的落地。5. 沉淀最佳实践,推动训练、评测、推理场景从人工走向自动化、智能化。 职位要求 1. 本科及以上,计算机相关专业。2. 3 年以上后端 /
AI 平台高级 SRE 工程师 / DevOps 工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。 2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。 3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。
基础安全工程师 北京 社招 全职 技术 - 开发 职位 ID:A218482 职位描述 岗位定位:作为公司级安全工程 Owner,覆盖各研发组织的业务系统、产品/平台、共享基础设施和数据/模型资产,负责基础、云原生、数据与 AI 安全工程落地,并协调业务 Owner 完成闭环。岗位职责:1. 安全治理与云原生基线:建立资产清单、数据/模型/服务分级、威胁建模和安全基线,推动 IAM、云网络、Kubernetes 权限与网络策略、密钥、加密、备份和审计日志等控制落地。2. 安全运营与事件响应:运营 WAF、云审计、主机/容器检测等能力,负责告警研判、溯源、应急处置、证据留存和复盘,参与重大活动与对外服务保障。3. 漏洞与攻防治理:在书面授权和明确范围内组织 Web/API、云资源、Kubernetes、容器镜像、CI/CD、依赖组件及内部网络测试,维护漏洞台账和修复 SLA,推动各研发组织完成修复验证。4. 数据、模型与 AI 安全:保护数据集、Checkpoint/LoRA、模型仓库、评测集、向量库、推理 Endpoint 和 API Key,落实访问控制、脱敏/DLP、来源校验和审计,覆盖注入、越权、投毒和供应链风险。5. DevSecOps 与协作:推动 SAST/DAST/SCA、镜像/IaC 扫描、SBOM、制品签名和密钥扫描接入研发流程;维护安全规范、预案和供应商评估,协调业务 Owner
【27届校招】大模型训练推理框架工程师 深圳、北京 正式 研发 - 算法 职位描述 负责大模型训练、推理和评测的基础设施研发,为算法团队提供高效稳定的工程底座。1、训练系统:设计和优化大规模分布式训练架构(Pretrain/SFT/RL),解决千卡级训练的通信、调度、容错问题;2、推理部署:基于 vLLM 等框架优化大模型推理性能,支撑 VLT/Omni 等模型在 XP5 端侧和云端的部署;3、评测平台:开发 DeepInsight 评测系统,支持 LLM/VLM/WBC/VLA 多类模型的自动化评测、报告生成和 CI/CD 集成;4、MLOps 工具链:构建模型版本管理、实验追踪、数据管理、资源调度等基础设施,提升研发效率;5、RL 训练环境:构建分布式强化学习训练系统,支持 Agent-环境大规模并行交互。 职位要求 1、硕士及以上学历,计算机、软件工程等相关专业;2、 精通 Python,熟练掌握 C++/Go 至少一门;3、在以下至少一个方向有丰富以上经验:- 分布式训练系统(Megatron-LM/DeepSpeed/FSDP);- GPU 编程与高性能计算(CUDA/NCCL/RDMA);- ML 平台开发(Kubernetes/Ray/Airflow);- 模型推理优化(TensorRT/vLLM/量化部署);4、理解大模型训练和 RL 训练的基本流程。
Please complete the attached Internal TransferRequest Formand submit. Please make sure to apply with your Coupang e-mail address. Company Introduction We exist to wow our customers. We know we’re doing the right thing when we hear
大模型训推平台开发工程师 北京 社招 全职 职位 ID:A249699 职位描述 团队定位:为公司模型迭代提供基建与保障,降本增效——降低算力成本,提高模型开发效率。岗位定位:负责AGI Hub训推平台的架构设计与工程开发,让「数据 → 训练 → 评估 → 量化 → 部署 → 使用」全链路一站式完成,高效支撑大模型各算法业务的迭代。岗位职责:1、负责 AGI Hub 平台的架构与工程开发,高效支持大模型的数据、训练、评估、部署等算法业务;2、对训推平台做全生命周期管理,覆盖资源调度、模型训练与版本迭代、模型推理与部署、模型监控与运维等核心模块的开发与迭代;3、结合业务场景(大语言模型、多模态、搜广推、AIGC 等)设计高效的工程方案,主动识别平台短板;oncall 响应算法业务的定制开发需求,联动算法、产品、测试完成版本迭代交付;4、构建自动化工具链(CLI、Skill 等),支持模型快速迭代与规模化部署,持续降低业务团队的使用门槛;5、管理与运维公司 GPU 机器:制定公平合理的算力使用制度,监控并统计机器在各方向上的使用与成本,持续提升 GPU 利用率。 职位要求 1、扎实的工程能力:熟练掌握 Python / Go 至少一门,有良好的系统设计、接口设计与代码工程化习惯;2、熟悉云原生技术栈:Kubernetes、容器、存储与网络,有多租户资源调度或配额管理经验者优先;3、熟悉主流训推框架与引擎的基本使用与部署方式(Megatron /