自动驾驶基座模型(世界模型方向) 北京 社招 全职 职位 ID:A49702A 职位描述 负责World Action Model在自动驾驶场景中的前沿算法研究,;参与World Action Model模型开发,数据闭环构建和创新型技术研发,为下一代自动驾驶技术提供基础支撑; 职位要求 教育背景:计算机科学、人工智能、机器人学、自动驾驶或相关领域的博士学位,或具备等效的研究经验;世界模型,视觉表征学习,视觉自监督算法研究经验;对DIffusion-based和AE-based视频生成模型的原理有深刻的理解理论与实践能力:扎实的机器学习、深度学习理论基础,具有视觉理解、自然语言处理与行为决策的交叉领域研究背景;编程能力:熟练掌握Python及主流深度学习框架(如PyTorch、TensorFlow等),有高效模型训练与大规模数据处理经验;学术能力:具有在国际顶级会议(NeurIPS、ICLR、CVPR、ICCV等)上发表过论文的经验,或参与过具有影响力的学术竞赛(如COCO、Kitti、nuScenes等);跨学科能力:具备跨学科协作能力,能够有效将计算机视觉、自然语言处理与机器人学的知识融合,推动自动驾驶机器人领域的创新;加分项:在大规模视觉预训练模型训练、蒸馏等方面有深入研究;具有实际项目经验,熟悉典型的算法V-JEPA, DINO系列;具有自动驾驶平台(如CARLA、Waymo、nuScenes等)上的实验经验。 投递...
数据闭环-车云测试工程师 北京 社招 全职 互联网 / 电子 / 网游 - 研发 职位描述 依据产品需求和项目要求,配合搭建并管理测试环境,对自动驾驶产品进行功能验证;依据测试需求设计测试用例,保证测试用例合理有效;执行测试用例,收集并跟踪测试中发现的问题,跟进问题的解决,确保问题的修复与闭环;根据测试业务特点,开发合适的测试工具或自动化解决方案,提高测试效率; 职位要求 大学本科及以上学历,电子、通信、计算机、机器人等相关专业;5年以上工作经验,了解车辆原理,熟悉车辆测试方法,具备自动驾驶测试或开发经验;熟悉台架搭建与维护,网络配置,了解CAN协议及熟练使用CANoe,了解Lauterbach使用者优先;熟悉ubuntu系统,能够使用linux常用命令,要求具备Python编程经验;熟悉V-model模型,熟悉常见的软件测试用例设计方法和编写方法;具备较好的逻辑思维、思路清晰、有全局视角、较好的沟通与表达能力,做事细致严谨,强烈的责任心和敬业精神,抗压能力强;有自动驾驶软件故障诊断测试经验者优先; 投递...
Tätigkeitsbereich:Forschung & Entwicklung incl. Design Fachabteilung:RD China Gesellschaft:Mercedes-Benz Group China Ltd. Standort:Mercedes-Benz Group China Ltd., Beijing Startdatum:01.09.2026 Veröffentlichungsdatum:22.07.2026 Stellennummer:MER0004683 Arbeitszeit:Vollzeit Bewerben Aufgaben To support RD China’s strategy of maximizing the local ecosystem and delivering a best-in-class
Tätigkeitsbereich:Forschung & Entwicklung incl. Design Fachabteilung:Ex RD China Gesellschaft:Mercedes-Benz Group China Ltd. Standort:Mercedes-Benz Group China Ltd., Beijing Startdatum:01.09.2026 Veröffentlichungsdatum:22.07.2026 Stellennummer:MER0004685 Arbeitszeit:Vollzeit Bewerben Aufgaben To support RD China’s strategy of maximizing the local ecosystem and delivering a
【智谱星】AI院-多模态理解-算法工程师(26届校招) 北京 正式 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】技术方向一:学科解题方向,负责VLM的混合SFT/RL训练优化及RL训练的数据处理;技术方向二:reward 方向,负责 reward system 和 verifier model 优化;技术方向三:负责VLM的算法开发和预研,需具备较强的算法自主研究能力(智谱星);技术方向四:多模态训练框架开发、调优、提速;技术方向五:负责 pretrain 训练数据清洗优化工作;技术方向六:负责多模态智能评估方向。 职位要求 【职位要求】1. 2026届毕业,自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练运用Pytorch、transformers、megatron等主流框架;4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先;5. 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验。加分项:1. 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...
AI院-多模态音频-算法工程师(26届校招) 北京 正式 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】1.负责音频生成中的SFT技术并探索RL的训练优化;2.负责音频生成的token2wav模块包括diffusion model、vocoder。 职位要求 【职位要求】1. 2026届毕业,自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Python和Pytorch/Tensorflow深度学习框架;4. 熟悉以下至少一种,且有相应研发经验优先,大模型的框架&理论(如Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM等),各类声码器(如Hifi-GAN,MelGAN,BigvGAN等),上一代语音合成模型(如Tacotron、Fastspeech等);5. 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验。加分项:1. 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...