端侧智能软件开发工程师 北京 社招 全职 技术 - 开发 职位 ID:A216933 职位描述 岗位职责概括:构建高性能、可靠的端侧(Edge)智能软件栈与 AI Agent 运行框架,使模型与智能体在资源受限设备(机器人、本车、边缘盒子、可穿戴、工业终端等)上实现低时延、稳定、可扩展的智能行为。主要工作内容(可选以下的一种或多种):1. 端侧智能系统开发 - 负责 AI Agent 在端侧的整体软件架构设计与模块实现(感知、规划、决策、工具调用、记忆管理等)。 - 设计与实现多模态数据(视频/语音/传感器)采集、缓存、预处理管线。 2. 模型部署与性能优化 - 将 NLP / CV / 多模态 / 具身策略模型在端侧芯片(如 NVIDIA Jetson、瑞芯微、Qualcomm、MTK 等之一)上进行移植、裁剪、量化、算子优化与内存/带宽调优。
Job Description SummaryResponsible for designing and programming a small module or a large component and designing a feature, set of features, or whole feature area. She/he will work independently and contribute to the immediate team and
大模型预训练算法实习生 北京 校招 实习 算法类 职位描述 1. 前沿探索与价值提炼深入调研多模态大模型预训练、世界模型、端到端自动驾驶等前沿方向,包括但不限于:BEV感知+Occupancy Network:从鸟瞰视角统一表达三维环境,结合时序Transformer实现动态障碍物与可通行区域建模。视觉-语言模型(VLM)与驾驶推理:利用CLIP、LLaVA等多模态对齐技术,将自然语言指令、交通规则与视觉特征深度融合,提升复杂场景理解能力。扩散模型与轨迹生成:研究基于扩散策略(Diffusion Policy)的连续轨迹预测与控制,解决多模态不确定性与长尾分布问题。世界模型与因果推理:探索基于隐空间动力学预测的世界模型,实现闭环仿真与决策鲁棒性评估。定期输出高质量调研报告,量化分析各技术路线对量产体验的潜在增益(如接管率降低、舒适度提升、长尾场景覆盖率提高)。2. 量产预训练方案研发参与设计并优化面向量产车端的预训练框架,重点攻克:高效多模态融合:在计算资源受限下,设计轻量化跨模态注意力机制(如Cross-Attention Pruning、Token Merging)。时序一致性预训练:利用对比学习、掩码重建等自监督范式,学习连续帧间的运动规律与语义对应关系。数据驱动的小样本适应:结合在线难例挖掘、自动标注与数据增强(如LiDAR-to-Camera投影扰动、对抗光照模拟),提升模型对极端天气、异形车辆等罕见场景的泛化能力。最终交付可直接部署至实车的预训练权重及配套蒸馏方案,显著提升感知、预测、规划全链路指标。3. 创新攻坚与学术引领聚焦行业级难题,推动技术边界突破:端到端联合优化:打破传统模块化流水线,探索可微规划器与感知特征的梯度直通,实现从像素到控制信号的全局最优。大规模并行预训练:利用ZeRO、FSDP、Megatron-LM等分布式策略,在万卡集群上完成千亿参数多模态模型的稳定训练。闭环评估与安全对齐:构建基于真实路采与仿真引擎的混合评测体系,引入对抗攻击测试、不确定性量化,确保模型行为符合驾驶伦理与法规。鼓励以第一作者身份投稿顶会(CVPR/ICCV/ECCV/NeurIPS/CoRL),并提供完整的实验平台、标注数据和算力支持。 职位要求 硕士及以上学历,计算机视觉、深度学习、自动驾驶、AI大模型等相关专业;在自动驾驶、多模态学习、强化学习/模仿学习等领域有高水平论文发表经历(如顶会一作);具备扎实的编程能力(Python/C++)及主流框架(PyTorch/JAX)开发经验;有知名自动驾驶公司或顶级AI实验室实习经历者优先;在Kaggle、nuScenes、Waymo Challenge等竞赛中获奖者优先。 投递...
全双工语音算法专家 北京 社招 全职 技术 - 算法 职位 ID:A76961 职位描述 1. 主导语音大模型的前沿算法研究及产业落地;2. 研发具有语音理解、生成、对话能力的端到端模型,开发流式全模态(语音/文本/视觉)大模型;3. 持续跟踪前沿技术动态,能够对领域最新技术进行及时吸纳和改进,通过技术创新和工程实践,支撑模型能力提升;4. 通过论文和技术报告等形式提升团队的技术影响力。 职位要求 硕士及以上学历,计算机相关专业;1. 三年以上语音算法开发经验,深入参与过语音交互类全链路模型及产品建设,熟悉 ASR/TTS/LLM/端到端语音大模型 等语音 AI 相关技术原理,并对相关技术有深入理解和思考;2. 掌握 AI 产品开发的开源工具和框架(如TensorFlow、PyTorch)。具备出色的编程能力和工程能力,熟练掌握Python或其他相关编程语言,具有良好的代码编写习惯和程序开发经验;3. 具备良好的团队合作精神、沟通能力以及分析和解决问题的能力。 投递...
大模型评测算法 北京 社招 全职 技术 - 算法 职位 ID:A00198 职位描述 本职位将及时跟踪AIGC技术前沿,承担高性能基础模型与创新应用的效果评估工作,驱动模型迭代与优化,直接影响前沿技术落地效果与用户体验:1、研究并跟踪国内外最新的大模型技术进展,搭建和维护科学、高效、可扩展的模型评测体系;2、深入参与团队内部模型训练的性能分析与评估,尤其聚焦在基础模型、多模态(图像、语音、Agent)和前沿技术(如强化学习对齐、Prompt工程)等方向的能力定量分析;3、分析评测结果,挖掘模型潜在瓶颈并提出改进建议,持续提升模型的质量与用户体验;4、参与制定模型评测的中长期规划,推动评测工具与流程自动化和标准化,构建业界领先的评测体系。 职位要求 1、计算机、人工智能相关专业本科及以上学历;2、具备2年以上机器学习、数据挖掘或算法评测相关工作经验,熟悉当前前沿模型的评测方法和指标体系,能力优秀的同学可适当降低年限要求;3、具备深厚的机器学习、自然语言处理、多媒体理解、语音合成、数据挖掘理论功底,能够深入理解并独立设计评测方案;4、熟练掌握Python/Java/C++中至少一种编程语言,熟悉常见深度学习框架(如PyTorch、TensorFlow)以及常见的评测框架(如OpenCompass/VLMEvalKit/EvalScope等等);5、具备优秀的分析问题与解决问题的能力,对前沿技术具备敏锐的洞察力。加分项:1、有大模型训练、模型应用落地和性能优化相关经历;2、有大规模模型评测框架搭建或优化经验,或者熟悉业界主流评测工具与方法者;3、在NeurIPS、ICML、ACL、SIGKDD、CVPR等国际顶级会议上发表论文,或有相关竞赛获奖经历者。 投递...
大模型 G-算法工程师-北京 北京 全职 研发 - 后端开发 职位描述 1、负责自然语言处理 (NLP) 大模型的算法研究和开发;2、根据业务场景需求设计微调方案、适配算法和调优工程方案;3、负责大模型的微调算法的开发和优化;4、应用场景包括文本摘要、文本生成、机器阅读理解、问答、多轮对话等; 职位要求 1. 计算机科学、人工智能、自然语言处理或相关领域的硕士或博士学位;2. 在NLP领域拥有扎实的理论基础,熟悉经典和现代的NLP方法和技术;3. 具有丰富的深度学习经验,熟悉常见的深度学习框架(如TensorFlow、PyTorch等);4. 在预训练语言模型(如LLAMMA,GPT等)的设计、训练和优化方面有实际项目经验者优先;5. 出色的问题解决能力和创新能力,能够解决复杂的技术挑战;6. 良好的团队合作和沟通能力,能够与跨职能团队合作,推动项目进展;7. 良好的英文读写能力,能够阅读和理解相关的研究论文和文档;8. 发表过相关领域的学术论文或专利者优先; 投递...
大模型算法工程师- 行业应用 北京 全职 研发 - 算法 职位描述 我们团队专注于将GLM系列大型模型推向商业市场,服务于中央企业、国有企业、金融机构、能源行业等高端企业客户。我们致力于帮助这些客户迅速搭建起新一代人工智能的平台架构,培育技术力量,并实现场景化的应用部署。依托于我们构建的企业级原生大模型应用开发平台,我们为用户提供了一系列专业化的产品与服务,覆盖音视频智能分析、多源异构知识整合管理、项目全生命周期研发支持、零代码的大模型应用快速开发,以及客户关键业务流程的智能化应用等多个领域。我们的目标是通过提升企业的运营效率,推动客户智能化转型,从而为企业带来更加深远的价值增长。岗位职责:1、负责大模型的研究和应用,包括但不限于LLM、SFT、Agent/MultiAgent、 Tool Learning、RAG、RLHF等技术探索,研究前沿模型训练和优化方法,开发国际顶尖级大模型;2、根据业务场景需求设计微调方案、适配算法和调优工程方案;3、参与智谱AI的行业大模型语料知识库建设和训练语料优化,知识图谱、知识FAQ、知识增强大模型等基础算法方向;4、研究和跟踪前沿技术发展,探索AI在助力数字民生服务普惠和智能化方面的新方法和新范式,推动相关领域技术创新。 职位要求 1、计算机科学、人工智能、自然语言处理或相关专业领域;2、具有大模型应用经验,丰富的深度学习经验,熟悉常见的深度学习框架(如TensorFlow、PyTorch等);4、在预训练语言模型(如LLAMMA,GPT等)的设计、训练和优化方面有实际项目经验者优先;5、出色的问题解决能力和创新能力,能够解决复杂的技术挑战;6、良好的团队合作和沟通能力,能够与跨职能团队合作,推动项目进展;7、良好的英文读写能力,能够阅读和理解相关的研究论文和文档;8、发表过相关领域的学术论文或专利者优先。 投递...
AI 院-多模态团队-多模态理解算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】1、 设计和训练先进的多模态大模型,包括图像、视频的理解与生成;2、 搭建与优化多模态大模型的自动化数据通路,提升模型的多模态基础能力及下游任务上的效果;3、优化模型训练,包括包括模型的预训练、微调、偏好对齐等;4、探索前沿算法,多模态理解的数据合成、模型自我迭代等;5、加速多模态大模型的推理过程并部署到实际应用中。 职位要求 1、985高校计算机、电子、自动化等相关专业硕士或博士学位(优秀本科生亦可考虑);2、深入理解常用多模态算法;具备多模态大模型和视频理解相关项目经验者优先;3、在CCF-A类会议发表过多模态相关论文者优先考虑;4、熟练运用Pytorch、transformers、megatron等主流框架;5、工作态度认真负责,具备良好的团队协作能力。 加入我们,您将有机会:1、参与突破性的多模态AI研究;2、与顶尖专家共事,快速提升技能;3、在充满活力的环境中实现自我价值;我们期待您的加入,一同推动AI技术的前沿发展! 投递...
AI 院-多模态理解-训练框架算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】参与GLM系列多模态大模型,CogVLM、CogView、CogVideo系列多模态理解生成模型训练框架 职位要求 1、统招硕士及以上学历,计算机或相关专业;2、熟练掌握Pytorch,具有模型训练经验;3、熟悉Transformer结构,对常见模型的训练方法有所了解,例如BERT、GPT、ViT、CLIP;4、有模型迁移、精度对齐经验,能够在新框架中适配新的模型;5、对常见的大模型训练优化有所了解,能够迅速熟悉掌握,根据需求进行修改;6、对Megatron框架有一定的了解,能够借鉴其他框架,完善优化已有的框架。 投递...
AI院-GLM团队-预训练算法工程师 北京 全职 研发 - 算法 职位描述 职位描述1. 参与数学或代码大模型预训练的研发工作,包括模型的预训练、对齐和评测等2. 负责构建和优化数学或代码的预训练和对齐数据,提升模型在数学或代码任务上的效果3. 探索针对数学或代码任务的数据合成方法,提升模型在数学或代码任务上的泛化能力 职位要求 职位要求1. 自然语言处理、机器学习等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Pytorch、Huggingface、DeepSpeed等框架;4. 对Transformer的架构有较为深入的理解,了解Transformer的各种变体,有相关的研究经验者优先;加分项:1. 在ACL,NeurIPS,ICLR,EMNLP等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先;3. 熟悉CUDA编程/Triton编程,有相关算子加速经验者优先; 投递...
智谱*清华联合培养博士后-AIforscience方向 北京 全职 互联网 / 电子 / 网游 职位描述 岗位职责:1. 从事大语言模型(LLM)与智能体(AI Agent)的前沿研究,重点探索自主学习、复杂推理、自我进化等方向的新理论、新方法。2. 参与构建下一代大规模预训练模型,优化其在多任务、多模态场景下的推理效率与泛化能力。3. 推动LLM与垂直领域(如生物医药、知识图谱、学术数据挖掘)的深度融合,解决实际应用中的关键技术难题。4. 在NeurIPS、ICML、ICLR、ACL等顶级会议/期刊上发表高质量论文,提升团队学术影响力。 职位要求 任职要求:1. 计算机科学、人工智能、计算生物学等相关专业博士毕业(或即将毕业),年龄一般不超过35周岁。2. 在大语言模型、AI Agent、知识图谱、图神经网络等方向有深入研究,并以第一作者身份在CCF-A类会议/期刊(如NeurIPS、ICML、ICLR、KDD、AAAI等)发表过论文。3. 熟悉Transformer、预训练、微调、提示学习等技术,具备大规模模型训练或推理优化经验者优先。4. 熟练掌握Python及主流深度学习框架(PyTorch/TensorFlow),具备良好的代码实现与调试能力。5. 具备独立科研能力、团队协作精神和良好的英文写作与沟通能力。 投递...
机器学习平台研发工程师 北京 全职 互联网 / 电子 / 网游 - 研发 职位描述 -负责机器学习平台与算力基础设施的研发与演进,为模型训练、推理、评测及数据处理等流程提供稳定、高效、可扩展的平台能力,主要包括:- 参与并主导大规模算力平台的设计与研发,覆盖资源调度、任务编排、容器与运行时管理等关键方向,持续提升集群整体资源利用率,保障训练与推理场景的稳定运行;- 基于 Kubernetes、Docker 等云原生技术,参与调度器扩展及 CRD/Controller 等核心能力建设,支撑大规模分布式训练与推理场景。- 持续推进平台的易用性与性能优化,完善工具链与开发体验,降低算法与模型团队的使用门槛,提升整体研发效率。 职位要求 - 本科及以上学历,3 年及以上研发经验,有大规模容器集群或平台型系统建设经验,有千卡及以上规模集群管理或调度经验者优先;- 熟练掌握 Golang,具备扎实的数据结构与算法基础,能够独立定位和解决复杂系统问题;- 熟悉 Kubernetes 核心机制与组件(如调度、网络、存储、Controller/CRD 等),了解容器运行时及云原生相关技术体系;- 熟悉常见分布式数据处理或计算框架(如 Ray / Spark / Flink 等),理解其架构设计与运行模型;-
多模态大模型算法实习生 北京 实习 数字技术 职位 ID:A98571 职位描述 1.参与车舱内外视觉算法和大模型算法的研究和落地;2.参与多模态大模型的数据处理、模型训练、开发部署等工作;3.协助算法工程师进行视觉和多模态大模型前沿技术的预研工作。 职位要求 1.硕士及以上的在读同学,计算机/人工智能/电子信息/自动化等专业;2.了解机器学习和深度学习相关理论知识,有pytorch深度学习框架使用经验;3.有CV/3D/VLM/VLA方向的研究或落地经验;4.有良好的工程能力以及前沿论文阅读能力;5.乐于学习,自驱力强,渴望快速成长;6.能够连续实习3个月及以上。加分项:1.有智能座舱、AI、大模型等相关行业的实习经历;2.有过相关领域的会议或期刊论文发表(CVPR、ICCV、ECCV等);3.在相关领域的学术竞赛(ImageNet、COCO、Kaggle、Waymo等)中取得较好成绩。 投递...
智能辅助驾驶算法实习生(多模态大模型方向) 北京 实习 数字技术 - 算法 职位 ID:A19204A 职位描述 岗位简介我们正在招聘一位智能辅助驾驶算法方向的实习生,参与公司多模态大模型(Multimodal LLM)相关研发工作。你将与团队共同构建智能辅助驾驶领域的 CoT(Chain-of-Thought)数据集工具链、推进多模态感知与规划场景的大模型微调,并参与创新性算法研究与工程落地。该岗位适合对智能辅助驾驶与大模型结合方向感兴趣、愿意参与前沿算法落地的硕士在读同学。 岗位职责多模态大模型相关开发:参与构建智能辅助驾驶感知/预测/规划数据的 CoT 标注与生成工具链,推动数据闭环与高质量训练数据生产。模型微调与优化:基于公司自研或开源 LLM(如 LLaMA/InternVL/Qwen 等),进行模型微调、对齐(SFT、DPO 等)与推理性能优化。智能辅助驾驶算法探索:参与智能辅助驾驶多模态模型(视觉、激光雷达、bev、轨迹等)在大模型框架下的研究验证。算法工程落地:协助完成模型训练、评估、部署等工程化工作,包括数据处理 pipeline、特征构建与实验分析。前沿技术调研:跟踪智能辅助驾驶与 LLM 结合方向的最新研究成果,并推动实验验证。 职位要求 硕士研究生在读,计算机、人工智能、自动化、电子工程或相关专业。熟悉深度学习基础,具有 Transformer / LLM / 多模态模型 的课程或项目经验。有 大模型训练或微调经验(如 LoRA, PEFT, SFT, RLHF /
大模型端到端算法实习生(前沿探索) 北京 实习 数字技术 - 算法 职位 ID:A03645 职位描述 1. 负责智能辅助驾驶大模型端到端模型算法的研发量产工作。2. 紧跟前沿技术发展,并将前沿技术在量产中落地。 职位要求 1. 硕士及以上学历,计算机 / 软件工程 / 人工智能等相关专业。2. 扎实的深度学习算法基础,精通常见的深度学习和机器学习算法。3. 熟悉一个或多个深度学习框架,有tensorflow/pytorch的深度使用经验者优先。4. 面对未知的领域和问题,有非常强的自学能力,善于通过基本的研究方法对问题本身进行拆解,并找到每个步骤的解决办法。5. 有着良好的团队合作精神,能够同公司内部的不同团队保持合作关系。 投递...
端到端算法工程师 北京 实习 数字技术 - 算法 职位 ID:A72815 职位描述 - 参与深度学习、强化学习等相关算法的研究与实现;- 在实际场景中开展强化学习(如 PPO、SAC、GRPO/DPO 等)的实验与改进;- 支持智能辅助驾驶或RL闭环仿真等前沿应用方向的研发工作;- 撰写技术文档,参与团队技术分享与学术交流。- 支持团队完成数据处理、模型训练与实验分析。 职位要求 在读硕士或博士,计算机、人工智能、自动化、电子工程或相关专业,距离毕业 1 年及以上;- 熟悉深度学习主流模型与架构(Transformer、Diffusion);- 对强化学习方法有一定理解,熟悉以下任一方向: - 主流 RL 算法(DQN、DDPG、SAC、PPO、GRPO 等); - 强化学习在轨迹预测、决策规划或模拟环境中的应用; - 世界模型(World Model)、3DGS 或基于 RL 的闭环仿真;-
AI院-多模态音频-算法实习生 北京 实习 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】1. 从事音频算法研究、训练、应用,具体业务包括Omni-音频理解、同声传译、video-audio联合生成等2. 探索语音/音频技术前沿技术,探索音频理解、音频表征、音视频联合生成的新范式3. 负责模型的多机多卡训练、高性能推理、数据集构建、评测系统搭建等 职位要求 【职位要求】1. 自然语言处理、机器学习、人工智能、软件工程等相关专业,硕士及以上学历;2. 较强的算法开发能力,熟悉常用的机器学习、深度学习算法;3. 熟练使用Python和Pytorch/Tensorflow深度学习框架;4. 熟悉以下至少一种,且有相应研发经验优先,大模型的框架&理论(如Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM等);5. 具备优秀的代码能力和基础算法功底,有较为丰富的工程经验,有大规模训练经验或大规模数据处理经验。加分项:1. 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先;2. 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...
AI院-多模态团队-多模态生成算法研究员 北京 全职 互联网 / 电子 / 网游 职位描述 【团队介绍】智谱多模态大模型团队是全球领先的多模态研究团队之一,专注于推动视觉语言大模型的认知与推理能力的突破。团队拥有从多模态理解到生成的全栈自研技术体系,依托强大的计算资源和全链路研发能力,持续引领行业创新。团队负责多模态基座模型研发(视觉语言模型+多模态生成模型),先后推出GLM-V系列多模态基座模型,以及GLM-Image、CogView、CogVideo等前沿生成模型。2025年连续发布GLM-4.1V-Thinking、GLM4.5V和GLM-4.6V系列模型,其中GLM-4.1V-Thinking创新性地引入思维链推理机制,采用课程采样强化学习策略,系统性提升模型跨模态因果推理能力与稳定性,在28项业界权威评测中有23项达成10B级模型的最佳成绩(SOTA);而GLM-4.5V采用MoE架构(总参数106B、激活参数12B),在100B级视觉推理模型中树立起新的标准,在41个业界主流benchmark上达到同级别SOTA,且OCR、视频理解、AI解题、长文档解读、前端复刻、空间定位与推理等核心能力获得显著提升;GLM-4.6V则在多模态感知和深度推理方面进一步增强,且支持128k long-context、多模态工具调用和图文交错输出,为执行复杂、长程、多模态Agentic任务奠定坚实基础;9B版本的GLM-4.6V-Flash整体表现超过 Qwen3-VL-8B,106B参数12B激活的GLM-4.6V表现比肩2倍参数量的Qwen3-VL-235B。顺应技术发展趋势和业界需求,2026年初团队研发和开源GLM-Image和GLM-OCR。前者是智谱新旗舰图像生成模型,全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以Nano Banana Pro为代表的新一代「认知型生成」技术范式的一次重要探索。GLM-OCR则是轻量级OCR和文档解析专用模型,以“小尺寸、高精度”树立新标杆,其性能登顶 OmniDocBench,擅长公式、手写体、表格等高难场景,仅 0.9B 参数,推理高效易部署,在HuggingFace上获得超过360万下载量。【岗位职责】负责图像/视频生成模型训练及数据优化 职位要求 1、985高校计算机、电子、自动化等相关专业硕士或博士学位(优秀本科生亦可考虑);2、深入理解常用多模态算法;具备多模态大模型和视频理解相关项目经验者优先;3、在CCF-A类会议发表过多模态相关论文者优先考虑;4、熟练运用Pytorch、transformers、megatron等主流框架;5、工作态度认真负责,具备良好的团队协作能力。 【加分项】 - 在ACL,NeurIPS,ICLR,EMNLP,ICML等顶级会议或期刊上发表过论文者优先; - 熟悉并行训练框架,有多机多卡训练经验者优先。 投递...
AI加速器架构研发工程师 北京 全职 互联网 / 电子 / 网游 - 研发 职位描述 1.基于现有指令集和编译框架,设计并实现优化深度学习算子,完成对PyTorch等主流框架的适配;2.负责AI加速器软硬件协同设计与优化,包括ISA设计、微架构设计及性能分析3.通过仿真器进行架构探索,分析性能瓶颈,结合模型算法探索优化方向4.与合作伙伴紧密配合,参与硬件架构设计与迭代,实现算法到硬件的高效映射5.追踪和研究AI芯片领域的前沿技术发展 职位要求 1.计算机科学、电子工程、集成电路等相关专业博士学位2.扎实的计算机体系结构基础,熟悉CPU/GPU/NPU等处理器设计原理3.熟悉深度学习算法及框架(如PyTorch),有AI编译器或算子优化经验者优先4.具备较强的编程能力(C/C++/Python)5.有AI芯片相关研究或工作经验者优先6.良好的问题分析和解决能力,具备较强的创新意识7.优秀的沟通协作能力,能够在跨部门团队中高效工作 投递...
AI 院-多模态音频团队-音频生成算法工程师(社招) 北京 全职 互联网 / 电子 / 网游 职位描述 1. 负责agent场景下的多模态理解、生成算法研究、训练、应用,包括但不限于context-aware ASR、指令控制TTS、omni understanding等。2. 负责模型的多机多卡训练、高性能推理等; 职位要求 1. 硕士及以上学历,计算机、数学、通信等相关专业;具备良好的学习能力、逻辑思维能力、沟通协作能力;2. 有三年及以上语音合成、语音识别算法经验,或三篇及以上顶会论文(各类CCF-A会、ICASSP/INTERSPEECH等);3. 熟练使用Python和Pytorch/Tensorflow深度学习框架;4. 对以下至少一种熟悉并有相关经验:1)语音大模型的框架&理论,包括但不限于Diffusion、Vall-E/SpearTTS/AudioLM、MusicLM;2)音频理解大模型/ASR大模型,包括但不限于qwen-audio、sensevoice、whisper等;3)熟悉omni多模态大模型,包括但不限于qwen-omni、mimo-omni、Step‑Audio、Covo‑Audio等;4)有业务落地工程经验优先。 投递...