We’re building a lightweight 2D vector map system for intelligent driving. We adopt learning-based algorithms to reconstruct structured road layers from mass vehicle driving data. Our team leverages computer vision, graph modeling and computational geometry to
语音算法工程师 北京 技术 - 算法 硕士及以上 职位描述 1、支持语音理解/语音合成、端到端语音对话相关技术在业务场景落地,解决落地过程中的问题,持续优化语音交互技术;2、参与全双工语音大模型的架构设计与算法研发,探索语音与语义的统一建模方案,提升模型端到端理解、推理与生成能力;3、参与音频训练数据的构建、清洗,与训练策略的设计,提升模型在复杂场景下的理解与推理能力;4、跟踪端到端语音对话、全双工交互、语音理解/语音生成等领域的前沿进展,推动新技术的验证与业务应用。 职位要求 1、具备多模态大模型、语音识别/语音合成/语音对话等方向的项目经验,至少在其中一个方向具有扎实的研发实践;2、熟悉端到端语音大模型的基本原理和主流架构,理解语音编码、语义建模、对话推理及语音生成等关键环节;3、熟悉语音交互系统的核心技术链路,对 ASR、TTS、VAD、语音活动检测、说话人建模或对话管理中的一个或多个模块有深入理解;4、对工业级大规模数据有实际处理经验,有使用海量数据优化实际业务模型的动手经验;5、具备良好的编程和工程实现能力,熟练使用 Python,熟悉 Linux 开发环境及主流深度学习框架;6、对技术有持续钻研的热情,具备较强的独立分析、问题解决和快速学习能力,同时拥有良好的沟通与团队协作能力。加分项: 1、具备客服、智能助手等场景下大规模语音交互系统的研发、部署与优化经验;2、对前沿的端到端语音对话系统有优化经验,熟悉Fun-Audio-Chat、Moshi、Qwen3Omni等端到端语音对话算法;3、同时具备语音识别/语音合成技术经验,熟悉端到端 ASR、流式识别、语音生成、音色克隆及情感与韵律控制等技术;4、具备语音大模型预训练、后训练、指令微调、偏好优化或推理加速等实践经验;5、在相关国际会议或主流期刊上发表论文(ICASSP、Interspeech、ASRU、IEEE/ACM Transactions等);6、参与过具有行业影响力的开源项目,并有实际代码或社区贡献。 职位信息 部门: 技术体系 投递温馨提示:投递顺序代表志愿顺序,请同学谨慎选择 投递...
【27届校招】具身智能算法工程师/研究员(人机交互) 深圳、上海、北京 正式 研发 - 算法 智能机器人板块 职位描述 1、机器人自然交互算法研发:面向通用人形机器人及真实物理世界场景,研发融合语音、视觉、文本、表情、手势、姿态和动作的多模态交互算法,打造自然、实时、主动且具有人格一致性的机器人交互体验。2、多模态感知与意图理解:研究复杂环境下的语音识别、声源定位、说话人识别、视觉感知、行为理解、情绪识别及多模态意图融合,实现机器人对“谁在说、对谁说、表达什么、希望机器人做什么”的准确判断。3、对话决策与行为生成:构建面向真实场景的多轮对话、任务规划、记忆管理与交互决策系统,研究语言、表情、注视、手势及全身动作的协同生成,提升机器人交互的连贯性、拟人性与任务完成能力。4、复杂场景交互与智能体建设:针对家庭、商业服务、工业等开放场景,解决多人交互、远近场交互、噪声干扰、指代消解、空间关系理解及动态打断等问题,构建具备环境认知和持续交互能力的机器人智能体。5、系统集成与端侧部署:与大模型、感知、运动控制、硬件及测试团队紧密协作,推动交互算法与机器人软硬件系统深度集成;持续优化端侧推理性能、交互时延、系统稳定性及用户体验。6、数据闭环与效果评估:建立机器人交互数据采集、标注、训练、评测和线上迭代体系,设计任务成功率、意图识别准确率、响应时延、自然度及用户满意度等评估指标,推动算法持续迭代。7、技术影响力建设:跟进人机交互、多模态大模型及具身智能领域的最新进展,通过技术创新和系统落地,形成具有行业竞争力的机器人交互解决方案。 职位要求 1、计算机、人工智能、自动化、机器人、电子信息等相关专业,本科及以上学历。2、熟悉语音、计算机视觉、自然语言处理、多模态学习或人机交互中的一种或多种技术方向。3、对多模态信息融合、对话系统、意图识别、智能体规划或动作生成具备扎实的理论基础和实践经验。4、熟练掌握 Python、C++、PyTorch 等开发工具,具备良好的算法开发、工程实现及系统调试能力。5、具备真实场景算法落地经验,能够针对噪声、时延、算力限制和传感器误差等问题进行系统性优化。6、具备良好的产品意识、用户体验意识和跨团队协作能力,能够从实际交互效果出发推动算法迭代。加分项1、有机器人、人机交互、智能音箱、数字人、车载交互或多模态智能体项目经验。2、熟悉 ASR、TTS、VAD、声源定位、视觉语言模型、对话大模型或生成式动作模型。3、熟悉 ROS/ROS 2、机器人传感器及感知—决策—控制系统。4、有端侧部署、实时音视频处理、模型量化或推理加速经验。5、在 HRI、多模态学习、语音、视觉或自然语言处理相关领域发表过高水平论文。 投递...
【27届校招】Research Scientist / Engineer(具身智能方向) 北京、深圳、上海 正式 互联网 / 电子 / 网游 智能机器人板块 职位描述 岗位简介面向通用人形机器人及真实物理世界场景,参与打造行业领先的具身智能大模型。围绕多模态大模型(VLA / Omni / VLM / LLM 等)的研究、训练、工程化与端侧落地展开工作,推动模型与机器人感知、认知、决策、控制及人机交互系统的深度融合,构建面向真实场景的下一代智能体系统。我们欢迎不同侧重的候选人:无论你更擅长前沿算法研究、大规模训练与工程化,还是系统集成与端侧部署,都能在这里找到合适的位置。职位描述1、前沿模型研究与打造:参与研究可泛化、可 Scaling 的多模态大模型(如 VLA、Omni 等),探索文本、语音、视觉、视频、动作等多模态信息的统一表征、理解、推理与生成,提升模型在开放环境下的通用智能与全身动作控制能力。2、多模态感知与自然交互:研究融合语音、视觉、语言、表情、手势、姿态与动作的多模态交互算法,提升机器人在复杂场景下的感知、意图理解、对话决策与行为生成能力,打造自然、实时、拟人的交互体验。3、大规模训练与数据体系:参与多模态数据构建与大规模训练、后训练、指令微调、偏好对齐、强化学习等技术研发,持续优化训练效率、稳定性与模型效果。4、工程化、系统集成与端侧部署:与算法、感知、运动控制、硬件及测试团队紧密协作,推动模型与机器人软硬件系统的深度集成;探索模型压缩、量化、蒸馏、推理加速及端侧异构部署,持续优化时延、性能与稳定性。5、技术影响力建设:紧跟国际学术界与工业界最新进展,通过算法创新、技术攻坚、论文专利及系统迭代,形成具有行业影响力的技术成果。 职位要求 1、教育背景:计算机、人工智能、自动化、电子信息、机器人、数学等相关专业,硕士及以上学历(研究或工程能力突出者可放宽)。2、基础能力:具备扎实的机器学习/深度学习基础,在 VLM、LLM、多模态、语音、RL、Robotics、3D Vision、AIGC 或人机交互等方向中的一个或多个有研究或实践经验。3、工程能力:熟练掌握 Python / C++ 与 PyTorch 等主流框架,具备良好的算法实现、系统调试与代码工程能力;熟悉
实时多模态交互工程实习生(R12069) 上海、北京 实习 职位描述 岗位职责参与实时多模态交互核心功能的开发与测试。接入和调试端到端大模型、Realtime API 协议设计与实现 等服务。参与上下文管理、工具调用、任务编排和状态管理能力建设。协助实现 VAD、对话判停、拒识和打断等交互能力。编写单元测试与集成测试,复现并定位时序、并发和链路问题。参与机器人或开发环境中的联调和效果验收。 职位要求 任职要求计算机、人工智能、自动化、软件工程等相关专业在读。做过多模态相关项目,理解上下文、工具调用和任务编排等基本概念。了解异步编程、WebSocket、流式接口或事件驱动系统中的至少一项。能够使用 Git、Linux及常见调试工具。有测试意识,愿意通过实验和数据验证结论。学习能力强,能够主动拆解和推进技术问题。加分项使用过 OpenAI Agents SDK、ADK、Livekit agent、Pipecat、Agentscope 或类似 Agent 框架。接触过 Realtime API、流式语音交互或 WebRTC。熟悉 VAD、ASR、PCM 音频或基础音频处理。有机器人、智能硬件或嵌入式 Linux 项目经验。使用过 ONNX Runtime、TensorRT 或其他端侧推理工具。有开源项目、技术博客、竞赛或可演示的个人项目。们希望你不满足于“模型能够返回结果”,愿意继续追踪时延、错误和边界情况。能清楚说明自己做过的项目,以及其中真正由自己完成的部分。遇到不确定的问题时,能够提出假设并设计验证方法。对实时多模态交互和机器人方向有长期兴趣。你将获得参与真实机器人交互闭环系统从骨架到落地的完整经历。深入接触实时音视频交互、联合Agent 工程化及端侧部署。在导师指导下负责可以独立验收的功能模块。表现优秀者可获得转正机会。 投递...
Career Area:Engineering Job Description: Your Work Shapes the World at Caterpillar Inc. When you join Caterpillar, youre joining a global team who cares not just about the work we do – but also about each other.
语音算法工程师(无麦K歌) 北京、上海 社招 全职 数字技术 本科及以上 5-7 年 职位描述 负责车载K歌&语音信号处理算法的研发与优化,包括语音降噪、回声消除、抗啸叫、麦克风阵列信号处理等;参与车载语音交互、语音通话、K歌等场景的声音增强与音质优化;推动算法在产品中的落地,实现实时处理与车机端侧部署;跟踪语音信号处理及听觉模型领域的前沿技术,持续提升算法性能。 职位要求 精通传统语音信号处理以及模型声学前端算法,降噪、分离、AFC、AEC、VAD、AGC、混响抑制等;信号处理、声学、电子信息、计算机、人工智能等相关专业,硕士及以上学历;熟练掌握 Python / C++,了解 PyTorch、TensorFlow、ONNX 等深度学习框架;具备良好的代码规范与工程实现能力,沟通顺畅,能协同多团队与供应商推进项目落地。优先条件:有端侧语音算法研发与部署经验;有K歌或娱乐音频算法研发经验;有多麦克风阵列语音增强或分离经验。 投递...
校招-座舱语音算法工程师(信号处理) 北京、上海 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-正式批 职位 ID:A44602 职位描述 负责车载语音信号处理算法的研发与优化,包括语音增强/分离、回声消除等相关模型训练;推动算法在产品中的落地,实现实时处理与车机端侧部署;与语音算法或芯片供应商进行技术对接与联调,评估并优化第三方方案;跟踪语音信号处理领域的前沿技术,持续提升算法性能。 职位要求 信号处理、声学、电子信息、计算机、人工智能等相关专业,硕士及以上学历;熟悉语音信号处理基础算法(降噪、分离、AEC、VAD、AGC、混响抑制等);熟练掌握 Python / C++,了解 PyTorch、ONNX等深度学习框架;具备良好的代码规范与工程实现能力,沟通顺畅,能协同多团队与供应商推进项目落地。 投递...
校招-大模型算法工程师(业务闭环方向) - 纵向 上海、北京 校招 正式 数字技术 - 算法 硕士及以上 2027届校园招聘-正式批 职位 ID:A165211A 职位描述 负责端到端规划模型纵向驾驶能力的优化,覆盖起步,提速、保持车距、碰撞避免、防御性限速等关键场景,提升行驶安全与体验。结合业务经验高效筛选目标场景数据,对模型进行监督微调,实现性能的精细迭代。设计纵向决策的强化学习奖励函数,搭建RL训练与数据闭环,驱动模型持续进化。跟进端到端智能辅助驾驶前沿技术,参与算法在量产平台上的部署与落地。 职位要求 职位要求硕士及以上学历,计算机、人工智能、自动化、机器人等相关专业。扎实的深度学习基础,精通监督学习与强化学习算法,熟练使用PyTorch等主流框架。理解智能辅助驾驶规划任务,熟悉端到端模型(如模仿学习、强化学习)的常用方法,有相关项目经验。具备优秀的工程落地能力,能独立完成数据处理、模型训练与深度分析。面对开放问题有很强的自学与拆解能力,善于团队协作,沟通主动。加分项具有端到端智能辅助驾驶(如UniAD、VAD等)或规划决策模块的实际研发经验。在机器人/智能辅助驾驶领域有丰富的强化学习落地经验,曾设计并调优复杂奖励函数。在CVPR、ICRA、NeurIPS等顶级会议发表过规划或决策相关论文。 投递...
语音算法工程师(ASR大模型 ) 上海、深圳 全职 职位描述 1、负责端到端语音识别大模型的训练、微调与优化,面向机器人语音交互场景、构建高鲁棒性识别能力;2、基于 Whisper、Parakeet 等大规模预训练模型,进行压缩(蒸馏、量化)、结构优化与风格适配,提升模型推理效率与产品适配性;3、研究并实现多模态融合识别方案,强化复杂场景下语音感知能力、推进先进训练范式落地;4、联合VAD、声纹模块,构建具备全链路协同优化能力的语音系统;5、关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情。 职位要求 1、本科及以上学历,计算机、人工智能、电子、数学等相关专业;2、出色的问题分析和解决能力,自主探索新解决方案的能力强;3、关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情;4、熟悉当前主流语音大模型架构,具备 ASR 预训练/微调经验。加分项:1、有 Whisper 等大模型的蒸馏调优、参数高效微调(如 LoRA、Adapter)经验者2、精通NeMo 等开源工具链,具备分布式训练与模型压缩能力;3、有机器人语音系统研发经验或复杂语音场景(噪声、多人、跨语种)实战经验者;4、在HCI、HRI、RSS、CVPR、ECCV、ICCV、NeurIPS、ICLR、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者;5、具有优秀的代码能力和竞赛精神,ACM/ICPC、RoboMaster等比赛获奖者。 投递...