语音算法工程师(ASR大模型 ) 上海、深圳 全职 职位描述 1、负责端到端语音识别大模型的训练、微调与优化,面向机器人语音交互场景、构建高鲁棒性识别能力;2、基于 Whisper、Parakeet 等大规模预训练模型,进行压缩(蒸馏、量化)、结构优化与风格适配,提升模型推理效率与产品适配性;3、研究并实现多模态融合识别方案,强化复杂场景下语音感知能力、推进先进训练范式落地;4、联合VAD、声纹模块,构建具备全链路协同优化能力的语音系统;5、关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情。 职位要求 1、本科及以上学历,计算机、人工智能、电子、数学等相关专业;2、出色的问题分析和解决能力,自主探索新解决方案的能力强;3、关注生成式 AI 和多模态交互技术,对推动人形机器人智能化有热情;4、熟悉当前主流语音大模型架构,具备 ASR 预训练/微调经验。加分项:1、有 Whisper 等大模型的蒸馏调优、参数高效微调(如 LoRA、Adapter)经验者2、精通NeMo 等开源工具链,具备分布式训练与模型压缩能力;3、有机器人语音系统研发经验或复杂语音场景(噪声、多人、跨语种)实战经验者;4、在HCI、HRI、RSS、CVPR、ECCV、ICCV、NeurIPS、ICLR、SIGGRAPH或SIGGRAPH Asia等顶级会议/期刊上发表论文者;5、具有优秀的代码能力和竞赛精神,ACM/ICPC、RoboMaster等比赛获奖者。 投递...
校招-座舱语音大模型算法工程师(ASR) 北京、上海 校招 正式 数字技术 - 算法 本科及以上 2027届校园招聘-正式批 职位 ID:A07469 职位描述 1. 参与语音识别算法研发与优化,提升算法性能和效果;2. 参与研发业界领先的语音大模型算法和落地工作,负责数据生产处理、模型预训练、微调及强化学习等相关工作;3. 跟进并深入调研语音、音频、语言、多模态等大模型前沿技术,为算法迭代提供技术支撑;4. 配合团队完成模型训练、性能评估与测试优化,协同产品、测试等跨团队,高效推进语音算法的交付与落地。 职位要求 1. 数学、计算机信号处理、自动化、软件工程等相关专业,本科及以上学历(硕士优先);2. 熟悉语音识别、大模型等核心算法,包括深度学习、LLM等;3. 熟练掌握C/C++/Python编程语言,精通常用设计模式、算法及数据结构, 深入了解pytorch、tensorflow、vllm等主流深度学习框架和开源工具;4. 有良好的理解、沟通和逻辑分析能力;5. 学习能力强,工作积极主动,注重细节,做事耐心。 投递...
The Opportunity SoundHound AI believes every person should be able to interact naturally with the products around them–by simply talking. With a global reach spanning two dozen languages, we build Voice AI products with conversational intelligence
The Opportunity SoundHound AI believes every person should be able to interact naturally with the products around them–by simply talking. With a global reach spanning two dozen languages, we build Voice AI products with conversational intelligence
端侧全模态大模型工程专家 北京、上海、深圳 社招 全职 技术 - 基础架构 职位 ID:A133605 职位描述 1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;2. 深入全模态模型双工异步工作流推理开发与优化;3. 模型量化、KV Cache 管理与投机推理加速;4. 分析硬件性能调优与内存管理;5. 跟进主流芯片厂商技术栈演进; 职位要求 1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;3. 有Orin平台开发经验;4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;5. 精通 C/C++/python;6. 具备 异步多线程计算、内存管理优化 实战经验;7.
视频生成算法工程师 (Reward Model) 北京、深圳、上海 全职 研发 - 算法 职位描述 负责视频生成 reward model、benchmark 和评测、迭代体系建设,把主观视频质量拆解成可训练、可评测、可追踪的多维信号:1. 与数据团队合作,制定和把控视频生成打分标准。2. 对音视频理解专家模型进行质量评估、bad case 收集和持续迭代,如ASR、说话人、音色、语种、音效、音画同步等音频专家模型,以及OCR、目标检测、动作识别、切镜点检测、镜头运动估计等视觉专家模型。3. 训练多维 reward model,包括视觉 RM、音视频 RM、语义遵循 RM、美学 RM、崩坏判定模型等。4. 建立 benchmark 和自动评测 pipeline,结合人工评测、专家模型交叉验证 RM 准确度。5. 发现 benchmark 被 hack、RM 偏置和评测失真问题,持续优化评测可信度。6. 为后训练、数据清洗、模型选型和交付版本提供依据,并结合评测反馈、用户数据,持续迭代 RM。
Company Description Turner & Townsend is a global professional services company with over 22,000 people in more than 60 countries. Working with our clients across real estate, infrastructure, energy and natural resources, we transform together delivering
About Wati Started as a WhatsApp team inbox in 2020, Wati has evolved into an AI-powered customer engagement platform that goes beyond a single channel. Designed for businesses that sell, support, and grow through conversations, Wati
智能语音交互开发工程师/专家 上海、深圳 全职 职位描述 1、负责机器人智能语音交互的语音SDK模块设计与开发;2、具有一定语音SDK软件架构设计能力,能够进行SDK接口定义和封装;3、负责语音算法工程化,语音唤醒、识别、语义等集成开发工作;4、负责语音性能分析和优化,包括CPU、内存优化、内存泄露、端到端耗时优化等; 职位要求 1、本科及以上学历,3-5年及以上智能语音开发经验;2、负责过语音交互产品的设计与开发,具备语音交互产品的接口设计与功能开发能力;3、熟悉语音(唤醒、ASR、TTS、声纹)及自然语言处理(NLU、DM、NLG)等基本技术和原理,具有独立分析定位语音链路中问题的能力;4、熟练掌握C++语音编程,熟悉常见设计模式,有扎实的面向对象设计和实现能力;5、具有良好的编码风格,熟悉常用的质量保证工具与技术,保证代码的质量与稳定性;6、抗压能力强,有ownership能够端到端负责业务模块;7、具有良好的沟通能力、团队合作精神,能够与产品、开发、测试等进行有效的沟通。 投递...
AI课程产品经理 Shenzhen Full-time Responsibilities 1、调研AI教育、语言学习领域技术趋势与竞品技术亮点,结合大模型、NLP等技术,制定AI课程产品规划及迭代路线。2、主导AI课程核心技术相关功能设计(如AI对话陪练、智能纠错、发音评测等),定义Prompt工程规则,撰写产品文档,明确技术落地要求。3、协同AI算法、研发团队,推进AI课程技术方案落地、测试及上线,解决开发中的技术相关产品问题。4、跟踪AI课程技术效果,通过数据与用户反馈,优化AI模型应用、功能体验及技术适配性。 Qualifications 1、本科及以上学历,2年以上AI产品(优先AI教育、AI课程方向)相关经验,熟悉语言学习产品逻辑者加分。2、精通大模型、NLP、ASR/TTS等AI技术原理,能清晰拆解技术需求,与算法、研发团队高效协同。3、具备技术敏感度与数据思维,能基于技术可行性设计产品,熟练使用常用产品工具,沟通推进能力强。4、了解AI课程技术落地难点,对AI教育有热情,英文流利者优先。 Apply...
【27届校招】语音大模型算法工程师(北京/上海) 北京、上海 正式 研发 - 算法 职位描述 1、参与大模型相关核心算法的研发、迭代优化与业务落地,涵盖模型预训练、微调、Prompt / 对齐优化、RAG 检索增强、多模态融合等关键能力的工程化与落地应用;2、跟进大模型、强化学习、多模态等领域的前沿技术(顶会论文 / 开源项目 / 行业主流方案), 通过实验对比与方案迭代,解决模型泛化性、推理精度、场景适配等核心问题;3、参与数据闭环工作:数据集构建、清洗、标注、质量管控与持续迭代,完成模型训练、评测、复盘全流程,输出规范的实验文档与技术报告;4、协同团队完成算法测试、业务实验与项目推进, 保障大模型相关项目高效落地与持续迭代。业务方向: 大模型算法 / 语音多模态算法 / Agent 与记忆系统 职位要求 1、硕士及以上学历,计算机科学、人工智能、数学、电子工程、自动化、语音语言学等相关专业;2、基础能力:-扎实的机器学习 / 深度学习理论基础 (Transformer、Attention、Loss 设计、训练范式)-熟练使用 PyTorch 等主流深度学习框架,有实际模型训练 / 调优经验-熟练 Python, 具备扎实的工程实现能力-良好的数学基础(概率论、线性代数、最优化)3、学习能力: 能快速阅读英文顶会论文
Career Area:Supply Chain and Logistics Job Description: Your Work Shapes the World at Caterpillar Inc. When you join Caterpillar, youre joining a global team who cares not just about the work we do – but also
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job Overview Voice AI is designed to deliver low-power wake-up, low-latency, and high-performance on-device voice technologies on Qualcomm platforms. These technologies include Automatic Speech
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As a member of Qualcomm Chinas engineering team dedicated to automotive infotainment and ADAS platforms, you will play a pivotal role in
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As part of the engineering team at Qualcomm China, focusing on automotive infotainment and ADAS platforms, we are seeking talented engineers with
The Opportunity SoundHound AI believes every person should be able to interact naturally with the products around them–by simply talking. With a global reach spanning two dozen languages, we build Voice AI products with conversational intelligence
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job Function We are looking for talent software developers for Qualcomm China gaming team, focusing on Artificial Intelligence (AI) technologies in gaming. You will
Company: Qualcomm China Job Area:Engineering Group, Engineering Group Software Engineering General Summary: Job overview: As a member of Qualcomm Chinas engineering team dedicated to automotive infotainment and ADAS platforms, you will play a pivotal role in
【27届校招】Research Scientist / Engineer(具身智能方向) 北京、深圳、上海 正式 互联网 / 电子 / 网游 智能机器人板块 职位描述 岗位简介面向通用人形机器人及真实物理世界场景,参与打造行业领先的具身智能大模型。围绕多模态大模型(VLA / Omni / VLM / LLM 等)的研究、训练、工程化与端侧落地展开工作,推动模型与机器人感知、认知、决策、控制及人机交互系统的深度融合,构建面向真实场景的下一代智能体系统。我们欢迎不同侧重的候选人:无论你更擅长前沿算法研究、大规模训练与工程化,还是系统集成与端侧部署,都能在这里找到合适的位置。职位描述1、前沿模型研究与打造:参与研究可泛化、可 Scaling 的多模态大模型(如 VLA、Omni 等),探索文本、语音、视觉、视频、动作等多模态信息的统一表征、理解、推理与生成,提升模型在开放环境下的通用智能与全身动作控制能力。2、多模态感知与自然交互:研究融合语音、视觉、语言、表情、手势、姿态与动作的多模态交互算法,提升机器人在复杂场景下的感知、意图理解、对话决策与行为生成能力,打造自然、实时、拟人的交互体验。3、大规模训练与数据体系:参与多模态数据构建与大规模训练、后训练、指令微调、偏好对齐、强化学习等技术研发,持续优化训练效率、稳定性与模型效果。4、工程化、系统集成与端侧部署:与算法、感知、运动控制、硬件及测试团队紧密协作,推动模型与机器人软硬件系统的深度集成;探索模型压缩、量化、蒸馏、推理加速及端侧异构部署,持续优化时延、性能与稳定性。5、技术影响力建设:紧跟国际学术界与工业界最新进展,通过算法创新、技术攻坚、论文专利及系统迭代,形成具有行业影响力的技术成果。 职位要求 1、教育背景:计算机、人工智能、自动化、电子信息、机器人、数学等相关专业,硕士及以上学历(研究或工程能力突出者可放宽)。2、基础能力:具备扎实的机器学习/深度学习基础,在 VLM、LLM、多模态、语音、RL、Robotics、3D Vision、AIGC 或人机交互等方向中的一个或多个有研究或实践经验。3、工程能力:熟练掌握 Python / C++ 与 PyTorch 等主流框架,具备良好的算法实现、系统调试与代码工程能力;熟悉
【27届校招】具身智能算法工程师/研究员(人机交互) 深圳、上海、北京 正式 研发 - 算法 智能机器人板块 职位描述 1、机器人自然交互算法研发:面向通用人形机器人及真实物理世界场景,研发融合语音、视觉、文本、表情、手势、姿态和动作的多模态交互算法,打造自然、实时、主动且具有人格一致性的机器人交互体验。2、多模态感知与意图理解:研究复杂环境下的语音识别、声源定位、说话人识别、视觉感知、行为理解、情绪识别及多模态意图融合,实现机器人对“谁在说、对谁说、表达什么、希望机器人做什么”的准确判断。3、对话决策与行为生成:构建面向真实场景的多轮对话、任务规划、记忆管理与交互决策系统,研究语言、表情、注视、手势及全身动作的协同生成,提升机器人交互的连贯性、拟人性与任务完成能力。4、复杂场景交互与智能体建设:针对家庭、商业服务、工业等开放场景,解决多人交互、远近场交互、噪声干扰、指代消解、空间关系理解及动态打断等问题,构建具备环境认知和持续交互能力的机器人智能体。5、系统集成与端侧部署:与大模型、感知、运动控制、硬件及测试团队紧密协作,推动交互算法与机器人软硬件系统深度集成;持续优化端侧推理性能、交互时延、系统稳定性及用户体验。6、数据闭环与效果评估:建立机器人交互数据采集、标注、训练、评测和线上迭代体系,设计任务成功率、意图识别准确率、响应时延、自然度及用户满意度等评估指标,推动算法持续迭代。7、技术影响力建设:跟进人机交互、多模态大模型及具身智能领域的最新进展,通过技术创新和系统落地,形成具有行业竞争力的机器人交互解决方案。 职位要求 1、计算机、人工智能、自动化、机器人、电子信息等相关专业,本科及以上学历。2、熟悉语音、计算机视觉、自然语言处理、多模态学习或人机交互中的一种或多种技术方向。3、对多模态信息融合、对话系统、意图识别、智能体规划或动作生成具备扎实的理论基础和实践经验。4、熟练掌握 Python、C++、PyTorch 等开发工具,具备良好的算法开发、工程实现及系统调试能力。5、具备真实场景算法落地经验,能够针对噪声、时延、算力限制和传感器误差等问题进行系统性优化。6、具备良好的产品意识、用户体验意识和跨团队协作能力,能够从实际交互效果出发推动算法迭代。加分项1、有机器人、人机交互、智能音箱、数字人、车载交互或多模态智能体项目经验。2、熟悉 ASR、TTS、VAD、声源定位、视觉语言模型、对话大模型或生成式动作模型。3、熟悉 ROS/ROS 2、机器人传感器及感知—决策—控制系统。4、有端侧部署、实时音视频处理、模型量化或推理加速经验。5、在 HRI、多模态学习、语音、视觉或自然语言处理相关领域发表过高水平论文。 投递...