AIGC图像数据工程师 Beijing Full-time R&D - Data mining Responsibilities - 负责图像与多模态数据全生命周期建设:围绕业务目标与模型训练需求,搭建数据获取 → 清洗 → 标注/弱标注 → 评估 → 版本管理 → 回流迭代的闭环流程。- 参与端到端多模态统一模型的数据体系:图文交错序列、多轮长轨迹、理解 + 生成联合数据、跨帧一致性(角色/场景/光线/风格/世界观)数据的构造、清洗、标注与配比。- 数据采集与合规治理:推进数据来源梳理、授权/版权风险排查、敏感内容过滤与安全策略落地,建立可审计的数据资产规范。- 清洗与质量提升:实现去重(近重复/语义重复)、质量筛选(清晰度/噪声/美学/主体完整性等)、异常检测(NSFW/水印/低质/违规)与长尾数据治理。- 数据标注体系建设:设计并迭代标注 schema(caption、tag、属性、风格、构图、人物/商品信息、图文交错结构、多轮对话轨迹等),制定标注指南与质检规则,推动标注一致性与效率提升。- 难例挖掘与数据配比:围绕线上问题(如一致性、可控性、编辑失败、风格偏移、长程一致衰减等)挖掘难例与负例,构建训练集/验证集配比策略与覆盖度分析。- 数据工程化与平台化:参与数据管线工程建设(ETL/调度/缓存/存储/索引),支持大规模数据处理与高吞吐读取,提升训练数据供给效率与稳定性。- 数据评估与可观测性:建立数据质量指标与报表(分布漂移、覆盖率、噪声率、标注一致性等),支持「数据 → 训练 → 评测」的问题定位。- 跨团队协作:与算法/训练工程/产品/运营协作,将业务问题沉淀为可复用的数据策略、工具链与最佳实践文档。 Qualifications
AIGC图像生成算法工程师 Beijing Full-time R&D - Algorithm Responsibilities - 基于业务目标与产品需求,负责团队图像生成/编辑模型与端到端多模态统一模型的训练迭代与落地,包括但不限于 SFT、偏好对齐 / RL(RLHF / DPO / GRPO 等)。- 负责端到端多模态原生统一模型(理解 + 生成一体)的训练与工程化:图文交错序列建模、统一 token 空间、理解–生成联合训练、原生长上下文与长程一致性的实现与优化。- 负责训练数据全流程建设:数据收集与清洗、质量评估、去重与过滤、难例挖掘、数据配比与版本管理,构建可持续迭代的数据体系与规范。- 负责训练管线与工程化建设:分布式训练(DeepSpeed/FSDP 等)、显存/吞吐优化、checkpoint 管理、训练监控与故障排查,持续提升训练效率与稳定性。- 设计并实现图像/多模态生成质量评估体系:自动指标(CLIP/美学/一致性/可控性/长程一致等)+ 人工评测流程,建立「评测→诊断→迭代」的闭环。- 跟进前沿论文与开源生态(Diffusers/ComfyUI/SD 系列、DiT/Flow Matching,以及自回归多模态、图文交错生成、统一理解-生成模型、长上下文推理/serving),结合业务场景完成复现、改进、实验对比与 A/B 验证。- 跨团队协作(产品/工程/运营),将模型能力沉淀为可复用的训练策略、数据策略与最佳实践文档,推动生产化交付。 Qualifications - 计算机/数学/统计/相关专业本科及以上学历;具备扎实的机器学习与深度学习基础。-
机器人专项-认知智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 【P0】具身多模态大模型(VLM/VLA)算法工程师/资深/专家/TL岗位职责:1. 研究应用大模型实现四足、人形机器人的复杂认知能力,包括: 1. 开放指令任务理解及规划、复杂场景理解、行为决策推理与动作规划,长程任务规划等; 2. 实现机器人自主探索导航 3. 实现高效可泛化的四足、人形机器人的移动、操作联合决策和规划2. 实现基于视觉、深度等的环境感知与3D空间表征,人脸人形识别、人体姿态估计等, 实现精准的空间推理 及action model 动作轨迹规划;3. 开发适配大模型VLM/VLA的场景表征/对齐技术和场景语义识别。训练图像/视频与文本融合的多模态理解大模型,提升模型的跨模态理解能力;4. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建5. 负责基模型的领域预训练,模型微调SFT、强化学习(RLHF)训练,提升夸任务的泛化性能,开发高效的模型评测方法提高迭代效率。6. 解决模型评测/部署/真机测试中的问题,满足项目交付指标要求7. 跟踪前沿技术方案,持续迭代升级方案 岗位要求1. 人工智能、计算机、机器人、自动驾驶、自然语言处理等相关专业硕士或博士学位2. 有如下某个方向研究经验: 1. 熟练掌握主流LLM技术(Bert、GPT、Llama、transformer等),有VLM模型(Llava、QwenVL等)、VLA(action token)模型应用经验, 熟悉生成式AI 技术(diffusion)。
具身智能-认知智能体 深圳、上海 社招 全职 智能制造 / 工业互联网 / 工业自动化 职位描述 【具身多模态大模型(VLM/VLA)算法工程师/资深/专家/TL】岗位职责:1. 研究应用大模型实现四足、人形机器人的复杂认知能力,包括:语音交互、场景理解、行为决策推理与动作规划,长程任务规划等;2. 实现基于视觉、深度等的环境感知与3D空间表征,人脸人形识别、人体姿态估计等, 实现精准的空间推理 及action model 动作轨迹规划;3. 开发适配大模型VLM/VLA的场景表征/对齐技术和场景语义识别。训练图像/视频与文本融合的多模态理解大模型,提升模型的跨模态理解能力;4. 设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建;5. 负责基模型的领域预训练,模型微调SFT、强化学习(RLHF)训练,提升夸任务的泛化性能,开发高效的模型评测方法提高迭代效率;6. 解决模型评测/部署/真机测试中的问题,满足项目交付指标要求;7. 跟踪前沿技术方案,持续迭代升级方案。岗位要求1. 人工智能、计算机、机器人、自动驾驶、自然语言处理等相关专业硕士或博士学位2. 有如下某个方向研究经验: a. 熟练掌握主流LLM技术(Bert、GPT、Llama、transformer等),有VLM模型(Llava、QwenVL等)、VLA(action token)模型应用经验, 熟悉生成式AI 技术(diffusion)。 b. 有量产动静态环境感知或表征经验,熟悉 BEV、Sparse,SAM,VIT,CLIP,DINO c. 具备多模态数据融合(文+视+听)研发经验; d. 掌握主流的具身大模型技术(RT2, π系列、OpenVLA,ACT,
Be a technical engineer/leader of ATNPI Assy/FT process. Take full ownership on assigned process to set-up, validate and detect risk according to six-sigma capability and manufacturability, communicate to stakeholders and mitigate risks to meet project quality,
机器人运动智能专家(轨迹规划) 上海 全职 研发 - 算法 职位描述 1.机器人运动规划与轨迹生成,包括机械臂、灵巧手、双臂协同等动作生成、轨迹优化、避障规划2.持续提升机器人运动稳定性、精度及柔顺性持续学习与泛化3.参与动作Policy训练,技能学习和技能库建设、模型预测控制等开发。推动运动策略 职位要求 学历要求:硕士及以上学历(人工智能、自动化、计算机等相关专业)基本能力: 1 年以上机器人及自动化工作站方案设计经验,能与客户共同分析工艺并提出自动化方案。专业能力:1. 熟悉Open CV、深度学习视觉算法、RGB-D、点云处理;具备三维视觉能力,熟悉相机标定、手眼标定、多相机融合等2. 熟练掌握 Matlab、Python、C++、PyTorch3. 具有以下经验之一:6D pose、FoundationPose、MegaPose、BundleSDF 等4. 理解 CLIP、Representation Learning、Transformer、Vision Encoder 5. 具有六维力/触觉传感器应用、灵巧手开发、Manipulation 研究经验之一的优先 投递...
机器人视觉智能专家 上海 全职 研发 - 计算机视觉 职位描述 1.机器人视觉感知研发,包括但不限于目标检测、分割、状态估计、多目标跟踪、三维目标定位、空间建模及场景理解等2.围绕机器人操作任务开发视觉能力,包括抓取点生成、插接位姿识别、工件定位、接触前视觉引导、双臂协同视觉、动态目标跟踪等3.提供统一的感知输入配合多模态算法专家,将多模态感知融合,将多模态特征及时序信息融合,为控制系统参与机器人AI模型研发,提升机器人跨场景泛化能力 职位要求 学历要求:硕士及以上学历(人工智能、自动化、计算机等相关专业)基本能力: 1 年以上机器人及自动化工作站方案设计经验,能与客户共同分析工艺并提出自动化方案。专业能力:1. 熟悉Open CV、深度学习视觉算法、RGB-D、点云处理;具备三维视觉能力,熟悉相机标定、手眼标定、多相机融合等2. 熟练掌握 Matlab、Python、C++、PyTorch3. 具有以下经验之一:6D pose、FoundationPose、MegaPose、BundleSDF 等4. 理解 CLIP、Representation Learning、Transformer、Vision Encoder 5. 具有六维力/触觉传感器应用、灵巧手开发、Manipulation 研究经验之一的优先 投递...
机器人多模态算法专家 上海 全职 研发 - 算法 职位描述 1.负责VTLA模型研发与优化,视觉、触觉、语言等多模态统一表示建模。2.研究World Model、Diffusion Policy、模仿学习等机器人基础模型3.设计机器人Manupullation Primitive,并支持复杂操作任务组合4.建设机器人数据闭环、包括数据采集、自主标注、训练与评估5.与机器人控制团队协同完成模型部署与性能优化 职位要求 学历要求:硕士及以上学历(计算机、机器人、自动化、AI 相关专业)基本能力: 2 年以上机器人、多模态或具身智能研发经验。专业能力:1. 熟悉一下方向中的多个:Transformer、CLIP、SigLIP 等对比学习模型、多模态学习(Vision-Touch)、Diffusion Policy、IL/RL2. 熟悉 至少一种机器人基础模型:OpenVLA、SmolVLA、π0、Groot3. 熟练掌握 Python、PyTorch、CUDA 、Linux 等;4. 具备车载Haptic、力控传感器、机器人控制相关嵌入式开发经验者优先,熟悉传感器数据采集、滤波、校准算法落地;5. 参与过机器人数据采集、Sim2Real、模型部署流程、有开源项目贡献的优先。 投递...
【基座模型】多模态大模型算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、负责视觉大模型基座架构优化、视觉编码器CLIP性能优化和视觉编码器训练(图像编码器和视频编码器);2、负责CLIP模型小型化优化,包含模型蒸馏效果优化、端侧轻量化模型架构设计、模型裁剪和稀疏训练(结构化稀疏和非结构化稀疏)、对比学习训练调优等;3、参与视觉大模型实际训练和项目落地,主导高效视觉编码器的架构设计和端侧推理性能优化。4、负责部分图文对数据集生产和构建、模型评测等任务 职位要求 1.硕士及以上学历,自动化、计算机等相关专业;2.必须有视觉VIT基座优化经验或者VLM、VLA相关项目落地交付经验;3.优秀的代码技术功底,熟练掌握CLIP编码器的From Scratch训练、VLM多模态预训练和强化学习训练等内容。4.有VIT视觉基座模型的架构设计经验,能针对硬件特性设计高性价比的模型架构。具备以下条件优先:1.在NeurlPS/ICLR/ACL/EMNLP/CVPR/ICCV等会议或期刊上发表过论文者优先。2.获得过国际或国内重要赛事奖项者优先。3.在大模型领域有主导过有影响力项目或者核心技术发布者优先。 投递...
具身智能算法实习生(VLA预训练方向) 深圳 实习 互联网 / 电子 / 网游 职位描述 【关于机器人中心】 小鹏机器人中心专注于构建面向未来的人形机器人系统,融合先进的人工智能(AI)、控制、机械与系统工程,打造能感知、理解、操作并能和现实世界进行交互的下一代机器人。【关于团队】 该部门承担前沿智能方法的预研工作,专注于实现机器人三大核心智能能力:自主移动(导航)、灵巧操作和人机交互。我们深入布局大语言模型(LLM)、多模态视觉语言模型(VLM)和视觉语言行动模型(VLA),实现全流程自研,推动机器人从感知到决策的全面智能化落地。 团队成员遍布深圳、上海和美国硅谷,聚集了世界一流的科研与工程人才。在这里,你将参与推动 LLM/VLM/VLA 与机器人智能体的融合,并在真实的物理世界中验证你的算法。1、算法参与:参与多模态大模型(VLM/VLA)在人形机器人上的算法研究与开发,协助进行VLA预训练泛化性的研究与验证;2、模型优化:协助进行VLA模型的训练与真机效果评估,支持机器人在复杂环境下的感知与行为能力;3、实验验证: 学习并参与模型在机器人真机中的部署与测试,在真实环境中验证和优化模型性能,积累宝贵的行业前沿机器人实际操作经验;4、前沿追踪: 跟踪 Embodied AI(具身智能)领域的最新的论文和开源动向。 职位要求 1、计算机、人工智能、自动化等相关专业本科及以上学历(硕士优先);2、具备扎实的深度学习基础,熟悉 Transformer 架构,对 ViT、CLIP、LLaVA 等主流模型有深入理解;3、有大模型(VLM、LLM)训练经验,熟悉其在多模态任务中的应用;4、对机器人技术有浓厚兴趣,愿意参与真机测试等实践性工作;5、熟练使用 PyTorch、TensorFlow 等深度学习框架,具备良好的工程能力和代码实现能力;6、良好的团队协作与沟通能力,具备快速学习和解决问题的能力。【加分项】1、有机器学习或深度学习项目经验,了解多模态模型的基本概念;2、对人形机器人、智能操作等方向有强烈兴趣;3、熟悉Linux系统和基本的命令行操作;4、有机器人相关课程或项目背景。 投递...
自动驾驶数据挖掘算法工程师/专家 上海、北京 社招 全职 研发 - 算法 职位描述 1. 搭建面向端到端自动驾驶的数据挖掘与处理体系,设计、开发端到端算法需求case挖掘算法;2. 研究前沿算法,进行视频理解、数据生成、视频打标签、视频检索、多模态大模型等技术在自动驾驶领域的落地研究;3. 基于自动驾驶业务需求和产品缺陷,有效、快速的响应下游需求,挖掘corner case场景数据,辅助自动驾驶算法的快速迭代优化;4. 跟进自动驾驶业界先进技术,应用多模数据分析(图像、点云等)技术助力产品落地并创造价值,赋能数据驱动的自动驾驶业务转型。 职位要求 1. 数学/计算机/统计/ 通信/电子等相关专业硕士或博士,具有5年及以上相关研究经历(含硕士/博士期间的研究经历);2. 有实际面向量产的端到端自动驾驶开发经验加分,对端到端自动驾驶的数据需求有深刻理解;3. 熟悉Python、Java、C/C++、Scala等至少一门编程语言,有使用相关算法解决实际问题经验,具备良好的工程实现能力;4. 熟悉至少一种深度学习框架,熟悉常见的机器学习/深度学习模型和算法,例如多模态Clip模型、GBDT、RF、 CNN/RNN、Transformer等;5. 沟通能力强,能够跟非技术人员对技术方案的优势进行有效沟通;逻辑思维好,有优秀的分析/解決问题的能力。 投递...
数据挖掘算法工程师/专家 北京、上海 社招 全职 研发 - 算法 职位描述 1. 基于自动驾驶海量数据,利用机器学习、深度学习和数据挖掘方法,负责相关数据挖掘、场景发现、数据筛选与价值挖掘工作,研发适用于实际业务场景的 AI 模型、算法和工具。2. 负责机器学习/深度学习领域的算法研究与工程落地,包括但不限于图学习、生成学习、迁移学习、强化学习、多模态学习以及各类优化方法的实践与创新。3. 面向自动驾驶感知、预测、规划、仿真、数据闭环等业务场景,探索前沿算法问题,设计并实现可落地的技术解决方案,推动数据驱动的模型迭代和业务发展。4. 建设数据挖掘与智能分析能力,包括规则挖掘、Embedding 检索、向量数据库、图搜索、文搜图/图搜图、多模态理解等能力,提升数据生产、质检、评测和交付效率。5. 结合业务需求,沉淀可复用的数据挖掘工具链和算法平台,支持大规模数据分析、样本召回、长尾场景挖掘、难例发现和数据质量提升。 职位要求 1. 数学、计算机、统计学、通信、电子、自动化等相关专业本科以上学历;具备 3 年及以上机器学习、深度学习或数据挖掘相关研究或工程经验。2. 熟悉 Python、Java、C/C++、Scala 等至少一门编程语言,具备良好的工程实现能力,有大规模数据处理、算法系统开发或模型训练经验者优先。3. 熟悉至少一种深度学习框架,如 PyTorch、TensorFlow、MindSpore 等;熟悉常见机器学习/深度学习模型和算法,包括但不限于 GBDT、RF、CNN、RNN、Transformer、CLIP、多模态模型、Embedding 模型等。4. 具备较强的数据分析和数据建模能力,熟悉常见数据挖掘方法,如聚类、分类、召回、排序、异常检测、相似度检索、特征工程、样本筛选等。5. 有自动驾驶、机器人、智能交通、地图、推荐系统、搜索广告、多模态理解、大规模数据挖掘等相关经验者优先。熟悉大数据处理工具或平台者优先,如 Spark、Flink、Hadoop、Hive、ClickHouse、Doris、Elasticsearch、Milvus、Faiss 等。6. 具备良好的问题抽象能力、技术判断力和沟通协作能力,能够结合业务场景快速定位问题,并推动算法方案落地。加分项1. 有自动驾驶数据闭环、长尾场景挖掘、感知数据挖掘、仿真数据挖掘、数据质检或模型评测经验。2. 有多模态大模型、VLM、CLIP、Qwen-VL、Embedding 检索、向量数据库、RAG、Agent
视觉识别设计师(Visual identity designer) 上海 全职 造型板块 职位描述 We are seeking a multidisciplinary Visual Designer who is equally comfortable behind a camera, in front of an editing timeline, and inside Adobe Creative Suite. You will lead the
智能座舱大模型算法工程师-汽车 北京 校招 正式 算法类 2027届校园招聘计划 职位描述 1、参与汽车舱内外场景下视觉算法与多模态大模型相关研发,支持座舱感知理解能力的训练、评测与迭代;2、参与计算机视觉相关算法的设计与实现,包括目标检测、分类、分割、跟踪、人脸/人体理解、行为识别等方向的模型训练与效果优化;3、参与视觉模型在车载场景下的工程化验证与部署支持,协助完成模型转换、推理性能分析、端侧适配和问题定位;4、与产品、交互、硬件、测试及工程团队协作,结合真实车载场景分析算法效果,推动数据、模型和策略的持续优化;5、跟踪计算机视觉、多模态模型、端侧部署等方向的前沿技术,参与技术方案调研、论文复现、专利总结和创新场景探索。 职位要求 1、本科及以上学历,计算机、人工智能、自动化、电子信息、软件工程等相关专业,计算机视觉、图像处理、机器学习方向优先;2、熟悉 Python / C++ 中至少一种语言,了解 PyTorch、Transformers 等主流深度学习框架,对 DeepSpeed、vLLM、SGLang、TensorRT-LLM 等大模型训练/推理框架有了解者优先;3、熟悉计算机视觉基础算法和常见视觉任务,了解 CNN、Transformer、ViT、YOLO、CLIP、VLM、视频理解模型等视觉与多模态模型中的一种或多种;4、有视觉相关课程项目、科研项目、实习、竞赛或开源项目经验,方向包括但不限于目标检测、图像分类、语义分割、目标跟踪、人脸识别、行为识别、3D视觉等;5、了解模型训练、数据处理、数据增强、模型评测、推理加速、模型压缩或端侧部署中的一种或多种技术;6、对智能汽车、智能座舱、人机交互和端侧 AI 有兴趣,具备较强的学习能力、动手能力和沟通协作能力,愿意在真实产品场景中解决算法问题。 投递...
大模型预训练算法实习生 北京 校招 实习 算法类 职位描述 1. 前沿探索与价值提炼深入调研多模态大模型预训练、世界模型、端到端自动驾驶等前沿方向,包括但不限于:BEV感知+Occupancy Network:从鸟瞰视角统一表达三维环境,结合时序Transformer实现动态障碍物与可通行区域建模。视觉-语言模型(VLM)与驾驶推理:利用CLIP、LLaVA等多模态对齐技术,将自然语言指令、交通规则与视觉特征深度融合,提升复杂场景理解能力。扩散模型与轨迹生成:研究基于扩散策略(Diffusion Policy)的连续轨迹预测与控制,解决多模态不确定性与长尾分布问题。世界模型与因果推理:探索基于隐空间动力学预测的世界模型,实现闭环仿真与决策鲁棒性评估。定期输出高质量调研报告,量化分析各技术路线对量产体验的潜在增益(如接管率降低、舒适度提升、长尾场景覆盖率提高)。2. 量产预训练方案研发参与设计并优化面向量产车端的预训练框架,重点攻克:高效多模态融合:在计算资源受限下,设计轻量化跨模态注意力机制(如Cross-Attention Pruning、Token Merging)。时序一致性预训练:利用对比学习、掩码重建等自监督范式,学习连续帧间的运动规律与语义对应关系。数据驱动的小样本适应:结合在线难例挖掘、自动标注与数据增强(如LiDAR-to-Camera投影扰动、对抗光照模拟),提升模型对极端天气、异形车辆等罕见场景的泛化能力。最终交付可直接部署至实车的预训练权重及配套蒸馏方案,显著提升感知、预测、规划全链路指标。3. 创新攻坚与学术引领聚焦行业级难题,推动技术边界突破:端到端联合优化:打破传统模块化流水线,探索可微规划器与感知特征的梯度直通,实现从像素到控制信号的全局最优。大规模并行预训练:利用ZeRO、FSDP、Megatron-LM等分布式策略,在万卡集群上完成千亿参数多模态模型的稳定训练。闭环评估与安全对齐:构建基于真实路采与仿真引擎的混合评测体系,引入对抗攻击测试、不确定性量化,确保模型行为符合驾驶伦理与法规。鼓励以第一作者身份投稿顶会(CVPR/ICCV/ECCV/NeurIPS/CoRL),并提供完整的实验平台、标注数据和算力支持。 职位要求 硕士及以上学历,计算机视觉、深度学习、自动驾驶、AI大模型等相关专业;在自动驾驶、多模态学习、强化学习/模仿学习等领域有高水平论文发表经历(如顶会一作);具备扎实的编程能力(Python/C++)及主流框架(PyTorch/JAX)开发经验;有知名自动驾驶公司或顶级AI实验室实习经历者优先;在Kaggle、nuScenes、Waymo Challenge等竞赛中获奖者优先。 投递...
生成式搜推大模型算法实习生 北京 校招 实习 软件研发类 职位描述 1. 模型研究: 负责小爱内容垂类(视频、有声资源等领域)生成式检索模型的前沿算法跟进和落地2. 大模型业务 SFT: 参与生成式大模的训练数据构建与 LLM 标注流程,通过多阶段 SFT 迭代优化搜推效果3. 评测体系建设: 协助搭建离线评测数据集,设计、跟踪模型效果,完成模型效果上线验证 职位要求 1. 专业背景 计算机、人工智能、信息检索、数据科学等相关专业在读(本科/研究生),可持续实习 4个月以上,每周4天以上 ;2. 算法基础扎实 熟悉信息检索、推荐系统或 NLP 基础理论;了解向量检索(ANN)、向量量化(VQ/PQ/RQ)等基本概念;3. 大模型相关经验 了解 Transformer 架构及主流大语言模型(LLM)原理;有大模型微调(SFT/RLHF)或 RAG 实践经验者优先;4. 多模态知识加分 有图文多模态模型(CLIP、Qwen-VL、Qwen2.5-Omni 等)使用或训练经验者优先;5.
自动驾驶多模态大模型算法研发实习生 北京 校招 实习 软件研发类 职位描述 1. 参与研发前沿大语言模型、多模态大模型、文生3D方向等相关前沿算法,发表国际顶级论文、申请专利2. 深入调研和关注LLM/VLM/AIGC等方向的前沿技术,重点关注大语言模型和多模态模型Evaluation/SFT/Agent/数据合成技术等相关方向3. 负责多模态理解&3D生成式等算法,如 LLava、GPT、Otter、StabelDiffusion等系列,包括但不限于图像-文本的多模态对话、多模态标签生成、VQA、多模态任务解析、触发、图像数据编辑及生成等。 职位要求 1. 2025届硕士及以上学历在读,人工智能、计算机、自动化、数学相关专业优先;2. 有扩散模型、GAN、ControlNet、LoRA、P-Tuning、NeRF等生成模型使用经验者优先;3. 熟悉多模态 CLIP 等transformer跨模态表征模型,熟悉 LLaVA、GPT-like、Otter、Sora 等前沿多模态大模型原理和训练,了解 LMM 训练中的数据制作、性能调优及评测等环节者优先;4. 有一作顶级会议和期刊文章,有开源项目经验,或在多模态、计算机视觉或机器学习领域的比赛中获得过优异成绩者优先;5. 一周4-5天,且持续6个月以上,有良好的英文读写能力和扎实的数学基础;责任心强,积极主动,有良好的沟通能力和团队合作能力; 投递...
多模态大模型专家 北京 社招 全职 职位 ID:A218222 职位描述 1、多模态大模型在汽车垂类场景的端到端落地:负责多模态大模型(MLLM)在懂车帝核心业务中的研发与应用,覆盖智能导购、车辆视觉理解、智能客服、车况评估、跨模态检索等公司级产品功能,推动算法模型从实验到上线的全链路工程化落地;2、多模态理解与生成系统构建:构建图文融合的多模态理解与生成系统,实现车辆识别、配置解读、外观 / 内饰细粒度理解、车况图文评估、视频理解与摘要等核心能力,持续提升模型在汽车垂类场景下的理解精度与生成质量;3、多模态模型训练与对齐:探索并应用视觉指令微调(Vision Instruction Tuning)、多模态思维链(Multimodal CoT)、视觉 Grounding 等机制,提升模型在复杂购车咨询、车型对比、故障诊断等高阶推理任务中的表现;参与多模态数据构建与优化链路,包括图文对数据清洗、高质量指令数据构建、偏好对齐(RLHF/DPO for MLLM);4、多模态 Agent 与智能交互:设计并开发基于多模态大模型的 Agent 系统,实现图文混合输入下的多轮对话、意图理解、工具调用与自主规划能力,赋能智能导购、AI 搜索等 C 端交互场景,提升用户任务完成率与体验;5、模型评测与迭代机制建设:建立科学的多模态效果评估体系(涵盖图文一致性、视觉理解准确率、指令跟随度等维度),搭建自动化评测与线上 AB 测试链路,持续驱动模型迭代优化;6、跨团队协同与业务落地:与产品、工程、业务团队紧密协作,配合版本规划完成开发上线,快速响应线上效果调优与稳定性追查需求,将复杂业务需求转化为可量化的技术方案。 职位要求 1、计算机、人工智能、自动化、数学或相关专业,硕士及以上学历(本科 + 强项目经验亦可);2、扎实的机器学习与计算机视觉理论基础,深入理解 Transformer 架构及主流多模态大模型(如 LLaVA、Qwen-VL、DeepSeek-VL、GPT-4V、Gemini 等)的训练与推理机制;3、具备多模态模型应用落地经验,熟悉 Prompt Engineering、视觉指令微调(Vision
TapTap 广告算法工程师(校招) 上海 实习 互联网 / 电子 / 网游 技术大类 TapTap 职位描述 1.协助 TapTap 广告系统 CTCVR 排序模型及策略的迭代和优化,从特征挖掘、样本生成、模型结构优化、多目标联合建模等方向提高排序模型的精度,驱动业务增长;2.协助广告系统策略优化,包括但不限定于个性化推荐算法策略的调研和优化,广告竞价机制设计和优化,广告产品的反作弊和竞价算法优化;3.对广告主的行为做深入的理解和分析,制定智能化产品的迭代策略,推动广告系统收入增长。 职位要求 1.本科及以上学历,计算机、人工智能、数学等相关专业在读(2027 年后毕业),每周现场办公 4 天以上;2.具有扎实的计算机视觉或机器学习算法基础,有相关方向顶会论文者优先;3.熟悉常见 AI 生成模型框架及常见多模态模型,如 stable diffusion,CLIP 等;4.熟悉常见广告排序系统模型,如 ESMM,DIN,PLE等。 投递...
多模态数据算法工程师 (视频) 北京 实习 研发 - 算法 职位描述 1、视频预处理与解码:负责原始视频的元数据探测、转码、HDR→SDR、黑边检测、音视频分离对齐。优化解码路径(FFmpeg / Decord / GPU decoder),保证大规模任务的吞吐与稳定性;2、镜头与场景切分:设计并落地 shot / scene 切分:镜头边界检测、视觉特征场景合并、按边界切片、jump-cut 检测。建立边界 F1 / mIoU / 长度合规等评估,持续压误切、漏切;3、视觉理解与结构化标注:接入 VLM 做视频 caption、语义打标、实体提取;接入开放词表检测、字幕擦除等视觉算子。保证标注 schema、token 用量、失败重试可统计、可回放。 职位要求 1、算法竞赛获奖经历,或为显著开源贡献者优先,计算机视觉 / 机器学习等相关专业,本科及以上,具有视频理解、视频处理或大规模数据生产经验;2、精通 Python;熟悉 PyTorch 推理落地(加载、batch、混合精度、OOM