数据项目经理(caption) 北京 全职 互联网 / 电子 / 网游 职位描述 1、进度管理:负责Caption数据生产项目全流程管理(需求拆解→排期→执行→交付),制定项目计划、里程碑及资源分配方案,主动识别风险点并制定应对预案,跨团队协调算法、数据策略、法务合规及外部供应商,对齐目标、推动卡点解决;2、 质量管理:深入理解算法团队对Caption数据的目标与边界条件,制定标注规范与验收框架;针对Caption任务,沉淀幻觉、漏描、冗余、主体识别、动作/镜头语言描述、文风一致性等维度的判定标准;建立Badcase库与典型样例集,定期组织校准会拉齐标注员认知;对质检数据做归因分析,推动Guideline、培训、工具、流程的持续优化;3、供应商与团队管理:负责离岸外包团队及国内标注基地的日常管理,包括产能调配、结算与汰换;主导供应商准入评估与试标,动态维护供应商质量与产能;建立SOP、FAQ及争议样本仲裁流程,缩短问题响应时长。 职位要求 1、本科及以上学历,3年以上数据标注项目管理经验,有Caption数据生产经验优先;2、对视频Caption任务有深入理解,熟悉镜头语言、主体描述、动作描写等质量维度;3、有管理离岸或大规模外包团队的实际经验,具备较强的多任务并行管理能力;4、抗压、Owner意识强,能在高节奏迭代中持续交付;5、 有自动化质检/workflow搭建经验优先;6、较强的项目推动力、跨团队协作能力与文档撰写能力;7、加分项:影视/编导/导演/摄影/剪辑相关专业,熟悉镜头语言、分镜、叙事结构;或在数据公司或大厂有视频/图像Caption标注、质检、项目管理实战经验。 投递...
AIGC图像数据工程师 Beijing Full-time R&D - Data mining Responsibilities - 负责图像与多模态数据全生命周期建设:围绕业务目标与模型训练需求,搭建数据获取 → 清洗 → 标注/弱标注 → 评估 → 版本管理 → 回流迭代的闭环流程。- 参与端到端多模态统一模型的数据体系:图文交错序列、多轮长轨迹、理解 + 生成联合数据、跨帧一致性(角色/场景/光线/风格/世界观)数据的构造、清洗、标注与配比。- 数据采集与合规治理:推进数据来源梳理、授权/版权风险排查、敏感内容过滤与安全策略落地,建立可审计的数据资产规范。- 清洗与质量提升:实现去重(近重复/语义重复)、质量筛选(清晰度/噪声/美学/主体完整性等)、异常检测(NSFW/水印/低质/违规)与长尾数据治理。- 数据标注体系建设:设计并迭代标注 schema(caption、tag、属性、风格、构图、人物/商品信息、图文交错结构、多轮对话轨迹等),制定标注指南与质检规则,推动标注一致性与效率提升。- 难例挖掘与数据配比:围绕线上问题(如一致性、可控性、编辑失败、风格偏移、长程一致衰减等)挖掘难例与负例,构建训练集/验证集配比策略与覆盖度分析。- 数据工程化与平台化:参与数据管线工程建设(ETL/调度/缓存/存储/索引),支持大规模数据处理与高吞吐读取,提升训练数据供给效率与稳定性。- 数据评估与可观测性:建立数据质量指标与报表(分布漂移、覆盖率、噪声率、标注一致性等),支持「数据 → 训练 → 评测」的问题定位。- 跨团队协作:与算法/训练工程/产品/运营协作,将业务问题沉淀为可复用的数据策略、工具链与最佳实践文档。 Qualifications -
多模态理解算法实习生 深圳、北京 研发 - 算法 实习生招聘 职位描述 1. 参与面向物理世界的具身理解大模型研发,协助提升模型在视觉定位、复杂点指、空间理解、任务规划、人机交互等场景下的感知与认知能力;2. 参与分析多模态模型在理解、推理、空间/时间定位等任务上的能力边界,协助构建用于具身基座模型训练的高质量数据;3. 参与多模态数据管线建设,包括文本、视觉、视频、动作等数据的合成、清洗、标注、格式化与质量评估;4. 协助构建视频理解相关数据,包括人类行为、事件识别、Video Caption、Temporal Grounding 等方向;5. 参与长程行为/任务拆解、CoT 推理标注与评测集构建,为模型训练和效果迭代提供支持。 职位要求 1. 在读本科、硕士、博士研究生;计算机视觉、自然语言处理、多模态大模型、人工智能等相关方向优先;2. 熟悉 Python,具备较好的编程能力,熟悉 PyTorch 等主流深度学习框架;3. 了解主流多模态大模型/VLM/MLLM,对视觉理解、视频理解、空间理解、具身智能等方向有兴趣;4. 有模型训练、微调、评测、数据处理或 benchmark 构建经验者优先;5. 熟悉 Chain-of-Thought、强化学习、多模态推理、Temporal Grounding、Video Caption 等相关技术者优先;6. 具备较强的学习能力、执行力和责任心,能够稳定实习 6 个月及以上者优先。加分项1. 有多模态大模型、视频理解、空间智能、具身智能相关论文、项目或开源经历;2. 有大规模数据清洗、标注体系设计、自动化评测或数据
视频生成算法实习生 (训练算法) 北京 实习 互联网 / 电子 / 网游 职位描述 负责视频生成基础模型的核心训练与架构迭代,围绕 DiT、VAE、refiner、omni 架构等方向,提升模型的画质、动态、指令遵循、多镜头一致性和训练稳定性:1. 负责视频 DiT 架构设计与训练,包括 attention 结构、position encoding、长视频建模、多分辨率训练、多任务混训等。 2. 探索 REPA、self-flow等训练算法,提高收敛效率和生成质量。 3. 负责视频 VAE 架构与算法优化,提升压缩率、重建质量、时序稳定性和训练/推理效率。 4. 探索 refiner / enhancer / second-stage model,用于提升细节、质感、动态稳定性和最终可用率。 5. 探索
VLM视频理解算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、负责 PE Model、Caption Model、Reward Model 三类 VLM 的训练与优化,基于千卡级算力进行大规模模型训练,探索 SFT、RL、Agentic RL 等训练方法,持续提升模型在视频理解、视频描述和视频质量评价等任务上的能力,训练业界 SOTA 的视频理解 VLM 和流式视频理解 VLM;2、负责 VLM Agent 的设计与训练,探索 VLM 在复杂视频理解任务中的 Agent 化能力,包括任务规划、工具调用、多轮推理、长视频分析等,结合 Agentic RL 等方法提升模型复杂任务的自主推理与问题解决能力;3、负责三类 VLM 的训练数据构建与优化,针对视频理解、视频描述、视频质量评价等任务,通过规则匹配、自动化方法及外包标注团队进行数据筛选、标注和质检,持续提升训练数据的规模与质量,并探索适用于
数据策略工程师 (音频) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义什么是好数据好音频:为视频/音频生成的训练与评测制定内容质量标准,覆盖切片、清洗、标注/caption、以及语音、音乐、音效、音画一致性等维度的判断依据,沉淀为可落地的数据生产标准与标注SOP。2、搭建评测与质检标准:从听觉内容与音频工程双重视角建立数据质量评估体系与benchmark评测集标准,定义质检维度与判定口径;抽检数据生产结果,持续定位质量短板并反哺标准迭代。3、推动标准的量化落地:与量化及工程团队协作,把内容与听感标准翻译成可统计、可自动化的指标与质检规则。4、跨团队对齐:协同算法、产品、评测团队对齐训练与评测需求,推动数据优化方案落地,并评估其对模型效果的实际影响。 职位要求 1、专业级听觉审美与音频判断力:深入理解声音设计、音乐性、对白/人声表演、混音与声场关系,能从专业视角评价音频质量。2、相关经验:有录音/混音、音乐制作、声音设计、音频后期或音频数据运营经验;尤其看重在影视/音乐/播客等语境下做过评测、质控或标注规范制定的经历。3、能把主观判断写成标准:可将模糊的听感/内容判断拆解为可解释、可复用、可传递给标注团队执行的规则。4、加分项:熟练用vibe coding/AI工具为工作提效;熟悉主流音频/音乐/语音生成模型如Suno、Udio、ElevenLabs等。 投递...
数据策略工程师 (编剧导演) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义视频 Caption 体系:面向视频生成模型的训练需求,制定一段视频应该被如何描述的标准——明确 caption 需覆盖哪些维度(动作与动机、情节推进、场景与调度、镜头运动、时序关系、主体与环境等),以及每个维度写到什么颗粒度、用什么语言风格,产出为可落地的 caption 编写规范与标注 SOP,能直接传递给标注团队执行;2、搭建 Caption 质检标准:定义一条 caption 合不合格的判定口径(如描述是否准确、是否遗漏关键动作/情节、动作与意图是否对应、时序是否正确、语言是否符合规范、是否存在幻觉/过度脑补等);建立抽检机制,持续定位标注质量短板并反哺 caption 规范迭代;3、推动标准的量化落地:与量化及工程团队协作,把 caption 的编写规范与质检口径翻译成可统计、可自动化的质检规则与指标(如覆盖度、准确率、prompt-视频语义对齐、时序/动作一致性等),提升质检效率;4、跨团队对齐:协同算法、产品、评测团队,理解模型对 caption 的真实诉求(如指令遵循、复杂动作序列、多镜头叙事所需的描述方式),推动 caption 体系优化并评估其对模型效果的实际影响。 职位要求 1、专业级叙事与画面解读能力:深入理解剧本结构、人物动机、戏剧冲突、场面调度与镜头语言,能从编剧/导演的专业视角准确读懂一段视频在演什么、怎么演的,并把它讲清楚。顶尖影视院校编剧/导演专业背景优先,但更看重实际的描述与拆解能力,而非获奖或作品履历。2、相关经验:有编剧、导演、剧本策划、分镜/故事板、影视内容策划等经验;尤其看重做过标注规范制定、内容描述/打标、质控口径设计的经历;有 AI 视频标注 / caption SOP 制定经验者优先;3、能把描述标准写成规则:可将一段视频该怎么被描述这件事,拆解为可解释、可复用、可传递给标注团队执行的公式化标准——让不同的人对同一段视频写出的 caption 尽量一致。这是本岗位的核心能力;4、加分项:a. 熟练用 vibe coding / AI 工具为工作提效,主动探索学习新技能;b. 熟悉主流视频生成模型如
数据策略工程师 (日语) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义什么是好数据好视频(日语语料):为视频生成的训练与评测制定内容质量标准,覆盖切片、清洗、标注/caption、美学与叙事等维度的判断依据;针对日语内容(动画、日剧、日影、综艺、日语解说/配音素材等)建立本地化的判断口径,沉淀为可落地的数据生产标准与标注SOP;2、搭建评测与质检标准:从内容/美学视角建立数据质量评估体系与benchmark评测集标准,定义质检维度与判定口径;负责日语数据的字幕/对白转写、caption翻译与文化语境准确性的判定;3、推动标准的量化落地:与量化及工程团队协作,把内容标准翻译成可统计、可自动化的指标与质检规则;4、跨团队对齐:协同算法、产品、评测团队对齐训练与评测需求,充当中日语境之间的标准翻译者。 职位要求 1、日语专业能力+视频审美判断力:日语达到母语或接近母语水平,能准确理解日语对白、字幕、文化梗与语境;同时具备专业级视频审美,理解镜头语言、叙事逻辑、剪辑手法,熟悉日本影视/动画的叙事与美学传统者优先;2、相关经验:有影视制作、视频编辑、视频数据运营,或日语内容的翻译/字幕/本地化/内容审校经验;尤其看重做过评测、质控或标注规范制定的经历;3、能把主观判断写成标准:可将模糊的美学/内容判断拆解为可解释、可复用、可传递给标注团队执行的规则;4、加分项:熟练用vibe coding/AI工具为工作提效;熟悉主流视频生成模型如Seedance、Kling等;中文可作为工作语言。 投递...
数据策略工程师 (小语种) 北京 全职 互联网 / 电子 / 网游 职位描述 1、英文机标 caption 的母语校准:对本语种视频的机器生成英文 caption 做准确性判断,重点定位三类错误——对白/屏内文字被机器听错、OCR 误读;文化与本地化误判(如服饰、节庆、习俗、禁忌、地域符号被写错);语境/叙事层面的英文描述偏差;2、语言无关的视觉/美学类错误可走通用流程,你聚焦语言与文化相关的部分。搭建本语种评测基准:为本语种沉淀一套可复用的评测集与判定样例,把「什么算对、什么算错、边界在哪」用可解释、可传递给外包的方式写下来;3、数据质检与抽检:对本语种生产数据结果做质检/抽检,量化本语种的短板(误译、漏译、字幕时轴错位、caption 未捕捉文化语境等),形成可反馈给上游的问题清单;4、落地与管理本语种外包评审池:作为本语种外包评审员的招募把关、培训、终审与冲突仲裁者;通过双人盲审、交叉验证等方式,保证外包产出质量,而不是靠信任个人;5、与机制/策略岗协作:接收统一的质检口径与 SOP 框架,负责把它准确落到本语种;把本语种的特殊性(该语言/文化独有的坑)反馈给机制岗,供其迭代。 职位要求 1、母语/近母语能力:精通至少一门目标语种(韩、德、意、西、俄),具备母语级的听译、转写、字幕断句与时轴判断力,能识别俚语、习俗、禁忌、地域表达等文化本地化问题;2、视频内容判断力:理解镜头语言、叙事逻辑、剪辑手法,能从专业视角评价视频质量。顶尖影视院校背景优先,但更看重实际的评测/质控判断力,而非创作履历;3、相关经验:有影视/字幕/本地化(配音、SDH、L10N)语境下做过评测、质控或标注规范制定的经历;有视频数据运营、AI 视频标注 SOP 制定经验者优先,看重「在影视/字幕语境做过评测质控」,而非单纯翻译或口笔译履历;4、能把主观判断写成标准:可将模糊的美学/内容/语言判断,拆解为可解释、可复用、可传递给外包评审执行的规则;5、加分项:熟练用 vibe coding / AI 工具为工作提效,主动探索学习新技能;熟悉主流视频生成模型(如 Seedance、Kling、Happyhorse 等),了解行业现状与痛点并有独立认知;掌握多门目标语种;有母语评审员池管理、或本语种数据配比治理经验。 投递...
数据策略工程师(量化质控) 北京 全职 互联网 / 电子 / 网游 职位描述 1、把质量定义成能数出来的东西:把切片、清洗、标注/caption、格式规范等各环节的质量要求,翻译成一组可计算、可复现的量化指标与判定口径(如格式合规率、重复率、时长/分辨率分布、caption缺失率等),沉淀为带明确阈值的质检规则;2、建立分层质检体系:针对数据生产的每个环节,判断哪些质检可全自动量化(规则/正则/统计可判)、哪些必须靠人力抽检、哪些是机器初筛+人工复核,并为每一类设计对应的判定流程与判定线;3、让人力质检变科学:为需要人工判断的环节设计科学抽样方案——根据数据量、置信水平、误差范围确定抽样量与抽样方式,输出可复现、可解释的抽检结论,而非凭感觉抽几十条下结论;4、持续定位质量短板并反哺标准:对上千万级数据批量跑量化检查,输出质量报告与分布分析,发现系统性问题(某来源格式错误率偏高、某批次重复率异常等),反馈给生产与标准团队迭代;5、跨团队对齐:协同算法、产品、评测及内容团队,对齐数据质量需求,推动质检方案落地,并评估其对训练/评测数据的实际改善。 职位要求 1、 聪明、学习能力强:本科及以上,985/211或同等水平院校优先,数学、统计学、数据科学/数据分析等定量专业优先;2、量化拆解能力:能把这批数据质量怎么样这种模糊问题,拆成一组能数出来的指标,并说清每个指标怎么算、判定线定在哪、为什么这么定(本岗位最核心能力);3、统计抽样素养:人力质检时懂科学抽样——能根据数据量、置信水平、误差范围算出该抽多少、怎么抽,理解抽样结论的可信区间,不拍脑袋下结论;4、轻量工具能力:能用正则/SQL/Excel/简单脚本自己把数跑出来、把分布画出来,可借助AI工具完成,不要求独立开发系统或搭建pipeline;5、加分项:有数据分析、数据质检、统计、数据运营相关背景或经验;熟练用vibe coding/AI工具为工作提效;了解主流视频生成模型(如Seedance、Kling、Happyhorse等)对数据质量的要求。 投递...
视频生成算法实习生 (数据) 北京 实习 互联网 / 电子 / 网游 职位描述 负责视频模型研发中,数据 → 模型训练 → 评测 → 迭代 的完整研发链路:1. 视频数据理解、筛选、质量建模与 Data Scaling2. Caption / VLM workflow、多模态数据算法3. OCR / ASR / Detection 等多模态信息融合4. 设计数据策略,并通过 模型训练和 Ablation 直接验证收益5. 参与视频基础模型训练、实验分析和版本迭代 职位要求
视频生成算法工程师 (数据) 北京 全职 互联网 / 电子 / 网游 职位描述 负责视频模型研发中,数据 → 模型训练 → 评测 → 迭代 的完整研发链路:1. 视频数据理解、筛选、质量建模与 Data Scaling2. Caption / VLM workflow、多模态数据算法3. OCR / ASR / Detection 等多模态信息融合4. 设计数据策略,并通过 模型训练和 Ablation 直接验证收益5. 参与视频基础模型训练、实验分析和版本迭代 职位要求
VLM视频理解算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、核心 VLM 训练与落地:负责 PE Model(Prompt 增强)、Caption / Recaption Model(视频重描述/密集描述)、Reward Model(质量评价与打分)等各类视频 VLM 的训练与实际落地。基于千卡级算力完成大规模 SFT、RL(DPO/PPO/RLHF 等)训练,实操提升模型在视频理解、细粒度 Caption 生成、视频 quality/alignment 评估上的效果。2、高质量数据构建与工程化(核心重点):负责三类 VLM 训练数据的全流程构建。针对视频 Recaption、视频质量打分、Prompt 生成等任务,结合规则清洗、VLM 打标/伪标签自动化流程,以及外包标注团队的管理与质检,持续积累和打磨高质高量的训练数据,并构建精准的 RL 奖励/反馈数据。3、评测体系建设与 Badcase 修复:负责三类 VLM 的
多模态数据算法工程师 (视频) 北京 实习 研发 - 算法 职位描述 1、视频预处理与解码:负责原始视频的元数据探测、转码、HDR→SDR、黑边检测、音视频分离对齐。优化解码路径(FFmpeg / Decord / GPU decoder),保证大规模任务的吞吐与稳定性;2、镜头与场景切分:设计并落地 shot / scene 切分:镜头边界检测、视觉特征场景合并、按边界切片、jump-cut 检测。建立边界 F1 / mIoU / 长度合规等评估,持续压误切、漏切;3、视觉理解与结构化标注:接入 VLM 做视频 caption、语义打标、实体提取;接入开放词表检测、字幕擦除等视觉算子。保证标注 schema、token 用量、失败重试可统计、可回放。 职位要求 1、算法竞赛获奖经历,或为显著开源贡献者优先,计算机视觉 / 机器学习等相关专业,本科及以上,具有视频理解、视频处理或大规模数据生产经验;2、精通 Python;熟悉 PyTorch 推理落地(加载、batch、混合精度、OOM 降级)。3、熟悉视频容器与编解码:FFmpeg