Refine Reset All
Sort by
Skills
Job Type
Employer/Recruiter
Date Posted
Skills
Location
Job Type
Employer/Recruiter
All Filters

Caption Jobs In - 16 Job Positions Available

1 – 15 of 16 jobs
ShengShu jobs

数据项目经理(caption) 北京 全职 互联网 / 电子 / 网游 职位描述 1、进度管理:负责Caption数据生产项目全流程管理(需求拆解→排期→执行→交付),制定项目计划、里程碑及资源分配方案,主动识别风险点并制定应对预案,跨团队协调算法、数据策略、法务合规及外部供应商,对齐目标、推动卡点解决;2、 质量管理:深入理解算法团队对Caption数据的目标与边界条件,制定标注规范与验收框架;针对Caption任务,沉淀幻觉、漏描、冗余、主体识别、动作/镜头语言描述、文风一致性等维度的判定标准;建立Badcase库与典型样例集,定期组织校准会拉齐标注员认知;对质检数据做归因分析,推动Guideline、培训、工具、流程的持续优化;3、供应商与团队管理:负责离岸外包团队及国内标注基地的日常管理,包括产能调配、结算与汰换;主导供应商准入评估与试标,动态维护供应商质量与产能;建立SOP、FAQ及争议样本仲裁流程,缩短问题响应时长。 职位要求 1、本科及以上学历,3年以上数据标注项目管理经验,有Caption数据生产经验优先;2、对视频Caption任务有深入理解,熟悉镜头语言、主体描述、动作描写等质量维度;3、有管理离岸或大规模外包团队的实际经验,具备较强的多任务并行管理能力;4、抗压、Owner意识强,能在高节奏迭代中持续交付;5、 有自动化质检/workflow搭建经验优先;6、较强的项目推动力、跨团队协作能力与文档撰写能力;7、加分项:影视/编导/导演/摄影/剪辑相关专业,熟悉镜头语言、分镜、叙事结构;或在数据公司或大厂有视频/图像Caption标注、质检、项目管理实战经验。 投递...

Premium Full-time
ShengShu  6 days ago
KAON jobs

AIGC图像数据工程师 Beijing Full-time R&D - Data mining Responsibilities - 负责图像与多模态数据全生命周期建设:围绕业务目标与模型训练需求,搭建数据获取 → 清洗 → 标注/弱标注 → 评估 → 版本管理 → 回流迭代的闭环流程。- 参与端到端多模态统一模型的数据体系:图文交错序列、多轮长轨迹、理解 + 生成联合数据、跨帧一致性(角色/场景/光线/风格/世界观)数据的构造、清洗、标注与配比。- 数据采集与合规治理:推进数据来源梳理、授权/版权风险排查、敏感内容过滤与安全策略落地,建立可审计的数据资产规范。- 清洗与质量提升:实现去重(近重复/语义重复)、质量筛选(清晰度/噪声/美学/主体完整性等)、异常检测(NSFW/水印/低质/违规)与长尾数据治理。- 数据标注体系建设:设计并迭代标注 schema(caption、tag、属性、风格、构图、人物/商品信息、图文交错结构、多轮对话轨迹等),制定标注指南与质检规则,推动标注一致性与效率提升。- 难例挖掘与数据配比:围绕线上问题(如一致性、可控性、编辑失败、风格偏移、长程一致衰减等)挖掘难例与负例,构建训练集/验证集配比策略与覆盖度分析。- 数据工程化与平台化:参与数据管线工程建设(ETL/调度/缓存/存储/索引),支持大规模数据处理与高吞吐读取,提升训练数据供给效率与稳定性。- 数据评估与可观测性:建立数据质量指标与报表(分布漂移、覆盖率、噪声率、标注一致性等),支持「数据 → 训练 → 评测」的问题定位。- 跨团队协作:与算法/训练工程/产品/运营协作,将业务问题沉淀为可复用的数据策略、工具链与最佳实践文档。 Qualifications -

KAON  18 days ago
High Scale jobs

About High Scale We’re High Scale — a future-focused, data-obsessed agency revolutionizing video advertising on TV and social media. Think Amazon’s obsession with customer experience meets SpaceX’s fearless ambition—that’s the DNA behind everything we do. Our

High Scale  16 days ago
X Square Robot (自变量机器人) jobs

多模态理解算法实习生 深圳、北京 研发 - 算法 实习生招聘 职位描述 1. 参与面向物理世界的具身理解大模型研发,协助提升模型在视觉定位、复杂点指、空间理解、任务规划、人机交互等场景下的感知与认知能力;2. 参与分析多模态模型在理解、推理、空间/时间定位等任务上的能力边界,协助构建用于具身基座模型训练的高质量数据;3. 参与多模态数据管线建设,包括文本、视觉、视频、动作等数据的合成、清洗、标注、格式化与质量评估;4. 协助构建视频理解相关数据,包括人类行为、事件识别、Video Caption、Temporal Grounding 等方向;5. 参与长程行为/任务拆解、CoT 推理标注与评测集构建,为模型训练和效果迭代提供支持。 职位要求 1. 在读本科、硕士、博士研究生;计算机视觉、自然语言处理、多模态大模型、人工智能等相关方向优先;2. 熟悉 Python,具备较好的编程能力,熟悉 PyTorch 等主流深度学习框架;3. 了解主流多模态大模型/VLM/MLLM,对视觉理解、视频理解、空间理解、具身智能等方向有兴趣;4. 有模型训练、微调、评测、数据处理或 benchmark 构建经验者优先;5. 熟悉 Chain-of-Thought、强化学习、多模态推理、Temporal Grounding、Video Caption 等相关技术者优先;6. 具备较强的学习能力、执行力和责任心,能够稳定实习 6 个月及以上者优先。加分项1. 有多模态大模型、视频理解、空间智能、具身智能相关论文、项目或开源经历;2. 有大规模数据清洗、标注体系设计、自动化评测或数据

X Square Robot (自变量机器人)  9 days ago
ShengShu jobs

视频生成算法实习生 (训练算法) 北京 实习 互联网 / 电子 / 网游 职位描述 负责视频生成基础模型的核心训练与架构迭代,围绕 DiT、VAE、refiner、omni 架构等方向,提升模型的画质、动态、指令遵循、多镜头一致性和训练稳定性:1. 负责视频 DiT 架构设计与训练,包括 attention 结构、position encoding、长视频建模、多分辨率训练、多任务混训等。 2. 探索 REPA、self-flow等训练算法,提高收敛效率和生成质量。 3. 负责视频 VAE 架构与算法优化,提升压缩率、重建质量、时序稳定性和训练/推理效率。 4. 探索 refiner / enhancer / second-stage model,用于提升细节、质感、动态稳定性和最终可用率。 5. 探索

ShengShu  7 days ago
ShengShu jobs

VLM视频理解算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、负责 PE Model、Caption Model、Reward Model 三类 VLM 的训练与优化,基于千卡级算力进行大规模模型训练,探索 SFT、RL、Agentic RL 等训练方法,持续提升模型在视频理解、视频描述和视频质量评价等任务上的能力,训练业界 SOTA 的视频理解 VLM 和流式视频理解 VLM;2、负责 VLM Agent 的设计与训练,探索 VLM 在复杂视频理解任务中的 Agent 化能力,包括任务规划、工具调用、多轮推理、长视频分析等,结合 Agentic RL 等方法提升模型复杂任务的自主推理与问题解决能力;3、负责三类 VLM 的训练数据构建与优化,针对视频理解、视频描述、视频质量评价等任务,通过规则匹配、自动化方法及外包标注团队进行数据筛选、标注和质检,持续提升训练数据的规模与质量,并探索适用于

Premium Full-time
ShengShu  7 days ago
Automatically Get Matched to caption Jobs Let our AI agent search and match you to the best jobs from across the web
Try it now
ShengShu jobs

数据策略工程师 (音频) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义什么是好数据好音频:为视频/音频生成的训练与评测制定内容质量标准,覆盖切片、清洗、标注/caption、以及语音、音乐、音效、音画一致性等维度的判断依据,沉淀为可落地的数据生产标准与标注SOP。2、搭建评测与质检标准:从听觉内容与音频工程双重视角建立数据质量评估体系与benchmark评测集标准,定义质检维度与判定口径;抽检数据生产结果,持续定位质量短板并反哺标准迭代。3、推动标准的量化落地:与量化及工程团队协作,把内容与听感标准翻译成可统计、可自动化的指标与质检规则。4、跨团队对齐:协同算法、产品、评测团队对齐训练与评测需求,推动数据优化方案落地,并评估其对模型效果的实际影响。 职位要求 1、专业级听觉审美与音频判断力:深入理解声音设计、音乐性、对白/人声表演、混音与声场关系,能从专业视角评价音频质量。2、相关经验:有录音/混音、音乐制作、声音设计、音频后期或音频数据运营经验;尤其看重在影视/音乐/播客等语境下做过评测、质控或标注规范制定的经历。3、能把主观判断写成标准:可将模糊的听感/内容判断拆解为可解释、可复用、可传递给标注团队执行的规则。4、加分项:熟练用vibe coding/AI工具为工作提效;熟悉主流音频/音乐/语音生成模型如Suno、Udio、ElevenLabs等。 投递...

Premium Full-time
ShengShu  7 days ago
ShengShu jobs

数据策略工程师 (编剧导演) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义视频 Caption 体系:面向视频生成模型的训练需求,制定一段视频应该被如何描述的标准——明确 caption 需覆盖哪些维度(动作与动机、情节推进、场景与调度、镜头运动、时序关系、主体与环境等),以及每个维度写到什么颗粒度、用什么语言风格,产出为可落地的 caption 编写规范与标注 SOP,能直接传递给标注团队执行;2、搭建 Caption 质检标准:定义一条 caption 合不合格的判定口径(如描述是否准确、是否遗漏关键动作/情节、动作与意图是否对应、时序是否正确、语言是否符合规范、是否存在幻觉/过度脑补等);建立抽检机制,持续定位标注质量短板并反哺 caption 规范迭代;3、推动标准的量化落地:与量化及工程团队协作,把 caption 的编写规范与质检口径翻译成可统计、可自动化的质检规则与指标(如覆盖度、准确率、prompt-视频语义对齐、时序/动作一致性等),提升质检效率;4、跨团队对齐:协同算法、产品、评测团队,理解模型对 caption 的真实诉求(如指令遵循、复杂动作序列、多镜头叙事所需的描述方式),推动 caption 体系优化并评估其对模型效果的实际影响。 职位要求 1、专业级叙事与画面解读能力:深入理解剧本结构、人物动机、戏剧冲突、场面调度与镜头语言,能从编剧/导演的专业视角准确读懂一段视频在演什么、怎么演的,并把它讲清楚。顶尖影视院校编剧/导演专业背景优先,但更看重实际的描述与拆解能力,而非获奖或作品履历。2、相关经验:有编剧、导演、剧本策划、分镜/故事板、影视内容策划等经验;尤其看重做过标注规范制定、内容描述/打标、质控口径设计的经历;有 AI 视频标注 / caption SOP 制定经验者优先;3、能把描述标准写成规则:可将一段视频该怎么被描述这件事,拆解为可解释、可复用、可传递给标注团队执行的公式化标准——让不同的人对同一段视频写出的 caption 尽量一致。这是本岗位的核心能力;4、加分项:a. 熟练用 vibe coding / AI 工具为工作提效,主动探索学习新技能;b. 熟悉主流视频生成模型如

ShengShu  7 days ago
ShengShu jobs

数据策略工程师 (日语) 北京 全职 互联网 / 电子 / 网游 职位描述 1、定义什么是好数据好视频(日语语料):为视频生成的训练与评测制定内容质量标准,覆盖切片、清洗、标注/caption、美学与叙事等维度的判断依据;针对日语内容(动画、日剧、日影、综艺、日语解说/配音素材等)建立本地化的判断口径,沉淀为可落地的数据生产标准与标注SOP;2、搭建评测与质检标准:从内容/美学视角建立数据质量评估体系与benchmark评测集标准,定义质检维度与判定口径;负责日语数据的字幕/对白转写、caption翻译与文化语境准确性的判定;3、推动标准的量化落地:与量化及工程团队协作,把内容标准翻译成可统计、可自动化的指标与质检规则;4、跨团队对齐:协同算法、产品、评测团队对齐训练与评测需求,充当中日语境之间的标准翻译者。 职位要求 1、日语专业能力+视频审美判断力:日语达到母语或接近母语水平,能准确理解日语对白、字幕、文化梗与语境;同时具备专业级视频审美,理解镜头语言、叙事逻辑、剪辑手法,熟悉日本影视/动画的叙事与美学传统者优先;2、相关经验:有影视制作、视频编辑、视频数据运营,或日语内容的翻译/字幕/本地化/内容审校经验;尤其看重做过评测、质控或标注规范制定的经历;3、能把主观判断写成标准:可将模糊的美学/内容判断拆解为可解释、可复用、可传递给标注团队执行的规则;4、加分项:熟练用vibe coding/AI工具为工作提效;熟悉主流视频生成模型如Seedance、Kling等;中文可作为工作语言。 投递...

Premium Full-time
ShengShu  7 days ago
ShengShu jobs

数据策略工程师 (小语种) 北京 全职 互联网 / 电子 / 网游 职位描述 1、英文机标 caption 的母语校准:对本语种视频的机器生成英文 caption 做准确性判断,重点定位三类错误——对白/屏内文字被机器听错、OCR 误读;文化与本地化误判(如服饰、节庆、习俗、禁忌、地域符号被写错);语境/叙事层面的英文描述偏差;2、语言无关的视觉/美学类错误可走通用流程,你聚焦语言与文化相关的部分。搭建本语种评测基准:为本语种沉淀一套可复用的评测集与判定样例,把「什么算对、什么算错、边界在哪」用可解释、可传递给外包的方式写下来;3、数据质检与抽检:对本语种生产数据结果做质检/抽检,量化本语种的短板(误译、漏译、字幕时轴错位、caption 未捕捉文化语境等),形成可反馈给上游的问题清单;4、落地与管理本语种外包评审池:作为本语种外包评审员的招募把关、培训、终审与冲突仲裁者;通过双人盲审、交叉验证等方式,保证外包产出质量,而不是靠信任个人;5、与机制/策略岗协作:接收统一的质检口径与 SOP 框架,负责把它准确落到本语种;把本语种的特殊性(该语言/文化独有的坑)反馈给机制岗,供其迭代。 职位要求 1、母语/近母语能力:精通至少一门目标语种(韩、德、意、西、俄),具备母语级的听译、转写、字幕断句与时轴判断力,能识别俚语、习俗、禁忌、地域表达等文化本地化问题;2、视频内容判断力:理解镜头语言、叙事逻辑、剪辑手法,能从专业视角评价视频质量。顶尖影视院校背景优先,但更看重实际的评测/质控判断力,而非创作履历;3、相关经验:有影视/字幕/本地化(配音、SDH、L10N)语境下做过评测、质控或标注规范制定的经历;有视频数据运营、AI 视频标注 SOP 制定经验者优先,看重「在影视/字幕语境做过评测质控」,而非单纯翻译或口笔译履历;4、能把主观判断写成标准:可将模糊的美学/内容/语言判断,拆解为可解释、可复用、可传递给外包评审执行的规则;5、加分项:熟练用 vibe coding / AI 工具为工作提效,主动探索学习新技能;熟悉主流视频生成模型(如 Seedance、Kling、Happyhorse 等),了解行业现状与痛点并有独立认知;掌握多门目标语种;有母语评审员池管理、或本语种数据配比治理经验。 投递...

ShengShu  7 days ago
ShengShu jobs

数据策略工程师(量化质控) 北京 全职 互联网 / 电子 / 网游 职位描述 1、把质量定义成能数出来的东西:把切片、清洗、标注/caption、格式规范等各环节的质量要求,翻译成一组可计算、可复现的量化指标与判定口径(如格式合规率、重复率、时长/分辨率分布、caption缺失率等),沉淀为带明确阈值的质检规则;2、建立分层质检体系:针对数据生产的每个环节,判断哪些质检可全自动量化(规则/正则/统计可判)、哪些必须靠人力抽检、哪些是机器初筛+人工复核,并为每一类设计对应的判定流程与判定线;3、让人力质检变科学:为需要人工判断的环节设计科学抽样方案——根据数据量、置信水平、误差范围确定抽样量与抽样方式,输出可复现、可解释的抽检结论,而非凭感觉抽几十条下结论;4、持续定位质量短板并反哺标准:对上千万级数据批量跑量化检查,输出质量报告与分布分析,发现系统性问题(某来源格式错误率偏高、某批次重复率异常等),反馈给生产与标准团队迭代;5、跨团队对齐:协同算法、产品、评测及内容团队,对齐数据质量需求,推动质检方案落地,并评估其对训练/评测数据的实际改善。 职位要求 1、 聪明、学习能力强:本科及以上,985/211或同等水平院校优先,数学、统计学、数据科学/数据分析等定量专业优先;2、量化拆解能力:能把这批数据质量怎么样这种模糊问题,拆成一组能数出来的指标,并说清每个指标怎么算、判定线定在哪、为什么这么定(本岗位最核心能力);3、统计抽样素养:人力质检时懂科学抽样——能根据数据量、置信水平、误差范围算出该抽多少、怎么抽,理解抽样结论的可信区间,不拍脑袋下结论;4、轻量工具能力:能用正则/SQL/Excel/简单脚本自己把数跑出来、把分布画出来,可借助AI工具完成,不要求独立开发系统或搭建pipeline;5、加分项:有数据分析、数据质检、统计、数据运营相关背景或经验;熟练用vibe coding/AI工具为工作提效;了解主流视频生成模型(如Seedance、Kling、Happyhorse等)对数据质量的要求。 投递...

Premium Full-time
ShengShu  6 days ago
ShengShu jobs

视频生成算法实习生 (数据) 北京 实习 互联网 / 电子 / 网游 职位描述 负责视频模型研发中,数据 → 模型训练 → 评测 → 迭代 的完整研发链路:1. 视频数据理解、筛选、质量建模与 Data Scaling2. Caption / VLM workflow、多模态数据算法3. OCR / ASR / Detection 等多模态信息融合4. 设计数据策略,并通过 模型训练和 Ablation 直接验证收益5. 参与视频基础模型训练、实验分析和版本迭代 职位要求

ShengShu  2 days ago
ShengShu jobs

视频生成算法工程师 (数据) 北京 全职 互联网 / 电子 / 网游 职位描述 负责视频模型研发中,数据 → 模型训练 → 评测 → 迭代 的完整研发链路:1. 视频数据理解、筛选、质量建模与 Data Scaling2. Caption / VLM workflow、多模态数据算法3. OCR / ASR / Detection 等多模态信息融合4. 设计数据策略,并通过 模型训练和 Ablation 直接验证收益5. 参与视频基础模型训练、实验分析和版本迭代 职位要求

ShengShu  2 days ago
ShengShu jobs

VLM视频理解算法工程师 北京 全职 互联网 / 电子 / 网游 职位描述 1、核心 VLM 训练与落地:负责 PE Model(Prompt 增强)、Caption / Recaption Model(视频重描述/密集描述)、Reward Model(质量评价与打分)等各类视频 VLM 的训练与实际落地。基于千卡级算力完成大规模 SFT、RL(DPO/PPO/RLHF 等)训练,实操提升模型在视频理解、细粒度 Caption 生成、视频 quality/alignment 评估上的效果。2、高质量数据构建与工程化(核心重点):负责三类 VLM 训练数据的全流程构建。针对视频 Recaption、视频质量打分、Prompt 生成等任务,结合规则清洗、VLM 打标/伪标签自动化流程,以及外包标注团队的管理与质检,持续积累和打磨高质高量的训练数据,并构建精准的 RL 奖励/反馈数据。3、评测体系建设与 Badcase 修复:负责三类 VLM 的

ShengShu  2 days ago
ShengShu jobs

多模态数据算法工程师 (视频) 北京 实习 研发 - 算法 职位描述 1、视频预处理与解码:负责原始视频的元数据探测、转码、HDR→SDR、黑边检测、音视频分离对齐。优化解码路径(FFmpeg / Decord / GPU decoder),保证大规模任务的吞吐与稳定性;2、镜头与场景切分:设计并落地 shot / scene 切分:镜头边界检测、视觉特征场景合并、按边界切片、jump-cut 检测。建立边界 F1 / mIoU / 长度合规等评估,持续压误切、漏切;3、视觉理解与结构化标注:接入 VLM 做视频 caption、语义打标、实体提取;接入开放词表检测、字幕擦除等视觉算子。保证标注 schema、token 用量、失败重试可统计、可回放。 职位要求 1、算法竞赛获奖经历,或为显著开源贡献者优先,计算机视觉 / 机器学习等相关专业,本科及以上,具有视频理解、视频处理或大规模数据生产经验;2、精通 Python;熟悉 PyTorch 推理落地(加载、batch、混合精度、OOM 降级)。3、熟悉视频容器与编解码:FFmpeg

ShengShu  1 day ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

caption jobs in china

You also might be interested in:

Captions

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Skills
Job Type
Employer/Recruiter