懂车帝 - 评测运营(大模型 / AI 方向) 北京 社招 全职 职位 ID:A50140 职位描述 岗位概述负责懂车帝 AI 大模型业务的评测体系建设与运营,从 0 到 1 搭建各 AI 方向的 Benchmark 评测集,建立标准化评测流程与质量管控机制,通过数据驱动模型效果优化,为算法选型、版本迭代和业务落地提供评测支撑。岗位职责1.评测体系建设:负责懂车帝 AI 大模型相关业务的评测体系从 0 到 1 搭建,包括 Benchmark 设计、评测标准制定、评分规则(Rubric)设计、评测流程规范化,覆盖搜索、问答、内容生成、Agent 等核心场景;2.Benchmark 集搭建:围绕业务目标和真实用户需求,建设覆盖多维度、多场景的评测数据集,设计评测维度与难度分层,保障评测结果的有效性、可比性和可复现性;3.模型评测与选型:开展不同基座模型、主流大模型及内部模型版本的横向评测与深度选型,综合评估模型效果、业务适配性、安全下限和稳定性,形成模型接入标准与版本准入决策依据;4.效果诊断与迭代:建立效果诊断与迭代牵引机制,结合得分、GSB、相关性、结果分布及典型 Case 开展问题定位与根因分析,区分模型能力短板、数据问题、Prompt 优化等不同归因,协同算法团队制定优化方案并验证迭代收益;5.评测资产沉淀:沉淀并运营 Benchmark