岗位职责 负责大语言模型 pretrain 数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向。 将数据算法落地到大规模数据处理流程中,基于 Ray、Spark 等分布式框架处理海量训练数据。 设计并执行数据消融实验,评估不同数据源、质量过滤策略、去重策略、配比方案和采样策略对模型能力的影响。 建设数据到模型效果的实验闭环,结合训练 loss、benchmark、能力维度评测、训练动态和样本分析,定位数据问题并迭代数据策略。 岗位要求 计算机、人工智能、数学、统计学等相关专业,本科及以上学历。 熟悉大语言模型预训练范式,理解 pretrain 数据对模型能力、训练稳定性和 scaling behavior 的影响。 具备扎实的机器学习、NLP 或大模型算法基础,能够独立完成算法设计、实验设计、结果分析和策略迭代。 熟练使用 Python,熟悉 PyTorch、TensorFlow、JAX 等至少一种深度学习框架。 熟悉大规模数据处理,有 Ray、Spark 等分布式计算框架使用经验。 具备良好的工程实现能力,能够将数据算法实现为稳定、高效、可复用的大规模处理 pipeline。 具备较强的数据分析能力,能从 loss 曲线、评测结果、数据分布和样本案例中定位问题。 具备良好的论文阅读、问题拆解和跨团队协作能力。 加分项 有 LLM