算法工程师 - LLM后训练 Beijing Full-time R&D - Algorithm Responsibilities 参与公司AI算法相关工作,专注于提升大语言模型(LLM)的生成质量,推动技术创新和产品落地,具体职责包括但不限于:1. 监督微调:深入研究和实施大语言模型(LLM)的SFT、RFT等技术方案,优化AI的情感表达能力和剧情设计能力,突破长期记忆、行为一致性等技术难点2. 奖励模型:基于海量用户交互日志和反馈数据,深入挖掘真实用户偏好信号,构建高质量的偏好数据集;设计并实现包括生成式奖励模型(GRM)、过程奖励模型(PRM)等在内的多维度奖励函数3. 强化学习:深入理解PPO、DPO、GRPO等常用LLM强化学习方法,结合具体业务目标(如上下文一致性、逻辑正确性、OOC等),设计定制化的奖励组合与训练策略4. Agent:面向复杂、多步骤的业务场景,设计并实现基于大语言模型的Agent架构;集成工具调用(Tool Use)、记忆机制(Memory)、反思(Reflection)、多智能体协作等范式实现复杂任务的能力跃迁 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;3. 在虚拟角色生成、角色扮演、情感陪伴等方向有项目经验或论文成果者优先;4. 能系统性拆解角色类模型在生成一致性、长期记忆等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。 Apply...
算法工程师 - Agent Beijing Full-time R&D - Algorithm Responsibilities 负责公司AI Agent方向的算法研究与落地工作,围绕个性化内容生成与长期记忆构建,将大模型训练技术(SFT、RL等)应用于Agent能力的持续提升,具体职责包括但不限于:1. Agent架构设计:面向个性化内容生成和角色交互场景,设计并实现基于大语言模型的Agent架构;定义Agent的编排流程、工具调用(Tool Use)、反思(Reflection)等核心范式,使Agent能够基于用户画像和历史交互生成高度个性化的内容与回复2. Agent训练与优化:运用SFT、RFT、PPO、DPO、GRPO等训练方法,针对Agent场景设计专项训练方案;构建Agent行为轨迹数据集,通过强化学习优化Agent的个性化生成质量、记忆调用准确性和多轮对话一致性3. 训练环境设计:构建Agent训练所需的真实可执行交互环境(工具调用沙箱、用户模拟器、多轮对话场景等),定义状态空间、动作空间和反馈信号,为Agent提供高质量的训练闭环4. 奖励建模:设计Agent专用的奖励函数与评估体系,针对个性化程度、内容一致性、记忆调用准确性、用户满意度等多维目标,结合过程奖励模型(PRM)、生成式奖励模型(GRM)以及个性化奖励模型(Personalized RM,基于用户偏好和交互历史动态调整奖励信号),实现对Agent行为链路的细粒度奖励,解决奖励稀疏、奖励欺骗等核心难题5. 记忆与个性化系统:构建可解释、可迁移、可控的Agent记忆架构,支持用户偏好的长期建模与动态更新;实现记忆的版本化管理,支持精确遗忘(通过token删除)和跨模型迁移,保障个性化体验的连续性与可控性6. 持续学习(Continual Learning):研究并实现Token Space下的持续学习机制,通过更新Agent的learned context(系统提示、记忆库、工具定义等)而非模型权重来实现Agent的持续进化;解决context poisoning(上下文污染)/ context rot(上下文退化)等有限上下文窗口下的记忆退化问题,在避免灾难性遗忘的前提下实现Agent知识的增量积累8. 快速实验与迭代闭环:具备从eval构建、数据准备、方案实现到结果评估的全链路快速实验能力;参与Agent的线上A/B实验设计,通过线上效果度量和用户反馈分析定位算法瓶颈,驱动下一轮训练与模型优化的方向 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP相关的算法和技术,具备大模型训练和RL算法的实践经验;3. 对LLM-based Agent系统有深入理解,具备Agent训练或Agent系统相关的项目经验;4. 能系统性拆解Agent在长期记忆管理、个性化内容生成、上下文窗口利用等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。加分项:1. 在Agent记忆机制、个性化生成、持续学习、上下文优化(如DSPy等prompt optimization方法)等方向有论文成果;2.
大模型算法工程师(LLM)-校招【27届】 北京 AI车青年 职位 ID:A214507 职位描述 1. 负责大语言模型(LLM)及智能体(Agent)在汽车垂类场景的端到端落地,覆盖AI销售、智能客服等公司级核心产品功能;2. 构建基于 智能体协作(Tools/Skills/Handoffs) 的智能体系统,实现多步骤任务规划能力;3. 探索并应用 思维链(Chain-of-Thought, CoT)、自我反思(Reflection)等机制,提升模型在复杂购车咨询、对比分析、金融贷款等高阶推理任务中的表现;4. 参与LLM强化学习优化链路建设,包括偏好数据构建、可验证奖励强化学习(RLVR);5. 与产品、工程、业务团队紧密协作,推动算法模型从实验到上线的全链路工程化落地,并建立科学的效果评估与迭代机制; 职位要求 1. 计算机、人工智能、自动化、数学或相关专业,硕士及以上学历;2. 扎实的机器学习理论基础,深入理解Transformer架构及主流大模型(如LLaMA、Qwen、DeepSeek、GPT系列)的训练与推理机制;3. 具备完整的LLM应用落地经验,熟悉 Prompt Engineering、SFT、DPO 等技术路径,并有实际项目验证效果;4. 对智能体(Agent)技术栈有实践积累,包括但不限于:基于CoT的任务分解与推理、多工具调用(Function Calling)与执行反馈闭环、自主规划(Planning)与状态记忆(Memory)机制、基于用户行为或模拟反馈的策略优化方法5. 熟练掌握Python,具备良好的工程实现与系统设计能力,了解服务端部署、模型监控与AB测试流程;6. 精通PyTorch/TensorFlow等框架,了解分布式训练、推理加速(vLLM/TensorRT-LLM等)、模型量化等优化技术;7. 具备优秀的逻辑思维、业务抽象能力与跨团队协作意识,能将复杂用户需求转化为可量化的技术方案;加分项(优先考虑)1. 有垂直领域(汽车、电商、客服等)智能体或强化学习落地经验;2. 在ICLR、NeurIPS、ICML、ACL、EMNLP等顶会发表过LLM、Agent或RL相关论文;3. 熟悉多智能体协作(handoffs architecture)、可验证奖励强化学习(RLVR);4. 参与过开源Agent框架(如LangChain、LlamaIndex、AutoGen)的二次开发或优化;5. 具备大模型评估体系设计经验,尤其在事实一致性、工具调用准确率、任务完成率等维度有方法论沉淀。 投递...
Job Summary: Works in a variety of finance roles, during a two-year developmental program. Based on assigned location, responsibilities will vary, including the preparation of analyses, forecasts and reports, support of the annual budget process, and
资深 Agent 工程师(Tripo Studio · Canvas Agent) Beijing Experienced Full-time Responsibilities 【我们在做什么】Tripo 做 3D 生成:把文本、图片和交互变成可交付的 3D 资产。https://tripo3d.ai本岗位在 Agent 团队,负责 Studio 中的 Canvas Agent:把自然语言、参考图和画布操作,编排成可执行的创作流程。工作重点是 Agent 架构、评测,以及效果、成本、时延之间的取舍。【你将负责】1. 端到端创作链路:基于自然语言、参考图和画布交互,规划并执行「生成 → 检查 → 分割 / 局部编辑 → 贴图 → 重拓扑