Refine Reset All
Sort by
Job Type
Employer/Recruiter
Date Posted
Location
Job Type
Employer/Recruiter
All Filters

Reflection Jobs In 北京 - 5 Job Positions Available

1 – 5 of 5 jobs
KAON jobs

算法工程师 - LLM后训练 Beijing Full-time R&D - Algorithm Responsibilities 参与公司AI算法相关工作,专注于提升大语言模型(LLM)的生成质量,推动技术创新和产品落地,具体职责包括但不限于:1. 监督微调:深入研究和实施大语言模型(LLM)的SFT、RFT等技术方案,优化AI的情感表达能力和剧情设计能力,突破长期记忆、行为一致性等技术难点2. 奖励模型:基于海量用户交互日志和反馈数据,深入挖掘真实用户偏好信号,构建高质量的偏好数据集;设计并实现包括生成式奖励模型(GRM)、过程奖励模型(PRM)等在内的多维度奖励函数3. 强化学习:深入理解PPO、DPO、GRPO等常用LLM强化学习方法,结合具体业务目标(如上下文一致性、逻辑正确性、OOC等),设计定制化的奖励组合与训练策略4. Agent:面向复杂、多步骤的业务场景,设计并实现基于大语言模型的Agent架构;集成工具调用(Tool Use)、记忆机制(Memory)、反思(Reflection)、多智能体协作等范式实现复杂任务的能力跃迁 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;3. 在虚拟角色生成、角色扮演、情感陪伴等方向有项目经验或论文成果者优先;4. 能系统性拆解角色类模型在生成一致性、长期记忆等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。 Apply...

KAON  28 days ago
KAON jobs

算法工程师 - Agent Beijing Full-time R&D - Algorithm Responsibilities 负责公司AI Agent方向的算法研究与落地工作,围绕个性化内容生成与长期记忆构建,将大模型训练技术(SFT、RL等)应用于Agent能力的持续提升,具体职责包括但不限于:1. Agent架构设计:面向个性化内容生成和角色交互场景,设计并实现基于大语言模型的Agent架构;定义Agent的编排流程、工具调用(Tool Use)、反思(Reflection)等核心范式,使Agent能够基于用户画像和历史交互生成高度个性化的内容与回复2. Agent训练与优化:运用SFT、RFT、PPO、DPO、GRPO等训练方法,针对Agent场景设计专项训练方案;构建Agent行为轨迹数据集,通过强化学习优化Agent的个性化生成质量、记忆调用准确性和多轮对话一致性3. 训练环境设计:构建Agent训练所需的真实可执行交互环境(工具调用沙箱、用户模拟器、多轮对话场景等),定义状态空间、动作空间和反馈信号,为Agent提供高质量的训练闭环4. 奖励建模:设计Agent专用的奖励函数与评估体系,针对个性化程度、内容一致性、记忆调用准确性、用户满意度等多维目标,结合过程奖励模型(PRM)、生成式奖励模型(GRM)以及个性化奖励模型(Personalized RM,基于用户偏好和交互历史动态调整奖励信号),实现对Agent行为链路的细粒度奖励,解决奖励稀疏、奖励欺骗等核心难题5. 记忆与个性化系统:构建可解释、可迁移、可控的Agent记忆架构,支持用户偏好的长期建模与动态更新;实现记忆的版本化管理,支持精确遗忘(通过token删除)和跨模型迁移,保障个性化体验的连续性与可控性6. 持续学习(Continual Learning):研究并实现Token Space下的持续学习机制,通过更新Agent的learned context(系统提示、记忆库、工具定义等)而非模型权重来实现Agent的持续进化;解决context poisoning(上下文污染)/ context rot(上下文退化)等有限上下文窗口下的记忆退化问题,在避免灾难性遗忘的前提下实现Agent知识的增量积累8. 快速实验与迭代闭环:具备从eval构建、数据准备、方案实现到结果评估的全链路快速实验能力;参与Agent的线上A/B实验设计,通过线上效果度量和用户反馈分析定位算法瓶颈,驱动下一轮训练与模型优化的方向 Qualifications 1. 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;2. 熟悉NLP相关的算法和技术,具备大模型训练和RL算法的实践经验;3. 对LLM-based Agent系统有深入理解,具备Agent训练或Agent系统相关的项目经验;4. 能系统性拆解Agent在长期记忆管理、个性化内容生成、上下文窗口利用等场景的挑战,提出创新解决方案;5. 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。加分项:1. 在Agent记忆机制、个性化生成、持续学习、上下文优化(如DSPy等prompt optimization方法)等方向有论文成果;2.

KAON  21 days ago
懂车帝 Dongchedi jobs

大模型算法工程师(LLM)-校招【27届】 北京 AI车青年 职位 ID:A214507 职位描述 1. 负责大语言模型(LLM)及智能体(Agent)在汽车垂类场景的端到端落地,覆盖AI销售、智能客服等公司级核心产品功能;2. 构建基于 智能体协作(Tools/Skills/Handoffs) 的智能体系统,实现多步骤任务规划能力;3. 探索并应用 思维链(Chain-of-Thought, CoT)、自我反思(Reflection)等机制,提升模型在复杂购车咨询、对比分析、金融贷款等高阶推理任务中的表现;4. 参与LLM强化学习优化链路建设,包括偏好数据构建、可验证奖励强化学习(RLVR);5. 与产品、工程、业务团队紧密协作,推动算法模型从实验到上线的全链路工程化落地,并建立科学的效果评估与迭代机制; 职位要求 1. 计算机、人工智能、自动化、数学或相关专业,硕士及以上学历;2. 扎实的机器学习理论基础,深入理解Transformer架构及主流大模型(如LLaMA、Qwen、DeepSeek、GPT系列)的训练与推理机制;3. 具备完整的LLM应用落地经验,熟悉 Prompt Engineering、SFT、DPO 等技术路径,并有实际项目验证效果;4. 对智能体(Agent)技术栈有实践积累,包括但不限于:基于CoT的任务分解与推理、多工具调用(Function Calling)与执行反馈闭环、自主规划(Planning)与状态记忆(Memory)机制、基于用户行为或模拟反馈的策略优化方法5. 熟练掌握Python,具备良好的工程实现与系统设计能力,了解服务端部署、模型监控与AB测试流程;6. 精通PyTorch/TensorFlow等框架,了解分布式训练、推理加速(vLLM/TensorRT-LLM等)、模型量化等优化技术;7. 具备优秀的逻辑思维、业务抽象能力与跨团队协作意识,能将复杂用户需求转化为可量化的技术方案;加分项(优先考虑)1. 有垂直领域(汽车、电商、客服等)智能体或强化学习落地经验;2. 在ICLR、NeurIPS、ICML、ACL、EMNLP等顶会发表过LLM、Agent或RL相关论文;3. 熟悉多智能体协作(handoffs architecture)、可验证奖励强化学习(RLVR);4. 参与过开源Agent框架(如LangChain、LlamaIndex、AutoGen)的二次开发或优化;5. 具备大模型评估体系设计经验,尤其在事实一致性、工具调用准确率、任务完成率等维度有方法论沉淀。 投递...

Premium Full-time
懂车帝 Dongchedi  13 days ago
Cummins jobs

Job Summary: Works in a variety of finance roles, during a two-year developmental program. Based on assigned location, responsibilities will vary, including the preparation of analyses, forecasts and reports, support of the annual budget process, and

Cummins  2 days ago
VAST jobs

资深 Agent 工程师(Tripo Studio · Canvas Agent) Beijing Experienced Full-time Responsibilities 【我们在做什么】Tripo 做 3D 生成:把文本、图片和交互变成可交付的 3D 资产。https://tripo3d.ai本岗位在 Agent 团队,负责 Studio 中的 Canvas Agent:把自然语言、参考图和画布操作,编排成可执行的创作流程。工作重点是 Agent 架构、评测,以及效果、成本、时延之间的取舍。【你将负责】1. 端到端创作链路:基于自然语言、参考图和画布交互,规划并执行「生成 → 检查 → 分割 / 局部编辑 → 贴图 → 重拓扑

VAST  1 day ago

Subscribe for job alerts and resources to make your job search easier!

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

Receive the latest job openings for:

reflection jobs in 北京

Confirmation email sent to

Check your email and click on the link to start receiving your job alerts

All Filters Apply
Sort by
Job Type
Employer/Recruiter