Refine Reset All
通过
工作类型
雇主/招聘方
发布日期
位置
工作类型
雇主/招聘方
所有筛选

Decode 招聘 在 Beijing (Peking) - 1 Job Positions Available

主要城市:
1 – 1 的 1 招聘
ModelBest 招聘

大模型工程师-推理与部署优化 北京 社招 全职 技术 - 基础架构 职位 ID:A23292 职位描述 1、负责大语言模型、多模态模型的推理引擎搭建、优化与线上落地,支撑高并发、低延迟的模型服务;2、基于 vLLM、TensorRT-LLM、SGLang、LightLLM 等主流推理框架进行性能调优,并探索 推测性解码 (Speculative Decoding)、前缀缓存 (Prefix Caching) 等前沿加速技术;3、负责大模型在 NVIDIA A/H 系列、昇腾 等国产加速卡上的适配与算子优化,解决兼容性与性能瓶颈;4、设计与实现高性能模型 Serving 架构,包括 Prefill-Decode (PD) 分离架构、Continuous Batching (连续批处理)、负载均衡、流式输出等;5、基于 Docker、Kubernetes 实现模型服务容器化编排、弹性扩缩容与运维稳定性保障;6、定位并解决线上服务瓶颈:如显存碎片化、OOM、推理崩溃、时延抖动(Tail Latency)、多卡并行异常等;7、与算法团队协作,将训练好的模型权重标准化、工程化,实现快速上线与迭代。 职位要求 1、本科及以上学历,计算机相关专业,2 年及以上大模型部署或推理优化相关经验;2、熟悉多种主流大模型推理框架(如 vLLM,

ModelBest  15天前发布

Subscribe for job alerts and resources to make your job search easier!

确认邮件已发送至

请检查邮件并点击链接,开始接收招聘提醒。

接收这类最新招聘:

decode 招聘 在 beijing

确认邮件已发送至

请检查邮件并点击链接,开始接收招聘提醒。

所有筛选 Apply
通过
工作类型
雇主/招聘方