Join the Innovative BytePlus Team As part of BytePlus, youll help enterprise customers build whats next for their business. Leveraging ByteDances cutting-edge technologies, we are devoted to developing innovative products and solutions to shape the future.
Join the Innovative BytePlus Team! As part of BytePlus, youll help both enterprises and AI-native developers build whats next for their business. Leveraging ByteDances cutting-edge technologies in AI models, agent solutions and cloud infrastructure, we are
端侧大模型推理与量化资深工程师 北京 全职 通用智能板块 职位描述 1、负责大模型与语音算法的量化、剪枝、蒸馏等模型精简与加速技术,完成在高通等移动端的转换、部署,保障端侧低延迟与高精度;2、设计并实现端侧推理引擎,负责关键推理优化策略(如 Prompt Cache、投机解码、Flash Attention 等)的工程落地,结合图优化与算子适配,最大化 NPU/CPU/DSP硬件利用率;3、负责跨平台推理 SDK 的架构设计、封装与迭代,提供稳定、高效的端侧推理接口;4、负责推理链路延迟、精度与功耗问题的定位,并给出优化方案,推动端侧推理性能指标达成;5、开发并迭代模型转换、精度与性能自动化测试工具链,提升算法到端侧的交付效率。 职位要求 1、硕士及以上学历,人工智能、计算机、电子、数学等相关专业;2、熟练掌握深度学习与大模型压缩和加速技术,包括量化、剪枝、蒸馏等,有端侧部署与精度调优实践经验;3、熟练掌握大模型推理优化策略(如 Prompt Cache、投机解码、Flash Attention 等),熟悉 SNPE/QNN 或者MTK 等主流平台推理框架;4、熟悉移动端与 Native 开发,熟练使用现代 C++,熟悉 Android Native / HAL 层开发调试与系统级性能分析;5、具备良好的跨团队协作与推动能力,能够与算法团队、芯片供应方紧密沟通,推动模型部署的端到端性能和效果优化;6、熟悉 ARM NEON / DSP intrinsic 等端侧底层加速技术者优先;7、熟悉 ONNX模型,熟悉 MNN/NCNN
CPU性能诊断专家 北京、上海 社招 全职 研发 - 基础架构 职位描述 一、一句话定位专攻在线业务 CPU 性能的诊断与优化专家——解决线上各类资源争抢、性能瓶颈、长尾延迟问题,把在线服务的性能与资源效率做上去。二、你将负责什么1. 性能诊断:定位线上 CPU 相关的资源争抢(CPU / cache / 内存带宽 / 锁 / IO)、毛刺与长尾延迟、吞吐瓶颈,尤其是混部 / 高并发场景下的干扰。2. 性能剖析与调优:用 perf / eBPF / 火焰图等做 profiling,找到内核态 / 用户态热点,给出可落地的优化(代码 / runtime / NUMA
【27届校招】智能座舱端侧Agent研发工程师(北京) 北京 正式 研发 - 算法 职位描述 1、参与端侧智能座舱AI Agent系统的研发,打造基于大语言模型的多模态座舱智能助手,支撑车控、导航、媒体、舱驾融合等核心场景的智能化交互; 2、参与端侧 AI Agent 核心模块的开发,包括任务规划、工具调用、上下文管理、记忆系统等harness相关关键能力的设计与实现,推动智能体系统的迭代落地;3、综合业务场景,参与 Agent 系统的调试与性能优化,解决工程落地中的各类问题,保障系统的稳定性和可扩展性。 职位要求 1、扎实的数据结构和数学基础;2、以Java/C++为基础的扎实编程功底;3、深度了解 LLM API、KV Cache、Tool Use、Reasoning/Planning、Multi-Agent System;4、能够娴熟运用 AI Agent 工具支撑软件开发业务,具备优异的自主技术钻研能力。针对自身暂无实操积累的编程语言、开发框架与技术体系,可借助 AI 辅助完成技术攻关与调研;5、热衷 Agent Harness 体系的研发与学术探索,对大模型输出行为具备精准判别能力。【加分项】1、有ACM/ICPC、NOI、Kaggle等比赛获奖经验;2、有嵌入式C++软件或是Android 开发经验。 投递...
Overview Calix is a cloud and appliance-based platform and managed services company. Broadband service providers leverage the Calix broadband platform, cloud, and managed services to simplify operations, engagement, and service, innovate for their consumer, business. and
端侧 AI 算法部署与工程化工程师 深圳 全职 互联网 / 电子 / 网游 - 研发 职位描述 负责将 CV 或 Audio算法模型,部署到 AI/AR 眼镜的端侧异构算力平台(如主控 SoC 的 NPU/DSP、低功耗视觉协处理器或 MCU)。深入分析端侧芯片的算力瓶颈,熟练运用模型剪枝(Pruning)、量化(PTQ/QAT,如 INT8/INT4 定点化)、知识蒸馏等技术,在保证精度的前提下,将模型显存占用和推理延迟压榨到极致。编写高效的 C/C++ 业务胶水代码,构建从“传感器数据采集(Camera/Mic) - 预处理 - NPU 推理 - 后处理响应”的完整高能效工程流;针对部分场景单一、逻辑简单的感知需求,能够脱离算法研究员,独立完成数据清洗、轻量级模型(如 MobileNet 等小算力网络)的训练、微调与快速工程验证。
【27届校招】AI Infra 模型优化工程师 广州、北京、上海 正式 研发 - 算法 通用智能板块 职位描述 岗位职责 负责大模型推理服务的车端部署、上线,保障服务的高可用、低延迟与稳定性;构建和优化推理框架,提升吞吐、降低时延与显存占用;参与模型量化、压缩、KV Cache 优化等推理加速工作,推动硬件资源的高效利用;与算法、模型团队紧密协作,推动模型从训练到生产环境的高效落地;跟进业界推理优化与部署前沿技术,并在生产环境中落地实践。 职位要求 基本要求 计算机、软件工程、人工智能等相关专业本科及以上学历;熟练掌握 PyTorch熟悉 C++/CUDA 者优先;熟悉主流推理框架(vLLM、SGLang、TensorRT-LLM 等)及其部署优化;熟悉模型量化/压缩技术(GPTQ、AWQ、SmoothQuant、FP8 等); 加分项 熟悉 CUDA 编程、算子优化或 Triton 开发;熟悉模型剪枝,蒸馏等技术有推理成本优化、性能压测或可观测性体系建设经验;对 LLM 推理底层原理(Attention、KV Cache、PagedAttention 等)有深入理解。 投递...
架构建模与性能分析工程师 上海、合肥 社招 全职 工程技术 本科及以上 工作年限不限 职位描述 岗位概述参与智能辅助驾驶 SoC 芯片的架构建模与性能分析工作。通过搭建和维护 cycle-accurate 级别的性能模型,对总线互联、内存子系统及典型 workload 进行建模与仿真,输出架构设计的量化依据,支撑芯片规格定义与微架构决策。核心职责1.架构建模基于 C++/Python 搭建和维护 SoC 级 cycle-accurate 性能模型对 总线拓扑、仲裁策略、Cache 层次结构等关键模块进行参数化建模根据芯片规格演进持续迭代模型,确保模型与设计意图一致2.性能分析针对典型应用场景进行 workload 特征分析与 trace 采集/回放分析总线带宽/延迟瓶颈,输出互联架构优化建议评估 DDR 带宽利用率、Cache 命中率等内存子系统关键指标,协助定义存储层次规格3.RTL 校准与验证将性能模型与 RTL 仿真结果进行对比校准,定位精度偏差并持续收敛协助定义性能回归测试集,确保模型在架构迭代中保持有效性 职位要求 必备条件计算机体系结构、电子工程、微电子等相关专业本科及以上学历熟练掌握 C++ 和 Python,具备良好的工程编码能力理解
AI推理部署实习工程师(具身智能方向) 杭州 校招 实习 互联网 / 电子 / 网游 职位描述 具身模型库工程化落地:负责将点云感知、视觉定位等传统算法,以及Pi0/Groot等VLA模型,在自研大算力芯片上进行推1. 理部署与性能调优,确保精度/延迟指标的统一出口。2. 工具链开发与维护:参与对外发布的一键式训练-推理发版工具链建设,封装底层算子差异,保障模型在不同场景下的精度对齐和长期运行稳定性。3. 模型轻量化加速:配合模型结构优化同学,落地W8A8、W4A16、W4A8等混合精度量化方案;针对Transformer架构和CNN架构进行算子融合与内存排布优化。 职位要求 1. 熟练掌握C++/Python,具备良好的代码习惯和性能分析能力(会使用perf、Nsight等工具)。2. 熟悉ONNX、TensorRT、PyTorch部署链路,有实际将PyTorch模型转为TensorRT/SNPE等端侧引擎并跑通的经验。3. 了解常见量化原理(PTQ/QAT),有实际处理过精度掉点问题。加分项:对VLA(视觉语言动作模型) 的推理架构有基础认知,了解KV Cache、Beam Search等推理优化手段。有机器人、自动驾驶或AR/VR相关的嵌入式部署经验者优先。 投递...
SummaryWe are looking for engineers with a passion for using machine learning to create intelligent applications. Be part of a highly accomplished, deeply technical and close-knit team of machine learning engineers, you will create tools that
处理器架构师(存储侧) 西安、北京、深圳 社招 全职 职位 ID:J2650 职位描述 1. 参与或主导处理器存储子系统微架构设计,包括Cache层次结构(L1/L2/L3)、一致性协议(MOESI/MESI)、预取引擎、TLB/MMU等,进行性能、功耗论证,并完成RTL实现与调优;2. 负责Load/Store单元、Store Buffer、内存控制器接口等数据通路的微架构设计与优化;3. 与指令侧架构、编译器、软件团队协同,确保存储子系统架构方案与指令侧流水线的高效配合,支撑端侧AI芯片高带宽低延时的访存需求;4. 跟踪业界存储子系统前沿技术(如CXL/UCIe互联、AI芯片片上存储架构、近存计算),输出技术洞察,牵引存储架构演进方向;5. 参与芯片流片和回片验证,确保存储子系统架构方案的工程落地; 职位要求 1. 硕士及以上学历,计算机/电子工程/微电子等相关专业;2. 精通计算机体系结构核心理论,深入理解缓存层次结构、一致性协议、虚拟内存管理;3. 熟悉ARM/RISC-V存储子系统架构,熟练使用Verilog/SystemVerilog;4. 掌握Gem5/VCS等工具链,在缓存设计/一致性协议/预取优化/内存子系统至少一个方向有深度研究;5. 有RTL设计或芯片流片经验者优先;6. 具备AI芯片片上存储架构设计经验、大模型访存模式分析能力或跨领域(芯片+AI/编译器)协作经验者优先。 投递...
GPU芯片架构师 上海、北京、西安 社招 全职 职位 ID:Z3987 职位描述 1. 作为GPU交付和应用领域owner,负责SoC中GPU选型、性能能效规划、供电热评估、低功耗策略;2. 负责GPU profile定义和优化、中后端实现策略评估;3. 和三方vendor及SoC团队一起,针对GPU微架构特点实现GPU和SoC/总线/cache/DDR的联合优化设计;4. 和软件及量产团队一起,完成GPU相关软件和应用优化,支撑量产中GPU相关PI/热/memory等问题的端到端交付;5. 跟踪GPU/图形处理器技术演进及端侧AI芯片对GPU算力的需求,牵引三方GPU微架构设计优化; 职位要求 1. 本科及以上学历,计算机/电子工程等相关专业;2. 8年以上工作经验,有处理器背景,特别是GPU图形学和渲染相关知识和经验;3. 作为领域owner参与过2款以上SoC量产商用,对SoC交付和量产有深刻理解;4. 自驱和驱动能力强,能独立推动跨团队协作;5. 有带团队经验者优先;6. 有GPU performance counter分析和业务行为对比分析经验,或具备端侧AI芯片优化、跨领域(GPU+AI框架)协作经验者优先。 投递...
高级总线验证工程师 西安、上海 社招 全职 职位 ID:F6871 职位描述 1. 负责高性能一致性SOC总线验证,独立制定验证计划,搭建维护UVM验证平台(driver/monitor/reference model/checker);2. 编写、收集功能覆盖率,保证验证完备性,确保总线从模块级到子系统级的设计规格充分验证;3. 探索总线验证方法学,研发验证工具,推动验证效率和完备性提升;4. 与芯片设计团队紧密合作,协同解决总线验证过程中的复杂技术问题;与AI/异构计算团队协同,支撑AI芯片高带宽互联场景的验证需求;5. 跟踪AMBA总线协议演进和前沿验证技术(如AI辅助覆盖率收敛),输出技术洞察; 职位要求 1. 本科及以上学历,电子/通信/计算机/自动化等相关专业;2. 5年以上总线领域验证经验;3. 精通SystemVerilog/UVM,精通以功能覆盖率为驱动的验证流程;4. 熟练掌握Perl/Python脚本语言,熟悉AMBA总线协议(NIC/NOC/DesignWare);5. 具备CHI一致性总线协议经验、Cache背景知识和验证经验;6. 有Reference model/VIP开发经验者优先;7. 熟悉处理器微架构(多核一致性/访存子系统)或具备AI芯片高带宽互联验证经验者优先。 投递...
ESL建模工程师 上海、西安、北京 社招 全职 职位 ID:O5097 职位描述 1. 负责开发和优化SoC架构性能模型,对性能关键模型进行微架构性能优化和瓶颈定位;2. 对SoC架构进行性能探索和评估,根据模型仿真结果分析关键瓶颈并给出优化方案;3. 参与ESL建模方法学建设,推动模型精度和仿真效率持续提升;4. 与芯片架构、设计团队协同,用模型驱动架构决策和设计优化;5. 跟踪业界ESL建模和架构探索前沿技术(如AI工作负载建模、异构计算架构探索),输出技术洞察; 职位要求 1. 硕士及以上学历,计算机或电子工程相关专业;2. 3年以上SystemC建模经验;3. 良好的C/C++编程能力;4. 对计算机体系结构有较深入了解(总线/Cache/DDR控制器);5. 有SoC架构性能探索经验者优先;6. 有微架构瓶颈分析和优化经验,或具备AI工作负载分析和异构计算架构探索经验者优先。 投递...
SOC系统能效优化专家 上海、北京、西安 社招 全职 职位 ID:O2822 职位描述 1. 负责Android/iOS平台用户典型业务场景的系统性能能效分析;2. 负责自研芯片平台性能功耗分析和优化,构建性能能效分析工具链和大数据平台;3. 挖掘用户隐藏痛点(续航/游戏/应用体验),提炼产品设计需求;4. 与芯片设计、系统软件团队协同,推动性能能效优化方案落地;5. 跟踪业界竞品平台性能能效前沿技术及端侧AI场景能效需求,进行专利技术挖掘,牵引芯片设计和产品宣传方向; 职位要求 1. 本科及以上学历,计算机/通信/软件/电子等相关专业;2. 3年以上系统性能功耗分析经验;3. 具备C/C++/Python项目开发经验;4. 熟悉ARM体系结构和SoC平台设计架构(CPU/GPU/DPU/DDR/ISP/cache/总线),具备软硬件系统分析能力;5. 有Android/iOS系统性能功耗分析工具使用经验者优先;6. 有编译器工作经验或端侧AI场景性能功耗优化经验者优先。 投递...
AI芯片架构师 上海、北京 社招 全职 职位 ID:U9425 职位描述 1. 参与AI芯片软硬协同架构分析及微架构设计,覆盖推理和训练两个场景;2. 参与AI系统软硬件协同架构设计,包括调度子系统、编译子系统、AI扩展ISA;3. 参与芯片需求分析、分解和管理,整芯片关键特性取舍分析和决策,竞品分析和竞争力规划;4. 与AI算法、编译器、系统软件团队协同,确保AI芯片架构满足端侧AI部署的性能和功耗要求;5. 跟踪业界AI芯片架构前沿技术(如存内计算、稀疏计算、混合精度训练、NVLink/UALink互联),参与芯片关键前沿技术预研; 职位要求 1. 集成电路/微电子/计算机等相关专业;2. 熟悉计算机体系结构、处理器架构,理解指令流水线、分支预测、数据预取、Cache一致性、页表转换等原理;3. 扎实的电路设计能力,熟悉低功耗设计、性能和面积优化方法;4. 熟悉AI计算模式(矩阵乘、卷积、Attention等),了解大语言模型/计算机视觉等AI workload特征者优先;5. 有AI加速器/NPU芯片设计经验、大模型部署架构经验或跨领域(芯片+AI框架/编译器)协作经验者优先;6. 有钻研精神及合作意识,结果导向,工程师素养佳。 投递...
处理器集成设计工程师 上海 社招 全职 职位 ID:A16416 职位描述 1. 参与或主导处理器顶层集成架构设计,完成子系统(CPU Core、Cache、NoC互联、外设接口等)的集成方案制定、RTL集成与调优;2. 负责处理器SoC级集成验证环境搭建,包括子系统间接口联调、时钟/复位/电源管理集成、中断控制器集成等;3. 主导处理器顶层时序约束(SDC)制定与时序收敛,协同后端团队确保芯片PPA目标达成;4. 与处理器架构、各子系统设计(AI计算、存储、Vector/Matrix)、验证、软件团队协同,确保集成方案与各子系统架构的高效配合,支撑端侧AI芯片的整体性能目标;5. 跟踪业界处理器SoC集成架构前沿技术(如UCIe/CXL片间互联、Chiplet集成、异构计算集成),输出技术洞察,牵引集成架构演进方向;6. 参与芯片流片和回片验证,负责处理器集成层面的Bring-up调试和问题定位,确保芯片集成方案的工程落地; 职位要求 1. 硕士及以上学历,计算机/电子工程/微电子等相关专业;2. 精通计算机体系结构核心理论,深入理解处理器SoC集成架构(总线/互联、中断、时钟树、电源域);3. 熟悉ARM/RISC-V处理器SoC集成流程,熟练使用Verilog/SystemVerilog,掌握主流EDA工具链(VCS/Genus/Innovus等);4. 掌握Gem5/VCS等仿真工具链,在SoC集成/子系统接口联调/时序收敛/低功耗集成至少一个方向有深度研究;5. 有RTL集成设计或芯片流片经验者优先;6. 具备异构计算SoC集成经验(如CPU+NPU+DSP)、多Die/Chiplet集成设计经验或跨领域(芯片集成+AI框架/编译器)协作经验者优先。 投递...
Miclaw-移动端 AI 性能专家 (Engine & Efficiency) 北京 社招 全职 职位 ID:A240371 职位描述 1. 引擎调优:负责 Android/iOS、与云端 Mimo 或本地 ExecuTorch/ncnn 的底层接入与硬件加速(NPU/GPU/Metal)。2. 效率突破:实现 Speculative Decoding (投机采样) 或 Prompt Caching,在手机端将 TTFT(首包延迟)降至极致。3. 性能监控:建立全链路监控指标体系,关注 Tokens/sec、ITL (Token 间延迟) 以及 Agent 后台运行时的功耗曲线。4. 资源调度:解决多 Agent
大模型推理优化工程师 北京 社招 全职 职位 ID:A234561 职位描述 1. 负责图像/视频/多模态等方向AIGC大模型推理加速研究,包括模型蒸馏、模型量化、模型剪枝、推理加速框架移植等2.实现高性能LLM/VLM/AIGC模型推理引擎,优化计算图编译、动态Batching及KV Cache管理,打造极致低延迟与高吞吐的线上服务架构3.续跟进业界最新的Infra技术(如FlashAttention演进、高效通信库、FP8/INT8量化、稀疏蒸馏等训练部署方案),配合实际业务驱动技术预研并转化为生产力 职位要求 1、本科及以上学历,计算机相关专业优先,熟练掌握C++/Python,精通数据结构与算法,并有并发编程基础;2、熟练使用PyTorch/TensorFlow或其他深度学习框架,熟练掌握深度学习性能加速技术包括但不限于算子性能优化,通信优化等;3、具有AIGC(VLM、Diffusion)模型训练/推理优化经验,熟悉TensorRT-LLM、vLLM、LightX2V等推理效率优化工具;4、熟悉大模型蒸馏、量化、剪枝等常用压缩技术,熟练使用常见推理加速工具,如TensorRT、vLLM等;5、积极主动有热情,具备较强的沟通能力以及优秀的团队协作能力 投递...