**********************
AI 推理框架与性能优化专家
  • 收藏职位
  • 分享职位
40-80万 北京 研究生 8-10年 招聘 1 人 预计佣金 108.8K 1天前发布
72小时新发
JD基本信息
岗位职责
1、核心推理引擎研发:深入掌握 vLLM、SGLang、TensorRT-LLM 等主流框架源码,主导研发公司自研的智能推理框架,构建核心技术壁垒。 2、全链路性能极致调优:深入 Prefill 与 Decode 阶段的计算特性,实施 PD 分离调度策略,优化请求排队与资源分配。应用 PagedAttention、RadixAttention​ 等前沿算法,解决显存碎片与重复计算问题,大幅提升 GPU 利用率与吞吐量。 3、模型量化与压缩:主导 FP16 至 FP8/FP4 及 AWQ 等量化方案的落地,在保证模型精度损失可控的前提下,显著降低推理延迟与显存占用,提升单卡承载并发能力。 4、分布式通信优化:针对大规模集群场景,优化张量并行(TP)、流水线并行等通信策略,解决多卡间的 I/O 瓶颈,实现线性加速比提升。 5、产品化与商业价值转化:将优化策略固化为产品配置,封装成可交付的标准化产品;通过技术手段直接降低算力成本(如实现同等业务下的算力消耗减半),为 Token 业务提供高性价比的差异化竞争力。
任职要求
1、计算机科学、人工智能等相关专业,硕士及以上学历(工程博士优先)。 2、具备深厚的 C++/CUDA 编程功底,有大型开源 AI 框架(如 PyTorch、vLLM、SGLang)的贡献经历者优先。 3、精通 LLM 推理全流程,对 KV Cache 管理、Continuous Batching等技术有深入理解与实践经验。 4、具备强烈的 Owner 意识,能将技术优化转化为商业价值,抗压能力强。
所属行业:
通信/网络设备、运营商/增值服务
职能分类:
其他技术职位
工作城市:
北京,招聘1人,详细地址:海淀
职位要求
学历要求:
研究生·统招
工作年限:
8-10年
技能/证书:
-
薪资福利
年薪范围:
40-80万*12薪
薪资福利:
6险一金、餐补、电话补、交通补、电脑补助、特殊礼金
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
3轮
面试流程:
-
视频面试:
可以接受
为你推荐