**********************
推理优化岗(模型与智能体)
  • 收藏职位
  • 分享职位
30-80万 北京 研究生 3-5年 招聘 3 人 预计佣金 80.6K 09:55刷新/2天前发布
迅致直营 72小时新发
JD基本信息
岗位职责
1.负责LLM/多模态大模型推理引擎研发与性能优化,提升吞吐、降低TTFT/TPOT/E2E延迟、降低显存占用。 2.基于vLLM/SGLang等框架进行二次开发,优化PagedAttention、KV缓存、连续批处理、动态调度、前缀缓存等核心机制。 3.负责CUDA算子开发与调优、算子融合、图优化等高效算子落地。 4.落地模型压缩方案:INT4/INT8/FP8量化、剪枝、蒸馏、Speculative Decoding,平衡精度与性能。 5.设计分布式推理架构,优化TP/PP/CP并行、多卡通信与负载均衡,支持千亿参数模型高效推理。 6.跟踪大模型推理领域前沿技术与研究成果,开展技术调研与攻关,将新技术、新方法落地到实际业务。
任职要求
1.硕士研究生及以上学历,计算机/电子/自动化相关,2年以上AI推理加速相关经验。 2.熟练掌握Python/C++,具备CUDA C编程能力,能独立开发与调优Kernel。 3.深入理解Transformer架构、Attention机制、预填充/解码阶段差异,熟悉LLM推理全流程。 4.熟练使用至少一种主流推理框架,有源码修改、性能优化或线上落地经验优先。 5.熟悉模型量化、KV缓存优化、连续批处理、动态调度等核心加速技术,有量化工具链开发经验加分。 6.熟悉Docker/K8s、云原生推理服务部署,有高并发线上推理优化经验优先。 7.良好的工程规范与团队协作,能快速跟进业界前沿技术。
所属行业:
通信/网络设备
职能分类:
前端开发工程师
工作城市:
北京,招聘3人,详细地址:北京-北京市
职位要求
学历要求:
研究生·统招·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
30-80万*15薪
薪资福利:
五险一金、超多福利
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
2轮
面试流程:
-
视频面试:
可以接受
为你推荐