**********************
Agent研发工程师
  • 收藏职位
  • 分享职位
50-100万 北京 研究生 3-5年 招聘 1 人 预计佣金 100.8K 09:55刷新/2天前发布
迅致直营 72小时新发
JD基本信息
岗位职责
1、智能体轨迹数据构建与数据飞轮(基于真实用户任务镜像):深入分析真实用户场景与任务特性,提取典型任务流程、交互模式与约束条件,设计并构建可复现、可运行的任务镜像(例如容器化环境或沙箱),为智能体提供接近真实世界的执行与训练场地。 2、前沿研究与算法创新:跟踪并复现大语言模型智能体(LLM Agent)领域的前沿研究成果,探索Agentic RL、Long Horizon推理、多步规划与工具调用等关键技术;研究并落地SFT、RLHF、GRPO、DPO等后训练与对齐算法,持续提升智能体在复杂任务中的理解、执行与约束遵循能力。 3、Long Horizon强化学习训练:负责Long Horizon场景下智能体的强化学习训练系统研发,解决上百轮交互场景中稀疏奖励下的信用归因(Credit Assignment)、目标漂移与错误累积等核心难题;探索长上下文强化学习、搜索与规划结合等前沿优化方案;参与大规模稠密/MoE大模型的强化学习训练系统建设,实现多种对齐算法与高效的分布式训练方案。
任职要求
1、硕士及以上学历,计算机科学、人工智能、机器学习、自然语言处理等相关专业,3年以上大语言模型或智能体相关研发经验。 2、具备扎实的深度学习算法基础,深刻理解Transformer架构,熟悉大模型训练与推理全流程。 3、熟练掌握Python,精通PyTorch等深度学习框架,熟悉Megatron、DeepSpeed、vLLM等分布式训练与推理加速工具。 4、熟悉大模型后训练全流程,包括但不限于SFT、RLHF、DPO、PPO、GRPO等对齐算法。 5、具备智能体系统设计经验,熟悉Function Calling、Tool Use、ReAct、Plan-Act、Multi-step Reasoning等Agent核心能力。 6、具备数据集构建与数据治理经验,熟悉代码语料清洗、对话/工具轨迹标注、用户行为数据分析等。 7、具有良好的工程实现能力与代码规范,能够独立完成从算法设计到工程落地的全流程。 加分项: 1、在顶级会议或期刊(如NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR等)发表过大模型、智能体或强化学习相关论文。 2、有大规模强化学习项目经验,主导过工业级强化学习训练管线的搭建与优化。 3、参与过业界知名开源项目或有高质量开源贡献。 4、熟悉VeRL、Slime、ROLL等强化学习训练框架。
所属行业:
通信/网络设备
职能分类:
算法工程师
工作城市:
北京,招聘1人,详细地址:北京-昌平区
职位要求
学历要求:
研究生·统招·985/211
工作年限:
3-5年
技能/证书:
-
薪资福利
年薪范围:
50-100万*15薪
薪资福利:
五险一金、超多福利
团队架构
所属部门:
-
下属人数:
-
部门架构:
-
汇报对象:
-
职级职称:
-
面试信息
面试轮次:
2轮
面试流程:
-
视频面试:
可以接受
为你推荐