**********************
大模型Agentic算法专家-北京/杭州
  • 收藏职位
  • 分享职位
60-120万 北京、杭... 本科 5-8年 招聘 2 人 预计佣金 104.4K 5天前发布
职位亮点
面聊
JD基本信息
岗位职责
全面负责定义、设计并实现下一代 Agentic AI 系统的核心算法与技术范式,将模型从回答问题升级成执行任务,解决智能体在任务规划、工具使用、多步推理、长程自主执行、环境交互等方面的核心挑战,探索并引领模型在自主决策、复杂任务编排、人机协作等前沿方向的技术突破。直接决定数亿用户在 AI 助手场景下的任务完成体验, 打造模型在 Agentic AI 时代的领先地位。 1. Agentic 能力定义与技术规划 深入分析用户的真实任务需求与使用场景,结合业务,制定并执行 Agentic 能力的中长期技术演进路线图。密切追踪并研究 agentic AI 领域的最新进展,包括 agent 架构范式(ReAct、多智能体协作等)、agentic RL、工具学习、计算机使用(computer use)、长程自主执行等方向,主导定义“顶级智能体能力”的标准,并将其分解为可落地、可量化的算法迭代目标。 2. 任务规划与多步推理 攻坚并解决复杂任务下的核心技术难题,包括但不限于任务分解与规划、多步推理与反思、错误自我识别与纠正、长程任务的记忆与状态管理、异常处理与恢复等。设计创新的脚手架与训练策略,使模型具备真正可靠、连贯的长程自主执行能力,而不仅是单轮的指令响应。 3. 工具使用与环境交互 主导研发模型与外部工具、API、代码执行环境、搜索引擎、数据库等深度动态融合的先进技术。解决工具调用准确性、参数生成、多工具编排、observation 理解与处理、执行结果验证等核心问题。设计并优化可扩展的工具调用框架与执行环境,显著提升智能体在真实场景下完成复杂任务的成功率与可靠性。 4. Agentic 训练与对齐 主导大模型在 agentic 场景下的 post-training 与对齐工作,包括 agentic SFT、面向工具使用与多步任务的强化学习(RLHF/RLAIF/DPO/GRPO 等)、奖励设计与可验证奖励、长程任务的信用分配、reward hacking 的识别与对抗等,设计高效的样本构建流水线,推动 agentic 能力的持续提升。 5. 评测体系与数据飞轮 建立并完善一套科学、全面的 agentic 能力评测体系,能够精准衡量智能体的任务完成质量(成功率、效率、可靠性、安全性等),覆盖过程评估与结果评估。探索 Agent-as-Judge 等前沿评测方法,以及针对性agentic benchmark建设,设计并驱动高效的数据闭环系统,利用真实用户的任务轨迹与反馈,持续、自动化地优化模型。
任职要求
1. 拥有计算机科学、人工智能或相关领域的博士学位者优先,硕士学位亦可。 2. 至少 3 年在自然语言处理(NLP)或大语言模型(LLM)领域的研发经验,对 LLM-based Agent、工具使用、强化学习等有深刻的理解和丰富的实战经验。在学术界或工业界有公认的 agentic 或相关技术成果。 3. 在以下一个或多个领域拥有一流的技术水准和成功经验:agent 架构与规划、工具学习与 function calling、大模型对齐技术(SFT/RLHF/RLAIF/DPO/GRPO 等)在 agentic 场景的深度应用、agentic RL、长 horizon 任务的训练与优化、熟悉主流 RL 训练框架者优先。 4. 具备以下条件者将获得优先考虑: - 主导或核心参与过业界知名的 AI Agent、code agent、autonomous agent 或相关智能体项目。 - 在顶级学术会议(如 NeurIPS、ICML、ICLR、ACL、EMNLP 等)上发表过多篇高质量的 agent、强化学习或相关方向论文。 - 对工具使用、多智能体系统、computer use、具身智能等前沿方向有深入研究或浓厚兴趣,有将前沿 agentic 技术成功应用于大规模商业产品的经验。 - 对前沿技术充满热情,具备出色的问题分析和解决能力,能够将研究成果有效应用于实际业务场景。
所属行业:
互联网、人工智能/大模型/算力
职能分类:
算法工程师
工作城市:
北京,招聘1人,详细地址:北京杭州,招聘1人,详细地址:杭州
职位要求
学历要求:
本科·统招·985/211
工作年限:
5-8年
技能/证书:
-
薪资福利
年薪范围:
60-120万*16薪
薪资福利:
大厂福利待遇
团队架构
所属部门:
面聊
下属人数:
不限
部门架构:
面聊
汇报对象:
面聊
职级职称:
面聊
面试信息
面试轮次:
4轮
面试流程:
三轮业务+一轮HR
视频面试:
可以接受
为你推荐