返回

大模型后训练算法工程师

岗位职责

  1. 全链路对齐优化:负责 SFT 到 RL 的全链路后训练研发,提升模型在通用对话、复杂推理与 Agentic 任务上的表现。
  2. 数据体系建设:以模型能力诊断驱动数据需求,设计高质量后训练数据管线,覆盖推理数据与 Agent 轨迹数据的清洗、合成与评估。
  3. 复杂能力突破:针对复杂推理与长程 Agent 任务(多步规划、工具调用、环境交互)进行数据与算法优化,突破模型能力上限。

任职要求

  1. 深刻理解 Transformer 架构与大模型训练全流程,深入理解 SFT、PPO、GRPO 等后训练算法,熟悉 RLVR、多步轨迹奖励等 Agentic RL 训练范式。
  2. 数据洞察力强,能定义高质量数据标准,精通大规模数据清洗、去重、多样性控制与质量评估,熟悉推理链(CoT)与工具调用轨迹数据的构造。
  3. 熟练掌握 PyTorch,有大规模分布式训练实战经验,熟悉 veRL、slime、OpenRLHF 等RL训练框架。
  4. Badcase 分析能力强,能通过细粒度拆解定位模型瓶颈;学习能力强、逻辑清晰、协作良好,能跟踪并转化前沿 Research 成果。

加分项

  1. 有大模型全链路研发与高质量模型发布/落地经验。
  2. 熟悉代码/数学/Agent 和其他推理任务,了解自动验证(Sandbox / Formal Verification)与执行反馈机制,熟悉 SWE-bench、τ-bench 等agent评测基准。
  3. 在 NeurIPS、ICLR、ICML、ACL 等顶会发表过论文,或有高水平竞赛获奖经历。
投递