返回

大模型後訓練算法工程師

崗位職責

  1. 全鏈路對齊優化:負責 SFT 到 RL 的全鏈路後訓練研發,提升模型在通用對話、複雜推理與 Agentic 任務上的表現。
  2. 數據體系建設:以模型能力診斷驅動數據需求,設計高質量後訓練數據管線,覆蓋推理數據與 Agent 軌跡數據的清洗、合成與評估。
  3. 複雜能力突破:針對複雜推理與長程 Agent 任務(多步規劃、工具調用、環境交互)進行數據與算法優化,突破模型能力上限。

任職要求

  1. 深刻理解 Transformer 架構與大模型訓練全流程,深入理解 SFT、PPO、GRPO 等後訓練算法,熟悉 RLVR、多步軌跡獎勵等 Agentic RL 訓練範式。
  2. 數據洞察力強,能定義高質量數據標準,精通大規模數據清洗、去重、多樣性控制與質量評估,熟悉推理鏈(CoT)與工具調用軌跡數據的構造。
  3. 熟練掌握 PyTorch,有大規模分佈式訓練實戰經驗,熟悉 veRL、slime、OpenRLHF 等RL訓練框架。
  4. Badcase 分析能力強,能通過細粒度拆解定位模型瓶頸;學習能力強、邏輯清晰、協作良好,能跟蹤並轉化前沿 Research 成果。

加分項

  1. 有大模型全鏈路研發與高質量模型發佈/落地經驗。
  2. 熟悉代碼/數學/Agent 和其他推理任務,瞭解自動驗證(Sandbox / Formal Verification)與執行反饋機制,熟悉 SWE-bench、τ-bench 等agent評測基準。
  3. 在 NeurIPS、ICLR、ICML、ACL 等頂會發表過論文,或有高水平競賽獲獎經歷。
投遞