返回大模型後訓練算法工程師
崗位職責
- 全鏈路對齊優化:負責 SFT 到 RL 的全鏈路後訓練研發,提升模型在通用對話、複雜推理與 Agentic 任務上的表現。
- 數據體系建設:以模型能力診斷驅動數據需求,設計高質量後訓練數據管線,覆蓋推理數據與 Agent 軌跡數據的清洗、合成與評估。
- 複雜能力突破:針對複雜推理與長程 Agent 任務(多步規劃、工具調用、環境交互)進行數據與算法優化,突破模型能力上限。
任職要求
- 深刻理解 Transformer 架構與大模型訓練全流程,深入理解 SFT、PPO、GRPO 等後訓練算法,熟悉 RLVR、多步軌跡獎勵等 Agentic RL 訓練範式。
- 數據洞察力強,能定義高質量數據標準,精通大規模數據清洗、去重、多樣性控制與質量評估,熟悉推理鏈(CoT)與工具調用軌跡數據的構造。
- 熟練掌握 PyTorch,有大規模分佈式訓練實戰經驗,熟悉 veRL、slime、OpenRLHF 等RL訓練框架。
- Badcase 分析能力強,能通過細粒度拆解定位模型瓶頸;學習能力強、邏輯清晰、協作良好,能跟蹤並轉化前沿 Research 成果。
加分項
- 有大模型全鏈路研發與高質量模型發佈/落地經驗。
- 熟悉代碼/數學/Agent 和其他推理任務,瞭解自動驗證(Sandbox / Formal Verification)與執行反饋機制,熟悉 SWE-bench、τ-bench 等agent評測基準。
- 在 NeurIPS、ICLR、ICML、ACL 等頂會發表過論文,或有高水平競賽獲獎經歷。
投遞