返回大模型預訓練算法工程師
崗位職責
- 主導大模型數據生產的Pipeline建設,涵蓋尋源、採集、解析、處理、實驗與分析等環節,為各基礎模型提供穩定、大規模且高質量的預訓練數據;
- 負責前沿數據合成研究,探索基於LLM的數據合成與增強技術(如Self-Instruct、Agent交互模擬等),設計高效生成策略以補充數據缺口;
- 建立針對合成數據的自動化評估體系(如Reward Model、LLM-as-a-Judge),並結合模型評測與數據分析反饋,反向迭代生產線與數據生成策略;
- 搭建並優化大模型預訓練的數據工程底座,開發自動化框架與平台,支持海量數據的清洗、去重與格式化處理,提升底層資源調度與數據策略迭代效率;
- 沉澱全網高質量預訓練數據,建設端到端的數據質量、多樣性體系及場景化標籤,與算法及基建團隊高效協同,探索真實與合成數據的最優配比。
任職要求
- 碩士及以上學歷,計算機、人工智能、數學或相關專業,具備紮實的編程基礎,精通Python,並掌握至少一種編程語言(Java/Go/C++);
- 具備AI數據開發經驗,掌握大模型預訓練基本原理,熟悉至少一類核心場景(代碼生成或通用NLP)的數據特性;
- 在數據合成或基礎工程方面,需具備以下任一方向的專業能力;研究方向:深入理解主流大模型架構及訓練機制,熟悉各類Prompt技巧及數據增強機制,對大模型對齊(RLHF/DPO等)背後的數據構建邏輯有深入研究;工程方向:熟悉Spark、Flink、Ray等分佈式計算框架,具備海量數據全流程清洗與處理經驗,熟悉vLLM等推理加速框架者優先;
- 具備數據質量指標設計能力,能夠熟練使用機器學習算法優化數據篩選與評估效率,溝通高效,能精準對接需求並協調資源。
加分項
- 參與過大模型數據準備,或有合成數據訓練大模型成功落地經驗者優先;
- 在自然語言處理或大模型相關領域(ACL、EMNLP、NeurIPS等)發表過高水平論文,或在GitHub開源項目(特別涉及合成數據、數據處理)有活躍貢獻者優先。
投遞