返回

大模型 Infra 工程師

崗位職責

你將參與以下一個或多個方向的工作:

  1. 針對大模型訓練、推理系統中不同分佈式並行的特點,實現針對調度、計算和通信的極致優化;
  2. 針對不同AI加速器的硬件架構,對訓練或推理算子性能做極致的性能優化;
  3. 算法和工程的聯合設計,追求系統性能和算法效果的最優平衡點。
  4. 構建Agent框架與平台,支持複雜交互下的強化學習模型訓練和性能優化;

任職要求

  1. 深刻理解Transformer架構與大模型訓練/推理相關核心技術,能分析其在工程上的可行性與瓶頸
  2. 精通PyTorch及其分佈式訓練和推理,有大規模分佈式系統設計及開發調優經驗
  3. 良好的代碼開發習慣,具備紮實的計算機體系結構、操作系統、網絡基礎
  4. 具備快速的學習能力和良好的團隊合作精神

加分項

  1. 參與過Megatron-LM/TransformerEngine/vLLM/SGLang等核心框架開發
  2. 積極參與開源社區,有自己滿意的GitHub開源項目
  3. 熟悉雲平台大規模AI負載管理
投遞