大模型 Infra 工程師
崗位職責
你將參與以下一個或多個方向的工作:
- 針對大模型訓練、推理系統中不同分佈式並行的特點,實現針對調度、計算和通信的極致優化;
- 針對不同AI加速器的硬件架構,對訓練或推理算子性能做極致的性能優化;
- 算法和工程的聯合設計,追求系統性能和算法效果的最優平衡點。
- 構建Agent框架與平台,支持複雜交互下的強化學習模型訓練和性能優化;
任職要求
- 深刻理解Transformer架構與大模型訓練/推理相關核心技術,能分析其在工程上的可行性與瓶頸
- 精通PyTorch及其分佈式訓練和推理,有大規模分佈式系統設計及開發調優經驗
- 良好的代碼開發習慣,具備紮實的計算機體系結構、操作系統、網絡基礎
- 具備快速的學習能力和良好的團隊合作精神
加分項
- 參與過Megatron-LM/TransformerEngine/vLLM/SGLang等核心框架開發
- 積極參與開源社區,有自己滿意的GitHub開源項目
- 熟悉雲平台大規模AI負載管理