返回大模型訓練平台工程師(MLOps/AI Infra)——入職香港理工大學
崗位職責
- 負責大模型訓練平台設計與研發,建設 GPU 資源管理、訓練任務調度、推理服務及 MLOps 平台能力,支持大模型高效訓練與迭代。
- 負責 GPU 集羣建設與優化,基於 Kubernetes + NVIDIA GPU Operator 搭建計算平台,包括資源調度、容器環境、GPU 軟件棧(CUDA、Driver、NCCL 等)配置與優化。
- 負責訓練平台核心工具鏈建設,包括訓練任務編排、自動化 Pipeline、基礎鏡像管理、數據加載及模型版本管理。
- 與算法團隊協作,支持 PyTorch Distributed、Megatron、SGLang 等分佈式訓練框架優化,提升訓練效率與穩定性。
- 建設平台監控與自動化運維體系,完善 GPU、網絡、存儲及訓練任務的監控、告警和故障定位能力。
任職要求
- 計算機、通信、電子等相關專業碩士及以上學歷。
- 有5年以上的後端研發經驗或3年以上的分佈式系統或大規模計算平台研發經驗
- 熟悉大模型訓練流程,瞭解訓練、推理、評測等完整鏈路。
- 熟練掌握 Python / Go 等編程語言,具備良好的工程開發能力。
- 熟悉 Kubernetes、Docker、GPU 調度及 AI 計算環境建設。
- 熟悉 NVIDIA GPU 架構、CUDA、NCCL、InfiniBand 等高性能計算技術。
加分項
- 千卡級 GPU 集羣訓練集羣組建經驗者優先。
- 熟悉 Ray、DeepSpeed、PyTorch、Megatron、vLLM、 SGLang 等大模型訓推框架者優先。
- GPU訓練平台、MLOps 平台或分佈式系統建設經驗優先。
- 熟悉 HDFS、GPFS、JuiceFS 等大規模存儲系統者優先。
投遞