返回

大模型訓練平台工程師(MLOps/AI Infra)——入職香港理工大學

崗位職責

  1. 負責大模型訓練平台設計與研發,建設 GPU 資源管理、訓練任務調度、推理服務及 MLOps 平台能力,支持大模型高效訓練與迭代。
  2. 負責 GPU 集羣建設與優化,基於 Kubernetes + NVIDIA GPU Operator 搭建計算平台,包括資源調度、容器環境、GPU 軟件棧(CUDA、Driver、NCCL 等)配置與優化。
  3. 負責訓練平台核心工具鏈建設,包括訓練任務編排、自動化 Pipeline、基礎鏡像管理、數據加載及模型版本管理。
  4. 與算法團隊協作,支持 PyTorch Distributed、Megatron、SGLang 等分佈式訓練框架優化,提升訓練效率與穩定性。
  5. 建設平台監控與自動化運維體系,完善 GPU、網絡、存儲及訓練任務的監控、告警和故障定位能力。

任職要求

  1. 計算機、通信、電子等相關專業碩士及以上學歷。
  2. 有5年以上的後端研發經驗或3年以上的分佈式系統或大規模計算平台研發經驗
  3. 熟悉大模型訓練流程,瞭解訓練、推理、評測等完整鏈路。
  4. 熟練掌握 Python / Go 等編程語言,具備良好的工程開發能力。
  5. 熟悉 Kubernetes、Docker、GPU 調度及 AI 計算環境建設。
  6. 熟悉 NVIDIA GPU 架構、CUDA、NCCL、InfiniBand 等高性能計算技術。

加分項

  1. 千卡級 GPU 集羣訓練集羣組建經驗者優先。
  2. 熟悉 Ray、DeepSpeed、PyTorch、Megatron、vLLM、 SGLang 等大模型訓推框架者優先。
  3. GPU訓練平台、MLOps 平台或分佈式系統建設經驗優先。
  4. 熟悉 HDFS、GPFS、JuiceFS 等大規模存儲系統者優先。
投遞