返回大模型训练平台工程师(MLOps/AI Infra)——入职香港理工大学
岗位职责
- 负责大模型训练平台设计与研发,建设 GPU 资源管理、训练任务调度、推理服务及 MLOps 平台能力,支持大模型高效训练与迭代。
- 负责 GPU 集群建设与优化,基于 Kubernetes + NVIDIA GPU Operator 搭建计算平台,包括资源调度、容器环境、GPU 软件栈(CUDA、Driver、NCCL 等)配置与优化。
- 负责训练平台核心工具链建设,包括训练任务编排、自动化 Pipeline、基础镜像管理、数据加载及模型版本管理。
- 与算法团队协作,支持 PyTorch Distributed、Megatron、SGLang 等分布式训练框架优化,提升训练效率与稳定性。
- 建设平台监控与自动化运维体系,完善 GPU、网络、存储及训练任务的监控、告警和故障定位能力。
任职要求
- 计算机、通信、电子等相关专业硕士及以上学历。
- 有5年以上的后端研发经验或3年以上的分布式系统或大规模计算平台研发经验
- 熟悉大模型训练流程,了解训练、推理、评测等完整链路。
- 熟练掌握 Python / Go 等编程语言,具备良好的工程开发能力。
- 熟悉 Kubernetes、Docker、GPU 调度及 AI 计算环境建设。
- 熟悉 NVIDIA GPU 架构、CUDA、NCCL、InfiniBand 等高性能计算技术。
加分项
- 千卡级 GPU 集群训练集群组建经验者优先。
- 熟悉 Ray、DeepSpeed、PyTorch、Megatron、vLLM、 SGLang 等大模型训推框架者优先。
- GPU训练平台、MLOps 平台或分布式系统建设经验优先。
- 熟悉 HDFS、GPFS、JuiceFS 等大规模存储系统者优先。
投递