大模型 Infra 工程师
岗位职责
你将参与以下一个或多个方向的工作:
- 针对大模型训练、推理系统中不同分布式并行的特点,实现针对调度、计算和通信的极致优化;
- 针对不同AI加速器的硬件架构,对训练或推理算子性能做极致的性能优化;
- 算法和工程的联合设计,追求系统性能和算法效果的最优平衡点。
- 构建Agent框架与平台,支持复杂交互下的强化学习模型训练和性能优化;
任职要求
- 深刻理解Transformer架构与大模型训练/推理相关核心技术,能分析其在工程上的可行性与瓶颈
- 精通PyTorch及其分布式训练和推理,有大规模分布式系统设计及开发调优经验
- 良好的代码开发习惯,具备扎实的计算机体系结构、操作系统、网络基础
- 具备快速的学习能力和良好的团队合作精神
加分项
- 参与过Megatron-LM/TransformerEngine/vLLM/SGLang等核心框架开发
- 积极参与开源社区,有自己满意的GitHub开源项目
- 熟悉云平台大规模AI负载管理