返回

大模型 Infra 工程师

岗位职责

你将参与以下一个或多个方向的工作:

  1. 针对大模型训练、推理系统中不同分布式并行的特点,实现针对调度、计算和通信的极致优化;
  2. 针对不同AI加速器的硬件架构,对训练或推理算子性能做极致的性能优化;
  3. 算法和工程的联合设计,追求系统性能和算法效果的最优平衡点。
  4. 构建Agent框架与平台,支持复杂交互下的强化学习模型训练和性能优化;

任职要求

  1. 深刻理解Transformer架构与大模型训练/推理相关核心技术,能分析其在工程上的可行性与瓶颈
  2. 精通PyTorch及其分布式训练和推理,有大规模分布式系统设计及开发调优经验
  3. 良好的代码开发习惯,具备扎实的计算机体系结构、操作系统、网络基础
  4. 具备快速的学习能力和良好的团队合作精神

加分项

  1. 参与过Megatron-LM/TransformerEngine/vLLM/SGLang等核心框架开发
  2. 积极参与开源社区,有自己满意的GitHub开源项目
  3. 熟悉云平台大规模AI负载管理
投递