返回

端侧训练推理 Infra 工程师

岗位职责

  1. 参与端侧 / 本地大模型(LLM & 多模态)的训练、微调及实验迭代,并推动模型在真实设备上的落地
  2. 负责模型在端侧的推理优化,包括量化、蒸馏、KV Cache、长上下文优化及推理链路调优
  3. 参与本地训练、推理、部署的完整流程,打通模型从训练到设备侧运行的闭环
  4. 在 CPU / GPU / NPU 等硬件平台上进行性能分析与优化,关注延迟、吞吐、内存占用与功耗
  5. 参与端侧 Runtime / 推理框架 / 工具链开发,提升模型稳定性与性能表现
  6. 与算法、系统及产品团队协作,推动端侧 AI 能力产品化落地

任职要求

  1. 计算机、人工智能、软件工程等相关专业,本科及以上
  2. 扎实的工程能力,熟练使用 Python,具备良好的代码规范和调试能力
  3. 熟练使用 PyTorch,有实际模型训练或微调经验(非只会调用API)
  4. 熟悉 Linux 开发环境,具备独立定位问题、分析日志、复现实验的能力
  5. 至少在以下一个方向有实际项目经验:
  • 大模型训练 / 微调(LoRA / QLoRA / 多模态)
  • 推理优化(量化 / KV Cache / latency 优化)
  • 模型部署 / 端侧落地

加分项

  1. 有端侧 / 本地 AI 项目经验(PC / 移动端 / 边缘设备)
  2. 熟悉 Unsloth、KTransformers、Nexa AI / Nexa SDK 等本地训练、推理或部署工具链
  3. 做过 LoRA、QLoRA、PTQ、QAT、蒸馏、长上下文优化或 KV Cache 相关工作
  4. 熟悉 CUDA、Triton、C++ 或其他性能优化工具,有 kernel / 推理加速经验
  5. 做过本地模型导出、跨平台部署或 Runtime 适配,了解模型从训练到设备侧交付的完整过程
  6. 参与过开源项目,或者有能展示的 GitHub、技术博客等
投递