返回端側訓練推理 Infra 工程師
崗位職責
- 參與端側 / 本地大模型(LLM & 多模態)的訓練、微調及實驗迭代,並推動模型在真實設備上的落地
- 負責模型在端側的推理優化,包括量化、蒸餾、KV Cache、長上下文優化及推理鏈路調優
- 參與本地訓練、推理、部署的完整流程,打通模型從訓練到設備側運行的閉環
- 在 CPU / GPU / NPU 等硬件平台上進行性能分析與優化,關注延遲、吞吐、內存佔用與功耗
- 參與端側 Runtime / 推理框架 / 工具鏈開發,提升模型穩定性與性能表現
- 與算法、系統及產品團隊協作,推動端側 AI 能力產品化落地
任職要求
- 計算機、人工智能、軟件工程等相關專業,本科及以上
- 紮實的工程能力,熟練使用 Python,具備良好的代碼規範和調試能力
- 熟練使用 PyTorch,有實際模型訓練或微調經驗(非只會調用API)
- 熟悉 Linux 開發環境,具備獨立定位問題、分析日誌、復現實驗的能力
- 至少在以下一個方向有實際項目經驗:
- 大模型訓練 / 微調(LoRA / QLoRA / 多模態)
- 推理優化(量化 / KV Cache / latency 優化)
- 模型部署 / 端側落地
加分項
- 有端側 / 本地 AI 項目經驗(PC / 移動端 / 邊緣設備)
- 熟悉 Unsloth、KTransformers、Nexa AI / Nexa SDK 等本地訓練、推理或部署工具鏈
- 做過 LoRA、QLoRA、PTQ、QAT、蒸餾、長上下文優化或 KV Cache 相關工作
- 熟悉 CUDA、Triton、C++ 或其他性能優化工具,有 kernel / 推理加速經驗
- 做過本地模型導出、跨平台部署或 Runtime 適配,瞭解模型從訓練到設備側交付的完整過程
- 參與過開源項目,或者有能展示的 GitHub、技術博客等
投遞