返回

大模型平台架構工程師——入職香港理工大學

崗位職責

  1. 牽頭大模型應用平台及數據處理平台的架構設計、開發與實施,建設面向大語言模型訓練的數據處理服務,支持數據採集、清洗、治理、處理及訓練數據集構建。
  2. 參與 MaaS(Model as a Service)平台的設計、開發和部署,推動不同類型大模型能力的服務化與產品化,支持內部業務場景及外部市場的大模型產品與服務拓展。
  3. 面向不同行業和業務場景,設計並開發領域大模型產品、服務及解決方案,涵蓋模型選型、技術架構設計、Prompt Engineering、RAG、Agent、工作流編排及系統集成等。
  4. 負責基於 Kubernetes 的大模型訓練、推理及應用服務平台建設,實現容器化部署、資源調度、彈性伸縮、高可用、服務治理和運行監控。
  5. 參與 MLOps 體系建設,完善從數據處理、實驗管理、模型訓練、模型評估、模型註冊到部署發佈、監控及持續迭代的全生命週期流程。
  6. 根據客户及業務需求提供大模型技術諮詢、解決方案設計和可行性分析,協助識別業務痛點並提出相應的技術實施建議。
  7. 負責大模型應用原型、PoC 及 Demo 系統的設計與開發,快速驗證技術方案和業務價值,推動 LLM 相關解決方案從概念驗證走向實際落地。
  8. 與算法、產品、軟件開發、雲平台及業務團隊緊密協作,完成大模型應用的開發、測試、部署、性能優化及持續迭代。
  9. 配合算法團隊開展模型微調需求分析和可行性評估,協助進行訓練數據準備、技術路線選擇、微調測試及效果評估。
  10. 完成上級安排的其他相關工作。

任職要求

  1. 具有計算機科學、人工智能、數據科學、商業分析或其他相關專業碩士及以上學歷。
  2. 具有至少三年 AI、軟件開發、雲計算、IT 服務、產品研發、解決方案架構或售前技術支持相關工作經驗。
  3. 熟悉主流大語言模型及多模態模型,包括 OpenAI GPT、Claude、Gemini、Qwen、Wan 等,理解 Transformer、Token、Embedding、上下文窗口、推理及大模型訓練等核心技術原理。
  4. 熟悉大模型應用開發技術,包括 Prompt Engineering、Embedding、向量檢索、RAG、Agent、Tool Calling、工作流編排及模型服務化部署等。
  5. 熟悉一種或多種主流 AI 應用開發框架、平台或工具,包括 LangChain、Dify、n8n、MCP、Skills、Claude Code、阿里雲百鍊或其他同類平台。
  6. 熟悉 Docker、Kubernetes 等容器及雲原生技術,具備以下一種或多種實踐經驗:
  • Kubernetes 集羣中的應用部署、運維和故障排查;
  • Deployment、StatefulSet、Service、Ingress、ConfigMap、Secret 等資源管理;
  • Helm、Kustomize 等應用部署和配置管理工具;
  • GPU 資源調度、彈性伸縮、高可用及分佈式訓練或推理環境建設;
  • Prometheus、Grafana、Loki、OpenTelemetry 等監控和可觀測性工具。
  1. 熟悉 MLOps 的基本理念、平台架構及工程流程,瞭解或使用過 MLflow、Kubeflow、Airflow、Argo Workflows、KServe、Ray、DVC 等一種或多種工具。
  2. 具備模型全生命週期管理經驗,瞭解數據版本管理、實驗追蹤、模型評估、模型註冊、模型部署、灰度發佈、版本回滾、運行監控及自動化流水線建設。
  3. 熟悉 CI/CD 工程實踐,能夠使用 GitLab CI、GitHub Actions、Jenkins、Argo CD 等工具構建自動化測試、鏡像構建和部署發佈流程。
  4. 瞭解大模型微調的基本概念、典型方法及適用場景,包括全參數微調、LoRA、QLoRA、PEFT 等;能夠配合算法團隊評估微調需求的技術可行性,並協助完成微調測試和效果驗證。
  5. 具備良好的系統架構和工程實踐能力,能夠獨立或牽頭完成大模型應用從需求分析、方案設計、原型開發到生產部署的完整流程。
  6. 具備良好的問題分析、溝通協調和跨團隊協作能力,能夠將業務需求轉化為可實施的技術解決方案。

加分項

  1. 具有大模型應用落地、AI 產品開發、MaaS 平台建設、解決方案架構或 AI 售前支持經驗。
  2. 具有生產級 Kubernetes 集羣、大規模 GPU 集羣或 AI 算力平台建設和運維經驗。
  3. 具有 MLOps 平台規劃、建設或落地經驗,熟悉模型訓練與推理任務的自動化流水線。
  4. 具有使用 Hugging Face、阿里雲 PAI 或類似平台開展模型微調實驗的實際經驗。
  5. 熟悉大模型訓練數據處理流程,以及數據清洗、質量評估、去重、脱敏、標註和數據集管理等相關技術。
  6. 具有多模態模型、Agent 應用、RAG 系統或複雜 AI 工作流的設計與開發經驗。
  7. 熟悉大模型推理框架及模型服務技術,例如 vLLM、TGI、Triton Inference Server、KServe、Ray Serve 等。
  8. 具備良好的英語溝通能力,能夠支持跨團隊、跨地區或國際業務交流。
投遞