返回

大模型平台架构工程师——入职香港理工大学

岗位职责

  1. 牵头大模型应用平台及数据处理平台的架构设计、开发与实施,建设面向大语言模型训练的数据处理服务,支持数据采集、清洗、治理、处理及训练数据集构建。
  2. 参与 MaaS(Model as a Service)平台的设计、开发和部署,推动不同类型大模型能力的服务化与产品化,支持内部业务场景及外部市场的大模型产品与服务拓展。
  3. 面向不同行业和业务场景,设计并开发领域大模型产品、服务及解决方案,涵盖模型选型、技术架构设计、Prompt Engineering、RAG、Agent、工作流编排及系统集成等。
  4. 负责基于 Kubernetes 的大模型训练、推理及应用服务平台建设,实现容器化部署、资源调度、弹性伸缩、高可用、服务治理和运行监控。
  5. 参与 MLOps 体系建设,完善从数据处理、实验管理、模型训练、模型评估、模型注册到部署发布、监控及持续迭代的全生命周期流程。
  6. 根据客户及业务需求提供大模型技术咨询、解决方案设计和可行性分析,协助识别业务痛点并提出相应的技术实施建议。
  7. 负责大模型应用原型、PoC 及 Demo 系统的设计与开发,快速验证技术方案和业务价值,推动 LLM 相关解决方案从概念验证走向实际落地。
  8. 与算法、产品、软件开发、云平台及业务团队紧密协作,完成大模型应用的开发、测试、部署、性能优化及持续迭代。
  9. 配合算法团队开展模型微调需求分析和可行性评估,协助进行训练数据准备、技术路线选择、微调测试及效果评估。
  10. 完成上级安排的其他相关工作。

任职要求

  1. 具有计算机科学、人工智能、数据科学、商业分析或其他相关专业硕士及以上学历。
  2. 具有至少三年 AI、软件开发、云计算、IT 服务、产品研发、解决方案架构或售前技术支持相关工作经验。
  3. 熟悉主流大语言模型及多模态模型,包括 OpenAI GPT、Claude、Gemini、Qwen、Wan 等,理解 Transformer、Token、Embedding、上下文窗口、推理及大模型训练等核心技术原理。
  4. 熟悉大模型应用开发技术,包括 Prompt Engineering、Embedding、向量检索、RAG、Agent、Tool Calling、工作流编排及模型服务化部署等。
  5. 熟悉一种或多种主流 AI 应用开发框架、平台或工具,包括 LangChain、Dify、n8n、MCP、Skills、Claude Code、阿里云百炼或其他同类平台。
  6. 熟悉 Docker、Kubernetes 等容器及云原生技术,具备以下一种或多种实践经验:
  • Kubernetes 集群中的应用部署、运维和故障排查;
  • Deployment、StatefulSet、Service、Ingress、ConfigMap、Secret 等资源管理;
  • Helm、Kustomize 等应用部署和配置管理工具;
  • GPU 资源调度、弹性伸缩、高可用及分布式训练或推理环境建设;
  • Prometheus、Grafana、Loki、OpenTelemetry 等监控和可观测性工具。
  1. 熟悉 MLOps 的基本理念、平台架构及工程流程,了解或使用过 MLflow、Kubeflow、Airflow、Argo Workflows、KServe、Ray、DVC 等一种或多种工具。
  2. 具备模型全生命周期管理经验,了解数据版本管理、实验追踪、模型评估、模型注册、模型部署、灰度发布、版本回滚、运行监控及自动化流水线建设。
  3. 熟悉 CI/CD 工程实践,能够使用 GitLab CI、GitHub Actions、Jenkins、Argo CD 等工具构建自动化测试、镜像构建和部署发布流程。
  4. 了解大模型微调的基本概念、典型方法及适用场景,包括全参数微调、LoRA、QLoRA、PEFT 等;能够配合算法团队评估微调需求的技术可行性,并协助完成微调测试和效果验证。
  5. 具备良好的系统架构和工程实践能力,能够独立或牵头完成大模型应用从需求分析、方案设计、原型开发到生产部署的完整流程。
  6. 具备良好的问题分析、沟通协调和跨团队协作能力,能够将业务需求转化为可实施的技术解决方案。

加分项

  1. 具有大模型应用落地、AI 产品开发、MaaS 平台建设、解决方案架构或 AI 售前支持经验。
  2. 具有生产级 Kubernetes 集群、大规模 GPU 集群或 AI 算力平台建设和运维经验。
  3. 具有 MLOps 平台规划、建设或落地经验,熟悉模型训练与推理任务的自动化流水线。
  4. 具有使用 Hugging Face、阿里云 PAI 或类似平台开展模型微调实验的实际经验。
  5. 熟悉大模型训练数据处理流程,以及数据清洗、质量评估、去重、脱敏、标注和数据集管理等相关技术。
  6. 具有多模态模型、Agent 应用、RAG 系统或复杂 AI 工作流的设计与开发经验。
  7. 熟悉大模型推理框架及模型服务技术,例如 vLLM、TGI、Triton Inference Server、KServe、Ray Serve 等。
  8. 具备良好的英语沟通能力,能够支持跨团队、跨地区或国际业务交流。
投递