返回大模型平台架构工程师——入职香港理工大学
岗位职责
- 牵头大模型应用平台及数据处理平台的架构设计、开发与实施,建设面向大语言模型训练的数据处理服务,支持数据采集、清洗、治理、处理及训练数据集构建。
- 参与 MaaS(Model as a Service)平台的设计、开发和部署,推动不同类型大模型能力的服务化与产品化,支持内部业务场景及外部市场的大模型产品与服务拓展。
- 面向不同行业和业务场景,设计并开发领域大模型产品、服务及解决方案,涵盖模型选型、技术架构设计、Prompt Engineering、RAG、Agent、工作流编排及系统集成等。
- 负责基于 Kubernetes 的大模型训练、推理及应用服务平台建设,实现容器化部署、资源调度、弹性伸缩、高可用、服务治理和运行监控。
- 参与 MLOps 体系建设,完善从数据处理、实验管理、模型训练、模型评估、模型注册到部署发布、监控及持续迭代的全生命周期流程。
- 根据客户及业务需求提供大模型技术咨询、解决方案设计和可行性分析,协助识别业务痛点并提出相应的技术实施建议。
- 负责大模型应用原型、PoC 及 Demo 系统的设计与开发,快速验证技术方案和业务价值,推动 LLM 相关解决方案从概念验证走向实际落地。
- 与算法、产品、软件开发、云平台及业务团队紧密协作,完成大模型应用的开发、测试、部署、性能优化及持续迭代。
- 配合算法团队开展模型微调需求分析和可行性评估,协助进行训练数据准备、技术路线选择、微调测试及效果评估。
- 完成上级安排的其他相关工作。
任职要求
- 具有计算机科学、人工智能、数据科学、商业分析或其他相关专业硕士及以上学历。
- 具有至少三年 AI、软件开发、云计算、IT 服务、产品研发、解决方案架构或售前技术支持相关工作经验。
- 熟悉主流大语言模型及多模态模型,包括 OpenAI GPT、Claude、Gemini、Qwen、Wan 等,理解 Transformer、Token、Embedding、上下文窗口、推理及大模型训练等核心技术原理。
- 熟悉大模型应用开发技术,包括 Prompt Engineering、Embedding、向量检索、RAG、Agent、Tool Calling、工作流编排及模型服务化部署等。
- 熟悉一种或多种主流 AI 应用开发框架、平台或工具,包括 LangChain、Dify、n8n、MCP、Skills、Claude Code、阿里云百炼或其他同类平台。
- 熟悉 Docker、Kubernetes 等容器及云原生技术,具备以下一种或多种实践经验:
- Kubernetes 集群中的应用部署、运维和故障排查;
- Deployment、StatefulSet、Service、Ingress、ConfigMap、Secret 等资源管理;
- Helm、Kustomize 等应用部署和配置管理工具;
- GPU 资源调度、弹性伸缩、高可用及分布式训练或推理环境建设;
- Prometheus、Grafana、Loki、OpenTelemetry 等监控和可观测性工具。
- 熟悉 MLOps 的基本理念、平台架构及工程流程,了解或使用过 MLflow、Kubeflow、Airflow、Argo Workflows、KServe、Ray、DVC 等一种或多种工具。
- 具备模型全生命周期管理经验,了解数据版本管理、实验追踪、模型评估、模型注册、模型部署、灰度发布、版本回滚、运行监控及自动化流水线建设。
- 熟悉 CI/CD 工程实践,能够使用 GitLab CI、GitHub Actions、Jenkins、Argo CD 等工具构建自动化测试、镜像构建和部署发布流程。
- 了解大模型微调的基本概念、典型方法及适用场景,包括全参数微调、LoRA、QLoRA、PEFT 等;能够配合算法团队评估微调需求的技术可行性,并协助完成微调测试和效果验证。
- 具备良好的系统架构和工程实践能力,能够独立或牵头完成大模型应用从需求分析、方案设计、原型开发到生产部署的完整流程。
- 具备良好的问题分析、沟通协调和跨团队协作能力,能够将业务需求转化为可实施的技术解决方案。
加分项
- 具有大模型应用落地、AI 产品开发、MaaS 平台建设、解决方案架构或 AI 售前支持经验。
- 具有生产级 Kubernetes 集群、大规模 GPU 集群或 AI 算力平台建设和运维经验。
- 具有 MLOps 平台规划、建设或落地经验,熟悉模型训练与推理任务的自动化流水线。
- 具有使用 Hugging Face、阿里云 PAI 或类似平台开展模型微调实验的实际经验。
- 熟悉大模型训练数据处理流程,以及数据清洗、质量评估、去重、脱敏、标注和数据集管理等相关技术。
- 具有多模态模型、Agent 应用、RAG 系统或复杂 AI 工作流的设计与开发经验。
- 熟悉大模型推理框架及模型服务技术,例如 vLLM、TGI、Triton Inference Server、KServe、Ray Serve 等。
- 具备良好的英语沟通能力,能够支持跨团队、跨地区或国际业务交流。
投递