返回

大模型评测算法工程师

岗位职责

  1. 参与大模型评测框架的持续建设与迭代,负责评测执行、Benchmark 接入、结果汇总、自动上传、可视化分析等核心链路开发,提升评测系统的稳定性、易用性和可扩展性。
  2. 建设面向Agent、Code、数学、知识、推理、PPL 等多场景的评测能力,支持规则评测、LLM-As-Judge、PPL/logprobs 评测、多轮对话评测等不同评测范式。
  3. 持续优化评测任务调度与自动化流程,参与评测可视化平台建设,完善评测结果的 ETL、DuckDB/Parquet 存储、前后端 API、样本级分析、横向对比和趋势追踪能力。
  4. 跟踪主流开源与行业 Benchmark,负责评测集清洗、适配、版本管理和指标校验,保证评测结果的公正性、可复现性和可解释性。
  5. 对模型评测结果进行深入分析,定位模型在知识、推理、代码、数学、指令遵循、长上下文、Agent 等能力维度上的优势与短板,为训练迭代和数据改进提供反馈。
  6. 与训练、推理、数据和产品团队协作,建设从模型产出到自动评测、结果回流、问题定位、能力改进的数据闭环。

任职要求

  1. 本科及以上学历,计算机、人工智能、软件工程、数学等相关专业优先。
  2. 熟练掌握 Linux、Shell、Git、Docker/Singularity、Slurm 等常用研发与集群工具。
  3. 熟悉常见大模型 Benchmark 和评测方法,如 MMLU、CMMLU、CEval、BBH、GPQA、GSM8K、HumanEval、LiveCodeBench、SuperGPQA、PPL 等。
  4. 具备良好的系统设计能力,能够围绕评测任务调度、并发执行、结果存储、日志追踪、失败重试、可视化分析等问题设计可靠方案。
  5. 具备较强的问题分析能力,能够从日志、指标、样本、配置和代码链路中定位评测异常、性能瓶颈和结果偏差。
  6. 对大模型评测、模型能力分析、Agent/Code/推理能力边界探索有强兴趣,愿意持续跟进行业进展和开源 Benchmark。

加分项

  1. 有 EvalScope、OpenCompass、lm-evaluation-harness、HELM、LightEval 等评测框架使用或二次开发经验。
  2. 有 FastAPI、Next.js、DuckDB、Parquet、数据平台或可视化系统开发经验。
  3. 有大模型训练、后训练、数据构建、模型分析或线上推理服务经验。
  4. 有 Code Agent、Agent Benchmark、工具调用评测、多轮任务评测相关经验。
  5. 有开源项目贡献、技术博客、评测报告、Benchmark 构建经验者优先。
投递