返回大模型評測算法工程師
崗位職責
- 參與大模型評測框架的持續建設與迭代,負責評測執行、Benchmark 接入、結果彙總、自動上傳、可視化分析等核心鏈路開發,提升評測系統的穩定性、易用性和可擴展性。
- 建設面向Agent、Code、數學、知識、推理、PPL 等多場景的評測能力,支持規則評測、LLM-As-Judge、PPL/logprobs 評測、多輪對話評測等不同評測範式。
- 持續優化評測任務調度與自動化流程,參與評測可視化平台建設,完善評測結果的 ETL、DuckDB/Parquet 存儲、前後端 API、樣本級分析、橫向對比和趨勢追蹤能力。
- 跟蹤主流開源與行業 Benchmark,負責評測集清洗、適配、版本管理和指標校驗,保證評測結果的公正性、可復現性和可解釋性。
- 對模型評測結果進行深入分析,定位模型在知識、推理、代碼、數學、指令遵循、長上下文、Agent 等能力維度上的優勢與短板,為訓練迭代和數據改進提供反饋。
- 與訓練、推理、數據和產品團隊協作,建設從模型產出到自動評測、結果迴流、問題定位、能力改進的數據閉環。
任職要求
- 本科及以上學歷,計算機、人工智能、軟件工程、數學等相關專業優先。
- 熟練掌握 Linux、Shell、Git、Docker/Singularity、Slurm 等常用研發與集羣工具。
- 熟悉常見大模型 Benchmark 和評測方法,如 MMLU、CMMLU、CEval、BBH、GPQA、GSM8K、HumanEval、LiveCodeBench、SuperGPQA、PPL 等。
- 具備良好的系統設計能力,能夠圍繞評測任務調度、併發執行、結果存儲、日誌追蹤、失敗重試、可視化分析等問題設計可靠方案。
- 具備較強的問題分析能力,能夠從日誌、指標、樣本、配置和代碼鏈路中定位評測異常、性能瓶頸和結果偏差。
- 對大模型評測、模型能力分析、Agent/Code/推理能力邊界探索有強興趣,願意持續跟進行業進展和開源 Benchmark。
加分項
- 有 EvalScope、OpenCompass、lm-evaluation-harness、HELM、LightEval 等評測框架使用或二次開發經驗。
- 有 FastAPI、Next.js、DuckDB、Parquet、數據平台或可視化系統開發經驗。
- 有大模型訓練、後訓練、數據構建、模型分析或線上推理服務經驗。
- 有 Code Agent、Agent Benchmark、工具調用評測、多輪任務評測相關經驗。
- 有開源項目貢獻、技術博客、評測報告、Benchmark 構建經驗者優先。
投遞