文章核心总结与创新点
主要内容
SuperGPQA 是一款覆盖285个研究生学科的LLM评估基准,包含26,529道题目,聚焦现有基准未充分覆盖的轻工业、农业、服务类等长尾领域。通过“源筛选-转录-质量检验”三阶段流程,结合人机协同过滤机制保证题目质量,最终对推理型、聊天型、基础型等多类LLM进行评估,揭示了模型在推理能力、指令微调效果、跨学科性能平衡等方面的关键表现。
创新点
- 覆盖范围突破:首次将LLM评估扩展至285个研究生学科,填补长尾专业领域评估空白,题目数量与学科深度远超现有基准。
- 人机协同构建机制:通过专家、众包标注者与SOTA LLM的协作,搭配三阶段质量检验,剔除无效题目,确保基准的可靠性与区分度。
- 多维度评估洞察:揭示推理能力、指令微调、模型规模对性能的影响,发现人文社科类学科对模型区分度更高,为LLM训练提供针对性方向。
- 高可靠性与稳健性:与Chatbot Arena Elo分数相关性达87.6,在24种语义等效提示下保持稳定排名,评估结果更具参考价值。
英文原文翻译(Markdown格式)
Abstract
大型语言模型(LLMs)在数学、物理、计算机科学等主流学术领域已展现出卓越能力。然而,人类知识涵
订阅专栏 解锁全文


被折叠的 条评论
为什么被折叠?



