
一、论文主要内容总结
- 基准设计:提出ONERULER基准,基于英文RULER基准扩展,覆盖26种语言(含高/低资源语言、不同语系和文字系统),包含7个合成任务(5种“大海捞针”检索变体+2种聚合任务),支持8K-128K四种上下文长度评估。
- 核心实验结果:
- 上下文长度从8K增至128K时,高/低资源语言的性能差距从11%扩大至34%;
- 波兰语在长上下文任务中表现最佳(平均准确率88%),英语排第6,中文排倒数第4;
- 引入“无答案”选项后,模型检索任务准确率显著下降(128K上下文时英语任务下降32%);
- 跨语言场景中,指令语言可导致性能波动达20%;
- 聚合任务(提取高频词)难度远高于检索任务,CWE-hard任务所有模型准确率接近0%。
- 模型表现:Gemini 1.5 Flash整体表现最优,Qwen 2.5 72B次之;OpenAI o3-mini-high因过度推理,长上下文任务表现不佳。
二、论文创新点
- 多语言扩展:首次将长上下文基准扩展至26种语言,涵盖低资源语言(如塞索
订阅专栏 解锁全文

195

被折叠的 条评论
为什么被折叠?



