One ruler to measure them all: Benchmarking multilingual long-context language models

在这里插入图片描述

一、论文主要内容总结

  1. 基准设计:提出ONERULER基准,基于英文RULER基准扩展,覆盖26种语言(含高/低资源语言、不同语系和文字系统),包含7个合成任务(5种“大海捞针”检索变体+2种聚合任务),支持8K-128K四种上下文长度评估。
  2. 核心实验结果
    • 上下文长度从8K增至128K时,高/低资源语言的性能差距从11%扩大至34%;
    • 波兰语在长上下文任务中表现最佳(平均准确率88%),英语排第6,中文排倒数第4;
    • 引入“无答案”选项后,模型检索任务准确率显著下降(128K上下文时英语任务下降32%);
    • 跨语言场景中,指令语言可导致性能波动达20%;
    • 聚合任务(提取高频词)难度远高于检索任务,CWE-hard任务所有模型准确率接近0%。
  3. 模型表现:Gemini 1.5 Flash整体表现最优,Qwen 2.5 72B次之;OpenAI o3-mini-high因过度推理,长上下文任务表现不佳。

二、论文创新点

  1. 多语言扩展:首次将长上下文基准扩展至26种语言,涵盖低资源语言(如塞索
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值