2025_NIPS_Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

论文核心总结与翻译

一、主要内容

论文聚焦大型语言模型(LLMs)中的“句法-领域虚假相关性”问题,即模型在训练中会学习到句法模板(词性序列构成)与特定领域的浅层关联,而非真正理解语义和领域知识。研究通过合成数据集验证了该相关性会降低模型在跨领域实体知识任务中的性能(OLMo-2系列模型均值0.51±0.06),并提出了一套评估框架检测该现象。实验表明,OLMo-2、Llama-4-Maverick、GPT-4o等开源和闭源模型均存在此问题,且该相关性可被利用绕过模型对有害请求的拒绝机制,引发安全风险。最后,研究指出需通过专项测试和增加训练数据的句法多样性来解决这一问题。

二、创新点

  1. 首次系统刻画了LLM中句法模板、语义与领域知识的交互关系,明确了“句法-领域虚假相关性”的定义和量化方法。
  2. 设计了可控的合成数据集,实证证明模型规模和指令微调均无法缓解这种虚假相关性带来的性能下降。
  3. 提出通用评估框架,可在无训练数据分布细节的情况下,检测模型对句法-领域虚假相关性的依赖。
  4. 揭示了该相关性的安全隐患,证明其可作为新型绕过技术突破模型的拒绝机制,拓展了LLM安全研究的视角。

三、核心部分翻译(Markdown格式)

Abstract

为了正确响应指令,大型语言模型(LLM)必须同时理解给定任务-指令对的语义和领域(即主题领域)。然而,句法也能传递隐含信息。近期研究表明,句法模板

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值