文章总结与翻译
一、文章主要内容
本文聚焦大型语言模型(LLMs)在文本隐写术和水印技术中存在的分词不一致(TI)问题展开研究。TI指发送方(Alice)生成文本的原始分词列表与接收方(Bob)对文本重新分词后的列表存在差异,会破坏隐写术的提取准确性和水印技术的检测鲁棒性。
1. 核心问题与研究发现
- TI的负面影响:在隐写术中,TI会导致提取错误(如Alice生成“_no”“body”,Bob重分为“_nobody”,破坏秘密信息提取);在水印技术中,TI会干扰水印检测,降低检测准确性。
- 不一致 token 特征:通过对Llama-2-7b(英文)、Swallow-7b(日文)、Qwen2.5-7b(中文)三种模型的实验,发现导致TI的不一致token具有两大关键特征——低频性(token级不一致率通常低于0.5%)和暂时性(部分不一致会随后续token生成自动恢复,如Swallow-7b和Qwen2.5-7b中多数临时不一致在生成2个后续token后消失)。
2. 针对性解决方案
基于不一致token的特征,文章为隐写术和水印技术分别提出解决方案:
- 隐写术:逐步验证法(Stepwise Verification)
在每一步token生成时,过滤候
订阅专栏 解锁全文

213

被折叠的 条评论
为什么被折叠?



