SageLM相关总结与翻译
一、文章主要内容
本文聚焦语音到语音(S2S)大型语言模型(LLMs)的评估难题,提出了端到端、多维度且可解释的语音评估模型SageLM。
首先,阐述当前S2S模型评估存在的两大核心问题:一是主流的级联式评估方法(先通过自动语音识别(ASR)将语音转文字,再用文本LLM评估)会受ASR错误传播影响,且完全忽略声学特征,无法评估语气、情感等维度;二是人工评估虽为黄金标准,但成本高、速度慢,难以满足大规模模型迭代需求。
接着,为解决这些问题,作者构建了包含324,774个样本的大型多维度语音偏好数据集SpeechFeedback,涵盖语义相关性和声学质量标注。同时,提出两阶段训练范式:第一阶段利用SpeechFeedback中丰富的语义偏好数据,训练SageLM在真实性、诚实性、有用性和指令遵循四个语义维度评估,并生成带解释的结构化比较结果;第二阶段融入有限声学偏好数据,新增语音指令遵循维度(评估合成语音是否符合情感、性别等声学属性要求)。
在训练方法上,通过实验对比强化学习(GRPO)与带推理依据的监督微调(SFT),发现后者能让模型在预测评估结果的同时进行合理推理,避免奖励黑客行为,且推理依据与评估结果一致性更高,因此SageLM两阶段训练均采用该方法。
最后,实验验证表明,SageLM与人类评估者的一致性达82.79%,较级联基线(如Whisper + GPT-4o)和基于语音到文本(S2T)LLM的基线分别至少高出7.42%和26.20%,在语义和声学多维度评估中均表现出色,还具备位置一致性强、对不同长度语音响应适应性较好等优势,且在未见过的数据集和真实S2S模型
订阅专栏 解锁全文

505

被折叠的 条评论
为什么被折叠?



