文章《INVESTIGATING ADVANCED REASONING OF LARGE LANGUAGE MODELS VIA BLACK-BOX INTERACTION》总结与翻译
一、文章主要内容总结
本文聚焦大型语言模型(LLMs)的高级推理能力评估,针对现有基准在交互式未知环境中评估推理能力的不足,提出了全新的“黑箱交互”评估范式,并构建了ORACLE基准,对19个主流LLMs进行了全面测试与分析,核心内容如下:
1. 现有评估方法的局限性
现有推理任务与基准无法在交互式、未知环境中评估LLMs的推理能力,仅能孤立评估演绎、归纳和溯因推理,忽略了人类探索现实世界所必需的整合推理过程;部分基于游戏的评估方法存在数据污染(LLMs可能提前熟悉游戏策略)和能力混淆(将推理与空间理解、长上下文理解等能力混为一谈)的问题。
2. 黑箱交互评估范式
- 黑箱定义:黑箱是一个隐藏函数f:X→Yf: X \to Y
订阅专栏 解锁全文

206

被折叠的 条评论
为什么被折叠?



