确定性有限自动机学习中的覆盖间隙现象及算法性能研究
1. 学习中的相变与覆盖间隙现象
在语法推理中,尤其是确定性有限自动机(DFA)的学习过程,会出现一种有趣的相变现象。在学习过程中,假设的覆盖率会发生突然变化,并且会快速跨越大多数潜在假设所在的区域。这种相变是学习方法的特性,而非假设空间的特性,在DFA学习中表现得更为明显。
以NFA情况作为对比,从学习样本开始的泛化锥是通过连续的泛化步骤(即状态合并)来探索的,覆盖率总是在诱导自动机覆盖随机测试字符串的极小部分和大部分这两种状态之间发生急剧转变。而DFA推理中虽然也会出现突然转变,但性质不同。具体来说,在泛化过程中,首先产生的低覆盖率自动机和后来遇到的高覆盖率自动机之间会出现一个间隙。
例如,在Abbadingo挑战中,涉及一个128状态的目标自动机,学习集|P| = 4382个字符串,字母表大小|Σ| = 2,字符串平均长度ℓ = 17 。这个问题在比赛中未得到解决,查看泛化锥中覆盖率的变化可以部分解释原因。明显可以看到,几乎没有覆盖率在0%到95%之间的DFA被考虑。而且这种模式在很多情况下都存在,具有普遍性,与字母表大小、学习和测试字符串的长度或训练集的大小无关。
2. 影响覆盖间隙的参数分析
为了理解这种典型行为的原因,我们需要考察与泛化过程动态相关的一些参数。
- 边与非终结状态数量比 :与图和有限状态自动机相关的一个重要特征是出口边数量与(非终结)状态数量的比率。随着状态合并,这个比率应该增加,因为每次合并后的状态至少继承了连接更紧密的父状态的边数。实验观察到,在PTA中这个比率接近1,因为自动机本质上由与每个训练字符串相关
超级会员免费看
订阅专栏 解锁全文

1304

被折叠的 条评论
为什么被折叠?



