深度学习计算模型中“门函数(Gating Function)”的作用

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情
/* 版权声明:可以任意转载,转载时请标明文章原始出处和作者信息 .*/

                                                     author: 张俊林



看深度学习文献,门函数基本上已经是你必然会遇到的一个概念了,最典型的就是LSTM,首先上来你就得过得去“遗忘门”“输入门”“输出门”这三个门。门函数本身是个独立概念,不过LSTM使用多个门函数来组合出一个带有状态记忆的计算模型而已。随着LSTM大行其道,各种计算模型开始在计算过程中引入门函数的概念,相信这些论文你也没少看,其实这也是一种研究模式,比如你看看你手头的模型,想想能不能把门函数引进来?会不会有效?也许能走得通。


RNN概念非常直接简单很好理解,但是看到了LSTM,估计不少人会挠头。学习LSTM刚开始看模型一般都不太容易立马搞明白到底这是怎么回事?其实很重要的原因一个是一下子引入了三个门,太多,另外一个是把记忆状态存储单独独立出来,所以看上去整个逻辑很复杂,其实你要是把门函数到底在干嘛搞清楚,那么LSTM的计算逻辑是非常清晰直接好理解的,跟RNN在概念上其实是一样的。所以首先得搞明白“门函数”们到底在干什么事情。


|猪家的神经网络门控系统


既然叫做门,那么我们可以和现实生活中的门的作用进行类比,比如我们在家里安装门是干嘛的呢?是个控制人进出房间的控制设备,门打开了,那么人就能通过,门闭上了,那么人就过不去,被锁在门外了,门要是半开半闭呢,如果不进一步推门的情况下,如果你体积小,可以侧着身子蹭进去。门打不打得开,打开能打多大,这是由谁来决定的?是由门控设备来决定的。什么是门控呢?我们都听说过“小红帽和狼外婆”以及“三只小猪”的故事,是吧?如果忘了可以看看下面图片辅助回忆一下:



在两个故事中,门控的作用就是狼字辈的不允许进入,妈妈和吃草的动物可以进,不过故事里的门控是通过室内的人或动物的观察来手动实现的,属于真正的“人工智能”或“猪工智能”。我们现在科技发达了,都使用刷卡或者刷脸的方式由门控设备来判断你是猪妈妈还是狼外婆,依此来决定是否让你进入。


假设现在我们帮小红帽或者三只小猪做个刷脸的门控设备,而且我们用目前流行度爆棚的神经网络来做这个门控,怎么做呢?


我们假设猪家其实是当地土豪,人称“豪猪”,有经济实力购买北京三环内学区房,而且房子还挺大,为了方便进出,在东南西北各个方向各有一个门,其神经网络建筑图如下:


当然,目前每个门还没有安装门控设施,所以每个门都可以随意进出,不论”X=猪妈妈也好,还是“X=狼外婆”也好,X顺着实线箭头路径找到四个门,推门就能闯进卧室跟你抬手say hello。很明显,此时室内安全指数为负数,这个房子的设计师按理说是需要负分滚粗的。这绝对是不允许的,得想想办法,于是经过李开复老师的引荐,猪妈妈用了250万美金聘请了深度学习房屋架构师老狼来给房子加上安全措施,老狼ML经验丰富,尤其是DL,一拍脑袋就给了个解决方案:加个门控不就完了么,而且我们这是DL牌的门控,加上门控的深度学习安防系统长这样:


图中标为虚线的箭头就是安防门控的神经网络参数了,门控系统的公式如下所示:


这样东南西北每个门是打开还是关上或者是半开半合就通过这个门控系统参数U来自如控制了。比如拿东门来说,假设输入是“X=猪妈妈”,那么通过UX矩阵计算,也就是猪妈妈的脸的照片乘以U中通向东门的虚线箭头权重,再经过Sigmod非线性映射,东门门控会输出一个值,我们知道Sigmod的分值区间在[0,1]之间,通过训练,可以让U中通向东门那个网络连接的权重学习到合适的数值,使得如果X=猪妈妈”的时候,经过Sigmod的输出是1,就是说东门完全打开,让猪妈妈顺利通过W参数网络那条通向东门的实线箭头路径进入卧室和猪爸爸抬手say hello。而反过来,如果输入是“X=狼外婆”,就是说此刻狼外婆到门外敲门了,争取让U学习到合适的参数,使得Sigmod(UX)的值为0,就是说门控系统决定门紧紧关上,不漏一丝缝隙,绝对不给狼外婆留下一丝性侵猪爸爸的机会。当然,这只是东门,其它四个门也如此处理即可,核心是神经网络门控参数U设置成什么值的问题,只要保证看到狼外婆通过U把四个门都关上,看到猪妈妈就把门都打开热烈欢迎就行了,当然门开的大小也可以控制,比如小松鼠来猪家做客:“X=小松鼠”,那么也没必要四个门都打开显得那么费电,只要把一个门打开一条缝就行了,就是说门控系统控制东南西三个门Sigmod值输出为0,关上门,北门Sigmod值输出为0.2,这就足够了。这下理解为啥门控经常用Sigmod作为非线性函数了吧,因为它很好地在物理含义上解释门开的大小,0就是关上,1就是“我家大门常打开,开放怀抱等你”。


|深度学习里的门函数


上面讲了猪家的神经网络门控系统是如何工作的,其实深度学习的各种门作用是类似的,懂了上面小猪家的门控就明白了深度学习里门函数的作用,区别无非是现在这个门控不像现实生活中的门用来控制人或动物的进出,而是控制信息的进出及进出程度的控制设备。如果门函数取值1,那么等于把门大开,允许门前的信息畅通无阻地流入流出,如果门函数取值0,则紧紧关上大门,所有信息被阻断,“此门不开,禁止出入”。如果取得01之间的值,代表允许部分信息进入或者流出后续的部件,如此而已。


在这个指导思想下我们再回顾下LSTM的几个门及其计算公式,估计此时不用看那个九曲回肠的LSTM神经网络图,光看公式也能明白LSTM到底在干嘛了吧:


上面是LSTM的计算公式,首先找那几个门,其实好找,那三个Sigmod作为非线性函数的就是三个门,很明显其取值范围在01和门打开关闭的物理意义是很好对应起来的。这个门的计算公式和上面猪家的门控计算公式其实是一样的,区别无非多出了一个h(t-1)部分,这个也好理解,这是因为LSTMRNN模型,决定t时刻节点的除了当前输入值x(t)外,还有t-1时刻的隐层节点输出h(t-1),这代表了历史信息对当前的影响,所以决定门开关程度的除了当前输入 x(t)外,还有h(t-1),仅此区别而已,其计算流程和物理含义和猪家的门控其实是一样的。


所以含义很清楚,输入门是用来控制输入i’(t)进出多少或者是否允许进出的门控设备;输出门是用来控制t时刻状态值m(t)对外多少是可见的门控设备;遗忘门是控制RNN中历史状态m(t-1)流动到t时刻后允许多少进入t时刻的门控设备;


所以关键在LSTM的状态值更新函数和隐层节点输出值函数上。对于状态更新函数来说:


f(t)是遗忘门门控,m(t-1)是历史状态信息,两者相乘代表t时刻允许多少历史信息进入来决定m(t)当前状态,如果遗忘门全关取值0,则历史对当前状态无影响,如果遗忘门全开取值1,则历史信息原封不动的传到t时刻,没有任何信息损失,当然更大可能是取值01之间,代表历史信息的部分流入;


i(t)是输入门门控,i’(t)是当前t时刻输入值, 两者相乘代表t时刻允许多少当前输入信息进入来决定m(t)当前状态,如果输入门全关取值0,则LSTM忽略当前输入的影响,等于没看到这个输入直接跳过去了,如果输入门全开取值1,则当前输入最大化地决定当前状态m(t),没有任何信息损失,当然更大可能是取值01之间,代表输入信息的部分流入;


经过上面两个门控控制历史信息的影响以及当前输入的影响,就形成了t时刻的隐层节点状态值m(t)


隐层节点输出值h(t)好理解,就是说通过输出门控制当前状态m(t)对外有多少是可见的,因为m(t)是内部隐藏的状态信息,除了往t+1时刻隐层传输外,外部其它地方是看不到的,但是它们可以看到h(t)


这就是LSTM是如何用三个门控以及抽离出的m状态存储器来表达运算逻辑的思路,其实可以看到它本质跟RNN一样,无非是体现历史影响及当前输入的影响,但是相对RNN来说,通过门控来自适应地根据历史和输入来控制信息的流动,当然其实更主要的是通过抽离出的m存储往后传递方式来解决梯度弥散问题的,因为今天主讲门控,所以这块不展开讲。


很多其它深度学习的工作也引入了门函数,其思路和上面介绍的猪家的门控系统思路本质上是一样的,无非是用门函数来控制信息流动程度的。在计算模型上怎么理解“有门”和“没门”的模型呢?其实你可以缺省地认为所有的模型都是“有门”的,而“没门”只是有门的一种特例情况。为什么呢?因为“没门”等价于什么,等价于:“有门”但是那个门是永远全开的,永远不会关上或者半遮半掩。所以引入门其实在干什么呢,就是加入控制,在有些情况下让你进入,有些情况下不让你进入,比如看见x不让进,看见y则自由出入。


|其它的类比


上面为了方便理解门函数的作用,我们用现实生活中的门作为类比例子。其实生活中还有很多起到类似类比作用的设备,比如水龙头,打开水龙头那么水就可以流进来,如果关上水龙头,那么就切断了水源,水龙头打开的大点,那么水流量就大些,水龙头打开的小点,那么水流量就小些。DL中的门函数其实跟这个水龙头调节的作用是一样的,区别无非是控制的不是水流量,而是流入的信息流量。


再比如,也可以把门函数类比为灯的光调节器,我们常见到带有光调节器的灯控设备,把设备调大,则照明强度增加,把设备调小,则照明强度减少。这个类比也能很形象地说明门函数的作用。


其实归纳起来,所有这些生活中的门起的是什么作用呢?其实起的作用是个“调节阀”的作用,通过开关调节阀来控制物体的流入;通过开关调节阀大小来控制流入程度;所以,所有起到调节阀作用的生活设施都可以用来做门函数的类比。


扫一扫关注微信号:“布洛卡区” ,深度学习在自然语言处理等智能应用的技术研讨与科普公众号

奈奎斯特定理和香农第二定理 讲奈奎斯特定理,先讲一下函数和Sa函数的傅里叶变换 即不管是Sa函数还是函数,时域主瓣宽度为a,频率为b=1/a时,傅里叶变换主瓣宽度为2b。 右图,当传码率为fB时,即码元间隔Tb=1/fB时,一个Sa函数的主瓣宽度为2Tb,对应频率为1/2Tb=fB/2,傅里叶后得到的函数(左图)的宽度为两倍的fB /2=fB ,即2fch=fB ,得到最小理论传输带宽为fch=12fBf_{c ... 阅读详情

相关推荐

控激活函数:GLU/GTU/Swish/HSwish/Mish/SwiGLU

是一种通过自身机制动态调节信息流动的激活函数,其核心在于模型能够根据输入数据自身的特征自动调整信息传递的强度,无需外部控制信号。‌核心特点。

weixin_36378508的博客 1311

【信息科学与工程学】【数字孪生】【云计算】第十五篇 云计算领域数字孪生的核心数学模型01

​功能​​关键算法/机制​​依赖组件​调度与扩缩容状态机循环、比例算法服务发现一致性哈希(IPVS)、DNS轮询存储绑定最佳匹配策略PV控制器自愈心跳检测、探针超时Node控制器、kubelet批处理任务Cron表达式解析CronJob控制器完整验证流程建议结合Prometheus监控​(资源指标)和Chaos Engineering工具​(故障注入)。代码实现细节可参考K8s源码中的模块。​节点信息快照机制​:减少锁争用,支持高速访问​无锁优先级队列。

weixin_49199313的博客 1088

梯度消失与梯度爆炸产生原因及解决方法

1 、什么是梯度消失和梯度爆炸 在反向传播过程中需要对激活函数进行求导,如果导数大于1,那么随着网络层数的增加梯度更新将会朝着指数爆炸的方式增加这就是梯度爆炸。同样如果导数小于1,那么随着网络层数的增加梯度更新信息会朝着指数衰减的方式减少这就是梯度消失。因此,梯度消失、爆炸,其根本原因在于反向传播训练法则,属于先天不足。 2、梯度消失、爆炸导致原因 2.1、从BP(反向传播原理)解释梯度消失和梯度爆炸 举例,一个简单的深层网络如下: 图中是一个四层的全连接网络,假设每一层网络激活后..

霜叶的博客 2万+

【信息科学与工程学】计算机科学与自动化——第十篇 芯片设计33 芯片中的后端设计20

编号子编号类型微电子领域领域关联子领域模型名称20​20.1​后端设计标准单元时序与功耗库NLDM/CCS时序模型​2020.2后端设计标准单元时序模型非线性延迟模型(NLDM)2020.3后端设计标准单元时序模型复合电流源模型(CCS)2020.4后端设计标准单元功耗模型开关功耗模型2020.5后端设计标准单元功耗模型内部功耗模型2020.6后端设计标准单元功耗模型漏电功耗模型2020.7后端设计标准单元噪声模型噪声容限模型2020.8后端设计标准单元噪声模型噪声传播模型2020.9后端设计标准单元PVT

weixin_49199313的博客 254

基本的信号——矩阵脉冲信号(函数

基本的信号——矩阵脉冲信号(函数

qq_42233059的博客 2万+

函数傅里叶变换推导

这是角频率,对于频率从还要乘2pi。

m0_53271604的博客 2894

深度学习计算模型"函数"作用

上面是LSTM计算公式,那三个Sigmoid作为非线性函数的就是三个LSTMRNN模型,决定t时刻节点的除了当前x(t)外,还有t-1时刻的隐层节点输出h(t-1).这代表了历史信息对当前的影响,所以决定开关程度的除了当前输入x(t)外,还有h(t-1)。 含义很清楚,输入是用来控制输入i'(t)进出多少或者是否允许进出的设备;输出是用来控制t时刻状态值m(t)对外多少是

suichen1的专栏 6262

深度学习模型可理解性:从归因算法到产线落地的工程实践

深度学习模型可理解性(understandability)是保障AI系统可信、合规与高效迭代的核心能力,其本质不是事后解释黑箱,而是通过归因算法、概念对齐与偏差感知等技术,在模型决策过程中主动释放人类可认知、可验证、可操作的信号。Integrated Gradients提供像素/字段级决策溯源,TCAV与概念瓶颈层实现人类语义与模型表征的一致性对齐,而基于特征分布与概念图谱的动态监控则支撑系统级偏差感知。该能力已深度应用于医疗影像诊断、金融风控、智能搜索等工业场景,显著缩短上线周期、提升调试效率,并满足GD

weixin_33970449的博客 411

模型稀疏激活真相:MoE架构下参数总量与实际计算量的硬核拆解

在大语言模型工程实践中,'参数总量'与'实际计算量'是两个根本不同的技术概念:前者决定模型容量上限和存储成本,后者直接关联推理延迟、显存占用与API调用费用。MoE(Mixture of Experts)架构通过专家路由实现稀疏激活,使单token仅触发Top-k专家,大幅降低动态计算开销,但路由器本身的稠密计算与负载均衡难题不可忽视。这一机制解释了为何DeepSeek-R1(6710亿参数)能保持接近百亿稠密模型的推理效率,也揭示了显存爆炸、路由漂移、微调失效等生产问题的底层根源。本文聚焦真实部署场景,从

记录技术点点之路 459

腾讯Hy3 MoE大模型:295B参数低成本推理实战指南

MoE(混合专家)架构是解决大语言模型推理成本问题的关键技术方案。其核心原理是通过控网络动态选择专家模块,实现参数的高效利用。这种设计让模型在保持大规模知识容量的同时,显著降低推理时的计算开销,为AI应用落地提供了可行的技术路径。在实际工程中,MoE模型特别适合长文本处理、复杂逻辑推理等需要大量参数支持但受成本约束的场景。腾讯开源的Hy3模型基于Apache 2.0协议,采用295B参数的MoE设计,声称性能可匹敌5倍规模的稠密模型,却只需要极低的推理成本。该模型通过智能路由机制,在保持大容量的同时仅激活

weixin_30887919的博客 334

从GPT-2到MoE架构:大模型演进与实战部署指南

Transformer架构作为现代自然语言处理的基石,其核心原理是通过自注意力机制并行处理序列数据,突破了传统RNN的顺序计算瓶颈。这一设计催生了预训练语言模型的技术范式,通过在海量文本上进行自监督学习,模型能够捕获通用的语言表征。其技术价值在于实现了强大的上下文理解与生成能力,为下游任务提供了通用的基础。随着模型规模扩大,密集架构面临计算成本剧增的挑战,这推动了混合专家(MoE)等稀疏架构的发展。MoE通过控网络动态激活部分参数,在保持庞大模型容量的同时控制计算开销,成为支撑GPT-4、Kimi K3等

weixin_34327761的博客 500

工业场景下损失函数选择:从业务目标出发的工程实践指南

损失函数是连接模型优化与业务目标的核心桥梁,其本质并非纯数学选择,而是面向真实数据分布、样本价值差异和错误代价不对称的工程权衡。在样本不均衡、强业务约束、动态数据漂移等典型工业场景中,标准交叉熵常因默认‘错误等价’假设而失效;需通过加权交叉熵、focal loss、代价感知loss等技术重构梯度更新方向,使模型学习过程直指关键业务指标(如漏诊率、投诉率、坏账成本)。本文聚焦损失函数的业务对齐方法论,涵盖代价矩阵量化、层级错误加权、序数惩罚设计、多任务梯度平衡及在线学习防遗忘等实战路径,为算法工程师提供可验证

dibeichan3033的博客 414

CVPR 2026自动驾驶技术演进:BEV、规划与大模型协同进化

自动驾驶系统正从单模块优化迈向感知-规划-推理深度耦合的新阶段。BEV(鸟瞰图)不再仅是几何投影,而是承载语义与意图的场景表征基础;规划任务突破轨迹生成范式,转向具备形式化安全保证与物理可解释性的行为契约构建;大模型则退居‘认知增强层’,以可解释推理、token动态裁剪和硬件协同设计支撑车端可信决策。三者交汇催生‘因果BEV序列建模’‘拓扑泊车规划’‘场景驱动的LLM推理’等工业级落地技术,显著提升系统实时性、鲁棒性与可验证性。本文聚焦CVPR 2026揭示的这一系统级协同演进路径。

303

NVIDIA MOPD专家模型实战:基于NIM构建低成本高性能AI推理系统

混合专家(MoE)是一种经典的神经网络架构,其核心原理是将一个大模型分解为多个‘专家’子网络,并通过控网络动态选择激活的专家,从而在保持模型容量的同时显著提升计算效率。这一技术价值在于能够以更低的部署与推理成本,获得在特定任务上媲美甚至超越超大通用模型的效果,尤其适用于代码生成、医疗问答等需要专业知识的应用场景。NVIDIA MOPD(Mixture of Pretrained Domain Experts)正是这一思想在预训练大模型场景下的创新实现,它通过集成多个预训练的领域专家模型(如CodeLlam

weixin_34226182的博客 345

DeepFilterNet深度解析:嵌入式实时音频降噪的终极解决方案

在当今远程办公和在线会议成为新常态的时代,音频质量直接影响沟通效率。DeepFilterNet作为一款基于深度学习的全频带音频降噪框架,凭借其轻量级设计和实时处理能力,正在重新定义嵌入式设备上的语音增强技术标准。这个开源项目通过深度滤波技术,在48kHz采样率下实现了专业级的噪声抑制效果,同时保持极低的计算复杂度,为实时通信、语音识别和助听设备等领域提供了突破性的解决方案。 ## 技术架构演进时

gitblog_00666的博客 721

Python机器学习:从零基础到项目实战

当您翻开此书,您正踏入一场数据与智慧的修行。机器学习,并非冰冷的符码,而是机器模拟人类洞察世界的法。本书将带您,以Python为舟,泛游于算法之海。我们不只传授“术”,更探求其后的“道”——从数据的生灭流转中观照规律,于模型的迭代演进里体悟得失。愿您合上书卷时,收获的不仅是驾驭数据的技能,更有一双洞悉复杂、化繁为简的“智慧之眼”。现在,让我们一同启程。

YunWisdom 868

从零构建GLM-5.2专家图谱探针:揭秘MoE模型内部工作机制

在机器学习模型可解释性研究中,探针(Probe)是一种关键的诊断技术,它通过训练简单的线性模型来探测模型内部激活与特定属性之间的关联。其核心原理在于,如果模型的中间层表示线性可分地编码了某些信息,那么一个浅层分类器就能有效预测这些属性,这间接反映了模型内部的知识组织方式。这项技术的价值在于,它为理解黑盒模型、验证其学习机制提供了数据驱动的工具,尤其在专家混合(MoE)等复杂架构的分析中至关重要。MoE模型通过路由网络动态选择专家网络处理不同输入,其内部的知识分工与协作模式是研究热点。应用探针技术,可以系统性

weixin_30430169的博客 419

模型稀疏激活原理:MoE路由机制与2%激活率的工程真相

稀疏激活是现代超大规模语言模型(LLM)实现高效训练与推理的核心技术,其本质是通过动态路由机制,在海量参数中按需激活子集,突破全参数激活带来的显存与算力瓶颈。该机制依托MoE(Mixture of Experts)架构,由轻量级可学习路由器实时决策每个token应调用的专家模块,实现‘总参数庞大’与‘活跃参数精简’的解耦。技术价值在于以极低计算开销(如GPT-4约2%参数/Token)支撑万亿级知识容量,显著提升吞吐、降低部署成本,并增强模型专业化能力。典型应用场景包括大模型推理加速、私有化部署、多领域任务

weixin_34198453的博客 461

2023年2月AI技术切片:多模态生成、指令微调与模型可解释性实战

生成式人工智能正从单点能力突破迈向系统化工程落地,其核心演进围绕多模态生成(音频/视频/3D)、指令微调(Instruction Tuning)与基础模型可解释性三大支柱展开。技术原理上,离散化自回归架构提升音频生成的语义一致性,检索增强+指令泛化的协同机制强化知识密集型任务的可控性,而RASP到Transformer的白箱编译则为模型行为提供形式化验证路径。这些进展显著提升了AI在内容创作、企业知识服务与可信部署中的技术价值,广泛应用于智能客服、教育问答、AIGC音乐制作及动态场景生成等真实业务场景。Mu

闲谈 443
上一篇: 使用Encoder-Decoder模型自动生成对联的思路
下一篇: 使用Word Embedding构造简洁有效的文本摘要系统
张俊林博客
张俊林博客 领域专家: 人工智能技术领域 领域专家: 人工智能技术领域
博客等级 码龄22年 6030粉丝 116原创
评论 11
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值