从哑终端到端侧推理:算力—软件—端云分工的三螺旋演进

从电子管计算机到今天,算力、软件和端云分工这三条线,一直在交替上升。每一次算力供给发生变化,软件范式就会跟着调整,端和云的边界也随之重新划定。端侧AI不是突然冒出来的新事物,它是这条螺旋演进到当前阶段的一个切面。

一条反复出现的节奏

1950年代,算力稀缺到不可能一人一台机器。分时系统让多个用户通过电传打字机拨号接入大型机。终端没有存储,没有算力,只负责敲键盘和看打印结果。这是端云关系的第一次谈判,结果很干脆:云端拿走全部控制权,终端退化成一个交互界面。哑终端不是技术落后,是大型机太贵,必须被几百人共享。成本结构决定了终端只能“哑”。

1970年代,微处理器把算力缩到指甲盖大小。但光有芯片没用,PC真正变成大众消费品,靠的是电子表格和文字处理软件。没有这些软件,PC就是一个昂贵的镇纸。端云分工被重新谈判:程序在本地跑,数据在本地存,端侧第一次拿到大部分控制权。

2000年代,云计算把算力变成按需取用的公共品。三层架构把应用拆开,浏览器管展示,其余全在云端。移动互联网把这条路走到极致:手机芯片不弱,但真正的计算大量发生在云端。端侧的角色再次被压缩成“交互入口”。

现在,算力又一次向端侧溢出。PC端128GB统一内存让千亿参数模型在本地跑起来,工控芯片在10W功耗下做到160 TOPS,端侧小模型在工具调用和指令遵循上真的能用了。硬件又跑到了软件前面。端云分工的第四次谈判正在进行,边界还没画完。

七十年看下来,爆发的时刻从来不是算力最强的时刻,而是软件终于让新的算力供给变得理所当然的时刻。分时系统让“算力在云端”变得理所当然,PC软件让“算力在桌面”变得理所当然,移动App让“算力在口袋加云端”变得理所当然。端侧AI现在缺的,就是这个“理所当然”。

PC:本地跑大模型,从演示变成产品

PC是这一轮端侧AI里最硬的一块战场。要解决的不是“能不能装个AI助手”,而是“能不能在本地跑起真正有用的大模型”。

2026年6月,英伟达在Computex上发布RTX Spark超级芯片,峰值算力1 PFLOPS,最高128GB统一内存,专为本地运行AI智能体设计。微软、戴尔、惠普、联想、华硕、微星等厂商秋季跟进。联想Yoga Pro 9n和宏碁的紧凑型桌面产品已经亮相。

这款芯片的意义不在算力数字,而在于它把“本地跑大模型”从极客演示变成了可量产的产品规格。搭载它的Windows PC有与微软联合开发的安全沙箱,可本地运行大语言模型,兼容超过1000款游戏和应用。

国产芯片也在推。后摩智能的M50用存算一体架构,10W功耗下做到160 TOPS,能流畅运行30B到120B参数的大模型。联想AI主机P7搭载这颗芯片,手掌大小的机身里做到190 TOPS综合算力,可离线运行高达1220亿参数的大模型,无网络环境下本地推理速度达到50 Tokens/s。

高通在另一端渗透。Dragonwing Q-2390和IQ-2390处理器面向零售终端、智能家电、消费机器人以及工业控制器、机器视觉系统,NPU算力1.1 TOPS,目的是让“智能”以可负担的成本覆盖更多设备品类。

Gartner预测2026年AI PC出货量达到1.43亿台,占整个PC市场的55%。AI PC在2029年成为常态,基本没有悬念。

工控与边缘:端侧AI真正在干活的地方

PC端的端侧AI还在解决“能不能本地跑”,工控和边缘设备上的端侧AI已经在解决“能不能稳定干活”。

高通IQ-2390的设计取向很说明问题:工作温度范围-30°C到+115°C,抗振动抗冲击,支持时间敏感网络标准,面向工厂、发电厂和户外工业环境。这些规格不是为了跑分,是为了确定性。

工业场景对端侧AI的要求和消费级完全不同。原始TOPS是误导性指标,真正决定成败的是每次推理的能耗和尾部延迟。一次微小的延迟抖动,在高精度产线上就是一个焊点错位。这就是端侧AI在工控领域必须硬核的原因。

后摩智能的M50已经在AI PC、桌面机器人、智能体电脑等终端中规模化商用,与联想、长城、中国移动等数十家头部企业建立合作。搭载该芯片的联想AI Workmate概念机以桌面机器人形态呈现,可在本地处理语音控制和手势操作,扫描笔记后生成摘要或转化为演示文稿,断网环境下仍可使用。

端侧AI在工业场景的核心价值不是酷,是延迟、安全和断网可用性。数据不出厂,断网也能用,延迟可控——这些在消费级场景是加分项,在工业场景是及格线。

模型:小尺寸,真能干活

端侧AI的另一个关键变量,是模型本身变得能干了。

2026年,多款参数规模在1.7B到4B之间的端侧模型在公开评测中展现出过去只有大模型才具备的能力。多轮工具调用的τ²-bench上,这一量级能拿到30分左右;MCP-Atlas协议测试超过50分,意味着能正确填写API参数、完成跨工具调用;自主搜索信息的BrowseComp接近40分,能从复杂页面中提取有效数据;指令遵循的IFBench达到75分左右。

这些分数的意义不在于“接近云端大模型”,而在于端侧模型的能力边界从陪聊和文字续写,扩展到了完成多步复杂任务——读几十页手册、跨工具操作、在断网环境下完成过去只有大模型才兜得住的活。对于内网办公电脑、工厂终端设备这些碰不到云的场景,这是从不能用 to 能用的跨越。

架构层面也在同步演进。混合专家架构让端侧模型推理时只激活一部分参数,在有限内存和算力下拿到更大的有效容量;量化技术让4B模型在4bit精度下权重压缩到2GB出头,足以放进中端手机的运行内存。这些工程进展叠在一起,才让“小尺寸真能干活”从口号变成可验证的事实。

端侧模型的竞争格局仍然分散,芯片厂商、模型公司、终端厂商各推各的方案,还没有出现一个像云端那样清晰的“基础模型加应用层”的分工结构。这既是机会,也是端侧AI在软件侧尚未收口的证据。

所以,端侧发力了吗

手机端的端侧AI还在找杀手级应用,用户换机的理由还不够硬。但PC、工控和边缘设备上的端侧AI,已经在用“能不能稳定跑起来、能不能断网干活、能不能守住延迟底线”来证明自己的价值。

2026年更准确的说法是:端侧AI的基础设施年。芯片就位了,模型能用了,终端产品开始出货了。产业界的共识正在形成,大模型从“能聊”走向“能干”。

但基础设施就位不等于爆发完成。三螺旋的节奏告诉我们,爆发的前提是出现让用户感知到“没有它不行”的场景。在消费端,这个时刻可能还要等一等;在工业端和生产力场景,它已经在发生了。

端侧AI的“理所当然”时刻,不会以某款爆款App的形式降临,更可能是这样被记住的:某一天你突然发现,开会时笔记本在离线状态下自动整理了纪要,工厂里的质检不再需要往云端传视频,家里的NAS在你还没开口时就准备好了你要找的文件——你不再意识到“AI在端侧运行”这件事,就像你不再意识到手机在本地处理照片、PC在本地运行办公软件一样。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值