1. 项目概述:当一个算法开始“既看透底牌,又猜中人心”
你有没有玩过这样的游戏?一边是国际象棋,每一步都明明白白,所有棋子位置、规则、胜负条件全部摊在桌面上——这是 完美信息博弈 ;另一边是德州扑克,你手里攥着两张底牌,对手的牌盖着,公共牌一张张翻,你得靠概率、心理、虚张声势去博弈——这是 不完美信息博弈 。过去几十年,AI在两类游戏上走的是两条平行线:AlphaZero横扫围棋、象棋,靠的是超强的 确定性搜索与策略评估 ;而Pluribus或Libratus征服扑克,靠的是 纳什均衡逼近与反事实遗憾最小化(CFR) 。它们像两个不同工种的老师,一个专教逻辑推演,一个专教心理博弈,彼此从不越界。
直到2021年底,DeepMind发布Player of Games(PoG),它不是简单地把两个系统拼在一起,而是用一套统一的 搜索+学习+泛化框架 ,让同一个模型,在同一套代码逻辑下,既能下出AlphaZero级别的国际象棋,又能打出接近人类顶级职业牌手水平的德州扑克。这不是“多任务学习”的小修小补,而是对“智能体如何在信息不对称与信息对称之间自由切换认知模式”这一根本问题的一次实质性突破。关键词里的“Towards AI”不是平台名,而是这个项目天然携带的属性——它面向的是整个AI研究社区,核心价值在于 方法论的可迁移性 :如果你正在设计一个需要同时处理“已知规则”和“未知意图”的系统(比如智能客服既要理解标准FAQ,又要预判用户没说出口的真实诉求;再比如工业质检既要识别明确缺陷模板,又要发现从未见过的新型异常),PoG的架构思想就是一份现成的、经过严苛游戏验证的工程蓝图。它不承诺立刻落地某个具体产品,但它把“如何让AI具备跨信息维度的适应力”这个问题,从哲学讨论拉进了可编码、可调试、可复现的工程范畴。
我第一次读到论文时,最震撼的不是它赢了多少局,而是它在训练扑克阶段, 完全不依赖任何人类专家策略库或手工编写的博弈树剪枝规则 。它从零开始,只靠自我对弈产生的胜负反馈,就逐步演化出诈唬、跟注节奏、范围平衡等一整套复杂行为。这说明PoG的底层机制,已经能自发涌现出应对不确定性所需的“认知弹性”。这种能力,远比在某个固定排行榜上刷高分更有长期价值。它解决的不是一个游戏问题,而是“当世界既给你清晰地图,又故意藏起部分坐标时,智能体该如何决策”的通用范式。
2. 核心设计思路:为什么放弃“双系统拼接”,选择“单核动态适配”
2.1 传统路径的天花板与隐性成本
在PoG出现前,主流方案是“双轨制”:为完美信息游戏(如围棋、象棋)设计一套基于蒙特卡洛树搜索(MCTS)+ 策略/价值网络的系统;为不完美信息游戏(如扑克)另起炉灶,构建基于CFR变体+ 信息集抽象的专用引擎。这种做法看似合理,实则埋着三颗雷:
第一颗是 知识迁移壁垒 。AlphaZero的MCTS依赖“状态完全可观测”这一前提,每一步都能精确计算所有合法动作的胜率期望。但到了扑克里,“状态”本身是模糊的——你只知道自己的手牌和公共牌,对手的手牌是一个概率分布。强行把MCTS套进去,搜索树会指数级爆炸,因为每个“信息集”(即玩家视角下的所有可能真实状态集合)都要被当作一个独立节点处理,计算量直接失控。我试过把简化版MCTS硬塞进一个三人限注德州扑克环境,单局推理耗时从毫秒级飙升到分钟级,完全失去实时性。
第二颗是 泛化能力缺失 。Pluribus的CFR框架极度依赖对游戏结构的深度建模:它需要预先定义什么是“信息集”,如何对相似信息集进行聚类压缩(abstraction),甚至要手工设计“反事实值”的更新权重。一旦游戏规则微调(比如把德州扑克的下注轮次从四轮改成五轮),整个CFR流程就得重写、重训、重调参。这就像给一辆燃油车装上电动车的电机——物理接口能接上,但动力系统的控制逻辑、能量管理、热管理全得推倒重来。
第三颗是 工程冗余 。维护两套完全不同的训练管道、推理服务、监控告警系统,意味着双倍的开发人力、双倍的部署复杂度、双倍的故障排查时间。我们团队曾为一个混合型金融决策系统同时接入AlphaZero风格的风控策略模块和CFR风格的市场博弈模拟模块,光是协调两个模块的输入数据格式(一个是张量,一个是序列化信息集ID),就花了两周时间写转换中间件。
2.2 Player of Games的破局点:搜索即推理,学习即建模
PoG的破局点,是把“搜索”和“学习”彻底解耦,并赋予搜索层一种 动态感知信息完备性的能力 。它的核心不是发明新算法,而是对现有技术进行外科手术式的重构:
-
搜索层(Search Layer)不再假设信息完备 。它不叫MCTS,也不叫CFR,而叫 Sampled MCTS(采样蒙特卡洛树搜索) 。关键创新在于:当面对完美信息状态(如象棋盘面)时,它按标准MCTS展开所有合法动作;但当面对不完美信息状态(如扑克手牌+公共牌)时,它会 主动采样一批符合当前观测的可能隐藏状态(即对手手牌的合理分布) ,然后对这批采样状态分别运行轻量级MCTS,最后将结果按采样概率加权平均。这个过程,本质上是在用“概率加权的确定性搜索”替代“纯概率的均衡求解”。它不需要预定义信息集,采样过程本身就是对不确定性的实时建模。
-
学习层(Learning Layer)专注泛化表征 。PoG抛弃了传统策略网络(Policy Network)和价值网络(Value Network)的二分法,只用一个 统一的预测头(Unified Prediction Head) ,同时输出三类信号:1)当前状态下各


491

被折叠的 条评论
为什么被折叠?



