扑克人工智能的崛起——从Deep Blue到Libratus再到Pluribus

2017年1月,匹兹堡的一家赌场内,一场注定载入史册的人机对决正在进行。对阵双方是四位人类顶级无限注德州扑克单挑牌手,以及一个名为Libratus的人工智能程序。经过二十天的鏖战,人类牌手全部告负,Libratus以压倒性优势赢得胜利。这是人工智能首次在无限注德州扑克单挑中击败人类顶尖选手。
两年后的2019年,另一个名为Pluribus的AI在六人桌无限注德州扑克中再次战胜人类职业牌手。扑克,这个长期被奉为人类心理博弈巅峰的游戏,终于也被人工智能征服。扑克对人工智能研究者来说具有特殊的吸引力。与国际象棋或围棋不同,扑克是一个“不完全信息博弈”——玩家无法看到对手的底牌,必须在信息缺失的情况下做出决策。这种特性使得扑克比完全信息博弈更接近真实世界中的战略决策场景:商业谈判、拍卖竞价、军事策略、金融交易,这些领域都涉及在不完全信息下做出最优选择。因此,攻克扑克不仅是游戏AI的里程碑,更具有广泛的应用前景。
人工智能挑战扑克的历史可以追溯到更早的时期。1980年代,计算机科学家们就开始尝试为简单的扑克变体编写策略程序。但早期的扑克AI水平极其有限,只能在最简单的限注扑克中与业余玩家抗衡。真正的突破发生在2000年代之后,随着计算能力的指数级增长和博弈论算法的发展,扑克AI开始逐步攻克各种扑克变体。
2015年,卡内基梅隆大学的研究团队发布了他们开发的AI程序Claudico,并在匹兹堡的一家赌场中与四名人类顶级牌手进行了无限注德州扑克单挑比赛。比赛持续了两周,打了超过八万手牌。最终Claudico以小幅劣势落败,但这个结果已经足够令人震惊——AI已经在最复杂的扑克形式中接近了人类顶尖水平。研究团队分析了Claudico的弱点,对其算法进行了大幅改进。
2017年,改进后的AI以Libratus之名重新挑战人类。Libratus的核心算法建立在博弈论的纳什均衡概念之上。简单来说,它试图找到一种在任何情况下都不会被对手利用的策略——即使对手知道Libratus的策略,也无法找到针对性的弱点。这种策略被称为“GTO策略”。在长达二十天的比赛中,Libratus展现了令人类牌手感到窒息的能力:它的下注尺度极其精确,它的诈唬频率近乎完美均衡,它从不受到情绪波动的影响,它甚至能够在每晚休息时通过自我对弈来修补白天比赛中暴露出的微小漏洞。
四位人类牌手中的一位在赛后接受采访时说:“与Libratus对战就像在黑暗中与一个永远不犯错的对手搏斗。你永远不知道它是强是弱,因为它每时每刻都保持着完美的平衡。”最终统计结果显示,Libratus在12万手牌中赢得了约177万美元的虚拟筹码,人类牌手全军覆没。
Libratus的胜利标志着无限注德州扑克单挑被人工智能攻克。但更大的挑战还在后面——六人桌扑克。单挑扑克中的策略空间已经极其庞大,六人桌的策略空间则呈指数级增长。多个玩家之间的互动、联盟和博弈使得找到最优策略的难度远远超过单挑。许多研究者认为,攻克六人桌无限注德州扑克可能需要更长的时间。
然而仅仅两年之后,2019年7月,卡内基梅隆大学和Facebook AI研究院联合发布了一个名为Pluribus的AI程序,宣布它在六人桌无限注德州扑克中击败了人类顶级牌手。Pluribus的突破在于它找到了一种更高效的算法,使得在多人博弈的巨大策略空间中找到近似最优解成为可能。在测试中,Pluribus与十五名人类职业牌手进行了超过一万手六人桌对决,最终以显著优势获胜。
Pluribus展现出了一些令人类牌手极为不安的策略特征。它频繁使用一些在传统扑克教学中被认为“非标准”的下注尺度,比如小额领先下注和超池下注。它的一些决策在人类牌手看来不可思议,但从博弈论的角度却是最优的。它不需要“读懂”对手,因为它假设所有对手都在做出最优回应,而它自己的策略在任何情况下都是不可利用的。
扑克AI的崛起对扑克产业产生了深远的影响。GTO策略训练已经成为当代职业牌手训练体系的核心组成部分。几乎每一位有志于在最高级别赛事中竞争的牌手都会使用基于AI算法的扑克求解器软件来分析和优化自己的策略。牌手们不再争论“这种局面下应该怎么做”,而是直接查询求解器的建议。这导致了高水平牌手之间的策略趋同——大家的打法都越来越接近博弈论最优解,依靠对手策略错误获利的空间被不断压缩。老一辈依靠直觉和经验打牌的牌手在这种新环境中愈发艰难,而新一代精通数学和求解器训练的牌手则占据优势。
AI的介入也引发了关于游戏公平性的讨论。在线上扑克中,如何防止玩家使用AI辅助决策成为平台方的重大挑战。高级的扑克求解器能够在几秒钟内给出特定局面下的最优策略建议,如果有人在线上比赛中实时使用这样的工具,将获得巨大的不正当优势。各平台纷纷部署了反作弊检测系统,但AI与反AI之间的军备竞赛仍在持续。
扑克人工智能的故事远未结束。当AI已经在策略层面碾压人类之后,研究者的兴趣正在转向更有挑战性的方向——比如让AI学会适应不同风格的对手,而不是简单地执行GTO策略;或者将扑克AI的技术应用到更广泛的不完全信息决策领域。正如Libratus和Pluribus的创造者之一Tuomas Sandholm所说:“扑克只是一个测试场地。真正的目标是创造一个能够在任何复杂的不完全信息环境中做出最优决策的通用智能。”
对于扑克世界来说,AI的征服是一个时代的终结,也是一个时代的开始。那些在烟雾弥漫的地下扑克局中依靠直觉和胆量打牌的日子一去不复返了。扑克不再是人类直觉的最后堡垒,而是人类与机器共同进化的新战场。