ai china

Suphx 从一位终须遗忘的老师那里学会了麻将

6 条来源 2 条一手来源 已翻译 2026年8月17号

正文
四名牌手围坐自动麻将桌打日式立直麻将,画面可见牌山、舍牌与点棒。

一局在自动桌上进行的日式立直麻将。Suphx 面向这一规则体系开发;图中人物仅作示意,与微软团队无关。摄影:Tairagi Makoto,CC0。[6]

视频模式

本文包含 1 个可跳转的视频片段。

  1. 1 李俊杰在 Microsoft Developer 视频中讲解 Suphx 麻将 AI 系统 YouTube 视频

在麻将牌桌上,未知本身就是状态的一部分。牌手能看到自己的手牌、已经公开的副露、舍牌、点数,以及逐渐缩短的牌山。其余三家的手牌藏在背后,下一张摸牌带有随机性;一次合理的舍牌同时要衡量当前这一局的和牌概率,以及几局之后落到第四名的风险。

微软开发者频道这部九分钟短片很容易因此被读成另一则熟悉的捷报:微软亚洲研究院的 AI 系统 Suphx 在 2019 年登上日式立直麻将平台天凤的 10 段。沿着影片继续看,研究者实际把不确定性拆成了三个问题:牌手始终看不到的信息、姗姗来迟的奖励,以及需要随局势改变的风险取向。[1][2]

Suphx 团队成员李俊杰以英语介绍这套系统。从 0:00 开始,可以列一张四栏信息账本:桌面可见、仅训练阶段可见、推断所得、研究设想。第一遍跟随研究叙述,第二遍则把每项说法归入相应栏目。这张账本能把三种差异很大的方法分开,避免它们一起隐入“机器产生了直觉”这种含混说法。[1][3]

第一遍——保留一张信息账本

Suphx 所面对的是四人日式立直麻将,范围限定在这一规则体系内。它的决策系统为舍牌、宣告立直以及吃、碰、杠分别设置模型,和牌本身由规则处理。五个学习模型先模仿天凤高水平玩家牌谱中的动作,随后由自我对弈强化学习继续改进舍牌模型。Suphx 的学习起点来自人类牌局,自我对弈再细调系统中调用最频繁的决策部分。[2]

当影片从暗牌转到“先知指导”(oracle guiding)时,这一区分格外重要。在强化学习期间,模型的先知版本可以读取普通牌手看不到的信息,包括对手的暗手牌和牌山里的牌。研究者随后逐步移除这些完美信息特征。训练结束时,常规策略只能依据规则允许观察的信息行动。[2][3]

先知指导相当于训练阶段的临时脚手架,越界信息被隔绝在正式对局之外。教师备课时可以摊开完整答案,学生进入考场后只能依靠考题允许的信息。这里的技术尝试,是让特权训练信息在消失之前给出更清晰的学习信号。论文证据显示,作者的系统性能有所提升;从中推不出部署后的牌手逐张还原了暗牌,也推不出它拥有通用的读心能力。

教师退场之后,不确定性留在牌桌上

先知指导处理的是训练难题,实战中的不确定性仍由常规策略承担。额外输入撤去之后,同一个可见牌面依然对应许多种暗牌排列,Suphx 必须选择能在这些未知情况中取得良好结果的动作。由此再看“预测”一词,它需要更准确的落点。系统的全局奖励预测器没有承担侦测暗牌的任务;它把多局游戏的最终结果连回较早的牌局,以免强化学习在那里只收到微弱或误导性的信号。[2]

假设牌手带着大幅领先进入最后一局。追求最高打点会增加多余的暴露,接受眼前的小损失则可以守住第一名。反过来,远远落后的牌手要主动接受波动,安全打法会减少追赶所需的机会。若奖励只系在当前一局上,这两种处境都会把训练引向错误方向。Suphx 的预测器根据牌局序列估计最终游戏奖励,让训练可以把得失归因到跨局动作上。训练对准的是最终名次,孤立的一局胜利只占其中一部分。[2][3]

影片还介绍了运行时策略适应:针对当前一局实际拿到的私有手牌调整策略。这是一项研究方法,解释公开的天凤战绩时应当将它单独放置。论文说明,线上天凤代理省去了这套适应程序,因为它的速度无法满足该环境。那项广受瞩目的成绩来自基础系统,没有使用这道额外的运行时程序。[2]

回放计分板,也把每一步放回奖惩规则中

天凤的激励规则塑造了“强大”的具体含义。它的段位体系会重罚第四名,段位越高,代价越大。Suphx 因此会保护有利的总排名,保留更安全的牌,并避开灾难性的放铳,即使更激进的路线能提高当前一局的和牌机会。论文记录的对局中,Suphx 以第四名结束的比例为 18.7%,放铳率为 10.06%。这些数字说明了它的防守名声从何而来,其适用范围仍限定在天凤规则内,无法直接充当所有麻将规则下的普遍最优值。[2][5]

这也是整段观看中最适合迁移到其他问题上的一课:看起来很像人类性格的“风格”,可以从评估制度中长出来。在把表现归于性情或直觉之前,可以先查看计分板奖励什么、对什么施加不对称惩罚,又经过多长时间才结算。面对同样的可见牌面,一个以单局和牌数、原始点数或锦标赛存活为目标的 AI,完全可以合理地学出另一种风格。

运行时策略适应、先知指导与全局奖励预测需要分放在三个格子里。第一项让策略贴合某一局获配的具体手牌,却没有用于论文所报的线上对局;第二项在训练时借用隐藏状态,部署前再将其移除;第三项把整场游戏的最终目标向前传递到各局。三者都可以归入“不确定性下的推理”,这种总称保持了方向,却会遮住那些让论断能够接受检验的工程选择。

明确范围内的一项强成绩

论文记录了 Suphx 在天凤特上桌(Expert room)的 5,760 局对战,最高段位为 10 段,估算安定段位为 8.74。对照组汇集了此前达到过 10 段的人类玩家在特上桌留下的 8,031 局对战,其安定段位为 7.46。作者还按最高段位分布计算,Suphx 超过了当时 99.99% 的天凤活跃段位玩家。[2]

这些历史成绩分量很足,其中每个名词也都限定了结论的适用范围。“安定段位”是按特定计分体系下的名次结果推算出的估计值;“顶尖人类”指合并后的对照群体,论文没有安排一位具名冠军参加受控比赛;“特上桌”也有别于天凤等级更高的凤凰桌(Phoenix room):AI 被禁止进入后者,两种牌室的计分差异也让论文选择不作直接比较。[2][5] 证据能够支持的结论是,Suphx 成为首个达到 10 段的 AI,并在安定段位上超过论文汇集的特上桌顶尖人类基准。这组证据没有覆盖所有麻将规则,也没有安排与世界单一最强牌手的对决。

片尾音乐在 9:03 左右再次响起时,影片对现实世界的延伸仍需停在证据所及之处。微软的英文专题写道,Suphx 经过 5,000 多局在线对战,从新手成长为专家;文章也把这些方法未来用于处理未知因素与随机事件交织的现实决策列为研究设想。[1][4] 这仍是一条研究方向,Suphx 实验本身没有评估物流、金融或交通任务。迁移到这些领域,需要重新表示规则允许的观察、可选动作、延迟结果、不断变化的风险,以及糟糕尾部事件的代价。

第二遍——把三个问题留在屏幕上

第二遍观看时,可以放下“AI 打败人类了吗?”这道凯旋式提问,改在屏幕上保留三个范围更窄的问题。

第一,训练与部署之间,哪些信息获准通行? 人类牌谱与暗牌都能用于教授策略,常规对局的评估则只能依据常规可见信息。第二,奖励在何时才有意义? 一步在当前局面造成损失的动作,仍能保护最终名次,因此学习信号要跨越多局。第三,指标让哪一种风险变得昂贵? 天凤对第四名的严厉惩罚,把避开灾难性结果从次要偏好变成了实力的一部分。

这些问题让视频的价值落在实验本身,现实类比可以暂且留在画外。Suphx 是一则紧凑的案例:北京的一支研究团队把文化上熟悉的游戏转化为关于部分可观测性与长时程决策的受控实验。它的成就落在一套精心分段的教育过程里,神秘的机器直觉则在论证之外:模仿人类,在全知教师的带领下学习,移除教师那份学生无权使用的视野,再用系统所针对的精确计分板检验最终牌手。

来源

  1. Microsoft Developer,“Developer Tech Minutes:用 AI 掌握麻将”,李俊杰演讲,2021 年。
  2. Junjie Li 等,“Suphx:以深度强化学习掌握麻将”,Microsoft Research Asia 技术论文,2020 年。
  3. Microsoft Research Asia,“微软超级麻将AI Suphx,破解非完美信息游戏”,中文一手技术解读,2019 年。
  4. Microsoft Stories Asia,“超越一场游戏:以 AI 与机器学习掌握麻将”,2019 年。
  5. Tenhou,官方游戏手册:牌室准入、AI 参与和段位规则。
  6. Tairagi Makoto,“日式立直麻将自动桌实战”,Wikimedia Commons 照片,CC0 1.0。
Previous 无问芯穹正把距离纳入加速器调度

Recommended In ai china

Matched by subject and format