问答文章1 问答文章501 问答文章1001 问答文章1501 问答文章2001 问答文章2501 问答文章3001 问答文章3501 问答文章4001 问答文章4501 问答文章5001 问答文章5501 问答文章6001 问答文章6501 问答文章7001 问答文章7501 问答文章8001 问答文章8501 问答文章9001 问答文章9501

连“石头剪刀布”,人类也玩不过AI了

发布网友 发布时间:2022-11-30 14:17

我来回答

1个回答

热心网友 时间:2023-11-04 15:47

如果说有一种解决问题的方法能跨域文化、种族和地域,那么除了抽签这种纯靠运气的方式,恐怕只剩下猜拳了。
人们普遍认可 “石头-剪刀-布” 三者之间的克制关系。“公平+随机” 的特性使其不仅是活跃气氛的小 游戏 ,更能作为一种相对公平的解决问题的手段,广泛应用在解决分歧,决定顺序,或者确定归属的关键时刻。

更不用说,在谁洗碗、谁拖地、谁做饭之类的家务活上,猜拳自带的 “愿赌服输” 可以有效维系家庭和睦,堪称随叫随到的家庭关系调解员。

在大多数人的认知里,猜拳是随机事件,玩家获胜的概率应该是一样的且恒定在三分之一,但事实可能并非如此。

近日,浙江大学何赛灵教授的研究团队开发了一个基于马尔可夫链的 AI 模型,专门用来玩猜拳 游戏 。在和 52 名人类玩家分别大战 300 回合之后,AI 击败了 95% 的玩家。

图 | AI 模型净胜场数变化

对于人类玩家来说,规则是赢 +2 分,平 +1 分,输不得分。在与 AI 对战之前,参与者知道获胜会获得金钱奖励,总分越高,赢的钱越多。因此玩家故意放水或者随便乱选的概率极低。

即便如此,AI 仍然大胜人类。在最悬殊的一场较量中,AI 获得了 198 次胜利,55 次平手,仅输了 47 次,胜率超过人类对手 4 倍。全部 15600 回合详尽的原始博弈数据,在论文的补充资料中给出(详见参考文献)。
如果猜拳胜负真的是随机概率,那么从统计学的角度来讲,15600 场比赛下来,AI 获得如此大优势的概率非常低。

本质上来看,猜拳属于博弈问题,其背后蕴藏着经典的纳什均衡,而每个个体的习惯、认知、策略和策略变化都会影响实际胜率。比如你和对手很熟悉,那么你可能知道他/她经常出布,因此可以多出剪刀来克制。

浙江大学何赛灵教授团队提出的 AI 模型就是利用了类似的方法,证明了猜拳真的存在针对不同个体的长期制胜策略,可以有效提高胜率。
这套 AI 模型基于 n-阶马尔可夫链设计,拥有记忆性,能够向前追溯最多 n 个 历史 状态并加以利用。
为了在实战中应对人类玩家的不同性格和策略,研究团队还发明了一套 Multi-AI 模型。
“建立对每个人都有效的单一模型很困难,因此我们决定将单个模型结合起来,使其能够区分和适应更多不同的竞争策略。” 研究人员在论文中解释称。
在与人类对战的第一Multi-AI 模型中,他们放入了 1-5 阶马尔可夫链,即 5 个独立的 AI 模型,分别参考之前 1-5 个动作。Multi-AI 会从整体上参考 5 个 AI 模型各自的决策,至于选择哪个,还要看它们最近 5 次的表现。
这里的 “最近 5 次” 被定义为一个超参数,名为 Focus length,可以视情况调整大小,实现进一步优化。在与人类对战的第二套 Multi-AI 模型中,该参数就被设为了 10。

图 | Multi-AI 模型的决策逻辑
打个比方,每一个 n 阶马尔可夫链模型就像是一位军师,各自有不同的决策标准。而 Multi-AI 模型就是司令,手底下有好多名军师组成的智囊团。做决策时,每个军师会提交自己的出拳建议,司令会根据他们过去几次(Focus Length)的表现,采纳综合分数最高的人的建议,以提高长期胜率。
如果人类玩家连续胜利,就会促使 Multi-AI 转向选择其他 AI 模型的更优解。如果人类玩家连续失败,大概率会转换策略,或者打破之前的出拳规律,这时 Multi-AI 也可以随之调整。
最终的 社会 实验结果反映出了这个想法的有效性。在 52 名志愿者中,只有不到 5 人击败了 AI。很多人都在最初 20-50 个回合里处于领先,但随后就被 AI 捕捉到了隐藏的行为模式,饮恨败北。
那些击败 AI 的人,胜率也只是稍微高出一些,并未拉开太大差距。

值得一提的是,在开发 AI 模型背后的算法,研究团队阅读了 6 年前另一个浙大团队的研究成果,但使用了另一种不同的博弈策略。
相较于之前对于所有玩家数据整体以统计学的方式进行研究,这里的 Multi-AI 模型更强调针对不同玩家之间的个性差异、出拳策略,来及时的进行*,选取当下最适宜的博弈策略。
2014 年 5 月,很多媒体都报道了一项以 “石头剪刀布” 游戏 为对象的科研成果。

其实不然。这项研究还被《麻省理工 科技 评论》评为 2014 年最佳成果(预印本)之一。

图 | 2014 年《麻省理工 科技 评论》的报道
论文揭示了猜拳 游戏 背后蕴藏着不同的行为模式,比如赢家倾向于下一轮出同样的手势,而输家倾向于改变;人们更愿意出石头等等。但更深层的主旨是探讨纳什均衡在真实博弈中是否成立,研究现实中的博弈模型框架,并且分析 游戏 中的宏观周期现象与微观行为基础。这其中用到的基础理论涉猎博弈论、心理学和神经科学等多个领域。
类似的,2020 年这项关于 “石头剪刀布” 的最新研究,成果不仅仅是一个很厉害的猜拳 AI,还是一个很厉害的循环制衡模型分析师。未来有望拓展到其他博弈场景,比如预测竞争对手的下一步举动,规划更有效的竞选策略,或者制定更有利的定价方案等等。

“(我们发现)人类的竞争行为确实有规律可循,通过使用适当的简单模型就能利用这些规律,”研究人员在论文中总结道,“对于竞争行为模式以及如何利用它们的研究,有望让我们更好地建模,预测和适应不同的竞争模式。”

声明声明:本网页内容为用户发布,旨在传播知识,不代表本网认同其观点,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。E-MAIL:11247931@qq.com
生产要素的需求有哪些性质 生产要素的需求有何特点? 什么是生产要素需求 微观经济学要素需求什么是条件要素需求?它和要素需求有什么不同?_百度... 养宠物的人遵守规则,是不是就能和别人平安相处呢? 企业培训学到了什么 培训感悟简短 有关培训的感悟 通过培训学到什么 培训你学到了什么 领导问培训学到什么怎么回复 光大银行专属客户是什么意思 华为p六如何进行本地升级 痤疮里面是什么.给我答案 男人心情不好的句子发朋友圈 恒阳名居附近小区 山西寿阳农商银行2016年度招聘笔试内容 山西寿阳农商银行2016年度招聘进面试的比例是多少?面试是什么形式? 气体、固体电解质都不导电吗? 气体能导电吗? 气体是否导电 【紧急求助】气体都不导电吗 求详细 气体会导电吗 任何气体(包括空气和氧气和(一二三四)氧化碳)都会导电吗? 银龙鱼能吃吗 银龙鱼与金龙鱼的区别 祝福闺蜜儿子结婚的祝福语 万宝龙145为什么假货多 光波炉烤半成品鸡排多久熟透啊? 同一牌子猫粮需要过渡吗 幼猫什么时候可以换成猫粮,换成猫粮需要过渡吗 猫咪从吃饭到吃猫粮需要过渡吗? 如何预防眼睛长鱼尾纹 让年龄冻结在眼部 会东县属于四川哪个市 西昌市会东县邮编 工业厂房租赁哪个做的好?有相对好的公司没? 有做厂房租赁业务的好公司么? 功能性长短脚怎么纠正 什么是长短腿 话说最近才发现荣耀路由有吱吱声,是怎么回事 路由器电源有吱吱声 梵蜜琳眼霜成分 梵蜜琳眼霜孕妇可以用吗 梵蜜琳是微商还是品牌,梵蜜琳祛斑霜效果怎么样 怎么在17k小说网上注册一个账号? 怎么样注册17K小说作者 怎样在17k原创小说网帐号注册 哪位朋友能告诉我怎样在17k里注册作家申请。 怎样在17K上注册帐号? 苏州天然气怎么缴纳 苏州虎丘区天然气充值激活? 为什么要做酒一样的男人 男性教父微信名对应女性微信名字 喜欢看教父的男人是什么性格