wepoker下载✿ღ。种苗繁育✿ღ。农人培训观光工厂✿ღ,产后修复✿ღ,微扑克水耕栽培✿ღ,4 月 7-9 日✿ღ,2017 年首期 ADL 课程中✿ღ,8 位顶尖学术大牛余凯✿ღ、颜水成✿ღ、杨强✿ღ、李航✿ღ、俞凯✿ღ、孙剑✿ღ、郑宇✿ღ、山世光将亲临现场授课✿ღ。想要第一时间聆听大牛分享?报名进行中✿ღ。
雷锋网按✿ღ:亚洲首度德州扑克人机大战——“冷扑大师 V.S. 中国龙之队” 巅峰表演赛已经在海南生态软件园传奇智力运动馆开始✿ღ,获胜方将获得 200 万人民币奖励✿ღ。面对来势迅猛的人工智能✿ღ,人类能够守住冠军的宝座呢?
比赛首日上半场✿ღ,中国龙之队顺利按进度完成 3600 手牌✿ღ,冷扑大师暂时领先中国龙之队 14145 筹码✿ღ。因为每人单副手牌重置后的筹码量就有 20000✿ღ,所以目前的差距非常小✿ღ。
冷扑大师和中国龙之队的介绍详见雷锋网报道✿ღ:亚洲首度德州扑克人机对战即将开赌✿ღ!附李开复演讲全文
看了上面的介绍我们知道✿ღ,所谓的 “冷扑大师” 其实就是今年 1 月 30 日在匹兹堡战胜 4 位顶尖人类玩家的 Libratus✿ღ。那么同是人机对战✿ღ,这次的看点在哪里呢?
昨天的发布会上✿ღ,从主办方公开的龙之队资料看✿ღ,很多队员都有深厚的计算机专业背景天海翼步兵✿ღ。比如✿ღ:杜悦✿ღ、许朝军✿ღ、张淮都曾就读于清华的计算机系✿ღ。用李开复的话说就是✿ღ:
匹兹堡之战中被击败的职业棋手确实都是德扑的顶尖职业牌手wepoker官网 app✿ღ,但他们并不懂计算机原理✿ღ,而此次龙之队都是学霸✿ღ,全部拥有计算机领域的从业经验✿ღ,会让比赛还保留悬念✿ღ。
据悉✿ღ,4 月 6 日至 10 日期间✿ღ,表演赛将以转播形式邀请多位爱好扑克的名人✿ღ,远程在各大直播平台展开系列精彩点评✿ღ,海泉基金创始人胡海泉✿ღ、著名专栏作家王小山✿ღ、360 人工智能研究院院长颜水成✿ღ、乐视云 CEO 吴亚洲✿ღ、追梦者基金创始人朱波✿ღ、英诺基金创始人李竹等将担任专家评论员✿ღ。
同时✿ღ,据主办方介绍✿ღ,在 4 月 10 日赛事最后一天晚间✿ღ,将有包括李开复在内的 36 位来自科技圈✿ღ、投资圈✿ღ、媒体圈的名人大咖组成六支战队来挑战冷扑大师✿ღ。
德州扑克一张台面至少 2 人✿ღ,最多 22 人✿ღ,一般有 2-10 个玩家参与✿ღ。目前冷扑大师还无法参与多人的牌局✿ღ,这多少让人感觉不那么刺激和热闹✿ღ。
每个人类玩家同时打两手牌✿ღ,比赛采用复式发牌wepoker官网 app✿ღ,也就是说 A 队人类拿到的手牌✿ღ,是 B 队电脑的手牌✿ღ,A 队电脑的手牌是 B 队人类的手牌✿ღ。而且是随机分配到某个牌手✿ღ,并非一一对应✿ღ。
据雷锋网了解✿ღ,冷扑大师采用完全数学的模型和算法✿ღ,后台的计算机群计算量很大✿ღ,所以人类同时打两手牌时间上也是来得及的✿ღ。
在每一局开始✿ღ,牌手和 AI 均有 20000 的筹码✿ღ,小盲注 100✿ღ,大盲注 200✿ღ。一局打完之后✿ღ,无论结果如何✿ღ,下一局双方的筹码都要重置回 20000✿ღ。
目前冷扑大师还不能在双方不同筹码的情况下与人类比赛✿ღ,因为这在模型的建立上要更加复杂✿ღ,而这无疑是降低了人机对抗时 AI 的难度✿ღ。
2016 年 3 月✿ღ,自从 AlphaGo 以 4:1 的成绩战胜职业九段李世乭以后✿ღ,围棋 AI 的厉害为大众所熟知✿ღ。不论是在专业的学术期刊还是社交网络✿ღ,人们都展开了深入和广泛的讨论✿ღ。但是对于德州扑克 AI✿ღ,大众还所知甚少✿ღ。那么德州扑克 AI 与围棋 AI 有何不同?
AlphaGo 是用大量的棋谱和自对弈做训练✿ღ,而 Libratus 则是用随机生成的牌局(随机产生公共牌✿ღ、底池筹码✿ღ、玩家拿牌概率)和尝试性的动作带来的结果(在随机生成的输入情况下模拟玩家跟牌后的结果)作为训练数据✿ღ。
“一对一无限注德州扑克” 就是两个人玩的赌博游戏✿ღ,因为事先会给每位玩家分发 2 张底牌✿ღ,所以对方的 “底牌信息” 你是不知道的✿ღ,对于计算机来说✿ღ,就是在处理一种 “非完整信息博弈”✿ღ。而 AlphaGo 玩围棋✿ღ,对弈双方的信息是完整的✿ღ、对称的✿ღ,并没有隐藏的信息✿ღ。
一方面是因为对于同样的客观状态✿ღ,各个玩家看到的信息不同✿ღ,因此增加了每个玩家状态空间的数目和决策的难度✿ღ;
另一方面即使在同样的状态下✿ღ,解非对称信息游戏所需要的内存也要比解对称信息要多得多✿ღ,这个主要是对于对称信息博弈来说✿ღ,只要记得当前局面并且向下推演找到比较好的策略就可以了✿ღ;但对非对称信息博弈天海翼步兵✿ღ,只记得当前(不完整的)局面是不够的✿ღ,即使盘面上的情况相同✿ღ,但对手之前的各种招法会导致事实上局面不同✿ღ,只有把它们全都罗列出来进行分析✿ღ,才能保证想出的应对策略不被别人利用✿ღ。
同时wepoker官网 appwepoker官网 app✿ღ,非对称信息博弈的实用价值更大些✿ღ。因为非对称信息博弈的应用范围非常广泛✿ღ,涵括我们每天遇到的所有决策✿ღ,上至国家战略✿ღ,下至日常琐事✿ღ,全都可以以同样的方法建模✿ღ。
据田渊栋近期在 AI 科技评论上所做的分享wepoker官网 app✿ღ,CMU 的 Libratus✿ღ,也就是现在的冷扑大师有三个特点✿ღ:
一是没有使用深度学习✿ღ,而是用到了 End-game solver✿ღ。因为德扑一局时间比较短✿ღ,几个回合就结束了✿ღ,所以可以从下往上构建游戏树✿ღ。这样的好处是✿ღ,最下面节点游戏树的状态是比较容易算出来的✿ღ,用这个反过来指导设计上面的游戏树✿ღ。
二是像 AlphaGo 一样也采用了蒙特卡罗方法✿ღ,标准的 CFR(Counterfactual Regret Minimization)在每次迭代的时候✿ღ,要把整个游戏树都搜一遍✿ღ,这个对于稍微复杂一点的游戏来说是不可接受的✿ღ。因为是指数级的复杂度✿ღ,所以用蒙特卡罗方法✿ღ,每次选一些节点去更新它上面的策略✿ღ。
第三✿ღ,一般来说我们在做游戏的时候往往会想到 怎么去利用对方的弱点天海翼步兵✿ღ,但其实不是这样的✿ღ。更好的方法是✿ღ,我尽量让别人发现我的弱点✿ღ,然后据此我可以去改进它✿ღ,变得越来越强✿ღ。用术语来讲✿ღ,就是去算一下对手的最优应对(Best response)✿ღ,让对手来利用你的弱点✿ღ,然后用这个反过来提高自己的水平✿ღ。
经过 AlphaGo 和 Libratus 分别在围棋和德扑领域几次三番对人类顶尖玩家形成碾压✿ღ,也许很多人已经对人类获胜不报期望✿ღ。本次赛前发布会上✿ღ,龙之队队长杜悦告诉媒体✿ღ,这次他们仅有 10% 的获胜希望天海翼步兵✿ღ。
其实或许不必如此悲观✿ღ,Libratus 在两个月前的匹兹堡人机对抗中并非赢的一帆风顺✿ღ,甚至还被人类玩家发现了破绽✿ღ。这点或许我们可以从近期著名扑克牌杂志 Card Player 对 Libratus 的创始成员 Brown 博士的专访中窥见一二✿ღ。此前雷锋网已将专访进行翻译✿ღ,《德州扑克算法幕后研发者 CMU 博士 Brown 专访✿ღ:AI 如何打败顶级人类牌手?》(点击阅读原文查看)✿ღ。
在人类玩家紧追比分✿ღ,对战进入白热化的时候✿ღ,你是不是在想对手可能已经找到了 Libratus 的弱点✿ღ,还是说仍旧很有信心?
第一周比赛快要结束时✿ღ,双方几乎打成平局✿ღ。人类选手也在第一周对 Libratus 会如何调整打法✿ღ、它的强项在哪里等做出了一系列推测✿ღ。他们没有和我详谈他们认为战局将会如何发展✿ღ,但从我听到的来看✿ღ,他们应该是想从数据中寻找 Libratus 的套路✿ღ,分析它的弱点和优势✿ღ。所以✿ღ,大体上我不怎么担心✿ღ。他们认为 AI 在一些方面有缺陷✿ღ,但实际上并没有✿ღ。
比如✿ღ,在有一天的比赛中✿ღ,他们 80% 都是再加注( three-betting )✿ღ,因为从数据来看✿ღ,他们认为 AI 对特定的三倍打法( three-bet size)不太擅长✿ღ。但我不认为那是缺陷✿ღ,只是他们的数据中存在噪音✿ღ。他们在比赛进程中获得的数据导致他们得出了这样的结论✿ღ。
但他们确实看到了里面存在的一些问题✿ღ。比如 Libratus 对特定的开局下注的大小对应不好✿ღ。比赛前我们认为这不是什么大问题✿ღ,但事实证明✿ღ,这个弱点很要命✿ღ。好在 AI 还留有一手——趁当天晚上对手睡觉的时候✿ღ,AI 就开始连续不断地进行训练✿ღ,弥补自己的不足以防止对手以后再次利用这一缺陷✿ღ。所以你看到✿ღ,从第二周局势就开始转变了✿ღ。
虽然 Brown 博士在采访中一开始回应 Libratus 没有弱点天海翼步兵✿ღ,但是后来又改口说 Libratus 对特定的开局下注的大小对应不好是个很要命的弱点✿ღ。而就像前面介绍的✿ღ,这次龙之队的成员大多为拥有计算机专业背景的学霸✿ღ,但愿他们能够及早发现 “冷扑大师” 的弱点并善加利用✿ღ,这多少将给我们增添几分人类获胜的希望✿ღ。
从比赛规则的制定中可以看出✿ღ,不管是要求 1V1 的单挑✿ღ,还是单局手牌后的筹码重置✿ღ,人类玩家都需要对 AI “迁就” 很多✿ღ。所以即便是 “冷扑大师” 取得本次人机大赛的胜利✿ღ,也不能说人工智能在德州扑克上完全战胜了人类天海翼步兵✿ღ。但是对于 “非完整信息博弈” 的人工智能研究课题而言✿ღ,冷扑大师的胜利将有重大的意义✿ღ。当然✿ღ,比赛才刚刚开始✿ღ,大奖花落谁家尚未可知✿ღ,让我们拭目以待✿ღ。