我想为卡牌游戏 Doppelkopf 贡献一些具体信息,这是作者示例性询问的。2012 年,Sievers撰写了一篇硕士论文,其中他在 Doppelkopf 游戏中采用了UCT算法。
UCT通常假设一个完美的信息博弈,因此他首先解决了“牌分配”问题,即根据一些已知的牌来猜测每个玩家的牌分配。
解决这个问题后,他尝试了两种方法来执行算法来解决卡片分配问题:
1) 猜测每个 UCT 树的卡片分配并查看多棵树的平均值。他将这种策略集合称为 UCT。
2) 采用单个 uct 树并为每次推出猜测一个新分配。在 UCT 的选择阶段,您只需忽略所有不一致的子项即可。他将此策略称为单一 UCT。
我的感觉是,2) 创造了一个更强的人工智能,但它似乎更弱,他在2015 年的后续会议论文中更清楚地指出了这一点。
受到 AlphaGo 成功的启发,我和一位朋友为他的学士论文启动了一个项目,他使用基于字符的 LSTM 制作了一个策略神经网络来指导 UCT 算法的选择过程。他的学士论文只涵盖了 ensemble-UCT 的一些测试结果,但我也已经针对单个 UCT 玩家进行了测试,它使得人工智能变得更强。我想这是因为单个 UCT 玩家可以从更有效地减少搜索空间中获益更多。
所以这个答案或多或少与 @charley 给出的相同,但更具体一些。