标签: mdptoolbox

马尔可夫决策过程的转移矩阵必须是随机的吗？

我正在尝试使用值迭代（通过 pymdptoolbox）和 NumPy找到此图中指定的马尔可夫决策过程问题的最佳策略。但是 pymdptoolbox 说我的转换矩阵“不是随机的”。

是不是因为有 [0, 0, 0, 0] 的数组？有些转换是不可能的，比如从状态 1 到状态 3。如果不是用零，我如何表示这些不可能的转换？

我的代码：

import mdptoolbox 
import numpy as np

transitions = np.array([
#action1
    [
            [0.2, 0.8, 0, 0], #s1
            [0, 0, 0, 0], #s2
            [0, 0, 0, 0], #s3
            [0, 0, 0.9, 0.1] #s4
    ],

#action2
    [
            [0.2, 0, 0, 0.8], #s1
            [0, 0.2, 0.8, 0], #s2
            [0, 0, 0, 0], #s3
            [0, 0, 0, 0] #s4
    ],

#action3
    [
            [0, 0, 0, 0], #s1
            [0.8, …

Run Code Online (Sandbox Code Playgroud)

python markov-chains dynamic-programming stochastic mdptoolbox

Jam*_*s C

2018 11-22

1
推荐指数

1
解决办法

2574
查看次数