三、截断策略迭代算法(Truncated Policy iteration algorithm)首先,比较value iteration和policy iteration:Policy Iteration: 从一个初始策略π0\pi_{0}