动态规划问世以来,在经济管理、生产调度、工程技术和最优控制等方面得到了广
泛的应用。例如最短路线、库存管理、资源分配、设备更新、排序、装载等问题,用动
态规划方法比用其它方法求解更为方便。

应指出,动态规划是求解某类问题的一种方法,是考察问题的一种途径,而不是
一种特殊算法
(如线性规划是一种算法)。因而,它不象线性规划那样有一个标准的数
学表达式和明确定义的一组规则,而必须对具体问题进行具体分析处理。因此,在学习
时,除了要对基本概念和方法正确理解外,应以丰富的想象力去建立模型,用创造性的
技巧去求解。

  • §2 基本概念、基本方程和计算方法
    2.1 动态规划的基本概念和基本方程
    一个多阶段决策过程最优化问题的动态规划模型通常包含以下要素。
    • 2.1.1 阶段
      阶段(step)是对整个过程的自然划分。通常根据时间顺序或空间顺序特征来划分阶
      段,以便按阶段的次序解优化问题。
    • 2.1.2 状态
      状态(state)表示每个阶段开始时过程所处的自然状况。它应能描述过程的特征并
      且无后效性,即当某阶段的状态变量给定时,这个阶段以后过程的演变与该阶段以前各
      阶段的状态无关。通常还要求状态是直接或间接可以观测的。
    • 2.1.3 决策
      当一个阶段的状态确定后,可以作出各种选择从而演变到下一阶段的某个状态,这
      种选择手段称为决策(decision),在最优控制问题中也称为控制(control)。描述决策的变量称决策变量(decision variable),变量允许取值的范围称允许决策
      集合(set of admissible decisions)。用uk (xk )表示第k 阶段处于状态 xk 时的决策变量,
      它是 xk 的函数,用Uk (xk ) 表示 xk 的允许决策集合。在例 1 中u2 (B1 ) 可取C1,C2 或C3 ,
      可记作u2 (1) = 1,2,3,而U2 (1) = {1,2,3}。决策变量简称决策。
    • 2.1.4 策略
      决策组成的序列称为策略(policy)。由初始状态 x1 开始的全过程的策略记作
      p1n (x1 )
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐