数学建模-第四章动态规划
·
动态规划问世以来,在经济管理、生产调度、工程技术和最优控制等方面得到了广
泛的应用。例如最短路线、库存管理、资源分配、设备更新、排序、装载等问题,用动
态规划方法比用其它方法求解更为方便。
应指出,动态规划是求解某类问题的一种方法,是考察问题的一种途径,而不是
一种特殊算法(如线性规划是一种算法)。因而,它不象线性规划那样有一个标准的数
学表达式和明确定义的一组规则,而必须对具体问题进行具体分析处理。因此,在学习
时,除了要对基本概念和方法正确理解外,应以丰富的想象力去建立模型,用创造性的
技巧去求解。
- §2 基本概念、基本方程和计算方法
2.1 动态规划的基本概念和基本方程
一个多阶段决策过程最优化问题的动态规划模型通常包含以下要素。- 2.1.1 阶段
阶段(step)是对整个过程的自然划分。通常根据时间顺序或空间顺序特征来划分阶
段,以便按阶段的次序解优化问题。 - 2.1.2 状态
状态(state)表示每个阶段开始时过程所处的自然状况。它应能描述过程的特征并
且无后效性,即当某阶段的状态变量给定时,这个阶段以后过程的演变与该阶段以前各
阶段的状态无关。通常还要求状态是直接或间接可以观测的。 - 2.1.3 决策
当一个阶段的状态确定后,可以作出各种选择从而演变到下一阶段的某个状态,这
种选择手段称为决策(decision),在最优控制问题中也称为控制(control)。描述决策的变量称决策变量(decision variable),变量允许取值的范围称允许决策
集合(set of admissible decisions)。用uk (xk )表示第k 阶段处于状态 xk 时的决策变量,
它是 xk 的函数,用Uk (xk ) 表示 xk 的允许决策集合。在例 1 中u2 (B1 ) 可取C1,C2 或C3 ,
可记作u2 (1) = 1,2,3,而U2 (1) = {1,2,3}。决策变量简称决策。 - 2.1.4 策略
决策组成的序列称为策略(policy)。由初始状态 x1 开始的全过程的策略记作
p1n (x1 )
- 2.1.1 阶段
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)