您好,欢迎来到聚文网。 登录 免费注册
阿尔法零对最优模型预测自适应控制的启示/信息技术和电气工程学科国际知名教材中译本

阿尔法零对最优模型预测自适应控制的启示/信息技术和电气工程学科国际知名教材中译本

  • 字数: 262
  • 出版社: 清华大学
  • 作者: (美)德梅萃·P.博塞克斯|译者:贾庆山//李岩
  • 商品条码: 9787302660361
  • 版次: 1
  • 开本: 16开
  • 页数: 161
  • 出版年份: 2024
  • 印次: 1
定价:¥69 销售价:登录后查看价格  ¥{{selectedSku?.salePrice}} 
库存: {{selectedSku?.stock}} 库存充足
{{item.title}}:
{{its.name}}
精选
内容简介
德梅萃·P.博塞克斯 (Dimitri P.Bertsekas)教 授是国际运筹优化与控制领 域的著名学者,其系列经典 教材被清华大学、麻省理工 学院等国内外高校广泛使用 。本书构建了近似动态规划 和强化学习的新的理论框架 ,简洁但雄心勃勃。这一框 架以离线训练和在线学习这 两类算法为中心,彼此独立 又通过牛顿法有机融合。当 今新一代人工智能技术发展 绚丽多彩,在看似纷繁复杂 的数据与算法表象之下,其 实蕴藏着简洁而美妙的规律 。通过本书的学习,读者将 能体会经典优化控制理论在 分析和理解当代强化学习算 法性能中的强大威力,更能 领悟到以阿尔法零为代表的 新一代算法浪潮为经典理论 提供的新的发展机遇。本书 适合作为普通高等学校信息 科学技术领域研究生、本科 生高年级教材,也可供本领 域科研人员自学参考。
作者简介
贾庆山,清华大学长聘教授。主要研究信息物理融合能源系统的优化理论与方法。发表四十篇IEEE汇刊论文。获得2009年国家自然科学奖二等奖、2018年国家自然科学奖二等奖、2020年教育部自然科学奖二等奖,多次获得国际期刊、国际会议最佳论文奖。担任IEEE Internet of Things Activity Board委员、IEEE控制系统协会Board of Governors委员、IEEE控制系统协会北京分会主席、IEEE机器人与自动化协会智能建筑专业委员会副主席、IFAC智慧城市控制专业委员会主席。曾任IEEE控制系统协会离散事件系统专业委员会主席。担任中国自动化学会第十一届控制理论专业委员会委员兼副秘书长,中国自动化学会第一届工业控制系统信息安全专业委员会委员。
目录
第1章 阿尔法零、离线训练和在线学习 1.1 离线训练和策略迭代 1.2 在线学习与值空间近似——截断滚动 1.3 阿尔法零的经验 1.4 强化学习的一种新概念框架 1.5 注释与参考文献 第2章 确定性和随机的动态规划 2.1 无限时段上的最优控制 2.2 值空间近似 2.3 注释与参考文献 第3章 强化学习的抽象视角 3.1 贝尔曼算子 3.2 值空间近似和牛顿法 3.3 稳定域 3.4 策略迭代、滚动和牛顿法 3.5 在线对弈对于离线训练过程有多敏感? 3.6 何不直接训练策略网络并在使用时摒弃在线对弈呢? 3.7 多智能体问题和多智能体滚动 3.8 在线简化策略迭代 3.9 例外情形 3.10 注释与参考文献 第4章 线性二次型情形——例证 4.1 最优解 4.2 稳定线性策略的费用函数 4.3 值迭代 4.4 单步和多步前瞻——牛顿步的解释 4.5 灵敏度问题 4.6 滚动和策略迭代 4.7 截断滚动——前瞻长度问题 4.8 线性二次型问题中的例外行为 4.9 注释与参考文献 第5章 自适应和模型预测控制 5.1 具有未知参数的系统——鲁棒和PID控制 5.2 值空间近似、滚动和自适应控制 5.3 值空间近似、滚动和模型预测控制 5.4 末端费用近似——稳定性问题 5.5 注释与参考文献 第6章 有限时段确定性问题——离散优化 6.1 确定性离散空间有限时段问题 6.2 一般离散优化问题 6.3 值空间近似 6.4 离散优化的滚动算法 6.5 采用多步前瞻的滚动——截断滚动 6.6 约束形式的滚动算法 6.7 使用部分可观马尔可夫决策问题模型滚动的自适应控制 6.8 极小化极大控制的滚动 6.9 小阶段费用与长时段——连续时间滚动 6.10 结语 附录A 不动点问题的牛顿法 A.1 可微不动点问题的牛顿法 A.2 无须贝尔曼算子可微性的牛顿法 参考文献

蜀ICP备2024047804号

Copyright 版权所有 © jvwen.com 聚文网