题名:
Joy RL   / 江季, 王琦, 杨毅远著 ,
ISBN:
978-7-115-63154-1 价格: CNY79.80
语种:
chi
载体形态:
160页 彩图 23cm
出版发行:
出版地: 北京 出版社: 人民邮电出版社 出版日期: 2025
内容提要:
本书深入浅出地介绍马尔可夫决策过程、蒙特卡罗方法、时序差分方法、Sarsa、Q-learning等传统强化学习算法以及策略梯度、近端策略优化、深度Q网络、深度确定性策略梯度等常见深度强化学习算法的基本概念和方法,并以大量生动有趣的例子帮助读者理解强化学习问题的建模过程以及核心算法的细节。 
主题词:
机器学习  
中图分类法:
TP181 版次: 5
其它题名:
强化学习实践教程
主要责任者:
江季 著
主要责任者:
王琦 著
主要责任者:
杨毅远 著
附注:
异步图书 
责任者附注:
江季,网易高级算法工程师,硕士毕业于北京大学。Datawhale成员,《Easy RL:强化学习教程》《深度学习详解》作者。主要研究方向为强化学习、深度学习、大模型、机器人等。 
责任者附注:
王琦,上海交通大学人工智能教育部重点实验室博士研究生,硕士毕业于中国科学院大学。Datawhale成员,《Easy RL:强化学习教程》《深度学习详解》作者,AI TIME 成员,HuggingFace社区志愿者。 
责任者附注:
杨毅远,牛津大学计算机系博士研究生,硕士毕业于清华大学。Datawhale成员,《Easy RL:强化学习教程》《深度学习详解》作者。主要研究方向为时间序列、数据挖掘、智能传感系统、深度学习。