您的位置：首页 > 其它

强化学习基础四--Policy Gradient 理论推导

2017-11-23 13:28 621 查看

本文原文见我的知乎主页：https://www.zhihu.com/people/ikerpeng/

参考：

David Silver，Tutorial: Deep Reinforcement Learning，2016.

Pieter Abbeel，Policy Optimization，2017.

Hodo van Hasselt，Deep reinforcement Learning，2017.

R. Sutton， RL：An introduction 2nd，2017

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签： 机器学习强化学习

相关文章推荐

计算学习理论、统计学习基础理论
>学习笔记一,基础理论
AJAX 基础理论学习笔记
Gan（Generative Adversarial Net）学习笔记（1）--- Gan的基础理论
视频编解码学习之一：理论基础
Java基础学习总结（53）——HTTPS 理论详解与实践
视频编解码学习之一：理论基础
视频编解码学习之一：理论基础
计算学习理论基础
视频编解码学习之一：理论基础
【svm学习笔记】svm_理论基础3
JS学习笔记-基础理论+数组
ICE中间件学习笔记基础理论篇
深度学习笔记——理论与推导之概念，成本函数与梯度下降算法初识（一）
自定义View学习笔记01—基础理论
Java基础学习总结（53）——HTTPS 理论详解与实践
模型汇总19 强化学习（Reinforcement Learning）算法基础及分类
python学习1-理论基础
复习：支持向量机的理论基础—学习算法的实现方法
强化学习的基础知识

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航