
目錄1. 強化學習基本概念1.1 Agent1.2 Environment1.3 State1.4 Action1.5 Reward2. 強化學習的隨機性來源2.1 Policy2.2 State transition3. 回報與價值函數3.1 Returnaka cumulative future reward)3.1.1 Return未來累計獎勵3.1.2 Discounted Return折扣回報3.2 Action-value function3.3 State-value function4. 強化學習目標4.1 policy-based learning4.2 value-based learning1. 強化學習基本概念1.1 Agent執行動作、和環境交互的主體。1.2 EnvironmentAgent外部世界接收動作返回新狀態與獎勵。1.3 State環境當前觀測到的信息。1.4 ActionAgent在狀態下做出的動作。1.5 Reward環境給予的反饋。2. 強化學習的隨機性來源2.1 Policy策略函數給定狀態計算動作的概率根據概率隨機抽樣使Agent做動作。具體來說就是根據觀測到的狀態做出決策來控制Agent運動。2.2 State transition環境用狀態轉移函數算出概率根據概率隨機抽樣得到下一個狀態。3. 回報與價值函數3.1 Returnaka cumulative future reward)3.1.1 Return未來累計獎勵t 時刻的回報從 t 時刻的獎勵開始一直加到結束。t 時刻我們更關注的是此刻的獎勵因此 t 時刻以后的獎勵的權重應降低由此引出Discounted Return。3.1.2 Discounted Return折扣回報t 時刻的折扣回報折扣率超參數人工手動調若未來的獎勵和此刻的獎勵同樣重要則若未來的獎勵不重要則可以小些。3.2 Action-value function是隨機變量依賴于未來的所有動作以及未來的所有狀態只與當前的狀態和動作以及policy函數有關。具體來說已知policy函數給當前狀態下所有的動作打分從而得知動作的好壞3.3 State-value function對關于動作求期望把消掉得到的只與和狀態有關。4. 強化學習目標強化學習的目標就是學習到policy函數或最優動作價值函數去控制Agent讓Agent基于當前的狀態來做出相應的動作爭取在未來得到盡量多的獎勵。4.1 policy-based learning策略學習利用policy函數根據狀態計算動作的概率根據概率隨機抽樣使Agent做動作。觀測到一個狀態把作為policy函數的輸入,函數輸出每一個動作的概率根據概率隨機抽樣得到動作Agent執行動作。4.2 value-based learning價值學習利用最優動作價值函數函數根據狀態計算根據使Agent做動作。觀測到一個狀態把作為的輸入,函數每一個動作做評價得到每一個動作的值選擇讓最大化的動作作為下一個動作Agent執行動作。