• <track id="oztn4"></track>
    <sup id="oztn4"><form id="oztn4"></form></sup>
    
    
    <mark id="oztn4"></mark>
  • <dfn id="oztn4"><samp id="oztn4"></samp></dfn>
      《地爆天星小姐》电影 ,麦子交换2免费观看2023年上映时间表 ,莫妮卡《爱我几何》,大牛影库战狼6欧式少女全部视频,三年大片国语版在线看,日本空姐电视剧,电影魔镜号中文字幕,和部长一起去出差旅是第几集
      全球「AI學術頂會」精華匯聚地
      您正在使用IE低版瀏覽器,為了您的雷峰網賬號安全和更好的產品體驗,強烈建議使用更快更安全的瀏覽器
      此為臨時鏈接,僅用于文章預覽,將在時失效
      人工智能 正文
      發私信給奕欣
      發送

      0

      南京大學俞揚博士:強化學習前沿(下)

      本文作者: 奕欣 2017-05-15 09:36
      導語:本文根據俞揚博士在中國人工智能學會AIDL第二期人工智能前沿講習班"機器學習前沿"所作報告《強化學習前沿》編輯整理而來,雷鋒網在未改變原意的基礎上略作了刪減。

      雷鋒網[AI科技評論]按:本文根據俞揚博士在中國人工智能學會AIDL第二期人工智能前沿講習班"機器學習前沿"所作報告《強化學習前沿》編輯整理而來,雷鋒網在未改變原意的基礎上略作了刪減,并經俞揚博士指正確認,特此感謝。全文分為上下兩篇,本文為下篇。

      上篇傳送門:《南京大學俞揚博士:強化學習前沿(上)》

      南京大學俞揚博士:強化學習前沿(下)

      俞揚博士、副教授,主要研究領域為人工智能、機器學習、演化計算。分別于2004年和2011年獲得南京大學計算機科學與技術系學士學位和博士學位。

      2011年8月加入南京大學計算機科學與技術系、機器學習與數據挖掘研究所(LAMDA)從事教學與科研工作。曾獲2013年全國優秀博士學位論文獎、2011年中國計算機學會優秀博士學位論文獎。發表論文40余篇,包括多篇Artificial Intelligence、IJCAI、AAAI、NIPS、KDD等國際一流期刊和會議上,研究成果獲得IDEAL'16、GECCO'11、PAKDD'08最佳論文獎,以及PAKDD’06數據挖掘競賽冠軍等。

      任《Frontiers of Computer Science》青年副編輯,任人工智能領域國際頂級會議IJCAI’15/17高級程序委員、IJCAI'16/17 Publicity Chair、ICDM'16 Publicity Chair、ACML'16 Workshop Chair。指導的學生獲天貓“雙十一”推薦大賽百萬大獎、Google獎學金等。

      在此列出俞揚老師講課目錄,以供讀者參考:

      • 一、介紹(Introduction)

      • 二、馬爾可夫決策過程(Markov Decision Process)

      • 三、從馬爾可夫決策過程到強化學習(from Markov Decision Process to Reinforce Learning)

      • 四、值函數估計(Value function approximation)

      • 五、策略搜索(Policy Search)

      • 六、游戲中的強化學習(Reinforcement Learning in Games)

      • 七、強化學習總結

      • 八、強化學習資源推薦

      上篇介紹了前兩個小節的內容,以下為下篇內容:

      三、從馬爾可夫決策過程到強化學習

      在強化學習任務中,獎賞和轉移都是未知的,需要通過學習得出。具體解決辦法有兩個:

      一種是還原出獎賞函數和轉移函數。首先把MDP還原出來,然后再在MDP上解這個策略,這類方法稱為有模型(Model-Based)方法,這里的模型指的是MDP。

      南京大學俞揚博士:強化學習前沿(下)

      還有一類和它相對應的方法,免模型(Model-Free)法,即不還原獎賞和轉移。

      基于模型的方法

      在這類方法中,智能體會維護Model(即MDP),然后從Model中求解策略。

      從隨機策略開始,把策略放到環境中運行,從運行的序列數據中把MDP恢復出來。因為序列數據可以提供環境轉移和獎賞的監督信息,簡單的做一個回歸,就能知道一個狀態做了一個動作下面會轉移到哪兒,以及能得到的獎賞是多少。

      這里有一個非常簡單的環境探索方法——RMax,它用了計數這個非常簡單的回歸模型。

      南京大學俞揚博士:強化學習前沿(下)

      雖然看起來很簡單,但是還原MDP的樣本復雜度是狀態數的平方,遠高于前面說到的求解策略的復雜度。從這里可以看出學習MDP的復雜度極高,所以大量的研究工作都集中在免模型學習上。

      免模型學習

      免模型學習簡單介紹兩種方法。一種叫做蒙特卡羅采樣方法(Monte-Carlo method),一種是時序差分法(Temporal difference method)

      • 蒙特卡羅采樣方法介紹(Monte-Carlo method)

      免模型學習和之前講到的策略迭代的思路很像,首先,評估當前策略怎么樣;第二,提高當前策略。

      第一步 評估策略

      在MDP里評估策略的時候,由于獎賞和轉移都是知道的,所以可以直接用這兩個函數算評估值?,F在這兩個函數都不知道,那怎么辦呢?

      這個Q值函數實際上是個期望,所以直接用采樣來替代期望就可以了。換句話說,就是拿該策略在環境里面去跑,看跑出來什么結果。

      南京大學俞揚博士:強化學習前沿(下)

      比如跑了之后我得到一條軌跡:先是出太陽,接著是多云,最后是出太陽;再跑第二次得到一條軌跡,再跑第三次又得到一個軌跡。最后得到很多軌跡。我知道每條軌跡的獎賞是多少,然后把這些軌跡的獎賞平均起來,作為這個策略的值函數的估計,用頻率來逼近期望。

      第二步 更新/提高策略

      如此一來,我們就可以去評價一個策略的好壞。評價完一個策略以后,就可以和剛才一樣,取Q值函數指示最好的動作作為新的策略,更新過程是一樣的。

      南京大學俞揚博士:強化學習前沿(下)

      整個算法寫出來比較簡單。我們要做m次采樣,每一次都把當前的策略拿到環境里面運行,然后會得到一個序列,根據序列讓獎賞求和,然后更新Q值,這個Q值就是歷史上采樣的均值,c是計數。

      在一條軌跡下來以后,更新Q值后,做第二條軌跡,這樣就做到了不依賴MDP模型的強化學習方法。

      然而該方法缺乏環境探索,難以更新策略

      但是,這個有一個問題——如果得到了確定性策略,那么有可能采100個樣本出來的軌跡都是一樣的,導致無法評估策略在所有狀態上的表現,所以無法提高策略。這里的關鍵在于它缺乏對環境的探索。

      如何探索環境,以獲得最大回報?

      怎么探索?我們可以考慮一個最簡單的強化學習問題:一個狀態,兩個動作,一個動作的回報高一點,一個動作回報低一點,但是這兩個回報來自于兩個分布。這個時候你選哪個動作,或者你怎么做能收到最大的回報?這其實就是bandit模型。

      • 一個極端是,嘗試100次,每個動作做50次,這個時候我可能知道哪個動作比較好,但是拿到的回報可能不是最高的,因為可能做10次以后,就已經知道第一個動作的回報要高一點了,如果剩下的投資還是均勻分布的話,就得不到最大回報。

      • 另一個極端是,兩個動作各試一次,看哪個回報高,剩下的98次全部投到最高的回報去。這個方法也不好,因為只試了1次,估計的回報很不穩定。

      第一種情況是要有足夠多的探索(即exploration),第二種情況是不需要過多的探索而有更好的投資(即exploitation),我們要在這兩點之間找到平衡。

      解決這個問題有多種方法。第簡單的方法是,以1-ε的概率,現在看好哪個,就去投資它,剩下的ε概率就完全隨機,每個動作都去嘗試。這個方法稱為ε-greedy。

      該方法可以保證所有狀態都有一定的概率,哪怕是很小的概率,被訪問到。所以當運行一段時間以后,它能夠找到最優的策略。

      但這個方法也有缺點,就是必須要指定一個ε值。通常這個值應當不斷衰減,直到收斂到一個比較好的結果。還有一個效率問題,比如A動作嘗試了10次以后,平均回報是1萬,B動作嘗試了10次以后是0.1,這個時候就已經沒有必要嘗試下去了,因為距離非常遠。但是ε-greedy的探索不會停下來,所以有了其他的方法,比如softmax——它會考慮到Q值本身,如果兩個動作的值差別很大,探索的概率就很小。另一個在理論上比較漂亮的方法是UCB(Upper Confidence Bound):

      • 第一,考慮了Q值。如果Q值本身差距比較大,探索的可能性就很?。?/p>

      • 第二,考慮了探索次數。如果探索次數很少,可能它的置信度就比較低,如果探索的次數較多,置信度就會比較高。

      南京大學俞揚博士:強化學習前沿(下)

      所以,按照Q值加上置信度的上界來選擇動作,它就會自動平衡。

      不過,最常用的還是第一種ε-greedy方法。給出一個策略π以后,把它變成探索的策略,即隨機挑選一個動作,把這個帶探索的策略放到蒙特卡羅的算法里面。并且,這個軌跡并不是從π中產生的,而是從帶探索的πε中產生的,這就能保證策略可以不斷更新了。

      南京大學俞揚博士:強化學習前沿(下)

      下面介紹On/Off Policy:學習帶探索/不帶探索的策略。

      大家可能常聽On/Off Policy策略這個詞。

      南京大學俞揚博士:強化學習前沿(下)

      在蒙特卡洛采樣中使用了πε策略來采樣,學的并不是π,是帶探索的πε。因為用來評估的數據,是從帶探索的策略產出來的,而不是從我們想要學的策略上產生出來的。這個區別會導致把探索也作為策略的一部。這種采樣與更新的策略是一樣的算法叫做On Policy。

      但很多時候,我們想學的實際是不帶探索的策略,也就是說要從帶探索的策略中采樣,但更新的只是策略本身,即Off Policy。這里面臨一個問題就是,采樣并不來自于當前的策略,常用的重要性采樣(Importance Sampling)技術通過修改采樣的分布,改成想要的樣子??梢酝ㄟ^加權重這個簡單的方法,修改策略的分布,然把這個分布加到具體算法里面去。也就是把獎賞加了一個權重,這樣的算法就變成一個Off Policy的算法,這樣它學習的就是π自己了。

      南京大學俞揚博士:強化學習前沿(下)

      蒙特卡洛算法總結

      總體來說,蒙特卡洛的算法不是一個效率很高的算法,但是能夠展現免模型類算法的特性。

      我們要做這個策略的評估,然后做完評估以后找到一個改進的方向,就可以改進這個算法了;這里,為了使策略能夠有效更新,需要引入對環境的探索;而對環境的探索里面,要注意On/Off Policy這么兩個概念。

      另外,蒙特卡洛的算法有一個很顯然的缺陷:一定要拿到整個軌跡以后,才能更新模型。

      • 時序差分(Temporal difference method)

      那能不能每走一步都更新模型呢?蒙特卡洛算法里面有一個性質——即更新Q值的時候,實際上是在更新均值。

      更新均值還可以寫成:μt = μt-1 + α(xt _ μt-1),意思是剛才我們更新的是Q值(算式如下圖顯示),其中R ? Q(st, at)叫做蒙特卡羅誤差。我們知道,Q是對獎賞的一個估計,R是是采完這個軌跡以后得到的真實的獎賞。換句話說,Q值d餓更新就是加上就是真實值和估計值的差別,即蒙特卡羅誤差。

      南京大學俞揚博士:強化學習前沿(下)

      在TD算法里,我們走了一步得到了一步真實的獎賞,再往后走還沒走,所以不知道后面真實的獎賞是多少,但可以通過之前的Q值來估計之后的獎賞,這兩個加起來就是當前知道的信息,用它來替代這個R,來減去老的預估值,我們稱這個過程為時序差分。

      如果用蒙特卡羅的話,需要先走到底,知道總體的結果之后,每一步的差別就能算出來;而對于TDL來說,只需要記錄一步的信息,所以可以在線更新自己。

      南京大學俞揚博士:強化學習前沿(下)

      • SARSA

      動態規劃記錄的是所有狀態上面的信息。而把剛才的蒙特卡羅的error換成了TD errpr,就可以得到新的TD方法的強化學習方法。這個方法就不是采集整個軌跡了,而是根據探索的策略,用TDL來更新Q值,每走一步就更新一下對當前策略的評判,然后再更新策略。這個算法叫做SARSA,屬于On Policy,而變成Off Policy的策略,只修改一處,用非探索策略來計算TD error,就得到Q-Learning算法。

      • SARSA v.s. Q-learning

      這是一個爬格子的問題,是典型的經典強化學習問題。

      南京大學俞揚博士:強化學習前沿(下)

      動作是上下左右的走,每走一步就會有一個-1的獎賞。從初始狀態走到最終的狀態,要走最短的路才能使獎賞最大。圖中有一個懸崖,一旦走到懸崖獎賞會極小,而且還要再退回這個初始狀態。

      在這里用On Policy SARSA會有一定的概率去探索,也就有可能會掉到這個懸崖下面去,所以獎賞就會比較小;而用Q Learning,因為最后的策略是不帶任何探索的,沒有任何的隨機性,所以路徑最短。

      這就是兩類強化學習算法的區別。你在學習過程中可以看到,Q Learning的值較低,這是因為學習的時候一定要帶探索的學習,所以你訓練的過程中一定是不斷的去訓練。

      另外,前面講的TD誤差更新是走一步后的更新,實際上還可以做兩步的更新、走N步的更新,都是可以的。所以有一種方法就是做很多步的,按照一個概率加權把它綜合起來,綜合起來以后到一個叫做λ—return,就是走一步、走兩步和走多步的TD。

       四、值函數估計(Value function approximation)

      剛才講的所有問題,前提是都能用表格表示。但是很多真實環境是無法用表格表示的。所以在強化學習發展的早期,一直沒辦法用在大規模的真實問題上去。后來大家就想,怎么把這個強化學習放在一個連續狀態空間去,甚至說放在動作也是連續的情景中,比如控制一架直升機的。

      大家可能覺得強化學習的學習過程和監督學習之間的差別比較大,算法、模型好像都完全不一樣。但進入連續狀態空間以后,兩者就會出現很多相似的地方。

      南京大學俞揚博士:強化學習前沿(下)

      離散狀態下可以用表格來表示值函數或策略;但進入連續狀態空間就要用一個函數的近似來表示,這個方法叫做值函數近似。

      比如,我們可以用一個線性函數來表示,V值是表示狀態s下面的一個值,狀態s先有一個特征的向量φ(s),這個V值表達出來就是一個線性的參數乘以特征的內積。Q值里面有一個動作,假設這個動作是離散的,一種方式是把這個動作和狀態放在一起變成一個特征,另一種方法是給每一個動作單獨做一個模型。

      當遇到連續空間的問題時,用近似來表示值函數V和Q,這個做法看起來很自然,但是近似以后會發現,以往很多的理論結果就不成立了。

      但我們現在先不管那些問題,先看做了近似以后怎么來學?我們想知道的是,這里的Q值,是希望Q值近似以后,夠盡量逼近真實的Q值。如果已經知道真實的Q值,怎么逼近呢?最簡單的方法就是做一個最小二乘回歸。其中一種解法是求導。求導以后,導數表示為,真實的Q和估計的Q的差值,然后再乘對Q值模型的導??梢钥吹?,導數表達的含義與之前的模特卡羅誤差、TD誤差是一致的,只不過更新的是參數w。把這種更新方式套進Q learning里,其他地方都沒有變,只得到了用值函數逼近的Q-Learning方法。

      南京大學俞揚博士:強化學習前沿(下)

      這個模型用什么函數呢?最簡單就是用線性函數。但是線性函數有很多局限的,需要在特征的設計上下功夫,這需要很好的人工設計。

      把它變成非線性函數,一個常用方法是用神經網絡,直接用神經網絡表示Q值。在更新的時候也很簡單,只需要把梯度傳到神經網絡中去就可以了,因為神經網絡的BP算法本身也是求梯度。

      用批量學習改進

      還有一些改進的方式。比如說我們在訓練近似模型的時候,在一個樣本上訓練可能會不穩定,所以可以用Batch Models的方式,積累一批數據來訓練這個模型。

      南京大學俞揚博士:強化學習前沿(下)

      剛才講的所有訓練方法,都是先把V值或者Q值估計出來,然后再從中把這個策略導出來。我們稱這種方法為基于值函數的強化學習方法。

      五、策略搜索(Policy Search)

      南京大學俞揚博士:強化學習前沿(下)

      值函數估計法存在的問題:策略退化

      但是用值函數估計會有一個問題——這種方法可以收斂到最優策略,但前提必須是用表格的表達方式;如果用的是函數近似,則會出現策略退化,即對Q值估計越大,策略越差。

      舉一個簡單的例子,現在有兩個狀態,一個是狀態1,一個是狀態2,狀態1的特征為2,狀態2的特征為1。我們設定獎賞,使得狀態2的最優V值比狀態1的要大。這時如果用一個線性函數來表示這個V,也就是用W乘以特征,這個特征只有一維,最優的這個V值2是比1大的,1的特征值要高一點,2的特征值要小一點,所以最優的W就應該是個負數,這樣會使得V(2)比V(1)大,因而能導出最優策略。

      但是基于值函數的做法是要使得V值盡量靠近最優的V值,最優的V值又是正值,這樣會導致這個W一定是正的,無法得到最優的策略。這樣值函數估計得越準,策略越差的現象被稱為策略退化。

      用策略搜索解決策略退化問題

      為了避免策略退化,我們的方法是直接去找策略,這就是策略搜索。

      先把策略參數化,對于離散動作來說,參數可以做成像Gibbs Policy一樣,即每個動作有一個參數,然后把它歸一,變成每一個動作有一個概率。如果是一個連續動作的話,可以用高斯分布來描述。里面這個參數,我在這里寫的是一個線性的過程,但也可以用神經網絡來替代。

      直接優化策略的參數,使得收到的總回報達到最大的方法,就是策略搜索(Policy Search)。

      策略搜索的優勢

      策略搜索和基于值函數的方法相比,優缺點各是什么?

      • 第一,能處理連續狀態和動作;

      • 第二,對于高維的數據總的表現比較好。

      • 第三,可以直接學出隨機性策略

      • 第四,Policy Search和監督學習的兼容性比較好。

      第三點用處很大,比如說玩“剪刀石頭布”,如果選擇確定性策略,那一定會輸;一定要做一個帶概率的輸出才會贏。     

      還有另外一個例子,跟大家講解一下為什么需要隨機性策略。

      南京大學俞揚博士:強化學習前沿(下)

      骷髏代表走到這就死掉了;最優策略肯定是往中間走,但是這里有兩個灰色格子,它們代表的是不完全觀測的狀態,即走到灰格子之后不知道該往左邊還是右邊;

      • 如果這時又用了確定性策略,那就只能向左或向右走,只能是確定的,則有可能會遇到走不通的路徑。

      • 如果用隨機性策略,向左和向右的概率都為50%,因此不管往哪邊走總能到達目標。

      這也體現了策略搜索的優勢。

      第四,策略搜索和監督學習的兼容性比較好。

      這個策略是用參數表達的,它的目標是最大化的獎賞。最大化獎賞的意思就是說,把空間里所有的軌跡枚舉出來。因為策略產生這些軌跡是有一定概率的,在某個狀態上,策略做出相應動作的概率是由策略決定的,把所有一條軌跡上所有動作的概率相乘,就得出產生這條軌跡的概率。所以它總體的期望回報,就是所有軌跡的期望,也就是每條軌跡的概率乘以每條概率能獲得的獎賞,這也是總回報的另外一種寫法。這種寫法有的好處就在于,它和策略參數目標有關,所以我可以對獎賞直接求導,來求解策略。另外一種寫法用的是穩態分布(Stationary Distribution),用和上面寫法完全等價,意思是完全一樣的,在這里就跳過不講了。

      策略搜索也有一個缺點,其中一個缺點就是有很多局部最優解,失去了全局最優的收斂性保障,其次是訓練過程方差非常高。

      • 早期策略求導的方法:Finite Difference

      相信大家都會求導,不過有一種方式大家可能沒有見過——有限差分(Finite Difference),這是早期用來做策略求導的方法。

      那什么時候會用到有限差分呢?可能是這個系統可能太復雜了,不容易求導,那就可以用一個簡單的方式來逼近這個導數。拿到一個參數θ,θ的導數就是看一下周圍哪個方向走的比較快,這樣給θ加一個很小的擾動的值,對θ周圍的局部進行采樣,對那個采樣增長得最快,這個方向就當成是一個導數方向。這是最簡單的方法,當然這個方法有很多缺陷,特別是在高維度的情況下,會需要很多采樣,所以更直接的方法還是直接求導。

      最后得到的一個導數,導數形式如下所示:

      南京大學俞揚博士:強化學習前沿(下)                                    

      E是期望,1到T代表考慮的是T步的軌跡,每一步軌跡對策略輸出值的對數取導數,然后乘以真實的獎賞(獎賞不取對數)。獎賞是個常數,即軌跡得到的獎賞值。

      可以通過采樣可以來逼近期望,對一個策略以后,去跑一些軌跡,然后計算平均梯度,作為梯度期望的逼近。

      我們剛剛說到,這種方式有一個很大的缺陷,就是它的方差很大,直接用計算的梯度來更新策略(vallina policy gradient),基本上得不到好的策略,因為它的方差太大,不穩定。

      控制方差的方法 1、Actor-Critic

      控制方差有多種方式,其中一種叫做Actor-Critic。用比如直接求導的方式把策略求出來,叫做Actor;對值函數進行估計,并用于評估策略,是Critic,意為它是一個評價者。

      我們要維護一個值函數Q的模型。另外,用導數的方法來求策略的梯度的時候,不做直接使用獎賞,而是使用Criitic提供的Q值。所以Actor-Critic會維護兩個模型,第一個是策略的模型,第二個是Q函數的模型。

      南京大學俞揚博士:強化學習前沿(下)

      對Q函數求近似的時候,式子和上面的那個導數形式一樣,里面的經驗獎賞換成了Q值。在求策略梯度時,Q值是一個常數,是不更新的,它有自己的更新方式,且通常是真實的Q值。

      控制方差的方法2、引入偏差項(bias term)

      另一種控制方差的形式,是引入偏差項,只要這個函數是一個只跟狀態有關、跟動作無關的函數,它的積分就是0,不影響梯度方向,而會影響梯度的方差。

      對于簡單的形式,我們可以直接求出來最優的偏差是什么。更一般的形式,我們可以用V值來替代bias。因為V值就是關于狀態的估計值,和動作沒有關系,所以它帶到積分里面去的時候會是0。

      把V值帶進去,后面的Q就變成了Q-V,叫做Advantage Function,意思指:在這個狀態上,V值相當于是一個平均值,Q值指某個動作比平均值高出來多少。用Advantage Function會使得做策略梯度以后,方差控制得比較好,只有當方差控制好了,這類算法才能真正起作用。

      南京大學俞揚博士:強化學習前沿(下)

      其他改進方法

      梯度的改進方法還有Nature Policy Gradient。在監督學習里面,隨機梯度是很容易并行的。最近有一些理論的工作,也探討了它的并行不會影響到它的理論性質。在策略梯度里面,我們同樣可以把這個梯度并行來做,這樣可以使得它的速度下的很快。

      還有對策略直接求導的方法,比如無梯度的優化(Derivative-Free Optimization)。這類方法不管強化學習是在做什么,而是直接優化策略里面的參數。優化完參數以后,試一下策略,得出這個值具體是多少。

      這樣,優化過的算法可以通過總體獎賞值來調整模型里面的參數。通常來說它比用Gradient Policy效率差,由于中間過程是忽略不計的,所以它對特別復雜的問題,反而有比較好的效果,比如俄羅斯方塊游戲。

      六、游戲中的強化學習(Reinforcement Learning in Games)

      最后一部分,講一下強化學習和游戲。

      為什么講游戲?一方面,是因為在游戲里面需要克服的一些問題,在真實應用中也常遇到;另外一方面,用游戲來做強化學習任務的成本比較低。

      • 游戲推動深度強化學習(Deep Reinforcement Learning)的發展

      2015年,DeepMind在Atari游戲上使用深度網絡直接從屏幕圖像訓練強化學習,直接推動了“深度強化學習”的發展。

      用深度神經網絡,放在Policy Gradient里面,作為一個策略的模型;或者放在基于值函數的方法里面,作為值函數Q值的一個估計。這樣的方法就稱為深度強化學習。

      深度強化學習

      其實,深度強化學習里很多工作是在研究怎么讓網絡更穩定。特別是當輸入數據比較少的時候,網絡方差的浮動會比較大。這就可以用“延后更新”來解決——如果用深度神經網絡,那么每走一步都更新模型會導致模型抖動非常大。而用“延后更新”,例如可以在100步里不更新策略,只是把神經網絡更新一下,這個神經網絡沒有放到新的策略里面來,等神經網絡有一個比較穩定的上升以后,再更新策略。還有,積累的數據不要丟掉,也拿出來,讓這個神經網絡更穩定一點。這兩個技巧合起來放在Q-Learning里面,就是DQN。

      • Deep Q-Network(DQN)

      DQN可以說是第一個聲稱深度強化學習算法,可能也是最廣為人知的一個?;旧?,它的整體結構就是一個函數近似的Q Learning,只不過用CNN做了近似函數。

      南京大學俞揚博士:強化學習前沿(下)

      在玩這個游戲的時候,它已經有了100萬個記錄歷史。每次訓練神經網絡的時候,要抓32個出來訓練一次,并且訓練完以后不去更新策略,而是在走一定的步數以后,再更新這個策略。除此之外,并不是直接從屏幕上把一幀圖像拿進來,而是把歷史上好幾幀的屏幕拼起來,得到一個當前幀和前面好幾幀合起來的一個總體的圖作為CNN的輸入。不過在最新的一些工作中,這個過程已經被被遞歸神經網絡替代了,不再是把好幾層拼起來,而是讓好幾幀分別輸入例如LSTM的網絡。

      很多運用強化學習尋找策略的游戲已經比人玩得都好了,它玩的好的優勢主要體現在反應速度上。但是在需要深入思考邏輯關系的游戲中,強化學習沒有人做得好。

      我們來看看它的游戲報告結果。

      南京大學俞揚博士:強化學習前沿(下)

      這里面,“with replay”和“without replay”的意思是有沒有用到歷史數據,“with target Q”和“without target Q”就用了CNN還是線性網絡。我們可以看到,神經網絡在這里貢獻并不是最大的。如果我們只用神經網絡而不用replay的話,效果還不如用了replay,但只用線性模型而不用CNN。當然,同時使用深度模型和強化學習是最好的,這可以完成一些過去完成不了的事情。

      在AlphaGo中的應用

      AlphaGo系統的基礎框架是蒙特卡洛樹搜索,這是經典的樹搜索的方法。但是單憑蒙特卡洛樹搜索本身并不能取得很好的效果,只用樹搜索大概只能達到業余的五六段。AlphaGo里面的一個創新的點就是引入強化學習來改進搜索樹的深度和寬度。

      南京大學俞揚博士:強化學習前沿(下)

      這里面用了三個神經網絡。

      • 第一個policy network,在展開蒙特卡羅樹搜索節點的時候起作用。這個網絡是用策略梯度方法訓練出來的。

      • 第二個是一個很小的神經網絡,蒙特卡羅樹搜索里再往下做很深的搜索時會用到,這樣它可以算得很快。這個小的網絡是通過監督學習學出來的。

      • 第三個網絡是用來修正值的。它是通過強化學習中間產生的數據來學習。

      由于大家對DQN比較熟悉,所以在嘗試深度學習的時候,首先想到的算法大多是DQN。但因為它是一個基于值函數估計的強化學習方法,所以這種方法在稍微復雜一點的應用環境中可能運行不了,大家會感覺用DQN做強化學習效果沒那么好。但同樣是DeepMin做的圍棋游戲,它的強化學習方法已經改成了Policy Gradient,而且以后的很多算法也都是以Policy Gradient為主的,用這種方法處理復雜問題效果更好。

      在其他游戲上的應用

      正是由于在計算機中模擬游戲的代價很低,所以不斷有研究者借助游戲來發展強化學習。比如,有用在3D第一人稱射擊游戲中,可以在這個世界里面行走,并且尋找東西。去年有一個“DOOM”游戲比賽,參賽者要用計算機控制游戲角色,以第一視角進行3D射擊。有了強化學習,參賽者就能控制游戲角色,讓它做一些動作。由于這個游戲額環境比較復雜,所以在玩游戲的過程中,也發展出了一些創新方法。

      例如,在游戲里面,如果讓一個強化學習直接到游戲環境里面學習,那它又要撿醫療箱,又要去撿武器等等,太復雜了。而其中一個團隊,就采取了這樣的做法:他們讓強化學習從簡單到復雜,一步一步的去學習——首先學一個策略,比如撿起醫療箱,然后在這個策略的基礎上再來學怎么樣來開槍、怎么樣來射擊敵人等等。

      實際上游戲里面有很多很高難度的挑戰,其中一個非常復雜游戲叫做StarCraft。這個游戲已經有很多年的歷史了,現在有不少人,包括DeepMind,都希望在這么復雜的游戲上面能表現出一個比較好的性能,因為這個游戲的復雜度已經大到和很多真實應用的復雜度相當,即使人去學這個游戲,也要花很長時間才能學會。以前用強化學習,只是先取其中一個小問題來解決。比如說我和對方各派三個兵,想辦法看這六個兵怎么打。這是一個很局部的戰役,但能學到這樣的東西也已經比較不錯了。如果要學到整盤的打法,它里面涉及到很多問題,第一,它的規模遠大于圍棋的規模;第二,有很多對手的信息是觀測不到的,比如敵方的行動。雖然在今年年初,德州撲克游戲上機器已經打贏了人類玩家,但德州撲克其實是一類很簡單的牌類游戲,想讓強化學習在大規模游戲任務中,在無法觀測到對手信息的情況下,指揮200多個單位做連續的運動,還要持續半個多小時走幾十萬步,目前還做不好。

      七、強化學習總結

      之前介紹的只是強化學習的其中一小部分,強化學習還包括很多內容:

      比如在MDP中如果出現了不可觀測的情況,它就不屬于Markov了,有一個專門的方向如POMDP來解決這個問題。

      還有Learning from Demonstrations,意為人先做出示范,然后從示范數據中教智能體。例如AlphaGo,一開始訓練的時候并不是直接上強化學習,而是首先搜集了很多人類對打的數據。

      而怎么去設計獎賞函數也會有很多不同的方法。

      下面總結一下兩個大家比較關心的問題。

      • 第一個問題:強化學習是否已經發展成熟?如何選擇強化學習問題中的算法?

      如果碰到比較簡單的強化學習問題,可以用基于值函數的方法,比如DQN,更復雜的問題可以用Policy Gradient的方法做策略梯度。

      但是從目前的發展現狀兩看,強化學習的成熟度遠遠不夠,也就是說在強化學習領域,還有很大的提升的空間,有可能能做出一個性能更好的全新的算法。但大規模的問題現在還是很難解決。這個大規模指是它的狀態空間大,并且步數特別多。

      • 第二個問題:在實際領域應用強化學習,會遇到什么瓶頸?

      1、 強化學習需要探索,在很多場景帶來風險。

      以推薦股票為例。我本來已經有一個還可以的推薦策略,每天能給我帶來100萬的收入。但是現在為了訓練強化學習,要做探索,嘗試一些隨機的股票。假如告訴你這個探索會導致今天一下子要損失好幾百萬,而一個月以后可以賺回1個億,那你就要衡量一下這里看面的風險有多高,敢不敢用了。

      2、 為什么強化學習在很多游戲上面用的比較多?

      游戲在計算機中運行,速度高、代價低。如果放到現實世界中來運行,比如放在推薦系統線上運行,那它就必須和真實的環境打交道。它的學習過程需要不斷探索,而部署在真實環境里可能會遇到很多麻煩,如果能有一個比較好的模擬器,就可以減少這些麻煩;另外,如果有比較好的監督學習數據的話,也可以做一個初始的策略,不過這個策略可能一開始起點要稍微高一點。做機器人一般也有一個機器人模擬器,所以一般先在模擬器里面做,做好策略再放到機器人身上來學。但是其他現實世界問題,在模擬器里可能就沒有那么好做了。

      八、強化學習資源推薦書籍

      強化學習的書不多,最經典的書是Richard S. Sutton的教科書;Masashi Sugiyama的書屬于專著;Reinforcement Learning: State-of-the-Art屬于文集,覆蓋面比較廣,但需要讀者有一定基礎;還有一些講述MDP的書;另外,在機器學習的書里面也會提到強化學習。

      南京大學俞揚博士:強化學習前沿(下)

      線上資源

      OpenAI Gym:一個基礎的強化學習平臺,里面很多環境,研究人員可以在上面做實驗,它對這個領域有很大的促進。還有AlphaGo技術負責人David Silver的線上教學視頻,講的非常好。

      南京大學俞揚博士:強化學習前沿(下)

      論文發表地

      強化學習論文主要發表在AI期刊和會議上,期刊有Artificial Intelligence, JAIR, JMLR, Machine Learning, JAAMAS等,會議有IJCAI, AAAI, NIPS, ICML, ICLR, AAMAS, IROS等等。

      以上就是俞揚博士的演講,更多內容請繼續關注雷鋒網。

      雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。

      南京大學俞揚博士:強化學習前沿(下)

      分享:
      相關文章
      當月熱門文章
      最新文章
      請填寫申請人資料
      姓名
      電話
      郵箱
      微信號
      作品鏈接
      個人簡介
      為了您的賬戶安全,請驗證郵箱
      您的郵箱還未驗證,完成可獲20積分喲!
      請驗證您的郵箱
      立即驗證
      完善賬號信息
      您的賬號已經綁定,現在您可以設置密碼以方便用郵箱登錄
      立即設置 以后再說
      主站蜘蛛池模板: 老舅1-27集免费看| 搜索02kkk| 奔跑吧兄弟| 第六感之吻电视剧在线观看| 站着再来一次26集全在线观看 | 在线播放国风按摩院 春宵一克值千金 第1集 - 高清资源 - 大鸟视频 | 金金丁字广场舞私人订制 | 我爱男保姆全集下载| 《特殊的治疗》中字| 善良的医生在线观看| 绝世双骄主题曲| 新金银悔1-5普通话一| 美国共和党领袖:已经炒了佩洛西| 电锯人樱花动漫| 坂本真绫 铃村健一| 幸福的黄手绢| 为您服务| 美丽妻子替弟还债主演佚名| 善良的小嫂子| X L司令| 你好李焕英免费版在线播放| 妈妈的职业免费观点看| 乡村爱情第三部优酷| 好兆头高清在线观看| 法国农场全新正版| E版人猿泰山1995故事简介| VHOTEL第一季在线| 巴掌 红肿WRITE AS| 韩剧亲爱的X| 牙克石市| 唐朝浪漫英雄下载| 电影女老师的诱惑在线观看| 离人心上电视剧| 弹珠警察全集| 等到满山红叶时| 纵有疾风起电视剧免费观看全集| 安拉拉斋电影在免费播 | 卖百科全书的人完整版| 亡羊补牢免费| 爱唯侦查dvd| 我是会长| 解放电影| 替夫还债完整版电影| 黄金小子| 正在播放:【传媒】MDSR0006-2 《小凤新婚》下集-高冷新妻性奴 | 《课外辅导女教师》电视剧 | 暮光之城2:新月| 激情从来| 转世传说| 女售楼小姐的秘密| 部长侵犯部下属人妻A片| 监禁时间电影| 斗破苍穹特别版| 天赋异禀美剧| 渔夫荒淫史电影| 东北风云| 麦乐迪马克思女超人在线观看完整免费高清原声满天星百 | 汉宫飞燕插曲| 浪漫刺客免费全集完整版| 3对1:初次性体检4| 超级老鼠| 法国女版《壮志凌云》演员表| 黑白潜行| 《屠宰森林》在线观看| 四对夫妇交换电影中文版| 漂亮的科室医生3| 满江红免费观看| 扫黑风暴在线观看免费版| 狙击手电影| 水润女人在线观看电视剧免费| 倾城时光50集免费高清| 刚铁侠2| 电影《夏威夷天体农场》| 坏家伙们电影| 人猿泰山1995版意大利经典电影| 飞刀问情电视剧免费观看| 囤货种田:空间农女短剧全集| 高压监狱2伦理HD| 小炸jackson| 法国版《女超人:麦乐迪》在线观看中文 | 初恋逆袭:竹马别来无恙短剧全集| 《外卖奇遇》完整版| 泰剧祁安《秘密爱》| 牙医姊妹在线免费观看| 《侏罗纪4:重生》免费播放| 色即是空2015字幕| 杀破狼3免费观看完整国语版| 夜班经理 第二季| 铠甲勇士全集播放| 青楼女人绝活免费观看电视剧| 《一对二》韩剧姜汉娜免费观看全集 | 在越南最后的日子| sp发刷 红肿 双丘旧巷笙歌| 一龙吊打空手道黑带| 生化危机2启示录电影| 黛博拉满天星三部曲| 成何体统动漫第二季| 瑜伽老师在线观看电视剧免费| 离婚前规则主题曲| 李延亮黄贯中| 天美乡村影院免费观看电视剧| 微笑的闪士| 水电工人的艳遇| 韩国伦理电影下载| 蝴蝶行动电视剧| 痞子英雄2电影| 美国电影免费看| 意大利《八尺夫人》电影全集免费观看| 点点星光免费观看完整版| 闪电五连鞭| 少女大人电视剧免费全集播放| 欧美黑白配在线观看| 镖行天下前传之库丁之谜| 八尺夫人意大利版原声满天星 | 青春在线观看| 战狼6欧式少女高清观看下载电影| 百花奖总导演致歉| 井向蓝| 高清《失窃的女孩》电视剧 | 自制ipad| 落魄琉璃川1-2集免费| 大神同学想被吃掉未增删有翻译 | 特警力量全集免费播放| 抖音奇妙派对| 恋爱先生电视剧全集免费版观看| 五十度灰在线播放标清| 美国式保罗1原版| 青海花儿胡汉三| 少妇按摩记轮理片| 巴啦啦小魔仙之彩虹心石11| 韩国 奇妙的发型屋| 春雨电视剧高清在线播放 | 缉毒警察绝不会输动漫免费观看| 招待外卖员电影| 《幸福一家人》电视剧| 新女员工部长的教育| 恋梦空间第二季| 三国演义全集| 永吉县| 优越的一天电视剧全集完整版| 老湿影院放映黒人男子,。大屌猛播美女髙清视频免费看 | 女佣变凤凰| 飞驰人生二| 《父债女偿还》完整版| 麦乐迪《家庭矛盾》4女超人| 一生一世白鹿在线观看免费完整版| 替夫还债2| 谢娜唱哭了| 男女愁电视剧高清在线观看| 电视剧驻站免费观看| 《金牌销售的秘密1》免费全集 | 魔术师1998| 小向美奈子 花与蛇| 克什克腾旗| 河北杂技频道直播| 小胰子5电影免费观看国语版| 牛魔王和铁扇公主| 被义子侵犯不敢出声| 果盘先生是什么意思| 梅川小帅上司伞电影讲什么| 飞屋环游记 高清| 修理人员的培训-正在播放-免费在线观看-窝窝影院 | 且试天下45集全集免费| 《特邀外卖员》完整版| 《心灵法医》电视剧| 饥饿游戏2:星火燎原| 不完美的受害者电视剧| 高清《风花雪月》香港在线观看| 卓仕琳七老板吞金| 棍勇的回复术士全集免费观看| 家教培训满天星电影在线观看满天星 | 性暴行y刂2| 故乡别来无恙电视剧免费观看| 法国版古墓丽影在线观看| 电视剧南来北往免费观看全集播放| 狙击枪怎么折| 《柔情挚我》| 善良的姨母| 女战狼6在线高清免费观看全集| 大神同学想被吃掉未增删有翻译| 99re在线观看视频| 黑道大佬第2季免费观看| 朴亚珍电影HD| 《熊出没之雪岭熊风》| 灵动 鬼影实录| 鼓手王澜| 电视剧大宅门全集| 美国超级星期二| 电影《女子护卫队》在线观看免费 | 布达佩斯之恋完整版| 自W到抖还要继续但没喷| 妻子的背叛1完整版视频| 鬼迷心窍 电影| 男女一起愁愁愁免费| 今天的她们在线电视剧免费播放| 《女超人满天星版》麦乐迪在线播放 | 365日:今时之欲在线| 魁拔3什么时候上映| 孔乙己教案| 《社长,不能说的秘密》电影免费观看 | 许磊苏雨若短剧免费观看| 状王宋世杰2粤语| 电影《美容院的特殊待遇》1中文在线 | 隔壁邻居很美味免费版| 年轻人到底有多爱辣条| 梅花红桃电视剧免费观看完整版| 灵媒在线观看| 全职高手第三季樱花动漫在线观看| shameless第十一季完整版| 短剧《明月曾照彩云归》落幕| 替夫还债的电影完整版| 你给我的喜欢电视剧免费观看全集| 香港小姑娘一级电影| 特朗普在炸鸡店为全场买单| 《壮志凌云》A片版| 你的欲梦裸身在线播放| 19岁大学生免费观看真人电视剧| 刘三姐电影原版完整免费观看| 新还珠格格燕儿翩翩飞| 天津市| 贵妇人街电影版免费观看中文| 甄嬛传72| 北原多香子无打码在线观看| 天美影院免费看高清电视剧 | 隔山之眼3免费完整版| 聊斋艳谭之艳魔大战| 娃娃脸4免费看| 我的父亲母亲高清| 电影美容院的特别待遇| 灵魂之音| 《法国空乘2| 黄家驹主演的电影| 一个好妈妈7中字头强华驿货拉拉价格| 一夜情约会| 《唐朝诡事录之西行》电视剧| 王贵与安娜剧情| 逆天狂妃:邪王靠边站全集免费 | 恐龙世界| 黑衣人3电影| 连丽如评书| 女杀油地狱在线观看| 时间都知道电视剧| 猎战狂徒电影| 锦月如歌电视剧免费观看全集完整版| 你的名字在线观看免费高清完整版| 梅州市| 《卿本佳人》李月仙| 电影《牙医姐妹》1986年在线| 斗罗大陆免费完整观看197| 法国护士长2006| 《快乐到死》电影| 俩个好儿媳慧珍宝拉| 羁绊5.3| 捆绑强奸小电影| 回复术士的重来人生 樱花动漫| 二十世纪性格与x爱情| 神勇武工队传奇2017任帅| 《极乐宝鉴》在线观看| 春雨电影大全免费动漫版| 女版战狼10高清免费播放| 夺命佳人在线完整版| 台湾版《棘手狂情》电影免费观看| 韩国电影空姐| 登陆之日电影| 单数绝配| 金甁梅电视剧高清版| 电视剧幸福的眼泪| 美姐妹牙医电影完整观看视频在线| 法国监狱2在线观看完整版| 恶魔幸存者第二季动漫| 《诱人的护士3》在线观看| 电影网站在线| 站着再来一次第26集| 捷克街头搭讪系列完整版免费观看 | 360大佬爱上我第三季在线观看| 韩剧学校2013| 凯登版《交易》啄木鸟英文| 年轻女教师HD中字| 007女版满天星在线观看| 365天:明日之欲| 《麦乐迪女超人》正在播放| 爱本无罪| 法国版古墓丽影在线观看| 裂心泰剧| 古惑仔5龙争虎斗| 沂蒙小调| 哇嘎电影高清免费播放日本| 动画片小美人鱼| 国产免费高清观看电视剧| 神机妙算刘伯温第四单元| 屠宰场呕吐娃娃电影在线观看免费| 能登的新娘| 法国满天星《女军医》| 成都免费高清在线观看| XL司令高清免费看| 国家地理频道| 战狼10国语版普通话迅雷下载 | 猎战狂徒电影| 世间道电视剧全集播放免费| 曹查理《浪蝶狂花》电影| 撞任长霞的肇事者| 第一滴血6全集免费完整| 斗罗大陆156集| 工腾拉拉| 爱情的牙齿在线观看| hhh555现在叫什么| 特区爱奴百度影音| 《二对一》| 《活着2:丧尸危机》免费播放| 在丈夫面前被别人欺负日语| 代号巴德| 名媛望族电视剧40集免费| 逃英乱港分子染上奥密克戎| 牝教师在线观看| 保你平安| 修师傅艳遇电影| 男生操男生动漫| 《塞伦三部曲》堕落男童| 小鲤鱼跳龙门电影| 正在播放: JUQ-101 在没有我丈夫的五天里,我被命令禁欲到第一个晚上。不想要 | 姐姐真漂亮5韩剧免费观看全集| 中国春节 bbc 记录片| 在线观看蜜桃17| 兵团岁月电视剧| 男女一起愁愁愁视频在线观看| 火柴女孩| 牙医姐妹在线观看完整版| 韩国三姐妹| 酒店第1-100集| 很想很想你| 骗骗喜欢你电影在线观看免费| 阿诗玛在线观看| 96分钟:列车爆炸案未删减| 小伙爱上兄弟妈妈原版| 黑白大搏斗燕赵刑警| 李恩美修电工的全部电影| 吸血鬼偶像 电视剧| 善良的母亲中字开头9个字| 百妖谱5什么时候出| 私人家教1983版电影免费观看| 电影铁原阻击战在线观看| 《爱你几何》高清全集免费播放| 真爱之百万新娘| 中字hd的丈夫的下属的成就与贡献| 我 伊蒂丝女皇免费观看完整版| 日本电影混血精油按摩| 宝贝我跟你老公比谁的更大 | 朝花夕誓| 人肉玩具姚乐怡| 爱转角遇到爱全集| 扎导正义联盟| 禁忌5免费在线观看| 白化农场| 女儿国3在线观看免费版,电影色戒完整版 | 《干柴烈火》| 维修师傅的艳遇韩国理论片在线观看 | 毕打自己人粤语全集| 斗破苍穹缘起动漫在线观看免费版 | 无良公会无修改板| 一路向西观看地址| 陕西卫视回看| 喜爱夜蒲2未删除版| 失控的生物课堂TXT免费| 赌圣3无名小子国语| 壮志凌云(法国版)2011| 暗香 电视剧| lovefou| 《永不独眠》在线观看| 牙医郝板栗完整板永久删除掉的剧情介绍 | 隐形帽子韩国电影完整 | 勾魂夜荷花| 年经年经母年经3| 廉狙击粤语在线观看免费高清| 地下偶像在线观看免费高清全集| 怎么说我不爱你伴奏 | 美国街头篮球| 狂飙电影免费观看完整版| xl司令全集观看完整版| 作家的谎言的电影| 731部队女子配狗的电影有哪些| 电视剧永不回头| 电影《女性治疗营》| 高考时晕倒确诊骨癌| 97在线播放免费观看| 《桑叶》韩版中国| 邛崃市| 八妻子电院影| 神探狄仁杰4部全集| 洒店1一80集免费观看| 《魔都精兵的奴隶 第二季》| 《偷天鉴宝》叶子楣在线| 电影网站在线| yy6680电视剧免费播放| 哈利波特免费观看完整版英文版| 像我这样的小可爱| 突围全集播放| 一起过春天电影在线观看| 凯帕克电影作品在线观看| 大地震电视剧| 长江1号| 三年大片大全免费观看国语版全集 | 大耳朵图图第季全集| 马成的喜悦| 让子弹飞 删减| 公媳韩国| 沉默的羔羊香港版| 通天书院| 高校教师在线观看免费 | 兰陵王电视剧| 车手在线观看| 十九岁完整版在线观看好看| 财阀刑警| 德国空姐2019满天星法版主演是谁| 字圣传奇| 站着再来一次全集| 流金岁月电视剧全集免费观看| 《女教师的味道3》| 解放电影| 天机富春山居图| 《她被搬运工侵犯》中文| 电影观看免费观看完整版高清| 4s44-cn战狼6免费高清版999加拿大版 | 含烟影院| 明星大侦探第五季在线观看| 吴君如搞笑电影国语| 卿卿日常更新| 云中玫瑰国语版| 电视剧《仁心俱乐部》完整版 | 性瘾成疾BY海棠| 韩国售楼小姐电影免费观看高清版 | 大唐歌飞| 《斗罗大陆》.免费观看| 赛仑《渔夫的妻子》1997| 恶之花免费观看| 原千岁主演电影免费观看高清| 蜂脸女人| 特殊的治疗室1| 世界大战100年全程实录| 霹雳奶娃满天星在线播放| 夕阳红简谱| 完美无瑕在线观看| 《美丽邻居》电视剧在线观看| 电影龙蛇争霸| 美国电影《需要爸爸播种2》在线观看 | 韩国演员金承佑| 暴躁老妈1-46集在线观看电视剧 | 牙医姐妹赤子板栗完整版| 诈欺游戏3| 兵在哪马在哪俑在哪导游你在哪| 银瓶梅电视剧高清免费观看| 肉蒲团 在线| 日本满天星电影全集免费观看| 要过好日子下载| 金银瓶1-5普通话1-5集| 电视剧养女全集| 加油亚当君| 渔夫的荒野史记高清下载| 完美世界dj| 3对1初体4| 动物的尾巴都有什么作用用处| 《一笑随歌》免费观看| 比特犬多少钱| 李灿森结婚| 女学生被强伦轩无删减| 硬核亨利在线观看免费高清| 姐姐当家综艺在线观看| 灭门惨案之孽杀快播| 古惑仔5之龙争虎斗粤语版免费 | 《法国空乘11》播放了吗 | 未来罪行| 私人航空 电影免费看全集| 一代匠师 电视剧免费观看| 美国电影需要爸爸播种中文版 | 杀死比尔2电影| 雷神托尔| 陕西秦腔全本戏| 女超人满天星蓝光版| 男女一起愁愁愁免费观看电视剧动漫| 五通神魔| 亮剑 电视剧| 电影报道| xl司令在线免费观看 | 《代替满足妻子》电影| 另一个贝内特家的姐妹未删减| 大人版《壮志凌云》 | 斗罗大陆101| WRITEAS粗壮| 党同伐异免费| 《维修工人的艳遇》中字| 如狼似虎的女人40集电视剧 | 我是特种兵3全集| 万古仙穹动漫第二季| 《军事不当行为》布兰迪在线观看| 斗罗大陆免费完整观看171集| 勇敢传说电影| 春风燃情电视剧免费观看| 出轨的味道在线观看| 在线播放JUFD-621偷窥湿按摩-巨大的乳房导师在失禁和羞耻中扭动-RikoMizusawa | 360天爱上我| 韩剧《大力女子都奉顺》| 电视剧长相思第二部| 太太度假时| 下半场 微电影| 《落魄贵族琉璃》在线观看| 梦魇绝镇第一季免费观看完整版| 少年骇客过火海| 易经讲解| 芒果香谢军| 需要爸爸播种籽2》在线| 银河奥特曼s免费观看全集中文版| 柔情挚我电影| 婚礼前婚闹先上车在线观看| 电视剧神探狄仁杰第一部| 本乡爱合集| 秘笈追踪| 明星新娘发型图片| 白峰电影高清播放在线观看免费| 极道之恋| 如懿传免费| 星银岛下载| 爱恋在线观看| 巨茎挺进李淑芬高清视频-迅雷看看在 | 2对1:女性3对1体检| 东北黑道风云20全集| 3ce九色眼影水蜜桃x9x| 叶倩文三级大尺度电影| 巴巴爸爸中文动画片| 《金牌销售》| 约会大作战第一季| 武陟一中网站| 《姐妹牙医》完整版在线观看| 高清沧元图 前传:东宁府的夏天 狂飙电视剧全集免费在线观看 | 国语韩剧爱的呼唤| 《美丽女儿替父亲还债》剧情电影 | 三门峡金燕| 战昆仑40集全免费观看| 战狼3电影免费观看高清完整版 | 灵机一触什么意思| 中国菲律宾撤侨| 义子乱的电影在线| 夺帅国语高清| 吐槽大会曹云金完整版| 特殊客房1983经典版介绍| 余波电影在线观看视频完整版高清 | 向连仓士献上纯洁| ed2k苍| 义姐是不良妈妈动漫第一季全集| 百鬼夜行抄未删减| 浪漫女家教| XL司令在线观看免费高清全集 | 千金驾到全集免费| 触摸未来2| 塔日酒店在线观看高清完整版 | 戏台电影| 快播韩国电影| 电影《空姐4》完整版| 杠上开花 电影| 驯龙高手1普通话版免费| 秘密女搜查官在线观看前田| 不要见怪电影| 快乐至死韩剧在线播放免费| 韩国美容院电影是什么| 空既是色| 罗生门免费| 短剧《她不乖》全集免费观看| 喋血双雄| 女护卫队电影免费播放2023年上映时间| 花蜜花液汁水野战高H动漫| 丝路传奇大海图| 有色视频在线播放| 隐身的名字| 黑帮大佬和我的365日翻译未减版| 和部长一起去出差旅| 穿越火线下载 迅雷| 合约变真爱:契约影后影帝短剧全集 | 落花时节又逢君电视| 肚子抽脂多少钱| 爱我几何高清版在线播放| 高清伪术奇才未删减| 泰剧金螺全集中文字在线观看| 白峰高清在线观看免费| 好运查理| 邻居家妻子 电影| 瓜达卢佩的玫瑰 墨西哥电视剧| 电影圣山村谜局完整版播放| 恋爱支招| 韩剧修理工的艳遇| 19岁姑娘电视剧免费观看| 全集免费观看1-40集| 男女愁愁愁愁愁高清| 兵团岁月电视剧| 二重生活| 一闪一闪亮星星免费观看| 古墓丽影特别版| 木子檀檀子电影免费看高清| 我爱你中国谭晶| 公主嫁到 粤语| 我的大胸继拇5| 扑通扑通| 交谊舞慢四步教学| 酒井法子空蝉之森原版| 陷阱韩国版在线看| 走过花季| 《娃娃脸4》少女| 罗小黑战记35集免费观看| 化神短剧全集免费| 法国禁忌5| 上流社会电影在线未删减| 芭比之神秘之门普通话免费观看| 500星级之341电影完整版| 随唐演义 全集高清| 七情六欲韩国版| 千金肉板栗电影在线| 免费观看回复术师的重启人生| 性的暴行在线观看| 不惑之旅连续剧| 遥远时空中3| 电影浪漫女家教正版货| 死亡账号电视剧| 反斗马骝国语| 金银瓶1-5手机版| 风之舞 电视剧| 开心女鬼国语| 八妻子视频观看| 回复术士在线观看免费全集第二季| 向涟苍士献上我的纯洁| xl司令第一季全集在线观看免费播放高清 | 夏日沙上| 《军事不当行为》法国版完整版| 免费完整版| 堂吉诃德动画片| 姐妹免费观看国语| 白峰美羽无码播放| 聊斋之奇情异恋| 原声喘息请戴好耳机| xxxx64美国| 高清《如月车站Re:》电影| 女友的妈妈双字ID推荐| 遇见璀璨的你免费观看完整版 | 大漠苍狼电视剧| 国庆阅兵2023有吗| 绝世天帝| 奥尼尔名人堂演讲| 金瓶梅在线播放国语免费观看| 《激战后厨5》完整版日本| 成何体统动漫第二季| 局内人韩国电影| 《蓝帽子》电影免费观看| 《古墓神蛇》| 巨茎插入李淑芬体内视频| 金钱帝国粤语高清| 扫黑行动在线观看免费高清完整版| 年轻保险销售员2| 叶罗丽精灵梦第八季第四集| 巧奔妙逃高清完整版| 老湿影院放映黒人男子,。大屌猛播美女髙清视频免费看 | 上原瑞穗 ed2k| 《极度召唤》| 《妻子替夫还债》| 高清《潜渊》电视剧全集免费观看 | 关于瑜伽的日本电影| 《性的暴行HD》在线观看| 电视剧宫锁连城| 布衣神相电视剧| 白鹿原未删减版| 牛仔裤的夏天2| 韩国特殊游泳课。| 爱情公寓25集| 爱情的牙齿| 牙医姐妹郝板栗1986 | 高清《断魂小丑》电影| 泫雅否认曾对同学校园暴力| 法国《荣誉守则》满天星版| 锦绣前程:重生不做炮灰短剧全集| 爱天地无用| 仁科百华在线| MSD-005 欧妮 维修工的心跳艳遇(下) 疼痛凌辱高潮快感-在线观看-338TV | 高清《热带鱼》电影在线观看| 公孚之手中字9| 卫生间的圣母像| 男女高潮又爽又黄又无遮挡| 美女扒精光秘 免费观看 | 哈哈哈第三季在线观看完整版| 3对1在线观看中文字幕| 无名之辈:否极泰来电影| 一起愁愁愁30分钟电视剧免费观看电视 | 高清《继母2》| 今夜天使降临电视剧| 坎贝奇成人影片免费播放| 电影跳出去| 甲午大海战| 《社长夫人》天使萌演员表 | 赘婿29| XL司令真人版在线观看 | 法证先锋粤语第一部| 电影《无憾》坎贝奇| 广东大妈| 破浪男女| 《水润女人》| 韩国辣舞| 赤裸特工| 《花子vs驱魔师》第1集免费观看视频 | 爱没那么简单 黄小琥| 金银梅5一10普通话免费观看| 灼灼风流在线观看免费| 僵尸伯伯国语版在线播放| 強暴處女系列1~12| 高清《香蜜沉沉烬如霜》电视剧 | 情难断原唱| 19岁在线播放免费观看电视剧| 鹰爪铁布衫第二部| 梁山伯与祝英台| 三年免费高清第一集在线看| 妻子6免费的电视剧完整版| 小小水蜜桃电视剧在线看免费观看| ♀女精油按摩大学生| 包青天之打龙袍| 全球游戏:江铠动漫免费观看 | 水浒之英雄本色| 黔江区| 王海相声| 周处除三害哪里可以看| 黑暗侵袭3免费完整| 为有暗香来电视剧| 地心历险记2 720P| 需要你的种子| 养父电视剧全集40| 林中小屋2百度影音| 郝板理子电影免费观看| 茶啊二中第四季| 曲周县委书记| 维修师傅的艳遇韩国BD| 岁岁青莲电视剧免费观看完整版| 少年派2免费观看全集| 蒋玲玲| 河南豫剧打金枝| 男子悬崖旁求婚后女友不慎坠亡| 感官的世界| XL司令第一季动漫| 为防导弹攻击 东京都修地下掩体| 《手》在线观看电视剧免费| 女版战狼6欧式少女| 轻吻姐姐| 司藤电视剧免费观看全集| 周生如故 在线观看| 行政体制改革的动力| 田姐辣妹电视剧全集免费观看| 女机器人1980法国满天星| 人间四月天在线播放| 单身首尔电影| 女超人麦乐迪在线视频| 新金瓶梅下百度影音| 三妻四妾国语版第三部电视剧简介 | 俄罗斯卖车子销售和老板电影| 盗墓笔记谜海归巢| 孙俪电视剧全集免费观看| 韩国免费性爱电影需要爸爸的种子| 三生有幸遇见你| 单数绝配| 我需要爸爸电影免费观看| 我是特种兵2全集在线观看| 皮囊之下电影完整高清在线播放| 《法国空姐2019法版》满天星中文| 怪兽娘奥特怪兽拟人化计划| 高清鬼女之家| 财神有道电视剧| 未满十八岁禁入视频网站在线观看 | 鬼哭狼嚎的意思| 山西省| 公交车免费观看完整版电视剧| 泰国电影晚娘2| 精油按摩电影在线观看| 男女愁愁愁在线观看免费| 莲花楼电视剧免费| 进击的巨人佩妹| 俘虏之锁在线观看完整版免费| 魔幻陀螺| 神雕侠侣刘亦菲| 男女一起愁愁愁在线视频| 爱恋下载| 假日游船1980法国经典| 《女律师还债》| 斗罗大陆动画片| 即兴爵士韩剧| 韩剧暴君2024| 男人与女人在一起愁愁愁愁的电视剧 | 女儿的朋友韩剧中汉字| 经营婚姻 电视剧| 宜章县| 销售的销售秘密4中字| 武动乾坤5季全集免费观看动漫| 斗罗大陆第144集免费观看| 陪讨厌部长千金去出差旅| 洗冤录第一部国语电视剧免费观看 | 国语韩剧媳妇当家| 站着再来一次第26集免费播放| 夫妻成长日记下载| 中国香港vs朝鲜| 暴躁46集在线观看电视剧免费全集| 韩国办公室秘书| 没离开过原唱| 女子秘密会所| 修车艳遇在线观看| 绝世武功 微电影| 啦啦队舞蹈教学| jizz美国| 大染坊第一部高清电视剧在线观看| 将军家的小娘子免费观看影视大全| 小姐的夜生活| 需要爸爸的种子伦理影院| 韩剧宫s国语版全集| 强者风范电视剧免费观看| 中文字Dl幕岳和女胥友田真希在线| 人之初1-40集免费观看| 死亡游戏动漫| 房术入门40个动作| 我女儿的朋友6在完整有限中字| 漯河市| 爱情面前谁怕谁| 且听凤鸣短剧免费观看全集| 广西北海地图| 台球高手在线观看免费完整版视频 | 日剧渣男前任求复合| 原振侠与卫斯理| 电影《顶级特工》| 神奇女侠第一季| 《最高の爱人沼》剧情解析| 电影《维和防暴队》| 侏罗纪公园 2013 电影| melodymarks女超人无删减免费播放 | 银行家的妻子中语| 教室那一间| 汶川灵异事件绝密档案| 印度人看中国高铁| 傻王闯天下全集| 歼灭天际线日韩版最新消息 | 年轻的继拇 主演| 月上海电视剧全集在线观看| 血腥杀手| 《社长夫人》天使萌剧免费观看| 女子拒绝同事表白后遭辱骂| 舍我其谁电视剧免费观看| 禁忌满天星| 帅哥按摩特级片| 第一次的辣妹无修| 调音师电影在线观看免费版 | 我们的热恋电视剧| 天行健在线观看| 孤单的儿媳免费观看全集| 在线播放丈夫被继子强暴,阴道紧绷的益女。住在高级住宅区的33岁人妻。每次被 | 小樱桃动画片|