• <track id="oztn4"></track>
    <sup id="oztn4"><form id="oztn4"></form></sup>
    
    
    <mark id="oztn4"></mark>
  • <dfn id="oztn4"><samp id="oztn4"></samp></dfn>
      《地爆天星小姐》电影 ,麦子交换2免费观看2023年上映时间表 ,莫妮卡《爱我几何》,大牛影库战狼6欧式少女全部视频,三年大片国语版在线看,日本空姐电视剧,电影魔镜号中文字幕,和部长一起去出差旅是第几集
      全球「AI學(xué)術(shù)頂會」精華匯聚地
      您正在使用IE低版瀏覽器,為了您的雷峰網(wǎng)賬號安全和更好的產(chǎn)品體驗,強(qiáng)烈建議使用更快更安全的瀏覽器
      此為臨時鏈接,僅用于文章預(yù)覽,將在時失效
      人工智能 正文
      發(fā)私信給奕欣
      發(fā)送

      0

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      本文作者: 奕欣 2017-05-15 09:36
      導(dǎo)語:本文根據(jù)俞揚博士在中國人工智能學(xué)會AIDL第二期人工智能前沿講習(xí)班"機(jī)器學(xué)習(xí)前沿"所作報告《強(qiáng)化學(xué)習(xí)前沿》編輯整理而來,雷鋒網(wǎng)在未改變原意的基礎(chǔ)上略作了刪減。

      雷鋒網(wǎng)[AI科技評論]按:本文根據(jù)俞揚博士在中國人工智能學(xué)會AIDL第二期人工智能前沿講習(xí)班"機(jī)器學(xué)習(xí)前沿"所作報告《強(qiáng)化學(xué)習(xí)前沿》編輯整理而來,雷鋒網(wǎng)在未改變原意的基礎(chǔ)上略作了刪減,并經(jīng)俞揚博士指正確認(rèn),特此感謝。全文分為上下兩篇,本文為下篇。

      上篇傳送門:《南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(上)》

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      俞揚博士、副教授,主要研究領(lǐng)域為人工智能、機(jī)器學(xué)習(xí)、演化計算。分別于2004年和2011年獲得南京大學(xué)計算機(jī)科學(xué)與技術(shù)系學(xué)士學(xué)位和博士學(xué)位。

      2011年8月加入南京大學(xué)計算機(jī)科學(xué)與技術(shù)系、機(jī)器學(xué)習(xí)與數(shù)據(jù)挖掘研究所(LAMDA)從事教學(xué)與科研工作。曾獲2013年全國優(yōu)秀博士學(xué)位論文獎、2011年中國計算機(jī)學(xué)會優(yōu)秀博士學(xué)位論文獎。發(fā)表論文40余篇,包括多篇Artificial Intelligence、IJCAI、AAAI、NIPS、KDD等國際一流期刊和會議上,研究成果獲得IDEAL'16、GECCO'11、PAKDD'08最佳論文獎,以及PAKDD’06數(shù)據(jù)挖掘競賽冠軍等。

      任《Frontiers of Computer Science》青年副編輯,任人工智能領(lǐng)域國際頂級會議IJCAI’15/17高級程序委員、IJCAI'16/17 Publicity Chair、ICDM'16 Publicity Chair、ACML'16 Workshop Chair。指導(dǎo)的學(xué)生獲天貓“雙十一”推薦大賽百萬大獎、Google獎學(xué)金等。

      在此列出俞揚老師講課目錄,以供讀者參考:

      • 一、介紹(Introduction)

      • 二、馬爾可夫決策過程(Markov Decision Process)

      • 三、從馬爾可夫決策過程到強(qiáng)化學(xué)習(xí)(from Markov Decision Process to Reinforce Learning)

      • 四、值函數(shù)估計(Value function approximation)

      • 五、策略搜索(Policy Search)

      • 六、游戲中的強(qiáng)化學(xué)習(xí)(Reinforcement Learning in Games)

      • 七、強(qiáng)化學(xué)習(xí)總結(jié)

      • 八、強(qiáng)化學(xué)習(xí)資源推薦

      上篇介紹了前兩個小節(jié)的內(nèi)容,以下為下篇內(nèi)容:

      三、從馬爾可夫決策過程到強(qiáng)化學(xué)習(xí)

      在強(qiáng)化學(xué)習(xí)任務(wù)中,獎賞和轉(zhuǎn)移都是未知的,需要通過學(xué)習(xí)得出。具體解決辦法有兩個:

      一種是還原出獎賞函數(shù)和轉(zhuǎn)移函數(shù)。首先把MDP還原出來,然后再在MDP上解這個策略,這類方法稱為有模型(Model-Based)方法,這里的模型指的是MDP。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      還有一類和它相對應(yīng)的方法,免模型(Model-Free)法,即不還原獎賞和轉(zhuǎn)移。

      基于模型的方法

      在這類方法中,智能體會維護(hù)Model(即MDP),然后從Model中求解策略。

      從隨機(jī)策略開始,把策略放到環(huán)境中運行,從運行的序列數(shù)據(jù)中把MDP恢復(fù)出來。因為序列數(shù)據(jù)可以提供環(huán)境轉(zhuǎn)移和獎賞的監(jiān)督信息,簡單的做一個回歸,就能知道一個狀態(tài)做了一個動作下面會轉(zhuǎn)移到哪兒,以及能得到的獎賞是多少。

      這里有一個非常簡單的環(huán)境探索方法——RMax,它用了計數(shù)這個非常簡單的回歸模型。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      雖然看起來很簡單,但是還原MDP的樣本復(fù)雜度是狀態(tài)數(shù)的平方,遠(yuǎn)高于前面說到的求解策略的復(fù)雜度。從這里可以看出學(xué)習(xí)MDP的復(fù)雜度極高,所以大量的研究工作都集中在免模型學(xué)習(xí)上。

      免模型學(xué)習(xí)

      免模型學(xué)習(xí)簡單介紹兩種方法。一種叫做蒙特卡羅采樣方法(Monte-Carlo method),一種是時序差分法(Temporal difference method)

      • 蒙特卡羅采樣方法介紹(Monte-Carlo method)

      免模型學(xué)習(xí)和之前講到的策略迭代的思路很像,首先,評估當(dāng)前策略怎么樣;第二,提高當(dāng)前策略。

      第一步 評估策略

      在MDP里評估策略的時候,由于獎賞和轉(zhuǎn)移都是知道的,所以可以直接用這兩個函數(shù)算評估值。現(xiàn)在這兩個函數(shù)都不知道,那怎么辦呢?

      這個Q值函數(shù)實際上是個期望,所以直接用采樣來替代期望就可以了。換句話說,就是拿該策略在環(huán)境里面去跑,看跑出來什么結(jié)果。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      比如跑了之后我得到一條軌跡:先是出太陽,接著是多云,最后是出太陽;再跑第二次得到一條軌跡,再跑第三次又得到一個軌跡。最后得到很多軌跡。我知道每條軌跡的獎賞是多少,然后把這些軌跡的獎賞平均起來,作為這個策略的值函數(shù)的估計,用頻率來逼近期望。

      第二步 更新/提高策略

      如此一來,我們就可以去評價一個策略的好壞。評價完一個策略以后,就可以和剛才一樣,取Q值函數(shù)指示最好的動作作為新的策略,更新過程是一樣的。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      整個算法寫出來比較簡單。我們要做m次采樣,每一次都把當(dāng)前的策略拿到環(huán)境里面運行,然后會得到一個序列,根據(jù)序列讓獎賞求和,然后更新Q值,這個Q值就是歷史上采樣的均值,c是計數(shù)。

      在一條軌跡下來以后,更新Q值后,做第二條軌跡,這樣就做到了不依賴MDP模型的強(qiáng)化學(xué)習(xí)方法。

      然而該方法缺乏環(huán)境探索,難以更新策略

      但是,這個有一個問題——如果得到了確定性策略,那么有可能采100個樣本出來的軌跡都是一樣的,導(dǎo)致無法評估策略在所有狀態(tài)上的表現(xiàn),所以無法提高策略。這里的關(guān)鍵在于它缺乏對環(huán)境的探索。

      如何探索環(huán)境,以獲得最大回報?

      怎么探索?我們可以考慮一個最簡單的強(qiáng)化學(xué)習(xí)問題:一個狀態(tài),兩個動作,一個動作的回報高一點,一個動作回報低一點,但是這兩個回報來自于兩個分布。這個時候你選哪個動作,或者你怎么做能收到最大的回報?這其實就是bandit模型。

      • 一個極端是,嘗試100次,每個動作做50次,這個時候我可能知道哪個動作比較好,但是拿到的回報可能不是最高的,因為可能做10次以后,就已經(jīng)知道第一個動作的回報要高一點了,如果剩下的投資還是均勻分布的話,就得不到最大回報。

      • 另一個極端是,兩個動作各試一次,看哪個回報高,剩下的98次全部投到最高的回報去。這個方法也不好,因為只試了1次,估計的回報很不穩(wěn)定。

      第一種情況是要有足夠多的探索(即exploration),第二種情況是不需要過多的探索而有更好的投資(即exploitation),我們要在這兩點之間找到平衡。

      解決這個問題有多種方法。第簡單的方法是,以1-ε的概率,現(xiàn)在看好哪個,就去投資它,剩下的ε概率就完全隨機(jī),每個動作都去嘗試。這個方法稱為ε-greedy。

      該方法可以保證所有狀態(tài)都有一定的概率,哪怕是很小的概率,被訪問到。所以當(dāng)運行一段時間以后,它能夠找到最優(yōu)的策略。

      但這個方法也有缺點,就是必須要指定一個ε值。通常這個值應(yīng)當(dāng)不斷衰減,直到收斂到一個比較好的結(jié)果。還有一個效率問題,比如A動作嘗試了10次以后,平均回報是1萬,B動作嘗試了10次以后是0.1,這個時候就已經(jīng)沒有必要嘗試下去了,因為距離非常遠(yuǎn)。但是ε-greedy的探索不會停下來,所以有了其他的方法,比如softmax——它會考慮到Q值本身,如果兩個動作的值差別很大,探索的概率就很小。另一個在理論上比較漂亮的方法是UCB(Upper Confidence Bound):

      • 第一,考慮了Q值。如果Q值本身差距比較大,探索的可能性就很小;

      • 第二,考慮了探索次數(shù)。如果探索次數(shù)很少,可能它的置信度就比較低,如果探索的次數(shù)較多,置信度就會比較高。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      所以,按照Q值加上置信度的上界來選擇動作,它就會自動平衡。

      不過,最常用的還是第一種ε-greedy方法。給出一個策略π以后,把它變成探索的策略,即隨機(jī)挑選一個動作,把這個帶探索的策略放到蒙特卡羅的算法里面。并且,這個軌跡并不是從π中產(chǎn)生的,而是從帶探索的πε中產(chǎn)生的,這就能保證策略可以不斷更新了。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      下面介紹On/Off Policy:學(xué)習(xí)帶探索/不帶探索的策略。

      大家可能常聽On/Off Policy策略這個詞。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      在蒙特卡洛采樣中使用了πε策略來采樣,學(xué)的并不是π,是帶探索的πε。因為用來評估的數(shù)據(jù),是從帶探索的策略產(chǎn)出來的,而不是從我們想要學(xué)的策略上產(chǎn)生出來的。這個區(qū)別會導(dǎo)致把探索也作為策略的一部。這種采樣與更新的策略是一樣的算法叫做On Policy。

      但很多時候,我們想學(xué)的實際是不帶探索的策略,也就是說要從帶探索的策略中采樣,但更新的只是策略本身,即Off Policy。這里面臨一個問題就是,采樣并不來自于當(dāng)前的策略,常用的重要性采樣(Importance Sampling)技術(shù)通過修改采樣的分布,改成想要的樣子。可以通過加權(quán)重這個簡單的方法,修改策略的分布,然把這個分布加到具體算法里面去。也就是把獎賞加了一個權(quán)重,這樣的算法就變成一個Off Policy的算法,這樣它學(xué)習(xí)的就是π自己了。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      蒙特卡洛算法總結(jié)

      總體來說,蒙特卡洛的算法不是一個效率很高的算法,但是能夠展現(xiàn)免模型類算法的特性。

      我們要做這個策略的評估,然后做完評估以后找到一個改進(jìn)的方向,就可以改進(jìn)這個算法了;這里,為了使策略能夠有效更新,需要引入對環(huán)境的探索;而對環(huán)境的探索里面,要注意On/Off Policy這么兩個概念。

      另外,蒙特卡洛的算法有一個很顯然的缺陷:一定要拿到整個軌跡以后,才能更新模型。

      • 時序差分(Temporal difference method)

      那能不能每走一步都更新模型呢?蒙特卡洛算法里面有一個性質(zhì)——即更新Q值的時候,實際上是在更新均值。

      更新均值還可以寫成:μt = μt-1 + α(xt _ μt-1),意思是剛才我們更新的是Q值(算式如下圖顯示),其中R ? Q(st, at)叫做蒙特卡羅誤差。我們知道,Q是對獎賞的一個估計,R是是采完這個軌跡以后得到的真實的獎賞。換句話說,Q值d餓更新就是加上就是真實值和估計值的差別,即蒙特卡羅誤差。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      在TD算法里,我們走了一步得到了一步真實的獎賞,再往后走還沒走,所以不知道后面真實的獎賞是多少,但可以通過之前的Q值來估計之后的獎賞,這兩個加起來就是當(dāng)前知道的信息,用它來替代這個R,來減去老的預(yù)估值,我們稱這個過程為時序差分。

      如果用蒙特卡羅的話,需要先走到底,知道總體的結(jié)果之后,每一步的差別就能算出來;而對于TDL來說,只需要記錄一步的信息,所以可以在線更新自己。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      • SARSA

      動態(tài)規(guī)劃記錄的是所有狀態(tài)上面的信息。而把剛才的蒙特卡羅的error換成了TD errpr,就可以得到新的TD方法的強(qiáng)化學(xué)習(xí)方法。這個方法就不是采集整個軌跡了,而是根據(jù)探索的策略,用TDL來更新Q值,每走一步就更新一下對當(dāng)前策略的評判,然后再更新策略。這個算法叫做SARSA,屬于On Policy,而變成Off Policy的策略,只修改一處,用非探索策略來計算TD error,就得到Q-Learning算法。

      • SARSA v.s. Q-learning

      這是一個爬格子的問題,是典型的經(jīng)典強(qiáng)化學(xué)習(xí)問題。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      動作是上下左右的走,每走一步就會有一個-1的獎賞。從初始狀態(tài)走到最終的狀態(tài),要走最短的路才能使獎賞最大。圖中有一個懸崖,一旦走到懸崖獎賞會極小,而且還要再退回這個初始狀態(tài)。

      在這里用On Policy SARSA會有一定的概率去探索,也就有可能會掉到這個懸崖下面去,所以獎賞就會比較小;而用Q Learning,因為最后的策略是不帶任何探索的,沒有任何的隨機(jī)性,所以路徑最短。

      這就是兩類強(qiáng)化學(xué)習(xí)算法的區(qū)別。你在學(xué)習(xí)過程中可以看到,Q Learning的值較低,這是因為學(xué)習(xí)的時候一定要帶探索的學(xué)習(xí),所以你訓(xùn)練的過程中一定是不斷的去訓(xùn)練。

      另外,前面講的TD誤差更新是走一步后的更新,實際上還可以做兩步的更新、走N步的更新,都是可以的。所以有一種方法就是做很多步的,按照一個概率加權(quán)把它綜合起來,綜合起來以后到一個叫做λ—return,就是走一步、走兩步和走多步的TD。

       四、值函數(shù)估計(Value function approximation)

      剛才講的所有問題,前提是都能用表格表示。但是很多真實環(huán)境是無法用表格表示的。所以在強(qiáng)化學(xué)習(xí)發(fā)展的早期,一直沒辦法用在大規(guī)模的真實問題上去。后來大家就想,怎么把這個強(qiáng)化學(xué)習(xí)放在一個連續(xù)狀態(tài)空間去,甚至說放在動作也是連續(xù)的情景中,比如控制一架直升機(jī)的。

      大家可能覺得強(qiáng)化學(xué)習(xí)的學(xué)習(xí)過程和監(jiān)督學(xué)習(xí)之間的差別比較大,算法、模型好像都完全不一樣。但進(jìn)入連續(xù)狀態(tài)空間以后,兩者就會出現(xiàn)很多相似的地方。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      離散狀態(tài)下可以用表格來表示值函數(shù)或策略;但進(jìn)入連續(xù)狀態(tài)空間就要用一個函數(shù)的近似來表示,這個方法叫做值函數(shù)近似。

      比如,我們可以用一個線性函數(shù)來表示,V值是表示狀態(tài)s下面的一個值,狀態(tài)s先有一個特征的向量φ(s),這個V值表達(dá)出來就是一個線性的參數(shù)乘以特征的內(nèi)積。Q值里面有一個動作,假設(shè)這個動作是離散的,一種方式是把這個動作和狀態(tài)放在一起變成一個特征,另一種方法是給每一個動作單獨做一個模型。

      當(dāng)遇到連續(xù)空間的問題時,用近似來表示值函數(shù)V和Q,這個做法看起來很自然,但是近似以后會發(fā)現(xiàn),以往很多的理論結(jié)果就不成立了。

      但我們現(xiàn)在先不管那些問題,先看做了近似以后怎么來學(xué)?我們想知道的是,這里的Q值,是希望Q值近似以后,夠盡量逼近真實的Q值。如果已經(jīng)知道真實的Q值,怎么逼近呢?最簡單的方法就是做一個最小二乘回歸。其中一種解法是求導(dǎo)。求導(dǎo)以后,導(dǎo)數(shù)表示為,真實的Q和估計的Q的差值,然后再乘對Q值模型的導(dǎo)。可以看到,導(dǎo)數(shù)表達(dá)的含義與之前的模特卡羅誤差、TD誤差是一致的,只不過更新的是參數(shù)w。把這種更新方式套進(jìn)Q learning里,其他地方都沒有變,只得到了用值函數(shù)逼近的Q-Learning方法。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      這個模型用什么函數(shù)呢?最簡單就是用線性函數(shù)。但是線性函數(shù)有很多局限的,需要在特征的設(shè)計上下功夫,這需要很好的人工設(shè)計。

      把它變成非線性函數(shù),一個常用方法是用神經(jīng)網(wǎng)絡(luò),直接用神經(jīng)網(wǎng)絡(luò)表示Q值。在更新的時候也很簡單,只需要把梯度傳到神經(jīng)網(wǎng)絡(luò)中去就可以了,因為神經(jīng)網(wǎng)絡(luò)的BP算法本身也是求梯度。

      用批量學(xué)習(xí)改進(jìn)

      還有一些改進(jìn)的方式。比如說我們在訓(xùn)練近似模型的時候,在一個樣本上訓(xùn)練可能會不穩(wěn)定,所以可以用Batch Models的方式,積累一批數(shù)據(jù)來訓(xùn)練這個模型。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      剛才講的所有訓(xùn)練方法,都是先把V值或者Q值估計出來,然后再從中把這個策略導(dǎo)出來。我們稱這種方法為基于值函數(shù)的強(qiáng)化學(xué)習(xí)方法。

      五、策略搜索(Policy Search)

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      值函數(shù)估計法存在的問題:策略退化

      但是用值函數(shù)估計會有一個問題——這種方法可以收斂到最優(yōu)策略,但前提必須是用表格的表達(dá)方式;如果用的是函數(shù)近似,則會出現(xiàn)策略退化,即對Q值估計越大,策略越差。

      舉一個簡單的例子,現(xiàn)在有兩個狀態(tài),一個是狀態(tài)1,一個是狀態(tài)2,狀態(tài)1的特征為2,狀態(tài)2的特征為1。我們設(shè)定獎賞,使得狀態(tài)2的最優(yōu)V值比狀態(tài)1的要大。這時如果用一個線性函數(shù)來表示這個V,也就是用W乘以特征,這個特征只有一維,最優(yōu)的這個V值2是比1大的,1的特征值要高一點,2的特征值要小一點,所以最優(yōu)的W就應(yīng)該是個負(fù)數(shù),這樣會使得V(2)比V(1)大,因而能導(dǎo)出最優(yōu)策略。

      但是基于值函數(shù)的做法是要使得V值盡量靠近最優(yōu)的V值,最優(yōu)的V值又是正值,這樣會導(dǎo)致這個W一定是正的,無法得到最優(yōu)的策略。這樣值函數(shù)估計得越準(zhǔn),策略越差的現(xiàn)象被稱為策略退化。

      用策略搜索解決策略退化問題

      為了避免策略退化,我們的方法是直接去找策略,這就是策略搜索。

      先把策略參數(shù)化,對于離散動作來說,參數(shù)可以做成像Gibbs Policy一樣,即每個動作有一個參數(shù),然后把它歸一,變成每一個動作有一個概率。如果是一個連續(xù)動作的話,可以用高斯分布來描述。里面這個參數(shù),我在這里寫的是一個線性的過程,但也可以用神經(jīng)網(wǎng)絡(luò)來替代。

      直接優(yōu)化策略的參數(shù),使得收到的總回報達(dá)到最大的方法,就是策略搜索(Policy Search)。

      策略搜索的優(yōu)勢

      策略搜索和基于值函數(shù)的方法相比,優(yōu)缺點各是什么?

      • 第一,能處理連續(xù)狀態(tài)和動作;

      • 第二,對于高維的數(shù)據(jù)總的表現(xiàn)比較好。

      • 第三,可以直接學(xué)出隨機(jī)性策略

      • 第四,Policy Search和監(jiān)督學(xué)習(xí)的兼容性比較好。

      第三點用處很大,比如說玩“剪刀石頭布”,如果選擇確定性策略,那一定會輸;一定要做一個帶概率的輸出才會贏。     

      還有另外一個例子,跟大家講解一下為什么需要隨機(jī)性策略。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      骷髏代表走到這就死掉了;最優(yōu)策略肯定是往中間走,但是這里有兩個灰色格子,它們代表的是不完全觀測的狀態(tài),即走到灰格子之后不知道該往左邊還是右邊;

      • 如果這時又用了確定性策略,那就只能向左或向右走,只能是確定的,則有可能會遇到走不通的路徑。

      • 如果用隨機(jī)性策略,向左和向右的概率都為50%,因此不管往哪邊走總能到達(dá)目標(biāo)。

      這也體現(xiàn)了策略搜索的優(yōu)勢。

      第四,策略搜索和監(jiān)督學(xué)習(xí)的兼容性比較好。

      這個策略是用參數(shù)表達(dá)的,它的目標(biāo)是最大化的獎賞。最大化獎賞的意思就是說,把空間里所有的軌跡枚舉出來。因為策略產(chǎn)生這些軌跡是有一定概率的,在某個狀態(tài)上,策略做出相應(yīng)動作的概率是由策略決定的,把所有一條軌跡上所有動作的概率相乘,就得出產(chǎn)生這條軌跡的概率。所以它總體的期望回報,就是所有軌跡的期望,也就是每條軌跡的概率乘以每條概率能獲得的獎賞,這也是總回報的另外一種寫法。這種寫法有的好處就在于,它和策略參數(shù)目標(biāo)有關(guān),所以我可以對獎賞直接求導(dǎo),來求解策略。另外一種寫法用的是穩(wěn)態(tài)分布(Stationary Distribution),用和上面寫法完全等價,意思是完全一樣的,在這里就跳過不講了。

      策略搜索也有一個缺點,其中一個缺點就是有很多局部最優(yōu)解,失去了全局最優(yōu)的收斂性保障,其次是訓(xùn)練過程方差非常高。

      • 早期策略求導(dǎo)的方法:Finite Difference

      相信大家都會求導(dǎo),不過有一種方式大家可能沒有見過——有限差分(Finite Difference),這是早期用來做策略求導(dǎo)的方法。

      那什么時候會用到有限差分呢?可能是這個系統(tǒng)可能太復(fù)雜了,不容易求導(dǎo),那就可以用一個簡單的方式來逼近這個導(dǎo)數(shù)。拿到一個參數(shù)θ,θ的導(dǎo)數(shù)就是看一下周圍哪個方向走的比較快,這樣給θ加一個很小的擾動的值,對θ周圍的局部進(jìn)行采樣,對那個采樣增長得最快,這個方向就當(dāng)成是一個導(dǎo)數(shù)方向。這是最簡單的方法,當(dāng)然這個方法有很多缺陷,特別是在高維度的情況下,會需要很多采樣,所以更直接的方法還是直接求導(dǎo)。

      最后得到的一個導(dǎo)數(shù),導(dǎo)數(shù)形式如下所示:

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)                                    

      E是期望,1到T代表考慮的是T步的軌跡,每一步軌跡對策略輸出值的對數(shù)取導(dǎo)數(shù),然后乘以真實的獎賞(獎賞不取對數(shù))。獎賞是個常數(shù),即軌跡得到的獎賞值。

      可以通過采樣可以來逼近期望,對一個策略以后,去跑一些軌跡,然后計算平均梯度,作為梯度期望的逼近。

      我們剛剛說到,這種方式有一個很大的缺陷,就是它的方差很大,直接用計算的梯度來更新策略(vallina policy gradient),基本上得不到好的策略,因為它的方差太大,不穩(wěn)定。

      控制方差的方法 1、Actor-Critic

      控制方差有多種方式,其中一種叫做Actor-Critic。用比如直接求導(dǎo)的方式把策略求出來,叫做Actor;對值函數(shù)進(jìn)行估計,并用于評估策略,是Critic,意為它是一個評價者。

      我們要維護(hù)一個值函數(shù)Q的模型。另外,用導(dǎo)數(shù)的方法來求策略的梯度的時候,不做直接使用獎賞,而是使用Criitic提供的Q值。所以Actor-Critic會維護(hù)兩個模型,第一個是策略的模型,第二個是Q函數(shù)的模型。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      對Q函數(shù)求近似的時候,式子和上面的那個導(dǎo)數(shù)形式一樣,里面的經(jīng)驗獎賞換成了Q值。在求策略梯度時,Q值是一個常數(shù),是不更新的,它有自己的更新方式,且通常是真實的Q值。

      控制方差的方法2、引入偏差項(bias term)

      另一種控制方差的形式,是引入偏差項,只要這個函數(shù)是一個只跟狀態(tài)有關(guān)、跟動作無關(guān)的函數(shù),它的積分就是0,不影響梯度方向,而會影響梯度的方差。

      對于簡單的形式,我們可以直接求出來最優(yōu)的偏差是什么。更一般的形式,我們可以用V值來替代bias。因為V值就是關(guān)于狀態(tài)的估計值,和動作沒有關(guān)系,所以它帶到積分里面去的時候會是0。

      把V值帶進(jìn)去,后面的Q就變成了Q-V,叫做Advantage Function,意思指:在這個狀態(tài)上,V值相當(dāng)于是一個平均值,Q值指某個動作比平均值高出來多少。用Advantage Function會使得做策略梯度以后,方差控制得比較好,只有當(dāng)方差控制好了,這類算法才能真正起作用。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      其他改進(jìn)方法

      梯度的改進(jìn)方法還有Nature Policy Gradient。在監(jiān)督學(xué)習(xí)里面,隨機(jī)梯度是很容易并行的。最近有一些理論的工作,也探討了它的并行不會影響到它的理論性質(zhì)。在策略梯度里面,我們同樣可以把這個梯度并行來做,這樣可以使得它的速度下的很快。

      還有對策略直接求導(dǎo)的方法,比如無梯度的優(yōu)化(Derivative-Free Optimization)。這類方法不管強(qiáng)化學(xué)習(xí)是在做什么,而是直接優(yōu)化策略里面的參數(shù)。優(yōu)化完參數(shù)以后,試一下策略,得出這個值具體是多少。

      這樣,優(yōu)化過的算法可以通過總體獎賞值來調(diào)整模型里面的參數(shù)。通常來說它比用Gradient Policy效率差,由于中間過程是忽略不計的,所以它對特別復(fù)雜的問題,反而有比較好的效果,比如俄羅斯方塊游戲。

      六、游戲中的強(qiáng)化學(xué)習(xí)(Reinforcement Learning in Games)

      最后一部分,講一下強(qiáng)化學(xué)習(xí)和游戲。

      為什么講游戲?一方面,是因為在游戲里面需要克服的一些問題,在真實應(yīng)用中也常遇到;另外一方面,用游戲來做強(qiáng)化學(xué)習(xí)任務(wù)的成本比較低。

      • 游戲推動深度強(qiáng)化學(xué)習(xí)(Deep Reinforcement Learning)的發(fā)展

      2015年,DeepMind在Atari游戲上使用深度網(wǎng)絡(luò)直接從屏幕圖像訓(xùn)練強(qiáng)化學(xué)習(xí),直接推動了“深度強(qiáng)化學(xué)習(xí)”的發(fā)展。

      用深度神經(jīng)網(wǎng)絡(luò),放在Policy Gradient里面,作為一個策略的模型;或者放在基于值函數(shù)的方法里面,作為值函數(shù)Q值的一個估計。這樣的方法就稱為深度強(qiáng)化學(xué)習(xí)。

      深度強(qiáng)化學(xué)習(xí)

      其實,深度強(qiáng)化學(xué)習(xí)里很多工作是在研究怎么讓網(wǎng)絡(luò)更穩(wěn)定。特別是當(dāng)輸入數(shù)據(jù)比較少的時候,網(wǎng)絡(luò)方差的浮動會比較大。這就可以用“延后更新”來解決——如果用深度神經(jīng)網(wǎng)絡(luò),那么每走一步都更新模型會導(dǎo)致模型抖動非常大。而用“延后更新”,例如可以在100步里不更新策略,只是把神經(jīng)網(wǎng)絡(luò)更新一下,這個神經(jīng)網(wǎng)絡(luò)沒有放到新的策略里面來,等神經(jīng)網(wǎng)絡(luò)有一個比較穩(wěn)定的上升以后,再更新策略。還有,積累的數(shù)據(jù)不要丟掉,也拿出來,讓這個神經(jīng)網(wǎng)絡(luò)更穩(wěn)定一點。這兩個技巧合起來放在Q-Learning里面,就是DQN。

      • Deep Q-Network(DQN)

      DQN可以說是第一個聲稱深度強(qiáng)化學(xué)習(xí)算法,可能也是最廣為人知的一個。基本上,它的整體結(jié)構(gòu)就是一個函數(shù)近似的Q Learning,只不過用CNN做了近似函數(shù)。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      在玩這個游戲的時候,它已經(jīng)有了100萬個記錄歷史。每次訓(xùn)練神經(jīng)網(wǎng)絡(luò)的時候,要抓32個出來訓(xùn)練一次,并且訓(xùn)練完以后不去更新策略,而是在走一定的步數(shù)以后,再更新這個策略。除此之外,并不是直接從屏幕上把一幀圖像拿進(jìn)來,而是把歷史上好幾幀的屏幕拼起來,得到一個當(dāng)前幀和前面好幾幀合起來的一個總體的圖作為CNN的輸入。不過在最新的一些工作中,這個過程已經(jīng)被被遞歸神經(jīng)網(wǎng)絡(luò)替代了,不再是把好幾層拼起來,而是讓好幾幀分別輸入例如LSTM的網(wǎng)絡(luò)。

      很多運用強(qiáng)化學(xué)習(xí)尋找策略的游戲已經(jīng)比人玩得都好了,它玩的好的優(yōu)勢主要體現(xiàn)在反應(yīng)速度上。但是在需要深入思考邏輯關(guān)系的游戲中,強(qiáng)化學(xué)習(xí)沒有人做得好。

      我們來看看它的游戲報告結(jié)果。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      這里面,“with replay”和“without replay”的意思是有沒有用到歷史數(shù)據(jù),“with target Q”和“without target Q”就用了CNN還是線性網(wǎng)絡(luò)。我們可以看到,神經(jīng)網(wǎng)絡(luò)在這里貢獻(xiàn)并不是最大的。如果我們只用神經(jīng)網(wǎng)絡(luò)而不用replay的話,效果還不如用了replay,但只用線性模型而不用CNN。當(dāng)然,同時使用深度模型和強(qiáng)化學(xué)習(xí)是最好的,這可以完成一些過去完成不了的事情。

      在AlphaGo中的應(yīng)用

      AlphaGo系統(tǒng)的基礎(chǔ)框架是蒙特卡洛樹搜索,這是經(jīng)典的樹搜索的方法。但是單憑蒙特卡洛樹搜索本身并不能取得很好的效果,只用樹搜索大概只能達(dá)到業(yè)余的五六段。AlphaGo里面的一個創(chuàng)新的點就是引入強(qiáng)化學(xué)習(xí)來改進(jìn)搜索樹的深度和寬度。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      這里面用了三個神經(jīng)網(wǎng)絡(luò)。

      • 第一個policy network,在展開蒙特卡羅樹搜索節(jié)點的時候起作用。這個網(wǎng)絡(luò)是用策略梯度方法訓(xùn)練出來的。

      • 第二個是一個很小的神經(jīng)網(wǎng)絡(luò),蒙特卡羅樹搜索里再往下做很深的搜索時會用到,這樣它可以算得很快。這個小的網(wǎng)絡(luò)是通過監(jiān)督學(xué)習(xí)學(xué)出來的。

      • 第三個網(wǎng)絡(luò)是用來修正值的。它是通過強(qiáng)化學(xué)習(xí)中間產(chǎn)生的數(shù)據(jù)來學(xué)習(xí)。

      由于大家對DQN比較熟悉,所以在嘗試深度學(xué)習(xí)的時候,首先想到的算法大多是DQN。但因為它是一個基于值函數(shù)估計的強(qiáng)化學(xué)習(xí)方法,所以這種方法在稍微復(fù)雜一點的應(yīng)用環(huán)境中可能運行不了,大家會感覺用DQN做強(qiáng)化學(xué)習(xí)效果沒那么好。但同樣是DeepMin做的圍棋游戲,它的強(qiáng)化學(xué)習(xí)方法已經(jīng)改成了Policy Gradient,而且以后的很多算法也都是以Policy Gradient為主的,用這種方法處理復(fù)雜問題效果更好。

      在其他游戲上的應(yīng)用

      正是由于在計算機(jī)中模擬游戲的代價很低,所以不斷有研究者借助游戲來發(fā)展強(qiáng)化學(xué)習(xí)。比如,有用在3D第一人稱射擊游戲中,可以在這個世界里面行走,并且尋找東西。去年有一個“DOOM”游戲比賽,參賽者要用計算機(jī)控制游戲角色,以第一視角進(jìn)行3D射擊。有了強(qiáng)化學(xué)習(xí),參賽者就能控制游戲角色,讓它做一些動作。由于這個游戲額環(huán)境比較復(fù)雜,所以在玩游戲的過程中,也發(fā)展出了一些創(chuàng)新方法。

      例如,在游戲里面,如果讓一個強(qiáng)化學(xué)習(xí)直接到游戲環(huán)境里面學(xué)習(xí),那它又要撿醫(yī)療箱,又要去撿武器等等,太復(fù)雜了。而其中一個團(tuán)隊,就采取了這樣的做法:他們讓強(qiáng)化學(xué)習(xí)從簡單到復(fù)雜,一步一步的去學(xué)習(xí)——首先學(xué)一個策略,比如撿起醫(yī)療箱,然后在這個策略的基礎(chǔ)上再來學(xué)怎么樣來開槍、怎么樣來射擊敵人等等。

      實際上游戲里面有很多很高難度的挑戰(zhàn),其中一個非常復(fù)雜游戲叫做StarCraft。這個游戲已經(jīng)有很多年的歷史了,現(xiàn)在有不少人,包括DeepMind,都希望在這么復(fù)雜的游戲上面能表現(xiàn)出一個比較好的性能,因為這個游戲的復(fù)雜度已經(jīng)大到和很多真實應(yīng)用的復(fù)雜度相當(dāng),即使人去學(xué)這個游戲,也要花很長時間才能學(xué)會。以前用強(qiáng)化學(xué)習(xí),只是先取其中一個小問題來解決。比如說我和對方各派三個兵,想辦法看這六個兵怎么打。這是一個很局部的戰(zhàn)役,但能學(xué)到這樣的東西也已經(jīng)比較不錯了。如果要學(xué)到整盤的打法,它里面涉及到很多問題,第一,它的規(guī)模遠(yuǎn)大于圍棋的規(guī)模;第二,有很多對手的信息是觀測不到的,比如敵方的行動。雖然在今年年初,德州撲克游戲上機(jī)器已經(jīng)打贏了人類玩家,但德州撲克其實是一類很簡單的牌類游戲,想讓強(qiáng)化學(xué)習(xí)在大規(guī)模游戲任務(wù)中,在無法觀測到對手信息的情況下,指揮200多個單位做連續(xù)的運動,還要持續(xù)半個多小時走幾十萬步,目前還做不好。

      七、強(qiáng)化學(xué)習(xí)總結(jié)

      之前介紹的只是強(qiáng)化學(xué)習(xí)的其中一小部分,強(qiáng)化學(xué)習(xí)還包括很多內(nèi)容:

      比如在MDP中如果出現(xiàn)了不可觀測的情況,它就不屬于Markov了,有一個專門的方向如POMDP來解決這個問題。

      還有Learning from Demonstrations,意為人先做出示范,然后從示范數(shù)據(jù)中教智能體。例如AlphaGo,一開始訓(xùn)練的時候并不是直接上強(qiáng)化學(xué)習(xí),而是首先搜集了很多人類對打的數(shù)據(jù)。

      而怎么去設(shè)計獎賞函數(shù)也會有很多不同的方法。

      下面總結(jié)一下兩個大家比較關(guān)心的問題。

      • 第一個問題:強(qiáng)化學(xué)習(xí)是否已經(jīng)發(fā)展成熟?如何選擇強(qiáng)化學(xué)習(xí)問題中的算法?

      如果碰到比較簡單的強(qiáng)化學(xué)習(xí)問題,可以用基于值函數(shù)的方法,比如DQN,更復(fù)雜的問題可以用Policy Gradient的方法做策略梯度。

      但是從目前的發(fā)展現(xiàn)狀兩看,強(qiáng)化學(xué)習(xí)的成熟度遠(yuǎn)遠(yuǎn)不夠,也就是說在強(qiáng)化學(xué)習(xí)領(lǐng)域,還有很大的提升的空間,有可能能做出一個性能更好的全新的算法。但大規(guī)模的問題現(xiàn)在還是很難解決。這個大規(guī)模指是它的狀態(tài)空間大,并且步數(shù)特別多。

      • 第二個問題:在實際領(lǐng)域應(yīng)用強(qiáng)化學(xué)習(xí),會遇到什么瓶頸?

      1、 強(qiáng)化學(xué)習(xí)需要探索,在很多場景帶來風(fēng)險。

      以推薦股票為例。我本來已經(jīng)有一個還可以的推薦策略,每天能給我?guī)?00萬的收入。但是現(xiàn)在為了訓(xùn)練強(qiáng)化學(xué)習(xí),要做探索,嘗試一些隨機(jī)的股票。假如告訴你這個探索會導(dǎo)致今天一下子要損失好幾百萬,而一個月以后可以賺回1個億,那你就要衡量一下這里看面的風(fēng)險有多高,敢不敢用了。

      2、 為什么強(qiáng)化學(xué)習(xí)在很多游戲上面用的比較多?

      游戲在計算機(jī)中運行,速度高、代價低。如果放到現(xiàn)實世界中來運行,比如放在推薦系統(tǒng)線上運行,那它就必須和真實的環(huán)境打交道。它的學(xué)習(xí)過程需要不斷探索,而部署在真實環(huán)境里可能會遇到很多麻煩,如果能有一個比較好的模擬器,就可以減少這些麻煩;另外,如果有比較好的監(jiān)督學(xué)習(xí)數(shù)據(jù)的話,也可以做一個初始的策略,不過這個策略可能一開始起點要稍微高一點。做機(jī)器人一般也有一個機(jī)器人模擬器,所以一般先在模擬器里面做,做好策略再放到機(jī)器人身上來學(xué)。但是其他現(xiàn)實世界問題,在模擬器里可能就沒有那么好做了。

      八、強(qiáng)化學(xué)習(xí)資源推薦書籍

      強(qiáng)化學(xué)習(xí)的書不多,最經(jīng)典的書是Richard S. Sutton的教科書;Masashi Sugiyama的書屬于專著;Reinforcement Learning: State-of-the-Art屬于文集,覆蓋面比較廣,但需要讀者有一定基礎(chǔ);還有一些講述MDP的書;另外,在機(jī)器學(xué)習(xí)的書里面也會提到強(qiáng)化學(xué)習(xí)。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      線上資源

      OpenAI Gym:一個基礎(chǔ)的強(qiáng)化學(xué)習(xí)平臺,里面很多環(huán)境,研究人員可以在上面做實驗,它對這個領(lǐng)域有很大的促進(jìn)。還有AlphaGo技術(shù)負(fù)責(zé)人David Silver的線上教學(xué)視頻,講的非常好。

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      論文發(fā)表地

      強(qiáng)化學(xué)習(xí)論文主要發(fā)表在AI期刊和會議上,期刊有Artificial Intelligence, JAIR, JMLR, Machine Learning, JAAMAS等,會議有IJCAI, AAAI, NIPS, ICML, ICLR, AAMAS, IROS等等。

      以上就是俞揚博士的演講,更多內(nèi)容請繼續(xù)關(guān)注雷鋒網(wǎng)。

      雷峰網(wǎng)原創(chuàng)文章,未經(jīng)授權(quán)禁止轉(zhuǎn)載。詳情見轉(zhuǎn)載須知

      南京大學(xué)俞揚博士:強(qiáng)化學(xué)習(xí)前沿(下)

      分享:
      相關(guān)文章
      當(dāng)月熱門文章
      最新文章
      請?zhí)顚懮暾埲速Y料
      姓名
      電話
      郵箱
      微信號
      作品鏈接
      個人簡介
      為了您的賬戶安全,請驗證郵箱
      您的郵箱還未驗證,完成可獲20積分喲!
      請驗證您的郵箱
      立即驗證
      完善賬號信息
      您的賬號已經(jīng)綁定,現(xiàn)在您可以設(shè)置密碼以方便用郵箱登錄
      立即設(shè)置 以后再說
      主站蜘蛛池模板: 亲爱的自己电视剧免费看| 美容室的待遇6在线观看| 巨人电视剧| 电影《美容院的特殊待遇》1中文在线| 李灿森结婚| 绽放许开心电视剧全集免费观看| 廊坊阳光驾校| 扶摇 电视剧| 《高庄监狱》完整版免费观看| 罚罪电视剧在线观看完整版| 青楼名妓电视剧免费观看全集| 科目三舞蹈原版| 夫妻成长日记全集| 《因为遇见你》免费观看| 电视剧扫毒风暴| 乌苏市| 辘轳女人和井全26集| 《千金小姐》在线观看| 鬼父手机在线看1到16集| 男生女生一起愁愁愁愁愁电视剧在线观看 | 水手服的饲养电影在线观看 | 房奴电视剧开头原声| 于婕 台北晚九朝五| 爱丫爱丫免费国语高清| 艰难爱情全集| 双人调情按摩术免费在线观看 | 姜素拉电影在线播放| 妈妈出轨了韩剧结局| 如懿传1-87集在线观看| 妙手电视剧| 阿娇张开双腿实干十三分钟| 亲兄热弟剧情| 永时影院| 第八号当铺电视剧| 秘密花园动漫在线观看完整| 韩国电影被水电工诱奸免费观看| 战狼6免费高清版| VICTORYDAY护士| 回复术士的重来人生13| 三狼奇案国语| 和部长出差日本电影| 女律师替夫还债50万电影叫什么 | 化风行万里歌曲原唱| 马达加斯加3插曲| 铁血昆仑关电影| 日本电影《叔嫂恋曲》中字 | 终结者5 720p| 建湖县| 中国媳妇主题曲| 罗曼蒂克地下室骑马画面| 交谊舞中四舞曲| 私人女性监狱免费观看途径| 《凤凰台上》免费观看| 变身超人 电影| 张若昀人之初在线观看| 夺冠免费观看完整版| 顾冠忠金瓶梅| 第十放映室解说词| 高压监狱在线观看完整免费高清原声高烧| 命中注定我爱你剧情分集介绍| 杰西壮志凌云2011全集| 律政俏佳人| 韩剧《爱妾》免费观看全集| 好老婆大联盟国语版| 台湾电影《越南妹》免费观看| 重生弃少短剧全集| 夏日重现动画在线观看| 姐姐妹妹闯北京| 神探高伦布大结局| 粉红女郎电视剧| 土地公土地婆 电视剧| 漆黑的追踪者国语| 潜伏29| 灵幻新娘| 闺蜜2 电影| 义姐不是良妈| 英语老师充足的奶水| 空调维修工人的艳遇在线观看全集 | 《昭和》电影免费观看| 察雅县| 秋瓷炫生死决断完整版在线观看 | 带领村民奔小康:返乡创业全集免费| 修理工的艳遇韩国电影| 雪梨枪4p视频下载| 黑人大巨茎大战欧罗斯两白妞| 黑白潜行2 电影| 《瓜达卢佩的玫瑰》在线观看 | 公的浮之手中字40| 忽而今夏1| 高压监狱法版在线| 王牌保镖电影| 电影安斋拉拉中文字幕| 爱情诊所在线观看| 男医生的特殊治疗电影完整版| 发财秘籍| 《美容院特殊待遇》在线| 绅士们电影完整免费版| 妻子6免费观看完整版电视剧| 蜜雪冰城加盟 官网电话| 总统夫人的夜晚在线观看全集| 跟着书本去旅行纪录片观看完整版| 酒店1-100集全集免费观看高清| 捉妖记电影在线观看| 二对一韩剧| 刘墉下南京豫剧| 我的小哥哥完整版| 规章制度的作用| 《伊波拉病毒第二部在线播放 | 妈妈再我一次| 麻衣传奇国语版| 爸爸当家综艺完整版免费观看 | 人生路不熟高清| 高清《诱人的护士》日本在线观看| 古战场传奇未删减版| 斗龙战士9| 高松惠理| 局内人2| 玛雅 亚洲电影| 全红婵睁眼坐过山车| 锦鲤空间:好运爆棚挡不住短剧全集| 歌剧假面舞会| 成中之城电视剧免费观看| 抗战40集免费观看| julia最好看的一部| 我朋友的丈夫3| 生死速递2| 电视剧马大帅第一部全集播放| 以法之名免费观看| 朱锁锁叶总什么电视剧| 干干人人| 《他为什么依然单身》电视剧| 老男孩父子篇| 名侦探柯南648| 杨恭如被污辱的电影| 地爆天星无删减完整版 | 我要爸爸的种子| 电车魔女| 美国妈妈需要播种在线电影吗| 按摩店待遇5电影| 巜人妻初次按摩2在线观看| 神墓动漫第一季免费观看高清| 神鬼战士1满天星版百度网盘资源| 越狱兔前传| 欧式少女16集全观看战狼6国产少女 | 电影猛龙过江| 二好电影在线播放免费观看| 韩国丽卡| 相爱十年全集| 清冷学长H乖打开腿H男男| 高清《大蛇王》在线观看| 浪漫女家教在线电影| 高中英雄们| 三年成全免费完整版电视剧| 木下和雅| 部长到我家| 七大罪无删减完整版在线观看| 小凤新婚电影手机在线免费观看| 扒灰漂亮儿媳妇| 需要爸爸种子在线| 狼群资源在线高清免费观看| 东京塔之越南女子别动队完整版 | 司藤电视剧在线观看免费完整版| 柳云龙风筝电视剧全集| 李采潭姨母的诱惑| 村妓K8经典网| 庆余年2精彩片段| 在线观看麦乐迪| 独身向前| 《美容院5| 家和万事兴之兄弟姐妹| 坠落女律师完整版在线观看| 电影《度娘》免费观看| 酒店1-75集免费观看全集| 年轻的母亲4在线播放| 妹汁全集在线观看国语| 鲜花盛开的村庄| 我怀了你的孩子电视剧免费观看| 修理工人的艳遇伦理片 | 塞伦意大利1997地爆天星| 朋友的女儿2| 《激战后厨1至5集》精彩原创影评:_酋长的女儿2满天星 | 非缘勿扰 下载| 八部半电影| 热播剧电视剧最近最火在线播放| 好兄弟的女友| 热恋2015| 星克莱尔在线| 姚二嘎吸毒| 铿铿铿锵锵锵锵高清免费观看| 妻子6免费的电视剧完整版| 花姑娘免费观看| 女大学生的美味沙龙| 高雅监狱| 高清《青蛇》电影在线观看| 三年中国高清在线观看| 《课外辅导女教师》电视剧| 爸爸的草鞋吉他谱| 大众女澡堂春光在线播放| 间谍过家家第三季免费观看中文版| 狂飙电视剧全集免费高清播放| 雪中悍刀行电视剧免费观看36集| 飞驰人生1| 默杀 电影| 女超人麦乐迪版本| 狙击手电影| 1996年杨敏思版电视剧第三集| 下水道美人鱼在线| 保罗和雪莉一家第一部| 泸州电视台直播| 军婚开荤粗肉HHHH| 讽刺澳军漫画作者:有空再画一张 青梅竹马是消防员第一季未增删看 | 阿lin| 最新一周立波秀| 魔童降世在线观看| 刚之炼金师| 急诊护士在线观看| 一代枭雄 电视剧| 平凡的荣耀免费观看| 高清《你好 李焕英》电影免费观看 | 两女共侍一夫| 《财阀家的小儿子》电视剧| 星战传说| 泫雅否认曾对同学校园暴力| 骑骑上司妻| 高清《剑雨》电影| 三打白骨精剧情攻略| 修理工的艳遇在线观看完整版| 韩国演艺圈悲惨1-33集| 大侦探福尔摩斯1在线观看| 神州侠侣全集| 光立方程序| 电视剧怒放| 岳池县| 再喊一声爹娘| 曹查理《浪蝶狂花》电影主演| 宝石战士| 铿钢锵锵锵锵锵好多少视频| 澳门风云高清完整版| 苏霞 朱干| 插曲的痛老狼| 凤凰泣血| 爸爸播种子美国电视剧吗英文| 《本能1》原版免费| 一起愁愁愁全集免费观看方法 | 高清《点石成金》电影| 免费在线电影抵债的妻子| 异形:夺命舰 电影| 三民主义歌| 一人之下第四季在线观看| 长沙县| 《伪装者》全集免费高清在线观看| 新金银悔1—5普通话免费| 甜馨回应压岁钱争议| 漂亮的保姆完整版免费观看韩剧| 高压监狱在线观看完整免费高清原声满天星下载 | 幻影英雄| 终结者qvod| 凶降喜讯电影| 神隐40集电视剧免费看| 《热辣滚烫》| 大奉打更人电视剧免费播放| 左右不逢源第二季| 死亡诗社| 爱如几何| 电影红旗谱| 温柔的诱惑电视剧免费完整版| 女销售电影| 辽宁卫视网络直播| 你和我的倾城时光百度云| 惊声尖笑1免费完整版高清| 十二封信| 《炽道》电视剧| 放羊的星星全集土豆| 闸北区| 激情燃烧的岁月主题曲| 伊莱克斯剧场版| 意能之下电视剧免费观看完整版| 十八岁的小妹叫29岁叫什么| 妇科诊室2满天星| 我们的爱情有点疯狂| 永济市| 广场舞茶山情歌| 云上的日子在线| 隋唐英雄全集在线观看| 《水润女人》| 不扣纽扣的女孩| 壮志凌云女版满天星| 子夜归全集38集免费观看| 赤子板《姐妹牙医》百度云| 爱本无罪| 《overflower》第一季真人版| 阿宾游记| 办公室特殊服务在线观看| 阴阳镇怪谈电影在线观看| 《贪婪:欲望之岛》| 霹雳舞2| 入室强奸电影完整版| 一切都值得 张杰| 朱迅的葬礼现场照片| 即刻上场免费观看完整版| 联姻五年后她重生了短剧免费全集| 《住在隔壁的女孩》电视剧| 永生守卫2妹妹归来| 四个妇人精油按摩完整版| 捉妖战记| 金银梅5至10普通话| 坏女孩电影高清完整版| 诱惑:湿身代言| 巜生殖按摩1无删减版电影| 无颜之月1~5集无删减观看策驰| 我爱几何电影免费播放| 我有时候也想成为a片主人公| 新婚上司出差与未婚妻的相处之道| 慈禧太后的秘密| 轩辕剑之天之痕26| 日历女孩韩国电影高清在线观看| 想你21| 苍井空电影在线直播| 播放_刚结婚陪部长出差的日子免费在线观看_看星星电影 | 重生回到刚就业时| 送你一朵小红花在线观看| 《新金莲外传》在线观看| 远大前程2011| 入室女职工被强行糟蹋电影| 绝地枪王电视剧| 莺长女儿全集在线看| 人间世全集免费观看| 强伦轩办公室女教师| 又色又爽又黄无遮挡的免费的软件| 射雕英雄传之降龙十八掌| 继父电影| 电视剧门第下载| 黑暗荣耀第一季无删减在线观看 | 《侏罗纪4:重生》免费播放| 超级教师3免费更新集数| 私人定制在线观看| 和喜玉兰完整版| 美姐妹很很努力| 让子弹飞观看免费完整版| 酒店2| 《今夜不设防》电视剧免费观看| 玉女心经播放| 做aj的剧免费观看| 铿锵锵锵锵免费观看| 狂野时速| 男生女生相愁愁愁电视剧在线观| 饭冈かなこ在线播放| 孔雀舞曲| 秘密女搜查官在线观看免费全集高清| 皇冠之战| 《疯狂动物城2》普通话免费观看| 如果.爱| 恶魔少爷| 小贤和橘子今天的最新视频 | 昆山事件| 战狼6在线观看免费版下载| 电视剧我的特一营| 高清昨天| 美姐妹牙医| 新婚旅行:不伦电影| 《欢乐颂》2免费观看| 爱情公寓2全集百度影音| 家庭密码美国| 芳华解说| 痕迹电视剧| 麦乐迪女超人高清下载| 透明装无内衣秀表演| 一切都值得 张杰| 3对1电影| 超级飞侠15季免费观看全集| 盗墓笔记超级季播剧| 玉门市| 马斯克不断被儿子打脑袋| 年轻丰满的在线播放免费观看| 踏血寻梅电影| 高压监狱第二部在线观看完整免费高清原声满天星 | 高清《顽主》| 赤板栗牙医姐妹1986在线观看| 三生三世枕上 书| 锁定美军特使下载| 公之浮之手5中字义父| 黑执事第2季| 追龙 粤语| 傲娇小姑娘中文版| 《丈夫叫妻子陪上司睡HD| 盗墓笔记 谜海归巢| 十万个冷笑话9集| 4个日本混血大学生精油按摩| 釜山行2国语高清版在线观看| 履霜坚冰至| 《需要爸爸种子》英文翻译| 女超人满天星版麦乐迪第一季| 龙门镖局 影音| 丰满的邻居2在线观看完整免费版| 黑白配国语免费观看高清| 再见了悲伤| 《新入职的女员工》| 金瓶双艳电视剧免费观看全集高清| 《玫瑰》瓜达卢佩在线播放免费观看 | 我怀了你的孩子第7集免费| 丛林肉搏4.5团该干嘛| 哥布林的窑洞免费观看| 独行月球在线观看| 锵锵锵免费完整观看| 电影大追捕| 十二猴子| 《乳房》特殊按摩电影| 《真实》崔雪莉多少秒出场| 6帕克禁忌| 亲爱的电视剧免费播放| 南靖县| 白峰美羽在线看| 命中注定我爱你20| 《扒皮割奶》电影免费观看| 生死决裂秋瓷炫高清完整版| 兴风作浪电影| 汪建民称愿与女方对质| 韩剧 2014| 美丽教师未删减完整免费观看| 美国电影美丽小樱桃免费观看| 小妈妈电影| 法国电影《卖百科全书》在线| 家有公婆在线观看| 少女农场| 高清《恶意》电影| 初体验5在线观看| 火口的两人全集免费观看| 黑白配中文在线观看| 大丫鬟大结局| 高清《手机》免费观看全集| 营盘镇的警事| 使徒行者粤语15| 广场舞玫瑰花开| 上海滩黄晓明版| 受益人 电影| 东方卫视广告| 法国空乘11未删减版在线观看| 3d肉蒲电影在线观看| 战狼6高清国语免费观看影视大全下载什么借钱平台好的 | 穿越火线在线观看免费完整版| 狂飙风云短剧免费观看| 和女部长一起去公司研学日剧叫什么| 山海情全剧免费观看| 模范出租车电视剧第一季| 益达广告完整版白百合| 女超人麦乐迪A片未删减版免费观看| 狂飙电视剧免费播放| 发法国空姐4| 不穿内裤的女教师在线观看| 空调维修工人的艳遇在线观看全集 | 爱我几何无删减版在线观看| 千年情人| 《女员工的滋味》2| 上流复仇| 剑道尘心剧场版免费播放| 二十世纪性格与x爱情| 瓦尼塔斯的手记动漫全集免费| 鬼子暴行少女电影VCD正片| 新济公活佛 电视剧| 亲爱的小孩 电视剧| 3d版玉蒲团| 三叉戟2在线看| 善良的秘书的目的在线| 美丽传说| 打雀英雄传| 热浪滚汤在线观看| 《夕颜》动漫全集在线观看完整版中| 好姑娘1免费观看完整版中文| 爱的释放电影完整版在线观看 | 新僵尸先生 电影| 妈妈爱上儿子同学1~2集| 小敏家电视剧免费版全集在线观看| 奇迹笨小孩电影免费高清在线观看| 需要爸爸播种2手机播放美国电影| 妖兽都市动漫| 《产科医生》电视剧40集| 高清《判处勇者刑》电视剧| 斗破苍穹第175集免费播放| 蓝色帽子隐形的韩国电影在线观看 | 女超人:麦乐迪》| 废柴嫡女:逆天改命飒爆了短剧全集 | 隋唐演义电视剧免费观看| 广场舞最美西藏| 亲爱的妈妈3高清HD| 乡村爱情小夜曲在线观看| 半神之境动漫免费观看全集| 图书馆的女朋友在线观看动漫完整免费版电视剧第六集 | 展昭艳史下载| 江苏体育台| 危情在线播放| 美国电影《小辣椒3》| 罪恶部队| 猪哥亮与朱慧珍| melody在线电影免费观看| 你好 李焕英 在线播放| 想爱就爱1电影| 视频电影在线观看免费观看完整版| 恶魔的请柬| 莫妮卡爱我几何在线观看全集免费播放| 电影国家元首| 电视剧西出玉门在线观看| 未知| 寂静法师| 晋州市| 不安于室短剧免费观看| 归路连续剧| 金银悔1-5手机版免费下载安装| 聚会的目的在线观看bd高清| 《房奴试爱》开头原声| 薛刚反唐评书| 潘金莲电视剧1至5集| 我的错误在线观看免费完整版电影| 有匪电视剧在线观看全集| (女学生的滋味)HD| WRITEAS幼童| 摇滚水果 电影| 第一滴血女版满天星电影在线观看 | 《需要爸爸播种子》免费观看在线播放_HD/未删减_1080P高清电影完整版 - 天堂 | 白头神探1高清在线观看免费完整版| 天地粮人电视剧| 朴诗妍韩国电影| 云裳广场舞爱情果| 美国伦理《生殖按摩》在线| 张靓颖 奥普拉| 大真探怪兽之谜3| 高清《西游记:女儿国》电影| 爱情悠悠药草香演员表| 睡美人1999版美国| 电视剧平凡之路| 美姊妹牙医| 苹果范冰冰| 美姐妹牙医在线电影观看完整版高清| 广场舞故乡的云| 盲山免费| 中国女曲和比利时女曲冲突| 年轻的家长3| 毒医肥尸电影未删减版在线观看| 非诚勿扰加长版| 部长来做客HD中字| 夜店美女跳舞| 新郎十八岁| 美容店的待遇5HD韩国三级片| 偶像练系生| 暗黑森林满天星版美国| 上错花轿嫁错郎| 武侠免费| 德国女子亲卫队满天星1973在线观看| 同桌上课揉我下面好湿H| 我和我的房东| 神医小娇妻全集免费| 黑帮大佬的365天第三季在线播放 电影朋友的妈妈在线观看 | 青山是故乡| 和丈夫的部下玩火的夜晚HD无字_经典电影_手机完整版在线观看_纤纤影院 | 沉睡谷第二季| 生化危机终章在线观看| 双人调情按摩伦理片| 邪恶游戏| 那些年我们一起追过的女孩电影| 战狼5欧美版免费观看完整版国语百度 | 李采潭的电影全集在线观看| 韩剧国语版求婚| 女人的战争2新婚快乐| 聊斋之辛十四娘| 青春派 电影完整版| 方块大背头| 你懂得369手机看片| 养母的花样年华演员表| 尖峰时刻 3| 入室强奸初中生免费观看| 电视剧迷雾重重| 汕尾市| 死神来了7高清完整在线观看| 尖峰时刻3国语高清| 酒店激战3-12集全集播放再来一次好吗| 一江春水向东流| 三年大片国语完整版| 那年花开月正圆免费| 开门红扇子舞| 《法国空乘5》无删减观看| 壮志凌云女飞行员版本| 错位温情短剧免费观看| 售楼部小姐的秘密在线观看| 娃娃解说| 高清《恋爱女子宿舍》| overflower完整版| 龙与虎下载| 特利迦奥特曼中文版| 新婚之喜台湾版主演| 多大的雪才算暴雪| 瑞士航空空姐4| 安徽泗县地图| 平潭县| 年轻的继拇 主演| 以父之名| 未完全侦探| 《家属》| 飞哥与小佛全集免费观看| 郭德纲枪毙任老道| 放学后的屋顶国语| 我来也高清| 麦乐迪《家庭矛盾》在线播放| 莫少琳电影全部免费播放| 广场舞花好月圆夜| 滚烫公媳全集免费观看电视剧| 中文字幕DI岳 和女胥视频| 大地8中文在线观看免费高清成全 禁止的爱 免费观看 百度百度 | 恨你无情泪水滴原唱| 女版战狼6三人| 富豪的女儿| 你给老子不上班| 发法国空姐4| 兔子更喜欢哪种食物| 电视剧青春无季免费观看西瓜影视| 四个妇人精油和按摩电影| 欢乐家长群2电视剧免费播放完整版| 天下第一大结局| 王在山轻音乐团| 哇嘎在线观看视频| 小丑免费| 韩国电影《美人》| 小巷人家40集全部播放目录| 《求佛》po| 男女一起愁愁愁免费看| 好久不见结局| 赛尔号第二季全集| 甜美姐姐动漫全集| 金战演员表| 《逆爱》1-24集全| 爱我几何原版完整版| 云盘镇警事| 叶罗丽第十一季在线观看| 夫妻的世界完整版免费观看| overflower第一季在线观看免费全集| 绝对权力电视剧全集免费观看在线| 天网追踪电视剧| 电影《姐妹牙医》完整版哪里可以看| 茶啊二中电影免费观看完整版高清| 监禁姐妹教师| 海豚人图片| 美国式禁忌国语| 第22条婚约| 敦煌夜谭| 哇嘎嘎在线电影观看| 罪恶部队| 内衣公司动漫第4集| 《新上任的秘书》演员表| 伦理《私人护士》| 年轻善良的岳母| 不期而遇免费观看全集| 北京青年土豆网| 《哪吒2:魔童闹海》免费观看 | 韩剧《女儿》| 粉红满天星36| 1dldss00361当我打电话叫应召女郎时,我发现了一个高傲的大胸秘书......在办公 | 带美影视影院-《妻子做社长秘书偿还债务》新版-最新完整版高清在线观看 | 父母爱情免费观看| 爱我几何电影完整版高清免费观看| 熊出没之年货全集| 电视剧抗战奇侠| 漂亮妈妈开家长会| 放荡的女人2| 日本一月出现两次死鱼潮| 大学生爬火车拍照被烧伤进ICU| 高清《谍战深海之惊蛰》| 《推拿男医生》免费观看全集| gogo高清在线| 宫斗之步步为升短剧全集| 品三国mp3| 巜性刑房3捆绑凌虐电影免费观看| 年轻的母亲6在线完整中文| 广场舞西海情歌| 姐妹牙医电影完整版观看| 《女教师3》在线观看| 高清《谋杀的滋味》电视剧| 美和花园电影免费观看2023年上映的| 联手复仇虐渣:双胞胎姐妹全集免费| 卧底48天全集在线看| 台湾犯罪故事| 漂白在线播放| 别当欧尼酱了动画第一季免费观看| 《需要爸爸播种子》电影免费在线观看,高清完整版美国倫理片_屠夫电影网 | 解放的潘多拉免费观看高清版| 拆弹专家2免费观看完整版| 女超人麦乐迪无删减版在线播放| 赵甲第电视剧在线观看| 伸冤人3 在线观看| 朴亚珍《蓝色隐身帽》全集| 雪中悍刀行第二季免费观看超清| 我和我的传奇| 专家建议对50万以上存款收税| 风流岁月全集| 《妻子5》免费高清电视剧| 《特殊游泳教练》完整版》 - 国语剧情手机免费观看... 韩国其它2017很 | 都市小神医短剧全集| 牛郎织女电影| 一本一道素人竹内纱里奈在线| 凯·帕克《迷宫》| 妻子的肉体偿还在线播放| 牧神记在线观看完整版| 绝世网红韩剧| 法证先锋4粤语版免费观看完整版| 黑白配高清在线免费观看| 绝密543电视剧| 高清我们是坏蛋理发师未删减| 炼气十万年短剧免费观看| 新文件夹建2| 人猿泰山未删减版1991劳拉| 美式忌讳5--7| 只想和你睡(1v 1)| 废柴嫡女:逆天修仙飒爆了全集免费 | 蜜桃成熟时33d ed2k| 高清《猎杀之后》电影| 木子凛子电影免费观看| 白色城堡电视剧在线观看免| 锦绣繁华电视剧免费观看全集高清 | 恋爱结婚| 狂飙高清在线观看| 父母爱情在线观看全集完整版电视剧| 禁止的爱在线观看 国语版| 男生女生一愁愁愁电视剧在线观30分钟 | 天天碰天天摸| 湘北曾姨百家号| 喜迎十大手抄报简单又漂亮| 《爱我几何》正版| ova邪娠娼馆在线观看| 我成了他的班主任| 八十八佛忏悔文唱诵| 金牌售楼销售的秘密5HD中字| 复仇者联盟4在线| 男女电视剧演员表免费观看| 法国满天星《律师事务所》| 折腰在线免费观看电视剧| 电影婚戒| 寂静岭p.t| 天蓝蓝 凤凰传奇| 你的名字重映2024| 曹老板的18个秘书续集| 侯门嫡女谋略:定乾坤短剧全集 | 《终极斗士1》电影免费观看| 怒晴湘西电视剧全集免费观看| 死亡遗迹之谜| 金银悔1-5集免费观看| 花蝴蝶4免费版大全多少集天气 | 神之晚餐全集在线观看| 京城李公子是谁| 插曲的痛60全集免费观看高清版在线观看 | 巨人新娘的花嫁2免费观看| 无名之辈电影高清免费 | 铁血使命第2部全集| 电影《补课》免费观看中文版| 韩国美容店的待遇5HD| 新有菜在线观看视频| 主妇的战争电视剧免费观看全集 | 二十四史白话文| 坎贝奇的品味人生完整版| 《特殊理发店| 月光光心慌慌7| 芈月传电视剧免费观看全集| 82版杨敏思版本1-5电视剧免费观看 | 美乃雀电影手机看| 小凤新婚下集| 吃鸡的段位等级排列顺序| 我的后半生免费观看全集| 仙剑4配音版| 恶行之外电影| 电影代理丈夫满足妻子| 还珠格格风儿阵阵吹| 牛郎织女电影| 国乒女单无缘亚锦赛四强| 向阳花电影在线观看免费版 | 人世间在线观看免费完整版高清| 极速车魂 第三季| 阮清槐薄斯珩| 电影塔日酒店免费观看| 色即是空2迅雷下载| 女狱警被躁BD在线观看| 麦乐蒂女超人满天星| 妈妈不哭| 孟瑶 三级| 崇文区| 替夫还债电影高清完整版| 美艳在线观看无修版ova| 百妖谱5什么时候出| 怀玉格格| 黑白配高清国语在线观看| 女律师被拖进房间糟蹋HD | 重生八零:俏媳妇致富经短剧全集 | 雪中悍刀行在线免费观看| 世界冲击影像社| 扫黑风暴全集免费观看完整版| 疯狂小女生法国版| 房奴试爱开头电视剧原声| 机械哥斯拉| 电视剧22条婚规| 龙年图片壁纸| 鬼父在线观看视频| 需要爸爸播种在线观看免费高清完整泰剧 | 大尺度动作片| 寻找所罗门王的宝藏| 销售的秘密2在线观看免费版| 瓜达卢佩玫瑰在线播放| 斗破苍穹年番第四集在线观看| 电影《维和防暴队》| 奥特曼八兄弟国语版| 电影《外出》在线观看| 《摩登家庭》满天星| 水润女人在线观看电视剧免费| 开心姐姐在美国| 灵魂摆渡 电视剧| 黄金渔场130605| 《请回答1988 十周年MT》| 孽恋狂情| 荣誉代号法版免费观看| xl司令动漫第一季全集在线观看免费播放动漫 | 罗马的房子在线观看| 地狱来的芳邻| 向井蓝之特别护理的进展和趋势| 韩国好姑娘| 你的婚礼资源| 湄公河行动在线观看| 落落历险记| 国庆阅兵背景音乐| 人猿泰山《激战丛林》电影在线观看| 四个少妇去按摩| 别叫我情圣在线观看| 韩国综艺情书第三季| 美国式禁忌4百度影音| 暴力监狱| 出生入死电视连续剧| 安姨售楼女王电影在线观看| 痰多最怕一味药| 我结中国版| 电视剧咱们结婚吧全集| 天生一对印度| b哥全集| 女友的妈妈双字id推荐| 《千金赤子板栗》完整| 这他妈才是爱情伴奏| 寒武纪电视剧免费全集在线观看| 免费李宗瑞全集在线观看| 肉蒲团高清迅雷下载| 唐古拉风暴| 吉普赛女王| 和部长一起去出差旅的日子电影| 夏日诱惑无删减版| 胶囊旅馆未删减版樱花| 市委书记晚上不打招呼调研被拦 | 天龙八部43| 巴厘岛的故事电视剧免费观看全集| 巴黎恋歌| 巜生殖按摩1无删减版电影|