• <track id="oztn4"></track>
    <sup id="oztn4"><form id="oztn4"></form></sup>
    
    
    <mark id="oztn4"></mark>
  • <dfn id="oztn4"><samp id="oztn4"></samp></dfn>
      《地爆天星小姐》电影 ,麦子交换2免费观看2023年上映时间表 ,莫妮卡《爱我几何》,大牛影库战狼6欧式少女全部视频,三年大片国语版在线看,日本空姐电视剧,电影魔镜号中文字幕,和部长一起去出差旅是第几集
      全球「AI學術頂會」精華匯聚地
      您正在使用IE低版瀏覽器,為了您的雷峰網賬號安全和更好的產品體驗,強烈建議使用更快更安全的瀏覽器
      此為臨時鏈接,僅用于文章預覽,將在時失效
      人工智能 正文
      發私信給AI研習社
      發送

      0

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      本文作者: AI研習社 2017-03-17 19:31
      導語:作者第一次參加Kaggle,在 2125 個參賽隊伍中排名第 98 位(~ 5%),本文為他根據自己第一次比賽的經驗總結,給新手們提供一些參考

      雷鋒網按:本文作者章凌豪,復旦大學計算機科學專業。有興趣的同學可以移步他的個人主頁:Linghao Zhang

      Introduction

      Kaggle 是目前最大的 Data Scientist 聚集地。很多公司會拿出自家的數據并提供獎金,在 Kaggle 上組織數據競賽。我最近完成了第一次比賽,在 2125 個參賽隊伍中排名第 98 位(~ 5%)。因為是第一次參賽,所以對這個成績我已經很滿意了。在 Kaggle 上一次比賽的結果除了排名以外,還會顯示的就是 Prize Winner,10% 或是 25% 這三檔。所以剛剛接觸 Kaggle 的人很多都會以 25% 或是 10% 為目標。在本文中,我試圖根據自己第一次比賽的經驗和從其他 Kaggler 那里學到的知識,為剛剛聽說 Kaggle 想要參賽的新手提供一些切實可行的沖刺 10% 的指導。

      本文的英文版見這里。

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      Kaggler 絕大多數都是用 Python 和 R 這兩門語言的。因為我主要使用 Python,所以本文提到的例子都會根據 Python 來。不過 R 的用戶應該也能不費力地了解到工具背后的思想。

      首先簡單介紹一些關于 Kaggle 比賽的知識:

      • 不同比賽有不同的任務,分類、回歸、推薦、排序等。比賽開始后訓練集和測試集就會開放下載。

      • 比賽通常持續 2 ~ 3 個月,每個隊伍每天可以提交的次數有限,通常為 5 次。

      • 比賽結束前一周是一個 Deadline,在這之后不能再組隊,也不能再新加入比賽。所以想要參加比賽請務必在這一 Deadline 之前有過至少一次有效的提交。

      • 一般情況下在提交后會立刻得到得分的反饋。不同比賽會采取不同的評分基準,可以在分數欄最上方看到使用的評分方法。

      • 反饋的分數是基于測試集的一部分計算的,剩下的另一部分會被用于計算最終的結果。所以最后排名會變動。

      • LB 指的就是在 Leaderboard 得到的分數,由上,有 Public LB 和 Private LB 之分。

      • 自己做的 Cross Validation 得到的分數一般稱為 CV 或是 Local CV。一般來說 CV 的結果比 LB 要可靠。

      • 新手可以從比賽的 Forum 和 Scripts 中找到許多有用的經驗和洞見。不要吝嗇提問,Kaggler 都很熱情。

      那么就開始吧!

      P.S. 本文假設讀者對 Machine Learning 的基本概念和常見模型已經有一定了解。 Enjoy Reading!

      General Approach

      在這一節中我會講述一次 Kaggle 比賽的大致流程。

      Data Exploration

      在這一步要做的基本就是 EDA (Exploratory Data Analysis),也就是對數據進行探索性的分析,從而為之后的處理和建模提供必要的結論。

      通常我們會用 pandas 來載入數據,并做一些簡單的可視化來理解數據。

      Visualization

      通常來說 matplotlib 和 seaborn 提供的繪圖功能就可以滿足需求了。

      比較常用的圖表有:

      • 查看目標變量的分布。當分布不平衡時,根據評分標準和具體模型的使用不同,可能會嚴重影響性能。

      • 對 Numerical Variable,可以用 Box Plot 來直觀地查看它的分布。

      • 對于坐標類數據,可以用 Scatter Plot 來查看它們的分布趨勢和是否有離群點的存在。

      • 對于分類問題,將數據根據 Label 的不同著不同的顏色繪制出來,這對 Feature 的構造很有幫助。

      • 繪制變量之間兩兩的分布和相關度圖表。

      這里有一個在著名的 Iris 數據集上做了一系列可視化的例子,非常有啟發性。

      Statistical Tests

      我們可以對數據進行一些統計上的測試來驗證一些假設的顯著性。雖然大部分情況下靠可視化就能得到比較明確的結論,但有一些定量結果總是更理想的。不過,在實際數據中經常會遇到非 i.i.d. 的分布。所以要注意測試類型的的選擇和對顯著性的解釋。

      在某些比賽中,由于數據分布比較奇葩或是噪聲過強,Public LB 的分數可能會跟Local CV 的結果相去甚遠。可以根據一些統計測試的結果來粗略地建立一個閾值,用來衡量一次分數的提高究竟是實質的提高還是由于數據的隨機性導致的。

      Data Preprocessing

      大部分情況下,在構造 Feature 之前,我們需要對比賽提供的數據集進行一些處理。通常的步驟有:

      • 有時數據會分散在幾個不同的文件中,需要 Join 起來。

      • 處理 Missing Data。

      • 處理 Outlier

      • 必要時轉換某些 Categorical Variable 的表示方式。

      • 有些 Float 變量可能是從未知的 Int 變量轉換得到的,這個過程中發生精度損失會在數據中產生不必要的 Noise,即兩個數值原本是相同的卻在小數點后某一位開始有不同。這對 Model 可能會產生很負面的影響,需要設法去除或者減弱 Noise。

      這一部分的處理策略多半依賴于在前一步中探索數據集所得到的結論以及創建的可視化圖表。在實踐中,我建議使用 iPython Notebook 進行對數據的操作,并熟練掌握常用的 pandas 函數。這樣做的好處是可以隨時得到結果的反饋和進行修改,也方便跟其他人進行交流(在 Data Science 中 Reproducible Results 是很重要的)。

      下面給兩個例子。

      Outlier

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      這是經過 Scaling 的坐標數據??梢园l現右上角存在一些離群點,去除以后分布比較正常。

      Dummy Variables

      對于 Categorical Variable,常用的做法就是 One-hot encoding。即對這一變量創建一組新的偽變量,對應其所有可能的取值。這些變量中只有這條數據對應的取值為 1,其他都為 0。

      如下,將原本有 7 種可能取值的 Weekdays 變量轉換成 7 個 Dummy Variables。

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      要注意,當變量可能取值的范圍很大(比如一共有成百上千類)時,這種簡單的方法就不太適用了。這時沒有有一個普適的方法,但我會在下一小節描述其中一種。

      Feature Engineering

      有人總結 Kaggle 比賽是 “Feature 為主,調參和 Ensemble 為輔”,我覺得很有道理。Feature Engineering 能做到什么程度,取決于對數據領域的了解程度。比如在數據包含大量文本的比賽中,常用的 NLP 特征就是必須的。怎么構造有用的 Feature,是一個不斷學習和提高的過程。

      一般來說,當一個變量從直覺上來說對所要完成的目標有幫助,就可以將其作為 Feature。至于它是否有效,最簡單的方式就是通過圖表來直觀感受。比如:

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      Feature Selection

      總的來說,我們應該生成盡量多的 Feature,相信 Model 能夠挑出最有用的 Feature。但有時先做一遍 Feature Selection 也能帶來一些好處:

      Feature 越少,訓練越快。

      有些 Feature 之間可能存在線性關系,影響 Model 的性能。

      通過挑選出最重要的 Feature,可以將它們之間進行各種運算和操作的結果作為新的 Feature,可能帶來意外的提高。

      Feature Selection 最實用的方法也就是看 Random Forest 訓練完以后得到的Feature Importance 了。其他有一些更復雜的算法在理論上更加 Robust,但是缺乏實用高效的實現,比如這個。從原理上來講,增加 Random Forest 中樹的數量可以在一定程度上加強其對于 Noisy Data 的 Robustness。

      看 Feature Importance 對于某些數據經過脫敏處理的比賽尤其重要。這可以免得你浪費大把時間在琢磨一個不重要的變量的意義上。

      Feature Encoding

      這里用一個例子來說明在一些情況下 Raw Feature 可能需要經過一些轉換才能起到比較好的效果。

      假設有一個 Categorical Variable 一共有幾萬個取值可能,那么創建 Dummy Variables 的方法就不可行了。這時一個比較好的方法是根據 Feature Importance 或是這些取值本身在數據中的出現頻率,為最重要(比如說前 95% 的 Importance)那些取值(有很大可能只有幾個或是十幾個)創建 Dummy Variables,而所有其他取值都歸到一個“其他”類里面。

      Model Selection

      準備好 Feature 以后,就可以開始選用一些常見的模型進行訓練了。Kaggle 上最常用的模型基本都是基于樹的模型:

      • Gradient Boosting

      • Random Forest

      • Extra Randomized Trees

      以下模型往往在性能上稍遜一籌,但是很適合作為 Ensemble 的 Base Model。這一點之后再詳細解釋。(當然,在跟圖像有關的比賽中神經網絡的重要性還是不能小覷的。)

      • SVM

      • Linear Regression

      • Logistic Regression

      • Neural Networks

      以上這些模型基本都可以通過 sklearn 來使用。

      當然,這里不能不提一下 Xgboost。Gradient Boosting 本身優秀的性能加上Xgboost 高效的實現,使得它在 Kaggle 上廣為使用。幾乎每場比賽的獲獎者都會用 Xgboost 作為最終 Model 的重要組成部分。在實戰中,我們往往會以 Xgboost 為主來建立我們的模型并且驗證 Feature 的有效性。順帶一提,在 Windows 上安裝 Xgboost 很容易遇到問題,目前已知最簡單、成功率最高的方案可以參考我在這篇帖子中的描述。

      Model Training

      在訓練時,我們主要希望通過調整參數來得到一個性能不錯的模型。一個模型往往有很多參數,但其中比較重要的一般不會太多。比如對 sklearn 的 RandomForestClassifier 來說,比較重要的就是隨機森林中樹的數量 n_estimators 以及在訓練每棵樹時最多選擇的特征數量 max_features。所以我們需要對自己使用的模型有足夠的了解,知道每個參數對性能的影響是怎樣的。

      通常我們會通過一個叫做 Grid Search 的過程來確定一組最佳的參數。其實這個過程說白了就是根據給定的參數候選對所有的組合進行暴力搜索。

      1  param_grid = {'n_estimators': [300, 500], 'max_features': [10, 12, 14]}

      2  model = grid_search.GridSearchCV(estimator=rfr, param_grid=param_grid, n_jobs=1, cv=10, verbose=20, scoring=RMSE)

      3  model.fit(X_train, y_train)

      順帶一提,Random Forest 一般在 max_features 設為 Feature 數量的平方根附近得到最佳結果。

      這里要重點講一下 Xgboost 的調參。通常認為對它性能影響較大的參數有:

      • eta:每次迭代完成后更新權重時的步長。越小訓練越慢。

      • num_round:總共迭代的次數。

      • subsample:訓練每棵樹時用來訓練的數據占全部的比例。用于防止 Overfitting。

      • colsample_bytree:訓練每棵樹時用來訓練的特征的比例,類似 RandomForestClassifier 的 max_features。

      • max_depth:每棵樹的最大深度限制。與 Random Forest 不同,Gradient Boosting 如果不對深度加以限制,最終是會 Overfit 的。

      • early_stopping_rounds:用于控制在 Out Of Sample 的驗證集上連續多少個迭代的分數都沒有提高后就提前終止訓練。用于防止 Overfitting。

      一般的調參步驟是:

      1. 將訓練數據的一部分劃出來作為驗證集。

      2. 先將 eta 設得比較高(比如 0.1),num_round 設為 300 ~ 500。

      3. 用 Grid Search 對其他參數進行搜索

      4. 逐步將 eta 降低,找到最佳值。

      5. 以驗證集為 watchlist,用找到的最佳參數組合重新在訓練集上訓練。注意觀察算法的輸出,看每次迭代后在驗證集上分數的變化情況,從而得到最佳的early_stopping_rounds。

      1  X_dtrain, X_deval, y_dtrain, y_deval = cross_validation.train_test_split(X_train, y_train, random_state=1026, test_size=0.3)

      2  dtrain = xgb.DMatrix(X_dtrain, y_dtrain)

      3  deval = xgb.DMatrix(X_deval, y_deval)

      4  watchlist = [(deval, 'eval')]

      5  params = {

      6                 'booster': 'gbtree',

      7                 'objective': 'reg:linear',

      8                  'subsample': 0.8,

      9                  'colsample_bytree': 0.85,

      10                'eta': 0.05,

      11                 'max_depth': 7,

      12                'seed': 2016,

      13               'silent': 0,

      14               'eval_metric': 'rmse'

      15  }

      16  clf = xgb.train(params, dtrain, 500, watchlist, early_stopping_rounds=50)

      17  pred = clf.predict(xgb.DMatrix(df_test))

      最后要提一點,所有具有隨機性的 Model 一般都會有一個 seed 或是 random_state 參數用于控制隨機種子。得到一個好的 Model 后,在記錄參數時務必也記錄下這個值,從而能夠在之后重現 Model。

      Cross Validation

      Cross Validation 是非常重要的一個環節。它讓你知道你的 Model 有沒有 Overfit,是不是真的能夠 Generalize 到測試集上。在很多比賽中 Public LB 都會因為這樣那樣的原因而不可靠。當你改進了 Feature 或是 Model 得到了一個更高的 CV 結果,提交之后得到的 LB 結果卻變差了,一般認為這時應該相信 CV 的結果。當然,最理想的情況是多種不同的 CV 方法得到的結果和 LB 同時提高,但這樣的比賽并不是太多。

      在數據的分布比較隨機均衡的情況下,5-Fold CV 一般就足夠了。如果不放心,可以提到 10-Fold。但是 Fold 越多訓練也就會越慢,需要根據實際情況進行取舍。

      很多時候簡單的 CV 得到的分數會不大靠譜,Kaggle 上也有很多關于如何做 CV 的討論。比如這個。但總的來說,靠譜的 CV 方法是 Case By Case 的,需要在實際比賽中進行嘗試和學習,這里就不再(也不能)敘述了。

      Ensemble Generation

      Ensemble Learning 是指將多個不同的 Base Model 組合成一個 Ensemble Model 的方法。它可以同時降低最終模型的 Bias 和 Variance(證明可以參考這篇論文,我最近在研究類似的理論,可能之后會寫新文章詳述),從而在提高分數的同時又降低 Overfitting 的風險。在現在的 Kaggle 比賽中要不用 Ensemble 就拿到獎金幾乎是不可能的。

      常見的 Ensemble 方法有這么幾種:

      • Bagging:使用訓練數據的不同隨機子集來訓練每個 Base Model,最后進行每個 Base Model 權重相同的 Vote。也即 Random Forest 的原理。

      • Boosting:迭代地訓練 Base Model,每次根據上一個迭代中預測錯誤的情況修改訓練樣本的權重。也即 Gradient Boosting 的原理。比 Bagging 效果好,但更容易 Overfit。

      • Blending:用不相交的數據訓練不同的 Base Model,將它們的輸出?。訖啵┢骄?。實現簡單,但對訓練數據利用少了。

      • Stacking:接下來會詳細介紹。

      從理論上講,Ensemble 要成功,有兩個要素:

      • Base Model 之間的相關性要盡可能的小。這就是為什么非 Tree-based Model 往往表現不是最好但還是要將它們包括在 Ensemble 里面的原因。Ensemble 的 Diversity 越大,最終 Model 的 Bias 就越低。

      • Base Model 之間的性能表現不能差距太大。這其實是一個 Trade-off,在實際中很有可能表現相近的 Model 只有寥寥幾個而且它們之間相關性還不低。但是實踐告訴我們即使在這種情況下 Ensemble 還是能大幅提高成績。

      Stacking

      相比 Blending,Stacking 能更好地利用訓練數據。以 5-Fold Stacking 為例,它的基本原理如圖所示:

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      整個過程很像 Cross Validation。首先將訓練數據分為 5 份,接下來一共 5 個迭代,每次迭代時,將 4 份數據作為 Training Set 對每個 Base Model 進行訓練,然后在剩下一份 Hold-out Set 上進行預測。同時也要將其在測試數據上的預測保存下來。這樣,每個 Base Model 在每次迭代時會對訓練數據的其中 1 份做出預測,對測試數據的全部做出預測。5 個迭代都完成以后我們就獲得了一個 #訓練數據行數 x #Base Model 數量 的矩陣,這個矩陣接下來就作為第二層的 Model 的訓練數據。當第二層的 Model 訓練完以后,將之前保存的 Base Model 對測試數據的預測(因為每個 Base Model 被訓練了 5 次,對測試數據的全體做了 5 次預測,所以對這 5 次求一個平均值,從而得到一個形狀與第二層訓練數據相同的矩陣)拿出來讓它進行預測,就得到最后的輸出。

      這里給出我的實現代碼:

      1  class Ensemble(object):

      2        def __init__(self, n_folds, stacker, base_models):

      3             self.n_folds = n_folds

      4             self.stacker = stacker

      5            self.base_models = base_models

      6      def fit_predict(self, X, y, T):

      7           X = np.array(X)

      8          y = np.array(y)

      9          T = np.array(T)

      10        folds = list(KFold(len(y), n_folds=self.n_folds, shuffle=True, random_state=2016))

      11       S_train = np.zeros((X.shape[0], len(self.base_models)))

      12       S_test = np.zeros((T.shape[0], len(self.base_models)))

      13       for i, clf in enumerate(self.base_models):

      14      S_test_i = np.zeros((T.shape[0], len(folds)))

      15      for j, (train_idx, test_idx) in enumerate(folds):

      16           X_train = X[train_idx]

      17           y_train = y[train_idx]

      18           X_holdout = X[test_idx]

      19          # y_holdout = y[test_idx]

      20         clf.fit(X_train, y_train)

      21         y_pred = clf.predict(X_holdout)[:]

      22         S_train[test_idx, i] = y_pred

      23         S_test_i[:, j] = clf.predict(T)[:]

      24         S_test[:, i] = S_test_i.mean(1)

      25     self.stacker.fit(S_train, y)

      26     y_pred = self.stacker.predict(S_test)[:]

      27    return y_pred

      獲獎選手往往會使用比這復雜得多的 Ensemble,會出現三層、四層甚至五層,不同的層數之間有各種交互,還有將經過不同的 Preprocessing 和不同的 Feature Engineering 的數據用 Ensemble 組合起來的做法。但對于新手來說,穩穩當當地實現一個正確的 5-Fold Stacking 已經足夠了。

      *Pipeline

      可以看出 Kaggle 比賽的 Workflow 還是比較復雜的。尤其是 Model Selection 和 Ensemble。理想情況下,我們需要搭建一個高自動化的 Pipeline,它可以做到:

      • 模塊化 Feature Transform,只需寫很少的代碼就能將新的 Feature 更新到訓練集中。

      • 自動化 Grid Search,只要預先設定好使用的 Model 和參數的候選,就能自動搜索并記錄最佳的 Model。

      • 自動化 Ensemble Generation,每個一段時間將現有最好的 K 個 Model 拿來做 Ensemble。

      對新手來說,第一點可能意義還不是太大,因為 Feature 的數量總是人腦管理的過來的;第三點問題也不大,因為往往就是在最后做幾次 Ensemble。但是第二點還是很有意義的,手工記錄每個 Model 的表現不僅浪費時間而且容易產生混亂。

      Crowdflower Search Results Relevance 的第一名獲得者 Chenglong Chen 將他在比賽中使用的 Pipeline 公開了,非常具有參考和借鑒意義。只不過看懂他的代碼并將其中的邏輯抽離出來搭建這樣一個框架,還是比較困難的一件事。可能在參加過幾次比賽以后專門抽時間出來做會比較好。

      Home Depot Search Relevance

      在這一節中我會具體分享我在 Home Depot Search Relevance 比賽中是怎么做的,以及比賽結束后從排名靠前的隊伍那邊學到的做法。

      首先簡單介紹這個比賽。Task 是判斷用戶搜索的關鍵詞和網站返回的結果之間的相關度有多高。相關度是由 3 個人類打分取平均得到的,每個人可能打 1 ~ 3 分,所以這是一個回歸問題。數據中包含用戶的搜索詞,返回的產品的標題和介紹,以及產品相關的一些屬性比如品牌、尺寸、顏色等。使用的評分基準是 RMSE

      這個比賽非常像 Crowdflower Search Results Relevance 那場比賽。不過那邊用的評分基準是 Quadratic Weighted Kappa,把 1 誤判成 4 的懲罰會比把 1 判成 2 的懲罰大得多,所以在最后 Decode Prediction 的時候會更麻煩一點。除此以外那次比賽沒有提供產品的屬性。

      EDA

      由于加入比賽比較晚,當時已經有相當不錯的 EDA 了。尤其是這個。從中我得到的啟發有:

      • 同一個搜索詞/產品都出現了多次,數據分布顯然不 i.i.d.。

      • 文本之間的相似度很有用。

      • 產品中有相當大一部分缺失屬性,要考慮這會不會使得從屬性中得到的 Feature 反而難以利用。

      • 產品的 ID 對預測相關度很有幫助,但是考慮到訓練集和測試集之間的重疊度并不太高,利用它會不會導致 Overfitting?

      Preprocessing

      這次比賽中我的 Preprocessing 和 Feature Engineering 的具體做法都可以在這里看到。我只簡單總結一下和指出重要的點。

      1. 利用 Forum 上的 Typo Dictionary 修正搜索詞中的錯誤。

      2. 統計屬性的出現次數,將其中出現次數多又容易利用的記錄下來。

      3. 將訓練集和測試集合并,并與產品描述和屬性 Join 起來。這是考慮到后面有一系列操作,如果不合并的話就要重復寫兩次了。

      4. 對所有文本能做 Stemming 和 Tokenizing,同時手工做了一部分格式統一化(比如涉及到數字和單位的)和同義詞替換。

      Feature

      • *Attribute Features

      1. 是否包含某個特定的屬性(品牌、尺寸、顏色、重量、內用/外用、是否有能源之星認證等)

      2. 這個特定的屬性是否匹配

      • Meta Features

      1. 各個文本域的長度

      2. 是否包含屬性域

      3. 品牌(將所有的品牌做數值離散化)

      4. 產品 ID

      • 簡單匹配

      1. 搜索詞是否在產品標題、產品介紹或是產品屬性中出現

      2. 搜索詞在產品標題、產品介紹或是產品屬性中出現的數量和比例

      3. *搜索詞中的第 i 個詞是否在產品標題、產品介紹或是產品屬性中出現

      • 搜索詞和產品標題、產品介紹以及產品屬性之間的文本相似度

      1. BOW Cosine Similairty

      2. TF-IDF Cosine Similarity

      3. Jaccard Similarity

      4. *Edit Distance

      5. Word2Vec Distance(由于效果不好,最后沒有使用,但似乎是因為用的不對)

      • Latent Semantic Indexing:通過將 BOW/TF-IDF Vectorization 得到的矩陣進行 SVD 分解,我們可以得到不同搜索詞/產品組合的 Latent 標識。這個 Feature 使得 Model 能夠在一定程度上對不同的組合做出區別,從而解決某些產品缺失某些 Feature 的問題。

      值得一提的是,上面打了 * 的 Feature 都是我在最后一批加上去的。問題是,使用這批 Feature 訓練得到的 Model 反而比之前的要差,而且還差不少。我一開始是以為因為 Feature 的數量變多了所以一些參數需要重新調優,但在浪費了很多時間做 Grid Search 以后卻發現還是沒法超過之前的分數。這可能就是之前提到的 Feature 之間的相互作用導致的問題。當時我設想過一個看到過好幾次的解決方案,就是將使用不同版本 Feature 的 Model 通過 Ensemble 組合起來。但最終因為時間關系沒有實現。事實上排名靠前的隊伍分享的解法里面基本都提到了將不同的 Preprocessing 和 Feature Engineering 做 Ensemble 是獲勝的關鍵。

      Model

      我一開始用的是 RandomForestRegressor,后來在 Windows 上折騰Xgboost 成功了就開始用 XGBRegressor。XGB 的優勢非常明顯,同樣的數據它只需要不到一半的時間就能跑完,節約了很多時間。

      比賽中后期我基本上就是一邊臺式機上跑 Grid Search,一邊在筆記本上繼續研究 Feature。

      這次比賽數據分布很不獨立,所以期間多次遇到改進的 Feature 或是 Grid Search新得到的參數訓練出來的模型反而 LB 分數下降了。由于被很多前輩教導過要相信自己的 CV,我的決定是將 5-Fold 提到 10-Fold,然后以 CV 為標準繼續前進。

      Ensemble

      最終我的 Ensemble 的 Base Model 有以下四個:

      • RandomForestRegressor

      • ExtraTreesRegressor

      • GradientBoostingRegressor

      • XGBRegressor

      第二層的 Model 還是用的 XGB。

      因為 Base Model 之間的相關都都太高了(最低的一對也有 0.9),我原本還想引入使用 gblinear 的 XGBRegressor 以及 SVR,但前者的 RMSE 比其他幾個 Model 高了 0.02(這在 LB 上有幾百名的差距),而后者的訓練實在太慢了。最后還是只用了這四個。

      值得一提的是,在開始做 Stacking 以后,我的 CV 和 LB 成績的提高就是完全同步的了。

      在比賽最后兩天,因為身心疲憊加上想不到還能有什么顯著的改進,我做了一件事情:用 20 個不同的隨機種子來生成 Ensemble,最后取 Weighted Average。這個其實算是一種變相的 Bagging。其意義在于按我實現 Stacking 的方式,我在訓練 Base Model 時只用了 80% 的訓練數據,而訓練第二層的 Model 時用了 100% 的數據,這在一定程度上增大了 Overfitting 的風險。而每次更改隨機種子可以確保每次用的是不同的 80%,這樣在多次訓練取平均以后就相當于逼近了使用 100% 數據的效果。這給我帶來了大約 0.0004 的提高,也很難受說是真的有效還是隨機性了。

      比賽結束后我發現我最好的單個 Model 在 Private LB 上的得分是 0.46378,而最終 Stacking 的得分是 0.45849。這是 174 名和 98 名的差距。也就是說,我單靠 Feature 和調參進到了 前 10%,而 Stacking 使我進入了前 5%。

      Lessons Learned

      比賽結束后一些隊伍分享了他們的解法,從中我學到了一些我沒有做或是做的不夠好的地方:

      • 產品標題的組織方式是有 Pattern 的,比如一個產品是否帶有某附件一定會用With/Without XXX 的格式放在標題最后。

      • 使用外部數據,比如 WordNet,Reddit 評論數據集等來訓練同義詞和上位詞(在一定程度上替代 Word2Vec)詞典。

      • 基于字母而不是單詞的 NLP Feature。這一點我讓我十分費解,但請教以后發現非常有道理。舉例說,排名第三的隊伍在計算匹配度時,將搜索詞和內容中相匹配的單詞的長度也考慮進去了。這是因為他們發現越長的單詞約具體,所以越容易被用戶認為相關度高。此外他們還使用了逐字符的序列比較(difflib.SequenceMatcher),因為這個相似度能夠衡量視覺上的相似度。像這樣的 Feature 的確不是每個人都能想到的。

      • 標注單詞的詞性,找出中心詞,計算基于中心詞的各種匹配度和距離。這一點我想到了,但沒有時間嘗試。

      • 將產品標題/介紹中 TF-IDF 最高的一些 Trigram 拿出來,計算搜索詞中出現在這些 Trigram 中的比例;反過來以搜索詞為基底也做一遍。這相當于是從另一個角度抽取了一些 Latent 標識。

      • 一些新穎的距離尺度,比如 Word Movers Distance

      • 除了 SVD 以外還可以用上 NMF。

      • 最重要的 Feature 之間的 Pairwise Polynomial Interaction。

      • 針對數據不 i.i.d. 的問題,在 CV 時手動構造測試集與驗證集之間產品 ID 不重疊和重疊的兩種不同分割,并以與實際訓練集/測試集的分割相同的比例來做 CV 以逼近 LB 的得分分布。

      至于 Ensemble 的方法,我暫時還沒有辦法學到什么,因為自己只有最簡單的 Stacking 經驗。

      Summary

      Takeaways

      比較早的時候就開始做 Ensemble 是對的,這次比賽到倒數第三天我還在糾結 Feature。

      很有必要搭建一個 Pipeline,至少要能夠自動訓練并記錄最佳參數。

      Feature 為王。我花在 Feature 上的時間還是太少。

      可能的話,多花點時間去手動查看原始數據中的 Pattern。

      Issues Raised

      我認為在這次比賽中遇到的一些問題是很有研究價值的:

      在數據分布并不 i.i.d. 甚至有 Dependency 時如何做靠譜的 CV。

      如何量化 Ensemble 中 Diversity vs. Accuracy 的 Trade-off。

      如何處理 Feature 之間互相影響導致性能反而下降。

      Beginner Tips

      給新手的一些建議:

      1. 選擇一個感興趣的比賽。如果你對相關領域原本就有一些洞見那就更理想了。

      2. 根據我描述的方法開始探索、理解數據并進行建模。

      3. 通過 Forum 和 Scripts 學習其他人對數據的理解和構建 Feature 的方式。

      4. 如果之前有過類似的比賽,可以去找當時獲獎者的 Interview 和 Blog Post 作為參考,往往很有用。

      5. 在得到一個比較不錯的 LB 分數(比如已經接近前 10%)以后可以開始嘗試做 Ensemble。

      6. 如果覺得自己有希望拿到獎金,開始找人組隊吧!

      7. 到比賽結束為止要繃緊一口氣不能斷,盡量每天做一些新嘗試。

      8. 比賽結束后學習排名靠前的隊伍的方法,思考自己這次比賽中的不足和發現的問題,可能的話再花點時間將學到的新東西用實驗進行確認,為下一次比賽做準備。

      9. 好好休息!

      Reference

      1. Beating Kaggle the Easy Way - Dong Ying

      2. Solution for Prudential Life Insurance Assessment - Nutastray

      3. Search Results Relevance Winner’s Interview: 1st place, Chenglong Chen

      TOP5%Kaggler:如何在 Kaggle 首戰中進入前 10% | 干貨

      分享:
      相關文章

      編輯

      聚焦數據科學,連接 AI 開發者。更多精彩內容,請訪問:yanxishe.com
      當月熱門文章
      最新文章
      請填寫申請人資料
      姓名
      電話
      郵箱
      微信號
      作品鏈接
      個人簡介
      為了您的賬戶安全,請驗證郵箱
      您的郵箱還未驗證,完成可獲20積分喲!
      請驗證您的郵箱
      立即驗證
      完善賬號信息
      您的賬號已經綁定,現在您可以設置密碼以方便用郵箱登錄
      立即設置 以后再說
      主站蜘蛛池模板: 青天衙门第二部| 清楼十二房| 怪盗基德的结局| 美国伦理《生殖按摩》免费观看| 睫毛膏2成人片| 超星神国语全集| 决战紫禁之巅在线观看完整版| 最新台剧| 死亡空间3解说| 浪蝶狂花| 维修工的艳遇韩国电影 | 蓝色隐形帽子完整版在哪看 | 龚玥菲新金瓶bt种子| 十大奇冤粤语| 仁心解码20| 成全观看免费完整观看动漫 | 欧美战狼10电影免费完整版| 和尚的一场春梦| 玉女聊斋电影全集| 吴雪雯电影性迷宫| 宅宅萝卜| 感动在身边| 日韩电影女律师的堕落| 新少年包拯电视剧免费观看| 美丽心得| 马达加斯加3| 高清《裂口女》大结局| 男人女人一起相愁愁愁电视剧在线观 | 法国版《安全出口》| 《善良的大胸女学生| 天才不能承受之重| 小羊没烦恼3000一晚| 坠落女律师电影在线观看免费 | 进口媳妇在线观看免费西瓜| 觉醒年代 电视剧| 需要爸爸的种子伦理片在线播放| 杯水情歌吉他谱| 唐人街探案3完整版在线观看| 电视剧浪子燕青| 高清《地狱来的芳邻》电视剧| 张警官第一集在线观看 | 种马猎人3电影免费| 孤舟免费观看完整版电视剧| 儿子妈妈免费观看大全电视剧| 插曲的痛第60集| 党的女儿电视剧| 大都市小爱情| 加勒比海盗女版1高清版| 雾蓝色的雨后晴天未删减| 大唐诡异录| 日本维修工人的艳遇5免费| 韩剧我的妻子| 姐姐vcd在线看免费高清电视剧| 二十一世纪指南在线 | 电影私人航空在线观看免费完整版| 老严有女不愁嫁片尾曲| 绿水青山带笑颜| 1986《牙医姐妹》在线看| 变形计第七季| 《落魄贵族琉璃川》动漫观看 | 女排决胜局1-6输球| 小丑1在线观看免费版高清| 冰与火之歌第八季| 青岛一酒店疑闪爆| 漾濞| 寻你到天涯全集| 那年我们一起追过的女孩| 电影《姐妹牙医》正片视频| 我的妹妹没那么可爱| 戈壁母亲电视剧全集免费观看| 五通魔神三狐仙原版无删减在线观看| 妹妹背着洋娃娃诡异版| 庆余年第一季特别版| 《新上任的秘书| 电影《女校长》完整版| 华丽的外出电影在线| 《售楼小姐的秘密》的秘密电视剧| 吴昕李维嘉同框| 国产人妻与上司午后出轨| yellow视频在线观看免费高清无吗 | 赌圣周星驰| 伊波拉病毒免费观看完整国语版 | 《放飞旅行团》| xl司令全集在线观看完整版免费高清| 地下偶像未删减版动画观看免费 | 法国空姐4在线| 精忠岳飞背景音乐| 爱国让你想起什么| 需要爸爸种子免费观看| 等着你回来粤语| 传闻中的陈芊芊免费观看| 牙医姊妹在线电影| 使徒行者1电影版国语| 公妇借种林娇H| 非常人贩在线观看免费完整版电影| 侏儒人被黑人蹂躏mp4| 海城市| 香瓜七兄弟| 贵妇人街电影版免费观看中文| 替夫还债完整版电影| 兄弟战争| 歌曲披着羊皮的狼| 酒店1-75全集免费观看国语| 史前超人| 千里江山图烟花1088发多少钱 | 死不张扬的离奇命案| 国家宝藏1国语高清| 满天星麦乐迪电影在线观看完整免费 | 战狼6免费完整高清版下载| 电车痴汉下载| 玩弄我的三位美艳馊子在线电影| 需要爸爸播子种| 抖音官网网页版| 昶读什么| 刚结婚陪部长出差的日剧免费观看第一季| 日剧second love| 韩剧《我的游泳教练》免费播放| 梦想成为魔法少女2| 女朋友的丰满妈咪| 盛唐风流电影完整版在线观看高清| 女扮男装当校草全集免费| 印度教父| 男女一起愁愁愁电影| WWW.COM捏胸挤出奶| 宫锁沉香电视剧| 爸爸接种2| 武林女大生| 吴亦凡向往的生活| 公之浮手中字在线观看| 樱桃小丸子来自意大利的少年| 古代种田全集免费| 美国式家庭忌讳1-7| 高清《奇迹》克劳| 无尽的尽头电视剧免费全集| 1995版《泰山和珍妮丛林》男女主角是| 家有公婆在线观看| 凤台县| 黄景瑜冬至电视剧全集免费观看| 司机是大佬全集免费| 中文字Dl幕岳 和女胥电影| 秘密花园第三集| 黄晓明发文祝贺表妹陈梦| 需要爸爸来播种 在线播放| 小唐璜感情史意大利| 康熙来了 赵又廷| 兄嫂2免费完整高清电视剧看中文版 | 外星生命| 卖房子的女销售2(1)艺术片| 北上电视剧在线观看全集免费播放 | 梅丽莎 特里奥| 亨利和琼在线观看| 壮志凌云啄木鸟满天星| 最终列车醉汉3电影免费观看| 饥渴的邻居HD| 禁忌5在线看| 法证先锋5电视剧全集在线观看| 小沈阳不差钱| 需要你的种子| 牧野诡事之卸岭力士| 全城热恋20150920| 邓紫棋深圳演唱会| 1984美式保罗中文1—4| 浦东新区| 爱情中毒| 白峰美羽无码电影观看| 美景之屋电影完整版在线播放| 马克达蒙| 酋长的女儿第二部| 斩神之凡尘神域| 和最讨厌的前男友一起去出差旅日剧| 斗罗大陆免费完整观看181集| 欲在线观看| 卖百科全书的女人电影完整版| 安斋拉拉电影免费观看高清版2023年| 少女sh| 风流女管家| 浓情蜜意| 部长来家里喝酒在线观看免费| 爸爸的3次婚礼| 双雄电影| 僧侣的色欲之夜| 偷窥无罪2诱人犯罪| 电影《飞夺泸定桥》在线观看免费| 妈妈爱上儿子的同学完整版电影 | 台版《烈火女警花》| 年轻漂亮的邻居瘦子4 | 狗哥短剧全集免费播放| 三大队电视剧在线免费观看| 无名高地电视剧| 步步深陷短剧全集免费观看| 人猿泰山hr版男主角| 僵尸伯伯国语版在线播放| 站着再来一次48集分集剧情介绍 | 吴梦梦与黑人AV片DVD| 父亲筷子兄弟电影| 私人助理2法国版观看| 英雄本色2| 别扒了我身份藏不住了短剧| 云南虫谷电视剧免费观看| 变装俱乐部| 你好世界在线观看完整版免费高清| 苍井空第二部| 老师丝袜| 人猿泰山电影| 智障小烁| 王庆爽知己红颜| 真实伦 乱| 与狼共舞30| 兄弟战争ova| 最酷的世界| 亲爱的 下载| 你微信时很美| 坏家伙们 电视剧| 宜昌保卫战| 不良的义姐| 《疯狂》1980年美国原版| 棒棒影院| 陈芊芊传闻中的电视剧免费观看| 空巢姥爷 电视剧| 小日子40集全免费播放| 飞屋环游记电影国语版免费版观看| 换伴5免费观看完整版| 《驯服》电影完整版丽卡结局| 铁马骝2之街头杀手| 牙医姐妹电影1986版未删减| 奉子成婚第一皇后| 《爱我几何》高清无删除版| 三大队电影免费抢先观看| 《束缚游戏》免费看| 闪婚大佬后免费全集在线观看| 杨敏思版1-5电视大结局在线观 | 我是特种兵之火凤凰27集| 壮乡小莫现实的老婆| 我是余欢水 电视剧| 感觉我的爱| 大红灯笼高高挂在线观看| 背叛在线观看免费完整版电视剧 | 女儿国满天星版 美国| 归路电视剧全集| 私人女性监狱| 天使奶奶| 《千金爱上佣人》完整版| 两个人高清在线观看免费下载| 鱼台县| 普通的孩子未删减| 免费观看归路电视剧全集| 黄手帕第2部| 木下凛凛子免费观看| 灵与肉电影| 《妓院里的中国姑娘》BD高清高清在线 | 金银悔1-5集免费观看| 女人的战争之肝脏的交易中字| 《同学聚会2》电影在线观看全集免费 | 曹查理电影全集在线观看| 菲律宾电影《女仆》播放| 一起愁愁在线观看完整版电视| 漠上风云| 爱我多深未剪原版在线观看| 朱日和阅兵2017| 《法国护士长》伦理| 傲世潜龙王东98集全| 我的漂亮的小瘦子3| 邻居寂寞人妻中文字幕| 满天星《贵夫人》在线观看| 胖妹最近10天的视频| 维修工的绝遇(2)| 妖兽都市粤语| 韩国电视剧宫全集| 绿箭侠23| 尸城在线| 1985版电影《干草堆》| 纽约 电影| 百慕大三角 美剧| 星落凝成糖免费完整版| 鸣梁海战电影免费观看国语| 秘社第二季| 益达广告完整版白百合| 乡村爱情13电视剧免费观看| 变成黑皮肤和朋友| 妙笔生花电影| 猎犬 第二季全集观看| 电视剧浪子燕青| 幸福七人组| 私人航空法国成人电影| 三体电视剧在线| 赤裸惊魂| 弹钢琴的盲童| 《爱恋》电影完整版在线观看| 武庚纪 动漫| 锵锵锵免费完整观看在线观看电影| 青谷子电视剧免费全集观看| 蛇姬恋免费观看完整版| 爱没那么简单 黄小琥| 动漫男女一起愁愁愁观看全集| 忘年恋曲电影| 黑白配HD1080完整版在| 一触即发在线观看| 高清非常检控观未删减| 疯狂特警队免费观看完整版| 偷香高手| 年轻的阿姨5在观整有限中字| 关山暮雪| 高压监狱香港| 妈妈的星星号| 凯登克罗斯在线电影免费观看护士 | 她唇之下电影无删减资源| 武鸣县| 案发现场第二部全集| 美容院·特珠待遇6| 大梦周天动漫在线观看免费播放全集 | 怪盗女谍之天海翼未删减版| 侏罗纪世界1电影免费版高清| 海之声电影在线观看免费完整高清原声 | 木下檀檩子在线观看免费完整版电影| 驯龙高手电影| 电视剧廖家| 圣堂风云| 《沧元图3》| 朝花夕誓| 蛮好的人生在线观看免费高清电影| 青梅竹马是消防员动漫| 法国版《女超人:麦乐迪》在线播放视频| 一个人在黑夜里寻找散文诗宋湘波| 公主岭市| 赵甲第电视剧在线观看| 小川阿佐美| 末日三问| 惊天激战2024完整版在线观看| 白嫖者联盟在线观看免费观看最新版| 妻子的浪漫旅行第五季| 肉汁奴隶完整版| 李幼斌《守望者》免费播放| 高压监狱完整版在线观看完整免费高清原声满天星2023 | 美丽的小蜜蜂美国版5娃娃脸| 裕树先生被树弄得是那几集| 长空雄鹰电影| 《美丽妻子替夫还债》剧情电影中文| 疯狂原始人免费看| 禁忌4年转一代禁忌演员表| 真命天子朱元璋在线观看| 庆余年电视剧全集免费观看| 大劫案电影2026| 辽宁卫视手机在线直播高清版| 新婚旅行:不伦电影| 加油亚当君| 度华年在线观看免费高清| 满清十大刑酷之赤裸凌迟 | 奔跑吧茶马古道免费观看完整版| v酒店第一季第一集在线观看| 二十四史前四史| 旺达卢佩的玫瑰| 驾驶员找工作| 加勒比海盗完整版1| 电视剧游击兵工厂| 妻子13免费完整高清电视剧在线看| 辣妹子影视电视剧免费高清| 高清《秘密囚禁》完整版| 人世间电视剧免费观看全集| 乡下大叔成为剑圣| 《陷阱》未删减版在线观看| 外星人对女忍者| 妻子8在线观看免费版电视剧 | 电影《灭火宝贝1》免费观看灭| 灵异侦缉档案2国语| 房奴试爱电影电视剧免费观看| 护宝风云电视剧全集在线观看免费| 日本空姐2019 | 生死拳速国语| 与君歌免费观看完整版电视剧全集| 美人鱼在线观看免费观看| 俘虏之锁动漫在线观看| 女状元:文武双全惊天下全集免费 | 隔离区2| 观看韩国伦理电影丈夫下属| 喜爱夜蒲免费在线观看| 《交换3》| 骆闻舟射到费渡里面微博| 白鹿原未删减版| 一念天堂免费观看| 失忆的劳尔| 俘虏之锁~处女们淫秽的束缚动漫在线观看 | 白雪公主满天星| 快递员的美味2中字在线观看| 古惑仔2高清| 鄂尔多斯市| 斗罗大陆漫画77| 尼基塔第二季全集| 台湾黛比浪漫女家教| 护国良相狄仁杰| 电影《牙医姐妹》完整版免费播放国| 快乐方程式动漫| 少年歌行萧瑟| 我的校花妹妹2| 十二猴子| 麦尔迪满天星| 大剑在线观看免费全集高清版| 爸爸播种子| 拿摩一等| lx司令动漫第一季免费观看| 少年派2正版全集免费观看| 加勒比女海盗1| 善良姐姐的朋友| 做aj的电视剧大全国外| 动漫在线观看免费全集| 《卖楼销售员》完整版电影| 哈利波特1普通话版| 特殊的内衣销售员| 电视剧拳王| 武汉大学校花| 新垣结衣生日| 我是余欢水下载| 台剧黛比女家教在线看| 鉴证实录2粤语| 法国满天星《古墓丽影》完整版在线| 限制别人网速| 《哪吒2:魔童闹海》免费观看| 云南蔡总 裸体| 刺杀盖世太保| 妈妈的职业5观看| 东方侠客免费观看全集| 工藤拉拉全部免费观看电视剧| 郭有才诺言完整版| 小斌斌事件| 朴槿惠被曝身体出现异常| 纯真岁月| 跟部长一起去出差旅行住同一个房间 | 快乐大本营2017免费观看完整版 | 花房姑娘第五季免费大全好看| 迈阿密风云电影| 陈枫动漫免费观看全集| 天地民心| 余秋雨经典语录| 桑拿房的秘密三级国产在线| 捆绑堵嘴3级强奸电影| 后宫 帝王之妾在线观看| 盛唐风流国语版免费播放| 青岛往事全集在线观看| 双j恋吧| 姐夫电影| 台军演练机场被炸瘫痪| 《她被搬运工侵犯》在线| 女生按摩胸部电影免费观看| 三人行电影| 绝世千金电视剧| 断背山电影高清版免费观看| 麦乐迪马克思女超人在线观看完整免费高清原声满天星百 | 三年成全在线观看免费观看影视大全 | 那年我们一起追过的女孩| 电影《避暑的夫人》观看| 西游记之诸神之战免费观看国语| 尹律新剧《债务妻子》结局| 人工少女2操作| 理想之城西瓜影视在线观看免费| 爱情悠悠药草香电视剧全集| 少妇的诱惑免费观看完整版中文| 满天星电影免费观看高清在线播放 | 战神3解说| 电视剧千方百计爱上你| 《特殊游泳教练》完整版》 - 国语剧情手机免费观看... 韩国其它2017很 | 淬火年代电视剧免费观看完整版| 新金银悔5普通话版免费观看 | 行尸走肉第七季全集| 皇后和公主一起干| 天堂马帮电视剧| 蓬安县| 原来你一直深爱着我短剧| 韩国人妻同丈夫吵架人妻系上司的关心下调教电影 | 广场舞dj活力加加| 奇妙萌可之甜蜜捕获| 白鹿原电视剧免费全集在线播放| 玄奘之路纪录片| 法国女仆电影在线观看完整免费高清原声满天星下载 | 听泉鉴宝最恐怖的一集| 玫瑰故事电视剧免费视频| 《特殊面试2》| 荣誉守则杰西简在线观看| 金瓶酶2| 安娜的妈妈偷看儿子手机是哪一集 | 高清《朋友的妻子》在线观看| 像风一样离去 电视剧免费观看| 误杀3 电影| MANTA所有歌曲TOTAKKA HAYA KIRGUZUX | 高清在韩国成为房主的方法未删减| 不良人第6季星辰影院观看| 五岛医生诊疗所| 花千骨日剧第二部在线观看| 我的瘦子女朋友2上映时间| 我年轻瘦子8完整版| 错过你的那些年| 插曲的痛60全集 | 王中王电视剧| 苍老师40电影全集免费观看 | 木下凛凛子未删减版| 聊斋艳谭3| 亲爱的翻译官大结局是什么| 满仓进城免费观看全集完整版| 村民在墓穴躺坐一排乘凉:人多不怕| 超级教师3免费版电视剧 | 陪部长出差的电影叫什么名字| 插翅难飞电影| 日本小妞| 妈妈的朋友手机在线观看| 伊甸园韩国综艺| 爱我几何免费完整观看高清| 龚玥菲新金平瓶梅全集| 青梅竹马:两小无猜超甜短剧全集| 《四少妇按摩完整版》| 《流光引》| 爱的烹调法| 歼灭天际线免费完整版在线观看| 电影《学生》完整版播放| 八十八佛忏悔文唱诵| 电影 非诚勿扰2| 龙珠大魔免费观看| 《和部长一起去出差旅》遇到暴雨 | 我出生在伊朗| 电影《村姑》完整版| 江南媳妇| 我不会爱你| 叶子楣电影| 当我飞奔向你电视剧| 粉红大白菜正宗版完整版 | 战狼6欧式少女全集观看高清版| 大佬1v1| 甜蜜的鞭子| 替丈夫偿还债当秘书| 血色玫瑰2| 高清《日本三国》电视剧| 需要爸爸的种子在线美国观看 | 钢铁巨人| 新继牳3| 明朗少女成功记| 一对一播放| 永远的母亲| 泰国非常大度的电影原声| 东北警察的故事| 毒战完整版免费观看| 《G点》1985欧美在线| 上帝之城| 三年大片免费观看国语完| 金装的维尔梅第一集| 玉蒲团字幕| 女战狼10普通话版免费观看| 两个人的世界在哪看| 激情厨房| 农情蜜意| 逆局在哪个平台播出| https://www.yalan365.com/shiwutv/sreteuc.html| 火山口电影完整版免费| 一个好妈妈高清完整版| 高清毒劫| 我的父亲母亲电影完整版观看| 新金瓶梅电视剧免费观看全集完整版1986 | 饥饿游戏2:星火燎原| 针锋对决无删节完整版| 白石茉利奈| 咖喱辣椒粤语| 《妻子8》在线观看免费版电视剧| 河南豫剧打金枝| 狙击部队高清| 炸天小姐电影星辰影院| 鬼片电影林正英| 疯狂的麦克斯4狂暴之路| 哆啦a梦电影国语| 《田耕纪》电视剧| 美国伦理电影需要爸爸播种| 雪中悍刀行第2部免费观看| 极限审判| 福禄寿电影粤语| 台湾土著版酋长的女儿| 黑神话悟空剧情| 十七岁的韩剧免费观看直播| 姜素拉一脱成名2免费观看| 因为爱情有| 凤凰卫视军情观察| 下北泽之虎胆龙威| 绝对权力剧情| 赤色狂魔3普通话版| 美国好人家在线观看| 法医嫡女短剧全集| 特殊房产销售5| 快乐方程式2| 拆局专家粤语| 日本金银1-5免费版| 恶意编年史| 巧虎快乐版2013全集| 雪中悍刀行第二部免费| 李阳疯狂英语全集| 皇上当着大臣宠幸她| 梅花三弄水云间| 八佰免费完整版在线观看| 替夫还债女律师免费观看完整版 | 平凡的世界电影| 《混血的摇篮曲》日本| 葬送的芙莉莲动漫免费观看| 郭奶奶相声网| 美丽的小蜜在线观看完整版| 人与狗马猪p4| 我的机器人女友| 电视剧前行者免费观看完整版 | 汇仁胜宝| 诱人的秘书BD在线观看| 酒店1-50集在线观看| 爸爸的朋友2在完整有限中字| 掌中宝电影西班牙| 写真片lcdv观看影院| 高清生命树| 酒店1-100集全集免费| 和空姐一起的日子剧情| 《疯狂动物城2》中文版| 男女一起愁愁愁免费全集观看| 历届奥运会主题曲| 正确的进入方法免费看| 三年电影在线观看免费播放| 吞噬星空106集| 乡村爱情5部免费全集电视剧| 女律师的坠落完整版HD| 熊出没·伴我“熊芯”免费| 人民的名义 直播| 美容室的特殊待遇6| 3d肉蒲团高清在线| 台安县| tek-081| 甜美日系风| 女战狼6在线高清免费观看全集 | 南来北往电视剧剧情介绍| 涩情影院| 大山里的幸福:知青媳妇全集免费 | 拳王粤语下载| 琉璃电视剧在线观看免费全集| 丈夫不在一周七天我失去了理智 | 羞耻电影完整版| 男女愁愁全集| 陈情令全集电视剧在线观看| 当我飞奔向你免费观看全集完整版| 战狼6高清完整免费观看| 迈克杰克逊吉隆坡演唱会| 刘德华演唱会2011| 《束缚游戏》第一季1-12集免费观看 | 一本之道在线观看| 小丑历险记| 插曲的痛全集免费播| 生存游戏在线观看完整版免费| 浴血黑帮第四季| 铿锵在线观看完整版| 《秘密列车》电视剧| 雪豹优酷| jjzz44| 古惑仔8| 暗算全集| 汝州市| 爱你就别想太多电视剧免费播放| 《与我同眠》电影| 电影《需要爸爸播种子》演员表 | 前所未有的深入(1981)| 仙剑奇侠传第三部全集| 金银悔1—5国语版下载| 天堂马帮 百度影音| 郭德纲于谦2012最新相声| 肯兰德桑德兰黑白配在线观看| 玉女聊斋1998 免费观看 | 橄榄球的电影| 凯登克劳斯电影作品在线观看 | 中华英雄在线观看| 法国空乘2023无删减版| 吊饰男士3季全集| 玉蒲团ii之玉女心经| 落魄贵族琉璃川在线观看免费动漫| 诺曼影视| 代表建议严炒作网红儿童账号| 女超人麦乐迪未删减版| 囧妈电影| 来者何人| 国风按摩院1-5季全部演员表| 巴西德国7比1死了多少人| 女匪传奇第二部| 朴亚珍《隐身帽子》在线观看| 高清《哺乳》电影完整版观看免费| 搞笑一家人国语版1| 搜神记动漫免费观看完整版国语| 长相思第二季完整版免费播放| 免费观看回复术师的重启人生| 活佛济公3电视剧| 交换的一天2韩国中汉字普通话| 无限复活粤语| 超神学院雄兵连| 《越南暴行2》免| 相门嫡女全集免费| 电视剧一起来看流星雨| 纳粹女人集中营惊天秘密| 突围全集| 亲吻拥抱动漫| 和讨厌部长一起去出差旅| 惊天下:女状元文武全集免费| 年轻的母亲在线观看中文版完整版 | 法国满天星《古墓丽影| 欢乐白领夫妻| 让子弹飞删减| 电影二对一的商务模式2| 哪里能看一路向西| 《窃视者》电影在线看完整版免费| 乳房按摩的电影在线观看| 烟火电视剧连续剧40集| 107g种子| 动漫《落魄贵族琉璃川》观看| 天才相师5200| 速度与激情11| 华胥引电视剧下载| 高压监狱2无删减完整版| 《汤摇庄的幽奈同学》| 毛驴县令之棒子老虎鸡| 好莱坞秘密花园免费观看完整版| 盗亦有道| 阴阳魔界| 插曲的痛第60集| 哪吒3上映时间| 我的抗战之猎豹突击高清| 花子君第二季免费观看| 无憾品味人生在线观看免费| 古畑任三郎国语| 哈利波特1国语版免费| 私人航空在线观看免费| 芳华高清电影免费观看| 小猪佩奇全套| 按摩店的特殊待遇电影| 左右免费| 售楼小姐韩国电视剧| 电影跳出去| 背水一战百度影音| 要妈妈播种的1983年电影 | 我在大学修文物未删减| 《法国空乘2015法版》| 标错参国语| 特种兵之火凤| 极限挑战大电影下载| 《公的浮之手中字》免费日本电影 | 天骄 电视剧| 名侦探柯南第14个目标| 坎贝奇品味人生免费观看中文| 夏日大作战qvod| 圣诞树折纸| 地下交通站第二部28集免费观看| 爱我多深删除的三个片段分别是什么 | 雨花石mv| 明星换脸高清在线观看完整版免费换脸 | 爸妈离婚女儿做了父亲的女人| 监狱高压2在线观看免费| 张禧嫔电视剧| 金鹰卡通节目在线直播| 21世纪爱情指南电影| 泰国电视剧美人计| 韩剧空调维修工| 白蛇后传分集剧情| 就想赖着你剧情介绍| 哇嘎电影在线播放免费版| 新闻女王国语电视剧免费| 完美爱情| 欧美男男video在线观看| 黑白配中文免费观看| 百变小樱魔术卡中文| 欢乐颂1电视剧全集免费观看| 《渔夫的荒野史记》免费观看| 我要当空姐 电视剧| 追龙2电影完整版在线观看| 缘之空在线观看动漫高清免费| 意大利小红帽满天星| 仙女湖免费观看电视剧全集| 少女3完整免费观看版高清在线| 《私人女性监狱》中文| 龙虾店老板深夜崩溃把店砸了 | 国产白嫩漂亮美女在线观看| 甜性涩爱全集在线观看| 双人调情接摩术电影| 姐姐10免费完整高清电视剧在线看| 影子爱人电影| 千金赤子板栗| 密爱高清下载| 詹妮弗康纳利裸戏| 全员加速中·对战季综艺 | 天乩全集免费观看完整版下载| 墨水心下载| 商务旅行戴帽子的老板同行电影完整版| 乡间小路简谱| 妲己无惨| 灯草花和灯高清免费| 《星汉灿烂》全集免费看| 拯救瑞恩| 永生守卫| 电影《女超人麦乐迪》免费播放| 我爱你中国谭晶| 求求鬼别吃我| 终结者1在线完整免费观看| 妈妈的职业5完整版结局在线看免费高清| 凉森玲梦| 阳刚男孩读后感| 新娃娃脸经典版| 乡村爱情3前传| 您好母亲大人| 中国交通频道| 黑白配中文高清免费观看| 骑士勇士总决赛| 灵动鬼影实录2| 星辰变第二季免费完整版| 美国大片国语普通话| 高清《科学家们》动漫免费观看| 无声谎言短剧免费观看| 月光宝盒免费观看全集| 《女超人麦乐迪满天星版》| 电幻国度电影在线观看免费| 天使的翅膀简谱| 女友的妈妈 双字id| 17·3电影在线观看免费 | 高h乱np甄宓| 《莫莉特别的酒店》| 《女销售员的秘密》2| 美国保罗一家第1—4集在线播放 | lieche| 韩国免费A片爱的人蜜爱| 大槻响作品番号| 男生女生嗟磋嗟磋磋| 肖申克的救赎 电影| 地牢女孩在线观看完整版高清| 瓜达卢佩的玫瑰在线观看| 人猿泰山1995在线| 电视剧神枪在线观看| 电影《灭火小妞》在线观看| 最高爱人诏日剧免费观看 | 斯托雅壮志凌云女版满天星法版| 剑魔1992未删减版在线观看| 金瓶梅1996杨思敏版| 壮志凌云2011版免费观看| 新金瓶梅3d 龚玥菲| 孟丽君电视剧| 四美女一男免费高清电视剧| 白峰电影高清无广告免费看| 黑暗荣耀第二季未删减| 长津湖电影| 寂静岭p.t| 韩日电影伦理四少妇精油按摩| 阴阳路1-20全集免费| 敦刻尔克电影| 学渣学霸:高考状元短剧全集| 法国监狱伦理3完整视频| 新妹魔王的契约者动漫| 小蓝电影| 黑帮帮大佬和我的365| 战狼6免费观看高清版| 曝李晨身家10亿| 灵魂之音| 捆绑电影| 法国满天星《古墓丽影》在线观看高清免费|