• <track id="oztn4"></track>
    <sup id="oztn4"><form id="oztn4"></form></sup>
    
    
    <mark id="oztn4"></mark>
  • <dfn id="oztn4"><samp id="oztn4"></samp></dfn>
      《地爆天星小姐》电影 ,麦子交换2免费观看2023年上映时间表 ,莫妮卡《爱我几何》,大牛影库战狼6欧式少女全部视频,三年大片国语版在线看,日本空姐电视剧,电影魔镜号中文字幕,和部长一起去出差旅是第几集
      全球「AI學術頂會」精華匯聚地
      您正在使用IE低版瀏覽器,為了您的雷峰網賬號安全和更好的產品體驗,強烈建議使用更快更安全的瀏覽器
      此為臨時鏈接,僅用于文章預覽,將在時失效
      人工智能學術 正文
      發私信給我在思考中
      發送

      0

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      本文作者: 我在思考中 2022-04-01 15:26
      導語:本文對視覺-語言(VL)智能按時間順序進行了全面調研。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      編譯丨Jocelyn

      編輯丨陳彩嫻

      本文對視覺-語言(VL)智能按時間順序進行了全面調研,并將這一領域的發展總結為三個階段:

      第一個階段是2014-2018年,其間,專門的模型被設計用于不同的任務。第二個時代是2019-2021年,在此期間,通過使用有著高質量標簽的VL數據集進行預訓練,神經網絡模型能夠學習視覺和語言的聯合表征。最后,隨著2021年CLIP的出現,第三個時代開始了,此時研究人員尋求在更大的弱標簽數據集上預訓練VL模型,并通過VL預訓練獲得性能強大的基于零樣本或少樣本的視覺模型。

      我們相信這篇綜述將有助于人工智能(AI)和機器學習(ML)的研究人員和實踐者,特別是那些對計算機視覺和自然語言處理感興趣的人。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      論文地址:https://arxiv.org/pdf/2203.01922.pdf



      1

      研究背景

      計算機視覺(CV)和自然語言處理(NLP)是人工智能的兩大分支,它們專注于在視覺和語言上模擬人類智能。在過去的十年中,深度學習極大地推進了單模態學習在這兩個領域的發展,并在一系列任務上取得了先進的成果。深度學習顯著進步的核心在于GPU的快速發展和大規模數據集的可用出現,這些加速了深度學習模型的大規模訓練。

      隨著深度學習的發展,我們也看到了一系列功能強大的神經網絡的發展。傳統的神經網絡通常是由多層線性層和非線性激活組成的多層感知器(MLP)。LeCun等人于1998提出了卷積神經網絡(CNN),將平移不變性作為對2D視覺輸入的更好的歸納偏差,這啟發了大量的深度神經網絡,包括AlexNet,VGGNet, GoogleNet和ResNet。

      另一個主要的突破是自然語言處理(NLP)領域的循環神經網絡(RNN),它提出了循環神經元用于序列數據建模。為了緩解長序列訓練中的梯度消失和梯度爆炸問題,LSTM(RNN的一種變體)和GRU(LSTM的一種更高效的版本)被提出。NLP的另一個重大突破是Transformer,它利用注意力機制追求更好的語言表征。使用多個堆疊的注意力層,Transformer可以以高并行性在全局范圍內融合語言符號的信息,這有利于有效的表征和大規模的訓練。

      雖然我們在單模態領域技術取得了鼓舞人心的進展,但現實世界的問題往往是涉及多模態的。例如,自動駕駛汽車應該做到能夠處理人類的命令(語言)、交通信號(視覺)、道路狀況(視覺和聲音)。即便單模態學習也能從多模態學習中受益。例如,語言學習需要感知,而感知是許多語義公理的基礎。

      感知是人類理解物質世界的方式,決定了人類語言背后的意義。由于我們聽到和看到的是同樣的事情,一些知識便被留下來作為常識,這些常識在我們的語言中是沒有記錄的。即便僅僅在語言領域,演講也比純文本包含更多有用的信息,例如,韻律可以暗示情感。

      多模態感知在多模態和單模態任務中都有幫助,因此誕生了大量的相關研究工作。在多模態領域中,由于視覺是人類用于理解環境最重要的感官之一,并且語言-視覺特征結合能夠極大地改善視覺和視覺-語言任務的表現,在視覺-語言集成的相關研究獲得到許多的關注。此外,視覺語言智能的普及還得益于該領域豐富的數據集和評估標準。

      解決特定任務VL問題的雄心推動了VL學習的初步發展。這些VL問題包括圖像字幕、視覺問答(VQA)、圖像-文本匹配等。Xu一些人于2015年的工作集成了一個CNN圖像編碼器和一個RNN文本解碼器用于圖像說明。Antol等人于2016年通過將圖像和文本映射到相同的潛在空間并從潛在表征中預測答案來解決VQA任務。Lee等人于2018年通過計算圖像和文本在句子級別或標記級別上的相似度來進行圖像-文本匹配。這些模型是為各種數據集的特定問題量身定制的,其中每個模型只能解決一個任務。

      受語言和視覺的預訓練和微調的流行啟發,視覺和語言的跨學科領域迎來了一個新時代: 通過圖像-文本對的預訓練來學習視覺和語言的聯合表征。VLP模型的興起主要是受到了架構設計和訓練方法中語言模型的啟發。例如,最近的許多研究采用了與BERT相似的架構和訓練方法。由于缺乏足夠大規模的人工標注數據,VL學習的發展面臨著嚴峻的挑戰。最近,一些研究通過采用對比學習和利用大規模網絡爬蟲爬取數據學習視覺語言特征而打破了這一限制,它們所獲得的特征可用于零樣本學習。

      隨著VL領域的快速發展,目前亟需一個對該領域現有研究的全面調研。本文旨在提供一個結構化的、關于VL領域的最新進展的綜述,以幫助研究人員獲得一個整體的VL領域的情況,并更好地理解最新的研究成果。

      我們將VL學習的發展分為三個階段。第一個是從2014-2018年,其間,專門的模型被設計用于不同的任務。第二個時代是2019-2021年,在此期間,通過使用有著高質量標簽的VL數據集進行預訓練,神經網絡模型能夠學習視覺和語言的聯合表征。最后,隨著2021年CLIP的出現,第三個時代開始了,此時研究人員尋求在更大的弱標簽數據集上預訓練VL模型,并通過VL預訓練獲得性能強大的基于零樣本或少樣本的視覺模型。

      回顧VL智能的整個發展過程,我們發現其總體目標是學習良好的視覺特征。一個好的視覺特征應該具有三個屬性,即對象級別、語言對齊和語義豐富。對象級別意味著視覺和語言特征的細粒度應該分別與對象級別和單詞級別中的保持一致。語言對齊強調的是與語言對齊的視覺特征可以幫助完成視覺任務。語義豐富是指不受領域限制地從大規模數據中學習特征。

      在VL的第一個時代,相關科學研究工作的目的是解決具體的問題,而不是學習上述良好的特征。在第二個時代,研究人員基于圖像-文本對來訓練模型,以獲得語言對齊的視覺特征。這個時代的一些研究成果采用檢測到的區域作為圖像特征,從而學習對象級別的特征。只有在第三個時代,研究人員才能處理大規模的數據集并使用蘊含豐富語義信息的特征來預訓練。



      2

      特定任務問題

      早期的 VL 方法是針對特定任務設計的。VL領域包含廣泛任務,包括圖像說明,視覺問答,圖文匹配,視覺對話等。

      本節中,我們詳細介紹三個最常見的任務:圖像說明、視覺問答和圖文匹配。我們總結了特定任務方法的發展是從全局表征到細粒度的以對象為中心的表征。

      大多數VL任務有三個階段,包括全局向量表征和簡單融合;網格特征表征和跨模態注意力機制和以對象為中心的特征表征和自底向上自頂向下的attention。這三個階段的代表工作如圖1所示。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖1所示,這三個階段的任務具體方法。主要區別在于視覺representation的粒度和視覺與語言特征融合的方式。

      A 圖像說明

      任務定義: 圖像說明的目標是為給定的圖像生成“標題”,即用一句話總結圖像內容。標題通常包含感興趣的對象、對象的行為以及對象之間的位置關系。

      方法: 深度學習出現之前,早期圖像說明方法主要基于規則。它們首先識別對象及其關系,然后根據預定義的規則生成標題。這種早期的方法由于視覺識別器詞匯量有限以及基于規則的方法在處理人類語言中復雜場景的局限性的原因而效果有限。

      深度學習技術的突破極大地增強了圖像說明功能。Seq2Seq在機器翻譯方面取得了巨大的成功,它利用文本編碼器對源語言的文本進行編碼,利用文本解碼器從目標語言生成文本。

      在Seq2Seq的編碼器-解碼器結構的基礎上,Xu等人提出用GoogleNet的圖像編碼器替代文本編碼器,并取得了當時最前沿的性能。于是這種編碼-解碼的結構開始流行起來,并被后續的工作廣泛采用。這個結構稱為img2seq,如圖2所示。

      早期研究采用CNN模型作為圖像編碼器進行提取一種全局的CNN特性,將其作為初始隱藏狀態輸入文本解碼器。m-RNN和LRCN提出將全局CNN特征添加到LSTM解碼器的每一步。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖2所示,img2seq結構包含圖像編碼器(如CNN)和語言解碼器(如LSTM)。

      全局CNN特征有一個明顯的弱點,因為解碼器不能像人類那樣聚焦于圖像的重要區域。為解決這個問題,引入了注意機制。

      Xu等人于2015年提出了一種將注意力機制引入特征的方法。假設CNN特征提取器的輸出特征圖形狀為(H, W, C),其中H, W為特征圖的高度和寬度,C為特征維數。feature map可以沿空間維度扁平化為H × W的C個緯度的網格特征。對于LSTM解碼器的每個cell,隱藏狀態都要關注網格特征,以決定關注哪個網格。

      與卷積相比,注意機制具有以下優點。它通過對重要的網格特征給予更高的attention權重,使模型能夠聚焦于圖像的某些部分。此外,該模型能夠學習與人類直覺高度相似的對齊方式。模型的可解釋性也可以通過可視化的attention分數得到改善,這樣可能有助于排除網絡錯誤。

      然而,將一幅圖像分割成大小相同的網格只是一種執行attention的樸素方法,因為網格與對象的對應關系很差。為了解決這個問題,一些研究人員試圖將注意力與更有意義的區域聯系起來。

      Anderson等人(2018)提出了一種自底向上和自頂向下的注意力方法(BUTD),將注意力與檢測模型獲得的顯著區域進行對應。BUTD使用在視覺基因組上預訓練的Faster-RCNN模型提取區域特征。由于檢測到的對象區域通常包含有意義的視覺概念,且能夠與人類語言更好地匹配,因此BUTD顯著提高了圖像說明和VQA的性能。因此,預訓練的檢測器在后續的VL研究中被廣泛采用。

      注意力機制運用的方式也有一些不同。例如,Lu等認為因為有些單詞與視覺特征無關,解碼器不需要一直保持關注視覺特征。因此,他們提議用一個門來決定注意力機制是否參與其中。AoA設計了一個特殊的“注意力疊加機制”的圖像說明任務。在標準注意力機制之后,它們將被關注的向量和query連接起來。然后由串聯向量生成信息向量和注意門,將信息向量與信息向量相乘得到輸出。

      除上述工作,也有不運用注意力機制的工作。例如,Neural Baby Talk首先生成一個句子模板,然后用圖像中檢測到的概念填充它。Cornia等人通過預測名詞塊的序列來生成一個句子。它們首先檢測區域,然后使用排序網絡對區域進行排序。最后,每個區域將被轉換成一個名詞塊來組成句子。

      綜上所述,早期圖像說明方法的發展主要有兩個方面,即視覺表征和語言解碼。視覺表征從圖像級的全局特征發展到細粒度和對象級的區域特征,語言解碼從LSTM發展到基于注意力機制的模型。

      B. 視覺問答

      任務定義: 給定一個圖像-問題對,視覺問答要求根據圖像回答一個問題。大多數研究都將視覺問答視為一個基于預定義答案集的分類問題。例如,VQA v2 有大約2K個預定義答案。

      方法: 普遍的視覺問答是LSTM問題編碼器和VGG圖像編碼器的組合。輸出圖像潛入和問題嵌入,它們通過逐點相乘來簡單地進行融合。然后,融合向量經過一個線性層和一個Softmax層,輸出選擇每個候選答案的概率。模型的體系結構如圖3所示。視覺問答中的后續研究通常采用相同的方法原型。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖3所示。vanilla VQA的體系結構包含一個CNN模型來編碼輸入圖像和一個LSTM模型來編碼輸入問題。將編碼后的圖像和問題特征進行點積合并,然后通過全連通層來預測候選答案的概率。

      早期研究通常采用全局圖像表征和簡單融合的方式。Malinowski等于2015提出將CNN圖像特征輸入到問題編碼器的每個LSTM 單元中。同年,Gao等使用了一個共享的LSTM來編碼問題和解碼答案。他們將CNN圖像特征與每個解碼器單元的輸出融合,逐字生成答案。

      問題回答通常只與圖像的某些區域有關。因此,由于不相關區域帶來的噪聲,全局表征只會導致次優解。Yang 等人于2016年提出了堆疊注意網絡(stacking Attention Network, SAN)將多個問題引導的注意層堆疊起來。在每一層中,問題的語義表示被用作對圖像網格的查詢。SAN是是一個驗證視覺問答中注意力有效性的工作。Fukui等人同樣采用了網格特征,他們通過雙線性池化融合圖像和語言特征。

      正如我們在圖像說明任務中所說,網格特征具有它的局限性。針對這個問題,Shih等人提出使用邊緣框定位出的區域特征作為視覺表征。BUTD預訓練了一個強大的檢測器,并使用問題特征作為queries來關注區域特征。Lu等人認為對文字的關注與對圖像的關注同等重要。因此,他們開發了一種聯合執行文本引導的圖像注意力和圖像引導的文本注意力的共注意力方式。

      除注意力以外,還有其他的模態融合策略。Ren等人將圖像特征視為語言標記。它們將圖像嵌入與語言標記連接起來作為LSTM的輸入。Kim等人提出了一種用于模態融合的元素乘法迭代方法,名為多模態殘差網絡。MUTAN提出了模式間參數化的雙線性相互作用。雖然融合圖像和語言特征的方法有很多,但注意力機制依舊是最常用的一種。

      圖像問答的核心是獲取圖像和語言(問題)的聯合表征。該領域的研究人員通過多種方式來更好地編碼和融合圖像與語言,為后續的視覺學習表征VLP方法奠定了基礎。該領域大多數工作都是將圖像和語言獨立編碼,然后進行融合,這類似于視覺學習表征VLP中的雙流方法。Ren等人將圖像嵌入視為一種語言標記,類似于單流方法。

      C.圖文匹配

      任務定義: 圖像-文本匹配 (ITM),或說圖文檢索,是視覺領域的基本課題之一。給定一個特定模態 (視覺或語言) 的query ,它的目標是從另一個模態中找到語義上最接近的目標。根據query和目標模式,它包含兩個子任務: 圖像-文本檢索和文本-圖像檢索。

      方法: 圖像-文本匹配的核心是計算圖像與文本之間的相似度或距離。一個被廣泛采用的模型是將圖像和文本映射到共享的嵌入空間,然后計算它們的相似性。所匹配出的圖像結果預期與句子的相似度最高。

      早期方法主要采用全局特征對圖文信息進行編碼。Kiros等提出了一種基于鉸鏈的三聯體排序損失的交叉視圖表示方法。Faghri等人考慮硬負樣本因素來提高性能。Karpathy等人提出“深度片段” (Deep Fragment),這是首次嘗試在圖像端和文本端都使用細粒度表示的方法。

      “Deep Fragment”的體系結構如圖4所示。與直接表示整個圖像和句子不同,該方法將每個圖像片段和句子片段映射到跨模態嵌入空間中。然后于不同模式之間排列片段。由于一個圖像區域可能與多個單詞相關,他們會為每個單詞的嵌入找到最相似的區域。圖像與句子的相似度是對齊后的詞對與區域對的相似度之和。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖4所示。Deep fragment結構概述。左:將檢測到的對象映射到片段嵌入空間。右:依賴樹關系被編碼為片段嵌入空間。

      由于注意力機制在其他視覺學習任務中取得了巨大成功,Huang等2016年提出將注意力機制引入到圖文匹配(ITM)中。他們開發了一種上下文調節的注意力方案,以關注出現在圖像和文本中的實例對。Nam等2017年提出了一種雙注意力框架,該框架通過多個步驟來關注圖像和文本中的特定區域,并從這兩種模態中收集重要信息。

      這些方法證明了注意力機制在ITM任務中的有效性。但是它們也存在局限性,比如它們是基于多步驟的方法,并且一次只能關注一個語義部分。Lee等人于2018提出了一種名為SCAN的交叉注意力算法,用于計算圖像和句子之間的相似性。為實現交叉注意力機制,它們將圖像表示為一組區域,將句子表示為一組單詞。交叉注意的核心思想是,既要用句子作為query來關注圖像區域,也要用圖像作為query來關注單詞。

      簡單來說,圖文匹配本質上是計算圖像和文本之間的相似度的問題。早期研究將圖像和文本編碼成全局特征,并通過點積計算它們的余弦相似度。在隨后的工作中,采用了細粒度特征-目標級特征來代表圖像,單詞級特征來代表語言。他們還開發了更復雜的算法來計算相似性,比如交叉注意力的方法。

      D.其他任務

      在視覺-語言跨學科領域中,有許多我們無法詳細闡述的任務。因此,我們下面簡單中列出了一些重要的任務,包括:

      文本-圖像生成: 給定一段文本,生成包含該文本內容的圖像。關于這部分更多細節請查看文章的IV-B部分。

      視覺對話: 給定一個圖像,一段對話歷史,和一個關于圖像的問題,回答這個問題。

      視覺推理: 與要求回答有關輸入圖像問題的VQA任務類似,視覺推理要求進一步理解圖像的能力。視覺推理任務通常包含足夠的關于圖像中的對象、問題結構等的注釋。

      視覺蘊涵: 給定一幅圖像和一篇文本,判斷該圖像在語義上是否包含輸入文本。

      短語基礎和參考表達式理解: 這兩個任務需要一個模型來輸出與文本對應的邊界框。對短語基礎而言,文本是一組短語; 對于引用表達理解而言,文本是一種表達。

      在特定任務方法的時代,研究人員為不同的任務設計了特定的模型。盡管不同任務的模型差異很大,但它們遵循著相似的軌跡。它們都有三個階段,如圖1所示。這個時代的技術發展為VLP時代奠定了基礎。



      3

      視覺語言聯合表征

      預訓練和微調范式已被廣泛應用于多個領域和各種下游任務。利用流行的大規模預訓練最重要的原因在于大量可用的數據集以及GPU的快速發展。在單模態的語言/視覺預訓練成功的推動下,研究人員開始探索語言和視覺的聯合表征,因此提出了跨模態VLP模型。

      近年來VLP模型的興起主要是受到了語言模型中架構設計和訓練方法的啟發。其中最重要的突破之一是由Vaswani等人于2017開發的用于改善語言表征的Transformer。使用多個堆疊的注意層,Transformer可以以高并行性在全局范圍內融合語言標記上的信息,這有利于高效的表征和大規模的訓練。

      Transformer的一個成功應用是BERT,它利用Transformer編碼器并引入了雙向屏蔽技術,允許每個語言標記雙向關注其他標記。如圖5所示,訓練是通過用一個特殊的[MASK]標記(即掩模)替換一些文本標記來進行的,并使用其上下文信息來預測每個[MASK]。

      該技術可以將語言表征訓練看作是一個去噪過程,在去噪過程中,輸入的句子能夠學習去用一些有噪聲的標記進行自我重構。這種去噪訓練迫使存在[MASK]的標記利用所有不存在[MASK]的信息,從而產生語境化的表達。

      基于Transformer語言模型開發的體系結構設計和掩模訓練技術是各種跨模態開發背后的主要原則,這些開發促進了最近VLP模型的激增。圖5(b)顯示了一個簡單的跨模態BERT。與語言訓練類似,它對圖像進行標記化,并使用一定的技術將圖像與語言標記一起嵌入,這些在后面將詳細介紹。通常,會將標記化的視覺特征和文本特征一起輸入帶有掩模語言訓練的Transformer編碼器,以學習聯合表征。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖5 (a)原始的單模態BERT,其中隱藏了一些語言符號進行預測,以訓練語言表示。(b)具有多模態的改進BERT,其中圖像和語言標記都被輸入到一個類似BERT的Transformer模型中。

      在本節中,我們將介紹VLP模型的主要組成部分。如圖6所示,VLP模型中主要有三大部分,即視覺嵌入(VE)、文本嵌入(TE)和模態融合(MF)模塊。VE和TE通常分別用圖像和文本進行預訓練,而MF則將VE和TE提取的特征,與圖像-文本的預訓練進行融合。

      VLP的目標是學習對象級別語言對齊,語義豐富的視覺表征。對象級別意味著學習后的表征是詳細的,并與對象對齊,而不是針對整個圖像。使用被檢測到物體的特征來表征圖像的研究成果是對象級的。語義豐富力求一種能夠泛化到廣泛語義概念的表征,并且需要從大規模數據集中學習。

      在海量數據集上進行預訓練對于使用較小數據集的下游任務的性能提升至關重要,因為學習后的表征可以在下游任務中傳遞。VLP模型已被證明是非常有效的支持下游任務的方法。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖6 VLP模型的體系結構通常包括視覺嵌入(VE)、文本嵌入(TE)和模態融合(MF)。(a)為雙流模型,(b)為單流模型。在雙流模型中,模態融合是可選的,由語言和圖像編碼器之間的交互(通常是交叉注意)完成。在單流模型中,模態融合是在一個統一的編碼器(通常是多層變壓器)中完成的。

      A 為何需要預訓練

      深度學習本質上是一種統計數據驅動的方法,旨在從已見數據中學習映射函數,以便使用學習到的映射函數對新的數據進行預測。請注意,最終目標是在新的數據上實現良好的性能。在統計學方面,這樣的目標被表示為最小化整個數據空間的預期損失,該損失遵循固定但未知的分布。但是,由于分布是未知的,這種預期的損失最小化并不容易處理。

      在實踐中,必須從該分布中采樣數據,并將經驗損失定義為預期損失的代替。這聽起來可能很奇怪,但實際上是機器學習中常用的做法。例如,對于判斷輸入圖像是否有貓的圖像分類問題,最實用的方法是收集有貓和無貓的訓練圖像,然后通過最小化在該訓練集上定義的經驗損失來訓練分類器。然而,有貓和無貓圖像的分布確實是未知的。

      統計學習理論表明,對于從足夠多未知分布中采樣的獨立同分布(iid)數據,經驗損失最小化結果收斂于預期損失最小化結果。也就是說,漸近地,可以使用iid樣本來逼近由未知分布定義的損失函數。然而,在實踐中,數據永遠不足以代表未知的分布,因此會導致許多缺陷,例如使用新訓練集時性能低下、容易受到對抗性攻擊等。

      預訓練允許人們利用無限量無標簽(或帶有弱標簽)的數據來學習符合下游任務的特征。如此大規模的數據集有助于更好的定義預期損失近似值,以便從數據中學習更穩健和真實的規律。由于預訓練和微調階段之間的共享模型,在非常有限(例如,few?shot)的監督下,微調后學習到的特征被用于下游任務時能夠有很高的精度。這使得預訓練和微調范式成為解決(或減輕)數據短缺問題的有效方案。

      B.  模態嵌入

      文本和圖像本質上是關于維度和結構的不同級別的信息。為解決這種模態差異,通常使用模態嵌入,即從每個模態中獨立提取特征,然后將特征映射到共享特征空間中。如圖6所示,模態嵌入涉及視覺嵌入和文本嵌入,兩者都包含標記化過程和嵌入過程。視覺嵌入旨在遵循文本嵌入的原理,將圖像轉換為多個標記,其特征級別為文本標記。Bugliarello 等進行的消融研究證明數據集和超參數的訓練是許多不同VLP模型性能改進的主要原因,并且還強調了模態嵌入的重要性。

      1)文本標記化和嵌入

      在文本嵌入之前,文本應該被標記化。考慮到語言的離散化性質,早期的工作只是將每個單詞視為一個標記。一項開創性的研究是Word2Vec,它提出了一個連續的CBOW和一個skip?gram模型來訓練詞向量表征。Word2Vec具有良好的計算效率,可以擴展到大型語料庫并產生高質量的嵌入。

      然而,盡管它的詞匯量高達一百萬左右,但這種方法由于稀有或未見過的單詞而存在詞匯量不足的問題,因此難以學習諸如“est”之類的單詞子單元。為解決這個問題,Sennrich等人提出了一種子單詞標記化的方法,該方法使用字節編碼(BPE),將單詞分割成更小的單元。子單詞標記化被廣泛用于包括BERT在內的許多語言模型中。

      大多數VLP模型采用來自預訓練BERT的文本嵌入。由于BERT是使用Transformer編碼器進行掩碼學習訓練的,因此它具有很強的雙向表征能力。

      2)視覺標記化和嵌入

      與離散并排列在單個維度中的語言標記不同,圖像來自高維空間并具有相互關聯的像素值。因此,圖像標記化通常比文本標記化更為復雜。基本上,圖像標記化可以分為基于區域的、基于網格的和基于塊的,下面對它們分別介紹。

      • 網格特征被卷積特征提取器直接從大小相等的圖像網格中提取出來。例如,Huang等人于2021采用網格特征作為其VLP模型的圖像嵌入。網格特征的優勢主要有兩點:第一,方便,因為它不需要預訓練的目標檢測器。第二個是除了顯著目標之外,網格特征還包含可能對下游任務有用的背景。

      • 區域特征由預訓練的目標檢測器提取。最近的VLP模型采用區域特征來學習對象級聯表征。特別是,基于BUTD的工作成果,大多數VLP模型采用在Visual Genome(VG)數據集上訓練的Faster R?CNN作為區域特征嵌入。區域特征有三個基本組成部分,分別是邊界框、對象標簽和RoI特征(RoI池化后的特征向量)。邊界框通常在VLP中用作位置指示符,通過變換編碼到與RoI特征相同的維度空間并添加到RoI特征中。對象標簽在訓練方法中被廣泛使用,例如Masked Region Classification,這些稍后將在III?D3中詳細闡述。區域特征的優勢在于它們幫助VLP模型專注于圖像中有意義的區域。這些區域通常與下游任務密切相關。

      • 塊特征通常通過在均勻分割的圖像塊上的線性投影來提取。塊特征和網格特征之間的主要區別在于,網格特征是從卷積模型的特征圖中提取的,而塊特征直接利用線性投影。塊特征的概念首先由Vision Transformer (ViT) 引入,然后被VLP模型采用。使用塊特征的優點是高效。例如,ViLT將預訓練速度提高了10倍,是很有競爭力的結果。

      圖像嵌入方法通常因不同的標記化方案而異。網格特征和區域特征通常來自預訓練的卷積模型,而塊特征可以簡單地通過線性層嵌入。

      C.  模態融合

      VLP模型的核心是模態融合,它對模態內和模態間融合進行建模,以產生圖像和文本的上下文聯合表征。MF模式可以分為雙流建模和單流建模。VLP的一般結構如圖6所示。

      1)雙流建模:雙流建模旨在將視覺和語言映射到相同的語義空間中。它是模態融合的開創性方法。如圖6(a)所示,它采用兩個獨立的編碼器分別學習視覺和語言的高級表征。雙流設計允許網絡深度和架構適應每種模式。除了每種模態內的模態融合外,一些研究還明確設計了兩個編碼器之間的模態間交互,以實現不同編碼階段的模態融合。

      2)單流建模:單流建模旨在學習一種聯合表征。圖像和文本標記被連接起來并輸入到Transformer中,如圖6(b)所示。大多數VLP模型都采用這種模態融合方案。單流建模執行隱式的模內和模間融合,不受雙流建模中融合階段的架構設計的限制。

      D .訓練

      為學習視覺和語言的聯合表征,視覺語言通常會在大數據集上使用多個自監督學習損失函數對模型進行預訓練。目前主要有三種預訓練方法,分別是圖像文本匹配(Image Text Matching, ITM)、掩膜語言建模(mask Language Modeling, MLM)和掩膜視覺建模(mask Visual Modeling, MVM)。

      1)圖文匹配:

      ITM的目標是預測一對圖像和文本是否匹配。ITM可以表述為一個二元分類任務。之前的工作在特殊令牌[CLS]的輸出上應用sigmoid函數來預測輸入的圖像和文本是否匹配。損失函數為:

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      其中  表示一個語言符號序列, 表示視覺內容。或 以表示圖像是被匹配 或未被匹配 。

      2) 掩膜語言建模:

      Chen 等人于2020年利用MLM 激勵模型學習語言符號與視覺內容之間的隱含關系。目標是根據已知的語言標記和可視內容重構掩膜語言標記。這個目標可以表述為:

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      其中表示沒有第個單詞的句子。請注意,盡管通常采用BPE進行語言分詞,但最小的掩碼單元是一個完整的單詞,而不是一個子單詞。這是因為由于信息泄露,可以很容易地從周圍的子詞中預測出子詞。

      也有改進版本的MLM。例如,Sun等人于2019年提出了知識掩膜語言模型,該模型執行短語級掩膜和實體級掩膜,將短語和實體級知識集成到語言表征中。對于實體級掩膜,它們將命名的實體視為一個整體。例如,J.K.羅琳(J. K. Rowling) 包含三個符號,是一個人名,應該在實體級掩膜中一起被掩膜。短語級別掩膜將一組詞作為一個概念單位。它們掩膜了屬于一個短語的所有標記,并同時預測它們。

      3) 掩膜視覺建模:

      受MLM的啟發,MVM被設計用來通過重構被掩膜的視覺內容來學習更符合實際的視覺表示。由于圖像的信息密度低于語言的信息密度,MVM比MLM具有更大的挑戰性。在重構缺失的單詞時,需要對語言進行復雜的理解。

      相反,缺失的圖像塊(patch)可以在不需要跨模態理解的情況下從鄰近的patch中恢復。為克服這一差距,大多數工作都是掩蓋信息密度相對較高的目標區域。其他工作如SOHO使用視覺字典(VD)來表征視覺領域更全面、更緊湊的語義,因此它們可以像MLM一樣應用MVM。綜上所述,主要有四種MVM方案。

      1) 掩膜區預測(MRP): MRP最小化掩膜區預測出的特征與由經過訓練的物體檢測器輸出之間的距離。

      2) 掩膜區域分類(MRC): MRC需要一個模型來預測每個掩蔽區域的對象語義類別。

      3) 帶KL-divergence的掩膜區域分類(MRC-KL): 由于MRC的目標標簽不準確,MRC-KL采用軟標簽作為監督信號,這是物體探測器在SoftMax后的原始輸出。

      4) 用可視化字典進行掩膜可視化建模(MVMVD): 與具有詞匯字典的語言模型類似,MVMVD需要一個可視化詞匯字典(VD)。MVMVD的目標是重構被屏蔽的VD令牌。

      有兩點值得注意。首先,為了鼓勵跨模態融合,一些工作,如UNITERVL,在訓練期間每次只屏蔽一個模態的令牌,以鼓勵被屏蔽的令牌對另一個模態進行缺失信息的處理。其次,由于相鄰的圖像網格高度相關,MVMVD傾向于映射到相同的VD令牌; 當執行重構時,模型可以直接復制周圍的令牌。

      因此,所有映射到相同VD令牌的視覺嵌入向量在SOHO中一起被屏蔽。盡管有上述方法,但有效的視覺建模仍然是一個具有挑戰性的問題。一些VLP模型(如SOHO)的消融研究的結果表明,增加MVM任務只會對性能產生微小的額外改善。Cao等人于2020發現,在下游任務中,VLP模型表現出關注文本信息而不是視覺信息的傾向。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      圖7 VLP方法的總覽。研究成果按公布時間分類。我們還展示了每個作品來自的主要機構的標識。

      E.  預訓練研究概況

      本節在介紹了VLP模型的一般流程之后,總結了跨領域VLP的一些開創性工作。受NLP和CV預訓練成功的啟發,近年來VLP領域的研究大量涌現,以尋求統一的跨模態表征。VLP研究成果的形勢如圖7所示。我們在這一節中詳細闡述了一些有代表性的研究。

      單流模型: VideoBERT是學習視頻和語言聯合表征的一項開創性工作。其主要思想是將可視的和文本的標記輸入到構建在BERT上的單流模型中。文本標記通過自動語音識別方法將視頻語音轉換為文本來提取,視覺標記通過使用卷積主干從視頻片段中提取特征來獲取。VideoBERT能夠執行廣泛的下游分類和生成任務,包括視頻說明和零樣本掩膜動/名詞預測。請注意,VideoBERT是使用烹飪視頻進行的預訓練,其中的內容是有教學意義且高質量的。它假設口語與視覺內容是一致的,這就限制了它只能應用于某些視頻(例如教學型視頻)。另一個限制其泛化性的問題是其精心設計的字幕文本模板,例如模板:now let’s [MASK] the [MASK] to the [MASK], and then [MASK] the [MASK],這只適用于烹飪視頻。

      Li等人提出了一個名為VisualBERT的簡易單流VLP模型。提取的視覺和文本標記被直接組合并輸入到Transformer中,從而在Transformer里可以隱式地執行跨模態融合。與VisualBERT類似,一些并行研究,如Unicoder VL、VL- bert 和UNITER也采用了單流架構。這些VLP研究在以下幾個方面是相似的:1)它們都利用目標檢測主干來計算圖像嵌入。2)它們都采用掩碼語言建模任務。3)均采用單流BERT架構。但它們在預訓練的方法和數據集上存在差異。

      雙流模型: ViLBERT和LXMBERT是將BERT擴展到雙流VLP模型的開創性工作。它們在Conceptual Captions數據集上進行預訓練,并利用預訓練的Faster R-CNN模型來檢測區域作為視覺標記。ViLBERT用兩個并行流分別處理視覺和文本標記,它們可以在需要時通過跨注意層融合跨模態信息。換句話說,ViLBERT假設了視覺和語言的不同處理架構。它的跨模態融合設計為兩個處理流程之間的稀疏和顯式融合。LXMBERT與ViLBERT的區別在于解耦模態內和模態間的處理。更具體地說,視覺標記和文本標記在第一階段被分別編碼,然后輸入到跨模態編碼器以產生聯合表征。

      其他融合方法: 從根本上說,單流建模和雙流建模在融合時間上有所不同,其中單流在早期融合不同的模態,而雙流更喜歡在融合前提取每種模態的高級特征。SemVLP提出通過迭代訓練來組合這兩種流行的建模架構。這種方法利用了這兩種架構,并在低級和高級上執行跨模態語義對齊。特別是,Transformer編碼器在兩種建模方法之間共享,在雙流編碼器中添加了一個額外的跨模態注意力模塊,這有助于語義對齊和減少參數。大多數VLP模型試圖將視覺和語言編碼為單獨的標記,這些標記通過模態融合顯式或隱式地相互作用。另一類VLP模型基于目標檢測模型將視覺標記附加到文本標記。B2T2提出在文本標記中融合檢測到的目標的特征,在此基礎上在預訓練中執行MLM  和ITM。在B2T2中,標記T可以表示為:

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      其中t是原始文本嵌入,是標記為的檢測到的對象的數量, 是第  個對象的邊界框的嵌入,表示從邊界框中提取的視覺特征。B2T2還分析了融合對象和文本標記的階段。結果表明了早期融合的有效性。

      彌補模態差距的早期嘗試:為實現生成和理解任務,Zhou等人提出了一種統一的視覺語言預訓練方法。它引入了兩種掩碼方案,即雙向注意力掩碼和序列到序列掩碼,以分別增強理解和生成任務。值得注意的是,這種統 一的VLP方法僅在預訓練期間采用MLM,并在圖像字幕和VQA方面取得了有競爭力的表現。12?in?1將多任務訓練擴展到四個廣泛任務,并在12個數據集上進行預訓練。實驗結果表明,多任務訓練可以持續提高下游任務的性能,并產生參數更少的更輕量級的模型。

      VILLA基于UNITER的設計,在嵌入級別將對抗訓練引入了視覺和文本標記。它通過在嵌入空間中添加擾動作為正則化來執行對抗性訓練,并產生了不錯的性能改進。

      受ERNIE的知識掩膜方案的啟發,結構化知識首先被納入ERNIE?ViL的VLP模型中。為了通過構建場景圖來開發更好的跨模態語義對齊,ERNIE?ViL提出了場景圖預測任務來對圖中的對象、屬性和關系進行建模,以學習對象級和屬性感知表示。將知識納入跨模態訓練具有挑戰性,并且至今仍然是一個懸而未決的問題。

      Grid & Patch features:雖然區域特征嵌入的流行促進了VLP模型的訓練,但它也限制了VLP模型的可擴展性和泛化能力。經分析,Faster R?CNN的區域特征的弱點如下所示:

      • 類別數量有限:視覺特征受到在具有預定義對象類別的、相對較小的數據集上進行訓練的目標檢測模型的限制。例如,BUTD中廣泛采用的Faster R?CNN 模型是在VG上訓練的,其中有固定的1594  個對象類和524個屬性。

      • 質量低:由于Faster R?CNN 模型是在標簽良好的小型數據集上訓練的,因此區域特征經常受到低質量的影響。

      • 缺乏上下文:區域特征在沒有任何背景信息的情況下提取屬于特定類別的RoI特征,導致忽略了這些區域特征之間的語義關系。實際上,這些語義關系很重要。

      PixelBERT試圖打破這一限制,通過直接從像素特征中學習來充分利用視覺信息。為了降低計算成本和提高模型的魯棒性,他沒有將所有像素都用作視覺特征,而是在預訓練期間隨機采樣100個像素。然而,實驗結果表明,隨機采樣僅略微提高了性能,在下游任務中的VQA分數低于0.5。

      SOHO是另一項利用網格特征進行跨模態理解的開創性工作。為了學習視覺上下文的語義全面表示,SOHO提出了一個學習用于視覺標記化的VD。SOHO是通過首先從卷積網絡中獲取高級特征來學習VD的,然后根據特征相似性對這些特征進行分組,并饋入移動平均編碼器以動態更新VD。

      由于視覺嵌入是可訓練的,SOHO是一個端到端的預訓練框架,可以直接從像素中學習,無需邊界框。通過訓練過程中的動態VD更新,VD中每個標記的序列號可以像語言標記一樣被視為一個標簽,從而可以很自然地執行掩碼視覺建模。對于預訓練任務,SOHO提出了一種新穎的MVMVD方法(在III?D3中描述)來同時掩蓋圖像中同一標簽的所有視覺標記,以避免任何信息泄漏。

      上述基于區域或網格的圖像嵌入計算量很大,提取的高級特征阻止了跨模態信息的早期融合。受ViT的啟發,ViLT采用圖像塊的簡單線性投影作為視覺嵌入,將預訓練速度加快了10倍,并且實驗結果具有競爭力。這意味著,相比于視覺嵌入,模態融合更可能是改進VLP模型表征的關鍵。

      改進對齊表示:視覺語言對齊表示是VLP的基本目標。為了實現這一目標,一些研究提出可以在VLP中采用額外的對象級數據。例如,許多VLP方法采用了RoI區域特征和檢測模型。然而,作為重要組成部分的檢測到的對象標簽并未在VLP模型中被明確建模。為了利用這些附加信息,Oscar引入了對象標簽作為錨點,以幫助學習跨模態對齊的表征。這種學習過程在經驗上是自然的,因為檢測到的對象標簽經常出現在和圖像配對的文本中,這有助于對齊視覺和語言。

      此外,使用對象標簽進行訓練有助于學習對象的共現(例如,和對象單詞會共同出現的單詞)。因此,Oscar在下游理解和生成任務上產生了顯著的改進。然而,Oscar  的缺點也很明顯,它依賴于標記良好的圖像字幕數據集,因此難以擴大訓練規模。

      由于VLP模型受到不充分對齊的(圖像、字幕)對的限制,VIVO建議使用大量的(圖像、標簽)對來增加預訓練的程度。VIVO采用Hungarian匹配損失進行掩碼標簽預測,這使得它可以進行視覺詞匯學習,提高模型描述下游任務中的新對象的泛化能力。它在NoCaps基準測試中首次超過了人類的表現。更具體地說,它采用ResNeXt152?C4并合并了包括VG、COCO、Objects365和  OpenImagesV5的四個公共數據集用于大規模訓練。  相比于VIVO和Oscar等VLP模型,VinVL有了顯著改進,并在NoCaps、圖像字幕和VQA排行榜上取得了最佳成績。



      4

      擴大模型和數據規模

      盡管研究者已經在視覺語言聯合表示方面取得了令人鼓舞的進展,但上述大多數研究主要集中在追求良好的跨模態對齊的對象級表示上。而且他們采取了一個門檻較高的假設:假設圖像和文本對被很好地標記。這項假設將訓練數據集限制為相對較小的擁有“黃金標簽”的數據集。例如,Conceptual Captions是廣泛用于VL預訓練的最大公共數據集,它具有300萬個圖像?文本對。

      為了使模型獲得更豐富的語義和更強的泛化能力,研究者非常需要更大的弱標記數據集,例如網絡爬蟲數據集。CLIP和DALL?E將大規模網絡爬取數據用于預訓練的第一個成功實踐案例。受CLIP和DALL?E成功的啟發,最近有幾項研究工作進一步構建了基于更大數據集的更強大的模型。

      本節旨在介紹使用大規模弱標簽數據集訓練的模型。本節分為兩部分。第一部分包括利用大規模數據集進行視覺理解的工作,例如CLIP、ALIGN、SimVLM和Florence。第二部分包含基于諸如DALL?E、GODIVA、NUWA等大型數據集的視覺生成模型。

      A.  視覺理解

      CLIP中的核心思想是訓練方法。CLIP不像其他VLP方法那樣通過訓練去預測掩模的視覺或文本標記,而是學習識別成對的圖像和文本。CLIP的目標是:在給定一批數量為N的(圖像?文本)對時,CLIP應能夠預測N × N個可能出現的對中哪些是匹配對(正樣本),哪些是非匹配對(負樣本)。經過預訓練后,CLIP可以通過使用類似于“a  photo  of”等短語加上類別名稱作為提示來告訴模型輸入圖像與哪些類別最相似,從而執行零樣本圖像分類。與全監督的基線相比,零樣本CLIP在27個數據集中的16個數據集上優于基線。

      與CLIP類似,ALIGN也采用了具有對比損失的雙編碼器模型執行零樣本任務。它利用了一個更大的原始數據集,包含1.8B圖像?文本對。ALIGN在許多零樣本視覺任務上的表現優于CLIP,這證明用更大的數據集訓練會帶來更好的性能。

      除了視覺任務,ALIGN在圖像文本檢索任務上的表現也優于之前的工作成果。SimVLM開發了一種新的VL預訓練方法。它遵循一個簡單的前綴語言建模目標,以自回歸的方式預測下一個標記。它在多個VL任務上取得了有競爭力的結果,并具有文本引導的零樣本學習能力。與之前采用粗略(圖像級)表征和靜態(圖像)數據的工作不同,Florence采用細粒度(對象級)表征并擴展到了動態(視頻)數據。對于對象級表示,研究者將適配器Dynamic  Head添加到了Florence中的圖像編碼器并使用額外的對象檢測數據集進行訓練。通過對9億對的圖像?文本對的預訓練,Florence在44個具有代表性的基準中的大多數中取得了新的最先進的結果。

      除了零樣本分類,CLIP還可以幫助檢測。例如,ViLD提出了一種通過CLIP蒸餾的零樣本檢測器。其他研究表明,CLIP 可以學習那些更像來自人腦中的神經元的多模態特征,并且它還可以幫助完成VL任務。

      B.  視覺生成

      除了視覺理解,大規模弱標記的圖文配對數據也可以輔助文本到圖像的生成。Ramesh等人(2021)開發了一種名為DALL?E的圖像生成系統。DALL?E使用離散變分自動編碼器(dVAE)將圖像轉換為離散的視覺標記,以便將一個(文本、圖像)對視為單個數據流。

      在訓練期間,文本圖像流被送到僅為解碼器的Transformer中。在其中應用注意力掩碼時,每個圖像標記都可以看到所有的文本標記。文本標記之間的注意力掩碼是標準因果掩碼。圖像到圖像的注意力使用行、列或卷積注意力掩碼。在推理時,給定文本標記,生成過程是像在GPT中一樣以自回歸方式預測圖像標記。DALL?E在四個方面展示了令人印象深刻的結果:創建動物和物體的擬人化版本、組合不相關的概念、渲染文本以及對現有圖像應用轉換。

      受DALL?E訓練方法的啟發,Wu  等人(2021a)提出了一種名為GODIVA的方法來從文本中生成視頻。與DALL?E類似,GODIVA對視頻的每一幀進行標記,并將文本和視覺標記順序連接為流來訓練模型。DALL?E和GODIVA分別設計用于文本到圖像的生成和文本到視頻的生成,而Wu等人(2021b)提出了一個統一的視覺生成模型,該模型在文本到圖像、文本到視頻、視頻預測等8個下游任務上取得了最先進的結果。

      他們提出了一個能夠編碼的3D  Transformer,它能夠對所有三種數據格式進行編碼,包括文本(1D)、圖像(2D)和視頻(3D)。為了優化視頻的效果,他們還設計了一個3D  Nearby  Attention來沿空間和時間軸應用注意力。



      5

      未來趨勢

      在過去幾年中,我們見證了VLP模型如何逐漸使用大量弱標記和更多樣化的數據。未來,模型和數據的規模都將不斷擴大,從而實現更強的模態合作,甚至是統一表征。此外,結合知識可以進一步增強VLP模型,從而使其獲得更好的泛化能力。在本節中,我們將討論這些未來趨勢。

      A.  走向模態合作

      除了使用VL數據集改進跨模態任務外,模態合作技術正逐漸在預訓練中被使用,從而提高單模態任務和多模態任務的性能。模態合作就是不同的模態互相幫助,以學習更好的表征。例如,用視覺數據改進語言任務,用單模態數據改進跨模態任務。

      1. 利用視覺數據改進語言任務

      研究者已經嘗試過利用視覺信息改進語言學習,并在廣泛的語言任務上進行了探索,其中包括機器翻譯、語義解析和語言基礎等任務。這些研究探索是為特定的語言任務量身定制的,并且這些研究成果之間可能存在模態差異。

      Tan和Bansal(2020年)提出了一種帶有視覺輔助的語言表示的通用預訓練模型,其中引入了“vokenization”模型,以將視覺語言對齊從圖像說明數據集外推到純語言語料庫。更具體地說,使用圖像文本匹配對“vokenization”模型進行訓練,以構建視覺圖像詞匯表,然后利用該詞匯表將僅語言數據集中的文本標記映射到檢索到的得分最高的圖像。實驗結果表明,它的性能相比自監督語言模型有了額外的進步。

      2. 使用單模態數據改進跨模態任務

      為了解決數據短缺問題,一些VLP模型利用額外的單模態數據來提高表示能力。例如,在圖像?文本數據集中,文本通常很短,只帶有幾個標記,這限制了文本的表征能力。因此,研究者在VL?BERT中添加了額外的語言語料庫來改進跨模態任務中的語言部分。

      B.  走向通用統一模態

      由于Transformer架構,研究人員在單模態和多模態表征學習方面都取得了顯著進展。在前面的部分中,我們討論了多模態表征和模態合作,它們以不同的方式連接視覺和語言。目前,該領域內的一個更大的目標是建立一個可以統一多種模態的通用表示模型。

      在一項開創性的工作UNIMO中,一個統一的預訓練模型被提出,它可以同時處理單模態和多模態的下游任務,包括理解和生成。它使用了大量單模態和跨模態數據進行預訓練,包括BookWiki(Zhu  et  al.,  2015)和OpenWebText(語言數據)、OpenImages(Krasin  et  al.,  2017)和COCO (Lin  et  al.,  2014)(圖像數據)、COCO(Lin  et  al.,  2014)、Visual  Genome(Krishna  et  al.,  2016) 、Conceptual  Captions(Sharma  et  al.,  2018)和SBU(Ordonez  et  al.,  2011)(圖文數據)。

      因此,UNIMO在執行許多單模態和多模態下游任務時的性能得到了大幅改進。另一個有趣的研究成果是Gupta等人開發的通用視覺系統,它可以用于一系列視覺和跨模態任務。

      C.  VL+知識

      模型在執行VL任務時,會有許多任務需要依靠超出訓練數據集的常識和事實信息才能夠完成。但是,大多數VLP模型沒有消耗額外知識的機制。

      ERNIE提出了一種基于知識的多階段掩模策略。該方法沒有直接添加知識嵌入,而是將語言掩蔽在三個級別,即基礎級別、短語級別和實體級別。對于實體級屏蔽,模型會屏蔽整個實體而非子單詞。此類實體包括人員、位置、組織、產品等。還有一種將知識集成到VLP模型中的方法。

      Shevchenko等人(2021)提出將知識嵌入直接注入視覺語言Transformer中。他們首先使用知識嵌入構建知識庫(KB),然后將訓練數據中的句子與知識嵌入進行匹配。在訓練期間,他們使用輔助損失來促使已學習到的表征與知識嵌入保持一致。盡管已經有一些研究工作試圖將知識整合到VLP模型中,但為了完成該目標,仍有許多挑戰需要解決,例如如何有效利用具有高噪音的大型維基數據以及如何以可解釋的方式從知識中學習。

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      雷峰網(公眾號:雷峰網)

      萬字深度好文!視覺-語言(VL)智能:任務、表征學習和大型模型

      分享:
      相關文章
      當月熱門文章
      最新文章
      請填寫申請人資料
      姓名
      電話
      郵箱
      微信號
      作品鏈接
      個人簡介
      為了您的賬戶安全,請驗證郵箱
      您的郵箱還未驗證,完成可獲20積分喲!
      請驗證您的郵箱
      立即驗證
      完善賬號信息
      您的賬號已經綁定,現在您可以設置密碼以方便用郵箱登錄
      立即設置 以后再說
      主站蜘蛛池模板: 棋王梁家辉| 九九电视剧免费观看| 酒店1-70集免费观看高清| 急诊室的故事第一季| 养母的花样年华| 萌宝当家爹地妈咪是特工| 《农场保卫战》满天星法国在线观看 | 消失的她完整版高清免费观看| 公之孚之中字8| ed2k 步兵| 天罡传免费观看全集高清| 韩国老公的上司来家里| 好妈妈5国语在线观看| 荷尔蒙6荷语中文版| 一步之遥电影下载| 牧师讲道2024年最新讲道视频| 原振侠与卫斯理| 特利迦奥特曼全集免费观看| 漂亮的母亲9中字开头6个字 | 云海翻腾孙悟空11| 版坎贝奇《无憾》免费观看 | 国产观看免费高清电视剧在线播放 | 二叔剧情介绍| 幻影丹尼| 混血儿的摇篮| 《情趣用品调教》| 吉首市| 间宫夕贵| 你是我的花朵mv| 《高庄监狱》免费观看| 仁心解码第一部粤语| 无主之花电影在线观看完整版| 家有儿女3| 明星有戏寻找唢呐王| 水电维修工的艳遇电影| 笨鸟先飞的故事| 远远的爱电视剧免费观看| 济公传 郭德纲2013| 好姑娘免费高清在线观看| 食物链删除的片段原声| 黑夜终至电影| 以法之名免费观看| GOGOGO在线观看免费播放电视剧| 巳怎么读| 《美容院2特殊待遇》| 欢乐谷免费观看高清软件| 八爪椅子电影免费观看完整版| 苏拉的失忆症在线观看| 电影情劫| 泰国司机海螺里吃出龙珠| 罪恶王冠16| 鬼神童子国语版| 家庭矛盾4麦乐迪在线| 从结婚开始恋爱电视剧| 决战风铃渡电视剧全集高清| 姨妈的诱惑电影| 火星哥treasure| 日剧公的之浮之手中字免费观看| 三d玉蒲团| 海绵宝宝第12季| 怪盗女谍之天海翼未删减版| 狙击手电影免费观看完整版| 《美容院:特殊待遇》完整版| 笨厨二美| 大明风华在线观看免费下载播放| 翻译官小姐短剧免费观看| 《一个真正的女人》| 电影法国空乘2019满天星法版| 高压监狱2在线完整免费高清原声满天星2019| 金瓶梅电影 未删减版| 侠岚第3季全集| Melody女超人| 翁止熄痒禁伦短文合集免费视频| 爸爸要播种子美国电视剧在线观看| 裤袜视界| 魔幻手机第一部| 一起愁愁免费观看高清电影| 小麦进城电视剧全集百度影音| 暴走财神1| 夫妻性按摩影院| 东北风云| 美丽的水蜜桃5伦理观后感| 明明不喜欢电视剧全集免费观看| 黑帮老大和我的365天第一部| 漂亮小瘦子7电视剧免费观看| 猪猪侠之超星萌宠3| 金瓶梅 电影下载| 铁证现场| 哥布林杀手动漫| 战狼6免费观看完整版| 阿郎的故事插曲| 陈小春版鹿鼎记免费| 交换上司的秘书在线播放| 牛郎织女电影| 高清《无情的光芒》完整版在线观看| 牙医姐妹1986无删减版| 神隐35集| 小苍解说| 蜡笔小新电影国语| 你比星光更美丽免费观看全集| 银瓶梅韩国| 肉欲伦JIAN| 城市猎人成龙国语| 瓜卢达佩的玫瑰在线观看| 县委大院电视剧免费观看| 伙记办大事| 牧教师6| 《你的孩子不是你的孩子》| 西峡县| 刘老根5全集免费观看完整版| 军火女王 第二季| 一起愁愁愁30分钟电视剧免费观看电视| 我的青梅竹马是消防员 第一季| 美国好人家| 牙医诊所1986电影完整版在线观看| 阿旺新传3| 白仙儿动画搞笑| 宁安如梦电视剧在线观看全集| 嫁给西北糙汉子的小说爱情| 《需要爸爸播种子》在线观看播放_HD/高清_免费无删减完整版电影 - 星辰影院 | 濑户之花嫁| 《温度爱情》免费资源下载| 红高粱电影| 一拳超人在线观看| 甜蜜第2季无马赛免费观| 农场主的女儿们免费看第一集| 味道云南 纪录片| 由良千岁在线观看| 十七岁完整版在线观看| 甄嬛传高清在线观看免费完整版| 王多鱼视频观看全集高清| 堕入地狱2| 步步惊心剧情| 电影《意》在线观看| 北京铁路车迷| 小红帽3满天星版| 新扎师妹2粤语| 《幸福一家人》电视剧| 《家庭矛盾4》麦乐迪观看| 小小安妮第三季| 法证先锋5粤语全集免费观看| 理发店韩国宋智考| 爱我就别想太多大结局| 和平精英火箭小子攻略| flowerover真人| 种上爸爸的种子在线| 奶大女朋友2伦理| 爸爸接种2| 僵尸伯伯国语版在线播放| 本溪市| 甜蜜惩罚13| 皇后心尖:皇上独宠全集免费| 《替夫还债2》| 伙伴男孩韩剧免费观看| 继承人电视剧全集| 《女律师替夫还债》电影完整版在线| 1992在线观看| 原神旅行者插雷电将军的游戏 | 王子变青蛙第二部01| 出差商务大学生| 启航当风起时电视剧全集免费观看 | 国产免费观看高清电视剧在线| 拔掉57颗牙是什么体验| 罗莉的时间| 美味快递员特殊待遇2免费观看| 我爱男闺蜜迅雷下载| 薛平贵与王宝钏电视剧全集| 【中文字幕】IPX668新任女教师中出笼城轮姦 白峰美羽 - 色网 | 完美广播| 需要爸爸的种免费观看| 东北往事2之黑道风云20年| 财神客栈在线观看| 丈夫的部长在线观看免费版黄色电视剧全| 不一样的男子| 蓝白红三部曲之蓝| 美国空乘2019电影完整免费高清原声奔跑吧中文字幕 | 韩剧我的漂亮瘦子8剧情介绍| 江苏卫视花样年华全集| 不良义姐受辱中| 暗宅之迷| 成全看在线| 斩服少女完整版在线观看| 白峰在线免费观看| 一个朋友的母亲| 海底小精灵| 兴风作浪3电影| 日常卿卿电视剧免费观看全集| 破地狱粤语版| 单身妈妈3高清全集在线观看| 医院特殊待遇2| 疯丫头 第一部| 老公我要电影免费观看| 战狼6欧洲少女完整版| 斗罗大陆2绝世唐门10| 做aj的电视剧大全免费观看下载| 镖行天下之至尊国宝| 播放 - 女律师的堕落高清 - 剧情电影 - 973影视 | 3对1,初次体检2| 黄山市| 八佰高清免费完整电影在线观看| 延禧宫攻略| 和静县| 酋长的男人在线观看| 双世萌妻| 韩娱攻略| 《女律师还债》| 行尸走肉第三季13| 高清《民国大侦探》免费观看| 做aj的电视剧全部免费| 斛珠夫人电视剧在线观看| 阿尔法特种部队| 牙医赤子板栗免费| 漫长的季节在哪个平台看| 惊天桃色劫完整版高清国语电影 | 天降之物14集| 我的妹妹雯雯| 女超人麦乐迪无删减版在线观看 | 东京吸血鬼酒店| 长津湖枪版| 发国少女6| 电影黄金大劫案| 魔镜号巴士街头中文字幕在线| 疯狂动物城英语版免费| 刀郎演唱会首站成都| 洛阳影视| 高压监狱2高清完整版免费播放| 中国维和警察 电视剧| 花街狂奔电影| 《战争之暴行女囚》免费观看高清| 千金归来全集免费| 高清《房奴试爱》| 新手律师满天星完整版| 谍战剧《破绽》柳云龙在线观看全集| 绝对权力剧情| 成都警方通报天府二街伤害案 | 与部长出差中文电影| 18GAY 台湾男同| 水儿武士| xl司令全集| 五号特工组1免费观看完整版高清| 黑白诀在线观看| 娃娃脸5完整版| 人生大事2022在线观看| 电视剧神话免费观看完整版| 娃娃脸4在线观看| 两个女人的诱惑在线观看 | 沧元图55集| 韩国女主播朴妮唛kw7142| 新月格格电视剧全集播放免费观看| 南洋十大邪术完整版| 一闪一闪亮晶晶电视剧免费观看 | 《你的指尖扰乱我的心弦》| 97社在线观看| 白丝学生羞涩被弄喘不停视频| 美丽小蜜桃6| 追星星的人| 我想和你好好| 电影时间停止器在线观看完整版| 《娃娃脸4》少女| 第三次初恋| 特殊的保险推销员2中国| 铁血少年| 知更鸟罗宾| 东北话版猫和老鼠| 电影《活着》在线观看| 锁定:怒火危崖| 开心鬼上错身女主角| 四个少妇全身稞体精油按摩 | 电影八尺夫人 意大利 完整版免费观看 | 老公原谅我在线| 白玉县| 嘻嘻哈哈四重奏| 隋唐英雄108| 美丽的谎言泰剧| 瓜达卢佩的玫瑰无删减| 金水桥边电视剧| 河南电视台法制频道今天7:50| 启航当风起时| 英雄儿女| 埃及皇后2003| 公主动画片全集| 吴清任上海市委副书记| 一个妈妈的9中字头强华驿演员表| 水浒传电视剧2011| 偷拐抢骗| 麦乐迪的女超人在线观看完整免费满天星百度云 | 需要爸爸来播种电影| 赌神1国语高清| WRITE AS 黄瓜| 进击的巨人在线看观看| 欧式少女第16集哪里可以看 | 春光灿烂猪八戒电视剧| 私人女性监狱-言情片-高清完整版-全集免费在线观看-tvb云播 | 咒术回战第一季中文版| 木下檩檩子电影免费观看2023年最新| 奈克瑟斯奥特曼| 流量女王短剧全集| 电影牙医姊妹完整版免费观看| 火锅米线培训| 公的浮之手电影完整版| 家族之歌| 百味人生| 《妻子与游泳教练》| 武林风六国拳王争霸赛| 许双军河南鹤壁| 扫黑风暴怎么变成28集了| 金瓶梅TV| 一念永恒在线观看动漫| 中国教育考试网官网登录入口| 《战狼6》免费观看| 郭达蔡明小品打针| 老公我要电影免费观看| 燃烧的夜晚| 女子特工满天星| 我愿意 孙红雷| 空中飞人打一字| 《驯服2》丽卡和谁在一起了电影名字 | 南北腿王| 玉蒲团之愉情宝鉴在线观看| 星克莱尔《豪门贵妇》在线观看 | 名媛望族粤语版| 日本年轻母年经4| 泰国满天星| 安徽师范大学主页| 《关于爱》在线观看免费| 白峰电影在线播放观看免费版| 寒门弃少:白手起家创辉煌全集免费| 电影失眠| 以法之名张译在线播放| 炸天小姐满天星观看| 新梅瓶1一5集在线观看| 金瓶梅电影完整版在线观看| 《插曲的痛》免费播放完整| 终极格斗士| 非诚勿扰泰国女嘉宾| 韩剧我愿意国语版| 男女在一起愁愁愁电视剧全完整版| 推女郎68期无删减视频| 红顶商人胡雪岩高清| 销售的秘密2在线观看免费版 | 中方突然宣布出兵| 无颜之月免费观看完整版电视剧| 公之浮之5HD高清版| 罪孽 泰国| 王者清风全集| 牙医姐妹电影观看免费完整版| 约会大作战第3季| 故乡的泥土全剧免费观看| 电视剧东陵大盗| 中字hd的丈夫的下属的成就与贡献| 谁能百里挑一20130427| 囧妈初一上线免费播出| 玉环县| 《伊波拉病毒第二部在线播放| 天才枪手 电影| 恋爱先生在线观看免费| 男女生一起愁愁愁电视剧在线观看 | 凯帕克63部电影合集在线观看 | 妈妈爱上儿子同学完整版电影 | 家有虎妻 电影| 《猎杀之后》| 四个已婚妇女去按摩| 日剧《轮到你了》第二季在线观看 | 《朋友夫妇·交换3》 | 永不磨灭的番号大结局 | 想要爸爸| 世界之外| 只因我们天生一对泰剧在线观看| 好妈妈33免费观看技巧| 宫心计国语| 陆贞传奇在线观看免费全集高清| 教授小星| 姐姐的男友2| 公主与女仆| 女囚七人第一集| 蓝色隐形帽子| 重生八零:俏媳妇致富经全集免费 | 天目危机| 屠宰森林| 电视剧归路全集免费观看| 美国电影需要爸爸播种 | 西班牙版掌中之物| 漂流欲室下载| 天空战记国语| 屠场呕吐娃娃免费高清观看完整版| 美丽人妻在超市被春药| 舞出我人生电影| 好好的时光电视剧| 插曲的痛30集全集免费观看第12集| 沙漠行动| 风信子开花后怎么处理| 一只鸽子在印度被当成中国间谍| 妻子背着丈夫招待社长| 女子特战队电视剧40集电视剧| 刘美君电影| 水电维修工的绝遇2| 不输男儿郎:将门嫡女沙场全集免费 | 齐天大剩| 女邻居请邻居修灯泡修灯是什么剧| 《私人女性监狱》免费在线播放观看_正片/未删减_1080P高清完整版电影 - 星空 | 电视剧绝不放过你| 公主与青蛙电影| 电影修理工的艳遇| 陈情令免费观看完整版| 修真界帝尊短剧全集免费观看| 电影深海| 壮志凌云女版在线观看| 张本煜回怼男观众称“大清亡了” | 小寡妇哭坟| 下一站别离大结局| 戴安琳恩《满天星》| 忠贞电影演员表| 金蝉脱壳| 红领章电视剧免费播放| 酒店1-5集高清免费观看 | 《法国空组》4| 流浪地球1免费观看完整版| 竹马是消防员未增减资源| 维修工人的绝遇免费观看第三季| 我的漂亮朋友5在线免费观看| 雷神暂退好莱坞| 电视剧《女人》全集免费观看| 满天星版壮志凌云在线观看| 人间中毒在线观看未删版完整版| 浮夸现场版| 僵尸道长1高清国语版在线观看| 超级教师3免费更新集数| 光环美剧| 泡沫爱情电视剧| 恐龙 2000 电影| 黄金仓库在线观看| 电视剧用心过日子| 踏血寻梅电影完整观看| 赤壁 电影| 播放_爱我几何免费完整观看_在线观看_馒头影院 | 电影小字辈完整版免费观看| 破产姐妹第四季| 啄木鸟版壮志凌云电影在线观看完整版 | 电视剧拜托小姐| 满天星在线观看完整免费高清原声满天 | 有个地方只有我们知道| 电视《金悔瓶》免费观看2008样| 邢台属于几线城市| 电影《一步之遥》在线播放| 电视剧九九全集播放| 禁忌5在线免费观看| 七政四余择日| 高楞青年| 《西游 降魔篇》| 美国电影《需要爸爸播种2》在线观看| 年轻老师2| 青春荷尔蒙1| 男与女 电影 2016| 烟花巷里禁忌之恋| 黑白禁区免费观看全集电视剧结局| 守望相助| 战神3中文版下载| MSD-005 欧妮 维修工的心跳艳遇(下) 疼痛凌辱高潮快感-在线观看-338TV | 97在线免费观看| 人生大事2022在线观看| 鸭王2免费看| 漂亮的妈妈7中字开头7个字| 爱情天使| 好妈妈韩国4中字韩国电影| 日韩男按摩师性按摩电影| 那刻的怦然心动| 千金女贼 电视剧| 战神阿修罗| 鲇川奈绪| 鹿鼎记之神龙教| 影子爱人百度影音| 蛇姬cos| 望城县| 醉笑卧乡野| 长安的荔枝免费播放| 苍井空rmvb| 第11个前锋下载| 爱我几何原版完整版| 坎贝奇品味人生未删减版在线| 《九歌》电影完整版| 隐身女侠的电影免费观看| 美国电影需要爸爸播种中文版| 2019商务旅行女老板戴的帽子经典电影 | 维修师傅的艳遇正在播放| 长安24集电视剧免费观看| 《痴心劫》理伦片在线观看| 《打黑风暴》22集全剧情| 杨敏思版1-5集电视剧在线观看 | 《看上女儿》电影免费播放| G点| 人间正道是苍桑| 行尸走肉第二季第二集| 《花琉璃轶闻》电视剧| 《妻子6》在线观看免费版电视剧 坎贝尔《人生无憾》在线播放 | 我有个兄弟叫顺溜| 小伙子爱上隔壁女邻居电视剧| 合肥话评书| 白峰电影在线观看550| 难哄电视剧全集在线观看| 保姆用废弃尿垫给老人擦嘴被判刑| 环太平洋 电影天堂| 韩剧和部长一起去出差的日子| 天龙特攻队国语| 百鬼夜行抄未删减| 人形少女 快播| 《法国空乘5》在线观看| 女律师的坠落日语版| 黑衣女人| 杜拉拉之似水年华结局| 追风行动| 带美影视影院-《妻子做社长秘书偿还债务》新版-最新完整版高清在线观看 | 坂口美穗乃| 非诚勿扰泰国女嘉宾| 西游记后传高清| 黛比浪漫女家教全集| 《猛鬼山坟》免费看| 不信天上掉馅饼| 离婚后惊艳:全城都羡慕我全集免费| 免费性生活电影| 印度电视剧新娘国语版全部| 台军演练机场被炸瘫痪| 全职法师之超级法神| 韩国女销售买房子的电影| 欲拒还迎电影| 六月的日记| 玄心奥妙决| 女员的付出中字1230| 锵锵锵锵锵锵锵锵免费观看电视| 蝴蝶梦越剧| 海贼王480| 陈家洛出场音乐| 黑白配免费观看大全在线播放| 丹麦女孩| 坎贝奇《无憾》完整| 恨锁金瓶在线观看3| 电影《鼠王》免费观看| 高压监控| 最好的相遇电影免费观看| 敌特在行动| 韩国银瓶梅| 无线电春宫| 3d如蒲团| 女人被躁到高潮嗷嗷叫69| 《酒店服务生》第一季动漫在线观看 | 婷妹要努力| 17在线观看免费高清电视剧在线观看| 《逆袭之爱上情敌》| 电影郝蕾版《颐明园》有没有播出| 姐姐韩国电影免费观看 电视剧| 《她被搬运工侵犯》在线看| 坚持翁立友| 画满一张纸| 古玩捡漏:我是捡漏小能手全集免费 | 爱的定义泰剧| 世界第一初恋剧场版| 一起愁愁愁免费观看完整| 民初奇人传电视剧在线观看| 夹震蛋玩到失禁PLAY调教| 月里二嫂猪肉换米| 亢奋电影原版完整版| 麻雀电视剧免费全集观看| 斯巴达克斯第三季在线观看| 入室女职工被强行糟蹋| 我的漂亮小后妈| 吴京《镖人》在线观看| 远亲小姐在线观看| 白夜追凶 下载| 房奴试爱开头电视剧原声| 他是谁免费观看| 花容月貌电影免费| 儿子讲述父亲疑被当猎物枪杀| 热情的儿媳| 绝地反击电影| juy一747青木玲在线观看| 他是谁电影免费观看完整版高清| 美国电影需要爸爸播种中文版| 粉红大白菜在线观看电视剧免费| 离婚律师 电视剧| 美少年高潮H跪趴扩张调教喷水| 笨蛋你在做什么第11集| 酒店1—80集全集免费高清| 美食的俘虏中文| 你是我今生该等的人| 布兰妮不雅照| 奶爸战神人生:打仗带娃全集免费 | 激情社区在线观看| 十七种幻想| 中文字幕DI岳 和女胥视频| 绮梦之旅全集观看| 火速搭档| 《花嫁高柳家》动漫完整版播放 | 伊丽莎白坎贝奇《无憾》播放 | 《新浪潮》| ova邪娠娼馆在线观看| 电视剧战争不相信眼泪| 铁马战车粤语| 《玉女心经2》国语| 斗罗大陆免费高清在线观看| 免费电影网站在线观看完整版| 安斋拉拉躲雨情节的电影在线观看 | 女友的妈妈双字ID怎么设置| 浴室春情| 高清《千与千寻》普通话版| 电视剧皇太子秘史| 分娩按摩在线| 福音战士新剧场版终| 杨思敏版1~5集全集电视剧| 曰批视频免费40分钟试看| 鱼跃在冬季国语| 地震发生前有哪些预兆| 21世纪性格爱情指南俄罗斯| 黄贯中我终于失去了你| 公元前2000年| 美国1985g点原版中文| 女秘密搜查官可耻的报酬是谁扮演的 | 日产精品免费网站的评分系统| 新入职的员工躲不过部长| 暴走财神5在线观看免费完整版 | 《女囚犯》电影在线观看| 漂亮的保姆高清在线完整版| 默杀电影免费播放在线观看 | 蜘蛛侠1电影高清| 零点电影完整版| 高清七王国的骑士 第一季未删减| 21世纪前女指南无删减免费看 | 极品家丁电视剧在线观看免费| 儿子的房间老妈跟外人睡好吗| 换脸明星电影免费| 小罗纳尔多过人集锦| 《弗兰茨》| 我女友是机器人| 电视剧绝密1950| 康斯坦丁电影高清在线观看完整| 泗洪县| 女保险公司推销员8| 开局花光老爸小金库短剧免费观看 | 汉川市| 特殊游泳私人教练在线观看 | 肉蒲团电影下载| 超级战舰完整版| 女友的妈妈字ID| 哥哥给我一个机会电影| 怒火街头1| 封神榜梁丽亮点第三集| 女版战狼6免费观看999战狼6| 秘密花园2.9.7最新版本更新时间| 一人之下剧场版在线观看| 和总裁假结婚后我被宠得上头| 无颜之月免费观看第一季全集| 铿锵铿铿锵免费观看西瓜视频| 韩国特殊游泳课。| 真心英雄电视剧| 代号叫麻雀| 星语心愿之再爱 电影| 漂亮妈妈7巴字中字开头墨西哥| 曹查理电影全集在线观看| 海扁王2迅雷下载| 英剧内政保镖第二季免费观看| 消失的爱人 字幕| 《特殊游泳女教练》免费观看下拉式| 禁忌5:偷欢| 中国封国最新消息| 姐姐我们来谈恋爱吧动漫| 婶婶在线播放| 伦理《高压监狱2》法国版| 不当军事行为线观看| 高清《谍战深海之惊蛰》电视剧| 蓝色档案| 满江红免费观看| 色戒未测减除版| 暴躁46集正版在线观看| 闪婚后1-100集免费看| 电视剧神隐在线播放最新| 吉林卫视全城热恋| krosskyden壮志凌云| 图书馆的女朋友免费动漫高清电视剧动漫第五集无广告 | 混血大学生精油按摩电影| 男女一起愁愁愁免费观看全集高清完整版动漫| 黑帮大佬和我第365日无删减版| 冒牌英雄电视剧| sp影视剧226| 女老板的性滋味| 荣誉守则成 版在线啄木鸟影院| 少年王卫斯理高清| 延禧攻略70集免费播放| 中国老师在英国| 花与蛇2麻醉牙医诊所| 西部通缉令在线观看| 怦然再心动| 《放飞旅行团》| 广场舞纳西情歌背面| 万源市| 《不良义姐| 一个妈妈的女儿3中字在线观看| 老人街头散钱66万无人要| 爱情而已电视剧免费观看全集完整版 | 俄罗斯版女儿国2| 电影美乃雀主演的电影在线观看| 银魂175| 热带雨电影完整版免费看| 水乳交融HPO| 满天星版《超女麦乐迪》完整版| 完美世界动漫在线观看免费播放| 《真实》崔雪莉多少秒出场| 一拳超人 迅雷下载| xl司令动漫第一季全集在线观看免费播 | 我和岳交换夫妇交换系列| 《黏黏糊糊的你》第1集| 91制造厂在线免费观看| 夏色のコワレモノ| 日本小电影出差 | 英国空姐3免费高清电视剧在线播放| 正在播放 青楼名妓之桃花扇HD - 免费在线观看 | 鲨鱼影视 | 洪湖赤卫队| 笔仙惊魂| 塔日酒店在线观看完整版| 法国高压监狱3完整免费高清观看| 春风燃情| 热辣滚烫电影免费| 电影双胞胎在线观看| 兴隆县| 《伦理按摩2》大片| 守护甜心全集土豆网| 梨树县| 日版大波唐三藏| 约会大作战h| 佳同译图| 需要爸爸的种子在线播放| 刻晴大战史莱姆外服免费观看高清动漫 | 容嬷嬷的小黑屋| 《真爱墨菲定律》泰剧| 法国满天星《巴黎律师事务所》片名| 大马配小毛驴高清| 烈火军校电视剧免费版| 鬼马保镖贼美人| 女子面试后被说漂亮女人不可靠| 电影巜商务旅行戴帽子的同行2019主演| 私人航空(未删减版)| 拼图电视剧| 电视剧一日夫妻百日恩| 智勇三宝国语| 李多海的电视剧| 凯帕克63部电影合集在线观看| 法国《古墓丽影》| 金瓶梅1-5电影观看完整版丿| 杨思敏1996版电视剧全集| 黄yyid频道| 权力的游戏第7季无删减完整观看| 坎贝奇三级片《无憾》完整版| 尖叫之夜2025| 小棉袄免费观看全集电影| 女性瘾者 在线播放| 惊魂游戏| 亡命英伦| 插曲的痛60全集免费| 快乐向前冲王中王争霸赛| 电视剧一生为奴| 飘香在线观看免费完整版| 亡灵召唤| 欢天喜地七仙女2| 特警力量电视剧在线观看| 包青天在线观看| 部长来我家中文字幕| 小舍得电视剧免费| 包子先生| 家有公婆在线观看| 我们高清看免费中国片| 昭平县| 3对1在线观看中文字幕| 女人公敌5| 哔哩哔哩高清免费观看| 我亲爱的课程完整版在线观看| 高清《我们的新时代》白敬亭谭松韵| 战狼6欧美版免费资源下载| 日本战狼10电影免费播放国语 | 《沧元图》59在线观看| 美国式家庭的忌讳| 继妹麦乐迪无删减版| 暗恋mv| 百万巨鳄电影完整版| 乔家大院全集| 风火战纪| 蓝色隐身帽在线观看免费高清| 爱我几何电影完整版在线播放高清| 罪恶六芒星1979| 文章孙兴最新电影| 马向阳下乡记电视剧免费观看| 爱的魔力转圈圈泰剧| 法国空姐4免费高清原声我奔跑| 郝板栗1986| 决战枭雄| 名侦探柯南609| 渡情原唱| 红高粱电视剧下载| 我的兄弟我的爱人| 奇妙发型屋完整版| 进击的巨人2| 少林寺传奇| 大鸟笼电影免费观看| 不被爱也没关系| 你妈妈也一样| 你懂的电影369| 高压监狱2 完整版| 拜登为英特尔站台又提中国| 爱在春天电视剧免费观看| 王保长传奇| 决战玄武门| 电影《V酒店》第一季在线观看| 女超人 满天星版麦乐迪马克斯在线观看 | 《唤醒》:凯登·克罗斯| 魔力宝贝监狱 在线| 跟着书本去旅行| 变态的情人| 我是特种兵2片尾曲叫什么| 年轻的小婊5线观高清5中字电影| 给女儿开了花包| 安斋拉拉在线观看视频| 乘龙怪婿第一部| 我们复婚吧| 火热电影| 快播电影u影一族| 一路向西电影完整| 私人教练1982年美国帕克| 成全高清动漫在线看 | 幸福的出租车| 《搜索》| 尖东老泥妹| 妻子的肉体偿还| 新来的瑜伽教练韩国电影在线观看中文 | 高清《建军大业》电影高清在线观看| 部长出差的日子免费观看 | 越南电影《性的暴行》| 灌篮高手电影版2022| 甄嬛传40集| 繁华落尽电视剧| 鬼灭之刃第二季全集免费观看| 刀锋之上苏联电影免费观看| 美国式保罗讳4免费| 三年成全在线观看免费播放电影| 高清花样少年少女| 德国炸毁最现代化电厂| 风雷影音电影| 一路向西粤语高清完整版| 意大利《激战丛林》完整版在线观看 | 妈妈的职业2观看全集免费高清中文| 杨思敏版金瓶全集在线观看| 你的名字重映2024| 小爸爸爱奇艺| 越南女子别动队无删减版| 不雅空乘电影完整版免费观看| 女大学生的心理沙龙室|