0
| 本文作者: 木子 | 2017-11-28 14:14 | 專題:AAAI 2018 |
11月,第32屆人工智能頂級國際會議AAAI 2018論文收錄結果公布。深圳Gowild(中文:狗尾草)智能科技有限公司或獨拔頭籌,成為國內唯一入選兩篇論文的創業公司,勢頭直逼BAT。
AAAI人工智能大會,是人工智能領域的頂級盛會,自1980年至今,已經成功舉辦了31屆。近幾年,隨著AI研究熱潮的到來,AAAI的參會人數和論文數量也逐年攀升,其中,2017年注冊參會人數接近2000人,論文投稿量超過2500篇。
作為人工智能創業公司,深圳Gowild智能有限公司人工智能研究院(Gowild AI Lab)共有兩篇論文被收錄,極有可能是創業公司在此次AAAI-18中的最佳表現。兩篇論文分別是《Adversarial Learning for Chinese NER from Crowd Annotations》、《Personalized Time-Aware Tag Recommendation》,作者將在2018年2月2日-7日前往美國新奧爾良進行演講。
資料顯示,Gowild AI Lab是深圳Gowild智能科技旗下的專業AI團隊,由知識圖譜專家、長期帶隊參與國家科研項目的王昊奮博士于2013年發起成立,專注于AI前沿研究及產品應用落地。2017年推出Gowild AI Virtual life Engine(Gowild人工智能虛擬生命引擎,簡稱“GAVE”),成功應用于Gowild出品的holoera及公子小白系列產品中。另一方面,Gowild AI Lab積極啟動校企合作,與蘇州大學、華東師范大學成立聯合實驗室,建立AI智庫,推動產學研的良好轉化。此次兩篇論文的入選,正是校企合作豐碩成果的體現。
近年,中國人工智能研究在國際舞臺發揮了越來越重要的作用,甚至AAAI 2017因原定時間逢中國春節,特為華人學者重定時間地點。今年來自中國的論文也取得了令人矚目的佳績,我們靜心期待明年年初在人工智能頂級舞臺上來自中國學者的表現。
這兩篇論文所關注的主題,都是實現虛擬生命的過程中遇到的實際問題,并通過校企合作進行研究和落地。兩篇論文分別研究了命名實體識別(NER)和推薦系統。前者是自然語言理解(NLU)的基礎功能,而后者可以在產品上體現“生命感”和認知功能。由于NLU技術目前在人工智能領域也僅僅處于起步階段,因此,在NER方面的研究,體現了如何利用眾包技術進一步提升數據的質量和算法的性能,從而增強虛擬生命的感知功能。而推薦系統,則以場景化出發,可以通過對多源異構的知識圖譜進行融合,實現準確的推薦,讓用戶真實感受到“情感陪伴和關懷”,從而使得虛擬生命產品,從傳統聊天機器人的“被動交互”,進化到根據用戶興趣和喜好進行“主動交互”。
下面是對兩篇論文的簡要介紹:
1. 和蘇大的合作是基于眾包的NER《Adversarial Learning for Chinese NER from Crowd Annotations》
簡介:
訓練命名實體識別系統時,需要大量的人工標注語料。為了保證質量通常雇傭專家來進行標注,這樣會造成代價成本高且規模難于擴大。我們采用眾包標注方法雇傭普通人員來快速低成本完成標注任務,但獲取的數據包含噪音。我們提出了利用眾包標注數據來學習對抗網絡模型的方法,構建中文實體識別系統。受到對抗網絡學習的啟發,我們在模型中使用了兩個雙向 LSTM 模塊,來分別學習標注員的公有信息和屬于不同標注員的私有信息。對抗學習的思想體現在公有塊的學習過程中,以不同標注員作為分類目標進行對抗學習。從而達到優化公有模塊的學習質量,使之收斂于真實數據 (專家標注數據)。本文的算法框架如下圖:

其中,左邊部分是作為 baseline 算法的 CRF+LSTM,右邊部分是本文提出的模型框架。
最終構建的中文實體識別系統(Crowd-NER)在真實數據上的性能比傳統 CRF 模型高7%(F1),如下圖所示:

2. 和華師大的合作是融合時間因素的標簽推薦方法《Personalized Time-Aware Tag Recommendation》
簡介:
標簽是用戶用來管理和查找網絡資源的重要工具,如何給用戶推薦合適的標簽來標注網絡資源也是當前的研究熱點。傳統的標簽推薦技術有基于張量分解的協同過濾方法 PITF,但此類模型沒有捕捉到時間對用戶打標簽行為的影響。受到考慮了時間影響的 BLL 類工作的啟發,本文提出了一種融合時間因素的標簽推薦方法(Time-Aware PITF, TAPITF)。該模型在 PITF 的基礎上增加了時間權重和頻次權重,使用 Hawkes 過程建模了用戶傾向于使用自己最近最多使用過的標簽這一行為特征,同時也考慮了目標資源上熱門標簽的影響。在真實標簽數據集上的實驗表明我們的方法具有較好的推薦準確度和一定的新穎性。
另外,本文提出的標簽推薦模型也可以很好地輔助基于對話的音樂推薦任務。在對話系統中,通過對話能夠收集到用戶對于歌曲及標簽的偏好。將收集到的<用戶-歌曲-標簽-時間戳>數據使用本文提出的 TAPITF 模型分解后可以得到用戶、歌曲、標簽對應的隱向量作為其特征向量表示,用于后續的音樂推薦。
在實驗數據上,TAPITF 模型在準確度和收斂性能上均優于其他算法,后續我們考慮使用深度學習模型 RNN 來建模時間信息以更好地提升模型的效果。
雷峰網原創文章,未經授權禁止轉載。詳情見轉載須知。