盗墓笔记有声小说,管理书籍排行榜,神武八荒一颗小说

清華大學(xué)、Google AI 和斯坦福大學(xué)李飛飛團(tuán)隊(duì)提出了一種具有強(qiáng)記憶力的 E3D-LSTM 網(wǎng)絡(luò)，強(qiáng)化了 LSTM 的長(zhǎng)時(shí)記憶能力，這為視頻預(yù)測(cè)、動(dòng)作分類等相關(guān)問題提供了新思路，是一項(xiàng)非常具有啟發(fā)性的工作。

如何對(duì)時(shí)間序列進(jìn)行時(shí)空建模及特征抽取，是 RGB 視頻預(yù)測(cè)分類，動(dòng)作識(shí)別，姿態(tài)估計(jì)等相關(guān)領(lǐng)域的研究熱點(diǎn)。

清華大學(xué)、Google AI 和斯坦福大學(xué)李飛飛團(tuán)隊(duì)提出了一種具有強(qiáng)記憶力的 E3D-LSTM 網(wǎng)絡(luò)，用 3D 卷積代替 2D 卷積作為 LSTM 網(wǎng)絡(luò)的基礎(chǔ)計(jì)算操作，并加入自注意力機(jī)制，使網(wǎng)絡(luò)能同時(shí)兼顧長(zhǎng)時(shí)和短時(shí)信息依賴以及局部時(shí)空特征抽取。

這為視頻預(yù)測(cè)、動(dòng)作分類等相關(guān)問題提供了新思路，是一項(xiàng)非常具有啟發(fā)性的工作。

時(shí)間序列的時(shí)空建模問題

現(xiàn)實(shí)生活中許多數(shù)據(jù)都同時(shí)具有時(shí)間特征和空間特征，例如人體的運(yùn)動(dòng)軌跡，連續(xù)幀的視頻等，每個(gè)時(shí)間點(diǎn)都對(duì)應(yīng)一組數(shù)據(jù)，而數(shù)據(jù)往往又具有一定的空間特征。因此要在這樣的時(shí)間序列數(shù)據(jù)上開展分類，預(yù)測(cè)等工作，就必須在時(shí)間（temporal）和空間（spatial）上對(duì)其進(jìn)行建模和特征抽取。

常用的時(shí)間建模工具是循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN）相關(guān)模型（LSTM 等），由于其特有的門結(jié)構(gòu)設(shè)計(jì)，對(duì)時(shí)間序列特征具有強(qiáng)大的抽取能力，因此被廣泛應(yīng)用于預(yù)測(cè)問題并取得了良好的成果，但是 RNN 并不能很好的學(xué)習(xí)到原始特征的高階表示，這不利于對(duì)空間信息的提取。空間建模則當(dāng)屬卷積神經(jīng)網(wǎng)絡(luò)（CNN），其具有強(qiáng)大的空間特征抽取能力，其中3D-CNN又能將卷積核可控范圍擴(kuò)大到時(shí)域上，相對(duì)于 2D 卷積靈活性更高，能學(xué)習(xí)到更多的運(yùn)動(dòng)信息（motion 信息），相對(duì)于 RNN 則更有利于學(xué)習(xí)到信息的高級(jí)表示（層數(shù)越深，信息越高級(jí)），是目前動(dòng)作識(shí)別領(lǐng)域的流行方法。當(dāng)然 3D 卷積的時(shí)間特征抽取能力并不能和 RNN 媲美。

得益于 3D 卷積和 RNN 在各自領(lǐng)域的成功，如何進(jìn)一步將二者結(jié)合起來(lái)使用也成為了研究熱點(diǎn)，常見的簡(jiǎn)單方法是將二者串聯(lián)堆疊或者并聯(lián)結(jié)合（在圖卷積網(wǎng)絡(luò)出現(xiàn)之前，動(dòng)作識(shí)別領(lǐng)域的最優(yōu)方法就是將 CNN 和 RNN 并聯(lián)），但測(cè)試發(fā)現(xiàn)這么做并不能帶來(lái)太大的提升，這是因?yàn)槎叩墓ぷ鳈C(jī)制差距太大，簡(jiǎn)單的結(jié)合并不能很好的實(shí)現(xiàn)優(yōu)勢(shì)互補(bǔ)。本文提出用 3D 卷積代替原始 LSTM 中的門更新操作，使 LSTM 不僅能在時(shí)間層面，也能在空間層面上進(jìn)行短期依賴的表象特征和運(yùn)動(dòng)特征的抽取，從而在更深的機(jī)制層面實(shí)現(xiàn)兩種網(wǎng)絡(luò)的結(jié)合。此外，在 LSTM 中引入自注意力（self-attention）機(jī)制，進(jìn)一步強(qiáng)化了 LSTM 的長(zhǎng)時(shí)記憶能力，使其對(duì)長(zhǎng)距離信息作用具有更好的感知力。作者將這種網(wǎng)絡(luò)稱為Eidetic 3D LSTM（E3D-LSTM），Eidetic 意思是具有逼真記憶，強(qiáng)調(diào)網(wǎng)絡(luò)的強(qiáng)記憶能力。

E3D-LSTM 網(wǎng)絡(luò)結(jié)構(gòu)

圖 1：三種不同的 3D 卷積和 LSTM 的結(jié)合方法

圖中每個(gè)顏色的模塊都代表了多層相應(yīng)的網(wǎng)絡(luò)。圖（a）和圖（b）是兩種 3D 卷積和 LSTM 結(jié)合的基線方法，3D 卷積和 LSTM 線性疊加，主要起到了編碼（解碼器）的作用，并沒有和 RNN 有機(jī)制上的結(jié)合。圖（a）中 3D 卷積作為編碼器，輸入是一段視頻幀，圖（b）中作為解碼器，得到每個(gè)單元的最終輸出。這兩個(gè)方法中的綠色模塊使用的是時(shí)空長(zhǎng)短時(shí)記憶網(wǎng)絡(luò)（ST-LSTM）［1］，這種 LSTM 獨(dú)立的維護(hù)兩個(gè)記憶狀態(tài) M 和 C，但由于記憶狀態(tài) C 的遺忘門過于響應(yīng)具有短期依賴的特征，因此容易忽略長(zhǎng)時(shí)依賴信息，因此 E3D-LSTM 在 ST-LSTM 的基礎(chǔ)添加了自注意力機(jī)制和 3D 卷積操作，在一定程度上解決了這個(gè)問題。具體單元結(jié)構(gòu)下一節(jié)介紹。

圖（c）是 E3D-LSTM 網(wǎng)絡(luò)的結(jié)構(gòu)，3D 卷積作為編碼 - 解碼器（藍(lán)色模塊），同時(shí)和 LSTM 結(jié)合（橙色模塊）。E3D-LSTM 既可用于分類任務(wù)，也可用于預(yù)測(cè)任務(wù)。分類時(shí)將所有 LSTM 單元的輸出結(jié)合，預(yù)測(cè)時(shí)則利用 3D 卷積解碼器的輸出作為預(yù)測(cè)值。

E3D-LSTM 單元結(jié)構(gòu)設(shè)計(jì)

圖 2：標(biāo)準(zhǔn) LSTM 單元結(jié)構(gòu)

首先簡(jiǎn)要介紹一下標(biāo)準(zhǔn) LSTM 結(jié)構(gòu)，和 RNN 相比 LSTM 增加了更復(fù)雜的門結(jié)構(gòu)（圖中黃色模塊），主要解決 RNN 中存在的梯度消失問題，從而提高網(wǎng)絡(luò)對(duì)長(zhǎng)時(shí)依賴（long-term dependency）的記憶感知能力。LSTM 有兩個(gè)輸入門，一個(gè)輸出門和遺忘門

。

圖 2：ST-LSTM 網(wǎng)絡(luò)結(jié)構(gòu)和單元結(jié)構(gòu)

和標(biāo)準(zhǔn) LSTM 相比，ST-LSTM 還增加了不同層間對(duì)應(yīng)位置的 cell 連接，如圖 2 左側(cè)，水平灰色連接線表示標(biāo)準(zhǔn) LSTM 的單元連接，豎直黃色連接線表示層間同一時(shí)刻的單元連接，通過張量 M 傳播，注意當(dāng) l=1 時(shí)，

（作者認(rèn)為 t 時(shí)刻的頂層信息對(duì) t+1 時(shí)刻的底層信息影響很大），這樣記憶信息就能同時(shí)在層內(nèi)和層間傳播。

圖 3 E3D-LSTM 單元結(jié)構(gòu)

圖 3 是本文提出的 E3D-LSTM 模型的單元結(jié)構(gòu)，

是一個(gè)維度為的五維張量，代表之前個(gè)時(shí)間步的所有隱狀態(tài)。表示召回門（代替遺忘門），和 ST-LSTM 相比，主要有以下改進(jìn)：

1、輸入數(shù)據(jù)是的四維張量，對(duì)應(yīng)時(shí)刻

的連續(xù)幀序列，因此現(xiàn)在每個(gè)單元時(shí)間步都對(duì)應(yīng)一段視頻，而不是單幀視頻。

2、針對(duì)幀序列數(shù)據(jù)額外添加了一個(gè)召回門（recall gate）以及相關(guān)結(jié)構(gòu)，用于實(shí)現(xiàn)長(zhǎng)時(shí)依賴學(xué)習(xí)，也就是自注意力機(jī)制。這部分對(duì)應(yīng)網(wǎng)絡(luò)名稱中的 Eidetic。

3、由于輸入數(shù)據(jù)變成了四維張量，因此在更新公式中采用 3D 卷積操作而不是 2D 卷積。

大部分門結(jié)構(gòu)的更新公式和 ST-LSTM 相同，額外添加了召回門更新公式：

上面介紹的機(jī)制用于同一層不同時(shí)間步連接，作者將這種機(jī)制也用在了不同層同一時(shí)間步的連接，但效果并不好，這是因?yàn)椴煌瑢釉谕粫r(shí)刻學(xué)習(xí)到的信息并沒有太好的依賴性。

基于 E3D-LSTM 的半監(jiān)督輔助學(xué)習(xí)

在許多監(jiān)督學(xué)習(xí)任務(wù)，例如視頻動(dòng)作識(shí)別中，沒有足夠的監(jiān)督信息和標(biāo)注信息來(lái)幫助訓(xùn)練一個(gè)令人滿意的 RNN，因此可以將視頻預(yù)測(cè)作為一個(gè)輔助的表征學(xué)習(xí)方法，來(lái)幫助網(wǎng)絡(luò)更好的理解視頻特征，并提高時(shí)間域上的監(jiān)督性。

具體的，讓視頻預(yù)測(cè)和動(dòng)作識(shí)別任務(wù)共享相同的主干網(wǎng)絡(luò)（圖 1），只不過損失函數(shù)不同，在視頻預(yù)測(cè)任務(wù)中，目標(biāo)函數(shù)為：

帶上標(biāo)的 X 表示預(yù)測(cè)值，不帶上標(biāo)的表示真值，F(xiàn) 表示 Frobenius 歸一化。

在動(dòng)作識(shí)別任務(wù)中，目標(biāo)函數(shù)為：

其中 Y 和是預(yù)測(cè)值和幀值，這樣通過將預(yù)測(cè)任務(wù)的損失函數(shù)嵌入到識(shí)別任務(wù)中，以及主干網(wǎng)絡(luò)的共享，能在一定程度上幫助識(shí)別任務(wù)學(xué)習(xí)到更多的時(shí)序信息。為了保證過渡平滑，額外添加了一個(gè)權(quán)重因子，會(huì)隨著迭代次數(shù)的增加而線性衰減：

作者將這種方法稱為半監(jiān)督輔助學(xué)習(xí)。

實(shí)驗(yàn)結(jié)果

視頻預(yù)測(cè)任務(wù)，在 Moving MINIST 數(shù)據(jù)集上的結(jié)果：

為了驗(yàn)證 E3D-LSTM 中不同模塊對(duì)性能的影響，作者還在該數(shù)據(jù)集上進(jìn)行了燒蝕研究：

可以看到不管是添加 3D 卷積還是自注意力機(jī)制，網(wǎng)絡(luò)性能相對(duì)于基線方法都有提升。

視頻預(yù)測(cè)任務(wù)，在 KTH 人體動(dòng)作數(shù)據(jù)集上的結(jié)果：

接下來(lái)在一個(gè)實(shí)際視頻預(yù)測(cè)任務(wù)：交通流預(yù)測(cè)中，與其他方法進(jìn)行了對(duì)比：

動(dòng)作識(shí)別任務(wù)，在 Something-Something 數(shù)據(jù)集上進(jìn)行了測(cè)試：

同樣在該數(shù)據(jù)集上進(jìn)行了燒蝕研究：

以及不同的半監(jiān)督輔助學(xué)習(xí)策略帶來(lái)的性能提升：

總結(jié)

本文對(duì) ST-LSTM 進(jìn)行了改進(jìn)，將流行的 3D 卷積操作作為其基本張量操作，同時(shí)添加了自注意力模塊，進(jìn)一步強(qiáng)化了網(wǎng)絡(luò)對(duì)長(zhǎng)距離依賴信息的刻畫能力，不僅能用于預(yù)測(cè)任務(wù)，還能通過輔助學(xué)習(xí)的方法拓展到其他任務(wù)上，是非常具有啟發(fā)性的工作。

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請(qǐng)聯(lián)系本站處理。舉報(bào)投訴

循環(huán)神經(jīng)網(wǎng)絡(luò)

循環(huán)神經(jīng)網(wǎng)絡(luò)

+關(guān)注

關(guān)注
0

文章
38

瀏覽量
2969

原文標(biāo)題：數(shù)月整改，三星折疊屏手機(jī)Fold 終于可以發(fā)售了？

文章出處：【微信號(hào)：AppDowns，微信公眾號(hào)：掌上科技頻道】歡迎添加關(guān)注！文章轉(zhuǎn)載請(qǐng)注明出處。

評(píng)論

相關(guān)推薦

RNN與LSTM模型的比較分析

RNN（循環(huán)神經(jīng)網(wǎng)絡(luò)）與LSTM（長(zhǎng)短期記憶網(wǎng)絡(luò)）模型在深度學(xué)習(xí)領(lǐng)域都具有處理序列數(shù)據(jù)的能力，但它們?cè)诮Y(jié)構(gòu)、功能和應(yīng)用上存在顯著的差異。以下

發(fā)表于 11-15 10:05 ?434次閱讀

深度學(xué)習(xí)框架中的LSTM神經(jīng)網(wǎng)絡(luò)實(shí)現(xiàn)

長(zhǎng)短期記憶（LSTM）網(wǎng)絡(luò)是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），能夠?qū)W習(xí)長(zhǎng)期依賴信息。與傳統(tǒng)的RNN相比，LSTM通過引入門控機(jī)制來(lái)解決梯度消

發(fā)表于 11-13 10:16 ?361次閱讀

基于LSTM神經(jīng)網(wǎng)絡(luò)的情感分析方法

情感分析是自然語(yǔ)言處理（NLP）領(lǐng)域的一項(xiàng)重要任務(wù)，旨在識(shí)別和提取文本中的主觀信息，如情感傾向、情感強(qiáng)度等。隨著深度學(xué)習(xí)技術(shù)的發(fā)展，基于LSTM（長(zhǎng)短期記憶）神經(jīng)網(wǎng)絡(luò)的情感分析方法因其出色的序列建模

發(fā)表于 11-13 10:15 ?524次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)在圖像處理中的應(yīng)用

長(zhǎng)短期記憶（LSTM）神經(jīng)網(wǎng)絡(luò)是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），它能夠?qū)W習(xí)長(zhǎng)期依賴關(guān)系。雖然LSTM最初是為處理序列數(shù)據(jù)設(shè)計(jì)的，但近年來(lái)，

發(fā)表于 11-13 10:12 ?419次閱讀

如何使用Python構(gòu)建LSTM神經(jīng)網(wǎng)絡(luò)模型

構(gòu)建一個(gè)LSTM（長(zhǎng)短期記憶）神經(jīng)網(wǎng)絡(luò)模型是一個(gè)涉及多個(gè)步驟的過程。以下是使用Python和Keras庫(kù)構(gòu)建LSTM模型的指南。 1. 安裝必要的庫(kù) 首先，確保你已經(jīng)安裝了Python

發(fā)表于 11-13 10:10 ?361次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)的訓(xùn)練數(shù)據(jù)準(zhǔn)備方法

LSTM（Long Short-Term Memory，長(zhǎng)短期記憶）神經(jīng)網(wǎng)絡(luò)的訓(xùn)練數(shù)據(jù)準(zhǔn)備方法是一個(gè)關(guān)鍵步驟，它直接影響到模型的性能和效果。以下是一些關(guān)于LSTM神經(jīng)

發(fā)表于 11-13 10:08 ?580次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)的結(jié)構(gòu)與工作機(jī)制

LSTM（Long Short-Term Memory，長(zhǎng)短期記憶）神經(jīng)網(wǎng)絡(luò)是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），設(shè)計(jì)用于解決長(zhǎng)期依賴問題，特別是在處理時(shí)間序列數(shù)據(jù)時(shí)表現(xiàn)出色。以下是

發(fā)表于 11-13 10:05 ?362次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)在語(yǔ)音識(shí)別中的應(yīng)用實(shí)例

語(yǔ)音識(shí)別技術(shù)是人工智能領(lǐng)域的一個(gè)重要分支，它使計(jì)算機(jī)能夠理解和處理人類語(yǔ)言。隨著深度學(xué)習(xí)技術(shù)的發(fā)展，特別是長(zhǎng)短期記憶（LSTM）神經(jīng)網(wǎng)絡(luò)的引入，語(yǔ)音識(shí)別的準(zhǔn)確性和效率得到了顯著提升。 LSTM

發(fā)表于 11-13 10:03 ?528次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)的調(diào)參技巧

長(zhǎng)短時(shí)記憶網(wǎng)絡(luò)（Long Short-Term Memory, LSTM）是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），它能夠?qū)W習(xí)長(zhǎng)期依賴信息。在實(shí)際應(yīng)用中，

發(fā)表于 11-13 10:01 ?598次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)的優(yōu)缺點(diǎn)分析

長(zhǎng)短期記憶（Long Short-Term Memory, LSTM）神經(jīng)網(wǎng)絡(luò)是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），由Hochreiter和Schmidhuber在1997年

發(fā)表于 11-13 09:57 ?1264次閱讀

使用LSTM神經(jīng)網(wǎng)絡(luò)處理自然語(yǔ)言處理任務(wù)

自然語(yǔ)言處理（NLP）是人工智能領(lǐng)域的一個(gè)重要分支，它旨在使計(jì)算機(jī)能夠理解、解釋和生成人類語(yǔ)言。隨著深度學(xué)習(xí)技術(shù)的發(fā)展，特別是循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN）及其變體——長(zhǎng)短期記憶（LSTM）網(wǎng)絡(luò)

發(fā)表于 11-13 09:56 ?385次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)在時(shí)間序列預(yù)測(cè)中的應(yīng)用

時(shí)間序列預(yù)測(cè)是數(shù)據(jù)分析中的一個(gè)重要領(lǐng)域，它涉及到基于歷史數(shù)據(jù)預(yù)測(cè)未來(lái)值。隨著深度學(xué)習(xí)技術(shù)的發(fā)展，長(zhǎng)短期記憶（LSTM）神經(jīng)網(wǎng)絡(luò)因其在處理序列數(shù)據(jù)方面的優(yōu)勢(shì)而受到廣泛關(guān)注。 LSTM神經(jīng)

發(fā)表于 11-13 09:54 ?622次閱讀

LSTM神經(jīng)網(wǎng)絡(luò)的基本原理如何實(shí)現(xiàn)LSTM神經(jīng)網(wǎng)絡(luò)

LSTM（長(zhǎng)短期記憶）神經(jīng)網(wǎng)絡(luò)是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN），它能夠?qū)W習(xí)長(zhǎng)期依賴信息。在處理序列數(shù)據(jù)時(shí)，如時(shí)間序列分析、自然語(yǔ)言處理等，LSTM

發(fā)表于 11-13 09:53 ?416次閱讀

LSTM模型的基本組成

長(zhǎng)短期記憶網(wǎng)絡(luò)（Long Short-Term Memory, LSTM）是一種特殊的循環(huán)神經(jīng)網(wǎng)絡(luò)（RNN）架構(gòu)，它在處理序列數(shù)據(jù)時(shí)能夠捕捉長(zhǎng)期依賴關(guān)系，有效解決了傳統(tǒng)RNN在處理長(zhǎng)序

發(fā)表于 07-10 17:01 ?1265次閱讀

新火種AI|AI教母李飛飛初創(chuàng)AI公司，開啟最前沿AI算法研究

AI教母李飛飛首次創(chuàng)業(yè)，瞄準(zhǔn)“空間智能”。

發(fā)表于 05-06 16:24 ?318次閱讀

在线观看www成人影院-在线观看www日本免费网站-在线观看www视频-在线观看操-欧美18在线-欧美1级

搜索歷史

清華、GoogleAI和斯李飛飛團(tuán)隊(duì)提出具有強(qiáng)記憶力的E3D-LSTM網(wǎng)絡(luò)

評(píng)論

RNN與LSTM模型的比較分析

深度學(xué)習(xí)框架中的LSTM神經(jīng)網(wǎng)絡(luò)實(shí)現(xiàn)

基于LSTM神經(jīng)網(wǎng)絡(luò)的情感分析方法

LSTM神經(jīng)網(wǎng)絡(luò)在圖像處理中的應(yīng)用

如何使用Python構(gòu)建LSTM神經(jīng)網(wǎng)絡(luò)模型

LSTM神經(jīng)網(wǎng)絡(luò)的訓(xùn)練數(shù)據(jù)準(zhǔn)備方法

LSTM神經(jīng)網(wǎng)絡(luò)的結(jié)構(gòu)與工作機(jī)制

LSTM神經(jīng)網(wǎng)絡(luò)在語(yǔ)音識(shí)別中的應(yīng)用實(shí)例

LSTM神經(jīng)網(wǎng)絡(luò)的調(diào)參技巧

LSTM神經(jīng)網(wǎng)絡(luò)的優(yōu)缺點(diǎn)分析

使用LSTM神經(jīng)網(wǎng)絡(luò)處理自然語(yǔ)言處理任務(wù)

LSTM神經(jīng)網(wǎng)絡(luò)在時(shí)間序列預(yù)測(cè)中的應(yīng)用

LSTM神經(jīng)網(wǎng)絡(luò)的基本原理如何實(shí)現(xiàn)LSTM神經(jīng)網(wǎng)絡(luò)

LSTM模型的基本組成

新火種AI|AI教母李飛飛初創(chuàng)AI公司，開啟最前沿AI算法研究