已完本玄幻小说排行榜,完美世界txt全集下载,盗墓笔记txt全集下载

視覺幻覺是常見于多模態大語言模型 (Multimodal Large Language Models, MLLMs) 的一個典型問題，它指的是"模型輸出的描述與圖片內容不相符"這一現象，如下圖所示：

圖中體現了兩種幻覺，紅色部分錯誤地描述了狗的顏色（屬性幻覺），藍色部分描述了圖中實際不存在的事物（目標幻覺）。幻覺對模型的可靠性產生了顯著的負面影響，因此引起了許多研究者的重視。

以往的方法主要集中在 MLLM 本身，通過在訓練數據以及架構上進行改進，以重新微調的方式訓練一個新的 MLLM。這種方式會造成較大的數據構建和訓練開銷，且較難推廣到各種已有的 MLLMs。

近日，來自中科大等機構的研究者們提出了一種免訓練的即插即用的通用架構“啄木鳥（Woodpecker）”，通過修正的方式解決 MLLM 輸出幻覺的問題。

論文鏈接：

https://arxiv.org/pdf/2310.16045.pdf

代碼鏈接：

https://github.com/BradyFU/Woodpecker

Woodpecker 可以修正各種場景下模型輸出的幻覺，并輸出檢測框作為引證，表明相應的目標確實存在。例如，面對描述任務，Woodpecker 可以修正其中帶有幻覺的部分。

對于 MLLM 難以檢測到的小對象，Woodpecker 也可以精準修正：

面對 MLLM 難以解決的復雜的計數場景，Woodpecker 同樣可以進行解決：

對于目標屬性類的幻覺問題，Woopecker 處理地也很好：

我們還提供了 Demo 供讀者測試使用，如下圖所示，上傳圖片并輸入請求，就可以得到修正前以及修正后的模型答復，以及供參考驗證的新圖片。

方法

Woodpecker 的架構如下，它包括五個主要步驟：關鍵概念提取、問題構造、視覺知識檢驗、視覺斷言生成以及幻覺修正。

關鍵概念提取：關鍵概念指的是 MLLM 的輸出中最可能存在幻覺的存在性目標，例如上圖描述中的“自行車；垃圾桶；人”。我們可以 Prompt 大語言模型來提取出這些關鍵概念，這些關鍵概念是后續步驟進行的基礎；

問題構造：圍繞著前一步提取出的關鍵概念，Prompt 大語言模型來提出一些有助于檢驗圖片描述真偽的問題，如“圖中有幾輛自行車？”、“垃圾桶邊上的是什么？”等等；

視覺知識檢驗：使用視覺基礎模型對提出的問題進行檢驗，獲得與圖片以及描述文本相關的信息。例如，我們可以利用 GroundingDINO 來進行目標檢測，確定關鍵目標是否存在以及關鍵目標的數量。這里我們認為像 GroundingDINO 這類視覺基礎模型對圖片的感知能力比 MLLM 本身的感知能力更強。對于目標顏色等這類屬性問題，我們可以利用 BLIP-2 來進行回答。BLIP-2這類傳統 VQA 模型輸出答案的長度有限，幻覺問題也更少；

視覺斷言生成：基于前兩步中獲得的問題以及對應的視覺信息，合成結構化的“視覺斷言”。這些視覺斷言可以看做與原有 MLLM 的回答以及輸入圖片相關的視覺知識庫；

幻覺修正：基于前面得到的，使用大語言模型對 MLLM 的文本輸出進行逐一修正，并提供目標對應的檢測框信息作為視覺檢驗的參照。

實驗效果

實驗選取了幾個典型的 MLLM 作為基線，包括：LLaVA，mPLUG-Owl，Otter，MiniGPT-4 論文中首先測試了 Woodpecker 在面對目標幻覺時的修正能力，在 POPE 驗證集的實驗結果如下表所示：

結果表明在不同的 MLLM 上應用 Woodpecker 修正后，均有不同程度的提升。在隨機設定下，Woodpecker 給 MiniGPT-4和 mPLUG-Owl 和在準確率指標上分別帶來了 30.66% 和 24.33% 的提升。

此外，研究者還應用更全面的驗證集 MME，進一步測試 Woodpecker 在面對屬性幻覺時的修正能力，結果如下表所示：

從表中可見 Woodpecker 不僅在應對目標幻覺時有效，在修正顏色等屬性幻覺時也具有出色的表現。LLaVA 的顏色得分從 78.33 分大幅提升到 155 分！經過 Woodpecker 修正后，四個基線模型在四個測試子集上的總分均超過 500 分，在總體感知能力上獲得了顯著提升。

為了更直接地衡量修正表現，更直接的方式是使用開放評測。不同于以往將圖片轉譯后送入純文本 GPT-4 的做法，文章利用 OpenAI 最近開放的視覺接口，提出使用 GPT-4 (Vision) 對修正前后的圖片描述直接對下列兩個維度進行打分：

準確度：模型的答復相對于圖片內容是否準確
詳細程度：模型答復的細節豐富度

在該實驗條件下，實驗結果如下表所示：

結果表明經過 Woodpecker 修正后圖片描述的準確性有一定的提升，這說明該框架可以有效修正描述中幻視的部分。另一方面，Woodpecker 修正后引入的定位信息豐富了文本描述，提供了進一步的位置信息，從而提升了細節豐富度。GPT-4V 輔助的評測樣例如下圖所示：

原文標題：幻覺降低30%！首個多模態大模型幻覺修正工作Woodpecker

文章出處：【微信公眾號：智能感知與物聯網技術研究所】歡迎添加關注！文章轉載請注明出處。

聲明：本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人，不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用，如有內容侵權或者其他違規問題，請聯系本站處理。舉報投訴

物聯網

物聯網

+關注

關注
2909

文章
44634

瀏覽量
373318

原文標題：幻覺降低30%！首個多模態大模型幻覺修正工作Woodpecker

文章出處：【微信號：tyutcsplab，微信公眾號：智能感知與物聯網技術研究所】歡迎添加關注！文章轉載請注明出處。

商湯日日新多模態大模型權威評測第一

剛剛，商湯科技日日新SenseNova多模態大模型，在權威綜合評測權威平臺OpenCompass的多模態評測中取得榜單第一。

發表于 12-20 10:39 ?183次閱讀

一文理解多模態大語言模型——下

/understanding-multimodal-llms ? 《一文理解多模態大語言模型 - 上》介紹了什么是多模態大語言

發表于 12-03 15:18 ?129次閱讀

一文理解<b class='flag-5'>多</b><b class='flag-5'>模態</b>大語言<b class='flag-5'>模型</b>——下

李彥宏：大模型行業消除幻覺，iRAG技術引領文生圖新紀元

在近日舉辦的百度世界大會上，百度創始人李彥宏分享了關于大模型行業的最新觀察。他指出，過去24個月里，大模型行業經歷了顯著的變化，其中最引人注目的是大模型已基本消除了幻覺現象。這一進步標

發表于 11-14 11:39 ?316次閱讀

利用OpenVINO部署Qwen2多模態模型

多模態大模型的核心思想是將不同媒體數據（如文本、圖像、音頻和視頻等）進行融合，通過學習不同模態之間的關聯，實現更加智能化的信息處理。簡單來說，多

發表于 10-18 09:39 ?440次閱讀

云知聲推出山海多模態大模型

在人工智能技術的浩瀚星海中，多模態交互技術正成為引領未來的新航標。繼OpenAI的GPT-4o掀起滔天巨浪后，云知聲以創新之姿，推出了其匠心獨運的山海多模態大

發表于 08-27 15:20 ?393次閱讀

TaD+RAG-緩解大模型“幻覺”的組合新療法

TaD：任務感知解碼技術（Task-aware Decoding，簡稱TaD），京東聯合清華大學針對大語言模型幻覺問題提出的一項技術，成果收錄于IJCAI2024。 RAG：檢索增強生成技術

發表于 07-16 15:01 ?2055次閱讀

阿里達摩院提出“知識鏈”框架，降低大模型幻覺

近日，阿里巴巴達摩院（湖畔實驗室）攜手新加坡南洋理工大學等研究機構，共同推出了大模型知識鏈（CoK）框架。該框架不僅可實時檢索異構知識源，還能逐步糾正推理錯誤，有效提高了大模型在回答知識型問題時的準確率，并顯著降低了所謂的“

發表于 05-10 11:46 ?694次閱讀

商湯科技與海通證券攜手發布金融行業首個多模態全棧式大模型

商湯科技與海通證券聯合研發并發布了金融行業內首個面向多業務場景的多模態全棧式大模型。雙方計劃將這一先進技術應用于智能問答、合規風控、代碼輔助

發表于 05-06 10:16 ?466次閱讀

人大系初創公司智子引擎發布全新多模態大模型Awaker 1.0

人大系初創公司智子引擎近日震撼發布了新一代多模態大模型Awaker 1.0，這一里程碑式的成果標志著公司在通用人工智能（AGI）領域取得了重要突破。與前代ChatImg序列模型相比，A

發表于 05-06 09:59 ?608次閱讀

商湯科技聯合海通證券發布業內首個面向金融行業的多模態全棧式大模型

4月23日，商湯科技正式推出“日日新SenseNova 5.0”大模型體系，并與海通證券聯合發布業內首個面向金融行業的多模態全棧式大模型。

發表于 04-26 09:48 ?473次閱讀

商湯科技發布5.0多模態大模型，綜合能力全面對標GPT-4 Turbo

商湯科技發布5.0多模態大模型，綜合能力全面對標GPT-4 Turbo 4月23日，商湯科技董事長兼CEO徐立在2024商湯技術交流日上發布了行業首個云、端、邊全棧大

發表于 04-24 16:49 ?1108次閱讀

微軟下架最新大語言模型WizardLM-2，緣因“幻覺測試疏忽”

對此，微軟技術人員在X平臺發表聲明，表示因對新模型發布流程不夠了解，且忽略了幻覺測試環節，導致模型被緊急下線。目前，開發團隊正在全力以赴進行測試，預計完成后將盡快重新上線。

發表于 04-22 14:15 ?458次閱讀

利用知識圖譜與Llama-Index技術構建大模型驅動的RAG系統（下）

對于語言模型（LLM）幻覺，知識圖譜被證明優于向量數據庫。知識圖譜提供更準確、多樣化、有趣、邏輯和一致的信息，減少了LLM中出現幻覺的可能性。

發表于 02-22 14:13 ?1212次閱讀

機器人基于開源的多模態語言視覺大模型

ByteDance Research 基于開源的多模態語言視覺大模型 OpenFlamingo 開發了開源、易用的 RoboFlamingo 機器人操作模型，只用單機就可以訓練。

發表于 01-19 11:43 ?420次閱讀

什么是多模態？多模態的難題是什么？

單模態大模型，通常大于100M～1B參數。具有較強的通用性，比如對圖片中任意物體進行分割，或者生成任意內容的圖片或聲音。極大降低了場景的定制成本。

發表于 01-17 10:03 ?4642次閱讀