生活分享

視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

閱讀時間約 8 分鐘

一張畫著山與太陽的照片被切成小方格,旁邊有放大鏡,彩色小方塊沿著虛線流向一個對話框
圖片:Mokaair (© Mokaair)

視覺語言模型(Vision-Language Model,VLM)在這裡指能同時接收圖片與文字、再輸出文字的模型:給它一張照片和一個問題,它用文字回答。名稱用法不一:Flamingo 論文自稱 Visual Language Model,LLaVA 論文稱大型多模態模型,POPE 論文寫成 LVLM,也有綜述把不產生文字的 CLIP 算進來。以下採 Hugging Face 文件「能接收圖片的語言模型」這種窄義;中文採國家教育研究院樂詞網收錄的譯名「視覺語言模型」。

下面依序談三段結構、三篇里程碑論文、相近名詞與常見錯誤,最後用讀收據的示例示範怎麼核對。

三段結構:視覺編碼器、連接層、語言模型

常見的視覺語言模型可拆成三段。視覺編碼器把圖片轉成一串向量,也就是影像特徵;常見做法來自 ViT 論文,把圖片切成固定大小的小方塊,像文字 token 一樣交給 Transformer。連接層把影像特徵換成語言模型讀得懂的影像 token;語言模型再參照這些 token 讀你的問題,產生回答。

語言模型這一段多半也是 Transformer,注意力怎麼連起前後文,見;LLaVA 這類接法把影像 token 直接放進上下文,Flamingo 則在層間另加交叉注意力去讀影像特徵。

關鍵在交接點:語言模型只讀得到編碼器交出的特徵,讀不到像素。編碼器沒保留的小字、朝向或前後位置,語言模型可能依常見說法補上一個聽起來合理的答案。

圖片經視覺編碼器、連接層進入語言模型,和文字問題一起產生文字回答;下方標出 CLIP、Flamingo、LLaVA 各自處理哪一段
由左往右看資料怎麼流動,下方三格是三篇論文各自改進的位置。 · 圖片:Mokaair (© Mokaair)

CLIP、Flamingo、LLaVA 各補上哪一塊

CLIP(Radford 等人,2021)訓練的是第一段。它用網路上的 4 億組圖文配對同時訓練影像與文字編碼器,目標是在一批圖文中認出真正成對的組合,而不是逐字預測說明;學完後把類別名稱寫成文字,就能零樣本分類。CLIP 本身不產生文字,只算圖文相符的程度;它的影像編碼器後來成了許多視覺語言模型的第一段。

Flamingo(Alayrac 等人,2022)處理第二段:凍結訓練好的視覺模型與語言模型,在中間加新元件。Perceiver Resampler 把長短不一的影像特徵壓成固定 64 個視覺 token;語言模型各層之間插入新的閘控交叉注意力層,閘控係數從 0 開始,所以訓練之初輸出和原本的語言模型相同。它也能讀圖文交錯的輸入,提示詞裡放幾組圖片與答案當示範,就能做新任務。

LLaVA(Liu 等人,2023)的連接層只有一層線性投影,論文列的第一項貢獻是資料:把 COCO 圖片的說明文字與物件定界框交給只能讀文字的大型語言模型,生成 15.8 萬筆圖文指令資料,做視覺指令調整。訓練分兩階段,先只訓練投影層,讓影像特徵對上詞嵌入,再連同語言模型一起微調,視覺編碼器始終凍結。

和多模態 AI、文字生圖怎麼分

範圍較廣,處理兩種以上資料形式的系統都算,包括語音與影片。Google 機器學習詞彙表舉的多模態模型例子,是輸入圖片與說明、輸出相符分數,和 CLIP 同一型;它是多模態模型,卻不是窄義的視覺語言模型。

方向相反:輸入文字、輸出圖片。同一個產品可能兩種都有,但能根據照片回答,不表示能照描述畫圖;分不清時先看輸出。

依輸入與輸出的方向區分;資料截至 2026 年 10 月。
名詞輸入 → 輸出典型的一句話
視覺語言模型(窄義)圖片加文字 → 文字「這張收據的總額是多少?」
CLIP 這類圖文比對模型圖片加文字 → 相符分數「比較像貓還是狗?」
多模態 AI兩種以上形式,方向不限語音對話、影片摘要都算
文字生圖文字 → 圖片「畫一張夜市插圖」

三種常見的錯:數量、位置、看見不存在的東西

數物體數量是 CLIP 論文自己列出的弱點。Tong 等人 2024 年找出 CLIP 編碼後幾乎一樣、純視覺模型卻分得出差別的圖片對,出了 150 對、300 個簡單問題,涵蓋方向、數量、位置等九類。論文的使用者測試裡,人平均答對 95.7% 的題目;模型的計分是一對圖的兩題都答對才算對,這樣亂猜約得 25%,多數受測模型卻低於 25%。讓 CLIP 吃力的類型,也多半讓以它為第一段的模型吃力。

空間關係也弱。Kamath 等人 2023 年自己拍了 820 張家用物品照片,例如同一個杯子放在桌子上、下、左、右,讓模型從只差一個介系詞的英文說明裡選出正確的。受測的 18 個圖文模型全部遠落後人類,不少只比亂猜高幾個百分點。作者也發現,大型圖文資料集的說明裡,「left of」這類空間介系詞只占約 0.2%;「左邊」以誰為準,本來就常說不清。

第三種是物件幻覺:說出圖中沒有的東西。Li 等人 2023 年的 POPE 研究指出,舊指標 CHAIR 從模型寫的圖說裡挑錯,結果會隨提示詞大幅變動,於是改問是非題「圖中有沒有某物」。他們從 MSCOCO 取 500 張照片,每張問 6 題、有無各半;圖中沒有的物體分三種挑法:隨機、資料集裡最常見的、最常和圖中物體一起出現的。受測的五個模型裡,有三個答「有」的比例在三種挑法下都超過 95%;整體來看,最常一起出現的那一組最容易被說成有。

論文作者也記錄過這類錯:Flamingo 有時給出只看文字合理、對照圖片卻錯的答案;冰箱只有優格和草莓,LLaVA 卻說有草莓口味優格。

物件幻覺是的一種,好處是證據就在手上:答案裡的物體、數字與位置,都能回到圖片核對。

示例:讀一張收據時怎麼核對

以下是示例,未實測任何產品,內容皆為虛構。假設你拍下一張小吃店收據,請它整理成記帳明細;收據有五個品項、一行外帶袋費用、總額,以及一行小字日期。

  1. 先轉錄、不摘要:請它由上到下列出每一行的品名、數量和金額,看不清就寫「看不清」。
  2. 自己加總:用它列的金額算一次,和收據印的總額比;對不上,就是有行漏掉、多出或讀錯。
  3. 換問法查多出的項目:不問「有沒有外帶袋費用」,改問「哪些行不是餐點」,再對照片。
  4. 小字另拍:日期放大再拍一張單獨問,前後比對。

預期結果是每行都對得上照片,加總等於總額。可能的失敗有三種:兩行同名品項合成一行,是數量錯;「8」讀成「6」,是細節沒保留;多出收據上沒有的「飲料」,是物件幻覺。總額不符時先在照片上找出是哪一行,不要請它「再看一次」就接受新數字。

讀地圖也一樣:問「車站在公園哪一邊」前,先講明以地圖上方為北,還是以拍照者面對的方向為準;先請它列出看得到的地名,對過再問路線,最後用地圖服務或現場標示核對。

適合交給它的事,與不要只靠它的事

適合交給它的是之後有人核對的初稿:描述照片、轉出清楚的印刷字、把表格整理成條列。不要只靠它的,是錯一次代價很高的判斷:金額、距離與方向、藥品標示或醫療影像;LLaVA 論文談風險時也點名了醫療。

研究分數只屬於各自的設定。上面的數字出自 2021 到 2024 年的論文,不代表今天的產品仍有同樣的錯,也不代表已改善;資料截至 2026 年 10 月,最可靠的仍是用自己的圖片抽查。

其他影像與語音相關的概念,可從找起。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

  • 生活分享

    迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走

    迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。

最新旅遊情報攻略

資料來源

生活分享