生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
閱讀時間約 8 分鐘

視覺語言模型(Vision-Language Model,VLM)在這裡指能同時接收圖片與文字、再輸出文字的模型:給它一張照片和一個問題,它用文字回答。名稱用法不一:Flamingo 論文自稱 Visual Language Model,LLaVA 論文稱大型多模態模型,POPE 論文寫成 LVLM,也有綜述把不產生文字的 CLIP 算進來。以下採 Hugging Face 文件「能接收圖片的語言模型」這種窄義;中文採國家教育研究院樂詞網收錄的譯名「視覺語言模型」。
下面依序談三段結構、三篇里程碑論文、相近名詞與常見錯誤,最後用讀收據的示例示範怎麼核對。
三段結構:視覺編碼器、連接層、語言模型
常見的視覺語言模型可拆成三段。視覺編碼器把圖片轉成一串向量,也就是影像特徵;常見做法來自 ViT 論文,把圖片切成固定大小的小方塊,像文字 token 一樣交給 Transformer。連接層把影像特徵換成語言模型讀得懂的影像 token;語言模型再參照這些 token 讀你的問題,產生回答。
語言模型這一段多半也是 Transformer,注意力怎麼連起前後文,見Transformer 架構Transformer 架構(Transformer)是什麼Transformer 是以注意力機制處理序列關係的神經網路架構,也是許多語言與多模態模型的重要基礎。本文用活動公告中的代名詞與語序例子,說明自注意力、位置資訊、前饋網路和遮罩如何合作,區分原始編碼器解碼器設計與後來變體。讀完能理解模型如何利用上下文,也知道注意力權重不是人類注意力或完整決策解釋,長序列仍有運算與驗證成本。閱讀全文;LLaVA 這類接法把影像 token 直接放進上下文,Flamingo 則在層間另加交叉注意力去讀影像特徵。
關鍵在交接點:語言模型只讀得到編碼器交出的特徵,讀不到像素。編碼器沒保留的小字、朝向或前後位置,語言模型可能依常見說法補上一個聽起來合理的答案。
CLIP、Flamingo、LLaVA 各補上哪一塊
CLIP(Radford 等人,2021)訓練的是第一段。它用網路上的 4 億組圖文配對同時訓練影像與文字編碼器,目標是在一批圖文中認出真正成對的組合,而不是逐字預測說明;學完後把類別名稱寫成文字,就能零樣本分類。CLIP 本身不產生文字,只算圖文相符的程度;它的影像編碼器後來成了許多視覺語言模型的第一段。
Flamingo(Alayrac 等人,2022)處理第二段:凍結訓練好的視覺模型與語言模型,在中間加新元件。Perceiver Resampler 把長短不一的影像特徵壓成固定 64 個視覺 token;語言模型各層之間插入新的閘控交叉注意力層,閘控係數從 0 開始,所以訓練之初輸出和原本的語言模型相同。它也能讀圖文交錯的輸入,提示詞裡放幾組圖片與答案當示範,就能做新任務。
LLaVA(Liu 等人,2023)的連接層只有一層線性投影,論文列的第一項貢獻是資料:把 COCO 圖片的說明文字與物件定界框交給只能讀文字的大型語言模型,生成 15.8 萬筆圖文指令資料,做視覺指令調整。訓練分兩階段,先只訓練投影層,讓影像特徵對上詞嵌入,再連同語言模型一起微調,視覺編碼器始終凍結。
和多模態 AI、文字生圖怎麼分
多模態 AI多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI 能處理不只一種資訊形式,例如文字、圖像、聲音或影片,但支援多種輸入不代表也能產生所有輸出。本文用組裝收納架的情境,說明影像與文字如何互相補充、原生整合與串接流程的差別,以及看見圖片為何仍可能漏讀細節。附輸入設計和交叉核對方法,幫你判斷模型依據畫面回答,還是把合理猜測當成看見的事實。閱讀全文範圍較廣,處理兩種以上資料形式的系統都算,包括語音與影片。Google 機器學習詞彙表舉的多模態模型例子,是輸入圖片與說明、輸出相符分數,和 CLIP 同一型;它是多模態模型,卻不是窄義的視覺語言模型。
文字生圖文字生圖(Text-to-Image)是什麼:把描述轉成可挑選的影像文字生圖就是生圖 AI 在做的事:把主體、場景和風格描述轉成影像,但提示詞不是每個像素都會遵守的施工圖。本文以校園閱讀角提案為例,示範如何寫出可驗收的要求、比較候選圖與處理不合格細節,並區分文字生圖、圖片編修和擴散模型,說明負面提示與引導設定的適用界線,讓生成素材能接進實際設計工作。閱讀全文方向相反:輸入文字、輸出圖片。同一個產品可能兩種都有,但能根據照片回答,不表示能照描述畫圖;分不清時先看輸出。
| 名詞 | 輸入 → 輸出 | 典型的一句話 |
|---|---|---|
| 視覺語言模型(窄義) | 圖片加文字 → 文字 | 「這張收據的總額是多少?」 |
| CLIP 這類圖文比對模型 | 圖片加文字 → 相符分數 | 「比較像貓還是狗?」 |
| 多模態 AI | 兩種以上形式,方向不限 | 語音對話、影片摘要都算 |
| 文字生圖 | 文字 → 圖片 | 「畫一張夜市插圖」 |
三種常見的錯:數量、位置、看見不存在的東西
數物體數量是 CLIP 論文自己列出的弱點。Tong 等人 2024 年找出 CLIP 編碼後幾乎一樣、純視覺模型卻分得出差別的圖片對,出了 150 對、300 個簡單問題,涵蓋方向、數量、位置等九類。論文的使用者測試裡,人平均答對 95.7% 的題目;模型的計分是一對圖的兩題都答對才算對,這樣亂猜約得 25%,多數受測模型卻低於 25%。讓 CLIP 吃力的類型,也多半讓以它為第一段的模型吃力。
空間關係也弱。Kamath 等人 2023 年自己拍了 820 張家用物品照片,例如同一個杯子放在桌子上、下、左、右,讓模型從只差一個介系詞的英文說明裡選出正確的。受測的 18 個圖文模型全部遠落後人類,不少只比亂猜高幾個百分點。作者也發現,大型圖文資料集的說明裡,「left of」這類空間介系詞只占約 0.2%;「左邊」以誰為準,本來就常說不清。
第三種是物件幻覺:說出圖中沒有的東西。Li 等人 2023 年的 POPE 研究指出,舊指標 CHAIR 從模型寫的圖說裡挑錯,結果會隨提示詞大幅變動,於是改問是非題「圖中有沒有某物」。他們從 MSCOCO 取 500 張照片,每張問 6 題、有無各半;圖中沒有的物體分三種挑法:隨機、資料集裡最常見的、最常和圖中物體一起出現的。受測的五個模型裡,有三個答「有」的比例在三種挑法下都超過 95%;整體來看,最常一起出現的那一組最容易被說成有。
論文作者也記錄過這類錯:Flamingo 有時給出只看文字合理、對照圖片卻錯的答案;冰箱只有優格和草莓,LLaVA 卻說有草莓口味優格。
物件幻覺是AI 幻覺AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文的一種,好處是證據就在手上:答案裡的物體、數字與位置,都能回到圖片核對。
示例:讀一張收據時怎麼核對
以下是示例,未實測任何產品,內容皆為虛構。假設你拍下一張小吃店收據,請它整理成記帳明細;收據有五個品項、一行外帶袋費用、總額,以及一行小字日期。
- 先轉錄、不摘要:請它由上到下列出每一行的品名、數量和金額,看不清就寫「看不清」。
- 自己加總:用它列的金額算一次,和收據印的總額比;對不上,就是有行漏掉、多出或讀錯。
- 換問法查多出的項目:不問「有沒有外帶袋費用」,改問「哪些行不是餐點」,再對照片。
- 小字另拍:日期放大再拍一張單獨問,前後比對。
預期結果是每行都對得上照片,加總等於總額。可能的失敗有三種:兩行同名品項合成一行,是數量錯;「8」讀成「6」,是細節沒保留;多出收據上沒有的「飲料」,是物件幻覺。總額不符時先在照片上找出是哪一行,不要請它「再看一次」就接受新數字。
讀地圖也一樣:問「車站在公園哪一邊」前,先講明以地圖上方為北,還是以拍照者面對的方向為準;先請它列出看得到的地名,對過再問路線,最後用地圖服務或現場標示核對。
適合交給它的事,與不要只靠它的事
適合交給它的是之後有人核對的初稿:描述照片、轉出清楚的印刷字、把表格整理成條列。不要只靠它的,是錯一次代價很高的判斷:金額、距離與方向、藥品標示或醫療影像;LLaVA 論文談風險時也點名了醫療。
研究分數只屬於各自的設定。上面的數字出自 2021 到 2024 年的論文,不代表今天的產品仍有同樣的錯,也不代表已改善;資料截至 2026 年 10 月,最可靠的仍是用自己的圖片抽查。
其他影像與語音相關的概念,可從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文找起。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
生活分享
迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走
迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Radford 等:Learning Transferable Visual Models From Natural Language Supervision(CLIP,2021) · 查證日期:
- Alayrac 等:Flamingo: a Visual Language Model for Few-Shot Learning(NeurIPS 2022) · 查證日期:
- Liu 等:Visual Instruction Tuning(LLaVA,NeurIPS 2023) · 查證日期:
- Li 等:Evaluating Object Hallucination in Large Vision-Language Models(POPE,EMNLP 2023) · 查證日期:
- Dosovitskiy 等:An Image is Worth 16x16 Words(Vision Transformer,ICLR 2021) · 查證日期:
- Tong 等:Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs(MMVP,2024) · 查證日期:
- Kamath、Hessel、Chang:What's "up" with vision-language models?(空間關係,EMNLP 2023) · 查證日期:
- Rohrbach 等:Object Hallucination in Image Captioning(CHAIR 指標,EMNLP 2018) · 查證日期:
- Zhang 等:Vision-Language Models for Vision Tasks: A Survey(把 CLIP 類模型算進 VLM 的廣義用法) · 查證日期:
- Hugging Face Transformers 文件:Image-text-to-text(VLM 的窄義用法) · 查證日期:
- Google for Developers:機器學習詞彙表(繁體中文,多模態模型等譯名) · 查證日期:
- 國家教育研究院樂詞網:vision-language model(VLM)的譯名「視覺語言模型」 · 查證日期: