生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
閱讀時間約 8 分鐘

世界模型(World Model)泛指系統內部用來預測「這樣做之後會怎樣」的模型。這個詞沒有單一定義,常見用法至少三種:強化學習代理學到的環境模型、LeCun 主張預測抽象表示的架構路線,以及隨操作即時生成畫面的互動環境。看到這個詞,先問是哪一種、預測什麼、怎麼驗證。
以下逐一說明,並整理大型語言模型有沒有世界模型的正反研究,資料截至 2026 年 10 月。第一種建立在強化學習強化學習(Reinforcement Learning)是什麼:靠獎勵一步步試出做法強化學習讓代理在環境中採取動作,依環境回饋的獎勵數字調整策略,目標是長期累積的回報最大。內容用格子世界示例說明狀態、動作、獎勵、策略與回報,對照監督式與非監督式學習,解釋探索與利用的取捨,再談語言模型裡的偏好獎勵與可驗證獎勵,以及獎勵設計不良時為什麼會被鑽漏洞。閱讀全文之上,第三種和文字生影片文字生影片(Text-to-Video)是什麼:讓畫面在時間裡保持連貫文字生影片是影片生成 AI 的基本任務:依描述生成動態畫面,除了物件與風格,還要處理動作順序、鏡頭和跨影格一致性。本文以陶杯轉動展示的示意案例,拆解怎麼寫單一鏡頭、檢查物件是否變形,以及如何分辨影格數、播放速度與真正的動作品質,並說明它和圖片生影片、動畫及剪輯工作的關係,避免把漂亮首幀當成整段影片合格。閱讀全文技術相鄰。
一個詞,三種用法
Sutton 與 Barto 的強化學習教科書把環境模型定義為代理用來預測環境如何回應其動作的任何東西:給定狀態與動作,預測下一個狀態與獎勵;以模型為輸入、產生或改進行動策略的計算,書中稱為規劃(planning)。三種用法都以「預測下一步」為核心,差在預測什麼、拿來做什麼。
| 用法 | 預測什麼 | 怎麼檢驗 |
|---|---|---|
| 強化學習的環境模型(Dreamer 等) | 動作之後的下一個狀態與獎勵 | 想像中學到的行為,在真實環境是否有效 |
| LeCun 的架構路線(JEPA) | 未來狀態的抽象表示,不重建像素 | 能否拿來規劃、完成實際任務 |
| 生成式互動環境(Genie 系列) | 回應最新操作的下一格畫面 | 長時間互動是否一致、是否照操作回應 |
| 相關爭論:語言模型內部 | 不另外訓練,問內部有沒有表示狀態 | 能否讀出、改動後輸出是否跟著變、換題是否失靈 |
強化學習裡的世界模型:在想像中練習
Ha 與 Schmidhuber 2018 年的〈World Models〉把代理拆成三塊:視覺部分把每格畫面壓縮成一小串數字,記憶部分依目前狀態與動作預測下一格的壓縮結果,控制器只是很小的線性模型。在 VizDoom 躲火球任務裡,控制器完全在世界模型生成的「夢境」裡訓練,放回真實遊戲後平均撐過約 1,100 個時間步,高於過關門檻的 750 步。
論文也記下弱點:控制器曾學會一種走位,讓夢裡的怪物在某些回合完全不發射火球,真實遊戲並沒有這個漏洞。世界模型只是近似,策略會專挑它預測錯的地方得分。Hafner 等人 2019 年的 Dreamer 同樣在學到的精簡狀態空間裡想像未來,直接從想像的軌跡學習行為;2023 年的 DreamerV3 論文報告,同一組設定在 150 多種任務上勝過專門方法,也是第一個不靠人類資料或由易到難的課程、從零在 Minecraft 收集到鑽石的演算法。
示例(假想情境,未實測):掃地機器人要回充電座,前方有門檻。世界模型替三個候選動作各推演幾步:直走會卡住,左繞與右繞都能抵達,右繞較短。規劃器選右繞但只走第一步,再拿感測結果比對預測,差距大就重新規劃。若右邊鋪著訓練時沒見過的長毛地毯,模型可能照樣預測「順利通過」,規劃器便一路選它;這時錯在預測而非規劃,要補收這種地面的經驗、重新訓練。
LeCun 的路線:預測抽象表示,不預測每個像素
LeCun 2022 年的立場論文提出一套代理架構,世界模型是最複雜的模組,負責補上感知沒看到的狀態,並預測一串動作之後的可能未來。他主張在抽象表示空間裡預測,且要能表示多種可能,因為世界並不完全可預測。
他提出的 JEPA(Joint Embedding Predictive Architecture,聯合嵌入預測架構)不生成畫面,而是把現在與未來各自編碼成表示,再從前者預測後者。例如車子開到岔路口:表示記下車子的位置、方向、速度等特徵,路邊樹木和人行道紋理可以忽略,往左或往右交給一個潛在變數。他認為樹葉擺動、水面漣漪這類細節無法長期準確預測,JEPA 可以選擇忽略,逐像素生成的模型卻得預測它們。
這是一位研究者的主張,論文開頭就說它不是傳統意義的技術論文。沿這條路的實驗之一是 Meta 團隊 2025 年的 V-JEPA 2:先用網路影片訓練,再用不到 62 小時的機器人影片學會預測動作後果,讓兩個實驗室的機械手臂對照目標影像規劃,完成抓取與放置。這說明該設定下可行,不代表路線已勝出。
生成式互動環境:會回應操作的生成畫面
第三種用法來自生成模型。Google DeepMind 2024 年的 Genie 論文用沒有動作標註的網路影片訓練,模型自己學出潛在動作;示範時從一張圖片起步,可以是照片、手繪草圖或文字生成的圖片,跨資料形式的處理可對照多模態 AI多模態 AI(Multimodal AI)是什麼:把圖像、聲音與文字一起理解多模態 AI 能處理不只一種資訊形式,例如文字、圖像、聲音或影片,但支援多種輸入不代表也能產生所有輸出。本文用組裝收納架的情境,說明影像與文字如何互相補充、原生整合與串接流程的差別,以及看見圖片為何仍可能漏讀細節。附輸入設計和交叉核對方法,幫你判斷模型依據畫面回答,還是把合理猜測當成看見的事實。閱讀全文。官方文章描述,2025 年 8 月發表的 Genie 3 能直接依文字提示即時生成可探索的環境,大致維持數分鐘一致,畫面記憶最多回溯約一分鐘。
它和一般影片生成的差別是每一格都要回應最新操作;官方指出逐格生成的誤差會累積,比一次生成整段影片更難維持一致。官方也列出限制:代理能直接做的動作有限、多個代理互動難模擬、無法精準重現真實地點、連續互動只能撐幾分鐘。以上都是開發者的描述與挑選過的示範,不是獨立評測。
大型語言模型有沒有世界模型
相關爭論是:只學預測下一個 token 的模型,內部會不會形成世界狀態的表示?Li 等人 2023 年的 Othello-GPT 只用黑白棋的合法棋步訓練 GPT 變體,沒告訴它規則或棋盤,研究者卻能用探針(probe,讀取內部活化值的小型分類器)讀出棋盤;在內部改動其中一格,預測的合法棋步也跟著變,可見這個表示會影響輸出。他們按黑白子讀時只有非線性探針讀得準,Nanda 等人改按「我方/對方」讀,線性探針也讀得出來。Gurnee 與 Tegmark 在開放權重語言模型裡找到地名經緯度與人物、作品、新聞年代的線性表示,稱為世界模型的「基本成分」,但也說這還不是完整的世界模型。
較具體的反面證據是 Vafa 等人在 NeurIPS 2024 的研究。他們用紐約計程車的逐段轉向路線訓練 transformer,模型給出的下一步幾乎都合法,也常找到最短路線;但從它還原的曼哈頓地圖和真實街道相去甚遠,有方向不可能的街道,一遇到繞道表現就下滑。用真實棋譜訓練的黑白棋模型也有同樣落差,用合成棋局訓練的則沒有;他們直接下提示詞測試的大型語言模型,在邏輯謎題上也出現類似情形。合起來看,規則明確的小領域有內部狀態表示的證據,但會預測下一步不等於有一致的世界模型,一般大型語言模型有沒有,取決於怎麼定義、怎麼量。
讀世界模型新聞時先問的事
- 說的是哪一種:三種用法的成功標準不同,先對上是哪一種。
- 預測什麼:狀態與獎勵、抽象表示,還是畫面?畫面逼真不代表物理關係正確。
- 怎麼驗證:想像中學到的行為在真實環境如何、長時間互動是否一致、有沒有第三方重現。
- 示範怎麼挑的:官方片段只說明做得到某些畫面,看不出失敗多常發生。
有開發者把世界模型說成通往AGI通用人工智慧(AGI)是什麼:各家定義為什麼不一樣AGI 沒有公認定義:OpenAI 章程看經濟價值工作,Google DeepMind 的 Levels of AGI 用表現與通用程度分級並把自主性分開談,學術界則量目標達成與技能習得效率。內容並列這些定義,說明基準測試分數為何不能直接宣告 AGI,並附讀新聞的檢查清單。閱讀全文的一步,Genie 3 的官方文章就這樣寫;但 AGI 沒有共識定義,這是研究方向的主張,不是已驗證的結果。其他名詞可從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文查起。
同主題延伸閱讀
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
生活分享
迎合(Sycophancy)是什麼:AI 為什麼順著你說,怎麼問才不被帶著走
迎合(Sycophancy)指 AI 順著使用者的立場改變答案,犧牲正確性。內容依 Perez、Sharma、Cheng 等人的論文與 OpenAI 對 2025 年 4 月事件的公開檢討,說明研究怎麼量測、可能的成因、它與幻覺的差別,並用同一題問三次的示例,教你判讀差異與降低被帶著走的機率。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Sutton、Barto:Reinforcement Learning: An Introduction 第二版(作者官網全文,第 8.1 節 Models and Planning) · 查證日期:
- Ha、Schmidhuber:World Models(arXiv:1803.10122) · 查證日期:
- Hafner 等:Dream to Control: Learning Behaviors by Latent Imagination(arXiv:1912.01603) · 查證日期:
- Hafner 等:Mastering Diverse Domains through World Models(DreamerV3,arXiv:2301.04104) · 查證日期:
- LeCun:A Path Towards Autonomous Machine Intelligence(OpenReview,Version 0.9.2) · 查證日期:
- Assran 等:V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning(arXiv:2506.09985) · 查證日期:
- Bruce 等:Genie: Generative Interactive Environments(arXiv:2402.15391) · 查證日期:
- Google DeepMind:Genie 3: A new frontier for world models(官方文章,2025 年 8 月) · 查證日期:
- Li 等:Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task(arXiv:2210.13382,ICLR 2023) · 查證日期:
- Nanda、Lee、Wattenberg:Emergent Linear Representations in World Models of Self-Supervised Sequence Models(arXiv:2309.00941) · 查證日期:
- Gurnee、Tegmark:Language Models Represent Space and Time(arXiv:2310.02207) · 查證日期:
- Vafa 等:Evaluating the World Model Implicit in a Generative Model(arXiv:2406.03689,NeurIPS 2024) · 查證日期: