生活分享
預訓練(Pretraining):模型的基礎能力從哪裡來
預訓練是在特定任務調整之前,讓模型從大量資料學得可重用表示與規律的階段。本文用下一個 token 預測和遮住內容再還原的例子說明資料、目標與參數更新,區分預訓練、微調和使用時提供上下文,也解釋為什麼學過文字不等於記得來源或保證事實正確。讀完能理解基礎模型的能力來源,以及訓練資料品質和評估汙染的影響。
更新日期: 閱讀時間約 7 分鐘

預訓練,英文 Pretraining,是在特定任務的調整之前,先讓模型從資料學得可重用規律與表示的訓練階段。在語言模型裡,常見做法是預測接下來的 token,或根據上下文還原被遮住的內容。模型透過反覆比較預測與目標來更新參數,逐漸形成可用於多種任務的能力,而不是先由人逐條寫好所有語言規則。
「預」是相對後續用途而言,不代表這個階段比較簡單或只做暖身。它可能佔模型建置的大部分工作,資料整理與計算都很重要。本篇以 BERT 原始論文和 Hugging Face 的語言建模文件說明常見訓練目標,範例都是簡化的教學情境,不把某一個模型的流程當成所有 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 都必經的唯一道路。
模型究竟在練什麼
因果語言建模通常利用前文預測下一個 token。例如給出「活動因大雨」,目標可能來自原文接下來的內容。模型不是先拿到完整的人類意圖標籤,而是從文字序列本身取得預測練習。這類由資料生成目標的方式常稱為自我監督,並不表示資料完全不需要人處理,也不表示模型能自主判斷哪些文字是真實或值得學習。
遮罩語言建模則把部分內容遮住,讓模型從其餘上下文預測被遮的部分。BERT 的原始設計使用這類目標,結合雙向上下文學習表示,與只看前文預測後文的方式有所不同。兩種例子都能學到語言規律,但架構、目標與適合的下游任務不同,不能看到都叫預訓練就假定它們產生相同能力。
資料與參數如何互相影響
訓練時,模型先產生預測,損失函式衡量與目標的差距,再由最佳化程式調整參數。學習率、資料順序、批次與訓練長度會影響更新過程,但一般讀者不必記住所有公式,先抓住一件事:預訓練會改變模型內部參數。之後只在聊天框貼一份文件,通常是在提供當次上下文,並沒有執行同樣的參數更新。
資料內容也會影響模型較常接觸哪些語言、寫法與主題。如果某種臺灣口語、罕見專有名詞或文件格式在資料中不足,模型可能處理得較不穩定。更多資料並不自動等於更好的資料;重複、噪音與錯誤內容可能佔用訓練能力。談模型的能力來源時,需要把資料分佈與訓練目標一起看,不能只問參數有多大。
示範:從句子練習到新輸入
假設一個教學模型讀到許多公告句子,例如「活動因大雨延期」與「報名截止後不再受理」。下一個 token 預測會讓它學習在某些上下文後,哪些片段較常出現。之後遇到一段新的公告開頭,模型可能產生合理續文。但如果新活動其實照常舉行,它仍可能接出「延期」,因為合理延續不等於知道這場活動的真實決策。
若改用遮罩練習,把「報名截止後不再受理」中的某部分遮住,模型要利用前後文還原內容。預期學習成果是更能表示句子的關係,不是背出每份公告的出處。這兩個例子刻意使用同一類文字,方便看出訓練目標不同;它們沒有實際執行訓練,也不能用來推算真實模型的準確度或所需資料量。
再把一份剛修訂的公告貼給既有模型,它可以根據上下文回答,但那是推論階段使用新資料。除非另外啟動訓練流程,不能說模型因這一輪對話就完成預訓練或永久學會所有內容。產品是否把對話收集作後續訓練,是另一個資料使用政策問題,與當次模型計算機制也需要分開理解。
學過不等於可靠記憶庫
模型可能記住某些訓練內容,也可能只學到概括規律,不能假定每一段文字都能被精準取回。回答一個問題時,產生的語句也不會自動附上對應訓練文件。對需要最新資訊或來源定位的任務,外部檢索仍很重要;預訓練能力與檢索能力可以互補,並不是模型越大就越不需要證據。
評估還要避免把測試題混入訓練資料。如果模型已看過題目或答案,成績可能高估它處理新問題的能力。對一般使用者而言,可用自己新整理、答案能獨立檢查的案例觀察表現;對訓練團隊則需要資料去重、切分與版本紀錄。只報一個高分而不說明評估來源,難以判斷能力能否轉移到實際情境。
預訓練之後,還能做什麼
預訓練模型可以再接受領域資料的持續訓練,也可用特定任務示範做微調,或進行偏好最佳化等後訓練。不同團隊對階段名稱的切分可能不完全一致,重點是實際使用什麼資料、最佳化什麼目標,以及哪些參數被更新。把所有後續改進都籠統說成預訓練,會掩蓋模型能力是在哪裡形成的。
選擇應用方案時,可以先問缺的是通用語言能力、特定輸出行為,還是最新外部知識。前兩者可能需要適合的基礎模型或微調,最後一項通常需要資料管道。一般組織未必需要從頭預訓練;直接使用合適基礎模型,再設計檢索與評估,常能更快驗證需求。是否投入訓練,仍應由實際問題與資源決定。
閱讀模型介紹時,也別把「預訓練資料截至某日」當成它對那天之前所有事情都知道。日期最多提供資料時間範圍的一部分線索,涵蓋率、來源品質與模型是否學到都仍不確定。對重要主張,要求可核對的外部來源,比猜測模型當年可能讀過什麼更實際。
| 方法 | 處理重點 | 需要留意 |
|---|---|---|
| 預訓練 | 學習可重用表示與規律 | 會更新模型參數 |
| 微調 | 針對任務或領域調整 | 從既有參數繼續訓練 |
| 提供上下文 | 當次讀取額外資料 | 通常不更新參數 |
微調(Fine-tuning):讓既有模型更適合你的任務微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文
模型參數(Model Parameters)是什麼模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文
上下文學習(In-context Learning)是什麼:當場適應新規則上下文學習(In-context Learning)是什麼:當場適應新規則上下文學習是模型利用當次輸入中的說明或示範,改變處理新問題的方式,通常不涉及更新模型參數。本文用自訂書籍分類標籤的情境,分清「學會格式」「套用對應」與「真的掌握新規則」,說明少樣本提示和微調的關係,以及研究結果為何不能簡化成隨便放例子都有效。附可自行操作的對照流程,幫你觀察模型究竟依賴哪些線索。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Devlin 等:BERT · 查證日期:
- Hugging Face:Causal language modeling · 查證日期: