生活分享
監督式微調(SFT):用好示範教模型完成任務
監督式微調以輸入和期望輸出作為訓練示範,讓既有模型學習更穩定的任務行為。本文用會議待辦整理說明資料配對、對話角色、損失計算與保留測試集,區分 SFT、少樣本提示、LoRA 和偏好最佳化,也解釋示範中的猜測與格式錯誤如何被學進去。讀完能檢查訓練資料是否真的教會模型保留未知資訊,而不是只學會看起來完整。
更新日期: 閱讀時間約 6 分鐘

監督式微調,英文 Supervised Fine-tuning,常縮寫為 SFT,是利用輸入與期望輸出的示範,在既有模型上繼續訓練。以語言模型為例,輸入可能是使用者的要求及資料,期望輸出則是符合規則的回答。模型在訓練中調整參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文,使示範答案更可能被產生,逐漸學習任務格式、說法與處理方式。
「監督式」表示訓練有明確的目標訊號,不代表每一輪回答都有真人旁觀,也不保證示範本身正確。本篇以虛構會議紀錄整理成待辦清單的情境,說明如何建立有用示範。參考 TRL 官方 SFT 文件及 InstructGPT 研究,但不把某工具的預設設定當成所有模型通用規則,更不宣稱範例已完成訓練測試。
好示範比漂亮答案更重要
假設目標是從會議紀錄提取工作項目、負責人與期限。示範需要教模型只填原文明示的資訊,沒有負責人便標示未指定,沒有期限便保留空缺。如果標註者為了讓表格完整而自行猜測日期,模型可能學到「缺資訊也要補齊」的行為。輸出看起來專業,反而偏離了任務真正要求的忠實整理。
資料配對還要保持一致。對相同模糊程度的句子,有的示範寫成確定待辦,有的保留待確認,模型就會收到衝突訊號。開始收集大量資料之前,應先定義什麼算承諾、討論提案與背景資訊,並讓標註者處理同一小組案例比對差異。SFT 的上限常受到目標本身是否清楚影響,不是只靠增加示範數就能解決。
訓練怎麼使用輸入與答案
常見語言模型 SFT 仍以預測答案 token 為核心,但資料被整理成明確的任務示範。對話資料需要保留系統、使用者及助理角色,並符合該模型的對話模板。角色分錯可能使模型學成模仿使用者提問,或把應作背景的文字當成要輸出的答案。因此資料格式不是包裝細節,而是訓練目標的一部分。
損失計算範圍也值得檢查。TRL 文件提供只對助理回答計算損失、或只對完成內容計算損失的選項;具體行為受資料型別與模板支援影響。不能看見有一欄答案,就假定工具一定只訓練那一欄。訓練前應讀取實際 token 化與遮罩結果,確認重要回答未被截斷,且不打算學習的角色內容沒有誤入目標。
示範:會議待辦如何配對
輸入假設寫「小林下週寄出簡報;場地是否更換,等管理員回覆後再決定」。期望輸出可以明確列出小林寄送簡報的待辦,期限保留原文的相對表達,並把換場地列為待確認事項。若沒有會議日期,不能擅自把「下週」轉成某個日曆日期。這是原創教學示例,不是任何真實會議或模型測試結果。
接著做一個對照輸入:「可以請小林考慮寄一份簡報嗎?」它可能只是提議,是否算正式交辦應依資料標註規則決定。測試集應同時包含承諾、疑問、否定與待確認句,檢查模型是否抓住任務語意。若只測與示範相同的句型,可能得到漂亮的格式分數,卻看不到實際會議裡的困難。
預期驗收至少分成內容正確、欄位格式與未知事項處理。模型若把人名放對欄位,卻把沒有期限的事項補成明天,仍屬失敗。反之,一份誠實保留空缺的清單不應因為看起來比較不完整而被標成較差。這種評估設計會反過來影響資料品質,讓模型學到產品真正需要的行為。
SFT 和其他方法怎麼分工
少樣本提示把例子放進當次上下文,通常不更新模型參數;SFT 則使用資料執行訓練,效果存在於訓練後的模型狀態。LoRA 是一種參數效率更新方式,可以用來執行 SFT,不是另一種互斥的示範格式。偏好最佳化則利用較佳與較差回答的比較,與直接提供期望答案的訊號不同,實務上可以接在示範學習之後。
如果問題是每週會議的最新內容,SFT 也不會替你自動讀取。應用仍需提供會議逐字稿、相關專案資料及必要日期,模型才能處理當次任務。訓練可以讓它更會整理,資料管道則負責讓它看到正確內容。把兩者分開,才能避免以為「訓練過公司資料」就能知道所有後續變動。
哪些證據才算訓練有用
保留未見過的會議資料非常重要,最好按會議或專案切分,避免同場會議的改寫版本同時出現在訓練與測試。評估時與清楚提示詞的原模型比較,檢視 SFT 是否在真實需求上改善,而不是只因用了更好的提示詞。也要檢查原本需保留的能力,有沒有因專用訓練而退化。
訓練損失下降表示模型更適應所用目標,不能單獨證明待辦清單更可靠。上線前還要驗證模型載入、對話模板、輸出解析和版本相容;上線後則抽查新類型會議與規則變更。若改變了「提案是否算待辦」的業務定義,舊示範可能也要重整,不能只期待推論時加一句話就完全抵銷衝突。
一份可交接的 SFT 成果應包含標註規則、資料來源範圍、訓練和評估版本,以及代表性的錯誤案例。這些資訊讓下一位維護者知道模型學的是什麼,哪些空缺是刻意保留。對一般讀者而言,最值得記住的是:SFT 在放大示範的行為,所以資料中的誠實、不確定性與例外處理,都和正確答案一樣重要。
| 方法 | 處理重點 | 需要留意 |
|---|---|---|
| 少樣本提示 | 當次提供示範 | 通常不更新參數 |
| SFT | 學習輸入到期望輸出 | 示範品質決定目標 |
| 偏好最佳化 | 比較不同回答品質 | 需要一致的偏好準則 |
微調(Fine-tuning):讓既有模型更適合你的任務微調(Fine-tuning):讓既有模型更適合你的任務微調是在既有模型上繼續訓練,讓它更適合特定任務或領域。本文以客服信件分類說明資料整理、參數更新、保留測試集與版本部署,區分完整微調、LoRA、監督式微調和 RAG,也解釋訓練成績變好卻實際退步的原因。讀完能判斷問題是否值得微調,以及如何檢查格式一致性、未知類型、資料洩漏和原有能力退化。閱讀全文
少樣本提示(Few-shot Prompting)是什麼:用例子教清楚格式少樣本提示(Few-shot Prompting)是什麼:用例子教清楚格式少樣本提示是在同一次輸入裡放入少量示範,讓模型依照範例處理新資料;它不等於替模型重新訓練。本文用失物招領分類的情境,教你挑選一般案例、邊界案例與資料不足案例,避免模型只模仿表面用詞。附測試方法、比較表與原創圖解,說明何時應增加例子、何時先改分類規則,以及為什麼示範資料必須和驗證資料分開。閱讀全文
直接偏好最佳化(DPO):用回答比較直接調整模型直接偏好最佳化(DPO):用回答比較直接調整模型直接偏好最佳化利用同一問題下的較佳與較差回答,直接調整模型對回答的相對偏好。本文依原始論文和 TRL 文件說明參考模型、偏好配對及訓練目標,以產品說明摘要示範資料如何影響結果,也區分 DPO、SFT 與典型 RLHF。讀完能理解它省略了哪些訓練環節,以及為什麼流程較簡單仍不能跳過資料品質、評估和能力退化檢查。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算