生活分享

監督式微調(SFT):用好示範教模型完成任務

監督式微調以輸入和期望輸出作為訓練示範,讓既有模型學習更穩定的任務行為。本文用會議待辦整理說明資料配對、對話角色、損失計算與保留測試集,區分 SFT、少樣本提示、LoRA 和偏好最佳化,也解釋示範中的猜測與格式錯誤如何被學進去。讀完能檢查訓練資料是否真的教會模型保留未知資訊,而不是只學會看起來完整。

更新日期: 閱讀時間約 6 分鐘

輸入與標準答案成對排列,一起形成監督訊號送進既有模型
圖片:Mokaair (© Mokaair)

監督式微調,英文 Supervised Fine-tuning,常縮寫為 SFT,是利用輸入與期望輸出的示範,在既有模型上繼續訓練。以語言模型為例,輸入可能是使用者的要求及資料,期望輸出則是符合規則的回答。模型在訓練中調整,使示範答案更可能被產生,逐漸學習任務格式、說法與處理方式。

「監督式」表示訓練有明確的目標訊號,不代表每一輪回答都有真人旁觀,也不保證示範本身正確。本篇以虛構會議紀錄整理成待辦清單的情境,說明如何建立有用示範。參考 TRL 官方 SFT 文件及 InstructGPT 研究,但不把某工具的預設設定當成所有模型通用規則,更不宣稱範例已完成訓練測試。

好示範比漂亮答案更重要

假設目標是從會議紀錄提取工作項目、負責人與期限。示範需要教模型只填原文明示的資訊,沒有負責人便標示未指定,沒有期限便保留空缺。如果標註者為了讓表格完整而自行猜測日期,模型可能學到「缺資訊也要補齊」的行為。輸出看起來專業,反而偏離了任務真正要求的忠實整理。

資料配對還要保持一致。對相同模糊程度的句子,有的示範寫成確定待辦,有的保留待確認,模型就會收到衝突訊號。開始收集大量資料之前,應先定義什麼算承諾、討論提案與背景資訊,並讓標註者處理同一小組案例比對差異。SFT 的上限常受到目標本身是否清楚影響,不是只靠增加示範數就能解決。

訓練怎麼使用輸入與答案

常見語言模型 SFT 仍以預測答案 token 為核心,但資料被整理成明確的任務示範。對話資料需要保留系統、使用者及助理角色,並符合該模型的對話模板。角色分錯可能使模型學成模仿使用者提問,或把應作背景的文字當成要輸出的答案。因此資料格式不是包裝細節,而是訓練目標的一部分。

損失計算範圍也值得檢查。TRL 文件提供只對助理回答計算損失、或只對完成內容計算損失的選項;具體行為受資料型別與模板支援影響。不能看見有一欄答案,就假定工具一定只訓練那一欄。訓練前應讀取實際 token 化與遮罩結果,確認重要回答未被截斷,且不打算學習的角色內容沒有誤入目標。

會議原文與期望待辦配對,SFT 學習已知內容的整理與未知欄位的保留,再用新會議驗證
目標輸出不只要格式正確,也要忠於原文。 · 圖片:Mokaair (© Mokaair)

示範:會議待辦如何配對

輸入假設寫「小林下週寄出簡報;場地是否更換,等管理員回覆後再決定」。期望輸出可以明確列出小林寄送簡報的待辦,期限保留原文的相對表達,並把換場地列為待確認事項。若沒有會議日期,不能擅自把「下週」轉成某個日曆日期。這是原創教學示例,不是任何真實會議或模型測試結果。

接著做一個對照輸入:「可以請小林考慮寄一份簡報嗎?」它可能只是提議,是否算正式交辦應依資料標註規則決定。測試集應同時包含承諾、疑問、否定與待確認句,檢查模型是否抓住任務語意。若只測與示範相同的句型,可能得到漂亮的格式分數,卻看不到實際會議裡的困難。

預期驗收至少分成內容正確、欄位格式與未知事項處理。模型若把人名放對欄位,卻把沒有期限的事項補成明天,仍屬失敗。反之,一份誠實保留空缺的清單不應因為看起來比較不完整而被標成較差。這種評估設計會反過來影響資料品質,讓模型學到產品真正需要的行為。

SFT 和其他方法怎麼分工

少樣本提示把例子放進當次上下文,通常不更新模型參數;SFT 則使用資料執行訓練,效果存在於訓練後的模型狀態。LoRA 是一種參數效率更新方式,可以用來執行 SFT,不是另一種互斥的示範格式。偏好最佳化則利用較佳與較差回答的比較,與直接提供期望答案的訊號不同,實務上可以接在示範學習之後。

如果問題是每週會議的最新內容,SFT 也不會替你自動讀取。應用仍需提供會議逐字稿、相關專案資料及必要日期,模型才能處理當次任務。訓練可以讓它更會整理,資料管道則負責讓它看到正確內容。把兩者分開,才能避免以為「訓練過公司資料」就能知道所有後續變動。

哪些證據才算訓練有用

保留未見過的會議資料非常重要,最好按會議或專案切分,避免同場會議的改寫版本同時出現在訓練與測試。評估時與清楚提示詞的原模型比較,檢視 SFT 是否在真實需求上改善,而不是只因用了更好的提示詞。也要檢查原本需保留的能力,有沒有因專用訓練而退化。

訓練損失下降表示模型更適應所用目標,不能單獨證明待辦清單更可靠。上線前還要驗證模型載入、對話模板、輸出解析和版本相容;上線後則抽查新類型會議與規則變更。若改變了「提案是否算待辦」的業務定義,舊示範可能也要重整,不能只期待推論時加一句話就完全抵銷衝突。

一份可交接的 SFT 成果應包含標註規則、資料來源範圍、訓練和評估版本,以及代表性的錯誤案例。這些資訊讓下一位維護者知道模型學的是什麼,哪些空缺是刻意保留。對一般讀者而言,最值得記住的是:SFT 在放大示範的行為,所以資料中的誠實、不確定性與例外處理,都和正確答案一樣重要。

概念對照;來源查證於 2026 年 9 月。
方法處理重點需要留意
少樣本提示當次提供示範通常不更新參數
SFT學習輸入到期望輸出示範品質決定目標
偏好最佳化比較不同回答品質需要一致的偏好準則

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享