生活分享

少樣本提示(Few-shot Prompting)是什麼:用例子教清楚格式

少樣本提示是在同一次輸入裡放入少量示範,讓模型依照範例處理新資料;它不等於替模型重新訓練。本文用失物招領分類的情境,教你挑選一般案例、邊界案例與資料不足案例,避免模型只模仿表面用詞。附測試方法、比較表與原創圖解,說明何時應增加例子、何時先改分類規則,以及為什麼示範資料必須和驗證資料分開。

更新日期: 閱讀時間約 7 分鐘

幾張已配對的物品卡引導一張空白新卡排列到相同格式的輸出位置。
圖片:Mokaair (© Mokaair)

少樣本提示(Few-shot Prompting)是把少量已完成的輸入與輸出示範放進提示詞,再請模型處理新的輸入。你不是只說「照這個格式」,而是讓它看到格式長什麼樣、分類邊界如何判斷,以及資料不完整時應該怎麼表達。

這種方法常適合難以只靠一句規則說清楚的工作,例如把民眾留言整理成固定欄位。但它不是永久訓練,也不保證例子越多越準。以下以失物招領資料為原創教學情境,示範如何選例子、檢查新案例,再判斷是否值得保留這套提示。

示範放在當次上下文,並未修改模型參數

Brown 等人的原始研究使用文字指示與示範,讓模型在沒有梯度更新或的情況下處理任務。少樣本提示沿用這個操作重點:例子作為當次輸入的一部分,幫助模型辨認任務與預期輸出。這與蒐集資料後重新調整模型的微調不同。

假如你給出「黑色雨傘在圖書館入口拾獲」對應「物品:雨傘;地點:圖書館入口」,模型可以用這個例子推測欄位寫法。當你開新對話而系統沒有帶回示範時,不能假設它仍知道你自訂的格式。若需要反覆使用,應把經確認的示範保存在可重用的提示或工作設定裡。

少樣本也沒有通用的最佳數量。選多少要看任務複雜度、例子長度與錯誤類型。如果分類規則本身矛盾,放更多例子可能只是增加混亂;如果格式很特別,一個清楚示範可能已經提供大量幫助。應以新資料的表現判斷,不用追求固定的示範數字。

普通、缺漏與邊界三種示範一起定義處理規則,新留言套用後由另一批未示範資料驗證。
示範用來傳達規則,驗證資料用來確認規則是否能套用到新情況。 · 圖片:Mokaair (© Mokaair)

用對例子,讓分類邊界變得可見

失物招領的普通例子可以包含明確物品與地點,但只放這類範例,模型可能誤以為每則留言都有完整資訊。第二種示範應處理缺漏,例如「剛剛撿到一張卡片」,預期地點欄位寫「未提供」,不能猜在車站或教室。

邊界案例則能表達容易混淆的規則。像「我的耳機不見了」是尋物消息,不是拾獲消息;若你的系統只收拾獲資料,就要示範如何不適用。這比多放幾則雨傘和水壺的類似留言,更能讓模型知道分類的真正界線。

Anthropic 的官方提示指引建議範例要相關、多樣且有清楚結構。對這個情境而言,多樣不是任意換幾個名詞,而是涵蓋不同判斷:資訊完整、必要欄位缺漏、任務不適用,以及一句話包含多個物品。你要示範的是規則分岔,不只是文句風格。

寫一份可檢查的失物招領提示

先用簡短文字定義工作:「判斷留言是否描述拾獲物品,只擷取文中明示的物品與地點;沒提供的欄位寫未提供。」再將每組輸入與預期輸出分開標示,讓模型不會把示範當成待處理的新案件。最後獨立放入這次真正要整理的留言。

以下是示意新輸入:「在操場旁看到有人留下一個保溫杯,不確定是不是已經被拿走。」理想輸出應保留物品與地點,並標示目前狀態不確定。若你的既定欄位無法表達不確定性,應先修改欄位設計,而不是要求模型把模糊事實硬塞成「已拾獲」。

輸出後對照原文檢查:物品有沒有被改名、地點有沒有補寫、暫時觀察有沒有被誤當成已保管。這份檢查是成功標準。格式整齊但資訊被誇大,仍是失敗;反過來說,若事實判斷正確而欄位不一致,問題可能主要是格式示範不夠明確。

示範資料和驗證資料必須分開

你用來教模型的留言,不適合又當作唯一的成績證據。模型照著已見過的例子重做成功,只能說明它能重現示範。另留一批不同措辭的新留言,包含相同判斷邊界,才能觀察它是否把規則用到未見過的輸入。

比較提示版本時,先固定這批驗證資料。一版只有規則,一版加入普通示範,另一版再加入缺漏和邊界案例。紀錄每版在哪些案件出錯,而不是只看自己最喜歡的一次回答。這裡沒有執行這項實驗,因此不提供任何準確率或改善比例。

如果新版本只讓雨傘留言更穩,卻把所有尋物消息也當成拾獲,就應重新平衡示範。也要檢查例子的排列與格式是否帶來暗示,例如前半部總是成功案例、後半部總是拒絕案例。讓內容與標籤的關係清楚,比用固定順序製造可猜的模式更重要。

何時用少樣本,何時應處理別的問題

當模型理解大方向卻抓不到欄位、風格或分類邊界時,少樣本提示特別值得嘗試。若它不知道最新公告,示範不能代替資料查詢;若原始留言被 OCR 讀錯,示範也不能自動修復來源。先辨認錯誤層次,才不會把所有失敗都歸因例子不夠多。

對要求高度一致的系統,還應加入程式檢查,例如必要欄位是否存在、標籤是否在允許清單內。這能抓格式錯誤,卻不能完全驗證語意,所以仍要保留原文與抽查流程。模型回傳合法格式,是能被系統接收的條件,不等於內容已經正確。

整理示範時應避免使用不必要的個資。失物招領可以用虛構內容表示規則,不必把真實電話、姓名和證件號碼重複塞入提示。最後保留少量能說清楚關鍵判斷的案例,並記錄它們對應的規則;這樣未來改版時,你會知道為什麼每一個例子都值得留下。

若團隊改了分類定義,要同步更新全部示範。舊規則寫在文字說明、新規則卻出現在例子裡,模型會收到衝突訊號。保留每組示範的用途與最後核對日期,也能讓接手的人理解這些例子如何維護。

概念與使用情境比較;查證於 2026 年 9 月。
做法提供什麼主要限制
零樣本提示規則與新輸入細微格式可能難說清
少樣本提示規則、示範與新輸入例子可能誤導或佔空間
微調用訓練資料更新參數需另外的訓練與評估流程

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享