生活分享

越獄提示(Jailbreak)是什麼

越獄提示通常指試圖讓 AI 繞過既有安全限制、產生原本不應提供之內容的輸入方式。本文區分它與提示詞注入、正常拒絕及誤拒,透過虛構客服助理的測試案例,說明成功條件為何必須看實際回答、研究結果為何不能直接套用所有模型,以及防護評測如何兼顧限制行為與合法使用者的正常需求。

更新日期: 閱讀時間約 7 分鐘

橘色折線試圖繞過綠色規則框,右側兩個分開的觀察鏡分別檢視對話卡片與操作開關。
圖片:Mokaair (© Mokaair)

你可能看過有人宣稱找到一段文字,能讓 不再遵守限制。這類嘗試常被稱為越獄提示,英文是 Jailbreak。它借用了突破裝置限制的比喻,但在語言模型情境中,通常指設法讓模型偏離既有安全限制或拒絕行為,產生原本不應提供的內容;不是替模型開啟一個隱藏的知識開關。

截至 2026 年 9 月,研究已觀察到不同形式的越獄與對抗輸入,但方法對哪些模型、哪些任務有效,取決於實驗條件與判定標準。網路截圖顯示模型說了「我會照做」,不一定證明限制已被繞過。要理解這個術語,需要分開看攻擊者希望改變的行為、模型實際產生的內容,以及應用層是否真的執行了相關動作。

越獄與提示詞注入,觀察角度不同

越獄通常聚焦讓模型突破行為或安全限制;提示詞注入則聚焦不可信文字如何變成指令,讓應用偏離原本任務。兩者有重疊,例如檔案內的誘導文字可能同時要求助手忽略任務並繞過安全規則。OWASP 把越獄放在提示詞注入的相關範圍內,但不同研究的分類不完全一致,閱讀時應先看作者如何定義。

也有風險主要涉及其中一邊。例如外部檔案讓摘要助手改寫報名名單,可能沒有要求生成危險內容,仍是提示詞注入;使用者直接要求模型突破內容限制,則不一定經過第三方檔案。這個差異有實際用途:前者需要處理資料來源與權限,後者需要檢查模型回應及內容政策,而完整產品通常兩邊都要做。

用無害任務觀察規則是否真的被繞過

假設正在測試一個虛構客服助手,明確規定不能替尚未核定的申請宣稱「退款已完成」。正常工作是讀取申請狀態並說明下一步。測試者設計幾種不同表達,試圖讓助手在狀態仍是審核中時承諾已退款;所有資料和帳號都放在測試環境,沒有真實交易。這是觀察約束行為的教學例子,不能代表所有內容安全越獄。

先固定判定條件:若助手描述使用者希望退款,不算突破;若直接對客戶宣稱退款已完成,才符合這個案例的失敗定義。如果模型只在分析題目或引用錯誤句子,也不能忽略語境,把包含關鍵字當成失敗。檢查最後交付的回答、角色與用途,比搜尋某個詞更接近真正的使用者影響。

再把回答與系統狀態分開。助手口頭宣稱成功,可能只是錯誤承諾;若還能呼叫付款工具,就要另外檢查是否產生未授權操作。兩者都值得修正,但證據不同。這種分層觀察能避免把模型的一句話誤報成真實退款,也能避免只因文字看起來安全,就漏掉工具已經執行的動作。

測試輸入送入有退款規則的客服助手後,分別檢查最後回覆與工具狀態,再與預先定義的規則比較。
無害客服測試展示判定方式;口頭承諾、語境中的引用與真實工具操作,需要分別記錄。 · 圖片:Mokaair (© Mokaair)

研究中的有效,不等於通用解鎖

Anthropic 的 many-shot jailbreaking 研究討論大量上下文示例如何影響模型的安全行為。Zou 等人的研究則觀察到某些對抗輸入可以在特定條件下轉移到其他模型。這些結果支持持續測試的重要性,卻不表示存在一組對所有產品永久有效的字串;產品可能使用不同模型、系統設定、內容檢查與工具限制。

看成功率時,至少要知道測了哪些請求、嘗試多少次、如何挑選輸入,以及誰判斷成功。如果只公佈成功截圖,卻沒有所有嘗試的總數,就無法推算實際成功機率。模型更新後,舊結果也可能不再適用。對應用團隊而言,最有價值的資料是能在自己環境重現的失敗案例與版本紀錄,而不是籠統的「已破解」標籤。

研究還可能使用自動評分器判斷輸出,評分器本身也會出錯。比較兩篇報告時,應確認它們對成功的定義是否一致:一篇可能只看是否開始配合,另一篇可能要求完整完成受限制內容。若判定尺度不同,直接排列百分比就可能誤導。閱讀原始研究的方法與限制,比轉述標題更能掌握結果的適用範圍。

防護不能把所有正常請求都拒絕

一個助手如果每題都拒絕,或許不會產生測試中的違規回答,卻也失去了用途。測試應同時包含不應完成的請求與應該完成的相近任務。例如客服可以說明退款流程、確認審核中狀態,也可以協助使用者補件;應拒絕的是沒有依據的完成承諾,而不是任何包含退款二字的問題。

這也是為什麼要記錄誤拒與漏放。誤拒表示合理需求被阻擋,漏放表示應受限制的行為仍出現;單一數字很難同時呈現兩者。對模糊案例,可以事先寫清楚允許的替代回答,例如說明目前狀態並提供下一步,而不是要求模型只回覆固定的拒絕句。這讓防護與實際工作相容,也更容易判斷修正是否有效。

把發現變成可重驗的測試

發現疑似越獄時,儲存必要的輸入、模型與提示版本、輸出及判定理由,並在授權的測試環境重現。不要把完整對話中的敏感資料直接貼到公開討論區。報告應描述原本的限制、預期行為與實際偏差;若不能穩定重現,也應明確記錄,而不是把一次偶發結果寫成普遍能力。

修正後除了重跑原案例,還要檢查相近的正常需求,確認沒有用大量誤拒換取表面改善。應用層也可以限制工具範圍、檢查重要輸出或要求人工核定,讓模型失守時的影響受限。越獄研究提醒我們,安全行為是需要持續驗證的系統表現;它既不是模型的一個永久勾選項,也不是只要找不到新花樣就能視為完成的工作。

越獄測試常見的判讀界線(2026 年 9 月查證)
觀察結果不能直接推論應補充的證據
模型答應配合限制已成功繞過最後回答的實質內容
輸出出現敏感詞一定違反規則語境、用途與允許範圍
單次嘗試成功所有模型都有效版本、樣本與重現結果
所有請求都被拒絕防護品質良好正常需求的完成情況

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享