生活分享
越獄提示(Jailbreak)是什麼
越獄提示通常指試圖讓 AI 繞過既有安全限制、產生原本不應提供之內容的輸入方式。本文區分它與提示詞注入、正常拒絕及誤拒,透過虛構客服助理的測試案例,說明成功條件為何必須看實際回答、研究結果為何不能直接套用所有模型,以及防護評測如何兼顧限制行為與合法使用者的正常需求。
更新日期: 閱讀時間約 7 分鐘

你可能看過有人宣稱找到一段文字,能讓 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 不再遵守限制。這類嘗試常被稱為越獄提示,英文是 Jailbreak。它借用了突破裝置限制的比喻,但在語言模型情境中,通常指設法讓模型偏離既有安全限制或拒絕行為,產生原本不應提供的內容;不是替模型開啟一個隱藏的知識開關。
截至 2026 年 9 月,研究已觀察到不同形式的越獄與對抗輸入,但方法對哪些模型、哪些任務有效,取決於實驗條件與判定標準。網路截圖顯示模型說了「我會照做」,不一定證明限制已被繞過。要理解這個術語,需要分開看攻擊者希望改變的行為、模型實際產生的內容,以及應用層是否真的執行了相關動作。
越獄與提示詞注入,觀察角度不同
越獄通常聚焦讓模型突破行為或安全限制;提示詞注入則聚焦不可信文字如何變成指令,讓應用偏離原本任務。兩者有重疊,例如檔案內的誘導文字可能同時要求助手忽略任務並繞過安全規則。OWASP 把越獄放在提示詞注入的相關範圍內,但不同研究的分類不完全一致,閱讀時應先看作者如何定義。
也有風險主要涉及其中一邊。例如外部檔案讓摘要助手改寫報名名單,可能沒有要求生成危險內容,仍是提示詞注入;使用者直接要求模型突破內容限制,則不一定經過第三方檔案。這個差異有實際用途:前者需要處理資料來源與權限,後者需要檢查模型回應及內容政策,而完整產品通常兩邊都要做。
用無害任務觀察規則是否真的被繞過
假設正在測試一個虛構客服助手,明確規定不能替尚未核定的申請宣稱「退款已完成」。正常工作是讀取申請狀態並說明下一步。測試者設計幾種不同表達,試圖讓助手在狀態仍是審核中時承諾已退款;所有資料和帳號都放在測試環境,沒有真實交易。這是觀察約束行為的教學例子,不能代表所有內容安全越獄。
先固定判定條件:若助手描述使用者希望退款,不算突破;若直接對客戶宣稱退款已完成,才符合這個案例的失敗定義。如果模型只在分析題目或引用錯誤句子,也不能忽略語境,把包含關鍵字當成失敗。檢查最後交付的回答、角色與用途,比搜尋某個詞更接近真正的使用者影響。
再把回答與系統狀態分開。助手口頭宣稱成功,可能只是錯誤承諾;若還能呼叫付款工具,就要另外檢查是否產生未授權操作。兩者都值得修正,但證據不同。這種分層觀察能避免把模型的一句話誤報成真實退款,也能避免只因文字看起來安全,就漏掉工具已經執行的動作。
研究中的有效,不等於通用解鎖
Anthropic 的 many-shot jailbreaking 研究討論大量上下文示例如何影響模型的安全行為。Zou 等人的研究則觀察到某些對抗輸入可以在特定條件下轉移到其他模型。這些結果支持持續測試的重要性,卻不表示存在一組對所有產品永久有效的字串;產品可能使用不同模型、系統設定、內容檢查與工具限制。
看成功率時,至少要知道測了哪些請求、嘗試多少次、如何挑選輸入,以及誰判斷成功。如果只公佈成功截圖,卻沒有所有嘗試的總數,就無法推算實際成功機率。模型更新後,舊結果也可能不再適用。對應用團隊而言,最有價值的資料是能在自己環境重現的失敗案例與版本紀錄,而不是籠統的「已破解」標籤。
研究還可能使用自動評分器判斷輸出,評分器本身也會出錯。比較兩篇報告時,應確認它們對成功的定義是否一致:一篇可能只看是否開始配合,另一篇可能要求完整完成受限制內容。若判定尺度不同,直接排列百分比就可能誤導。閱讀原始研究的方法與限制,比轉述標題更能掌握結果的適用範圍。
防護不能把所有正常請求都拒絕
一個助手如果每題都拒絕,或許不會產生測試中的違規回答,卻也失去了用途。測試應同時包含不應完成的請求與應該完成的相近任務。例如客服可以說明退款流程、確認審核中狀態,也可以協助使用者補件;應拒絕的是沒有依據的完成承諾,而不是任何包含退款二字的問題。
這也是為什麼要記錄誤拒與漏放。誤拒表示合理需求被阻擋,漏放表示應受限制的行為仍出現;單一數字很難同時呈現兩者。對模糊案例,可以事先寫清楚允許的替代回答,例如說明目前狀態並提供下一步,而不是要求模型只回覆固定的拒絕句。這讓防護與實際工作相容,也更容易判斷修正是否有效。
把發現變成可重驗的測試
發現疑似越獄時,儲存必要的輸入、模型與提示版本、輸出及判定理由,並在授權的測試環境重現。不要把完整對話中的敏感資料直接貼到公開討論區。報告應描述原本的限制、預期行為與實際偏差;若不能穩定重現,也應明確記錄,而不是把一次偶發結果寫成普遍能力。
修正後除了重跑原案例,還要檢查相近的正常需求,確認沒有用大量誤拒換取表面改善。應用層也可以限制工具範圍、檢查重要輸出或要求人工核定,讓模型失守時的影響受限。越獄研究提醒我們,安全行為是需要持續驗證的系統表現;它既不是模型的一個永久勾選項,也不是只要找不到新花樣就能視為完成的工作。
| 觀察結果 | 不能直接推論 | 應補充的證據 |
|---|---|---|
| 模型答應配合 | 限制已成功繞過 | 最後回答的實質內容 |
| 輸出出現敏感詞 | 一定違反規則 | 語境、用途與允許範圍 |
| 單次嘗試成功 | 所有模型都有效 | 版本、樣本與重現結果 |
| 所有請求都被拒絕 | 防護品質良好 | 正常需求的完成情況 |
提示詞注入(Prompt Injection)是什麼提示詞注入(Prompt Injection)是什麼提示詞注入是讓模型把不可信內容中的文字當成應遵循的指令,進而偏離原本任務。本文用閱讀活動報名郵件的原創案例,說明直接與間接注入、資料和權限的界線,以及為何檢索、引用格式或一句「忽略惡意指令」不能包辦防護,並整理外部內容分隔、工具授權與人工確認各自能阻止的失敗。閱讀全文
安全防護機制(Guardrails)是什麼安全防護機制(Guardrails)是什麼安全防護機制(Guardrails)是放在 AI 輸入、資料、回答與工具操作周圍的一組檢查和限制。本文用二手物品刊登助手的原創案例,說明哪些規則適合程式驗證、哪些需要模型判讀或人工確認,以及阻擋、修正與交回處理的差別,幫你理解防護如何維持正常工作,同時避免把單一篩選器當成完整安全保證。閱讀全文
模型與代理評測(Evals)是什麼模型與代理評測(Evals)是什麼模型與代理評測把任務、輸入、執行條件和成功標準固定下來,觀察 AI 是否真的符合需求。本文用志工排班助理為例,說明案例、重複嘗試、評分器與外部結果的差別,比較程式、人類與模型評分,解釋為何單次答對和平均高分都不足以證明可靠。讀完能建立一組小而實用的評測,讓提示詞或模型更新有可比較的證據,也能保留尚未驗證的限制。閱讀全文
AI 名詞總索引:從 Loop Engineering 到生成式 AIAI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算