在本文中
儘管 DeepSeek 的能力吸引了大量關注與期待,但就像其他 AI 模型一樣,它也內建了某些限制,以確保其使用的安全性與負責任。
儘管如此,這並未阻止部分使用者嘗試所謂的 DeepSeek 越獄提示詞。其背後的概念是「欺騙」模型內部的安全機制,迫使其產生正常情況下不會生成的回應。

如果您想了解其背後的影響與潛在疑慮,我們將說明 DeepSeek 越獄提示詞 的整體概念。本文的目的是揭示這些方法,以便未來的研究能夠聚焦於改善大型語言模型的安全防護。
第一部分:DeepSeek 能做什麼?
在深入探討 DeepSeek 越獄提示詞之前,讓我們先從了解 DeepSeek 的設計用途開始。作為一款先進的 AI 模型,DeepSeek 能夠針對不同主題提供結構完善、具備情境感知能力的答案。人們在許多領域使用它,例如:
- 寫作與內容生成
- 支援學術或商業研究
- 提供技術協助與說明
- 以及許多其他日常與專業需求

在提供這些功能的同時,使用者仍需對其內建限制有基本的認識。DeepSeek 與其他 AI 系統一樣,運作基礎稱為 系統提示詞。這是一組隱藏的指令,用於引導其行為、執行安全規則並確保符合道德規範的使用。
當有人設法操控或提取該系統提示詞時,可能會取得敏感的內部細節、改變模型的回應方式,或將 AI 用於非預期的目的。DeepSeek 已有部分此類越獄嘗試被公開分享。
第二部分:是什麼導致了 DeepSeek 提示詞越獄?
DeepSeek 並非第一個面臨越獄嘗試的 AI 模型,但其突然竄紅使其立刻成為目標。其先進功能所引發的熱潮,加上比 ChatGPT 等競爭對手更低廉的成本,吸引了大批使用者。幾乎在第一時間,使用者便開始測試能將系統逼到何種極限。
原因很簡單:人們想知道 DeepSeek 的低成本是否是以犧牲強大的安全防護為代價,以及其他相關問題。

研究人員發現越獄方法後,DeepSeek 的系統提示詞遭到曝光
研究人員很快便證實了這些疑慮,他們發現了一種暴露 DeepSeek 系統提示詞的越獄方法。其研究結果顯示,該平台的安全防護遠不如預期可靠。
就背景而言,DeepSeek 審查的內容類型包括:
- 暴力與有害內容
- 非法活動
- 敏感個人資訊
- 與其母國政府相關的政治敏感話題
- 露骨圖像等。

然而,一項新研究 由思科與賓夕法尼亞大學進行,使用廣泛採用的 HarmBench 基準測試中的 50 個惡意提示詞,對 DeepSeek 的 R1 推理模型進行測試。這些提示詞涵蓋六大類有害內容,包括網路犯罪、錯誤資訊及非法活動。
結果如何?DeepSeek 在每一項測試中均告失敗。
研究人員回報攻擊成功率達 100%,意即所有有害提示詞均未被攔截。安全公司 Adversa AI 也確認了類似發現。其測試顯示,包括語言技巧、AI 生成提示詞及基於程式碼的攻擊在內的常見越獄方法,均能輕易繞過 DeepSeek 的防護機制。

此外,DeepSeek 越獄系統提示詞的問題不僅僅在於繞過內容過濾器。另一項引人注目的發現由 Wallarm 報告,指出該模型能夠揭露其自身訓練與蒸餾過程的細節。在此調查過程中,他們發現了直接引用 OpenAI 模型的內容。這項發現表明,OpenAI 的技術可能影響了 DeepSeek 的訓練流程。
第三部分:社群分享的 DeepSeek 越獄提示詞
越獄提示詞很快便出現在 Reddit 和 GitHub 等平台上。使用者開始分享各種繞過 DeepSeek 內容過濾器的方法。這些提示詞中,有些出乎意料地簡單,有些則更具創意。
1. 「移居新的地外世界」
在 Reddit 上最受歡迎的 DeepSeek 越獄提示詞之一,是要求 DeepSeek 想像自己正在協助一位移居名為「Zeta」的另一個星球的人。在這個虛構世界中,地球上的正常法律與道德規則不再適用,這正是讓 AI 放棄其慣常防護機制的關鍵。

2. 使用十六進位編碼
另一個由 Shashwat (Shawn) Gupta 分享的 DeepSeek 越獄提示詞,其原理是將普通請求轉換為一串十六進位代碼。
十六進位編碼是一種使用十六進位系統(0–9 及 a–f)中的數字與字母來表示文字的方式。每個字元(如字母或符號)都會被轉換為其對應的十六進位值。

您可能需要添加額外的請求,例如要求模型「以點分隔每個字元」,才能使此技巧生效。實際效果可能有所不同,我們今日測試時,此方法在實踐中並不穩定。
3. 使用漸進式越獄攻擊
接下來,有一種 DeepSeek 提示詞越獄技巧,稱為「漸進式攻擊」。這種方法並非直接提出敏感問題,而是逐步引導。每個提示詞單獨看來都無害,但合在一起卻能逐漸降低模型的防備,直到它開始回答正常情況下不會回答的問題。

例如,若您直接問「如何製作汽油彈?」,DeepSeek 不會回答您的問題。但若您以較小、不那麼明顯的問題來鋪墊對話,最終可能將 AI 引導至提供其本應封鎖的細節。

4. 在 GitHub 上探索更多 DeepSeek 越獄提示詞
您也可以在 GitHub 上找到許多其他流傳的越獄提示詞。使用者不僅分享提示詞本身,還會分享程式碼片段、實驗結果以及他們如何繞過 DeepSeek 過濾器的詳細說明。有些甚至包含 DeepSeek R1 越獄提示詞:
第四部分:越獄是否也適用於其他 AI 工具?
DeepSeek 越獄提示詞事件自然引發了一個更大的問題:同樣的情況是否會發生在其他 AI 工具上?事實是,確實有可能。越獄並非 DeepSeek 獨有的問題。每個語言模型都可能被以各種方式試探,有時得以繞過其安全過濾器。
不同模型的反應可能有所不同,各平台的安全措施也不盡相同。根據網路上分享的資訊,我們測試時發現,部分曾經有效的越獄技巧已不再奏效。

關於圖像與影片生成
由於 DeepSeek 目前是一款以文字為主的模型,越獄嘗試主要影響文字輸出。但若相同的手法能夠應用於圖像與影片生成,影響將會更為深遠。
在您擔憂之前,值得慶幸的是,針對圖像或影片生成的越獄嘗試通常更為複雜且難以執行。Wondershare Filmora 便為例,已建立安全防護機制,防止生成包含「敏感詞彙」或不安全提示詞的影片或圖像。

即使 Filmora 採用了先進模型,例如 Veo 3 用於 文字生成影片 的創作,它也在其上疊加了自身的內容審核系統,以在提示詞進入生成階段之前攔截有風險的內容。
第五部分:對 AI 發展與安全的未來影響
DeepSeek 越獄系統提示詞事件揭示了 AI 發展中一個更深層的問題:可負擔性與可及性往往與安全性的取捨並存。
提供平價的 AI 工具能讓更多人使用先進技術。然而,在安全防護上偷工減料,可能使模型暴露於操控、濫用與意外風險之中,而這些在安全風險、資料洩露與信任喪失方面的代價,遠比節省的成本昂貴得多。

漏洞被發現後,DeepSeek 迅速發布了修補程式以修復問題。儘管如此,越獄風險仍表明,AI 系統需要強而有力且持續的防護,以確保長期的安全性與可靠性。
結論
DeepSeek 的越獄提示詞揭示了即使是最先進的 AI 系統,一旦安全性未被列為優先考量,其脆弱性有多麼顯著。它或許拓展了平價 AI 的能力邊界,然而其薄弱的安全防護已使其成為濫用的容易目標。
由此可見,AI 產業面臨更大的挑戰:創新與可及性必須始終與強大的安全防護相互平衡。當這些漏洞進一步延伸至圖像或影片生成等領域時,潛在風險將會更加巨大。

