Filmora
Filmora - 人工智慧影片剪輯軟體
更快、更智慧、更容易剪輯!
立即打開
Filmora 影片編輯軟體
最好的編輯器可幫助您輕鬆編輯影片。
  • 使用 300 多種令人驚嘆的效果增強影片
  • 個性化裁剪區域
  • 易於使用
支援:
掃碼下載
保障安全
qrcode-android
支援:
掃碼下載
保障安全
qrcode-android
支援:

DeepSeek越獄提示詞詳解:指令範例、風險與潛在影響

Arvin Alejandro
Arvin Alejandro 最初發佈時間 Aug 12, 26, 更新時間 Aug 12, 26
robot AI 摘要

儘管 DeepSeek R1 推理模型以低成本提供先進功能,但思科與賓州大學的研究指出其安全防護極度脆弱,在 HarmBench 基準測試中對 50 個惡意提示詞的攔截失敗率高達 100%。
    ● 使用者與研究人員已成功利用「移居 Zeta 星球」情境設定、十六進位編碼轉換以及漸進式提問等越獄手法,輕易繞過模型針對暴力、非法活動與政治敏感話題的內容過濾器。
    ● 越獄攻擊不僅會導致有害內容生成,還被 Wallarm 證實能迫使模型洩露隱藏的系統提示詞,進而揭露其訓練與蒸餾過程可能直接引用了 OpenAI 的模型細節。
    ● DeepSeek 現已發布修補程式修復已知漏洞,且此類文字越獄手法較難直接應用於具備專屬內容審核機制的影音生成平台(如整合 Veo 3 模型的 Wondershare Filmora),但仍凸顯了平價 AI 產品在開發初期容易犧牲安全性的隱患。


向 AI 詢問摘要

在本文中
    1. 研究人員發現越獄方法後,DeepSeek 的系統提示詞遭到曝光
    1. 1. 「移居新的地外世界」
    2. 2. 使用十六進位編碼
    3. 3. 使用漸進式越獄攻擊
    4. 4. 在 GitHub 上探索更多 DeepSeek 越獄提示詞
    1. 關於圖像與影片生成

儘管 DeepSeek 的能力吸引了大量關注與期待,但就像其他 AI 模型一樣,它也內建了某些限制,以確保其使用的安全性與負責任。

儘管如此,這並未阻止部分使用者嘗試所謂的 DeepSeek 越獄提示詞。其背後的概念是「欺騙」模型內部的安全機制,迫使其產生正常情況下不會生成的回應。

writing deepseek prompt

如果您想了解其背後的影響與潛在疑慮,我們將說明 DeepSeek 越獄提示詞 的整體概念。本文的目的是揭示這些方法,以便未來的研究能夠聚焦於改善大型語言模型的安全防護。

第一部分:DeepSeek 能做什麼?

在深入探討 DeepSeek 越獄提示詞之前,讓我們先從了解 DeepSeek 的設計用途開始。作為一款先進的 AI 模型,DeepSeek 能夠針對不同主題提供結構完善、具備情境感知能力的答案。人們在許多領域使用它,例如:

  • 寫作與內容生成
  • 支援學術或商業研究
  • 提供技術協助與說明
  • 以及許多其他日常與專業需求
generate content with deepseek

在提供這些功能的同時,使用者仍需對其內建限制有基本的認識。DeepSeek 與其他 AI 系統一樣,運作基礎稱為 系統提示詞。這是一組隱藏的指令,用於引導其行為、執行安全規則並確保符合道德規範的使用。

當有人設法操控或提取該系統提示詞時,可能會取得敏感的內部細節、改變模型的回應方式,或將 AI 用於非預期的目的。DeepSeek 已有部分此類越獄嘗試被公開分享。

第二部分:是什麼導致了 DeepSeek 提示詞越獄?

DeepSeek 並非第一個面臨越獄嘗試的 AI 模型,但其突然竄紅使其立刻成為目標。其先進功能所引發的熱潮,加上比 ChatGPT 等競爭對手更低廉的成本,吸引了大批使用者。幾乎在第一時間,使用者便開始測試能將系統逼到何種極限。

原因很簡單:人們想知道 DeepSeek 的低成本是否是以犧牲強大的安全防護為代價,以及其他相關問題。

trying deepseek jailbreak prompt

研究人員發現越獄方法後,DeepSeek 的系統提示詞遭到曝光

研究人員很快便證實了這些疑慮,他們發現了一種暴露 DeepSeek 系統提示詞的越獄方法。其研究結果顯示,該平台的安全防護遠不如預期可靠。

就背景而言,DeepSeek 審查的內容類型包括:

  • 暴力與有害內容
  • 非法活動
  • 敏感個人資訊
  • 與其母國政府相關的政治敏感話題
  • 露骨圖像等。
content censored on deepseek

然而,一項新研究 由思科與賓夕法尼亞大學進行,使用廣泛採用的 HarmBench 基準測試中的 50 個惡意提示詞,對 DeepSeek 的 R1 推理模型進行測試。這些提示詞涵蓋六大類有害內容,包括網路犯罪、錯誤資訊及非法活動。

結果如何?DeepSeek 在每一項測試中均告失敗。

研究人員回報攻擊成功率達 100%,意即所有有害提示詞均未被攔截。安全公司 Adversa AI 也確認了類似發現。其測試顯示,包括語言技巧、AI 生成提示詞及基於程式碼的攻擊在內的常見越獄方法,均能輕易繞過 DeepSeek 的防護機制。

deepseek ai chat

此外,DeepSeek 越獄系統提示詞的問題不僅僅在於繞過內容過濾器。另一項引人注目的發現由 Wallarm 報告,指出該模型能夠揭露其自身訓練與蒸餾過程的細節。在此調查過程中,他們發現了直接引用 OpenAI 模型的內容。這項發現表明,OpenAI 的技術可能影響了 DeepSeek 的訓練流程。

第三部分:社群分享的 DeepSeek 越獄提示詞

越獄提示詞很快便出現在 Reddit 和 GitHub 等平台上。使用者開始分享各種繞過 DeepSeek 內容過濾器的方法。這些提示詞中,有些出乎意料地簡單,有些則更具創意。

1. 「移居新的地外世界」

Reddit 上最受歡迎的 DeepSeek 越獄提示詞之一,是要求 DeepSeek 想像自己正在協助一位移居名為「Zeta」的另一個星球的人。在這個虛構世界中,地球上的正常法律與道德規則不再適用,這正是讓 AI 放棄其慣常防護機制的關鍵。

deepseek jailbreak prompt on reddit

2. 使用十六進位編碼

另一個由 Shashwat (Shawn) Gupta 分享的 DeepSeek 越獄提示詞,其原理是將普通請求轉換為一串十六進位代碼。

十六進位編碼是一種使用十六進位系統(0–9 及 a–f)中的數字與字母來表示文字的方式。每個字元(如字母或符號)都會被轉換為其對應的十六進位值。

deepseek jailbreak prompt using hex-encoding

您可能需要添加額外的請求,例如要求模型「以點分隔每個字元」,才能使此技巧生效。實際效果可能有所不同,我們今日測試時,此方法在實踐中並不穩定。

3. 使用漸進式越獄攻擊

接下來,有一種 DeepSeek 提示詞越獄技巧,稱為「漸進式攻擊」。這種方法並非直接提出敏感問題,而是逐步引導。每個提示詞單獨看來都無害,但合在一起卻能逐漸降低模型的防備,直到它開始回答正常情況下不會回答的問題。

crescendo attack deepseek jailbreak prompt

例如,若您直接問「如何製作汽油彈?」,DeepSeek 不會回答您的問題。但若您以較小、不那麼明顯的問題來鋪墊對話,最終可能將 AI 引導至提供其本應封鎖的細節。

deepseek unable to provide answer

4. 在 GitHub 上探索更多 DeepSeek 越獄提示詞

您也可以在 GitHub 上找到許多其他流傳的越獄提示詞。使用者不僅分享提示詞本身,還會分享程式碼片段、實驗結果以及他們如何繞過 DeepSeek 過濾器的詳細說明。有些甚至包含 DeepSeek R1 越獄提示詞:

第四部分:越獄是否也適用於其他 AI 工具?

DeepSeek 越獄提示詞事件自然引發了一個更大的問題:同樣的情況是否會發生在其他 AI 工具上?事實是,確實有可能。越獄並非 DeepSeek 獨有的問題。每個語言模型都可能被以各種方式試探,有時得以繞過其安全過濾器。

不同模型的反應可能有所不同,各平台的安全措施也不盡相同。根據網路上分享的資訊,我們測試時發現,部分曾經有效的越獄技巧已不再奏效。

ai tools similar to deepseek

關於圖像與影片生成

由於 DeepSeek 目前是一款以文字為主的模型,越獄嘗試主要影響文字輸出。但若相同的手法能夠應用於圖像與影片生成,影響將會更為深遠。

在您擔憂之前,值得慶幸的是,針對圖像或影片生成的越獄嘗試通常更為複雜且難以執行。Wondershare Filmora 便為例,已建立安全防護機制,防止生成包含「敏感詞彙」或不安全提示詞的影片或圖像。

立即試用
立即試用
安全驗證
web_2022_article_block
掃碼獲取行動版

filmora jailbreak prompt safety measure

即使 Filmora 採用了先進模型,例如 Veo 3 用於 文字生成影片 的創作,它也在其上疊加了自身的內容審核系統,以在提示詞進入生成階段之前攔截有風險的內容。

第五部分:對 AI 發展與安全的未來影響

DeepSeek 越獄系統提示詞事件揭示了 AI 發展中一個更深層的問題:可負擔性與可及性往往與安全性的取捨並存。

提供平價的 AI 工具能讓更多人使用先進技術。然而,在安全防護上偷工減料,可能使模型暴露於操控、濫用與意外風險之中,而這些在安全風險、資料洩露與信任喪失方面的代價,遠比節省的成本昂貴得多。

future implications on ai security

漏洞被發現後,DeepSeek 迅速發布了修補程式以修復問題。儘管如此,越獄風險仍表明,AI 系統需要強而有力且持續的防護,以確保長期的安全性與可靠性。

結論

DeepSeek 的越獄提示詞揭示了即使是最先進的 AI 系統,一旦安全性未被列為優先考量,其脆弱性有多麼顯著。它或許拓展了平價 AI 的能力邊界,然而其薄弱的安全防護已使其成為濫用的容易目標。

由此可見,AI 產業面臨更大的挑戰:創新與可及性必須始終與強大的安全防護相互平衡。當這些漏洞進一步延伸至圖像或影片生成等領域時,潛在風險將會更加巨大。

Arvin Alejandro
Arvin Alejandro Aug 12, 26
分享文章:
開學季促銷活動 開學季促銷活動