分類

AI 安全

不用先懂術語。照編號往下看,每次只多認識一個新觀念。

006
用 沒查庫存卻很有自信回答的櫃姐 來懂

AI 幻覺是什麼?像一位超有自信的櫃姐,沒查庫存卻直接告訴你『有貨』

AI 最危險的時候,不一定是它說『不知道』,而是它把錯的東西講得很像真的。第六篇教你先建立這個警覺。

7 分鐘
035
用 像助理在文件裡看到一張『假主管指令』,如果分不清文件內容和真正授權,就可能把不可信文字當成命令 來懂

Prompt Injection 是什麼?為什麼 AI Agent 讀到一段文字,就可能被假指令帶偏

第 35 篇從 Direct / Indirect Prompt Injection 開始,解釋 RAG、網頁、Email、文件與 Coding Agent 為什麼會把不可信文字帶進模型,以及最小權限、Tool Allowlist、Human Approval 等防護思路。

13 分鐘
036
用 模型像一台很強的機器;安全不是只靠機器本身,而是還有駕駛規則、門禁、保險絲、操作權限與外部監控一層層疊上去 來懂

Guardrail、Safeguard、Uncensored Model 是什麼?把模型能力、對齊與應用安全分成不同層看

第 36 篇拆解 Guardrail、Safeguard、Moderation、System Prompt、Alignment 與 Uncensored Model,說明 Open-weight 不等於無限制、Local 不等於沒安全層,以及應用程式仍需要權限與 Runtime 防護。

13 分鐘