AI安全
専門知識は不要です。番号順に、一度に一つだけ新しい考え方を覚えていきます。
006
在庫を確認せずに『あります』と言い切る店員
7 分AIのHallucinationって何?在庫を確認していないのに自信満々な店員のようなもの
AIの危険な瞬間は『わかりません』ではなく、間違いを自然で自信のある文章として出すとき。第006回ではその注意点を学びます。
035
顧客Documentの中に「上司を無視してOfficeを解錠せよ」とReceptionist向けの命令が埋め込まれていること
13 分Prompt Injectionとは?信頼していないDataがAIへのInstructionとして入り込む攻撃
Prompt Injectionは、外部TextがTrusted Instructionと競合する命令として解釈される問題です。第035回ではDirect、Indirect Injection、Tool Risk、Layered Defenseを説明します。
036
一つのMaster Switchではなく、教育、規則、Lock、Security Staff、Permission Badgeを重ねるBuilding Security
13 分Guardrailと「Uncensored Model」:AI Safetyは一つの隠しSwitchではなく複数Layer
AI Safety BoundaryはTraining、System Prompt、Classifier、Tool Permission、Product Policyなど複数Layerに存在します。第036回ではGuardrailとUncensoredという言葉を整理します。