← ホームへ戻る
LESSON 036AI安全13 分

Guardrailと「Uncensored Model」:AI Safetyは一つの隠しSwitchではなく複数Layer

AI Safety BoundaryはTraining、System Prompt、Classifier、Tool Permission、Product Policyなど複数Layerに存在します。第036回ではGuardrailとUncensoredという言葉を整理します。

今日のたとえ一つのMaster Switchではなく、教育、規則、Lock、Security Staff、Permission Badgeを重ねるBuilding Security

AIがRequestを拒否すると、「ModelのFilterに止められた」とよく言われます。

便利な言い方ですが、Model内部に一つの隠しSwitchがあり、それだけで全部を決めているように聞こえます。

実際のAI ProductではSafety Behaviorが複数Layerから作られることがあります。

こうした制約や保護を広く**Guardrail(ガードレール)**と呼びます。

GuardrailはModelの前・中・後ろにある

Production Systemでは、

などを組み合わせることがあります。

Productによって構成は違います。

Model BehaviorとProduct Behaviorは同じではない

Open-weight ModelをLocalで動かしたときと、関連Modelを使ったHosted ProductではBehaviorが違う場合があります。

Product側でSystem Prompt、Filter、Tool、Account Ruleを追加できるからです。

第034回で見た通り、Company、Product、Modelは別Layerです。

“Uncensored Model”とは?

この言葉に一つのTechnical Standardはありません。

Communityでは、Refusalが少ない、Safety Tuningを弱めた、より広いPromptへ答えるようFine-tuningしたModelなどをUncensoredと呼ぶことがあります。

しかしUncensoredと書かれていても、

ことを保証しません。

Behaviorを表すInformal Labelとして読み、Security Specificationだと思わない方が安全です。

Refusalが少ないことが役立つ場面もある

ResearchやDevelopmentでは、

などで、過度なRefusalが邪魔になる場合があります。

一方、Safeguardを減らすとHarmful、Deceptive、Privacy-sensitiveなContentを生成しやすくなるRiskもあります。

重要なのは「CensoredかUncensoredか」だけではなく、Use Case、Access User、Tool Capability、周囲のControlです。

Tool Permissionは会話Styleより重要になることがある

言葉としてPermissiveなModelでもToolがなければOperational Impactは限定されます。

逆に、File、Payment、Message Toolを持つAgentは大きな影響を持ちます。

Security BoundaryはModelのRefusalだけでなくSoftware Permissionへ置く必要があります。

これは第035回のPrompt Injectionとも直結します。

GuardrailにはTrade-offがある

強いSafety RuleはLegitimate RequestまでBlockするFalse Positiveを生むことがあります。

弱すぎればHarmful Contentを通すFalse Negativeが増えます。

完全なClassifierはありません。

実際のRisk LevelとUserに合わせてEvaluationする必要があります。

Local Modelでは責任もLocalへ移る

Open-weight Modelを自分のHardwareで動かすと、Hosted Product側のPolicyが毎RequestをEnforceしなくなる場合があります。

Controlが増える代わりに、誰へ公開するか、どのDataへAccessできるか、どのToolを使えるかの責任も自分へ移ります。

001〜036を通した大きなLesson

AIは一つのMagic Brainではありません。

Userが体験するBehaviorは、

のStackで決まります。

Stackを理解すると、AIを神秘的に考えず、どこが変わればBehaviorが変わるかを分析できます。

今日の一文

GuardrailはAIのBehaviorやActionを制約する複数Layerです。“Uncensored”は一部のBehavior制限が弱いことを示す場合がありますが、RuleもRiskも存在しないという意味ではありません。

参考資料

たとえは直感をつかむ入口です。正式な定義や技術詳細は原典をご確認ください。

  1. Hugging Face Hub — Model Cards ↗
  2. OpenAI Platform — Safety Best Practices ↗
  3. OWASP GenAI — LLM Top 10 ↗
← 前の章035Prompt Injectionとは?信頼していないDataがAIへのInstructionとして入り込む攻撃
次の章 →0372026年のAI動画生成はどう選ぶ?Text-to-Video、Image-to-Video、Referenceの違いから考える
COMMUNITY

コメント

質問、感想、補足したいことがあれば、ここに残せます。

0 / 1200