AIがRequestを拒否すると、「ModelのFilterに止められた」とよく言われます。
便利な言い方ですが、Model内部に一つの隠しSwitchがあり、それだけで全部を決めているように聞こえます。
実際のAI ProductではSafety Behaviorが複数Layerから作られることがあります。
こうした制約や保護を広く**Guardrail(ガードレール)**と呼びます。
GuardrailはModelの前・中・後ろにある
Production Systemでは、
- Training Dataの選定
- Safety Training / Preference Training
- System Instruction
- Input Classifier
- Output Classifier
- Policy Engine
- Tool Permission
- Age / Account Setting
- Rate Limit
- Human Review
などを組み合わせることがあります。
Productによって構成は違います。
Model BehaviorとProduct Behaviorは同じではない
Open-weight ModelをLocalで動かしたときと、関連Modelを使ったHosted ProductではBehaviorが違う場合があります。
Product側でSystem Prompt、Filter、Tool、Account Ruleを追加できるからです。
第034回で見た通り、Company、Product、Modelは別Layerです。
“Uncensored Model”とは?
この言葉に一つのTechnical Standardはありません。
Communityでは、Refusalが少ない、Safety Tuningを弱めた、より広いPromptへ答えるようFine-tuningしたModelなどをUncensoredと呼ぶことがあります。
しかしUncensoredと書かれていても、
- System Promptが絶対にない
- Biasがない
- 何でも答える
- Outputが正しい
- Security Riskがない
- License上すべて自由
- Application Filterがない
ことを保証しません。
Behaviorを表すInformal Labelとして読み、Security Specificationだと思わない方が安全です。
Refusalが少ないことが役立つ場面もある
ResearchやDevelopmentでは、
- Red Team Evaluation
- Security Research
- LawfulなFiction / Roleplay
- Controlled Experiment
- Generic FilterがFalse Positiveを起こす専門Task
などで、過度なRefusalが邪魔になる場合があります。
一方、Safeguardを減らすとHarmful、Deceptive、Privacy-sensitiveなContentを生成しやすくなるRiskもあります。
重要なのは「CensoredかUncensoredか」だけではなく、Use Case、Access User、Tool Capability、周囲のControlです。
Tool Permissionは会話Styleより重要になることがある
言葉としてPermissiveなModelでもToolがなければOperational Impactは限定されます。
逆に、File、Payment、Message Toolを持つAgentは大きな影響を持ちます。
Security BoundaryはModelのRefusalだけでなくSoftware Permissionへ置く必要があります。
これは第035回のPrompt Injectionとも直結します。
GuardrailにはTrade-offがある
強いSafety RuleはLegitimate RequestまでBlockするFalse Positiveを生むことがあります。
弱すぎればHarmful Contentを通すFalse Negativeが増えます。
完全なClassifierはありません。
実際のRisk LevelとUserに合わせてEvaluationする必要があります。
Local Modelでは責任もLocalへ移る
Open-weight Modelを自分のHardwareで動かすと、Hosted Product側のPolicyが毎RequestをEnforceしなくなる場合があります。
Controlが増える代わりに、誰へ公開するか、どのDataへAccessできるか、どのToolを使えるかの責任も自分へ移ります。
001〜036を通した大きなLesson
AIは一つのMagic Brainではありません。
Userが体験するBehaviorは、
- Data
- Training
- Model Architecture
- Prompt / Context
- Tool
- Memory
- Application Logic
- Security Control
- Product Policy
のStackで決まります。
Stackを理解すると、AIを神秘的に考えず、どこが変わればBehaviorが変わるかを分析できます。
今日の一文
GuardrailはAIのBehaviorやActionを制約する複数Layerです。“Uncensored”は一部のBehavior制限が弱いことを示す場合がありますが、RuleもRiskも存在しないという意味ではありません。
コメント
質問、感想、補足したいことがあれば、ここに残せます。
まだコメントはありません。1Fになってみませんか。