LLM SafeControl Profile
生成AIの出力・外部作用・公開前審査を、HOLD / ESCALATE / FREEZE と公開・監査・復帰条件つきで扱う外付け安全制御プロファイル。
このページは、LLMそのものの能力競争ではなく、社会に出る前の出力・実行・公開を止まれる形へ近づけるための公開正本です。
LLM SafeControl Profile v0.1 は、生成AIの出力・外付け実行・公開前審査を、HOLD / ESCALATE / FREEZE と公開・監査・復帰条件つきで扱う外付け安全制御層の公開仕様です。基盤モデルそのものの内部を書き換えるものではなく、出力が社会に出る前の統治面を記述します。版管理・証跡・検証導線を整えた Living Draft / Public Original として公開します。内容の真実保証・完全な抽出防止・モデル内部の安全保証は対象外です。
本ページは Living Draft / Public Original v0.1 です。
本番運用、正確性保証、真実保証、投資収益、完全な抽出防止、モデル内部の安全保証を意味しません。
これは基盤モデルそのものではなく、外付けの安全制御層を記述する公開仕様です。
Why this matters now — Frontier Model Access Shock
先端AIの安全性は、モデル単体の評価だけでは足りなくなっています。組織側には、AI出力が公開・送信・API実行・外部作用へ進む前に、HOLD / ESCALATE / FREEZE / SHRINK し、理由と証跡を残し、復帰条件を管理する外付け制御層が必要です。
従来のLLMガードは「内容」を守ります。入力モデレーション、出力モデレーション、jailbreak検知、危険トピック拒否——いずれもテキストの意味を見る防御です。しかし、内容が無害でも、実行経路が危険なら事故は起きます(Semantic safe ≠ Operationally safe)。承認経路の飛ばし、未知の外部送信先、権限昇格、監査ログ欠落、署名鎖の不整合——これらは意味を読んでも防げません。
Incident Mapping: Frontier Model Access Shock
公開済みフロンティアモデルが、規制・輸出管理・安全保障上の判断によって突然アクセス停止される事態が、現実に発生し得ます。このとき組織が直面する構造的リスクと、SafeControl の対応を以下に対応づけます。
| 観測される構造リスク | SafeControl 対応 |
|---|---|
| 上流モデルへのアクセスが予告なく停止される | FREEZE:外部実行・公開を即時停止し、復帰条件を記録 |
| プロバイダ側の安全方針が業務フロー準備なしに変更される | HOLD:証跡が揃うまで出力を未公開に保つ |
| フォールバック挙動が下流統治に対して不透明 | reason_code:経路が変わった理由を識別子で記録 |
| 法務・輸出管理・安全保障上の制約が突発的に課される | ESCALATE:人間の法務・セキュリティ判断へ引き渡す |
| 縮小可能な属性が観測できず全体停止に帰着する | FREEZE:SHRINK不能時の唯一の安全手段として記録付きで停止 |
注:本ページは特定企業の事案を評価するものではありません。公開済みモデルのアクセス停止という構造パターンを、SafeControl の語彙で一般化して記述しています。
What it is
- 生成AIの出力・外付け実行・公開前審査を扱う外付けの安全制御層の仕様
- HOLD / ESCALATE / FREEZE / SHRINK と公開・監査・復帰条件つきで出力統治を記述する公開正本
- AIガバナンスの公開知識面(/ai-governance)に接続する技術本体
- 版管理・証跡・Verify導線を整えた Living Draft / Public Original v0.1
- 社会に出る前の出力・実行・公開を「止まれる形」へ近づけるための設計参照面
What it is not
Why now
生成AIの外付け安全制御層の公開仕様を今整える理由を以下に示します。
- 生成AIの外部作用(API実行・コード生成・公開文書生成)が拡大し、出力だけでなく実行・公開前の統治面が空白になっている
- 「モデルが安全かどうか」の評価はモデルベンダーに依存するが、「出力を社会に出す前に止める・記録する・説明する」層は組織側が整える必要がある
- HOLD / ESCALATE / FREEZE を語彙として共有しないと、組織横断の審査・引き継ぎ・監査が属人的になる
- reason_code による判定記録がないと、なぜ止めたか・なぜ通したかを後から説明できない
- Two-Rail 構造では公開レールと非公開レールの接続条件を定義するが、その接続判断を行う制御層の語彙が未定義だった
Scope
この仕様が扱う範囲を以下に示します。
出力ゲート:生成AIの出力が送信・公開・実行される前の審査ポイント
実行ゲート:外付けツール呼び出し・コード実行・API送信の前の審査ポイント
公開ゲート:ドキュメント・UI・外部配信の公開前審査ポイント
判定語彙:PASS / HOLD / ESCALATE / FREEZE / SHRINK の5状態
記録構造:reason_code による判定理由の識別子記録
復帰条件:HOLD / FREEZE から PASS へ移行する条件と手続き
Two-Rail 接続条件:公開レールに出力が移る前の境界定義
Non-goals
この仕様が明示的に対象外とする事項を以下に示します。
Core actions
このプロファイルで定義する5つの判定アクションです。PASS / HOLD / ESCALATE / FREEZE / SHRINK はC³の固有語彙であり、他の意味に転用しません。
出力・実行・公開の条件を満たし、次の工程へ進める状態。根拠・導線・非目標の明示が揃っている。PASS は永続的な承認ではなく、この版・この時点での通過を示す。
根拠・導線・非目標の明示が不足している状態。送信・公開・断定の前で止まる。存在否定ではない。修正・補足の後に再審査できる。reason_code で保留理由を記録する。
法務確認・倫理審査・上位判断が必要な状態。自動審査の範囲を超える。担当者・部門・外部レビュアーへの引き渡しを記録する。ESCALATE 後の判断は人間が行う。
安全のために強制停止する状態。出力・実行・公開を即時中断する。FREEZE は強制力のある停止語彙。復帰には明示的な解除手続きと記録が必要。
出力・実行・公開の範囲を縮小して継続する状態。全体を止めるほどではないが、特定のスコープを外す・対象を限定する・公開範囲を絞る判断。影響範囲を最小化しながら継続する。SHRINK は、縮小可能なスコープ次元が観測可能な属性に紐づくときにのみ成立します。遮断条件が観測不能な属性(例:実行時にリアルタイム判別できない利用者属性)に基づく場合、範囲を絞る軸が存在しないため、SHRINK は成立せず FREEZE に帰着します。この場合の SafeControl の貢献領域は、範囲縮小ではなく、FREEZE の理由記録(reason_code)と復帰条件(recovery_condition)の管理に移ります。
TG projection — 構造的フェイルセーフ層としての TG
LLM SafeControl Profile は、意味を見ない構造ゲート(Topological Gatekeeper, TG)を下限安全帯として接続します。TG は出力・実行・公開の意味内容を読まず、経路・権限・証跡・署名・監査到達性といった構造の逸脱だけを見て、HOLD / ESCALATE / FREEZE / SHRINK を発火させます。
TG は「安全な意味」を保証する装置ではありません。PASS を単独で出すのではなく、構造的に問題がない候補(PASS_CANDIDATE)までを示し、最終的な PASS は profile 適合・証跡・必要に応じた意味審査を通った後に確定します。TG が強いのは「内容が危険か」ではなく「危険な出方をしているか」の判定です。法務・医療・金融などの内容リスク、ハルシネーション、差別・名誉毀損といった意味依存の判定は TG 単体の射程外であり、意味審査層と組み合わせて扱います。
| TG が見る構造逸脱 | SafeControl 判定 |
|---|---|
| 監査経路がない | HOLD |
| 外部送信なのに承認不足 | ESCALATE |
| 署名鎖・記録の不整合 | FREEZE |
| tool call の分岐(fanout)急増 | SHRINK |
| 公開レールへ直行 | HOLD |
| 未知の外部送信先 | ESCALATE |
TG の詳細は Topological Gatekeeper 仕様 を参照してください。
Two-Rail boundary
LLM SafeControl Profile は Two-Rail 構造の境界上に位置します。 公開レールに出力を移す前の制御点として機能します。 公開レールと非公開レールにそれぞれ置くべき情報の原則を以下に示します。
公開レール(Public Rail)に置くもの
- 判定語彙(PASS / HOLD / ESCALATE / FREEZE / SHRINK)の定義と意味
- reason_code の体系(/spec/reason-codes に接続)
- 復帰条件の原則(記録・手続き・承認の必要性)
- Verify / History / Updates 導線
非公開レール(Protected Rail)に置くもの
- 具体的なしきい値・検知パラメータ・判定ロジックの詳細
- 組織固有の法務・コンプライアンス判定基準
- 実装中のシステム構成・ベンダー情報
- 審査プロセスの内部運用詳細
Two-Rail の詳細は /spec/two-rail を参照してください。
Verify / History / Related Pages
Time Layer
Provenance
doc_id: C3-SPEC-LLM-SAFECONTROL-PROFILE-0.1
version: 0.1.0
status: living-draft
last_updated: 2026-04-17T00:00:00+09:00
canonical: https://www.c3-anchor.jp/spec/llm-safecontrol-profile