C³社会デザインセンター

サイト内を検索

ページ、Verify ID を検索...

EN
Living Draftv0.1.0

LLM SafeControl Profile

生成AIの出力・外部作用・公開前審査を、HOLD / ESCALATE / FREEZE と公開・監査・復帰条件つきで扱う外付け安全制御プロファイル。

このページは、LLMそのものの能力競争ではなく、社会に出る前の出力・実行・公開を止まれる形へ近づけるための公開正本です。

LLM SafeControl Profile v0.1 は、生成AIの出力・外付け実行・公開前審査を、HOLD / ESCALATE / FREEZE と公開・監査・復帰条件つきで扱う外付け安全制御層の公開仕様です。基盤モデルそのものの内部を書き換えるものではなく、出力が社会に出る前の統治面を記述します。版管理・証跡・検証導線を整えた Living Draft / Public Original として公開します。内容の真実保証・完全な抽出防止・モデル内部の安全保証は対象外です。

本ページは Living Draft / Public Original v0.1 です。

本番運用、正確性保証、真実保証、投資収益、完全な抽出防止、モデル内部の安全保証を意味しません。

これは基盤モデルそのものではなく、外付けの安全制御層を記述する公開仕様です。

Why this matters now — Frontier Model Access Shock

先端AIの安全性は、モデル単体の評価だけでは足りなくなっています。組織側には、AI出力が公開・送信・API実行・外部作用へ進む前に、HOLD / ESCALATE / FREEZE / SHRINK し、理由と証跡を残し、復帰条件を管理する外付け制御層が必要です。

従来のLLMガードは「内容」を守ります。入力モデレーション、出力モデレーション、jailbreak検知、危険トピック拒否——いずれもテキストの意味を見る防御です。しかし、内容が無害でも、実行経路が危険なら事故は起きます(Semantic safe ≠ Operationally safe)。承認経路の飛ばし、未知の外部送信先、権限昇格、監査ログ欠落、署名鎖の不整合——これらは意味を読んでも防げません。

なぜ従来のLLMガードだけでは足りないのか:LLM SafeControl Profile / TG が必要になる技術的理由

Incident Mapping: Frontier Model Access Shock

公開済みフロンティアモデルが、規制・輸出管理・安全保障上の判断によって突然アクセス停止される事態が、現実に発生し得ます。このとき組織が直面する構造的リスクと、SafeControl の対応を以下に対応づけます。

観測される構造リスクSafeControl 対応
上流モデルへのアクセスが予告なく停止されるFREEZE:外部実行・公開を即時停止し、復帰条件を記録
プロバイダ側の安全方針が業務フロー準備なしに変更されるHOLD:証跡が揃うまで出力を未公開に保つ
フォールバック挙動が下流統治に対して不透明reason_code:経路が変わった理由を識別子で記録
法務・輸出管理・安全保障上の制約が突発的に課されるESCALATE:人間の法務・セキュリティ判断へ引き渡す
縮小可能な属性が観測できず全体停止に帰着するFREEZE:SHRINK不能時の唯一の安全手段として記録付きで停止

注:本ページは特定企業の事案を評価するものではありません。公開済みモデルのアクセス停止という構造パターンを、SafeControl の語彙で一般化して記述しています。

What it is

  • 生成AIの出力・外付け実行・公開前審査を扱う外付けの安全制御層の仕様
  • HOLD / ESCALATE / FREEZE / SHRINK と公開・監査・復帰条件つきで出力統治を記述する公開正本
  • AIガバナンスの公開知識面(/ai-governance)に接続する技術本体
  • 版管理・証跡・Verify導線を整えた Living Draft / Public Original v0.1
  • 社会に出る前の出力・実行・公開を「止まれる形」へ近づけるための設計参照面

What it is not

基盤モデルそのものの能力・内部構造を変更するものではありません
完全な抽出防止・ハルシネーション完全排除・モデル内部の安全保証を意味しません
本番自動公開・本番自動承認を前提とした設計ではありません
内容の真実保証・投資収益・排他権・仕様決定権を主張するものではありません
特定ベンダーのモデルや製品を推奨・評価するものではありません
法務判断の代替ではありません。法務レビューが必要な状態を検知して渡す導線として機能します

Why now

生成AIの外付け安全制御層の公開仕様を今整える理由を以下に示します。

  • 生成AIの外部作用(API実行・コード生成・公開文書生成)が拡大し、出力だけでなく実行・公開前の統治面が空白になっている
  • 「モデルが安全かどうか」の評価はモデルベンダーに依存するが、「出力を社会に出す前に止める・記録する・説明する」層は組織側が整える必要がある
  • HOLD / ESCALATE / FREEZE を語彙として共有しないと、組織横断の審査・引き継ぎ・監査が属人的になる
  • reason_code による判定記録がないと、なぜ止めたか・なぜ通したかを後から説明できない
  • Two-Rail 構造では公開レールと非公開レールの接続条件を定義するが、その接続判断を行う制御層の語彙が未定義だった

Scope

この仕様が扱う範囲を以下に示します。

出力ゲート:生成AIの出力が送信・公開・実行される前の審査ポイント

実行ゲート:外付けツール呼び出し・コード実行・API送信の前の審査ポイント

公開ゲート:ドキュメント・UI・外部配信の公開前審査ポイント

判定語彙:PASS / HOLD / ESCALATE / FREEZE / SHRINK の5状態

記録構造:reason_code による判定理由の識別子記録

復帰条件:HOLD / FREEZE から PASS へ移行する条件と手続き

Two-Rail 接続条件:公開レールに出力が移る前の境界定義

Non-goals

この仕様が明示的に対象外とする事項を以下に示します。

基盤モデルのウェイト・内部アーキテクチャの変更は対象外です
完全な抽出防止・知識蒸留防止はこの仕様の対象外です
リアルタイムのコンテンツモデレーション(ストリーミング中の割り込み)は対象外です
モデルの能力評価・ベンチマーク比較は対象外です
個人情報保護・プライバシー法の法的要件の定義は対象外です(法務ESCALATEで渡す)
本番インフラの自動デプロイ・自動承認は対象外です

Core actions

このプロファイルで定義する5つの判定アクションです。PASS / HOLD / ESCALATE / FREEZE / SHRINK はC³の固有語彙であり、他の意味に転用しません。

PASS通過

出力・実行・公開の条件を満たし、次の工程へ進める状態。根拠・導線・非目標の明示が揃っている。PASS は永続的な承認ではなく、この版・この時点での通過を示す。

HOLD保留

根拠・導線・非目標の明示が不足している状態。送信・公開・断定の前で止まる。存在否定ではない。修正・補足の後に再審査できる。reason_code で保留理由を記録する。

ESCALATE上申

法務確認・倫理審査・上位判断が必要な状態。自動審査の範囲を超える。担当者・部門・外部レビュアーへの引き渡しを記録する。ESCALATE 後の判断は人間が行う。

FREEZE停止

安全のために強制停止する状態。出力・実行・公開を即時中断する。FREEZE は強制力のある停止語彙。復帰には明示的な解除手続きと記録が必要。

SHRINK縮小

出力・実行・公開の範囲を縮小して継続する状態。全体を止めるほどではないが、特定のスコープを外す・対象を限定する・公開範囲を絞る判断。影響範囲を最小化しながら継続する。SHRINK は、縮小可能なスコープ次元が観測可能な属性に紐づくときにのみ成立します。遮断条件が観測不能な属性(例:実行時にリアルタイム判別できない利用者属性)に基づく場合、範囲を絞る軸が存在しないため、SHRINK は成立せず FREEZE に帰着します。この場合の SafeControl の貢献領域は、範囲縮小ではなく、FREEZE の理由記録(reason_code)と復帰条件(recovery_condition)の管理に移ります。

TG projection — 構造的フェイルセーフ層としての TG

LLM SafeControl Profile は、意味を見ない構造ゲート(Topological Gatekeeper, TG)を下限安全帯として接続します。TG は出力・実行・公開の意味内容を読まず、経路・権限・証跡・署名・監査到達性といった構造の逸脱だけを見て、HOLD / ESCALATE / FREEZE / SHRINK を発火させます。

LLM SafeControl Profile における TG の作用:TG = 意味を見ない構造的フェイルセーフ層

TG は「安全な意味」を保証する装置ではありません。PASS を単独で出すのではなく、構造的に問題がない候補(PASS_CANDIDATE)までを示し、最終的な PASS は profile 適合・証跡・必要に応じた意味審査を通った後に確定します。TG が強いのは「内容が危険か」ではなく「危険な出方をしているか」の判定です。法務・医療・金融などの内容リスク、ハルシネーション、差別・名誉毀損といった意味依存の判定は TG 単体の射程外であり、意味審査層と組み合わせて扱います。

TG が見る構造逸脱SafeControl 判定
監査経路がないHOLD
外部送信なのに承認不足ESCALATE
署名鎖・記録の不整合FREEZE
tool call の分岐(fanout)急増SHRINK
公開レールへ直行HOLD
未知の外部送信先ESCALATE

TG の詳細は Topological Gatekeeper 仕様 を参照してください。

Two-Rail boundary

LLM SafeControl Profile は Two-Rail 構造の境界上に位置します。 公開レールに出力を移す前の制御点として機能します。 公開レールと非公開レールにそれぞれ置くべき情報の原則を以下に示します。

公開レール(Public Rail)に置くもの

  • 判定語彙(PASS / HOLD / ESCALATE / FREEZE / SHRINK)の定義と意味
  • reason_code の体系(/spec/reason-codes に接続)
  • 復帰条件の原則(記録・手続き・承認の必要性)
  • Verify / History / Updates 導線

非公開レール(Protected Rail)に置くもの

  • 具体的なしきい値・検知パラメータ・判定ロジックの詳細
  • 組織固有の法務・コンプライアンス判定基準
  • 実装中のシステム構成・ベンダー情報
  • 審査プロセスの内部運用詳細

Two-Rail の詳細は /spec/two-rail を参照してください。

Verify / History / Related Pages

Time Layer

StatusLiving DraftPage TypeTechnical Specification / Public OriginalVersion0.1Last Updated2026-04-17Related Pages

Provenance

doc_id: C3-SPEC-LLM-SAFECONTROL-PROFILE-0.1

version: 0.1.0

status: living-draft

last_updated: 2026-04-17T00:00:00+09:00

canonical: https://www.c3-anchor.jp/spec/llm-safecontrol-profile