NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
Musubiがモデレーション用小型モデル「PolicyLM-1.7B」をオープンウェイト公開 — 自社ポリシーを読む判定モデル、中央値35ミリ秒
Trust & SafetyスタートアップのMusubiは2026年10月6日、コンテンツモデレーション向けの1.7Bパラメータの判定モデルPolicyLM-1.7BをApache 2.0で公開した。ポリシーとメッセージを同時に読み、各カテゴリに0〜1のスコアを返す。テキスト生成を伴わない単一パス推論で、24GB GPU上の短文チャットで中央値35ミリ秒をうたう。
Musubiは2026年10月6日、公式ブログでコンテンツモデレーション向けの小型モデル「PolicyLM-1.7B」を公開した。ライブチャットやゲームロビー、DMなど「会話が進む前に判定が必要な場面」を想定したモデルで、重みはApache 2.0ライセンスのオープンウェイトとしてHugging Face(musubilabs/policylm-1.7b、リビジョンv1.2)で配布されている。以下は同社ブログとモデルカードの記載内容の整理である。
仕組み — ポリシーを読む判定モデル、テキストは生成しない
- 判定方式: メッセージとポリシーを同時に読み取り、ポリシー内の各カテゴリに0〜1のスコアを単一パスで返す。チャットボットのように文章を生成しないため高速・低コストだとしている。
- ポリシーの記述: ラベルを平易な言葉で独自に定義でき、ポリシー変更は再学習なしに即時反映される。1回の呼び出しで最大16カテゴリ、ポリシー側は最大1,662トークン。ポリシーとメッセージで2,048トークンのコンテキストを共有する。
- 組み込み分類体系: NVIDIAの公開する23カテゴリの危害分類「Aegis 2.0」を内蔵し、汎用スクリーニングにも使える。
- 位置づけ: ブログは、判定のみを返す小型モデルという同じ発想の例としてJevに言及し、大規模モデルは申立て対応や微妙な判断に、PolicyLMのような特化小型モデルは大量メッセージの判定に向くと整理している。
- ベースと学習: BidirLM-1.7B-Embedding(Qwen3-1.7B-Base由来のオープンなエンコーダ)を起点に、NVIDIAのNemotron Safety Guardデータセットv3(一部ラベルをLLM支援で修正)、AlibabaのXGuard-Train-Open-200K、PolyGuardMixに加え、合成データとLLM生成データで学習した。
性能の公表値 — 速度とカスタムポリシーの精度
- 速度: 100ミリ秒未満をうたい、短文チャットでは中央値でL4(24GB)上35ミリ秒・最大6カテゴリ、H100上22ミリ秒。単一24GB GPUのほか、ノートPCのCPUやAppleシリコンでも動作するとしている。
- カスタムポリシーの精度: 自社の合成業務ポリシーベンチマークで精度0.842を示し、比較対象の20B未満のモデル(Granite Guardian 4.1-8Bの0.722、Nemotron-3.5-Content-Safetyの0.668など)を上回ったとしている。なお21.5Bのgpt-oss-safeguard-20Bは0.909で上回っている。
- 汎用ベンチマーク: WildGuardTest、XSTest、OR-Bench、PolyGuard、RabakBenchでのAUROCもモデルカードに掲載している(例: WildGuardTest 0.947、XSTest 0.968)。
- カットオフ: カテゴリごとにしきい値を設定でき、「precision」(既定・違反が稀な場面向け)と「balanced」(違反が多い場面向け)のプリセットがある。自社ポリシーでは0.335/0.275、内蔵分類体系では0.69/0.45とされている。
- 注意: 上記はいずれもベンダー公称値であり、独立した第三者評価ではない。評価セットの多くは開発中にも使用されたとモデルカードに明記されている。
利用条件と制限 — テキストのみ、英語が最強
- 言語: 19言語で評価し、英語が最も強く、タミル語が最も弱い。カスタムポリシーの検証は英語のみで行われた。
- 制限: テキストのみで会話履歴は扱わない。無害だが有害に聞こえる内容の誤検知、コード混じりスラングやleetspeakへの弱さ、長文(2,000文字超)のウィンドウ分割による検出率上昇などが挙げられている。判定理由の文章は出力しない。
- 対象外: 子どもの安全確保の唯一の手段、自傷対策の唯一のセーフガード、敵対的ユーザーへのセキュリティ境界、AI応答のモデレーションは適用外とされている。
- 導入: Python 3.10以上、transformers 4.57.6(5.xは未対応)、torch 2.5.1以上が必要。ヘルパーは難読化(look-alike文字、base64など)の正規化を既定で行い、テストセットで変装違反の検出が10〜12ポイント改善したとしている。
- コミュニティ: ROOSTのModel Communityに参加し、10月27日に安全性モデルの選択とルーティングに関するワークショップ「Does a Model Follow Your Rules?」を共催する。微調整版が1日100万超メッセージを扱うプラットフォームで本番稼働済みとしている。