液冷式AIサーバーと発光する計算基盤の抽象ビジュアル
NAW / COMPUTE 06

IMAGE: AI生成ビジュアル

COMPUTE / Infrastructure

KTのAIモデルルーターが公開ベンチマークRouter Arenaで2位に — 精度とコストを両立するTDL方式をオープンソース公開

韓国KTは2026年9月27〜28日、自社のAIモデルルーティング技術AutoModelRouterが公開ベンチマークRouter ArenaのAcc-Cost Arenaで2位になったと発表した。リーダーボードの記録ではスコア76.28・精度78.14・コスト0.27ドル/1,000クエリで、1位に0.35ポイント差まで迫っている。クエリの意味構造とモデル選択を分離するTDL方式の手法・ポリシーはApache 2.0でGitHub公開されている。

韓国KTは2026年9月27〜28日、自社のAIモデルルーティング技術「AutoModelRouter」が公開ベンチマーク「Router Arena」で世界2位になったと発表した(韓国メディアの報道による。同報道はRice大学の研究者らが開発したベンチマークと伝えている)。RouterArenaの公開リーダーボードでも「KT-ModelRouter」がAcc-Cost Arenaで2位(🥈)に記録されており、スコア76.28・精度78.14・コスト0.27ドル/1,000クエリで、1位のPaix2(77.63)に1.35ポイント差まで迫っている。以下は公開リーダーボードとKTのGitHubリポジトリの記載内容の整理であり、独立した再評価ではない。

発表内容 — Acc-Cost Arenaで2位、コストは1位と同水準

  • 順位と数値: 公開リーダーボードの記録では、KT-ModelRouterはAcc-Cost Arena 76.28、精度(Accuracy)78.14、コスト0.27ドル/1,000クエリ、堅牢性(Robustness)80.48となっている。コストは1位Paix2と同額の0.27ドルで、3位Sqwish Router(0.70ドル)の半分以下だ。
  • ベンチマークの位置づけ: RouterArenaはLLMルーター(クエリごとに最適なモデルを自動選択する仕組み)のための公開評価基盤で、精度・コスト・最適性・堅牢性・遅延の5系統の指標とライブリーダーボードを持つと説明されている。評価のみを目的とするデータセットであり、RouterArenaデータでの学習・調整は禁止されている。
  • 評価規模: KTのリポジトリによれば、提出には1,976件の較正(calibration)クエリと8,400件のRouterArenaテストクエリ、5モデルの候補プールが使われた。較正データで選んだポリシーをテストクエリに適用し、品質・コストのトレードオフが未知クエリでも保たれるかを検証する設計だ。

手法 — クエリの意味構造とモデル選択を分離するTDL方式

  • 設計思想: KTの公開READMEによれば、ルーティングの関心事を3層に分ける。(1) クエリの意味構造は比較的安定している、(2) モデルと提供条件(品質・価格・可用性)は変わる、(3) 運用目標はサービスとしての品質・コスト選択である、という前提だ。
  • 3層の構成: クエリをモデル非依存の意味グループに写像する「TDL分類器」、意味グループから候補プールのモデルへの写像である「ルーティングポリシー」、ワークロード全体の品質・コスト選択を表す「運用点(operating point)」に分離する。候補モデルは分類器の固定出力クラスではなく、ポリシー層で差し替え可能な最適化の選択肢として扱われ、モデルの追加・削除・価格改定にはポリシーの再構築だけで対応できるとしている。
  • TDL分類: テスト提出では意味グループをTask(T1〜T12:何をするか)・Domain(D1〜D10:どの知識領域か)・Level(L1〜L3:難易度と推論の深さ)で定義し、mmBERTベースの分類器を使う。各グループとモデルの組み合わせごとに較正測定から品質QとコストCを集計し、Paretoフィルタで非劣位のポリシー候補(frontier)を残し、較正データ上で1つの運用点を選択してグループ→モデルの対応表に固定する。

再現性と限界 — 公開範囲と順位の変動に注意

  • 公開物: リポジトリには較正クエリ、選択されたルーティングポリシー、較正・テスト比較、ルーティング分布のヒートマップが含まれ、ライセンスはApache License 2.0だ。TDL分類器のチェックポイントか事前計算ラベルのどちらを公開するかは検討中とされ、分類器の学習パイプラインは公開範囲外と明記されている。
  • 再現の条件: ポリシーの再生成には、TDL分類器の出力、候補モデルの品質・コスト測定、Pareto構築コード、運用点の選択規則が別途必要とされている。導入可否の判断には自環境での再現確認が必要だ。
  • 順位の留保: リーダーボードはライブ更新型で、提出の追加により順位は変動しうる。数値はベンチマーク上の報告値であり、実サービスでの品質・コストを保証するものではない。

出典