NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
Aleph Alphaが独英特化の開放ウェイトモデル「Kolibri-1」を公開 — 78BパラメータMoEをApache 2.0で
ドイツのAleph Alphaは2026年10月3日、英語・ドイツ語に特化したMixture-of-Experts推論モデル「Kolibri-1」をオープンウェイトとして公開した。総パラメータ78Bに対しトークンあたり3.46Bのみを活性化し、FP8量子化で約78GBに収める。最大104万トークンのコンテキスト、推論モードとツール呼び出しに対応し、Hugging Faceで非ゲート公開されている。
ドイツのAleph Alphaは2026年10月3日(ドイツ再統一の日)、英語・ドイツ語に特化したMixture-of-Experts(MoE)推論モデル**「Kolibri-1」**をオープウェイトとして公開した。総パラメータ78Bに対してトークンあたり3.46Bのみを活性化する設計で、重みはApache 2.0ライセンスのもとHugging Faceで非ゲート公開されている。以下は公式ブログとモデルカードの記載内容の整理であり、性能数値はすべてベンダー報告値である。
78B総・3.46B活性のMoE設計と長期コンテキスト
- アーキテクチャは50層のMoE Transformer。総パラメータは78,103,074,560、トークンあたり活性は3,457,573,120。1層あたり384エキスパートで、共有1+ルーティング6の構成、4:1のSWA:GQAアテンションを採用する。
- **言語はドイツ語と英語の2言語に絞った「深さ優先」**の選択。ドイツ語の語構造に合わせた専用トークナイザで処理効率を確保しつつ、英語を犠牲にしない設計と説明されている。
- コンテキストはネイティブ262,144トークン(事前学習16,384→中間学習65,536→長文脈化262,144の段階拡張)。位置符号化をスライディングウィンドウ層にのみ適用する設計で、最大1,048,576トークンまで品質・提供効率を検証済み。ただし遅延・スループット重視や複雑なタスクでは262,144以下が推奨されている。
- 精度はFP8(float8_e4m3fn)の128×128ブロック量子化で、重みフットプリントは約78GB。最小構成はA100 80GB×2やH100 SXM5×2、H200・B200・B300×1など、推奨はH100×2以上とされている。
- 明示的な推論モードとツール呼び出しに対応し、vLLM経由で提供される。推奨サンプリングはtemperature=1.0、top_p=0.97、top_k=128。知識カットオフは英独とも2026年6月18日と記載されている。
学習データ・計算資源と提供形態
- 学習トークン量は事前学習20T、中間学習3.44T、長文脈拡張201B。コーパスは英語約62.5%、ドイツ語約23.9%、コード約13.6%のフィルタ済みバイリンガル構成で、厳選Web・合成リフレーズ・翻訳・高品質ソースを組み合わせている。
- 計算資源は768基のNVIDIA B200(96ノード)で事前学習21日間(392k GPU時間)、中間学習5日間(90k GPU時間)、長文脈13時間(10k GPU時間)、総FLOPSは6.4e23。学習手法はMuonとExact Quantile Balancingと記載されている。
- 提供は
aleph-alpha-inferenceパッケージまたはコンテナイメージ経由で、同梱のvLLMプラグインで推論・ツール呼び出しを有効化する。Hugging Faceリポジトリは非ゲートで、ライブラリ指定はvLLM、タグにreasoning・moe・de・enが付与されている。 - 想定用途は公共行政・産業・航空宇宙などの規制領域を含む主権的でミッションクリティカルな業務で、会話アシスタントやエージェント型ワークフローへの組み込みを前提とする。人間がレビューする協働利用を意図し、自律的に無審査で行動する用途は想定外と明記されている。Aleph AlphaはEUの汎用AI行動規範(GPAI Code of Practice)の署名者でもある。
- エネルギー消費の推定値は約950MWh(事前・中間・長文脈学習の合計、ノード電力とデータセンター overhead を含む。SFT・RL等は除外)。
ベンダー報告の評価値(独立評価ではない)
- モデルカードの評価表は、同規模MoE群との比較で英語総合75.5、ドイツ語総合70.8をKolibri-1の値として記載している。比較対象にはGLM-4.7 Flash 30B-A3B、Nemotron 3 Nano 30B-A3B、Qwen3.5/3.6 35B-A3Bなどが含まれる。
- 数学系では英語平均96.5で、AIME 2025英語96.9、AIME 2026英語96.0と記載。知識系ではGPQA Diamond英語84.3、Humanity’s Last Exam英語21.5、MMLU-Pro CoT英語80.0と記載されている。
- コード系では英語平均89.3で、LiveCodeBench v6が85.9、HumanEval+が92.7、SWE-Bench Verifiedが66.4と記載されている。
- エージェント系では英語平均63.4で、Tau2-Bench Airlineが76.7、Tau3-Bench Bankingが38.1、BFCL v4 overallが61.4と記載されている。BFCL v4のmulti-turnやmemoryなど一部項目では他モデルが上回る値も記載されており、強みはタスクによりばらつく。
- いずれもAleph Alpha自身の測定・集計による公称値であり、第三者による独立評価や再現実験の結果ではない点に留意されたい。