SECTION / MODELS

モデル・基盤技術

基盤モデル、マルチモーダル、推論能力、オープンモデルなど、AIの能力を更新する中核技術を追います。

81 ARTICLES

LATEST / Cloudflare

Cloudflare、マルチモーダル決定モデル「Clef-omni」を公開 — 音声・動画・画像・テキストを単一APIで判定

Cloudflareは2026年10月9日、オープンウェイトの決定モデル群Clefに新モデルClef-omniを追加した。音声と動画をテキスト・画像と合わせて単一API呼び出しで処理し、重みはHugging Faceで公開。同時にClef-flashの値下げとClefの高速化も発表した。

記事を読む

MODELS

モデルの新着記事

RSSで購読

MODELS / 01

Liquid AI、エッジ向けオープンウェイト決定モデル「d1-3B」「d1-omni-600M」を公開 — トークン生成なしの単一フォワードパスで回答

Liquid AIが2026年10月7日に公開したオープンウェイト決定モデルd1-3Bとd1-omni-600Mを公式ブログ・Hugging Faceの一次情報から整理。単一フォワードパス回答の設計、Decision Indexや7種テキストベンチマークの公称値、NVIDIA・AMD・Apple・Jetsonでのレイテンシ、llama.cpp対応とライセンス上の注意を扱う。

MODELS / 01

Reflectionが501B・23BアクティブのMoE「Beam」を発表 — 米オープンウェイトの新鋒、重みは10月中にApache 2.0で公開へ

Reflectionが2026年10月5日に発表したオープンウェイトモデルBeam(501B・23BアクティブMoE)を公式ブログの一次情報から整理する。23.8兆トークンの事前学習、大規模RLの計算規模、ベンチマーク公称値、安全性の取り組み、Apache 2.0での重み公開予定を解説。

MODELS / 01

Musubiがモデレーション用小型モデル「PolicyLM-1.7B」をオープンウェイト公開 — 自社ポリシーを読む判定モデル、中央値35ミリ秒

Musubiが2026年10月6日に公開したオープンモデルPolicyLM-1.7Bを一次情報に基づき整理。Apache 2.0のオープンウェイト、ポリシー条件付きの判定方式、速度・精度の公表値、カットオフ設定、19言語評価、制限事項を扱う。

MODELS / 01

Mistral Large 4(Le Chonk)をプレビュー公開 — 1Tパラメーター・49BアクティブのMoE、月末に重み公開へ

Mistral AIが2026年10月6日に発表したMistral Large 4(Le Chonk)の公開プレビューを公式発表の一次情報から整理する。1T・49BアクティブMoEの仕様、DeepSWE・Terminal-Bench・Cybench等のベンチマーク公称値、料金、欧州データセンターでの学習、月末の重み公開予定を解説。

MODELS / 01

Rekaが19Bオムニモデル「Rho-1」を研究プレビュー公開 — テキスト・画像・動画・ロボット動作を単一ネットワークに統合

Reka AIが2026年10月5日に発表した19Bオムニ推論モデルRho-1(研究プレビュー)を公式発表の一次情報から整理する。単一ネットワークへの統合アーキテクチャ、0.79倍速の動画生成公称値、世界モデル・ロボティクスへの展開、学習規模と提供条件を解説。

MODELS / 01

Microsoft AI、初のストリーミング音声認識モデルと多言語TTS 2モデルを発表

Microsoft AIは2026年10月1日、初のストリーミング音声認識モデルMAI-Transcribe-2-Streamingと多言語TTSモデルMAI-Voice-2.1/MAI-Voice-2.1-Flashを発表した。60言語のリアルタイム文字起こし、23言語対応の単一ボイス、150ミリ秒の低遅延、料金と提供経路を一次情報に基づき整理する。

MODELS / 01

Black Forest Labs、画像モデル「FLUX 3 Image」を公開 — 境界ボックスで構図を直接指定

Black Forest LabsがFLUX 3ファミリーの画像生成・編集を担う「FLUX 3 Image」の提供を開始した。境界ボックスによるレイアウト指定、最大10枚の参照画像合成、画素単位の多段階編集、ネイティブ4K生成を特徴とし、PlaygroundとAPI、商用ウェイトライセンスで提供する。公式モデルページに基づき整理する。

MODELS / 01

Cloudflare、オープンな意思決定モデル「Clef」と「Clef-flash」を公開 — Workers AIで提供、Apache 2.0でオープンソース化

Cloudflareが2026年10月1日に意思決定モデル「Clef」「Clef-flash」を公開した。Qwen3.8-27B/Qwen3.5-9Bをベースに後段学習したマルチモーダルモデルで、Workers AIでホストし、Hugging FaceでApache 2.0ライセンスとして公開。Jev API互換とベンダー公称のベンチマーク結果、新しい強化学習ファインチューニング基盤を一次情報に基づき整理する。

MODELS / 01

Ideogram、画像編集モデル「Ideogram 4.5」を公開 — 多段階編集の劣化を抑制

Ideogramが2026年10月1日ごろに画像編集モデル「Ideogram 4.5」を公開した。繰り返し編集での画質劣化(ドリフト)抑制を前面に出し、GPT Image 2.5 SunburstやNano Banana Pro・Nano Banana 2との同一編集の比較映像、高解像度画像の部分編集機能を示している。公式モデルページに基づき整理する。

MODELS / 01

Tavus、対面会話モデル「Griffin」を発表 — 1分間のビデオ通話で48%が人間と誤認と報告

Tavusが2026年10月1日、初のHuman Interaction Model(HIM)「Griffin」(プレビュー版Griffin-Lite)を発表。会話モデリングと音声・映像生成を並行に動かす全二重video-to-video方式で、VideoFDBの生成・知覚の両部門で既存首位を上回ったとしている。仕組みと評価数値を一次情報に基づき整理する。

MODELS / 01

Google DeepMind、次世代フロンティアモデル「Gemini 4 Argon」を発表 — 防御側への段階公開、出力上限100万トークン

Google DeepMindが2026年9月30日に次世代フロンティアモデルGemini 4 Argonを発表。長時間・多段階の実務ワークフロー向けに設計され、ソフトウェア工学・法務金融の知識業務・サイバー防御で最高水準の性能をうたう。出力上限100万トークン、導入価格、評価結果、段階公開と安全策、社内活用実績を一次情報に基づき整理する。

MODELS / 01

NVIDIA、表データ特化の基盤モデル「Kumo Tabular」を公開 — 学習不要で分類・回帰を予測

NVIDIAが表データ向けオープンファウンデーションモデルKumo TabularをHugging Faceで公開。学習・調整・特徴量エンジニアリングなしに分類と回帰を予測し、TabArena、BeyondArena、TALENT、ScoringBenchで1位を報告。3サイズ、合成データ事前学習、OpenMDW-1.1ライセンス、制約を一次情報に基づき整理する。

MODELS / 01

OpenAI、GPT-6.1 Solを発表 — Astra級の性能を5分の1の価格で、コーディングとcomputer useに最適化

OpenAIが2026年9月29日のDevDay 2026でGPT-6.1 Solを発表。エージェント型コーディング、computer use、専門業務でGPT-6 Astraに迫る性能を標準価格の5分の1で提供する。DeepSWE v1.1、GDP.pdf、AutomationBench、OSWorld 2.0、Terminal-Bench Science 0.1の評価結果、価格、提供形態、安全性評価を一次情報に基づき整理する。

MODELS / 01

Liquid AI、視覚言語モデル向けDSparkドラフトを公開 — LFM2.5-VL-3Bのデコードを最大3.13倍高速化

Liquid AIは2026年9月24日、VLM「LFM2.5-VL-3B」向け投機的デコーディング用ドラフトモデル「LFM2.5-VL-DSpark」を公開した。4層・約280Mパラメータ(279.5M、+8.9%)の軽量ドラフトで、MLX(M5 Max)でデコード最大3.13倍・end-to-end最大2.62倍、SGLang(H100)でデコード最大2.66倍・end-to-end最大2.27倍を報告。6種のMMSpecタスクで評価。llama.cpp(GGUF)/MLX-VLM/SGLangにday-one対応。Hugging Faceで重みを公開(独自ライセンス)。

MODELS / 01

AlibabaのQwen、画像生成・編集モデル「Qwen-Image-2.1」をオープンウェイト公開 — 7Bで透過PNG生成と最大10枚参照編集に対応

AlibabaのQwenチームが2026年9月20日に画像生成・編集モデルQwen-Image-2.1をオープンウェイト公開。70億パラメータの生成部、透過RGBA対応、最大10枚参照の編集、2K解像度、Qwen Research License、初日対応の推論基盤を一次情報から整理。

MODELS / 01

階躍星辰(StepFun)が「Step 5 Preview」を公開 — 100万トークンのエージェント向けフロンティアモデル、重みもHugging Faceに

中国の階躍星辰(StepFun)がフロンティアモデル「Step 5 Preview」のドキュメントを公開した。モデルIDはstep-5-previewで、テキスト・画像・動画入力、100万トークンのコンテキスト、ツールコールと推論強度の調整に対応する。`stepfun-ai` 名義のアカウントがHugging Faceに safetensors 形式の重みも公開している。

MODELS / 01

Alibaba Cloudが「Qwen3.8-Omni-Flash」のドキュメントを公開 — 100万トークンの音声・動画理解モデル

Alibaba Cloudが2026年9月18日更新のModel Studioドキュメントで音声・動画理解モデル「qwen3.8-omni-flash」を掲載。テキスト・画像・音声・動画入力、テキスト出力、100万トークンのコンテキストウィンドウ、既定有効のThinking、Function Calling・Web検索・キャッシュ対応、東京を含む6リージョンで提供。

MODELS / 01

AllSpark、オープンウェイトの検索エージェントIris-mini/Iris-proを公開 — Qwen系MoEを探索学習で調整、同規模の公開勢で最高と主張

AllSpark-Researchが2026年9月に公開したオープンウェイト検索エージェントIris-mini/Iris-proを一次情報に基づき整理。Qwen系ベース、SFT-RL climbingによる学習、BrowseComp・HLE等の評価値、Iris-Harnessの同梱、Apache-2.0での重み公開を扱う。

MODELS / 01

Alibaba・Qwen、自動運転向け視覚言語基盤モデル「Qwen-Drive-1.0」を公開 — 3D知覚・対話・軌道計画を単一モデルに統合、Apache 2.0

AlibabaのQwenチームと華中科技大学が公開した自動運転向け視覚言語基盤モデルQwen-Drive-1.0を一次情報(GitHub・Hugging Face・技術レポート)に基づき整理。BEV知覚ヘッドと計画エキスパートの構成、NAVSIM・Waymo・NVIDIA PhysicalAIでの計画性能、運転VQAと汎用VQAの評価値を扱う。

MODELS / 01

H Company、マルチモーダル・多言語エンコーダ「NeoMME」を公開 — 260M/800MをApache 2.0で、文書検索でサイズ別Pareto最前線

H Companyが2026年9月3日にマルチモーダル・多言語エンコーダNeoMME(260M/800M)を公開。単一Transformerでテキストと画像を処理し、Apache 2.0でチェックポイントを提供。ViDoReベンチマークでの検索性能と高速化・圧縮の数値を整理する。

MODELS / 01

OpenAI、GPT-6 Astraの提供を開始 — 最上位モデルをTrusted Accessから順次拡大

OpenAIが2026年9月3日にGPT-6 Astraの提供を開始。Trusted Access Programの企業向けに先行提供し、APIとPlus・Pro・Business・Enterpriseプランへ数日中に拡大。105万トークンコンテキスト、5段階の推論設定、computer use対応などの仕様と、システムカードで示された安全性評価を整理する。

MODELS / 01

Meta、Muse Spark 1.3を発表 — 長時間コーディングとエージェント性能を強化、max推論は追加安全テスト後に提供

Meta Superintelligence LabsがMuse Spark 1.3を2026年9月2日に発表。エージェント/コーディング性能を改善し、長時間タスクでの要求保持や制約順守、自己認識を強化。従来比でツール呼び出し約20%、トークン約25%削減。Muse CodeとMeta Model APIで提供、max reasoningは追加の安全性テスト後に公開。

MODELS / 01

Geminiに「Agentic Video」登場 — 動画理解を最大88%トークン削減、最大7%精度向上

GoogleがGeminiのAgentic Video理解を発表。3.7 Flash等で動画を動的に探索・再視聴することで、標準ベンチマークでトークン最大88%・コスト最大66%削減、精度最大7%向上。APIでprocessingをagenticに設定するだけで利用でき、長尺動画の針穴探索や高速動作のカウントが大幅に効率化する。

MODELS / 01

Anthropic、Claude Fable 5.1とMythos 5.1を発表 — コーディング最前線と科学研究で新境地、キャッシュ75%値下げ

Anthropicが2026年9月1日にClaude Fable 5.1とClaude Mythos 5.1を発表。同一モデルを一般向けと信頼アクセス向けに分岐し、長時間コーディングでSOTA、タンパク質設計でヒット率50%、金星地形の高精細化、GPUカーネル最大2.5倍高速化などの研究成果と、キャッシュ読み取り75%値下げ、EFSによるゼロ保持、EU AI Act準拠の透かしを明らかにした。

MODELS / 01

李飛飛氏のWorld Labs、マルチモーダル世界モデル「Atlas」を発表 — テキスト・画像・動画・3Dを統合

World Labsが9月1日に次世代世界モデルAtlasを発表。テキスト・画像・動画・3Dを共有の空間コンテキストに統合するomniモデルで、カメラ制御生成、空間再構築、時空間シミュレーション、画像生成を1モデルで実行。Marbleの次期版の中核として提供予定。

MODELS / 01

Google、Gemini Omni 1.1 Flashを発表 — シーン延長・前後フレーム指定・4K出力を強化、制作向けに本番対応

Googleは2026年8月27日、動画生成モデルGemini Omni 1.1 Flashを発表した。シーン延長、始点・終点フレーム指定、360pドラフト、4Kアップスケール、参照動画入力など制作現場向けの制御機能を強化し、Gemini API(Google AI Studio / Gemini Enterprise Agent Platform)で提供する。

MODELS / 01

Z.ai、320B MoE「GLM-5.3-Flash」をMITで公開 — 18Bアクティブで1Mコンテキスト、“Ox Alpha”の正体

Z.aiは2026年8月26日、GLM-5.3-Flashを公開した。320B総パラメータ(18Bアクティブ)のネイティブマルチモーダルMoEで、長文推論コストを下げるハイブリッドAttentionとManifold-Constrained Hyper-Connectionsを導入。Hugging FaceでMITライセンスのオープンウェイトとして提供され、1Mコンテキストと推論制御を備える。

MODELS / 01

Alibaba Qwen、125B MoE「Qwen3.8-Flash-Next」を公開 — Qwen4アーキテクチャの先行版、6Bアクティブで長文・低遅延を狙う

Alibaba Qwenチームは2026年8月26日、Qwen4アーキテクチャのプレビューとしてQwen3.8-Flash-Nextを公開した。マルチモーダル対応の125B MoE(アクティブ6B)で、Qwen Sparse AttentionやGated Residual、n-gram embeddingを導入。262Kネイティブコンテキスト(最大1M拡張)を備え、HFでオープンウェイト提供される。

MODELS / 01

Google、Gemini 3.5 Transcribeを公開 — 高精度な音声文字起こしの専用モデル、Gemini APIでプレビュー提供

Googleは2026年8月26日、音声文字起こし専用モデル Gemini 3.5 Transcribe を発表した。最も高精度な speech-to-text モデルと位置づけ、既に自社プロダクトで稼働。Gemini API経由でGoogle AI StudioとGemini Enterpriseでパブリックプレビューとして提供され、リアルタイムと録音音声の両対応をうたう。

MODELS / 01

アリババ、動画生成AI「Wan 3.0」正式公開 — 30秒一括生成とドキュメントからの動画化に対応

アリババが動画生成モデルWan 3.0を2026年8月24日に正式公開。30秒のネイティブ動画を一括生成、テキスト/画像/映像/音声に加えドキュメント(doc/xls/ppt/pdf)を参照入力できるOmni-Reference、1080p・音声同時生成が特徴。ロイター等が同日報じ、AIBase/QbitAIが詳細を伝えた。

MODELS / 01

DeepSeek、マルチモーダル「V4-Flash-Vision-Exp」を公開 — V4-Flash同等のテキスト性能に視覚理解を追加、Files APIも同時提供

DeepSeekが2026年8月21日、実験的マルチモーダルモデルDeepSeek-V4-Flash-Vision-ExpをAPIで公開。V4-Flashと同等のテキスト性能を維持しつつマルチモーダルエージェント性能を大幅強化し、Opus-4.8に迫るとするベンダー公称ベンチマークを提示。料金はV4-Flashと同額、Files APIを同時リリース。

MODELS / 01

Liquid AI、LFM2.5向けDSparkドラフトを公開 — 推論を最大3.2倍高速化、品質はそのままにllama.cpp / SGLang対応

Liquid AIは2026年8月20日、Hugging FaceブログでLFM2.5向け投機的デコーディング「LFM2.5-DSpark」を公開した。LFM2.5-1.2B-Instruct/2.6B/8B-A1B向けに各約300Mパラメータ(5層・ブロック9)のアテンション特化ドラフトを提供。DFlash並列バックボーン+マルコフ逐次ヘッド+信頼度スケジュール検証のDSpark構成を採用。llama.cpp(M4 Max MacBook Pro・Metal・FP16 GGUF)とSGLang(H100・BF16)で評価し、H100で最大3.18倍、M4 Maxで最大2.87倍のスループット向上を報告。greedyではターゲットと同一出力のため精度不変、2.6BではBFCL相当の多ツール呼び出しレイテンシを平均57%削減。llama.cppとSGLangにday-one対応。

MODELS / 01

Liquid AI、LFM2.5向けQ4_0 GGUFをQuantization-Aware Distillationで刷新 — BF16の97%を維持しながらエッジでの高速推論を実現

Liquid AIは2026年8月19日、Hugging FaceブログでLFM2.5向けのQ4_0 GGUFをQuantization-Aware Distillation(QAD)で刷新したと発表した。対象はLFM2.5-230M/350M/1.2B-Instruct/2.6B。教師モデルから量子化済み生徒モデルへ蒸留するQADにより、従来のPTQ Q4_0の品質低下を回復し、BF16平均精度の97%前後を維持すると報告。GPQA DiamondやMMLU-Proなど7種のベンチマーク平均(5回平均)で従来Q4_0を大幅に上回り、Q5_K_M/Q4_K_M並みの品質をより高いデコードスループットで達成。MacBook ProやGalaxy S26 Ultraなど4種の実機でも計測し、llama.cppで即利用可能。Hugging Faceで公開中。

MODELS / 01

アリババ、AI音楽モデル「HappyShrimp 1.0(快乐虾米)」公開 — 自然言語1行から作詞・作曲・編曲・歌唱まで生成

アリババは2026年8月17日、自社開発のAI音楽生成モデル「HappyShrimp 1.0」(中文名:快乐虾米)を公式チャンネルで発表し、同日から国内版・海外版のPC Webで提供を開始した。「端から端まで(end-to-end)」の整曲生成で、自然言語の意図理解と多次元プロンプト制御を特徴とする(いずれもベンダー公称)。モデルアーキテクチャやベンチマーク数値は未公表で、独立した品質評価は今後の課題。公開初日の太合音楽グループとの戦略提携についても整理する。

MODELS / 01

Xiaohongshu(RedNote)のDots Studio、初のオープンウェイトモデル「dots3-note Preview」を公開 — 280B MoE・512Kコンテキスト・Apache 2.0

Xiaohongshu傘下のDots Studioは2026年8月中旬、オープンウェイトモデル「dots3-note Preview」をApache 2.0で公開した。280B総パラメータ/16BアクティブのMoE、512Kコンテキスト、4モダリティ入力など、モデルカード・GitHub README・Hugging Faceで確認できる事実を整理する。

MODELS / 01

Microsoftの小型コーディングモデル「MAI-Code-1.1-Flash」がGitHub Copilotに登場 — 画像理解に対応し価格は旧モデルの約1/4に

Microsoftは2026年8月11日、小型コーディングモデル「MAI-Code-1.1-Flash」をGitHub Copilotで提供開始した。画像理解への対応、性能改善、価格低減、旧モデルMAI-Code-1-Flashの非推奨化スケジュールを一次情報(Microsoft AI・GitHub Changelog)に基づいて整理する。

MODELS / 01

Z.ai、「GLM-5.3」を公開 — コーディング50%改善と「創発したサイバー能力」、重みは約2週間後に公開予定

Z.ai(Zhipu AI)が2026年8月14日、コーディング特化モデル「GLM-5.3」を公開した。GLM-5.2と同じベースモデルから事後学習のみで性能を引き上げ、コーディングと脆弱性発見の両方で大きな改善を報告している。一次情報(Z.ai公式ブログ・公式ドキュメント)に基づき、公表されたベンチマーク、サイバー能力の扱い、提供形態を整理する。

MODELS / 01

NVIDIA、エージェント実行層向けオープンモデル「Nemotron 3.5 Lightning」を公開 — 30B MoE・3Bアクティブで最大4倍の出力速度

NVIDIAが2026年8月11日、エージェントの実行層に特化したオープンモデル「Nemotron 3.5 Lightning(30B-A3B)」を公開した。アーキテクチャ、速度と精度の両立手法、公表されたベンチマーク、ライセンス、提供形態を一次情報に基づいて整理する。

MODELS / 01

Liquid AI、エッジ向け最上位VLM「LFM2.5-VL-3B」を公開 — 画面理解・物体接地・ツール呼び出しを強化

Liquid AIが2026年8月12日、自社ハードウェアで動かせる最上位の視覚言語モデル「LFM2.5-VL-3B」をHugging Faceで公開した。アーキテクチャと学習方法、公表されたベンチマークと推論速度、提供形態とライセンスを一次情報に基づいて整理する。

MODELS / 01

Google DeepMind、手話→テキスト翻訳モデル「SL2T」を発表 — Pixel 11のGboard/Live Transcribeに初搭載

Google DeepMindが2026年8月12日、手話からテキストへの翻訳モデル「SL2T」(sign-language-to-text)を発表した。Pixel 11のGboardとLive TranscribeでのASL→英語の手話入力機能、学習データとモデル設計、プライバシー保護の仕組み、公表された評価結果を一次情報に基づいて整理する。