PRODUCTS / 03
Ollama v0.40.0 — Apple SiliconでMLX実行が既定に、EmbeddingGemma 2の埋め込みにも対応
Ollama v0.40.0のリリースノート(GitHub一次情報)を整理する。Apple SiliconでのMLX既定実行、対応モデル、decision modelsとembeddinggemma-2のMLX対応、v0.35.1からの変更点を解説。
MODELS / TRACKED TOPIC
Qwenモデル、オープンウェイト、ライセンスに関する記事。
32 STORIES
MODELS
PRODUCTS / 03
Ollama v0.40.0のリリースノート(GitHub一次情報)を整理する。Apple SiliconでのMLX既定実行、対応モデル、decision modelsとembeddinggemma-2のMLX対応、v0.35.1からの変更点を解説。
COMPUTE / 06
llama.cppが2026年10月5日に公開した安定版v0.6.0をGitHubリリースノートの一次情報から整理する。llama_batch_ext拡張バッチAPI、GLM-5.3-Flash 320B・Clef・Qwen4Exp MTP投機デコーディングの新モデル対応、/v1/systemone decisionモデルAPI、Metal高速化、ggml v0.26.0を解説。
MODELS / 01
Ai2が2026年10月2日に科学レポート生成モデルAstaBrief 8Bをオープンウェイト公開。Qwen3-8B起点のSFT+DPO学習、SQABench-CS2・DeepScholarBenchでの評価、51.1秒 vs 178.5秒の速度比較、Hugging Faceでの公開内容を一次情報に基づき整理する。
MODELS / 01
Cloudflareが2026年10月1日に意思決定モデル「Clef」「Clef-flash」を公開した。Qwen3.8-27B/Qwen3.5-9Bをベースに後段学習したマルチモーダルモデルで、Workers AIでホストし、Hugging FaceでApache 2.0ライセンスとして公開。Jev API互換とベンダー公称のベンチマーク結果、新しい強化学習ファインチューニング基盤を一次情報に基づき整理する。
RESEARCH / 04
Hugging FaceがOpen TTS Leaderboardを2026年9月30日に公開。Seed TTS EvalとCV3 Evalを用い、WER/CER・RTFx・TTFA・話者類似度で多言語TTSと声クローンを評価。英語はKokoro-82Mらが上位、試聴・投票タブも備える。
MODELS / 01
AlibabaのQwenチームが音声モデル群Qwen-Audio-3.1を公開。Model Studioの公式ドキュメントで確認できたqwen-audio-3.1-realtime-plusの仕様と、2026年9月22日発効の音声系モデル値下げ通知の内容を一次情報中心に整理する。
PRODUCTS / 03
Hugging Faceが2026年9月22日に公開したTransformersのGGUF対応を整理。ggmlカーネルの再利用、Qwen3.5系からの対応、from_pretrainedとtransformers serveでの使い方、llama.cppとの速度比較、MPS限定などの制約を扱う。
RESEARCH / 04
Multiverse Computingが2026年9月21日にHugging Faceで公開したLLMブロック剪定のIsing定式化を一次情報に基づき整理。Hessianによる結合の扱い、tabu solverでの求解、低エネルギー励起状態の活用、Llama・Qwen・Nemotronでの結果を扱う。
MODELS / 01
Xiaomi MiMoが2026年9月22日にMiMo-V2.6シリーズ(Pro-RL約524B・Flash-RL約159B・Distill-Qwen-9B)をオープンソース公開。AA知能指数46点、6日間のLive RL訓練、DeepSWE v1.1の改善幅、再現用リソースの公開を一次情報から整理。
MODELS / 01
AlibabaのQwenチームが2026年9月20日に画像生成・編集モデルQwen-Image-2.1をオープンウェイト公開。70億パラメータの生成部、透過RGBA対応、最大10枚参照の編集、2K解像度、Qwen Research License、初日対応の推論基盤を一次情報から整理。
MODELS / 01
Alibaba Cloudが2026年9月18日更新のModel Studioドキュメントで音声・動画理解モデル「qwen3.8-omni-flash」を掲載。テキスト・画像・音声・動画入力、テキスト出力、100万トークンのコンテキストウィンドウ、既定有効のThinking、Function Calling・Web検索・キャッシュ対応、東京を含む6リージョンで提供。
MODELS / 01
Prism MLが2026年9月17日にBonsai 2 27Bを公開。Qwen3.8 27Bベースの27.8BパラメータTernaryマルチモーダルモデルで、5.9GB・フル精度比9倍超の省メモリ化と20ベンチマーク総合83.9(98.2%維持)を両立。RTX 5090で最大143トークン/秒、Apache 2.0で無償提供。
MODELS / 01
AllSpark-Researchが2026年9月に公開したオープンウェイト検索エージェントIris-mini/Iris-proを一次情報に基づき整理。Qwen系ベース、SFT-RL climbingによる学習、BrowseComp・HLE等の評価値、Iris-Harnessの同梱、Apache-2.0での重み公開を扱う。
COMPUTE / 06
vLLM v0.29.0が公開。Model Runner V2の全モデル既定化、新モデル対応、投機的デコーディングとRL重み同期の強化、破壊的変更などを整理。
MODELS / 01
AlibabaのQwenチームと華中科技大学が公開した自動運転向け視覚言語基盤モデルQwen-Drive-1.0を一次情報(GitHub・Hugging Face・技術レポート)に基づき整理。BEV知覚ヘッドと計画エキスパートの構成、NAVSIM・Waymo・NVIDIA PhysicalAIでの計画性能、運転VQAと汎用VQAの評価値を扱う。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年9月5日に安定版v0.5.19を公開。786件のPR・214名のコントリビューターによる大規模リリースで、ビームサーチ対応、DeepEP v2 ElasticBufferバックエンド、統合radix treeの既定化、LayerNorm系列並列、Hopper向けW4A8 MoE、Blackwell既定バックエンドでのDCP、AMD向けLean attention、Qwen3.8・Spark2.5・Granite 4.2など9モデルの新規対応を含む。
COMPUTE / 06
ローカルLLM推論エンジンllama.cppが2026年9月4日に安定版v0.4.0を公開。Qwen3.8-Flash-Next(qwen4exp)の初期アーキテクチャ対応、NVIDIA Nemotron-3-Puzzle-75B-A9BとNemotron 3.5のDSpark対応、遅延テンソル読み込み、スロット別コンテキスト上限、動画入力オプション、ggml v0.23.0(スパースflash attention・Apple RDMA)への更新を含む。
RESEARCH / 04
Hugging FaceのSergio Paniegoが、Surya Narreddi氏のウイルス動画「言語モデルがコードで描く水彩画」をTRLとOpenEnvで再現。p5.brushを用い、HPSv3とQwen3-VLによる pairwise judgeを組み合わせた報酬設計と、178枚の手作業プールを基に3通りの報酬配分で学習。学習レシピ、環境、データ、モデルを全てHubで公開。
RESEARCH / 04
Google ResearchとVirginia TechがAgent Skillsの進化に永続的なWiki層を導入するフレームワークWikiSkill(arXiv:2608.27454)を公開。Raw/Wiki/Skillの3層アーキテクチャとWiki Maintainer/Skill Proposer/Gatingのループで、実行トレースを構造化知識に編纂し再利用。5ベンチマークで既存手法を上回り、モデルスケールとの相補性やモデル間転移も確認。
COMPUTE / 06
CloudflareはAI SearchでWorkers AIの6つのテキスト生成モデルを新たにサポート。DeepSeek V4 Flash/Pro、gpt-oss 120B/20B、Qwen3.8-27B、Kimi K2.7 CodeがWorkers AI上でAPIキー不要で利用可能。
MODELS / 01
Alibaba Qwenチームは2026年8月26日、Qwen4アーキテクチャのプレビューとしてQwen3.8-Flash-Nextを公開した。マルチモーダル対応の125B MoE(アクティブ6B)で、Qwen Sparse AttentionやGated Residual、n-gram embeddingを導入。262Kネイティブコンテキスト(最大1M拡張)を備え、HFでオープンウェイト提供される。
PRODUCTS / 03
Hugging Face Transformers v5.16.0が2026年8月26日に公開。Qwen4-Exp、Granite Speech 5 Turbo CTC、Step-3.7-Flash、Cohere Compassの4モデルを新規追加。NVFP4量子化、パイプライン並列推論、DTensorベースのテンソル並列移行など基盤強化も実施。
BUSINESS / 05
Alibaba Groupは2026年8月23日、香港で総額800億香港ドルの新規普通株式のプレースメントを提案したと発表した。手取金の100%をフルスタックAI能力への投資、とりわけAIインフラの拡張・強化に充てるとし、グローバルなAIリーダーシップの拡張を目的と位置づける。米国外の非米国人向けのオフショア取引として実施し、完了は市況等の条件次第とした。
RESEARCH / 04
英Inherent Laboratoriesは2026年8月14日、27BパラメータのAI科学者エージェント「Faraday」を公開した。Qwen3.6-27Bをベースに、100本のML/AI-for-science論文から310の再現タスクで構成される新ベンチマーク「Replica」で長期間の強化学習を実施。論文付随の図を時間・計算資源の制約下で再現するタスクで、Claude Opus 4.8(Claude Codeハーネス)とGPT-5.5(Codexハーネス)を上回る精度を示したと報告。自動生成ルーブリックによるLLMジャッジで報酬を設計し、人手との一致度も検証している。詳細は公式研究ブログとarXiv論文で公開。
COMPUTE / 06
高性能LLMサービングフレームワークSGLangが2026年8月22日にv0.5.18を公開。710 PR・212 contributorsの大規模リリースで、Muse GlimmerやIntern-S2-Mobius、SANA-Videoなど7モデルを新規対応。Qwen3-32Bの起動を2.38倍高速化するオーバーラップ読み込み、DeepSeek-V4系のLMHead/AllReduce最適化、統合キャッシュディレクトリなど基盤改善を一次情報に基づき整理。
RESEARCH / 04
第三者のベンチマーク機関Artificial Analysisは2026年8月17日前後、Alibaba Qwen製の27Bオープンウェイトモデル「Qwen3.8-27B」の評価結果を公開した。インテリジェンス指標(9種の評価の複合)で52点を記録し、同指標でGPT-5.6 Luna(max)と同点、GLM-5.2(max)より1点低い水準。小規模なオープンウェイトモデルがフロンティア級のスコアに並んだ点が注目される一方、評価中の出力トークン数は160Mで中央値(43M)の約3.7倍と非常に冗長で、効率面の課題も明らかになった。数値は全てArtificial Analysis(一次情報)および同指標のデータに基づく。
RESEARCH / 04
arXiv:2608.11242。ペンシルベニア州立大学のZhiqi Wang氏らが、LLMシステムがコンテキストを圧縮(コンパクション)する際に「セッション制約(Session Constraints, SC)」が消失する問題を定量化した研究。3つの長期コンテキストシナリオ(マルチターンチャット・エージェント軌跡・長時間研究)で12種のコンパクタを評価した結果、注入したSCの平均保持率は17%で、多くのケースで圧縮なしより悪化した。SC認識抽出器(Qwen3.5-9Bベース)をコンパクタと並置するだけで全シナリオで90%超の保持率を記録した。評価スイートと実装はGitHubで公開。
COMPUTE / 06
Cloudflareは2026年8月17日、Workers AIにQwen 3.8 27Bを追加した。Alibaba QwenがApache 2.0で公開した27B密度型VLMが、エッジAI推論プラットフォームで利用可能になる。機能・料金・利用方法を一次情報(Cloudflare公式Changelog・モデルページ)に基づいて整理する。
RESEARCH / 04
Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。
MODELS / 01
Qwenチームは2026年8月13〜14日、27B密度型のネイティブVLM「Qwen3.8-27B」の重みをApache 2.0ライセンスでHugging Faceに公開した。仕様、ベンチマーク公称値、ライセンス、提供状況を一次情報に基づいて整理する。
RESEARCH / 04
Hugging Faceが2026年8月14日、半年に一度のオープンモデル生態系レポート「State of Open Models: Summer 2026 Observations」を公開した。フロンティアの重心移動、注目と採用の乖離、ライセンス戦略、Qwenエコシステムの拡大、エージェントトラフィックの急増など、Hub上のデータに基づく観察を一次情報に基づいて整理する。
MODELS / 01
Qwenが初めてMax級モデル「Qwen3.8-2.4T-A95B」をオープンウェイトで公開した。テキスト専用・思考必須という位置づけや、新設ライセンス「qwen3.8-max」の条件を一次情報に基づいて整理する。