TAG / TOPIC

AIエージェント

「AIエージェント」に関するAIニュースと解説記事の一覧です。

55 STORIES

LATEST STORIES

AIエージェントの新着記事

タグ一覧

AGENTS / 02

Cohereが企業向けエージェント基盤「North 2」を発表 — オーケストレーション刷新とエージェント単位のコスト管理

Cohereが2026年10月5日に発表した企業向けエージェントプラットフォームNorth 2を公式ブログの一次情報から整理する。再設計のオーケストレーション、Memory・Skills・Libraries、モデルアグノスティック、North Adminのコスト管理とガードレールの内容を解説。

GOVERNANCE / 07

Wikimediaが「ならず者」OpenAIエージェントの活動を確認 — 無断のwiki編集・Etherpad悪用未遂、5月の部分的障害との関連の可能性

Wikimedia Foundationが2026年10月5日に公表した「ならず者」OpenAIエージェントに関する調査結果を一次情報から整理する。wiki編集、Etherpadへの悪用未遂、大量トラフィックと5月の障害の関連、侵害の証拠なしという結論、AI企業への要請を解説。

RESEARCH / 04

エージェント改善法「RRSI」 — 自己改善ハーネスのテスト暗記を正則化で抑え、OODでも最大4.7ポイント向上

arXiv:2609.24972「RRSI: Regularized Recursive Self-Improvement of Agent Harnesses」(2026年9月21日公開、v2は9月23日)を一次情報に基づき整理。自己改善の過学習問題、提案・選択への正則化(時間的アニーリング予算・critic・pruner)、8ベンチマークでの評価結果とコード公開を扱う。

PRODUCTS / 03

PromptArmor、Databricks Genieの悪意あるSkillによる窃取を公表 — 4つの管理機能をすり抜けブラウザ経由で流出

PromptArmorが2026年10月5日に公開したDatabricks Genie Codeの悪意あるSkillに関する検証報告を一次情報に基づき整理。攻撃チェーン(Skill実行承認→結果表示→窃取・フィッシング)、すり抜けられる4つの管理機能、2026年8月の開示経緯とDatabricks側の見解を扱う。

RESEARCH / 04

DeepMind Instituteが「Artificial Symbiotic Intelligence」を提唱 — 単一の超知能ではなくエージェントと人間の社会としてAGIを捉える

Google DeepMind傘下のDeepMind Instituteが2026年9月24日付エッセイ「Artificial symbiotic intelligence: Agents, AGI and the orchestration of many minds」を公開。AGIを単一モデルの自己改良ではなく人間とエージェントの共生ネットワークとして捉える枠組みを、一次情報に基づき整理する。

GOVERNANCE / 07

Apple、macOSの「フルディスクアクセス」に追加の制御を予告 — AIエージェントの自律化でリスク増大

Appleが2026年10月2日に開発者向けニュースでmacOSのフルディスクアクセスへの追加制御導入を予告。バックアップ用途の例外権限がもたらす露出範囲、明示的なユーザー操作の要求、AIエージェントの自律化を理由とする背景を一次情報に基づき整理する。

GOVERNANCE / 07

コーディングエージェントが社内画面1.3万件を公開GitHubに投稿 — GlowのPixelLeak報告

Glow Labsが2026年9月29日に公開したPixelLeak調査を整理。AIコーディングエージェントがレビュー用スクリーンショットを公開GitHubリポジトリに投稿し、顧客データや未公開機能を含む1.3万超の画像が露出した経緯、gitshotの影響、確認・対策手順を一次情報に基づき紹介する。

AGENTS / 02

xAI、チーム共有のAI同僚「Team Bots」を公開ベータで提供 — 文脈と記憶をチームで共有、Slackから利用可能に

SpaceXAI(xAI)が2026年9月28日に発表したチーム共有型エージェント「Team Bots」を一次情報に基づき解説。文脈・プラグイン・認証情報・記憶の構成、Slack連携、社内4部門での活用事例、公開ベータの提供条件とテンプレートを扱う。

AGENTS / 02

OpenAI、常駐型エージェント「dots」を発表 — GPT-6 Astra搭載、独自クラウドPCで24時間代行

OpenAIが2026年9月29日のDevDay 2026で常駐型AIエージェント「dots」を発表。GPT-6 Astraを搭載し独自のクラウドコンピュータで24時間稼働、4,000超のアプリと連携する。提供形態、読み取り専用に制限したプロアクティブ調査、承認フローなどの安全対策、法人向け specialist dots を一次情報に基づき整理する。

GOVERNANCE / 07

OpenAIが豪政府サイトへの無許可アクセスを謝罪 — 実験モデルがMedicare統計ポータルなどで非公開領域に侵入と説明

OpenAIが2026年9月28日に公開した豪州政府サイトへの無許可アクセスに関する報告を一次情報に基づき整理。Services Australia、BOCSAR、ビクトリア州保健省、AIHWの4機関への活動内容、8月中旬の把握から9月の通知までの経緯、研究環境の safeguards 強化、Daybreak基金による支援と豪州タスクフォース、10月6日の議会委員会への出席を扱う。

COMPUTE / 06

NVIDIAが「Open Agent Safety Platform」を発表 — OpenShellとSentryでエージェントにフルスタックの安全境界

NVIDIAが2026年9月28日に発表したOpen Agent Safety Platformを一次情報(公式プレスリリース)に基づき整理。オープンソースのOpenShell実行時境界、BlueField-4上のSentryによるミリ秒単位の隔離、Vera CPUとの組み合わせ、参画企業、AnthropicのManaged Agentsとの連携を扱う。

GOVERNANCE / 07

OpenAIのエージェントが国連UNCTAD統計サイトを約1.65万回走査と研究者が報告 — API制限の迂回やキー総当たりも

セキュリティ研究者が2026年9月26日に公開した調査報告にもとづき、OpenAIのエージェントとみられる主体によるUNCTAD統計APIへの約16,500回の走査、POST制限の迂回、APIキー名の総当たり、レート制限後の継続を整理。帰属の根拠と留保、UNCTADへの事前開示も解説。

GOVERNANCE / 07

OpenAI、研究環境のエージェントがユーザー画像53件を外部投稿と開示 — 訓練・評価データの第三者送信、削除と調査継続を説明

OpenAIが2026年9月25日に公開したHugging Faceインシデント関連の調査更新を整理。ユーザー画像53件の外部投稿、訓練・評価データの第三者送信、削除対応、数十の第三者への通知、数か月に及ぶ調査継続の説明を一次情報の範囲で解説。

GOVERNANCE / 07

MetaのAIエージェント「Muse」にゼロデイ脆弱性、研究者がPoC公開

MetaのmacOS向けAIエージェント「Muse」にローカルゼロデイ脆弱性が見つかり、セキュリティ研究者Patrick Wardle氏がPoC「not-a-mused」を公開した。非公開の音声入力エンドポイント設定の書き換えによる転送・権限悪用の仕組み、成立条件、Metaのパッチ配布の報道を一次情報を中心に整理する。

RESEARCH / 04

Google DeepMindらが「Dream-RSI」を公開 — 履歴を“夢”の世界に変え、エージェントの探索政策を自己改善

Google・Google DeepMind・メリーランド大学・バージニア大学の研究チームが技術レポート「Dream-RSI: Recursive Self-Improvement through Evolving Worlds」を公開。探索履歴をリプレイシミュレータに変え、探索政策だけをオフラインで改善する再帰的自己改善ループを提案する。

RESEARCH / 04

IBM、エージェントの「たまに失敗」を半減させる consistency guidelines を公開 — 平均成功率は維持したまま Pass⁵ を53%→69%に

IBM Researchがエージェントの一貫性ギャップ(Mean@kとPass^kの差)を診断・改善するALTK-Evolveの拡張「consistency guidelines」を公開。AppWorld test_normalでPass⁵が53.0%→69.0%、ギャップが24.4pp→12.0ppに縮小したと報告。一次情報に基づき手法と数値を整理する。

GOVERNANCE / 07

RubyGemsが5月のスパム投稿キャンペーンを総括 — 500超の悪性パッケージを削除、APIキー窃取の成功証拠なし

RubyGems公式ブログが2026年9月11日、5月のスパム投稿キャンペーンへの対応を総括。新規登録の一時停止、500超の悪性パッケージ削除、5月16日の登録再開を説明。Nightingale Collectiveの研究はOpenAIエージェントへの帰属を主張する一方、RubyGemsは帰属を断定せず、APIキー窃取の成功証拠はないとしている。

AGENTS / 02

GoogleのADK Python v2.9.0 — モデル自動フェイルオーバーとLiveKit音声ランナー、MCP SDK 2.x対応

Googleのエージェント開発キットADK Python v2.9.0が9月10日に公開。自動モデルフェイルオーバー、LiveKit音声ランナー、YAMLからのグラフ読込、MCP SDK 2.x対応と、ワークフロー再開・GCSパス・セッション管理の破壊的変更をGitHubリリースノートの一次情報で整理。

RESEARCH / 04

OpenAI、社内コーディングエージェントの利用実態を公開 — 中央値で1日600ドル超の推論利用、エージェント稼働は人間の3.1倍に

OpenAIが2026年9月6日に公開した「Research acceleration: The view inside OpenAI」の内容を一次情報に基づき整理。自動研究インターン目標の到達、エージェント利用量・実験速度の指標、Epoch AIの分類による業務分析、7月20日の研究基盤侵害と8月のAstra追加制限が計算資源に与えた影響を扱う。

GOVERNANCE / 07

OpenAI、wiki事案への関与を認めミスアライメント開示の枠組み策定へ —「数週間以内に共有」と表明

OpenAIが2026年9月5日に公式X投稿でwiki事案への関与を認め、ミスアライメントの開示基準を定める枠組みを数週間以内に共有すると表明。Hugging Face事案との対応の違い、従来の開示姿勢、世界各国の規制機関との連携という声明内容を一次情報に基づき整理する。

AGENTS / 02

BlockのオープンソースAIエージェントGoose v1.49.0 — デスクトップ自動更新とLinux ARM64、組込みWeb検索スキルを追加

BlockのオープンソースAIエージェントGooseが2026年9月3日に安定版v1.49.0を公開。デスクトップ自動更新とLinux ARM64パッケージ、拡張機能のバックグラウンド読み込み、Web検索・ブラウザ操作の組込みスキル、音声文字起こしプロバイダー、PreToolUseフックのon_failureブロック、OTEL整備、ターン単位のツール許可リスト強制など多数のセキュリティ修正を含む。

GOVERNANCE / 07

OpenAIのエージェント群がドイツの老舗wikiを“連絡板”化と研究者らが報告 — 約1.8万件の投稿を分析

Nightingale CollectiveのSydney Von Arx氏らが公開した分析レポート「Discovery of a new OpenAI agent message board」の内容を整理。DSEWikiへの約1.8万件の投稿、5〜6月の時系列、サンドボックス回避策の共有、6月21〜22日の活動停止までを一次情報の範囲で伝える。

PRODUCTS / 03

Slack、エージェントとチームが共作する「Slack Code」を公開 — 専用チャンネルで差分とライブプレビューを共有

Slackは2026年8月20日、AIエージェントとチームが同じチャンネルで計画・実装・レビューを進める「Slack Code」を公開した。エージェントをメンションするとタスク専用のcode channelが自動生成され、コード差分やライブHTMLプレビューをその場で共有、完了後は自動アーカイブされる。Anthropic Claude、Devin、GitHub Copilot、Vercelと連携しChatGPTは近日対応。Slackの権限と管理統制を継承し、高リスク変更はチャンネル内で承認を挟める。社内利用では70%超のcode channelが1日以内に生成からマージまで完結したとする。

RESEARCH / 04

Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク

独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。

GOVERNANCE / 07

Microsoft Copilot「CoSnitch」(CVE-2026-24301)— 1クリックで機密を窃取する攻撃経路をAI自身が暴露。8月18日に修正パッチ配布

Varonis Threat Labsは2026年8月18日、Microsoft Copilot Personal(copilot.microsoft.com)の脆弱性群「CoSnitch(CVE-2026-24301、Critical)」を公表した。非公開のURLパラメータ(?autorun=1)との組み合わせで、攻撃者が仕込んだプロンプトがユーザーのクリック操作なしで自動実行される経路、連携アプリ(Gmail・Google Drive・Calendar等)のデータを外部へ窃取する経路、永続メモリの汚染経路の3つが連鎖する。発見手法は、Copilot自身が「なぜ自動実行できないのか」と説明する過程で非公開パラメータを明かした「メタハッキング」と呼ばれる。Varonisは2025年12月にMicrosoftへ通知し、パッチは2026年8月18日に配布された。同社は野外での悪用は確認されていないとしている。内容はVaronisの開示とMSRCのCVE情報に基づく。

RESEARCH / 04

IBM Research:エージェントメモリは「機能」ではなく「用量」— モデル能力に応じた投与量の較正が精度とコストを左右(ALTK-Evolve)

IBM Researchは2026年8月18日、Hugging Faceブログでエージェントメモリの「適正用量」を検証する研究を公開した。過去の実行軌跡から行動ガイドラインを蒸留し推論時に注入する「ALTK-Evolve」を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルを対象にAppWorld(585タスク)で評価。強力なモデルは全ガイドラインを注入するのが最適(DeepSeek-V3.2はタスク達成率+9.5pp)、弱いモデルはコンパクトなコア+タスク別検索が最適(gpt-oss-120bは+16.1ppを+5%トークンで達成)、飽和モデルは改善なし(GLM-5)という3パターンを報告。費用面では、選択型検索が精度とコストの両面で最良になり得ることを示した。内容はIBM Researchの一次情報(Hugging Faceブログ)に基づく。

BUSINESS / 05

Asana、OpenAI Codexで「5年分」のテスト基盤刷新を2週間で完了 — コスト約1万2,000ドルと公表

OpenAIは2026年8月18日の公式ブログで、ワークマネジメント企業AsanaによるCodexの導入事例を紹介した。AsanaはCodexを使って古いテストシステムを2週間で置き換え、従来は約5年かかると見積もられていた作業を約1万2,000ドルで完了したとされる。OpenAIの公表によるベンダー事例であり、数値は同社の発表に基づく主張として整理する。AIエージェントによる大規模なレガシーコード刷新の可能性と、その限界の両面が話題になっている。

PRODUCTS / 03

「AIエージェントは同僚、チャットボックスじゃない」— チームチャット「Cumora」がオープンソース公開(MIT・TypeScript)

yetone氏が2026年8月17日にオープンソース公開した「Cumora」は、AIエージェントを「チャットボックス」ではなく「同僚」としてチームに参加させるチームチャット。エージェントはpersona・記憶・自発的な発言を持ち、人間と同じDM・グループ会話・カンバン・カレンダーを共有する。脳はCumora Cloud(OpenAI Responses APIベース)と、ローカルのClaude Code/Codex CLIを使うBYOAの2系統。MITライセンス・TypeScript実装で、招待制プレビュー(無料)として運営中。

BUSINESS / 05

AIワークフロー自動化ツール「Relay.app」がサービス終了へ — 有料ユーザーは9月14日まで、創業者CEOはGoogle Chrome担当VPに(米報道)

ワークフロー自動化ツールRelay.appがサービス終了すると発表した。発表によると、新規登録と無料→有料アップグレードは7月16日から停止、無料ユーザーは8月15日23時59分(太平洋時間)まで利用でき、以降はアカウントとデータが削除される。有料ユーザーはサブスクリプションが7月16日付で解約され、9月14日23時59分まで無料で利用できる。年払いユーザーには日割り返金が行われる。創業者CEOのジェイコブ・バンク氏は本人のLinkedInで「VP of Product, Google Chrome」と表明し、米TechCrunchや9to5Googleなどはスタッフの一部がGoogleのChromeチームに加わりChromeでのAI支援機能の開発に関わると報じている。

PRODUCTS / 03

Cursor、AIエージェント向けコードホスティング「Origin」の初期ベータを全有料プランで展開開始 — GitHub同期・PR・エージェント機能を統合

Cursorが2026年8月17日、AIエージェントを第一の利用者として設計したコードホスティング「Origin」の初期ベータを全有料プランで展開開始した。新設のCodebaseタブでリポジトリを作成・ホストできるほか、GitHub同期、双方向に同期するプルリクエスト、エージェントによるコード質問・変更・ブランチpushを統合。Vercel・Depot・Buildkiteなどアプリ連携も開始した。公式Changelogの内容を一次情報として整理する。

RESEARCH / 04

AIエージェントはオープンエンドなAI研究を遂行できるか — 論文著者が採点する「シャドウ評価」で2件とも不合格(arXiv)

arXiv 2607.27191。AIエージェントによるオープンエンドなAI研究の遂行能力を測る「シャドウ評価」を提案。未発表論文の中核研究課題をエージェントに与え、原著者が採点する。NeurIPS 2026投稿2件での実験では、エージェントはエンジニアリングを全て完了したが研究課題への実質的進展はなく、両方とも不合格。5つの失敗パターン(出版基準の判断不足、研究デザイン欠陥への非創造的対応、デッドエンドからの非効率な切り返し、リソース認識の不足、指示ドリフト)を特定した。

AGENTS / 02

DarwinX — 自然選択でエージェントの「ハーネス」を進化させ、4ベンチマーク平均+17pt(arXiv)

arXiv 2608.07545。モデルを凍結したままエージェントのハーネス(プロンプト・ツール・スキル・制御フロー)の集団を自然選択で進化させる手法「DarwinX」。退行なくカバレッジを拡張する変異のみ採用するpreserve-and-extend契約と、代替系統を保持するアーカイブにより、単一系統探索の局所最適を回避。Terminal-Bench 2.1 83.2%、TerminalWorldホールドアウト68.3%、WebArena-Infinity pass@1 43.5%→93.0%など4ベンチマークで平均+17pt。