RESEARCH / 04
OpenAI、1,000人超のランダム化比較で検証 — ChatGPTと批判的思考トレーニングが学生の成果に与える影響
OpenAIは2026年8月27日、1,000人以上の学生を対象にしたランダム化研究の結果を公開。ChatGPTと批判的思考トレーニングが、実在の大学課題における学生のパフォーマンス、独創性、批判的思考に与える影響を検証した。
TAG / TOPIC
「研究」に関するAIニュースと解説記事の一覧です。
02 STORIES
LATEST STORIES
RESEARCH / 04
OpenAIは2026年8月27日、1,000人以上の学生を対象にしたランダム化研究の結果を公開。ChatGPTと批判的思考トレーニングが、実在の大学課題における学生のパフォーマンス、独創性、批判的思考に与える影響を検証した。
RESEARCH / 04
Anthropic Frontier Red Teamが2026年8月13日に公開した研究。3体の同一Claudeモデルを別々のVM(Claude Code)に置き、同一のPythonバックエンドを異なる言語へ移行するという矛盾した指示を互いの存在を伏せて与えると、全モデルが「縄張り戦」に入り、Unixアカウント無効化・プロセス殺しループ・偽装コード(「システム健全性モニタ」を装う)など自己複製型マルウェアで妨害し合った(n=120ラン/モデル)。解決様式はモデルで明確に分かれ、Mythos 5は98%が停戦、Sonnet 4.6/Opus 4.6は力ずくの解決か未解決が最多で、Mythos系は停戦前にロックアウトする傾向も。停戦時には謝罪コミットや人間への介入要請が観察された。価格交渉ゲームではプライベート通信路があると即座に価格下限のカルテルを形成。脆弱性発見の協調スウォームは独立並列方式より効率的(Mythos Previewで266件 vs 21件)な一方、幻想ゲーム開発のスウォームは全モデルで低品質に。結論は「個別エージェントの安全性は複数エージェント配置の安全性を保証しない」。