NVIDIAのSANA-Video 2.0は、ソフトマックスアテンションを3対1で線形アテンションに置き換えるハイブリッド設計を採用。VBench 84.30を維持しつつ720pのDiT前向き計算を3.2倍高速化し、単一H100で13.2秒生成を実現した仕組みを解説します。
AnthropicがClaude Opus 5を公開しました。Fable 5級の性能を半額で提供し、Frontier-Benchで前世代の2倍を記録。拒否時に旧モデルへ切り替える自動フォールバック機能も解説します。
RoPEの周波数を反周期的に設計し系列の両端をメビウス境界条件で結ぶ新手法Möbius RoPEを解説。ニードル検索の精度を文脈長512で63.3%から90.3%へ高め、乱数シードによる性能のばらつきを解消します。
米トランプ政権が中国製オープンウェイトAIモデルの禁止を検討しています。Kimi K3の蒸留疑惑を発端に、NvidiaやMistralなど業界6社が広範な規制に反対する公開書簡を提出した経緯と論点を解説します。
拡散モデルの画像生成にLLM流の推論時スケーリングを持ち込む新手法Progressive Seed Pruningを解説します。多数のシードを初期段階で評価して有望な候補へ計算を集中させ、同じ予算でGenEvalと人手評価の両面でBest-of-Nを上回ります。
OpenAIやAnthropicの安全ガードレールが脆弱性研究など正当な防御作業まで拒否し、研究者が制限のない中国製モデルGLMへ流出しています。NCC Group等の実名証言からAI安全対策の逆説的な副作用を解説します。
複数条件を満たす答えを探すディープリサーチ向けに、調査ループと自己改善ループを交互に回すエージェントAREXが登場。4Bと122B-A10Bの2モデルでBrowseComp 82.5%を達成した仕組みを解説します。
MicrosoftがGitHub CopilotとExcelに自社AI「MAI」を本格投入しました。コード採用率はGPT-5.4 Mini比で約10%高く、トークン消費は約10%少ないという数値の意味を解説します。
物体間の関係を表す相互作用グラフを制御入力とする画像から動画生成モデルGraphVidを解説します。Motion-I2V比でFIDを最大39.9%削減し、多物体の相互作用を精密に制御する新手法の仕組みと成果を紹介します。
OpenAIがChatGPTに医療記録とApple Healthを接続する機能「Health」を米国で提供開始しました。対象プランや接続できるデータ、学習・広告への不使用方針、1月の試験提供からの変更点を解説します。
自己回帰動画拡散の訓練に潜む勾配の欠落を突き止め、2パス訓練で解決したSelf Gradient Forcing(SGF)を解説します。5秒の学習だけで240秒の動画を破綻なく生成する仕組みと実験結果をまとめました。
ワールドモデル(世界モデル)とは何か、LLMとの違いや仕組みを図解で解説。V-JEPA 2・Dreamer 4・Genie 3・Cosmosなど主要モデルの特徴と、実用化を阻む課題まで整理します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
AIのイエスマン化が人間に悪影響、スタンフォード・CMU研究が実証
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム