音声生成、内容編集、強調分離、パラ言語編集、音響編集の5タスクを自然言語指示で統一的に扱う基盤モデルAuKを解説。195万時間の学習データと4.5倍高速な蒸留版の性能を紹介します。
複数モデルのルーティング記録を事後学習データに変える「NeoHorse-1」を解説。サブシーン分割と6観点評価により、11ベンチマーク平均で4Bが58.94→64.87、9Bが65.60→69.04に改善しました。
GoogleのMaxKernelは、計画・実装・デバッグ・計測を分担するLLMエージェント群がTPUカーネルを自動生成する枠組みです。JaxBenchで1.58倍、実モデルでは専門家の手動実装を上回る成果を解説します。
LLMの重みを自己回帰重みと拡散重みに分離する新手法Unoを解説。サンプラー族Ψ-Specによりドラフトモデルなしで出力を変えずに最大3倍高速化し、8Bで26Bモデルを上回った成果を紹介します。
Cerebrasらが2,400回超の実験で、LLM事前学習にレイヤードロップアウトを使うべきと実証。訓練FLOPsを最大25%削減し、early exitや自己投機的デコーディングで推論を最大1.55倍高速化する手法を解説します。
音声対話モデルの隠れ状態から全身モーションを直接生成するMotion-Omniを解説します。単語誤り率2.62%を保ちつつ、教師カスケード比で応答を5.4倍高速化した仕組みと実験結果を紹介します。
長文脈を連続メモリトークンに圧縮する新手法 LatentPress を解説。LongMemEval で 7.70 倍圧縮時に精度 0.504 と無圧縮の 0.490 を上回り、読み込みは 5〜9 倍高速化しました。
Salesforce AI ResearchらのRandom Attentionは、KVキャッシュをスコア計算なしでランダムに追い出すだけで既存手法と同等精度を保ち、vLLMで32〜43%高速化。仕組みと限界を解説します。
エージェントの行動履歴からファイル操作を再生し実行可能なターミナル環境を3.73万件合成する新手法Terminal-Universeを解説。Qwen3.5-27BでTerminal-Bench 2.1が+11.9ポイント向上しました。
VAE潜在空間を使わずピクセル空間で直接学習するテキスト画像拡散モデルの訓練レシピを解説します。潜在拡散と同等以上の品質を保ちつつ、推論を最大4.75倍高速化した最新研究の要点を紹介します。
上海AI Labが知識を蓄えるFFNと推論を担うSelf-Attentionを分離した新アーキテクチャMobiusを提案。7Bは学習データ62.6%でTransformer同等、35BのIntern-S2-Mobiusは約4倍の推論高速化を実現しました。
戦争や災害のAI生成フェイク動画に特化した検出ベンチマーク「RA-Bench」を解説します。実動画と生成動画あわせて1.8万本で各種検出器を検証し、精度がほぼ偶然並みに低下し、SNS拡散でさらに悪化する実態を明らかにしました。