Tencent HY Teamが提案するHiLS-Attentionは、LM損失でチャンク選択を学習するスパース注意機構です。訓練長8Kから512K(64倍超)への外挿で90%超の検索精度を維持し、推論速度は全注意比最大15.7倍になります。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
ロボットの実機評価コストを削減する動画世界モデルの活用法を体系的に研究。7種のモデル・32万件超のロールアウト分析から、実世界との一致には「映像美」より「長期アクション忠実度」が重要と実証しました。
スコアリングトークンのlogit分布から連続スコアを算出し、検証を第三のスケーリング軸とする汎用フレームワーク。SWE-Bench Verified 78.2%・RoboRewardBench 87.4%など複数領域でSOTAを達成します。
NVIDIAが提案するAudexは、音声認識・翻訳・TTS・音声生成を単一のTransformerに統合しながらLibriSpeech test-cleanでWER 1.4%を達成。Cascade強化学習とオンポリシー蒸留でテキスト推論能力の劣化を防ぐ設計を解説します。
FLUX.1・Wan 2.1など主要な拡散モデルを、サンプルデータ不要でW4A4・W2A4量子化する手法OrbitQuantを解説します。RPBH変換で活性化分布を安定化し、W2A4で唯一実用的な出力を維持した点が大きな特徴です。
LLM強化学習の根本的問題「目標不一致」を初めて体系化。訓練ではなく推論ポリシーの単調改善を保証するMIPI原則とアルゴリズムMIPUを提案し、PPO・GRPOの設計方針を再考させる重要研究。
LLMエージェントの長期タスクでコンテキストが肥大化する問題に対し、3層の有界メモリと型付き検索で解決するAgenticSTSを解説します。Slay the Spire 2上のベンチマークでエージェントの勝率を3/10から6/10に改善しました。
LLMエージェントのメモリ管理を「学習可能な認知スキル」として定式化したAutoMemフレームワークを解説します。スキャフォールド最適化と習熟度トレーニングの2段階で、Qwen2.5-32BモデルがClaude Opus 4.5と同等水準に達しました。
ロボットVLAモデルの専門家データ不足を解決する2段階事前学習「TAP」を解説。失敗軌跡も含む未ラベルデータで動作スキルを先習得し、行動模倣学習比+10%の向上とカメラ擾乱下25%の成功率を達成しました。
LLMが3D軌跡とカメラ動作を計画し、画面外に消えたオブジェクトを正確に再現する「永続的動的オブジェクトメモリ」を備えたビデオ世界モデル「WorldDirector」を解説します。PSNRで18.1を達成し、既存手法を大幅に上回りました。
強化学習で視覚生成モデルを改善する際に生じるモードコラプスを、生成分布全体を評価するDistribution-wise Rewardで解決する手法をICML 2026論文が提案。SiTモデルでFID-50Kを8.30から5.77に改善しました。
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
Qwen-AgentWorldとは?LLMを環境シミュレーターに変換するエージェント向け言語世界モデル
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム
AIのイエスマン化が人間に悪影響、スタンフォード・CMU研究が実証