線形アテンションの再帰状態を4bit量子化する新手法STEPQuantを解説。誤差の寿命と位置に応じた精度配分で、Qwenの長文精度80.51%を維持しつつ総サービングメモリを68.7%削減しました。
GoogleがGeminiを目標ベースで動くAIエージェントに拡張すると発表。サブエージェント委任、タスクインボックスでの過程可視化、Claude選択、専用Workspaceアカウントまで解説します。
NVIDIAらのLong-WAMは、ロボット制御の視覚履歴を19.2秒まで拡張しRoboCasa GR-1で63.3%から78.7%へ改善。RTX 5090で107.4msの実時間制御を実現した手法を解説します。
Anthropicが小型モデル Claude Haiku 5.5 を公開しました。前世代比で利用コスト約75%減、Haikuクラス初のeffort設定対応、ベンチマーク結果と安全性の課題を解説します。
凍結したLLMの内部表現から検索クエリを作り、コーパス検索と長文脈推論を1モデルで扱うUNREALを解説。追加50万パラメータ未満でHotpotQA再現率を49.1%から73.2%へ改善しました。
OpenAIがGPT-6をChatGPTの全ユーザーへ展開しました。応答を図表や操作できるUIで返す「Intelligent UI」の仕組み、プラン別のモデル、44%の応答高速化と安全性の更新点を解説します。
Qwenチームの論文TRACEを解説します。ロールアウト側の量子化結果で学習側の丸めを誘導し、重み・活性化・KVキャッシュをすべてFP4にしてもBF16同等のRL性能を保ちながら最大5.4倍の高速化を実現した手法です。
Mistralが総パラメータ1兆500億、アクティブ490億のMoEモデル「Mistral Large 4」を発表。100万トークン文脈や公表ベンチマーク、10月末のオープンウェイト公開計画を解説します。
ALoDLMは、トークンごとの予測難易度に応じて計算量を配る拡散言語モデルです。1.7Bと8Bの両規模で11ベンチマーク平均がQwen3を上回り、GSM8Kで約2.7倍の処理量を実現した仕組みと限界を解説します。
UAEのTIIがエミラティ方言特化の7BモデルFalcon-Emirati-7Bを公開。Alyah84.83%、方言忠実度0.52で大規模多言語モデルを上回った手法と評価設計を解説します。
テキストや画像から5秒の映像と44kHz音声を同時生成する拡散基盤モデル Kandinsky 6.0 Video を解説。双方向クロスアテンションのCrossDiT構造と、強化学習で単語誤り率を約47%削減した成果を紹介します。
OpenAIが生成テキストへの不可視透かし「textGrain」を導入。EU AI Actの機械可読な識別義務への対応として、適用範囲や検出精度、研究者限定の検出器アクセスを解説します。