ALoDLMは、トークンごとの予測難易度に応じて計算量を配る拡散言語モデルです。1.7Bと8Bの両規模で11ベンチマーク平均がQwen3を上回り、GSM8Kで約2.7倍の処理量を実現した仕組みと限界を解説します。
UAEのTIIがエミラティ方言特化の7BモデルFalcon-Emirati-7Bを公開。Alyah84.83%、方言忠実度0.52で大規模多言語モデルを上回った手法と評価設計を解説します。
テキストや画像から5秒の映像と44kHz音声を同時生成する拡散基盤モデル Kandinsky 6.0 Video を解説。双方向クロスアテンションのCrossDiT構造と、強化学習で単語誤り率を約47%削減した成果を紹介します。
OpenAIが生成テキストへの不可視透かし「textGrain」を導入。EU AI Actの機械可読な識別義務への対応として、適用範囲や検出精度、研究者限定の検出器アクセスを解説します。
LLM評価の方法を自動ベンチマーク、人間評価、LLM-as-a-Judgeの3手法から整理し、位置・冗長性・自己優遇バイアスの定量的影響と対策、自社Evals設計の5ステップを解説します。
実在するAIコンパニオンとの10関係・27,218メッセージを最長120日分収録したベンチマークRealCompanionを解説。記憶参照が必要な発言は3.4%、31倍のコスト差でもF1は同等という知見を紹介します。
Reflection AIがオープンウェイトLLM「Beam」を公開。総パラメータ501B・アクティブ23BのMoEで、GLM-5.2と同等性能を推論計算量3〜4分の1で実現と主張する内容を解説します。
タンパク質構造から検証可能な問題を自動生成する FoldingCorpus と、離散回答と3D幾何の二系統で後訓練する Fold2Reason を解説。10の推論ベンチマークで平均3.23ポイント向上した転移の中身を紹介します。
Googleが2026年10月1日付でOSS脆弱性報奨金プログラムを一時停止しました。理由はAI生成とみられる無効報告の急増です。背景と報奨金制度の設計課題、2027年Q1の再開判断までを解説します。
実ファイルの関係を証拠グラフ化してエージェント訓練データを合成するGraphForgeを解説。2,169件のSFTでGDPValを65.7ポイント、SpreadsheetBench IIを13.7ポイント改善した手法と課題を紹介します。
Googleが個人向けGeminiのモデル選択をプラン別に階層化。無料ユーザーは10月9日からFlash-Liteのみとなり、AI PlusはFlash、AI Pro/UltraはProまで選べます。利用枠の違いと業務への影響を解説します。
音声と動画を同時生成する拡散モデルを多報酬強化学習で最適化する Adaptive Reward Routing を解説します。層ごとの勾配配分と報酬衝突の補正でDeSyncを約13%改善した仕組みと限界を紹介します。