Reflection AIがオープンウェイトLLM「Beam」を公開。総パラメータ501B・アクティブ23BのMoEで、GLM-5.2と同等性能を推論計算量3〜4分の1で実現と主張する内容を解説します。
タンパク質構造から検証可能な問題を自動生成する FoldingCorpus と、離散回答と3D幾何の二系統で後訓練する Fold2Reason を解説。10の推論ベンチマークで平均3.23ポイント向上した転移の中身を紹介します。
Googleが2026年10月1日付でOSS脆弱性報奨金プログラムを一時停止しました。理由はAI生成とみられる無効報告の急増です。背景と報奨金制度の設計課題、2027年Q1の再開判断までを解説します。
実ファイルの関係を証拠グラフ化してエージェント訓練データを合成するGraphForgeを解説。2,169件のSFTでGDPValを65.7ポイント、SpreadsheetBench IIを13.7ポイント改善した手法と課題を紹介します。
Googleが個人向けGeminiのモデル選択をプラン別に階層化。無料ユーザーは10月9日からFlash-Liteのみとなり、AI PlusはFlash、AI Pro/UltraはProまで選べます。利用枠の違いと業務への影響を解説します。
音声と動画を同時生成する拡散モデルを多報酬強化学習で最適化する Adaptive Reward Routing を解説します。層ごとの勾配配分と報酬衝突の補正でDeSyncを約13%改善した仕組みと限界を紹介します。
MicrosoftとHugging Faceが公開したThinkingBoxは、応答文ではなくDBの終了状態でエージェントを評価し、同一タスク20回で再現性を測ります。失敗要因の内訳とモデル別成績を解説します。
連続潜在を生成の主状態に据えた階層型拡散言語モデルHC-DLMを解説。並列デコードでトークン依存が壊れる課題を単一の降ノイズ過程で解決し、Countdownで37.52%、LM1Bで生成パープレキシティ75.5を達成しました。
OpenAIが公開したGPT-6ファミリーの実践ガイドを解説します。Astra、Sol、Lunaの使い分け、reasoning effortの4段階、プロンプトとスキルの調整、長時間タスクの最適化まで指針を整理しました。
事前学習済みTransformerは文脈内の参照を1.4〜3.6行しか辿れないという欠陥を特定し、全重み凍結のままrank-8 LoRAを浅い層に1枚挿すだけでQwen3-8Bの24行連鎖精度を15.5%から99%へ改善した研究を解説します。
Metaがパーソナルエージェント「Muse」と連携する自作ガジェット向けSDKをApache 2.0で公開しました。ESP32とRaspberry Pi対応の内容、純正デバイスMuse Home Linkの提供条件を解説します。
ストリーミング動画対話の知覚・記憶・能動応答を統一したOneStreamerを解説。映像を文字記録化して文脈トークンを93.1%削減し、4Bモデルで8ベンチマーク全てで最高性能を達成した仕組みを紹介します。