AnthropicがカスタムAIチップの設計チームを新設しました。ハードウェアとモデルを協調設計してClaudeの推論を高速化・効率化する狙いで、GoogleやOpenAIに続くAI業界の垂直統合の動きを解説します。
1枚の画像から3Dシーンを再構成する新視点合成手法InfiniSplatを解説します。ピクセル整列ではなく深度から導く表面構造にガウスを配置し、大きな視点変化でもSOTAを達成しました。
JFrogがGitHubで公開された55件の脆弱性報告を検証し、54件がAI生成とみられる捏造だったと発表しました。SQLite関連はNVDで最高評価を受けており、公的脆弱性DBの構造的欠陥を解説します。
Tencentが公開したHunyuan3D-Buffalo 1.0は、3Dの生成・理解・編集・パーツ生成を単一モデルに統合した基盤モデルです。テキストから3D生成で選好率約3倍、編集でChamfer距離86.7%削減を達成した仕組みを解説します。
テキサス州が全新規データセンターに監査を義務付け、実質的に建設を停止しました。接続待機キューは半年で233GWから474GWへ倍増。AIインフラ集積地に生じた転機を数値とともに解説します。
因果的自己注意を勾配経路として使い、報酬勾配を連続潜在状態へ直接割り当てるテスト時推論手法「GradCuit」を解説します。5つのLLMと3ベンチマークで平均64.5%を達成し、CoTを6.6ポイント上回りました。
AppleがOpenAIに対する営業秘密訴訟の調査対象を元従業員11人超へ拡大しました。未発表製品情報の持ち出しやAIデバイス開発の差止請求など、争点を整理して解説します。
拡散Transformer訓練を2倍以上高速化する最適化手法CMuonを解説します。重み行列を機能ごとに分割してから直交化することで収束停滞を解消し、ImageNet 256でFID 1.18を200エポックで達成しました。
塩野義製薬が社内向け生成AIの正答率を50%から90%へ改善した事例を解説します。処理を4段階に分けるモジュラーRAGと、Excel台帳とAWSによる機密データの認可制御の手法を紹介します。
ByteDanceが自然言語による声質デザインと参照音声からのゼロショットクローンを1つに統合した音声生成モデルSwanTaleを解説。会話や歌唱、環境音まで一貫生成し、InstructTTSEvalで首位を獲得した仕組みと成果を紹介します。
OpenAIが連続的な音声対話を実現する「GPT-Live」を発表しました。発話の切れ目を待つターン制を廃止し、聞くと話すを同時に行う全二重モデルと低遅延通信で自然な会話を実現する仕組みを解説します。
ByteDance Seedが、拡散モデルの収束損失がプロンプト内の構造化言語量に応じて下がる新法則を発見。尤度指標GPGと属性指標EDで定量化し、構造化プロンプトと自動生成器で画像生成のSOTAを達成した成果を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム