AppleがOpenAIに対する営業秘密訴訟の調査対象を元従業員11人超へ拡大しました。未発表製品情報の持ち出しやAIデバイス開発の差止請求など、争点を整理して解説します。
拡散Transformer訓練を2倍以上高速化する最適化手法CMuonを解説します。重み行列を機能ごとに分割してから直交化することで収束停滞を解消し、ImageNet 256でFID 1.18を200エポックで達成しました。
塩野義製薬が社内向け生成AIの正答率を50%から90%へ改善した事例を解説します。処理を4段階に分けるモジュラーRAGと、Excel台帳とAWSによる機密データの認可制御の手法を紹介します。
ByteDanceが自然言語による声質デザインと参照音声からのゼロショットクローンを1つに統合した音声生成モデルSwanTaleを解説。会話や歌唱、環境音まで一貫生成し、InstructTTSEvalで首位を獲得した仕組みと成果を紹介します。
OpenAIが連続的な音声対話を実現する「GPT-Live」を発表しました。発話の切れ目を待つターン制を廃止し、聞くと話すを同時に行う全二重モデルと低遅延通信で自然な会話を実現する仕組みを解説します。
ByteDance Seedが、拡散モデルの収束損失がプロンプト内の構造化言語量に応じて下がる新法則を発見。尤度指標GPGと属性指標EDで定量化し、構造化プロンプトと自動生成器で画像生成のSOTAを達成した成果を解説します。
スクウェア・エニックスがGoogle CloudのマルチモーダルAI「Gemini」を使い、ゲームのQAテストを自動化する事例を発表しました。AIが画面を見てコントローラーを自走操作し検証を進める仕組みを解説します。
正解のない要約や創作を「スパイ探し」ゲームに変換し、検証可能な報酬を自動生成する強化学習RLSVRを解説。Qwen3-8Bで要約75.4%、創作77.3%の勝率を達成し、既存の自己改善手法を上回った成果を紹介します。
Alibaba Cloudが2.4兆パラメータの新モデルQwen3.8-Maxを公開しました。一部ベンチマークでFable 5やGPT-5.6 Solを上回り、来週には重みと中規模版も公開予定です。
頂点集合VAEとFlow Matchingを組み合わせた3Dメッシュ生成手法「Meshy T2」を解説します。画像からメッシュまでを中央値6秒で生成し自己回帰手法の10倍以上高速、面数制御やマルチパート資産にも対応します。
OpenAIが公式ブログで「豊富な知能」構想を公開しました。AIインフラの価値を規模ではなく実現できることで測り、フルスタック戦略と成果あたりのコストで供給拡大を目指す方針をまとめました。
同じ動きを異なる見た目で二重描画する「シャドウペア」で、動作と見た目を分離する動画ワールドモデル「ShadowDancer」を解説します。ラベルや微調整なしで動作を環境間転送し、人間動作PSNR22.4を達成しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム