KAISTらが積み木の合成データ1.5万件でLVLMの空間推論を訓練するSpatialBlockを公開。3B規模モデルが積み木ベンチで29.9%から94.8%、実写のMindCubeでも10ポイント改善した手法を解説します。
エージェントの行動履歴からファイル操作を再生し実行可能なターミナル環境を3.73万件合成する新手法Terminal-Universeを解説。Qwen3.5-27BでTerminal-Bench 2.1が+11.9ポイント向上しました。
戦争や災害のAI生成フェイク動画に特化した検出ベンチマーク「RA-Bench」を解説します。実動画と生成動画あわせて1.8万本で各種検出器を検証し、精度がほぼ偶然並みに低下し、SNS拡散でさらに悪化する実態を明らかにしました。
画像生成モデルとVLMの空間認知を、テキストではなく生成ピクセルで答えさせ同一指標で比較する新枠組みProVisEを解説。14サブタスク470問のベンチマークで、人間88%に対しGPT-5.4は61%にとどまる実態を紹介します。
コードエージェントにLLM学習用のデータ処理をDAGとして組ませるDataFlow-Harnessを解説します。12タスクで成功率93.3%、コスト72.5%削減・遅延49.9%削減を達成した仕組みと課題を紹介します。
250名以上の業界専門家と共同設計した1,490タスクで構成されるAIエージェント評価ベンチマーク「ALE」を解説します。最良モデルでも全体合格率26.2%にとどまる結果が示す、現在のAIエージェントの実力と今後の課題を詳しく紹介します。
正しい答えを返しながら根拠箇所を誤引用する「帰属ハルシネーション」を体系的に定量化するベンチマーク「CiteVQA」が公開されました。711本のPDF・1,897問・7ドメインで構成し、最強モデルでもSAA 76.0%という大きなギャップを明らかにします。
NVIDIAが提案したMemLensは789問・5能力・4段階のコンテキスト長でマルチモーダル長期記憶を評価する初の体系的ベンチマークです。最先端モデルも30%以下に留まる視覚記憶の壁を解説します。
64人の数学者が設計した研究レベル数学ベンチマーク「Soohak」を解説します。最先端モデルでもGemini-3-Proが30.4%、GPT-5が26.4%止まりで、不当な問題を見抜く「Refusal Subset」ではいかなるモデルも50%未満でした。
45,320個のDocker環境を自動合成し、SWE-bench Verifiedで66.0%を達成したオープンソースSWEエージェント訓練基盤「daVinci-Env」を紹介します。品質フィルタリングで抽出した9,000個の環境と完全公開されたインフラで、AI駆動型ソフトウェア開発の民主化を実現します。
本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。 本論文の概要 論文「METAGENE-1: Metagenomic Foundation Model for Pandemic […]
本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。 本論文の概要 本論文では、LLM(大規模言語モデル)の数学的推論能力を向上させる新しいアプローチ「BoostStep」が提案され […]