論文執筆を13個の合成可能なスキルに分解した自動生成システム「Spark-to-Paper」を解説します。結果を見る前に証拠を規定する設計で捏造検出率を14%から92%へ高め、引用正確性99.5%、1本8.1ドルを実現しました。
AnthropicがClaude生成テキストに埋め込む電子透かしの仕組みを公開しました。秘密鍵と文脈から単語選択を操作し、品質や料金に影響なく統計的パターンを残す方式です。検出方法や効かない場面まで解説します。
どのクエリにも万能なLLMは存在しません。LLMRouterはルーティングを5要素で定式化し、汎用から視覚まで5トラックのベンチマークで16種以上のルーターを評価。学習型は固定モデル比で相対14.6%の改善を達成しました。
マスク拡散LLMが推論の途中で答えを先に固定してしまう欠陥を特定した研究を解説します。単一パラメータ「frontier-gated commitment」でGSM8K精度を0.528から0.852へ改善し、最大4倍の並列デコードを維持した成果を紹介します。
元Anthropicの研究者が設立したAIラボMirendilが、Google Cloudと1億ドル超の複数年契約を締結。TPUとNvidia GPUを確保し、再帰的自己改善AIで科学研究の自動化を目指す狙いを解説します。
初期検索の失敗を手がかりに推論するRetrieval-Centric CoTを提案する新手法UniME-R1を解説します。埋め込みモデルとアドバイザーを組み合わせ、MMEB-V2など多様なマルチモーダル検索で既存手法を上回りました。
Google DeepMindの気象AI「WeatherNext」がサイクロン予測で従来モデルより24時間以上のリードタイムを獲得。Natureに掲載された技術の仕組みと実用事例を解説します。
Meta AIが統合マルチモーダルモデルの事前学習を体系的に解剖。言語・視覚理解・視覚生成間の知識伝達の非対称性、共有Attention+モダリティ別FFN、早期統合の優位性を実証し、標準の5%の計算量で高い生成性能を達成したレシピを解説します。
LLMのTemperature、Top-p、Top-kの違いと仕組みを初心者向けに解説。用途別の推奨値やOpenAI・Anthropic・Geminiのパラメータ差異、設定時の注意点まで体系的に整理します。
NVIDIAが自動運転オープンモデルAlpamayoのライセンスをOpenMDW-1.1へ変更し、商用利用を解禁しました。新モデルAlpamayo 2 SuperはLingoQAで約40モデル中首位、累計ダウンロード50万超の実力を解説します。
正解から逆探索して各ステップに密な報酬を与える強化学習手法ABSeekerを解説します。Qwen3.5-4BをわずかBrowseComp 37.3%(文脈管理で55.3%)に引き上げ、30B級に匹敵させた仕組みを紹介します。
Metaがターミナル動作型のコーディングエージェント「Muse Code」を発表。新モデルMuse Spark 1.2はTerminal-Bench 2.1で82.9%を記録し、Claude CodeやCodexに対抗します。その仕組みと実力を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
OpenAI、企業向けAIエージェント基盤「Presence」発表 — 電話対応の75%を無人解決