記事一覧 (35ページ目)

マルチモーダル論文解説

【VITA-1.5】音声と視覚の統合技術で人と機械の自然な対話を実現

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要 VITA-1.5は、音声と視覚のマルチモーダルなリアルタイムインタラクションを目指したモデルとして提案されました。 […]

2025年1月28日

強化学習論文解説

ロボット予測操作と計算最適化の新枠組みEnerVerse

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要本論文では、ロボット操作における「未来空間」生成を目的とした新しいフレームワーク「EnerVerse」が提案されて […]

2025年1月27日

画像論文解説

画像生成で個性を出せる新技術「Nested Attention」

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この研究は、画像生成モデルにおける「個性化」を実現しつつ、元の特徴や品質を保つ新たな手法「Nested Atten […]

2025年1月27日

データセット論文解説

CodeELOとは？競技プログラミングでLLMのコード生成力を評価する新ベンチマーク

競技プログラミング向けの新ベンチマーク「CodeELO」を解説。ELOレーティングに基づきLLMのコード生成能力を多面的に評価する仕組みと、各モデルの評価結果を紹介します。

2025年1月27日

データセット論文解説

時系列データ解析のための生成モデル「PaD-TS」

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この論文では、時系列データを生成するために新しいモデル「Population-Aware Diffusion fo […]

2025年1月27日

言語・LLM論文解説

長文タスクに優れたエンコーディング「TAPE」で頑健性と効率性を向上

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要本論文では、Transformerモデルの性能を向上させる新しい位置エンコーディングフレームワーク「TAPE（Tr […]

2025年1月27日

動画論文解説

動画の細粒度認識のための半教師あり学習手法「SeFAR」

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この論文では、動画データに基づいた細粒度動作認識を対象として、新しい半教師あり学習フレームワーク「SeFAR」を提 […]

2025年1月27日

言語・LLM論文解説

SSMの長期依存タスクの性能向上を実現する新手法

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この論文では、State Space Models（SSM）における情報の再現性や長期的依存関係の限界を克服するた […]

2025年1月27日

動画論文解説

LTX-Videoとは？リアルタイムで高品質な動画を生成するAIモデルの仕組み

Lightricks開発の動画生成AI「LTX-Video」の技術詳細を解説。Video Latent Diffusionにより、リアルタイムで高品質な動画生成を実現する仕組みとアーキテクチャの特徴を紹介します。

2025年1月27日

マルチモーダル論文解説

画像の安全性を自動判断するAI技術「MLLM-as-a-Judge」

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この論文では、画像が有害かどうかを判断する手法「MLLM-as-a-Judge」を提案しています。この方法は、大規 […]

2025年1月26日

言語・LLM論文解説

【CodeRM-88】コード生成評価を改善する新手法

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要この論文では、コード生成モデルの評価における課題を克服するため、CodeRM-88という新たな手法が提案されていま […]

2025年1月26日

言語・LLM論文解説

【A3】モバイルアプリ上で動作するエージェント評価

本記事で使用している画像は論文中の図表、またはそれを参考に作成した画像を使用しております。本論文の概要本論文では、モバイルアプリのGUI（グラフィカルユーザインタフェース）上で動作するエージェントを評価・改善するため […]

2025年1月25日

【VITA-1.5】音声と視覚の統合技術で人と機械の自然な対話を実現

ロボット予測操作と計算最適化の新枠組みEnerVerse

画像生成で個性を出せる新技術「Nested Attention」

CodeELOとは？競技プログラミングでLLMのコード生成力を評価する新ベンチマーク

時系列データ解析のための生成モデル「PaD-TS」

長文タスクに優れたエンコーディング「TAPE」で頑健性と効率性を向上

動画の細粒度認識のための半教師あり学習手法「SeFAR」

SSMの長期依存タスクの性能向上を実現する新手法

LTX-Videoとは？リアルタイムで高品質な動画を生成するAIモデルの仕組み

画像の安全性を自動判断するAI技術「MLLM-as-a-Judge」

【CodeRM-88】コード生成評価を改善する新手法

【A3】モバイルアプリ上で動作するエージェント評価

人気記事