MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kalakonda, Sai Shashank, Maheshwari, Shubh, Sarvadevabhatla, Ravi Kiran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
par: Huang, Yiheng, et autres
Publié: (2024)
par: Huang, Yiheng, et autres
Publié: (2024)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
par: Sanguigni, Fulvio, et autres
Publié: (2025)
par: Sanguigni, Fulvio, et autres
Publié: (2025)
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
par: Kandhare, Mahesh, et autres
Publié: (2024)
par: Kandhare, Mahesh, et autres
Publié: (2024)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
par: Zhao, Sihan, et autres
Publié: (2025)
par: Zhao, Sihan, et autres
Publié: (2025)
Human Motion Video Generation: A Survey
par: Xue, Haiwei, et autres
Publié: (2025)
par: Xue, Haiwei, et autres
Publié: (2025)
Generating Attribute-Aware Human Motions from Textual Prompt
par: Wang, Xinghan, et autres
Publié: (2025)
par: Wang, Xinghan, et autres
Publié: (2025)
Transcending Fusion: A Multi-Scale Alignment Method for Remote Sensing Image-Text Retrieval
par: Yang, Rui, et autres
Publié: (2024)
par: Yang, Rui, et autres
Publié: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
par: Taghipour, Ashkan, et autres
Publié: (2026)
par: Taghipour, Ashkan, et autres
Publié: (2026)
ViMo: Generating Motions from Casual Videos
par: Qiu, Liangdong, et autres
Publié: (2024)
par: Qiu, Liangdong, et autres
Publié: (2024)
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
par: Jin, Chuhao, et autres
Publié: (2025)
par: Jin, Chuhao, et autres
Publié: (2025)
Waymo-3DSkelMo: A Multi-Agent 3D Skeletal Motion Dataset for Pedestrian Interaction Modeling in Autonomous Driving
par: Zhu, Guangxun, et autres
Publié: (2025)
par: Zhu, Guangxun, et autres
Publié: (2025)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
par: Wang, Xinghan, et autres
Publié: (2024)
par: Wang, Xinghan, et autres
Publié: (2024)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
SOSControl: Enhancing Human Motion Generation through Saliency-Aware Symbolic Orientation and Timing Control
par: Au, Ho Yin, et autres
Publié: (2025)
par: Au, Ho Yin, et autres
Publié: (2025)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
par: Zhu, Yixin, et autres
Publié: (2026)
par: Zhu, Yixin, et autres
Publié: (2026)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
par: Shi, Haoyuan, et autres
Publié: (2026)
par: Shi, Haoyuan, et autres
Publié: (2026)
Scalable Image Coding for Humans and Machines Using Feature Fusion Network
par: Shindo, Takahiro, et autres
Publié: (2024)
par: Shindo, Takahiro, et autres
Publié: (2024)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
par: Ding, Yiming, et autres
Publié: (2026)
par: Ding, Yiming, et autres
Publié: (2026)
Mesquite MoCap: Democratizing Real-Time Motion Capture with Affordable, Bodyworn IoT Sensors and WebXR SLAM
par: Vanani, Poojan, et autres
Publié: (2025)
par: Vanani, Poojan, et autres
Publié: (2025)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
par: Yang, Fan, et autres
Publié: (2025)
par: Yang, Fan, et autres
Publié: (2025)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
par: Zhang, Yuang, et autres
Publié: (2024)
par: Zhang, Yuang, et autres
Publié: (2024)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
par: Zhang, Bolin, et autres
Publié: (2026)
par: Zhang, Bolin, et autres
Publié: (2026)
Deep Compositional Phase Diffusion for Long Motion Sequence Generation
par: Au, Ho Yin, et autres
Publié: (2025)
par: Au, Ho Yin, et autres
Publié: (2025)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
par: Wang, Xue, et autres
Publié: (2026)
par: Wang, Xue, et autres
Publié: (2026)
Tile Classification Based Viewport Prediction with Multi-modal Fusion Transformer
par: Zhang, Zhihao, et autres
Publié: (2023)
par: Zhang, Zhihao, et autres
Publié: (2023)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
par: Shan, Ziyu, et autres
Publié: (2024)
par: Shan, Ziyu, et autres
Publié: (2024)
KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
par: Vo-Thanh, Hoang-Son, et autres
Publié: (2024)
TMFNet: Two-Stream Multi-Channels Fusion Networks for Color Image Operation Chain Detection
par: Niu, Yakun, et autres
Publié: (2024)
par: Niu, Yakun, et autres
Publié: (2024)
Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
par: Cheng, Shihao, et autres
Publié: (2026)
par: Cheng, Shihao, et autres
Publié: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
par: Jia, Tianzhi, et autres
Publié: (2026)
par: Jia, Tianzhi, et autres
Publié: (2026)
REArtGS: Reconstructing and Generating Articulated Objects via 3D Gaussian Splatting with Geometric and Motion Constraints
par: Wu, Di, et autres
Publié: (2025)
par: Wu, Di, et autres
Publié: (2025)
OneHOI: Unifying Human-Object Interaction Generation and Editing
par: Hoe, Jiun Tian, et autres
Publié: (2026)
par: Hoe, Jiun Tian, et autres
Publié: (2026)
Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion
par: Chen, Sen, et autres
Publié: (2022)
par: Chen, Sen, et autres
Publié: (2022)
DepthGait: Multi-Scale Cross-Level Feature Fusion of RGB-Derived Depth and Silhouette Sequences for Robust Gait Recognition
par: Li, Xinzhu, et autres
Publié: (2025)
par: Li, Xinzhu, et autres
Publié: (2025)
Documents similaires
-
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
par: Huang, Yiheng, et autres
Publié: (2024) -
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
par: Sanguigni, Fulvio, et autres
Publié: (2025) -
An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval
par: Kandhare, Mahesh, et autres
Publié: (2024) -
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025) -
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
par: Zhao, Sihan, et autres
Publié: (2025)