iMotion-LLM: Instruction-Conditioned Trajectory Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Felemban, Abdulwahab, Hroub, Nussair, Ding, Jian, Abdelrahman, Eslam, Shen, Xiaoqian, Mohamed, Abduallah, Elhoseiny, Mohamed |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023)
par: Shen, Xiaoqian, et autres
Publié: (2023)
FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
How Well Can Vision Language Models See Image Details?
par: Gou, Chenhui, et autres
Publié: (2024)
par: Gou, Chenhui, et autres
Publié: (2024)
InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
ToddlerDiffusion: Interactive Structured Image Generation with Cascaded Schrödinger Bridge
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
WikiAutoGen: Towards Multi-Modal Wikipedia-Style Article Generation
par: Yang, Zhongyu, et autres
Publié: (2025)
par: Yang, Zhongyu, et autres
Publié: (2025)
A Dynamic Programming Framework for Discovering Count and Values of Multilevel Image Thresholding
par: Hegazy, Eslam, et autres
Publié: (2026)
par: Hegazy, Eslam, et autres
Publié: (2026)
INSTA-YOLO: Real-Time Instance Segmentation
par: Mohamed, Eslam, et autres
Publié: (2021)
par: Mohamed, Eslam, et autres
Publié: (2021)
Overcoming Generic Knowledge Loss with Selective Parameter Update
par: Zhang, Wenxuan, et autres
Publié: (2023)
par: Zhang, Wenxuan, et autres
Publié: (2023)
Neural Catalog: Scaling Species Recognition with Catalog of Life-Augmented Generation
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
Time Blindness: Why Video-Language Models Can't See What Humans Can?
par: Upadhyay, Ujjwal, et autres
Publié: (2025)
par: Upadhyay, Ujjwal, et autres
Publié: (2025)
Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation
par: Cai, Deli, et autres
Publié: (2026)
par: Cai, Deli, et autres
Publié: (2026)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
par: Chen, Jun, et autres
Publié: (2022)
par: Chen, Jun, et autres
Publié: (2022)
ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition
par: Felemban, Abdulwahab, et autres
Publié: (2025)
par: Felemban, Abdulwahab, et autres
Publié: (2025)
The Devil is in the EOS: Sequence Training for Detailed Image Captioning
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
par: Mohamed, Abdelrahman, et autres
Publié: (2025)
3DCoMPaT200: Language-Grounded Compositional Understanding of Parts and Materials of 3D Shapes
par: Ahmed, Mahmoud, et autres
Publié: (2025)
par: Ahmed, Mahmoud, et autres
Publié: (2025)
Controlling Structured Output Representations from Attributes using Conditional Generative Models
par: Debbagh, Mohamed
Publié: (2023)
par: Debbagh, Mohamed
Publié: (2023)
From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors
par: Zhao, Liangbing, et autres
Publié: (2026)
par: Zhao, Liangbing, et autres
Publié: (2026)
AI Art Neural Constellation: Revealing the Collective and Contrastive State of AI-Generated and Human Art
par: Khan, Faizan Farooq, et autres
Publié: (2024)
par: Khan, Faizan Farooq, et autres
Publié: (2024)
iLRM: An Iterative Large 3D Reconstruction Model
par: Kang, Gyeongjin, et autres
Publié: (2025)
par: Kang, Gyeongjin, et autres
Publié: (2025)
Self-Consistency for LLM-Based Motion Trajectory Generation and Verification
par: Ma, Jiaju, et autres
Publié: (2026)
par: Ma, Jiaju, et autres
Publié: (2026)
Domain-Aware Continual Zero-Shot Learning
par: Yi, Kai, et autres
Publié: (2021)
par: Yi, Kai, et autres
Publié: (2021)
IKMo: Image-Keyframed Motion Generation with Trajectory-Pose Conditioned Motion Diffusion Model
par: Zhao, Yang, et autres
Publié: (2025)
par: Zhao, Yang, et autres
Publié: (2025)
Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
Continual Learning on a Diet: Learning from Sparsely Labeled Streams Under Constrained Computation
par: Zhang, Wenxuan, et autres
Publié: (2024)
par: Zhang, Wenxuan, et autres
Publié: (2024)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
par: Ye, Zilyu, et autres
Publié: (2024)
par: Ye, Zilyu, et autres
Publié: (2024)
Step-by-step Layered Design Generation
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation
par: Li, Yuan-Ming, et autres
Publié: (2025)
par: Li, Yuan-Ming, et autres
Publié: (2025)
Motion Prompting: Controlling Video Generation with Motion Trajectories
par: Geng, Daniel, et autres
Publié: (2024)
par: Geng, Daniel, et autres
Publié: (2024)
RDM: Recurrent Diffusion Model for Human Motion Generation
par: Mohamed, Mirgahney, et autres
Publié: (2024)
par: Mohamed, Mirgahney, et autres
Publié: (2024)
MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple Granularities
par: Wu, Bizhu, et autres
Publié: (2025)
par: Wu, Bizhu, et autres
Publié: (2025)
Mojito: Motion Trajectory and Intensity Control for Video Generation
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
Documents similaires
-
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
par: Ataallah, Kirolos, et autres
Publié: (2024) -
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023) -
FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
par: Khan, Faizan Farooq, et autres
Publié: (2025) -
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023) -
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)