Multimodal Large Models Are Effective Action Anticipators
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Binglu, Tian, Yao, Wang, Shunzhou, Yang, Le |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding Multimodal Complementarity for Single-Frame Action Anticipation
par: Benavent-Lledo, Manuel, et autres
Publié: (2026)
par: Benavent-Lledo, Manuel, et autres
Publié: (2026)
Intention Action Anticipation Model with Guide-Feedback Loop Mechanism
par: Ma, Zongnan, et autres
Publié: (2024)
par: Ma, Zongnan, et autres
Publié: (2024)
GaTector+: A Unified Head-free Framework for Gaze Object and Gaze Following Prediction
par: Jin, Yang, et autres
Publié: (2025)
par: Jin, Yang, et autres
Publié: (2025)
Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models
par: Sato, Yuji, et autres
Publié: (2025)
par: Sato, Yuji, et autres
Publié: (2025)
FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance
par: Shao, Dian, et autres
Publié: (2025)
par: Shao, Dian, et autres
Publié: (2025)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
par: Cao, Congqi, et autres
Publié: (2025)
par: Cao, Congqi, et autres
Publié: (2025)
Action-Guided Attention for Video Action Anticipation
par: Tai, Tsung-Ming, et autres
Publié: (2026)
par: Tai, Tsung-Ming, et autres
Publié: (2026)
AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?
par: Zhao, Qi, et autres
Publié: (2023)
par: Zhao, Qi, et autres
Publié: (2023)
Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?
par: Benavent-Lledo, Manuel, et autres
Publié: (2025)
par: Benavent-Lledo, Manuel, et autres
Publié: (2025)
Boosting Gaze Object Prediction via Pixel-level Supervision from Vision Foundation Model
par: Jin, Yang, et autres
Publié: (2024)
par: Jin, Yang, et autres
Publié: (2024)
LFMamba: Light Field Image Super-Resolution with State Space Model
par: xia, Wang, et autres
Publié: (2024)
par: xia, Wang, et autres
Publié: (2024)
From Recognition to Prediction: Leveraging Sequence Reasoning for Action Anticipation
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
An Effective End-to-End Solution for Multimodal Action Recognition
par: Wang, Songping, et autres
Publié: (2025)
par: Wang, Songping, et autres
Publié: (2025)
Vision-based Wearable Steering Assistance for People with Impaired Vision in Jogging
par: Liu, Xiaotong, et autres
Publié: (2024)
par: Liu, Xiaotong, et autres
Publié: (2024)
Interaction Region Visual Transformer for Egocentric Action Anticipation
par: Roy, Debaditya, et autres
Publié: (2022)
par: Roy, Debaditya, et autres
Publié: (2022)
A Survey on Deep Learning Techniques for Action Anticipation
par: Zhong, Zeyun, et autres
Publié: (2023)
par: Zhong, Zeyun, et autres
Publié: (2023)
TransGOP: Transformer-Based Gaze Object Prediction
par: Wang, Binglu, et autres
Publié: (2024)
par: Wang, Binglu, et autres
Publié: (2024)
VGD: Visual Geometry Gaussian Splatting for Feed-Forward Surround-view Driving Reconstruction
par: Lin, Junhong, et autres
Publié: (2025)
par: Lin, Junhong, et autres
Publié: (2025)
DriveExplorer: Images-Only Decoupled 4D Reconstruction with Progressive Restoration for Driving View Extrapolation
par: Jia, Yuang, et autres
Publié: (2025)
par: Jia, Yuang, et autres
Publié: (2025)
Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models
par: Mittal, Himangi, et autres
Publié: (2024)
par: Mittal, Himangi, et autres
Publié: (2024)
Human Action Anticipation: A Survey
par: Lai, Bolin, et autres
Publié: (2024)
par: Lai, Bolin, et autres
Publié: (2024)
Gaze-Guided Graph Neural Network for Action Anticipation Conditioned on Intention
par: Ozdel, Suleyman, et autres
Publié: (2024)
par: Ozdel, Suleyman, et autres
Publié: (2024)
TAP-JEPA: Frozen Future-Latent Probing and Two-Stage Score Fusion for EPIC-KITCHENS-100 Action Anticipation
par: Wang, Chaoyang, et autres
Publié: (2026)
par: Wang, Chaoyang, et autres
Publié: (2026)
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation
par: Tian, Ye, et autres
Publié: (2025)
par: Tian, Ye, et autres
Publié: (2025)
MMaDA: Multimodal Large Diffusion Language Models
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
Multi-level and Multi-modal Action Anticipation
par: Kim, Seulgi, et autres
Publié: (2025)
par: Kim, Seulgi, et autres
Publié: (2025)
When, Where, and What? A Novel Benchmark for Accident Anticipation and Localization with Large Language Models
par: Liao, Haicheng, et autres
Publié: (2024)
par: Liao, Haicheng, et autres
Publié: (2024)
Semantically Guided Action Anticipation
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
ActFusion: a Unified Diffusion Model for Action Segmentation and Anticipation
par: Gong, Dayoung, et autres
Publié: (2024)
par: Gong, Dayoung, et autres
Publié: (2024)
MixANT: Observation-dependent Memory Propagation for Stochastic Dense Action Anticipation
par: Wasim, Syed Talal, et autres
Publié: (2025)
par: Wasim, Syed Talal, et autres
Publié: (2025)
See It Before You Grab It: Deep Learning-based Action Anticipation in Basketball
par: Roy, Arnau Barrera, et autres
Publié: (2025)
par: Roy, Arnau Barrera, et autres
Publié: (2025)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
Parameter-efficient Tuning of Large-scale Multimodal Foundation Model
par: Wang, Haixin, et autres
Publié: (2023)
par: Wang, Haixin, et autres
Publié: (2023)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
MANTA: Diffusion Mamba for Efficient and Effective Stochastic Long-Term Dense Anticipation
par: Zatsarynna, Olga, et autres
Publié: (2025)
par: Zatsarynna, Olga, et autres
Publié: (2025)
CoStoDet-DDPM: Collaborative Training of Stochastic and Deterministic Models Improves Surgical Workflow Anticipation and Recognition
par: Yang, Kaixiang, et autres
Publié: (2025)
par: Yang, Kaixiang, et autres
Publié: (2025)
Towards an Effective Action-Region Tracking Framework for Fine-grained Video Action Recognition
par: Sun, Baoli, et autres
Publié: (2025)
par: Sun, Baoli, et autres
Publié: (2025)
Uncertainty-boosted Robust Video Activity Anticipation
par: Qi, Zhaobo, et autres
Publié: (2024)
par: Qi, Zhaobo, et autres
Publié: (2024)
Effectiveness of Large Multimodal Models in Detecting Disinformation: Experimental Results
par: Kheddache, Yasmina, et autres
Publié: (2025)
par: Kheddache, Yasmina, et autres
Publié: (2025)
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
par: Liu, Yikun, et autres
Publié: (2024)
par: Liu, Yikun, et autres
Publié: (2024)
Documents similaires
-
Understanding Multimodal Complementarity for Single-Frame Action Anticipation
par: Benavent-Lledo, Manuel, et autres
Publié: (2026) -
Intention Action Anticipation Model with Guide-Feedback Loop Mechanism
par: Ma, Zongnan, et autres
Publié: (2024) -
GaTector+: A Unified Head-free Framework for Gaze Object and Gaze Following Prediction
par: Jin, Yang, et autres
Publié: (2025) -
Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models
par: Sato, Yuji, et autres
Publié: (2025) -
FinePhys: Fine-grained Human Action Generation by Explicitly Incorporating Physical Laws for Effective Skeletal Guidance
par: Shao, Dian, et autres
Publié: (2025)