ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Yi-Xing, Yang, Qize, Tang, Yu-Ming, Fu, Shenghao, Lin, Kun-Yu, Wei, Xihan, Zheng, Wei-Shi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
par: Fu, Shenghao, et autres
Publié: (2024)
par: Fu, Shenghao, et autres
Publié: (2024)
A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
Human-Centric Transformer for Domain Adaptive Action Recognition
par: Lin, Kun-Yu, et autres
Publié: (2024)
par: Lin, Kun-Yu, et autres
Publié: (2024)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation
par: Li, Yuan-Ming, et autres
Publié: (2025)
par: Li, Yuan-Ming, et autres
Publié: (2025)
Rethinking CLIP-based Video Learners in Cross-Domain Open-Vocabulary Action Recognition
par: Lin, Kun-Yu, et autres
Publié: (2024)
par: Lin, Kun-Yu, et autres
Publié: (2024)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
VideoChat: Chat-Centric Video Understanding
par: Li, KunChang, et autres
Publié: (2023)
par: Li, KunChang, et autres
Publié: (2023)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
par: Qian, Long, et autres
Publié: (2024)
par: Qian, Long, et autres
Publié: (2024)
InstrAct: Towards Action-Centric Understanding in Instructional Videos
par: Yang, Zhuoyi, et autres
Publié: (2026)
par: Yang, Zhuoyi, et autres
Publié: (2026)
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
par: Sun, Boyuan, et autres
Publié: (2026)
par: Sun, Boyuan, et autres
Publié: (2026)
SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding
par: Hu, Yangliu, et autres
Publié: (2025)
par: Hu, Yangliu, et autres
Publié: (2025)
YourSkatingCoach: A Figure Skating Video Benchmark for Fine-Grained Element Analysis
par: Chen, Wei-Yi, et autres
Publié: (2024)
par: Chen, Wei-Yi, et autres
Publié: (2024)
Text-guided Fine-Grained Video Anomaly Understanding
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
par: Pan, Hewen, et autres
Publié: (2025)
par: Pan, Hewen, et autres
Publié: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025)
par: Cai, Yuxuan, et autres
Publié: (2025)
DreamView: Injecting View-specific Text Guidance into Text-to-3D Generation
par: Yan, Junkai, et autres
Publié: (2024)
par: Yan, Junkai, et autres
Publié: (2024)
A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
par: Li, Hongyu, et autres
Publié: (2025)
par: Li, Hongyu, et autres
Publié: (2025)
Rethinking Few-shot Class-incremental Learning: Learning from Yourself
par: Tang, Yu-Ming, et autres
Publié: (2024)
par: Tang, Yu-Ming, et autres
Publié: (2024)
Modeling Multiple Normal Action Representations for Error Detection in Procedural Tasks
par: Huang, Wei-Jin, et autres
Publié: (2025)
par: Huang, Wei-Jin, et autres
Publié: (2025)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
par: Kim, Namho, et autres
Publié: (2025)
par: Kim, Namho, et autres
Publié: (2025)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
par: Zhao, Fufangchen, et autres
Publié: (2025)
par: Zhao, Fufangchen, et autres
Publié: (2025)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
FMimic: Foundation Models are Fine-grained Action Learners from Human Videos
par: Chen, Guangyan, et autres
Publié: (2025)
par: Chen, Guangyan, et autres
Publié: (2025)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
par: He, Xusheng, et autres
Publié: (2025)
par: He, Xusheng, et autres
Publié: (2025)
M^2ConceptBase: A Fine-Grained Aligned Concept-Centric Multimodal Knowledge Base
par: Zha, Zhiwei, et autres
Publié: (2023)
par: Zha, Zhiwei, et autres
Publié: (2023)
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
par: Liu, Yuansen, et autres
Publié: (2025)
par: Liu, Yuansen, et autres
Publié: (2025)
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
par: Pereira, João, et autres
Publié: (2026)
par: Pereira, João, et autres
Publié: (2026)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
par: Yu, Hong-Tao, et autres
Publié: (2025)
par: Yu, Hong-Tao, et autres
Publié: (2025)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024)
par: Chen, Houlun, et autres
Publié: (2024)
Documents similaires
-
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
par: Fu, Shenghao, et autres
Publié: (2025) -
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
par: Zhao, Jiaxing, et autres
Publié: (2025) -
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
par: Yang, Qize, et autres
Publié: (2025) -
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025) -
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
par: Fu, Shenghao, et autres
Publié: (2024)