REEF: Relevance-Aware and Efficient LLM Adapter for Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Reza, Sakib, Song, Xiyun, Yu, Heather, Lin, Zongfang, Moghaddam, Mohsen, Camps, Octavia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HAT: History-Augmented Anchor Transformer for Online Temporal Action Localization
di: Reza, Sakib, et al.
Pubblicazione: (2024)
di: Reza, Sakib, et al.
Pubblicazione: (2024)
ePBR: Extended PBR Materials in Image Synthesis
di: Guo, Yu, et al.
Pubblicazione: (2025)
di: Guo, Yu, et al.
Pubblicazione: (2025)
OT-Talk: Animating 3D Talking Head with Optimal Transportation
di: Wang, Xinmu, et al.
Pubblicazione: (2025)
di: Wang, Xinmu, et al.
Pubblicazione: (2025)
Inverse Rendering for High-Genus Surface Meshes from Multi-View Images
di: Gao, Xiang, et al.
Pubblicazione: (2025)
di: Gao, Xiang, et al.
Pubblicazione: (2025)
3D-HGS: 3D Half-Gaussian Splatting
di: Li, Haolin, et al.
Pubblicazione: (2024)
di: Li, Haolin, et al.
Pubblicazione: (2024)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model
di: Guo, Yu, et al.
Pubblicazione: (2026)
di: Guo, Yu, et al.
Pubblicazione: (2026)
MotionAdapter: Video Motion Transfer via Content-Aware Attention Customization
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
di: Zhang, Zhexin, et al.
Pubblicazione: (2026)
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding
di: Ponbagavathi, Thinesh Thiyakesan, et al.
Pubblicazione: (2026)
di: Ponbagavathi, Thinesh Thiyakesan, et al.
Pubblicazione: (2026)
Detection of Intoxicated Individuals from Facial Video Sequences via a Recurrent Fusion Model
di: Baroutian, Bita, et al.
Pubblicazione: (2025)
di: Baroutian, Bita, et al.
Pubblicazione: (2025)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering
di: Song, Peipei, et al.
Pubblicazione: (2025)
di: Song, Peipei, et al.
Pubblicazione: (2025)
RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding
di: Tan, Xichen, et al.
Pubblicazione: (2025)
di: Tan, Xichen, et al.
Pubblicazione: (2025)
When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
A Race Bias Free Face Aging Model for Reliable Kinship Verification
di: Nazari, Ali, et al.
Pubblicazione: (2025)
di: Nazari, Ali, et al.
Pubblicazione: (2025)
Generalized Disguise Makeup Presentation Attack Detection Using an Attention-Guided Patch-Based Framework
di: Taraghi, Fateme, et al.
Pubblicazione: (2026)
di: Taraghi, Fateme, et al.
Pubblicazione: (2026)
CAD: Memory Efficient Convolutional Adapter for Segment Anything
di: Kim, Joohyeok, et al.
Pubblicazione: (2024)
di: Kim, Joohyeok, et al.
Pubblicazione: (2024)
PMA: Towards Parameter-Efficient Point Cloud Understanding via Point Mamba Adapter
di: Zha, Yaohua, et al.
Pubblicazione: (2025)
di: Zha, Yaohua, et al.
Pubblicazione: (2025)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction
di: Su, Wuqi, et al.
Pubblicazione: (2026)
di: Su, Wuqi, et al.
Pubblicazione: (2026)
Test-Time Temporal Sampling for Efficient MLLM Video Understanding
di: Wang, Kaibin, et al.
Pubblicazione: (2025)
di: Wang, Kaibin, et al.
Pubblicazione: (2025)
Dyn-Adapter: Towards Disentangled Representation for Efficient Visual Recognition
di: Zhang, Yurong, et al.
Pubblicazione: (2024)
di: Zhang, Yurong, et al.
Pubblicazione: (2024)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning
di: Chen, Junan, et al.
Pubblicazione: (2025)
di: Chen, Junan, et al.
Pubblicazione: (2025)
I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models
di: Guo, Xun, et al.
Pubblicazione: (2023)
di: Guo, Xun, et al.
Pubblicazione: (2023)
MoMA: Multimodal LLM Adapter for Fast Personalized Image Generation
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
di: Song, Kunpeng, et al.
Pubblicazione: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models
di: Cheng, Ying, et al.
Pubblicazione: (2025)
di: Cheng, Ying, et al.
Pubblicazione: (2025)
TAMM: TriAdapter Multi-Modal Learning for 3D Shape Understanding
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
UrbanSAM: Learning Invariance-Inspired Adapters for Segment Anything Models in Urban Construction
di: Li, Chenyu, et al.
Pubblicazione: (2025)
di: Li, Chenyu, et al.
Pubblicazione: (2025)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
di: Zhi, Zhuo, et al.
Pubblicazione: (2025)
HIERAMP: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
di: Li, Handong, et al.
Pubblicazione: (2026)
di: Li, Handong, et al.
Pubblicazione: (2026)
M-LLM Based Video Frame Selection for Efficient Video Understanding
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
di: Zheng, Duo, et al.
Pubblicazione: (2024)
di: Zheng, Duo, et al.
Pubblicazione: (2024)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
di: Ebrahimi, Sayna, et al.
Pubblicazione: (2024)
di: Ebrahimi, Sayna, et al.
Pubblicazione: (2024)
PickStyle: Video-to-Video Style Transfer with Context-Style Adapters
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
di: Jin, Xiaojie, et al.
Pubblicazione: (2023)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
Documenti analoghi
-
HAT: History-Augmented Anchor Transformer for Online Temporal Action Localization
di: Reza, Sakib, et al.
Pubblicazione: (2024) -
ePBR: Extended PBR Materials in Image Synthesis
di: Guo, Yu, et al.
Pubblicazione: (2025) -
OT-Talk: Animating 3D Talking Head with Optimal Transportation
di: Wang, Xinmu, et al.
Pubblicazione: (2025) -
Inverse Rendering for High-Genus Surface Meshes from Multi-View Images
di: Gao, Xiang, et al.
Pubblicazione: (2025) -
3D-HGS: 3D Half-Gaussian Splatting
di: Li, Haolin, et al.
Pubblicazione: (2024)