Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Pereira, Joao, Lopes, Vasco, Semedo, David, Neves, Joao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
di: Pereira, João, et al.
Pubblicazione: (2026)
di: Pereira, João, et al.
Pubblicazione: (2026)
Chain-of-Anomaly Thoughts with Large Vision-Language Models
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
Zero-Shot Action Recognition in Surveillance Videos
di: Pereira, Joao, et al.
Pubblicazione: (2024)
di: Pereira, Joao, et al.
Pubblicazione: (2024)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
Seeing Across Time and Views: Multi-Temporal Cross-View Learning for Robust Video Person Re-Identification
di: Rashidunnabi, Md, et al.
Pubblicazione: (2025)
di: Rashidunnabi, Md, et al.
Pubblicazione: (2025)
VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2026)
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2026)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025)
di: Liu, Shuming, et al.
Pubblicazione: (2025)
Towards Concept-based Interpretability of Skin Lesion Diagnosis using Vision-Language Models
di: Patrício, Cristiano, et al.
Pubblicazione: (2023)
di: Patrício, Cristiano, et al.
Pubblicazione: (2023)
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
di: Weng, Yuetian, et al.
Pubblicazione: (2024)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
di: Nguyen, Thong, et al.
Pubblicazione: (2025)
di: Nguyen, Thong, et al.
Pubblicazione: (2025)
Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models
di: Parsa, Pouya, et al.
Pubblicazione: (2025)
di: Parsa, Pouya, et al.
Pubblicazione: (2025)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
Video-Zero: Self-Evolution Video Understanding
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
di: Han, Mingfei, et al.
Pubblicazione: (2025)
di: Han, Mingfei, et al.
Pubblicazione: (2025)
Image Re-Identification: Where Self-supervision Meets Vision-Language Learning
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
di: Ye, Jinhui, et al.
Pubblicazione: (2025)
An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
Self-Supervised Contrastive Learning for Videos using Differentiable Local Alignment
di: Oei, Keyne, et al.
Pubblicazione: (2024)
di: Oei, Keyne, et al.
Pubblicazione: (2024)
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
SelfReDepth: Self-Supervised Real-Time Depth Restoration for Consumer-Grade Sensors
di: Duarte, Alexandre, et al.
Pubblicazione: (2024)
di: Duarte, Alexandre, et al.
Pubblicazione: (2024)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
di: Hu, Bin, et al.
Pubblicazione: (2024)
di: Hu, Bin, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
Large Language Models for Captioning and Retrieving Remote Sensing Images
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
di: Ramos, Vasco, et al.
Pubblicazione: (2025)
di: Ramos, Vasco, et al.
Pubblicazione: (2025)
Automated Evaluation of Large Vision-Language Models on Self-driving Corner Cases
di: Chen, Kai, et al.
Pubblicazione: (2024)
di: Chen, Kai, et al.
Pubblicazione: (2024)
MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
Large Language Models Facilitate Vision Reflection in Image Classification
di: An, Guoyuan, et al.
Pubblicazione: (2025)
di: An, Guoyuan, et al.
Pubblicazione: (2025)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization
di: Sarkar, Pritam, et al.
Pubblicazione: (2025)
di: Sarkar, Pritam, et al.
Pubblicazione: (2025)
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
di: Pereira, João, et al.
Pubblicazione: (2026) -
Chain-of-Anomaly Thoughts with Large Vision-Language Models
di: Domingos, Pedro, et al.
Pubblicazione: (2025) -
Zero-Shot Action Recognition in Surveillance Videos
di: Pereira, Joao, et al.
Pubblicazione: (2024) -
Show and Guide: Instructional-Plan Grounded Vision and Language Model
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024) -
Seeing Across Time and Views: Multi-Temporal Cross-View Learning for Robust Video Person Re-Identification
di: Rashidunnabi, Md, et al.
Pubblicazione: (2025)