ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Jian, Korkinof, Dimitrios, Gong, Shaogang, Beguerisse-Diaz, Mariano |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
di: Lin, Jiayi, et al.
Pubblicazione: (2024)
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
di: Cheng, Zixu, et al.
Pubblicazione: (2025)
Grounding Video Reasoning in Physical Signals
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
di: Osmanli, Alibay, et al.
Pubblicazione: (2026)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
di: Cao, Yu, et al.
Pubblicazione: (2024)
di: Cao, Yu, et al.
Pubblicazione: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
SMaRt: Improving GANs with Score Matching Regularity
di: Xia, Mengfei, et al.
Pubblicazione: (2023)
di: Xia, Mengfei, et al.
Pubblicazione: (2023)
Video Summarisation with Incident and Context Information using Generative AI
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
di: De Silva, Ulindu, et al.
Pubblicazione: (2025)
Neuro-Symbolic Spatial Reasoning in Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
di: Lin, Jiayi, et al.
Pubblicazione: (2025)
Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking
di: Sun, Shitong, et al.
Pubblicazione: (2023)
di: Sun, Shitong, et al.
Pubblicazione: (2023)
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
di: Lee, Yeonkyung, et al.
Pubblicazione: (2026)
di: Lee, Yeonkyung, et al.
Pubblicazione: (2026)
ViPro-2: Unsupervised State Estimation via Integrated Dynamics for Guiding Video Prediction
di: Takenaka, Patrick, et al.
Pubblicazione: (2025)
di: Takenaka, Patrick, et al.
Pubblicazione: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
di: Li, Zheng, et al.
Pubblicazione: (2024)
di: Li, Zheng, et al.
Pubblicazione: (2024)
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
di: Cao, Yu, et al.
Pubblicazione: (2025)
di: Cao, Yu, et al.
Pubblicazione: (2025)
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
di: Zhao, Zengqun, et al.
Pubblicazione: (2024)
di: Zhao, Zengqun, et al.
Pubblicazione: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
di: Fang, Zixun, et al.
Pubblicazione: (2024)
di: Fang, Zixun, et al.
Pubblicazione: (2024)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
di: Zhao, Zengqun, et al.
Pubblicazione: (2026)
XFMamba: Cross-Fusion Mamba for Multi-View Medical Image Classification
di: Zheng, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zheng, Xiaoyu, et al.
Pubblicazione: (2025)
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
di: Cheng, Zixu, et al.
Pubblicazione: (2024)
di: Cheng, Zixu, et al.
Pubblicazione: (2024)
Unsupervised Object Localization in the Era of Self-Supervised ViTs: A Survey
di: Siméoni, Oriane, et al.
Pubblicazione: (2023)
di: Siméoni, Oriane, et al.
Pubblicazione: (2023)
Which Direction to Choose? An Analysis on the Representation Power of Self-Supervised ViTs in Downstream Tasks
di: Kaltampanidis, Yannis, et al.
Pubblicazione: (2025)
di: Kaltampanidis, Yannis, et al.
Pubblicazione: (2025)
ViDiC: Video Difference Captioning
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
di: Wu, Jiangtao, et al.
Pubblicazione: (2025)
E2MPL:An Enduring and Efficient Meta Prompt Learning Framework for Few-shot Unsupervised Domain Adaptation
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
di: Wang, Xijun, et al.
Pubblicazione: (2023)
di: Wang, Xijun, et al.
Pubblicazione: (2023)
ViLL-E: Video LLM Embeddings for Retrieval
di: Gupta, Rohit, et al.
Pubblicazione: (2026)
di: Gupta, Rohit, et al.
Pubblicazione: (2026)
MoViE: Mobile Diffusion for Video Editing
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
di: Karjauv, Adil, et al.
Pubblicazione: (2024)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation
di: Wang, Zihao, et al.
Pubblicazione: (2026)
di: Wang, Zihao, et al.
Pubblicazione: (2026)
ViMU: Benchmarking Video Metaphorical Understanding
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
FreeViS: Training-free Video Stylization with Inconsistent References
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
ViVo: A Dataset for Volumetric Video Reconstruction and Compression
di: Azzarelli, Adrian, et al.
Pubblicazione: (2025)
di: Azzarelli, Adrian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoS: Chain-of-Shot Prompting for Long Video Understanding
di: Hu, Jian, et al.
Pubblicazione: (2025) -
Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2024) -
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
di: Lin, Jiayi, et al.
Pubblicazione: (2024) -
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
di: Hu, Jian, et al.
Pubblicazione: (2025) -
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
di: Cheng, Zixu, et al.
Pubblicazione: (2025)