Less is More: Label-Guided Summarization of Procedural and Instructional Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rajpal, Shreya, Golovanevsky, Michal, Eickhoff, Carsten |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
par: McLaughlin, Oliver, et autres
Publié: (2026)
par: McLaughlin, Oliver, et autres
Publié: (2026)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
par: Rudman, William, et autres
Publié: (2025)
par: Rudman, William, et autres
Publié: (2025)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024)
par: De Min, Thomas, et autres
Publié: (2024)
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
par: Wu, Yuanli, et autres
Publié: (2025)
par: Wu, Yuanli, et autres
Publié: (2025)
Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning
par: Li, Xuchen, et autres
Publié: (2025)
par: Li, Xuchen, et autres
Publié: (2025)
LIME: Less Is More for MLLM Evaluation
par: Zhu, King, et autres
Publié: (2024)
par: Zhu, King, et autres
Publié: (2024)
When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't
par: Nemitz, Jonathan, et autres
Publié: (2026)
par: Nemitz, Jonathan, et autres
Publié: (2026)
Less is More: The Influence of Pruning on the Explainability of CNNs
par: Merkle, Florian, et autres
Publié: (2023)
par: Merkle, Florian, et autres
Publié: (2023)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts
par: Golovanevsky, Michal, et autres
Publié: (2025)
par: Golovanevsky, Michal, et autres
Publié: (2025)
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
par: Zare, Ali, et autres
Publié: (2024)
par: Zare, Ali, et autres
Publié: (2024)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Mechanisms of Prompt-Induced Hallucination in Vision-Language Models
par: Rudman, William, et autres
Publié: (2026)
par: Rudman, William, et autres
Publié: (2026)
Guiding Video Prediction with Explicit Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024)
par: Takenaka, Patrick, et autres
Publié: (2024)
VideoSAGE: Video Summarization with Graph Representation Learning
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
Enhancing Video Summarization with Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
Comparing Learning Paradigms for Egocentric Video Summarization
par: Wen, Daniel
Publié: (2025)
par: Wen, Daniel
Publié: (2025)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025)
par: Tian, Xinyu, et autres
Publié: (2025)
Less is More: A Closer Look at Semantic-based Few-Shot Learning
par: Zhou, Chunpeng, et autres
Publié: (2024)
par: Zhou, Chunpeng, et autres
Publié: (2024)
Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization
par: Zhang, Zhiwang, et autres
Publié: (2025)
par: Zhang, Zhiwang, et autres
Publié: (2025)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
par: Tsigos, Konstantinos, et autres
Publié: (2024)
par: Tsigos, Konstantinos, et autres
Publié: (2024)
Cluster-based Video Summarization with Temporal Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
par: Zeng, Ziyun, et autres
Publié: (2026)
par: Zeng, Ziyun, et autres
Publié: (2026)
Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
par: Li, Yulin, et autres
Publié: (2025)
par: Li, Yulin, et autres
Publié: (2025)
Dense Video Captioning using Graph-based Sentence Summarization
par: Zhang, Zhiwang, et autres
Publié: (2025)
par: Zhang, Zhiwang, et autres
Publié: (2025)
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
par: Park, Jungin, et autres
Publié: (2025)
par: Park, Jungin, et autres
Publié: (2025)
An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
par: Eleftheriadis, Thomas, et autres
Publié: (2025)
par: Eleftheriadis, Thomas, et autres
Publié: (2025)
Exploring Efficient Foundational Multi-modal Models for Video Summarization
par: Samel, Karan, et autres
Publié: (2024)
par: Samel, Karan, et autres
Publié: (2024)
SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos
par: Niu, Yulei, et autres
Publié: (2024)
par: Niu, Yulei, et autres
Publié: (2024)
PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs
par: Assouel, Rim, et autres
Publié: (2026)
par: Assouel, Rim, et autres
Publié: (2026)
Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving
par: Yang, Sheng, et autres
Publié: (2025)
par: Yang, Sheng, et autres
Publié: (2025)
EdgeVidSum: Real-Time Personalized Video Summarization at the Edge
par: Mujtaba, Ghulam, et autres
Publié: (2025)
par: Mujtaba, Ghulam, et autres
Publié: (2025)
Early Exit and Multi Stage Knowledge Distillation in VLMs for Video Summarization
par: Khan, Anas Anwarul Haq, et autres
Publié: (2025)
par: Khan, Anas Anwarul Haq, et autres
Publié: (2025)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
YTCommentQA: Video Question Answerability in Instructional Videos
par: Yang, Saelyne, et autres
Publié: (2024)
par: Yang, Saelyne, et autres
Publié: (2024)
Unsupervised Transcript-assisted Video Summarization and Highlight Detection
par: Barbakos, Spyros, et autres
Publié: (2025)
par: Barbakos, Spyros, et autres
Publié: (2025)
Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation
par: Yuan, Kun, et autres
Publié: (2024)
par: Yuan, Kun, et autres
Publié: (2024)
TRIMMER: A New Paradigm for Video Summarization through Self-Supervised Reinforcement Learning
par: Mishra, Pritam, et autres
Publié: (2026)
par: Mishra, Pritam, et autres
Publié: (2026)
Sense Less, Generate More: Pre-training LiDAR Perception with Masked Autoencoders for Ultra-Efficient 3D Sensing
par: Tayebati, Sina, et autres
Publié: (2024)
par: Tayebati, Sina, et autres
Publié: (2024)
Documents similaires
-
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
par: McLaughlin, Oliver, et autres
Publié: (2026) -
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
par: Rudman, William, et autres
Publié: (2025) -
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
par: De Min, Thomas, et autres
Publié: (2024) -
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
par: Li, Xuchen, et autres
Publié: (2025) -
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
par: Wu, Yuanli, et autres
Publié: (2025)