"Previously on ..." From Recaps to Story Summarization
Fuente:
arXiv
Saved in:
| Main Authors: | Singh, Aditya Kumar, Srivastava, Dhruv, Tapaswi, Makarand |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MALeR: Improving Compositional Fidelity in Layout-Guided Generation
by: Saxena, Shivank, et al.
Published: (2025)
by: Saxena, Shivank, et al.
Published: (2025)
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
by: Gaur, Manu, et al.
Published: (2024)
by: Gaur, Manu, et al.
Published: (2024)
SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels
by: Singh, Darshan, et al.
Published: (2024)
by: Singh, Darshan, et al.
Published: (2024)
Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation
by: Gaur, Manu, et al.
Published: (2024)
by: Gaur, Manu, et al.
Published: (2024)
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
by: Darur, Balaji, et al.
Published: (2026)
by: Darur, Balaji, et al.
Published: (2026)
Seeing Eye to AI: Comparing Human Gaze and Model Attention in Video Memorability
by: Kumar, Prajneya, et al.
Published: (2023)
by: Kumar, Prajneya, et al.
Published: (2023)
Investigating Mechanisms for In-Context Vision Language Binding
by: Saravanan, Darshana, et al.
Published: (2025)
by: Saravanan, Darshana, et al.
Published: (2025)
What You See is What You Ask: Evaluating Audio Descriptions
by: Kala, Divy, et al.
Published: (2025)
by: Kala, Divy, et al.
Published: (2025)
MICap: A Unified Model for Identity-aware Movie Descriptions
by: Raajesh, Haran, et al.
Published: (2024)
by: Raajesh, Haran, et al.
Published: (2024)
STRinGS: Selective Text Refinement in Gaussian Splatting
by: Raundhal, Abhinav, et al.
Published: (2025)
by: Raundhal, Abhinav, et al.
Published: (2025)
Steerable Visual Representations
by: Ruthardt, Jona, et al.
Published: (2026)
by: Ruthardt, Jona, et al.
Published: (2026)
VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment
by: Saravanan, Darshana, et al.
Published: (2024)
by: Saravanan, Darshana, et al.
Published: (2024)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
by: Bagad, Piyush, et al.
Published: (2024)
by: Bagad, Piyush, et al.
Published: (2024)
UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer
by: Sharma, Dhruv, et al.
Published: (2024)
by: Sharma, Dhruv, et al.
Published: (2024)
More than a Moment: Towards Coherent Sequences of Audio Descriptions
by: Khandelwal, Eshika, et al.
Published: (2025)
by: Khandelwal, Eshika, et al.
Published: (2025)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
by: Shaar, Shaden, et al.
Published: (2026)
by: Shaar, Shaden, et al.
Published: (2026)
Autonomous Crack Detection using Deep Learning on Synthetic Thermogram Datasets
by: Pimpalkhare, Chinmay Makarand, et al.
Published: (2024)
by: Pimpalkhare, Chinmay Makarand, et al.
Published: (2024)
NurtureNet: A Multi-task Video-based Approach for Newborn Anthropometry
by: Khandelwal, Yash, et al.
Published: (2024)
by: Khandelwal, Yash, et al.
Published: (2024)
Previously on the Stories: Recap Snippet Identification for Story Reading
by: Li, Jiangnan, et al.
Published: (2024)
by: Li, Jiangnan, et al.
Published: (2024)
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
by: Arora, Aditya, et al.
Published: (2026)
by: Arora, Aditya, et al.
Published: (2026)
Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories
by: Jain, Chayan, et al.
Published: (2025)
by: Jain, Chayan, et al.
Published: (2025)
ISS-Geo142: A Benchmark for Geolocating Astronaut Photography from the International Space Station
by: Srivastava, Vedika, et al.
Published: (2025)
by: Srivastava, Vedika, et al.
Published: (2025)
EmoStory: Emotion-Aware Story Generation
by: Yang, Jingyuan, et al.
Published: (2026)
by: Yang, Jingyuan, et al.
Published: (2026)
Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames
by: Chen, Chao, et al.
Published: (2023)
by: Chen, Chao, et al.
Published: (2023)
Disentangling Polysemantic Neurons with a Null-Calibrated Polysemanticity Index and Causal Patch Interventions
by: Gupta, Manan, et al.
Published: (2025)
by: Gupta, Manan, et al.
Published: (2025)
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
by: Song, Kaiyu, et al.
Published: (2024)
by: Song, Kaiyu, et al.
Published: (2024)
A Review of YOLOv12: Attention-Based Enhancements vs. Previous Versions
by: Khanam, Rahima, et al.
Published: (2025)
by: Khanam, Rahima, et al.
Published: (2025)
Light Field Based 6DoF Tracking of Previously Unobserved Objects
by: Goncharov, Nikolai, et al.
Published: (2025)
by: Goncharov, Nikolai, et al.
Published: (2025)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
by: Sreenivas, Manogna, et al.
Published: (2026)
by: Sreenivas, Manogna, et al.
Published: (2026)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
by: Zhuang, Cailin, et al.
Published: (2025)
by: Zhuang, Cailin, et al.
Published: (2025)
LEMMA: Laplacian pyramids for Efficient Marine SeMAntic Segmentation
by: Gakhar, Ishaan, et al.
Published: (2026)
by: Gakhar, Ishaan, et al.
Published: (2026)
From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations
by: Li, Yuzhi, et al.
Published: (2025)
by: Li, Yuzhi, et al.
Published: (2025)
Segmentation-free Connectionist Temporal Classification loss based OCR Model for Text Captcha Classification
by: Khatavkar, Vaibhav, et al.
Published: (2024)
by: Khatavkar, Vaibhav, et al.
Published: (2024)
A Surrogate Model for the Forward Design of Multi-layered Metasurface-based Radar Absorbing Structures
by: Joy, Vineetha, et al.
Published: (2025)
by: Joy, Vineetha, et al.
Published: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
by: Yang, Shuai, et al.
Published: (2024)
by: Yang, Shuai, et al.
Published: (2024)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
by: Shen, Xiaoqian, et al.
Published: (2023)
by: Shen, Xiaoqian, et al.
Published: (2023)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
FolkTalent: Enhancing Classification and Tagging of Indian Folk Paintings
by: Hada, Nancy, et al.
Published: (2024)
by: Hada, Nancy, et al.
Published: (2024)
Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation
by: Gupta, Arnav, et al.
Published: (2025)
by: Gupta, Arnav, et al.
Published: (2025)
Similar Items
-
MALeR: Improving Compositional Fidelity in Layout-Guided Generation
by: Saxena, Shivank, et al.
Published: (2025) -
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
by: Gaur, Manu, et al.
Published: (2024) -
SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels
by: Singh, Darshan, et al.
Published: (2024) -
Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation
by: Gaur, Manu, et al.
Published: (2024) -
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
by: Darur, Balaji, et al.
Published: (2026)