Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Minkuk, Kim, Hyeon Bae, Moon, Jinyoung, Choi, Jinwoo, Kim, Seong Tae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
SurgX: Neuron-Concept Association for Explainable Surgical Phase Recognition
di: Kim, Ka Young, et al.
Pubblicazione: (2025)
di: Kim, Ka Young, et al.
Pubblicazione: (2025)
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
WWW: A Unified Framework for Explaining What, Where and Why of Neural Networks by Interpretation of Neuron Concepts
di: Ahn, Yong Hyun, et al.
Pubblicazione: (2024)
di: Ahn, Yong Hyun, et al.
Pubblicazione: (2024)
Mask-Free Neuron Concept Annotation for Interpreting Neural Networks in Medical Domain
di: Kim, Hyeon Bae, et al.
Pubblicazione: (2024)
di: Kim, Hyeon Bae, et al.
Pubblicazione: (2024)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
PCBEAR: Pose Concept Bottleneck for Explainable Action Recognition
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
DEVIAS: Learning Disentangled Video Representations of Action and Scene
di: Bae, Kyungho, et al.
Pubblicazione: (2023)
di: Bae, Kyungho, et al.
Pubblicazione: (2023)
ESSENTIAL: Episodic and Semantic Memory Integration for Video Class-Incremental Learning
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
di: Lee, Jongseo, et al.
Pubblicazione: (2025)
A Review of Image Retrieval Techniques: Data Augmentation and Adversarial Learning Approaches
di: Jinwoo, Kim
Pubblicazione: (2024)
di: Jinwoo, Kim
Pubblicazione: (2024)
PCEvE: Part Contribution Evaluation Based Model Explanation for Human Figure Drawing Assessment and Beyond
di: Lee, Jongseo, et al.
Pubblicazione: (2024)
di: Lee, Jongseo, et al.
Pubblicazione: (2024)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
di: Kim, Ye-Chan, et al.
Pubblicazione: (2026)
Time-Scaling State-Space Models for Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
Bi-directional Contextual Attention for 3D Dense Captioning
di: Kim, Minjung, et al.
Pubblicazione: (2024)
di: Kim, Minjung, et al.
Pubblicazione: (2024)
See It All: Contextualized Late Aggregation for 3D Dense Captioning
di: Kim, Minjung, et al.
Pubblicazione: (2024)
di: Kim, Minjung, et al.
Pubblicazione: (2024)
Learning Multi-frame and Monocular Prior for Estimating Geometry in Dynamic Scenes
di: Park, Seong Hyeon, et al.
Pubblicazione: (2025)
di: Park, Seong Hyeon, et al.
Pubblicazione: (2025)
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
di: Park, Jinyoung, et al.
Pubblicazione: (2025)
MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations
di: Bae, Kyungho, et al.
Pubblicazione: (2025)
di: Bae, Kyungho, et al.
Pubblicazione: (2025)
Weakly Supervised Video Scene Graph Generation via Natural Language Supervision
di: Kim, Kibum, et al.
Pubblicazione: (2025)
di: Kim, Kibum, et al.
Pubblicazione: (2025)
EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
di: Ahn, Geo, et al.
Pubblicazione: (2026)
di: Ahn, Geo, et al.
Pubblicazione: (2026)
HERO-VQL: Hierarchical, Egocentric and Robust Visual Query Localization
di: Chang, Joohyun, et al.
Pubblicazione: (2025)
di: Chang, Joohyun, et al.
Pubblicazione: (2025)
Body-Hand Modality Expertized Networks with Cross-attention for Fine-grained Skeleton Action Recognition
di: Cho, Seungyeon, et al.
Pubblicazione: (2025)
di: Cho, Seungyeon, et al.
Pubblicazione: (2025)
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video
di: Choi, Chanhyuk, et al.
Pubblicazione: (2026)
di: Choi, Chanhyuk, et al.
Pubblicazione: (2026)
Leveraging Textual Compositional Reasoning for Robust Change Captioning
di: Park, Kyu Ri, et al.
Pubblicazione: (2025)
di: Park, Kyu Ri, et al.
Pubblicazione: (2025)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
di: Jia, Mingda, et al.
Pubblicazione: (2025)
di: Jia, Mingda, et al.
Pubblicazione: (2025)
ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval
di: Kim, Ji-Hyeon, et al.
Pubblicazione: (2026)
di: Kim, Ji-Hyeon, et al.
Pubblicazione: (2026)
I$^2$-SLAM: Inverting Imaging Process for Robust Photorealistic Dense SLAM
di: Bae, Gwangtak, et al.
Pubblicazione: (2024)
di: Bae, Gwangtak, et al.
Pubblicazione: (2024)
SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding
di: Han, Jiwook, et al.
Pubblicazione: (2026)
di: Han, Jiwook, et al.
Pubblicazione: (2026)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
di: Kim, Younggun, et al.
Pubblicazione: (2025)
di: Kim, Younggun, et al.
Pubblicazione: (2025)
See-Saw Modality Balance: See Gradient, and Sew Impaired Vision-Language Balance to Mitigate Dominant Modality Bias
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2025)
di: Kwon, JuneHyoung, et al.
Pubblicazione: (2025)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
di: Shin, Jongmin, et al.
Pubblicazione: (2026)
di: Shin, Jongmin, et al.
Pubblicazione: (2026)
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
VideoMamba: Spatio-Temporal Selective State Space Model
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
Analyzing Effects of Mixed Sample Data Augmentation on Model Interpretability
di: Won, Soyoun, et al.
Pubblicazione: (2023)
di: Won, Soyoun, et al.
Pubblicazione: (2023)
Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs
di: Lee, Jongseo, et al.
Pubblicazione: (2026)
di: Lee, Jongseo, et al.
Pubblicazione: (2026)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning
di: Kim, Minkuk, et al.
Pubblicazione: (2024) -
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024) -
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025) -
SurgX: Neuron-Concept Association for Explainable Surgical Phase Recognition
di: Kim, Ka Young, et al.
Pubblicazione: (2025) -
Disentangled Concepts Speak Louder Than Words: Explainable Video Action Recognition
di: Lee, Jongseo, et al.
Pubblicazione: (2025)