Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Choi, Seung hee, Jeon, MinJu, Oh, Hyunwoo, Lee, Jihwan, Kim, Dong-Jin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
by: Jeon, MinJu, et al.
Published: (2025)
by: Jeon, MinJu, et al.
Published: (2025)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
by: Kim, Ye-Chan, et al.
Published: (2026)
by: Kim, Ye-Chan, et al.
Published: (2026)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
by: Kim, Si-Woo, et al.
Published: (2025)
by: Kim, Si-Woo, et al.
Published: (2025)
Rethinking Saliency-Guided Weakly-Supervised Semantic Segmentation
by: Kim, Beomyoung, et al.
Published: (2024)
by: Kim, Beomyoung, et al.
Published: (2024)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
by: Tao, Yilin, et al.
Published: (2025)
by: Tao, Yilin, et al.
Published: (2025)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
by: Kim, Minkuk, et al.
Published: (2024)
by: Kim, Minkuk, et al.
Published: (2024)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
by: Lee, Ji Soo, et al.
Published: (2025)
by: Lee, Ji Soo, et al.
Published: (2025)
ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation
by: Lee, Kwanyoung, et al.
Published: (2026)
by: Lee, Kwanyoung, et al.
Published: (2026)
ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
by: Ye, Jianping, et al.
Published: (2026)
by: Ye, Jianping, et al.
Published: (2026)
Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
by: Lee, Ji Soo, et al.
Published: (2025)
by: Lee, Ji Soo, et al.
Published: (2025)
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
by: Gordeev, Aleksandr, et al.
Published: (2024)
by: Gordeev, Aleksandr, et al.
Published: (2024)
VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness
by: Cha, SeungJu, et al.
Published: (2025)
by: Cha, SeungJu, et al.
Published: (2025)
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
by: Hou, Xiuquan, et al.
Published: (2024)
by: Hou, Xiuquan, et al.
Published: (2024)
Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation
by: Lee, Kwanyoung, et al.
Published: (2026)
by: Lee, Kwanyoung, et al.
Published: (2026)
Dense Video Object Captioning from Disjoint Supervision
by: Zhou, Xingyi, et al.
Published: (2023)
by: Zhou, Xingyi, et al.
Published: (2023)
Using Saliency and Cropping to Improve Video Memorability
by: Mudgal, Vaibhav, et al.
Published: (2023)
by: Mudgal, Vaibhav, et al.
Published: (2023)
Smooth Deep Saliency
by: Herdt, Rudolf, et al.
Published: (2024)
by: Herdt, Rudolf, et al.
Published: (2024)
Grains of Saliency: Optimizing Saliency-based Training of Biometric Attack Detection Models
by: Crum, Colton R., et al.
Published: (2024)
by: Crum, Colton R., et al.
Published: (2024)
Salience-SGG: Enhancing Unbiased Scene Graph Generation with Iterative Salience Estimation
by: Qu, Runfeng, et al.
Published: (2026)
by: Qu, Runfeng, et al.
Published: (2026)
Saliency-Aware Model Merging
by: Park, Jungin, et al.
Published: (2026)
by: Park, Jungin, et al.
Published: (2026)
Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning
by: Baek, Seung Hyup, et al.
Published: (2026)
by: Baek, Seung Hyup, et al.
Published: (2026)
HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning
by: Kim, Minkuk, et al.
Published: (2024)
by: Kim, Minkuk, et al.
Published: (2024)
Salience-Based Adaptive Masking: Revisiting Token Dynamics for Enhanced Pre-training
by: Choi, Hyesong, et al.
Published: (2024)
by: Choi, Hyesong, et al.
Published: (2024)
BIAS: A Biologically Inspired Algorithm for Video Saliency Detection
by: Zhang, Zhao-ji, et al.
Published: (2026)
by: Zhang, Zhao-ji, et al.
Published: (2026)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
by: Wang, Kun, et al.
Published: (2026)
by: Wang, Kun, et al.
Published: (2026)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2024)
by: Yu, Li, et al.
Published: (2024)
SMCL: Saliency Masked Contrastive Learning for Long-tailed Recognition
by: Park, Sanglee, et al.
Published: (2024)
by: Park, Sanglee, et al.
Published: (2024)
Saliency Map-based Image Retrieval using Invariant Krawtchouk Moments
by: Nejad, Ashkan, et al.
Published: (2024)
by: Nejad, Ashkan, et al.
Published: (2024)
Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
by: Li, Long, et al.
Published: (2025)
by: Li, Long, et al.
Published: (2025)
Streaming Dense Video Captioning
by: Zhou, Xingyi, et al.
Published: (2024)
by: Zhou, Xingyi, et al.
Published: (2024)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2025)
by: Yu, Li, et al.
Published: (2025)
SalFoM: Dynamic Saliency Prediction with Video Foundation Models
by: Moradi, Morteza, et al.
Published: (2024)
by: Moradi, Morteza, et al.
Published: (2024)
DiffSal: Joint Audio and Video Learning for Diffusion Saliency Prediction
by: Xiong, Junwen, et al.
Published: (2024)
by: Xiong, Junwen, et al.
Published: (2024)
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
by: Hooshanfar, Kiana, et al.
Published: (2025)
by: Hooshanfar, Kiana, et al.
Published: (2025)
Exploring Saliency Bias in Manipulation Detection
by: Krinsky, Joshua, et al.
Published: (2024)
by: Krinsky, Joshua, et al.
Published: (2024)
Hallucination Begins Where Saliency Drops
by: Zhang, Xiaofeng, et al.
Published: (2026)
by: Zhang, Xiaofeng, et al.
Published: (2026)
SAGE: Saliency-Guided Contrastive Embeddings
by: Crum, Colton R., et al.
Published: (2025)
by: Crum, Colton R., et al.
Published: (2025)
Saliency Guided Optimization of Diffusion Latents
by: Wang, Xiwen, et al.
Published: (2024)
by: Wang, Xiwen, et al.
Published: (2024)
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
by: Gong, Shizhan, et al.
Published: (2026)
by: Gong, Shizhan, et al.
Published: (2026)
See It All: Contextualized Late Aggregation for 3D Dense Captioning
by: Kim, Minjung, et al.
Published: (2024)
by: Kim, Minjung, et al.
Published: (2024)
Similar Items
-
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
by: Jeon, MinJu, et al.
Published: (2025) -
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
by: Kim, Ye-Chan, et al.
Published: (2026) -
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
by: Kim, Si-Woo, et al.
Published: (2025) -
Rethinking Saliency-Guided Weakly-Supervised Semantic Segmentation
by: Kim, Beomyoung, et al.
Published: (2024) -
Aesthetic Image Captioning with Saliency Enhanced MLLMs
by: Tao, Yilin, et al.
Published: (2025)