SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Zixu, Pu, Yujiang, Gong, Shaogang, Kordjamshidi, Parisa, Kong, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Grounding Video Reasoning in Physical Signals
by: Osmanli, Alibay, et al.
Published: (2026)
by: Osmanli, Alibay, et al.
Published: (2026)
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
by: Hu, Jian, et al.
Published: (2025)
by: Hu, Jian, et al.
Published: (2025)
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
by: Hu, Jian, et al.
Published: (2025)
by: Hu, Jian, et al.
Published: (2025)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
by: Cheng, Zixu, et al.
Published: (2026)
by: Cheng, Zixu, et al.
Published: (2026)
Exploring Spatial Language Grounding Through Referring Expressions
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
by: Cheng, Zixu, et al.
Published: (2025)
by: Cheng, Zixu, et al.
Published: (2025)
NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
by: Kamali, Danial, et al.
Published: (2025)
by: Kamali, Danial, et al.
Published: (2025)
Narrowing the Gap between Vision and Action in Navigation
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing
by: Premsri, Tanawan, et al.
Published: (2025)
by: Premsri, Tanawan, et al.
Published: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
by: Tumu, Akshar, et al.
Published: (2025)
by: Tumu, Akshar, et al.
Published: (2025)
Procedural Mistake Detection via Action Effect Modeling
by: Guo, Wenliang, et al.
Published: (2025)
by: Guo, Wenliang, et al.
Published: (2025)
CoS: Chain-of-Shot Prompting for Long Video Understanding
by: Hu, Jian, et al.
Published: (2025)
by: Hu, Jian, et al.
Published: (2025)
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
by: Cao, Yu, et al.
Published: (2025)
by: Cao, Yu, et al.
Published: (2025)
Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
by: Pu, Yujiang, et al.
Published: (2025)
by: Pu, Yujiang, et al.
Published: (2025)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
by: Cao, Yu, et al.
Published: (2024)
by: Cao, Yu, et al.
Published: (2024)
HIVE: HIerarchical Volume Encoding for Neural Implicit Surface Reconstruction
by: Gu, Xiaodong, et al.
Published: (2024)
by: Gu, Xiaodong, et al.
Published: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
by: Barezi, Elham J., et al.
Published: (2024)
by: Barezi, Elham J., et al.
Published: (2024)
ASHiTA: Automatic Scene-grounded HIerarchical Task Analysis
by: Chang, Yun, et al.
Published: (2025)
by: Chang, Yun, et al.
Published: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
by: Ma, Tianyi, et al.
Published: (2025)
by: Ma, Tianyi, et al.
Published: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
by: Li, Wenrui, et al.
Published: (2024)
by: Li, Wenrui, et al.
Published: (2024)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
by: Cai, Weitong, et al.
Published: (2024)
by: Cai, Weitong, et al.
Published: (2024)
Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking
by: Sun, Shitong, et al.
Published: (2023)
by: Sun, Shitong, et al.
Published: (2023)
Neuro-Symbolic Spatial Reasoning in Segmentation
by: Lin, Jiayi, et al.
Published: (2025)
by: Lin, Jiayi, et al.
Published: (2025)
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
by: Zhao, Zengqun, et al.
Published: (2024)
by: Zhao, Zengqun, et al.
Published: (2024)
S4Fusion: Saliency-aware Selective State Space Model for Infrared Visible Image Fusion
by: Ma, Haolong, et al.
Published: (2024)
by: Ma, Haolong, et al.
Published: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
by: Zhang, Yue, et al.
Published: (2025)
by: Zhang, Yue, et al.
Published: (2025)
Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection
by: Pu, Yujiang, et al.
Published: (2023)
by: Pu, Yujiang, et al.
Published: (2023)
Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation
by: Hu, Jian, et al.
Published: (2024)
by: Hu, Jian, et al.
Published: (2024)
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
by: Lin, Jiayi, et al.
Published: (2024)
by: Lin, Jiayi, et al.
Published: (2024)
Discovering Failure Modes in Vision-Language Models using RL
by: Jain, Kanishk, et al.
Published: (2026)
by: Jain, Kanishk, et al.
Published: (2026)
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
by: Gong, Shizhan, et al.
Published: (2026)
by: Gong, Shizhan, et al.
Published: (2026)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
by: Zhang, Zheyuan, et al.
Published: (2024)
by: Zhang, Zheyuan, et al.
Published: (2024)
TempSAL -- Uncovering Temporal Information for Deep Saliency Prediction
by: Aydemir, Bahar, et al.
Published: (2023)
by: Aydemir, Bahar, et al.
Published: (2023)
Quality Assessment and Distortion-aware Saliency Prediction for AI-Generated Omnidirectional Images
by: Yang, Liu, et al.
Published: (2025)
by: Yang, Liu, et al.
Published: (2025)
ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
by: Hu, Jian, et al.
Published: (2025)
by: Hu, Jian, et al.
Published: (2025)
SIMON: Saliency-aware Integrative Multi-view Object-centric Neural Decoding
by: Lin, YuSheng, et al.
Published: (2026)
by: Lin, YuSheng, et al.
Published: (2026)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
by: Fu, Zhiheng, et al.
Published: (2026)
by: Fu, Zhiheng, et al.
Published: (2026)
SOTA: Spike-Navigated Optimal TrAnsport Saliency Region Detection in Composite-bias Videos
by: Liu, Wenxuan, et al.
Published: (2025)
by: Liu, Wenxuan, et al.
Published: (2025)
Ranking-aware adapter for text-driven image ordering with CLIP
by: Yu, Wei-Hsiang, et al.
Published: (2024)
by: Yu, Wei-Hsiang, et al.
Published: (2024)
Similar Items
-
Grounding Video Reasoning in Physical Signals
by: Osmanli, Alibay, et al.
Published: (2026) -
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
by: Hu, Jian, et al.
Published: (2025) -
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
by: Hu, Jian, et al.
Published: (2025) -
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
by: Cheng, Zixu, et al.
Published: (2026) -
Exploring Spatial Language Grounding Through Referring Expressions
by: Tumu, Akshar, et al.
Published: (2025)