Referencing Where to Focus: Improving VisualGrounding with Referential Query
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yabing, Tian, Zhuotao, Guo, Qingpei, Qin, Zheng, Zhou, Sanping, Yang, Ming, Wang, Le |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2025)
di: Wang, Yabing, et al.
Pubblicazione: (2025)
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2024)
di: Sun, Xiaolong, et al.
Pubblicazione: (2024)
Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
Versatile Multimodal Controls for Expressive Talking Human Animation
di: Qin, Zheng, et al.
Pubblicazione: (2025)
di: Qin, Zheng, et al.
Pubblicazione: (2025)
Moment Quantization for Video Temporal Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
Grounding Language in Multi-Perspective Referential Communication
di: Tang, Zineng, et al.
Pubblicazione: (2024)
di: Tang, Zineng, et al.
Pubblicazione: (2024)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2024)
di: Wang, Yabing, et al.
Pubblicazione: (2024)
Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
di: Li, Yulin, et al.
Pubblicazione: (2025)
di: Li, Yulin, et al.
Pubblicazione: (2025)
PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning
di: Li, Yizhe, et al.
Pubblicazione: (2025)
di: Li, Yizhe, et al.
Pubblicazione: (2025)
Dual Tuning for Reasoning Efficacy-Driven Data Curation in Multimodal LLM Training
di: Zheng, Ruobing, et al.
Pubblicazione: (2026)
di: Zheng, Ruobing, et al.
Pubblicazione: (2026)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
di: Ouyang, Mingyu, et al.
Pubblicazione: (2026)
di: Ouyang, Mingyu, et al.
Pubblicazione: (2026)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
di: Le, Binh M., et al.
Pubblicazione: (2025)
di: Le, Binh M., et al.
Pubblicazione: (2025)
SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs
di: Wang, Siting, et al.
Pubblicazione: (2025)
di: Wang, Siting, et al.
Pubblicazione: (2025)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
di: Fei, Senyu, et al.
Pubblicazione: (2025)
di: Fei, Senyu, et al.
Pubblicazione: (2025)
Grounding Language Models for Visual Entity Recognition
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
Robust Noisy Label Learning via Two-Stream Sample Distillation
di: Bai, Sihan, et al.
Pubblicazione: (2024)
di: Bai, Sihan, et al.
Pubblicazione: (2024)
According to Me: Long-Term Personalized Referential Memory QA
di: Mei, Jingbiao, et al.
Pubblicazione: (2026)
di: Mei, Jingbiao, et al.
Pubblicazione: (2026)
Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries
di: Wu, Yin, et al.
Pubblicazione: (2025)
di: Wu, Yin, et al.
Pubblicazione: (2025)
LVLMs and Humans Ground Differently in Referential Communication
di: Zeng, Peter, et al.
Pubblicazione: (2026)
di: Zeng, Peter, et al.
Pubblicazione: (2026)
VGR: Visual Grounded Reasoning
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation
di: Gao, Ning, et al.
Pubblicazione: (2024)
di: Gao, Ning, et al.
Pubblicazione: (2024)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
di: Wang, Shaoguang, et al.
Pubblicazione: (2026)
di: Wang, Shaoguang, et al.
Pubblicazione: (2026)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
FlowRAM: Grounding Flow Matching Policy with Region-Aware Mamba Framework for Robotic Manipulation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual Grounding
di: Unal, Ozan, et al.
Pubblicazione: (2023)
di: Unal, Ozan, et al.
Pubblicazione: (2023)
ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding
di: Wang, Austin T., et al.
Pubblicazione: (2025)
di: Wang, Austin T., et al.
Pubblicazione: (2025)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
ReCap: Lightweight Referential Grounding for Coherent Story Visualization
di: Arora, Aditya, et al.
Pubblicazione: (2026)
di: Arora, Aditya, et al.
Pubblicazione: (2026)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
di: Xiao, Han, et al.
Pubblicazione: (2025)
di: Xiao, Han, et al.
Pubblicazione: (2025)
Towards Generalizable Multi-Object Tracking
di: Qin, Zheng, et al.
Pubblicazione: (2024)
di: Qin, Zheng, et al.
Pubblicazione: (2024)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
di: Guo, Pinxue, et al.
Pubblicazione: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Generalizable Entity Grounding via Assistance of Large Language Model
di: Qi, Lu, et al.
Pubblicazione: (2024)
di: Qi, Lu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2025) -
Diversifying Query: Region-Guided Transformer for Temporal Sentence Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2024) -
Embracing Aleatoric Uncertainty: Generating Diverse 3D Human Motion
di: Qin, Zheng, et al.
Pubblicazione: (2025) -
RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation
di: Qin, Zheng, et al.
Pubblicazione: (2025) -
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)