Visual Grounding with Attention-Driven Constraint Balancing
Fuente:
arXiv
Salvato in:
| Autori principali: | Kang, Weitai, Zhou, Luowei, Wu, Junyi, Sun, Changchang, Yan, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
On the Faithfulness of Vision Transformer Explanations
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision Transformer
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
di: Chen, Wenxin, et al.
Pubblicazione: (2025)
di: Chen, Wenxin, et al.
Pubblicazione: (2025)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Semantic-Cohesive Knowledge Distillation for Deep Cross-modal Hashing
di: Sun, Changchang, et al.
Pubblicazione: (2025)
di: Sun, Changchang, et al.
Pubblicazione: (2025)
MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs
di: Chen, Huiyi, et al.
Pubblicazione: (2025)
di: Chen, Huiyi, et al.
Pubblicazione: (2025)
SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention
di: Xiao, Feng, et al.
Pubblicazione: (2024)
di: Xiao, Feng, et al.
Pubblicazione: (2024)
TraceFlow: Dynamic 3D Reconstruction of Specular Scenes Driven by Ray Tracing
di: Tao, Jiachen, et al.
Pubblicazione: (2025)
di: Tao, Jiachen, et al.
Pubblicazione: (2025)
Finetuning-Free Personalization of Text to Image Generation via Hypernetworks
di: Shrestha, Sagar, et al.
Pubblicazione: (2025)
di: Shrestha, Sagar, et al.
Pubblicazione: (2025)
Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching
di: Yao, Gongxin, et al.
Pubblicazione: (2024)
di: Yao, Gongxin, et al.
Pubblicazione: (2024)
Enhancing Dance-to-Music Generation via Negative Conditioning Latent Diffusion Model
di: Sun, Changchang, et al.
Pubblicazione: (2025)
di: Sun, Changchang, et al.
Pubblicazione: (2025)
X-Field: A Physically Grounded Representation for 3D X-ray Reconstruction
di: Wang, Feiran, et al.
Pubblicazione: (2025)
di: Wang, Feiran, et al.
Pubblicazione: (2025)
Direct Visual Grounding by Directing Attention of Visual Tokens
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation
di: Chen, Sherry X., et al.
Pubblicazione: (2025)
di: Chen, Sherry X., et al.
Pubblicazione: (2025)
Dataset Quantization with Active Learning based Adaptive Sampling
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
Inline Critic Steers Image Editing
di: Kang, Weitai, et al.
Pubblicazione: (2026)
di: Kang, Weitai, et al.
Pubblicazione: (2026)
Consistent Instance Field for Dynamic Scene Understanding
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
di: Narnaware, Vishal, et al.
Pubblicazione: (2026)
di: Narnaware, Vishal, et al.
Pubblicazione: (2026)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
CogniMap3D: Cognitive 3D Mapping and Rapid Retrieval
di: Wang, Feiran, et al.
Pubblicazione: (2026)
di: Wang, Feiran, et al.
Pubblicazione: (2026)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
di: Yan, Qingyang, et al.
Pubblicazione: (2025)
di: Yan, Qingyang, et al.
Pubblicazione: (2025)
From Particles to Fields: Reframing Photon Mapping with Continuous Gaussian Photon Fields
di: Tao, Jiachen, et al.
Pubblicazione: (2025)
di: Tao, Jiachen, et al.
Pubblicazione: (2025)
LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation
di: Yan, Cilin, et al.
Pubblicazione: (2025)
di: Yan, Cilin, et al.
Pubblicazione: (2025)
In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation
di: Kang, Dahyun, et al.
Pubblicazione: (2024)
di: Kang, Dahyun, et al.
Pubblicazione: (2024)
Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems
di: Yuan, Qihao, et al.
Pubblicazione: (2024)
di: Yuan, Qihao, et al.
Pubblicazione: (2024)
BASIC: Semi-supervised Multi-organ Segmentation with Balanced Subclass Regularization and Semantic-conflict Penalty
di: Feng, Zhenghao, et al.
Pubblicazione: (2025)
di: Feng, Zhenghao, et al.
Pubblicazione: (2025)
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
di: Mohan, Deen Dayal, et al.
Pubblicazione: (2026)
di: Mohan, Deen Dayal, et al.
Pubblicazione: (2026)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
Efficient Multimodal Dataset Distillation via Generative Models
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
CaO$_2$: Rectifying Inconsistencies in Diffusion-Based Dataset Distillation
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
di: Yang, Jiabing, et al.
Pubblicazione: (2025)
di: Yang, Jiabing, et al.
Pubblicazione: (2025)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
Cambrian-P: Pose-Grounded Video Understanding
di: Yang, Jihan, et al.
Pubblicazione: (2026)
di: Yang, Jihan, et al.
Pubblicazione: (2026)
Recurrent Visual Feature Extraction and Stereo Attentions for CT Report Generation
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
On the Faithfulness of Vision Transformer Explanations
di: Wu, Junyi, et al.
Pubblicazione: (2024) -
Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision Transformer
di: Wu, Junyi, et al.
Pubblicazione: (2024) -
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
di: Kang, Weitai, et al.
Pubblicazione: (2025)