Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yichi, Chen, Gongwei, Zhu, Jun, Wan, Jia, Nie, Liqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
di: Zhang, Renshan, et al.
Pubblicazione: (2025)
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
di: Chen, Yanda, et al.
Pubblicazione: (2025)
di: Chen, Yanda, et al.
Pubblicazione: (2025)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
di: Shen, Leyang, et al.
Pubblicazione: (2024)
di: Shen, Leyang, et al.
Pubblicazione: (2024)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
di: Lyu, Yibo, et al.
Pubblicazione: (2025)
di: Lyu, Yibo, et al.
Pubblicazione: (2025)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
di: Shi, Haoxiang, et al.
Pubblicazione: (2025)
di: Shi, Haoxiang, et al.
Pubblicazione: (2025)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
di: Lyu, Yibo, et al.
Pubblicazione: (2026)
di: Lyu, Yibo, et al.
Pubblicazione: (2026)
Reliable Representation Learning for Incomplete Multi-View Missing Multi-Label Classification
di: Liu, Chengliang, et al.
Pubblicazione: (2023)
di: Liu, Chengliang, et al.
Pubblicazione: (2023)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
Object-Shot Enhanced Grounding Network for Egocentric Video
di: Feng, Yisen, et al.
Pubblicazione: (2025)
di: Feng, Yisen, et al.
Pubblicazione: (2025)
Enhancing Diffusion-based Dataset Distillation via Adversary-Guided Curriculum Sampling
di: Zou, Lexiao, et al.
Pubblicazione: (2025)
di: Zou, Lexiao, et al.
Pubblicazione: (2025)
Text-promptable Object Counting via Quantity Awareness Enhancement
di: Shi, Miaojing, et al.
Pubblicazione: (2025)
di: Shi, Miaojing, et al.
Pubblicazione: (2025)
PVLR: Prompt-driven Visual-Linguistic Representation Learning for Multi-Label Image Recognition
di: Tan, Hao, et al.
Pubblicazione: (2024)
di: Tan, Hao, et al.
Pubblicazione: (2024)
Beyond Degradation Redundancy: Contrastive Prompt Learning for All-in-One Image Restoration
di: Wu, Gang, et al.
Pubblicazione: (2025)
di: Wu, Gang, et al.
Pubblicazione: (2025)
Quantity-Aware Coarse-to-Fine Correspondence for Image-to-Point Cloud Registration
di: Yao, Gongxin, et al.
Pubblicazione: (2023)
di: Yao, Gongxin, et al.
Pubblicazione: (2023)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
di: Li, Zaijing, et al.
Pubblicazione: (2026)
di: Li, Zaijing, et al.
Pubblicazione: (2026)
Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR
di: Li, Zhenyang, et al.
Pubblicazione: (2024)
di: Li, Zhenyang, et al.
Pubblicazione: (2024)
Less is More: Empowering GUI Agent with Context-Aware Simplification
di: Chen, Gongwei, et al.
Pubblicazione: (2025)
di: Chen, Gongwei, et al.
Pubblicazione: (2025)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
Embodied Crowd Counting
di: Long, Runling, et al.
Pubblicazione: (2025)
di: Long, Runling, et al.
Pubblicazione: (2025)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
di: Li, Yanyu, et al.
Pubblicazione: (2025)
di: Li, Yanyu, et al.
Pubblicazione: (2025)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2026)
di: He, Ruozhen, et al.
Pubblicazione: (2026)
Multimodal Reference Visual Grounding
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
Stage-wise Adaptive Label Distribution for Facial Age Estimation
di: Wu, Bo, et al.
Pubblicazione: (2025)
di: Wu, Bo, et al.
Pubblicazione: (2025)
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents
di: Shao, Rui, et al.
Pubblicazione: (2026)
di: Shao, Rui, et al.
Pubblicazione: (2026)
Dynamic in Static: Hybrid Visual Correspondence for Self-Supervised Video Object Segmentation
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
di: Pei, Gensheng, et al.
Pubblicazione: (2024)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
di: Li, Xuchen, et al.
Pubblicazione: (2026)
di: Li, Xuchen, et al.
Pubblicazione: (2026)
Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
di: Zafar, Anas, et al.
Pubblicazione: (2026)
di: Zafar, Anas, et al.
Pubblicazione: (2026)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
di: Wen, Haokun, et al.
Pubblicazione: (2026)
di: Wen, Haokun, et al.
Pubblicazione: (2026)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2025)
di: Wang, Langyu, et al.
Pubblicazione: (2025)
Rethinking Model Ensemble in Transfer-based Adversarial Attacks
di: Chen, Huanran, et al.
Pubblicazione: (2023)
di: Chen, Huanran, et al.
Pubblicazione: (2023)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
di: Fu, Zhiheng, et al.
Pubblicazione: (2026)
di: Fu, Zhiheng, et al.
Pubblicazione: (2026)
Beyond Object Categories: Multi-Attribute Reference Understanding for Visual Grounding
di: Guo, Hao, et al.
Pubblicazione: (2025)
di: Guo, Hao, et al.
Pubblicazione: (2025)
Uncertainty-Aware Pseudo-Label Filtering for Source-Free Unsupervised Domain Adaptation
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers
di: Ren, Li, et al.
Pubblicazione: (2025)
di: Ren, Li, et al.
Pubblicazione: (2025)
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
di: Zhu, Yijie, et al.
Pubblicazione: (2025)
Beyond the Label Itself: Latent Labels Enhance Semi-supervised Point Cloud Panoptic Segmentation
di: Chen, Yujun, et al.
Pubblicazione: (2023)
di: Chen, Yujun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers
di: Zhang, Renshan, et al.
Pubblicazione: (2025) -
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
di: Chen, Yanda, et al.
Pubblicazione: (2025) -
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
di: Shen, Leyang, et al.
Pubblicazione: (2024) -
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024) -
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
di: Lyu, Yibo, et al.
Pubblicazione: (2025)