Adaptive Masking Enhances Visual Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Sen, Li, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
par: Lei, Bin, et autres
Publié: (2025)
par: Lei, Bin, et autres
Publié: (2025)
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
par: Yuan, Xinbin, et autres
Publié: (2025)
par: Yuan, Xinbin, et autres
Publié: (2025)
Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
par: Malik, Ashish, et autres
Publié: (2026)
par: Malik, Ashish, et autres
Publié: (2026)
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Enhancing Monotonic Modeling with Spatio-Temporal Adaptive Awareness in Diverse Marketing
par: Li, Bin, et autres
Publié: (2024)
par: Li, Bin, et autres
Publié: (2024)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
par: Yu, Jiaao, et autres
Publié: (2025)
par: Yu, Jiaao, et autres
Publié: (2025)
Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs
par: Pan, Jun-Yu, et autres
Publié: (2026)
par: Pan, Jun-Yu, et autres
Publié: (2026)
Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation
par: Jiang, Yubo, et autres
Publié: (2026)
par: Jiang, Yubo, et autres
Publié: (2026)
VEGAS: Towards Visually Explainable and Grounded Artificial Social Intelligence
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Adaptive Optimization for Enhanced Efficiency in Large-Scale Language Model Training
par: Chen, Jiajing, et autres
Publié: (2024)
par: Chen, Jiajing, et autres
Publié: (2024)
GUI-ARP: Enhancing Grounding with Adaptive Region Perception for GUI Agents
par: Ye, Xianhang, et autres
Publié: (2025)
par: Ye, Xianhang, et autres
Publié: (2025)
On Surprising Effectiveness of Masking Updates in Adaptive Optimizers
par: Joo, Taejong, et autres
Publié: (2026)
par: Joo, Taejong, et autres
Publié: (2026)
InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation
par: Chen, Qiaosheng, et autres
Publié: (2025)
par: Chen, Qiaosheng, et autres
Publié: (2025)
FlashVTG: Feature Layering and Adaptive Score Handling Network for Video Temporal Grounding
par: Cao, Zhuo, et autres
Publié: (2024)
par: Cao, Zhuo, et autres
Publié: (2024)
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026)
par: Jin, Zeyu, et autres
Publié: (2026)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
par: Jia, Furong, et autres
Publié: (2026)
par: Jia, Furong, et autres
Publié: (2026)
Fragment-Masked Diffusion for Molecular Optimization
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
Instruction-Guided Visual Masking
par: Zheng, Jinliang, et autres
Publié: (2024)
par: Zheng, Jinliang, et autres
Publié: (2024)
Visual Position Prompt for MLLM based Visual Grounding
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Aria-UI: Visual Grounding for GUI Instructions
par: Yang, Yuhao, et autres
Publié: (2024)
par: Yang, Yuhao, et autres
Publié: (2024)
Generative AI-Enhanced Cooperative MEC of UAVs and Ground Stations for Unmanned Surface Vehicles
par: You, Jiahao, et autres
Publié: (2025)
par: You, Jiahao, et autres
Publié: (2025)
EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models
par: Villa, Andrés, et autres
Publié: (2025)
par: Villa, Andrés, et autres
Publié: (2025)
Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
par: Gundersen, Benjamin, et autres
Publié: (2025)
par: Gundersen, Benjamin, et autres
Publié: (2025)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
par: Xu, Ziqiang, et autres
Publié: (2025)
par: Xu, Ziqiang, et autres
Publié: (2025)
Look Through Masks: Towards Masked Face Recognition with De-Occlusion Distillation
par: Li, Chenyu, et autres
Publié: (2024)
par: Li, Chenyu, et autres
Publié: (2024)
INVIGORATE: Interactive Visual Grounding and Grasping in Clutter
par: Zhang, Hanbo, et autres
Publié: (2021)
par: Zhang, Hanbo, et autres
Publié: (2021)
AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt
par: Zhao, Zijian, et autres
Publié: (2025)
par: Zhao, Zijian, et autres
Publié: (2025)
TruthLens: Visual Grounding for Universal DeepFake Reasoning
par: Kundu, Rohit, et autres
Publié: (2025)
par: Kundu, Rohit, et autres
Publié: (2025)
ADMFormer: An Adaptive-Decomposition Transformer with Time-Varying Masked Spatial Attention for Traffic Forecasting
par: Gu, Ruiwen, et autres
Publié: (2026)
par: Gu, Ruiwen, et autres
Publié: (2026)
Residual Tokens Enhance Masked Autoencoders for Speech Modeling
par: Sadok, Samir, et autres
Publié: (2026)
par: Sadok, Samir, et autres
Publié: (2026)
Quantum-Enhanced Adversarial Robustness in Artificial Intelligence
par: Sen, Jaydip
Publié: (2026)
par: Sen, Jaydip
Publié: (2026)
Grounding and Enhancing Informativeness and Utility in Dataset Distillation
par: Wang, Shaobo, et autres
Publié: (2026)
par: Wang, Shaobo, et autres
Publié: (2026)
OpenGrok: Enhancing SNS Data Processing with Distilled Knowledge and Mask-like Mechanisms
par: AI, Lumen, et autres
Publié: (2025)
par: AI, Lumen, et autres
Publié: (2025)
Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions
par: Liu, Quan, et autres
Publié: (2024)
par: Liu, Quan, et autres
Publié: (2024)
EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data
par: Chen, Xuetian, et autres
Publié: (2024)
par: Chen, Xuetian, et autres
Publié: (2024)
Learning Visually Grounded Domain Ontologies via Embodied Conversation and Explanation
par: Park, Jonghyuk, et autres
Publié: (2024)
par: Park, Jonghyuk, et autres
Publié: (2024)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
par: Chen, Chen, et autres
Publié: (2026)
par: Chen, Chen, et autres
Publié: (2026)
SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
par: Li, Kuan, et autres
Publié: (2026)
par: Li, Kuan, et autres
Publié: (2026)
Generating Visual Stories with Grounded and Coreferent Characters
par: Liu, Danyang, et autres
Publié: (2024)
par: Liu, Danyang, et autres
Publié: (2024)
Documents similaires
-
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
par: Lei, Bin, et autres
Publié: (2025) -
Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning
par: Yuan, Xinbin, et autres
Publié: (2025) -
Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
par: Malik, Ashish, et autres
Publié: (2026) -
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
par: Kang, Weitai, et autres
Publié: (2025) -
Enhancing Monotonic Modeling with Spatio-Temporal Adaptive Awareness in Diverse Marketing
par: Li, Bin, et autres
Publié: (2024)