Visual Grounding for Object-Level Generalization in Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Haobin, Lu, Zongqing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RELO: Reinforcement Learning to Localize for Visual Object Tracking
von: Chen, Xin, et al.
Veröffentlicht: (2026)
von: Chen, Xin, et al.
Veröffentlicht: (2026)
Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
von: Gundersen, Benjamin, et al.
Veröffentlicht: (2025)
von: Gundersen, Benjamin, et al.
Veröffentlicht: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
von: Jiang, Yankai, et al.
Veröffentlicht: (2026)
von: Jiang, Yankai, et al.
Veröffentlicht: (2026)
Reinforcement Learning Friendly Vision-Language Model for Minecraft
von: Jiang, Haobin, et al.
Veröffentlicht: (2023)
von: Jiang, Haobin, et al.
Veröffentlicht: (2023)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
von: Wei, Tong, et al.
Veröffentlicht: (2025)
von: Wei, Tong, et al.
Veröffentlicht: (2025)
OLIVE: Object Level In-Context Visual Embeddings
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
Robust Motion Generation using Part-level Reliable Data from Videos
von: Li, Boyuan, et al.
Veröffentlicht: (2025)
von: Li, Boyuan, et al.
Veröffentlicht: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2025)
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2025)
Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
von: Du, Yong, et al.
Veröffentlicht: (2025)
von: Du, Yong, et al.
Veröffentlicht: (2025)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
von: Yan, Zhonghao, et al.
Veröffentlicht: (2025)
von: Yan, Zhonghao, et al.
Veröffentlicht: (2025)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
von: Rahman, Md Ashikur, et al.
Veröffentlicht: (2026)
von: Rahman, Md Ashikur, et al.
Veröffentlicht: (2026)
OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data
von: Cao, Bin, et al.
Veröffentlicht: (2026)
von: Cao, Bin, et al.
Veröffentlicht: (2026)
ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
von: Lv, Guannan, et al.
Veröffentlicht: (2026)
von: Lv, Guannan, et al.
Veröffentlicht: (2026)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
von: Ma, Xinyu, et al.
Veröffentlicht: (2025)
von: Ma, Xinyu, et al.
Veröffentlicht: (2025)
Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation
von: Suzuki, Rena, et al.
Veröffentlicht: (2026)
von: Suzuki, Rena, et al.
Veröffentlicht: (2026)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
von: Zheng, Sipeng, et al.
Veröffentlicht: (2024)
von: Zheng, Sipeng, et al.
Veröffentlicht: (2024)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
von: Lee, Daeun, et al.
Veröffentlicht: (2026)
von: Lee, Daeun, et al.
Veröffentlicht: (2026)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2024)
von: Zhang, Wanpeng, et al.
Veröffentlicht: (2024)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning
von: Feiding, et al.
Veröffentlicht: (2026)
von: Feiding, et al.
Veröffentlicht: (2026)
Improving Zero-Shot Object-Level Change Detection by Incorporating Visual Correspondence
von: Nguyen, Hung Huy, et al.
Veröffentlicht: (2025)
von: Nguyen, Hung Huy, et al.
Veröffentlicht: (2025)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
von: Liu, Ye, et al.
Veröffentlicht: (2025)
von: Liu, Ye, et al.
Veröffentlicht: (2025)
SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens
von: Brown, Alexandre, et al.
Veröffentlicht: (2025)
von: Brown, Alexandre, et al.
Veröffentlicht: (2025)
Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
von: Huang, Weikai, et al.
Veröffentlicht: (2025)
von: Huang, Weikai, et al.
Veröffentlicht: (2025)
Grounded Object Centric Learning
von: Kori, Avinash, et al.
Veröffentlicht: (2023)
von: Kori, Avinash, et al.
Veröffentlicht: (2023)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
von: Chen, Ruizhe, et al.
Veröffentlicht: (2025)
Grounding 3D Object Affordance with Language Instructions, Visual Observations and Interactions
von: Zhu, He, et al.
Veröffentlicht: (2025)
von: Zhu, He, et al.
Veröffentlicht: (2025)
Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation
von: Jiang, Yubo, et al.
Veröffentlicht: (2026)
von: Jiang, Yubo, et al.
Veröffentlicht: (2026)
Dream to Generalize: Zero-Shot Model-Based Reinforcement Learning for Unseen Visual Distractions
von: Ha, Jeongsoo, et al.
Veröffentlicht: (2025)
von: Ha, Jeongsoo, et al.
Veröffentlicht: (2025)
Learning Physical Dynamics for Object-centric Visual Prediction
von: Xu, Huilin, et al.
Veröffentlicht: (2024)
von: Xu, Huilin, et al.
Veröffentlicht: (2024)
Interacted Object Grounding in Spatio-Temporal Human-Object Interactions
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2024)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
von: Ding, Hao, et al.
Veröffentlicht: (2026)
von: Ding, Hao, et al.
Veröffentlicht: (2026)
Generating by Understanding: Neural Visual Generation with Logical Symbol Groundings
von: Peng, Yifei, et al.
Veröffentlicht: (2023)
von: Peng, Yifei, et al.
Veröffentlicht: (2023)
Augmented Commonsense Knowledge for Remote Object Grounding
von: Mohammadi, Bahram, et al.
Veröffentlicht: (2024)
von: Mohammadi, Bahram, et al.
Veröffentlicht: (2024)
VGR: Visual Grounded Reasoning
von: Wang, Jiacong, et al.
Veröffentlicht: (2025)
von: Wang, Jiacong, et al.
Veröffentlicht: (2025)
MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
von: Jiang, Zheng, et al.
Veröffentlicht: (2026)
von: Jiang, Zheng, et al.
Veröffentlicht: (2026)
Visual Position Prompt for MLLM based Visual Grounding
von: Tang, Wei, et al.
Veröffentlicht: (2025)
von: Tang, Wei, et al.
Veröffentlicht: (2025)
Towards Understanding Visual Grounding in Visual Language Models
von: Pantazopoulos, Georgios, et al.
Veröffentlicht: (2025)
von: Pantazopoulos, Georgios, et al.
Veröffentlicht: (2025)
A Study of Commonsense Reasoning over Visual Object Properties
von: Kolari, Abhishek, et al.
Veröffentlicht: (2025)
von: Kolari, Abhishek, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
RELO: Reinforcement Learning to Localize for Visual Object Tracking
von: Chen, Xin, et al.
Veröffentlicht: (2026) -
Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
von: Gundersen, Benjamin, et al.
Veröffentlicht: (2025) -
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
von: Jiang, Yankai, et al.
Veröffentlicht: (2026) -
Reinforcement Learning Friendly Vision-Language Model for Minecraft
von: Jiang, Haobin, et al.
Veröffentlicht: (2023) -
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
von: Wei, Tong, et al.
Veröffentlicht: (2025)