RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Wenfang, Chen, Hao, Du, Yingjun, Zheng, Yefeng, Snoek, Cees G. M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
Training-Free Semantic Segmentation via LLM-Supervision
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
di: Du, Yingjun, et al.
Pubblicazione: (2023)
di: Du, Yingjun, et al.
Pubblicazione: (2023)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
R-MAE: Regions Meet Masked Autoencoders
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
Prompt Diffusion Robustifies Any-Modality Prompt Learning
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
RCA: Region Conditioned Adaptation for Visual Abductive Reasoning
di: Zhang, Hao, et al.
Pubblicazione: (2023)
di: Zhang, Hao, et al.
Pubblicazione: (2023)
Low-Resource Vision Challenges for Foundation Models
di: Zhang, Yunhua, et al.
Pubblicazione: (2024)
di: Zhang, Yunhua, et al.
Pubblicazione: (2024)
FVO: Fast Visual Odometry with Transformers
di: Yugay, Vlardimir, et al.
Pubblicazione: (2025)
di: Yugay, Vlardimir, et al.
Pubblicazione: (2025)
CaPo: Cooperative Plan Optimization for Efficient Embodied Multi-Agent Cooperation
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning
di: Zheng, Lihao, et al.
Pubblicazione: (2025)
di: Zheng, Lihao, et al.
Pubblicazione: (2025)
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
NeoBabel: A Multilingual Open Tower for Visual Generation
di: Derakhshani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Derakhshani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning
di: Bhowmik, Aritra, et al.
Pubblicazione: (2024)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2024)
Dual Guidance Semi-Supervised Action Detection
di: Singh, Ankit, et al.
Pubblicazione: (2025)
di: Singh, Ankit, et al.
Pubblicazione: (2025)
SimPLR: A Simple and Plain Transformer for Efficient Object Detection and Segmentation
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
Segment Any 3D-Part in a Scene from a Sentence
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
di: Dorkenwald, Michael, et al.
Pubblicazione: (2024)
di: Dorkenwald, Michael, et al.
Pubblicazione: (2024)
A Simple and Better Baseline for Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
Beyond Coarse-Grained Matching in Video-Text Retrieval
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
di: Wang, Ziqi, et al.
Pubblicazione: (2025)
Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
di: Wei, Zhaoyang, et al.
Pubblicazione: (2025)
di: Wei, Zhaoyang, et al.
Pubblicazione: (2025)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
di: Luo, Liqin, et al.
Pubblicazione: (2025)
di: Luo, Liqin, et al.
Pubblicazione: (2025)
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Reasoning Matters for 3D Visual Grounding
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning
di: Yang, Bangji, et al.
Pubblicazione: (2026)
di: Yang, Bangji, et al.
Pubblicazione: (2026)
Elastic ViTs from Pretrained Models without Retraining
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
Lost in Time: A New Temporal Benchmark for VideoLLMs
di: Cores, Daniel, et al.
Pubblicazione: (2024)
di: Cores, Daniel, et al.
Pubblicazione: (2024)
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
Any-Shift Prompting for Generalization over Distributions
di: Xiao, Zehao, et al.
Pubblicazione: (2024)
di: Xiao, Zehao, et al.
Pubblicazione: (2024)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
Union-over-Intersections: Object Detection beyond Winner-Takes-All
di: Bhowmik, Aritra, et al.
Pubblicazione: (2023)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2023)
MROSS: Multi-Round Region-based Optimization for Scene Sketching
di: Liang, Yiqi, et al.
Pubblicazione: (2024)
di: Liang, Yiqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
di: Sun, Wenfang, et al.
Pubblicazione: (2024) -
IPO: Interpretable Prompt Optimization for Vision-Language Models
di: Du, Yingjun, et al.
Pubblicazione: (2024) -
Training-Free Semantic Segmentation via LLM-Supervision
di: Sun, Wenfang, et al.
Pubblicazione: (2024) -
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
di: Du, Yingjun, et al.
Pubblicazione: (2023) -
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)