OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Chujie, Lu, Jianyu, Luo, Zhiyuan, Chen, Xi, He, Chu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
von: Liu, Jiaqi, et al.
Veröffentlicht: (2025)
von: Liu, Jiaqi, et al.
Veröffentlicht: (2025)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
von: Yu, Xinlei, et al.
Veröffentlicht: (2025)
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
von: Zhang, Ben, et al.
Veröffentlicht: (2025)
von: Zhang, Ben, et al.
Veröffentlicht: (2025)
VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
von: Liu, Junming, et al.
Veröffentlicht: (2026)
von: Liu, Junming, et al.
Veröffentlicht: (2026)
Geometrically-Constrained Agent for Spatial Reasoning
von: Chen, Zeren, et al.
Veröffentlicht: (2025)
von: Chen, Zeren, et al.
Veröffentlicht: (2025)
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
von: Guo, Yuchen, et al.
Veröffentlicht: (2026)
von: Guo, Yuchen, et al.
Veröffentlicht: (2026)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
von: Gu, Zishan, et al.
Veröffentlicht: (2024)
von: Gu, Zishan, et al.
Veröffentlicht: (2024)
Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection
von: Zhou, Enshen, et al.
Veröffentlicht: (2024)
von: Zhou, Enshen, et al.
Veröffentlicht: (2024)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
von: Zhou, Jingqi, et al.
Veröffentlicht: (2024)
von: Zhou, Jingqi, et al.
Veröffentlicht: (2024)
Diving into Self-Evolving Training for Multimodal Reasoning
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
von: Jiang, Xi, et al.
Veröffentlicht: (2026)
von: Jiang, Xi, et al.
Veröffentlicht: (2026)
CorrDetail: Visual Detail Enhanced Self-Correction for Face Forgery Detection
von: Zhou, Binjia, et al.
Veröffentlicht: (2025)
von: Zhou, Binjia, et al.
Veröffentlicht: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
von: Chen, Yan, et al.
Veröffentlicht: (2025)
von: Chen, Yan, et al.
Veröffentlicht: (2025)
SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis
von: Chen, Zhangtianyi, et al.
Veröffentlicht: (2026)
von: Chen, Zhangtianyi, et al.
Veröffentlicht: (2026)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
von: Xu, Haoran, et al.
Veröffentlicht: (2026)
von: Xu, Haoran, et al.
Veröffentlicht: (2026)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
von: Zhang, Jesen, et al.
Veröffentlicht: (2025)
von: Zhang, Jesen, et al.
Veröffentlicht: (2025)
LP-OVOD: Open-Vocabulary Object Detection by Linear Probing
von: Pham, Chau, et al.
Veröffentlicht: (2023)
von: Pham, Chau, et al.
Veröffentlicht: (2023)
Transparent Visual Reasoning via Object-Centric Agent Collaboration
von: Teoh, Benjamin, et al.
Veröffentlicht: (2025)
von: Teoh, Benjamin, et al.
Veröffentlicht: (2025)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
von: Xi, Suyang, et al.
Veröffentlicht: (2026)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
von: Lin, Zichuan, et al.
Veröffentlicht: (2026)
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
von: Ning, Zhiwei, et al.
Veröffentlicht: (2026)
von: Ning, Zhiwei, et al.
Veröffentlicht: (2026)
Evolving Interpretable Visual Classifiers with Large Language Models
von: Chiquier, Mia, et al.
Veröffentlicht: (2024)
von: Chiquier, Mia, et al.
Veröffentlicht: (2024)
Instruction-tuned Self-Questioning Framework for Multimodal Reasoning
von: Jang, You-Won, et al.
Veröffentlicht: (2025)
von: Jang, You-Won, et al.
Veröffentlicht: (2025)
VisAgent: Narrative-Preserving Story Visualization Framework
von: Kim, Seungkwon, et al.
Veröffentlicht: (2025)
von: Kim, Seungkwon, et al.
Veröffentlicht: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization
von: Taoudi-Benchekroun, Yassine, et al.
Veröffentlicht: (2025)
von: Taoudi-Benchekroun, Yassine, et al.
Veröffentlicht: (2025)
Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
von: Guo, Guangfu, et al.
Veröffentlicht: (2026)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
von: Zhang, Jianke, et al.
Veröffentlicht: (2025)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
von: Yu, Jiazuo, et al.
Veröffentlicht: (2024)
von: Yu, Jiazuo, et al.
Veröffentlicht: (2024)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
von: Zheng, Yikai, et al.
Veröffentlicht: (2026)
von: Zheng, Yikai, et al.
Veröffentlicht: (2026)
Anti-Inpainting: A Proactive Defense Approach against Malicious Diffusion-based Inpainters under Unknown Conditions
von: Guo, Yimao, et al.
Veröffentlicht: (2025)
von: Guo, Yimao, et al.
Veröffentlicht: (2025)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
von: Shi, Fan, et al.
Veröffentlicht: (2025)
von: Shi, Fan, et al.
Veröffentlicht: (2025)
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
von: Xiong, Yuqi, et al.
Veröffentlicht: (2026)
von: Xiong, Yuqi, et al.
Veröffentlicht: (2026)
S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation
von: Xie, Yichen, et al.
Veröffentlicht: (2025)
von: Xie, Yichen, et al.
Veröffentlicht: (2025)
MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning
von: Cai, Zhixi, et al.
Veröffentlicht: (2026)
von: Cai, Zhixi, et al.
Veröffentlicht: (2026)
GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
On Explaining Visual Captioning with Hybrid Markov Logic Networks
von: Shah, Monika, et al.
Veröffentlicht: (2025)
von: Shah, Monika, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
von: Liu, Jiaqi, et al.
Veröffentlicht: (2025) -
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
von: Yu, Xinlei, et al.
Veröffentlicht: (2025) -
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
von: Zhang, Ben, et al.
Veröffentlicht: (2025) -
VIKSER: Visual Knowledge-Driven Self-Reinforcing Reasoning Framework
von: Wang, Chao, et al.
Veröffentlicht: (2025) -
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
von: Liu, Junming, et al.
Veröffentlicht: (2026)