Visual Reasoning Agent: Robust Vision Systems in Remote Sensing via Inference-Time Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Chung-En Johnny, Jalaian, Brian, Bastian, Nathaniel D. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2025)
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2025)
Hydra: An Agentic Reasoning Approach for Enhancing Adversarial Robustness and Mitigating Hallucinations in Vision-Language Models
di: Chung-En, et al.
Pubblicazione: (2025)
di: Chung-En, et al.
Pubblicazione: (2025)
SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systems
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2026)
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2026)
Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
Learning Collective Dynamics of Multi-Agent Systems using Event-based Vision
di: Lee, Minah, et al.
Pubblicazione: (2024)
di: Lee, Minah, et al.
Pubblicazione: (2024)
AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
di: Qiu, Yilun, et al.
Pubblicazione: (2026)
DVM-SLAM: Decentralized Visual Monocular Simultaneous Localization and Mapping for Multi-Agent Systems
di: Bird, Joshua, et al.
Pubblicazione: (2025)
di: Bird, Joshua, et al.
Pubblicazione: (2025)
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
di: Sinha, Sanchit, et al.
Pubblicazione: (2025)
MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding
di: Zheng, Henry, et al.
Pubblicazione: (2026)
di: Zheng, Henry, et al.
Pubblicazione: (2026)
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
di: Xu, Yichang, et al.
Pubblicazione: (2026)
di: Xu, Yichang, et al.
Pubblicazione: (2026)
FetalAgents: A Multi-Agent System for Fetal Ultrasound Image and Video Analysis
di: Hu, Xiaotian, et al.
Pubblicazione: (2026)
di: Hu, Xiaotian, et al.
Pubblicazione: (2026)
Enhancing CLIP Robustness via Cross-Modality Alignment
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
ReCCur: A Recursive Corner-Case Curation Framework for Robust Vision-Language Understanding in Open and Edge Scenarios
di: Wei, Yihan, et al.
Pubblicazione: (2026)
di: Wei, Yihan, et al.
Pubblicazione: (2026)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration
di: Wei, Zheng, et al.
Pubblicazione: (2025)
di: Wei, Zheng, et al.
Pubblicazione: (2025)
V-Agent: An Interactive Video Search System Using Vision-Language Models
di: Park, SunYoung, et al.
Pubblicazione: (2025)
di: Park, SunYoung, et al.
Pubblicazione: (2025)
A Case Study of Counting the Number of Unique Users in Linear and Non-Linear Trails -- A Multi-Agent System Approach
di: Rahman, Tanvir
Pubblicazione: (2025)
di: Rahman, Tanvir
Pubblicazione: (2025)
RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows
di: Zhang, Kai, et al.
Pubblicazione: (2025)
di: Zhang, Kai, et al.
Pubblicazione: (2025)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
VideoMultiAgents: A Multi-Agent Framework for Video Question Answering
di: Kugo, Noriyuki, et al.
Pubblicazione: (2025)
di: Kugo, Noriyuki, et al.
Pubblicazione: (2025)
Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration
di: Hu, Xiaotian, et al.
Pubblicazione: (2026)
di: Hu, Xiaotian, et al.
Pubblicazione: (2026)
Visual Reasoning over Time Series via Multi-Agent System
di: Ruan, Weilin, et al.
Pubblicazione: (2026)
di: Ruan, Weilin, et al.
Pubblicazione: (2026)
Sentinel: Embodied Cooperative Spatial Reasoning and Planning
di: Lin, Xiangye, et al.
Pubblicazione: (2026)
di: Lin, Xiangye, et al.
Pubblicazione: (2026)
MARIC: Multi-Agent Reasoning for Image Classification
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
di: Seo, Wonduk, et al.
Pubblicazione: (2025)
Chain-of-Anomaly Thoughts with Large Vision-Language Models
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
di: Domingos, Pedro, et al.
Pubblicazione: (2025)
AURA: A Multi-Modal Medical Agent for Understanding, Reasoning & Annotation
di: Fathi, Nima, et al.
Pubblicazione: (2025)
di: Fathi, Nima, et al.
Pubblicazione: (2025)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
di: Li, Yuankai, et al.
Pubblicazione: (2026)
di: Li, Yuankai, et al.
Pubblicazione: (2026)
Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance
di: Wang, Xiangxiang, et al.
Pubblicazione: (2025)
di: Wang, Xiangxiang, et al.
Pubblicazione: (2025)
OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis
di: Hao, Jing, et al.
Pubblicazione: (2026)
di: Hao, Jing, et al.
Pubblicazione: (2026)
Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
di: Vlachos, Angelos, et al.
Pubblicazione: (2025)
Visual Sensor Pose Optimisation Using Visibility Models for Smart Cities
di: Arnold, Eduardo, et al.
Pubblicazione: (2021)
di: Arnold, Eduardo, et al.
Pubblicazione: (2021)
EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow
di: Pan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Pan, Xiaoyu, et al.
Pubblicazione: (2025)
A Multi-Agent System Enables Versatile Information Extraction from the Chemical Literature
di: Chen, Yufan, et al.
Pubblicazione: (2025)
di: Chen, Yufan, et al.
Pubblicazione: (2025)
AstroVLM: Expert Multi-agent Collaborative Reasoning for Astronomical Imaging Quality Diagnosis
di: Han, Yaohui, et al.
Pubblicazione: (2026)
di: Han, Yaohui, et al.
Pubblicazione: (2026)
LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization
di: Meng, Chutian, et al.
Pubblicazione: (2026)
di: Meng, Chutian, et al.
Pubblicazione: (2026)
StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
SPACE: 3D Spatial Co-operation and Exploration Framework for Robust Mapping and Coverage with Multi-Robot Systems
di: Ghanta, Sai Krishna, et al.
Pubblicazione: (2024)
di: Ghanta, Sai Krishna, et al.
Pubblicazione: (2024)
StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments
di: Kulinski, Sean, et al.
Pubblicazione: (2024)
di: Kulinski, Sean, et al.
Pubblicazione: (2024)
AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
di: Shi, Haoyuan, et al.
Pubblicazione: (2025)
di: Shi, Haoyuan, et al.
Pubblicazione: (2025)
TranSPORTmer: A Holistic Approach to Trajectory Understanding in Multi-Agent Sports
di: Capellera, Guillem, et al.
Pubblicazione: (2024)
di: Capellera, Guillem, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2025) -
Hydra: An Agentic Reasoning Approach for Enhancing Adversarial Robustness and Mitigating Hallucinations in Vision-Language Models
di: Chung-En, et al.
Pubblicazione: (2025) -
SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systems
di: Yu, Chung-En Johnny, et al.
Pubblicazione: (2026) -
Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
di: Yu, Xinlei, et al.
Pubblicazione: (2025) -
Learning Collective Dynamics of Multi-Agent Systems using Event-based Vision
di: Lee, Minah, et al.
Pubblicazione: (2024)