Enregistré dans:
| Auteurs principaux: | Halder, Sourav, Tong, Jinjun, Wu, Xinyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2509.18405 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Are Large Vision Language Models Good Game Players?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation
par: Abraham, Savitha Sam, et autres
Publié: (2024)
par: Abraham, Savitha Sam, et autres
Publié: (2024)
Chain-of-Adaptation: Surgical Vision-Language Adaptation with Reinforcement Learning
par: Li, Jiajie, et autres
Publié: (2026)
par: Li, Jiajie, et autres
Publié: (2026)
Environmental Understanding Vision-Language Model for Embodied Agent
par: Bang, Jinsik, et autres
Publié: (2026)
par: Bang, Jinsik, et autres
Publié: (2026)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Leveraging Chat-Based Large Vision Language Models for Multimodal Out-Of-Context Detection
par: Shalabi, Fatma, et autres
Publié: (2024)
par: Shalabi, Fatma, et autres
Publié: (2024)
Detecting and Mitigating Hateful Content in Multimodal Memes with Vision-Language Models
par: Van, Minh-Hao, et autres
Publié: (2025)
par: Van, Minh-Hao, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
par: Dong, Xinpeng, et autres
Publié: (2026)
par: Dong, Xinpeng, et autres
Publié: (2026)
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
par: Wu, Kangyi, et autres
Publié: (2026)
par: Wu, Kangyi, et autres
Publié: (2026)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
Automated Facility Enumeration for Building Compliance Checking using Door Detection and Large Language Models
par: Zhang, Licheng, et autres
Publié: (2025)
par: Zhang, Licheng, et autres
Publié: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
par: Kumbhar, Shrinidhi, et autres
Publié: (2026)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
par: Han, Xiao, et autres
Publié: (2024)
par: Han, Xiao, et autres
Publié: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
par: Ai, Wei, et autres
Publié: (2026)
par: Ai, Wei, et autres
Publié: (2026)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
par: Zhai, Yuexiang, et autres
Publié: (2024)
par: Zhai, Yuexiang, et autres
Publié: (2024)
ScreenAgent: A Vision Language Model-driven Computer Control Agent
par: Niu, Runliang, et autres
Publié: (2024)
par: Niu, Runliang, et autres
Publié: (2024)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses
par: Jiang, Zhuohang, et autres
Publié: (2026)
par: Jiang, Zhuohang, et autres
Publié: (2026)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2025)
par: Zhang, Zilun, et autres
Publié: (2025)
DL$^3$M: A Vision-to-Language Framework for Expert-Level Medical Reasoning through Deep Learning and Large Language Models
par: Hasan, Md. Najib, et autres
Publié: (2025)
par: Hasan, Md. Najib, et autres
Publié: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
par: Wang, Xinhao, et autres
Publié: (2026)
par: Wang, Xinhao, et autres
Publié: (2026)
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
MirrorCheck: Efficient Adversarial Defense for Vision-Language Models
par: Fares, Samar, et autres
Publié: (2024)
par: Fares, Samar, et autres
Publié: (2024)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
par: Zou, Shu, et autres
Publié: (2025)
par: Zou, Shu, et autres
Publié: (2025)
Temporal Grounding of Activities using Multimodal Large Language Models
par: Song, Young Chol
Publié: (2024)
par: Song, Young Chol
Publié: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
par: Liang, Shuang, et autres
Publié: (2025)
par: Liang, Shuang, et autres
Publié: (2025)
ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
par: Wang, Kaishen, et autres
Publié: (2025)
par: Wang, Kaishen, et autres
Publié: (2025)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
Vision-Language Agents for Interactive Forest Change Analysis
par: Brock, James, et autres
Publié: (2026)
par: Brock, James, et autres
Publié: (2026)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
par: Babaiee, Zahra, et autres
Publié: (2025)
par: Babaiee, Zahra, et autres
Publié: (2025)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2026)
par: Huang, Wenxuan, et autres
Publié: (2026)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Jailbreaks on Vision Language Model via Multimodal Reasoning
par: Noheria, Aarush, et autres
Publié: (2026)
par: Noheria, Aarush, et autres
Publié: (2026)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
par: He, Linfeng, et autres
Publié: (2024)
par: He, Linfeng, et autres
Publié: (2024)
Documents similaires
-
Are Large Vision Language Models Good Game Players?
par: Wang, Xinyu, et autres
Publié: (2025) -
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024) -
To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation
par: Abraham, Savitha Sam, et autres
Publié: (2024) -
Chain-of-Adaptation: Surgical Vision-Language Adaptation with Reinforcement Learning
par: Li, Jiajie, et autres
Publié: (2026) -
Environmental Understanding Vision-Language Model for Embodied Agent
par: Bang, Jinsik, et autres
Publié: (2026)