Enregistré dans:
| Auteurs principaux: | Brock, James, Zhang, Ce, Anantrasirichai, Nantheera |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.04497 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis
par: Brock, James, et autres
Publié: (2026)
par: Brock, James, et autres
Publié: (2026)
Zero-TIG: Temporal Consistency-Aware Zero-Shot Illumination-Guided Low-light Video Enhancement
par: Li, Yini, et autres
Publié: (2025)
par: Li, Yini, et autres
Publié: (2025)
An InSAR Phase Unwrapping Framework for Large-scale and Complex Events
par: Song, Yijia, et autres
Publié: (2026)
par: Song, Yijia, et autres
Publié: (2026)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
par: Ma, Tianyi, et autres
Publié: (2025)
par: Ma, Tianyi, et autres
Publié: (2025)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
Cost-effective Instruction Learning for Pathology Vision and Language Analysis
par: Chen, Kaitao, et autres
Publié: (2024)
par: Chen, Kaitao, et autres
Publié: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View
par: Schumann, Raphael, et autres
Publié: (2023)
par: Schumann, Raphael, et autres
Publié: (2023)
A Comprehensive Study of Object Tracking in Low-Light Environments
par: Yi, Anqi, et autres
Publié: (2023)
par: Yi, Anqi, et autres
Publié: (2023)
RMFAT: Recurrent Multi-scale Feature Atmospheric Turbulence Mitigator
par: Liu, Zhiming, et autres
Publié: (2025)
par: Liu, Zhiming, et autres
Publié: (2025)
DeTurb: Atmospheric Turbulence Mitigation with Deformable 3D Convolutions and 3D Swin Transformers
par: Zou, Zhicheng, et autres
Publié: (2024)
par: Zou, Zhicheng, et autres
Publié: (2024)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
par: Perincherry, Akhil, et autres
Publié: (2025)
par: Perincherry, Akhil, et autres
Publié: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
par: Lin, Zhiqiu, et autres
Publié: (2023)
par: Lin, Zhiqiu, et autres
Publié: (2023)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
par: Liang, Xiwen, et autres
Publié: (2023)
par: Liang, Xiwen, et autres
Publié: (2023)
HELPER-X: A Unified Instructable Embodied Agent to Tackle Four Interactive Vision-Language Domains with Memory-Augmented Language Models
par: Sarch, Gabriel, et autres
Publié: (2024)
par: Sarch, Gabriel, et autres
Publié: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
par: Jiang, Haojun, et autres
Publié: (2022)
par: Jiang, Haojun, et autres
Publié: (2022)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
par: Zhao, Hongbo, et autres
Publié: (2025)
par: Zhao, Hongbo, et autres
Publié: (2025)
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
Enhancing Vision Models for Text-Heavy Content Understanding and Interaction
par: TG, Adithya, et autres
Publié: (2024)
par: TG, Adithya, et autres
Publié: (2024)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
par: Zhang, Jingyuan, et autres
Publié: (2025)
par: Zhang, Jingyuan, et autres
Publié: (2025)
Probing and Inducing Combinational Creativity in Vision-Language Models
par: Peng, Yongqian, et autres
Publié: (2025)
par: Peng, Yongqian, et autres
Publié: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023)
par: Zhang, Siyu, et autres
Publié: (2023)
Panoptic Vision-Language Feature Fields
par: Chen, Haoran, et autres
Publié: (2023)
par: Chen, Haoran, et autres
Publié: (2023)
Survey on Vision-Language-Action Models
par: Adilkhanov, Adilzhan, et autres
Publié: (2025)
par: Adilkhanov, Adilzhan, et autres
Publié: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
par: Gu, Zishan, et autres
Publié: (2024)
par: Gu, Zishan, et autres
Publié: (2024)
VLCD: Vision-Language Contrastive Distillation for Accurate and Efficient Automatic Placenta Analysis
par: Mehta, Manas, et autres
Publié: (2025)
par: Mehta, Manas, et autres
Publié: (2025)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
par: Du, Yiyang, et autres
Publié: (2026)
par: Du, Yiyang, et autres
Publié: (2026)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
par: Li, Yanwei, et autres
Publié: (2024)
par: Li, Yanwei, et autres
Publié: (2024)
General Scene Adaptation for Vision-and-Language Navigation
par: Hong, Haodong, et autres
Publié: (2025)
par: Hong, Haodong, et autres
Publié: (2025)
Benchmarking Vision Language Models for Cultural Understanding
par: Nayak, Shravan, et autres
Publié: (2024)
par: Nayak, Shravan, et autres
Publié: (2024)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
par: Cahyawijaya, Samuel, et autres
Publié: (2026)
par: Cahyawijaya, Samuel, et autres
Publié: (2026)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
PyVision: Agentic Vision with Dynamic Tooling
par: Zhao, Shitian, et autres
Publié: (2025)
par: Zhao, Shitian, et autres
Publié: (2025)
Documents similaires
-
Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis
par: Brock, James, et autres
Publié: (2026) -
Zero-TIG: Temporal Consistency-Aware Zero-Shot Illumination-Guided Low-light Video Enhancement
par: Li, Yini, et autres
Publié: (2025) -
An InSAR Phase Unwrapping Framework for Large-scale and Complex Events
par: Song, Yijia, et autres
Publié: (2026) -
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
par: Ma, Tianyi, et autres
Publié: (2025) -
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
par: Kim, Yunsoo, et autres
Publié: (2024)