Saved in:
| Main Authors: | Zhang, Ruizhi, Huang, Ye, Pan, Yuangang, Shen, Chuanfu, Liu, Zhilin, Xie, Ting, Li, Wen, Duan, Lixin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2604.08340 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Semantic segmentation with reward
by: Ting, Xie, et al.
Published: (2025)
by: Ting, Xie, et al.
Published: (2025)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
by: Liu, Zhilin, et al.
Published: (2026)
by: Liu, Zhilin, et al.
Published: (2026)
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
by: Jiang, Wen, et al.
Published: (2025)
by: Jiang, Wen, et al.
Published: (2025)
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
by: Tang, Xikai, et al.
Published: (2025)
by: Tang, Xikai, et al.
Published: (2025)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
by: Song, Xinshuai, et al.
Published: (2024)
by: Song, Xinshuai, et al.
Published: (2024)
SSR: SAM is a Strong Regularizer for domain adaptive semantic segmentation
by: Ge, Yanqi, et al.
Published: (2024)
by: Ge, Yanqi, et al.
Published: (2024)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
by: Zhang, Yuelin, et al.
Published: (2026)
by: Zhang, Yuelin, et al.
Published: (2026)
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
by: Qiu, Weikang, et al.
Published: (2026)
by: Qiu, Weikang, et al.
Published: (2026)
ResCLIP: Residual Attention for Training-free Dense Vision-language Inference
by: Yang, Yuhang, et al.
Published: (2024)
by: Yang, Yuhang, et al.
Published: (2024)
Beyond Viewpoint: Robust 3D Object Recognition under Arbitrary Views through Joint Multi-Part Representation
by: Fan, Linlong, et al.
Published: (2024)
by: Fan, Linlong, et al.
Published: (2024)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
by: Rahman, Md Ashikur, et al.
Published: (2026)
by: Rahman, Md Ashikur, et al.
Published: (2026)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
by: Ren, Xiyu, et al.
Published: (2026)
by: Ren, Xiyu, et al.
Published: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
by: Zhou, Yucheng, et al.
Published: (2024)
by: Zhou, Yucheng, et al.
Published: (2024)
BiGym: A Demo-Driven Mobile Bi-Manual Manipulation Benchmark
by: Chernyadev, Nikita, et al.
Published: (2024)
by: Chernyadev, Nikita, et al.
Published: (2024)
Cross-Covariate Gait Recognition: A Benchmark
by: Zou, Shinan, et al.
Published: (2023)
by: Zou, Shinan, et al.
Published: (2023)
Tuning-Free Adaptive Style Incorporation for Structure-Consistent Text-Driven Style Transfer
by: Ge, Yanqi, et al.
Published: (2024)
by: Ge, Yanqi, et al.
Published: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
by: Wang, Yanling, et al.
Published: (2025)
by: Wang, Yanling, et al.
Published: (2025)
S-INF: Towards Realistic Indoor Scene Synthesis via Scene Implicit Neural Field
by: Liang, Zixi, et al.
Published: (2024)
by: Liang, Zixi, et al.
Published: (2024)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
by: Jiayang, Cheng, et al.
Published: (2026)
by: Jiayang, Cheng, et al.
Published: (2026)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
by: Ruan, Jiacheng, et al.
Published: (2025)
by: Ruan, Jiacheng, et al.
Published: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
by: Cai, Jie, et al.
Published: (2025)
by: Cai, Jie, et al.
Published: (2025)
Towards Unsupervised Model Selection for Domain Adaptive Object Detection
by: Yu, Hengfu, et al.
Published: (2024)
by: Yu, Hengfu, et al.
Published: (2024)
Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method
by: Pan, Bikang, et al.
Published: (2024)
by: Pan, Bikang, et al.
Published: (2024)
OpenGait: A Comprehensive Benchmark Study for Gait Recognition towards Better Practicality
by: Fan, Chao, et al.
Published: (2024)
by: Fan, Chao, et al.
Published: (2024)
Exploring the Interplay Between Self‐Identity, Affective Style, Emotion Regulation, and Anxiety: Based on Bayesian Network Model
by: Ruizhi Huang, et al.
Published: (2025)
by: Ruizhi Huang, et al.
Published: (2025)
How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study
by: Liu, Che, et al.
Published: (2025)
by: Liu, Che, et al.
Published: (2025)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
by: Zhang, Jiyao, et al.
Published: (2026)
by: Zhang, Jiyao, et al.
Published: (2026)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
by: Liang, Xiwen, et al.
Published: (2025)
by: Liang, Xiwen, et al.
Published: (2025)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
by: Shen, Qirui, et al.
Published: (2026)
by: Shen, Qirui, et al.
Published: (2026)
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
by: Wang, Zhaowei, et al.
Published: (2026)
by: Wang, Zhaowei, et al.
Published: (2026)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
by: Meng, Fanqing, et al.
Published: (2026)
by: Meng, Fanqing, et al.
Published: (2026)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
by: Chen, Kesheng, et al.
Published: (2026)
by: Chen, Kesheng, et al.
Published: (2026)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
by: Guo, Xianda, et al.
Published: (2024)
by: Guo, Xianda, et al.
Published: (2024)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
by: Mei, Xiaodong, et al.
Published: (2026)
by: Mei, Xiaodong, et al.
Published: (2026)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
by: Zeng, Yu, et al.
Published: (2026)
by: Zeng, Yu, et al.
Published: (2026)
PokeFlex: A Real-World Dataset of Volumetric Deformable Objects for Robotics
by: Obrist, Jan, et al.
Published: (2024)
by: Obrist, Jan, et al.
Published: (2024)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
by: Luo, Wen, et al.
Published: (2026)
by: Luo, Wen, et al.
Published: (2026)
EVLM: An Efficient Vision-Language Model for Visual Understanding
by: Chen, Kaibing, et al.
Published: (2024)
by: Chen, Kaibing, et al.
Published: (2024)
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
by: Xiu, Lixin, et al.
Published: (2026)
by: Xiu, Lixin, et al.
Published: (2026)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
by: Geng, Tiantian, et al.
Published: (2024)
by: Geng, Tiantian, et al.
Published: (2024)
Similar Items
-
Semantic segmentation with reward
by: Ting, Xie, et al.
Published: (2025) -
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
by: Liu, Zhilin, et al.
Published: (2026) -
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
by: Jiang, Wen, et al.
Published: (2025) -
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
by: Tang, Xikai, et al.
Published: (2025) -
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
by: Song, Xinshuai, et al.
Published: (2024)