PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Ruizhi, Huang, Ye, Pan, Yuangang, Shen, Chuanfu, Liu, Zhilin, Xie, Ting, Li, Wen, Duan, Lixin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Semantic segmentation with reward
di: Ting, Xie, et al.
Pubblicazione: (2025)
di: Ting, Xie, et al.
Pubblicazione: (2025)
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
di: Jiang, Wen, et al.
Pubblicazione: (2025)
di: Jiang, Wen, et al.
Pubblicazione: (2025)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
di: Song, Xinshuai, et al.
Pubblicazione: (2024)
di: Song, Xinshuai, et al.
Pubblicazione: (2024)
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
di: Liu, Zhilin, et al.
Pubblicazione: (2026)
di: Liu, Zhilin, et al.
Pubblicazione: (2026)
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
di: Tang, Xikai, et al.
Pubblicazione: (2025)
di: Tang, Xikai, et al.
Pubblicazione: (2025)
SSR: SAM is a Strong Regularizer for domain adaptive semantic segmentation
di: Ge, Yanqi, et al.
Pubblicazione: (2024)
di: Ge, Yanqi, et al.
Pubblicazione: (2024)
ResCLIP: Residual Attention for Training-free Dense Vision-language Inference
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement
di: Qiu, Weikang, et al.
Pubblicazione: (2026)
di: Qiu, Weikang, et al.
Pubblicazione: (2026)
Beyond Viewpoint: Robust 3D Object Recognition under Arbitrary Views through Joint Multi-Part Representation
di: Fan, Linlong, et al.
Pubblicazione: (2024)
di: Fan, Linlong, et al.
Pubblicazione: (2024)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
di: Zhang, Yuelin, et al.
Pubblicazione: (2026)
di: Zhang, Yuelin, et al.
Pubblicazione: (2026)
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
di: Ren, Xiyu, et al.
Pubblicazione: (2026)
di: Ren, Xiyu, et al.
Pubblicazione: (2026)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
di: Rahman, Md Ashikur, et al.
Pubblicazione: (2026)
di: Rahman, Md Ashikur, et al.
Pubblicazione: (2026)
Tuning-Free Adaptive Style Incorporation for Structure-Consistent Text-Driven Style Transfer
di: Ge, Yanqi, et al.
Pubblicazione: (2024)
di: Ge, Yanqi, et al.
Pubblicazione: (2024)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
S-INF: Towards Realistic Indoor Scene Synthesis via Scene Implicit Neural Field
di: Liang, Zixi, et al.
Pubblicazione: (2024)
di: Liang, Zixi, et al.
Pubblicazione: (2024)
BiGym: A Demo-Driven Mobile Bi-Manual Manipulation Benchmark
di: Chernyadev, Nikita, et al.
Pubblicazione: (2024)
di: Chernyadev, Nikita, et al.
Pubblicazione: (2024)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
OpenGait: A Comprehensive Benchmark Study for Gait Recognition towards Better Practicality
di: Fan, Chao, et al.
Pubblicazione: (2024)
di: Fan, Chao, et al.
Pubblicazione: (2024)
Cross-Covariate Gait Recognition: A Benchmark
di: Zou, Shinan, et al.
Pubblicazione: (2023)
di: Zou, Shinan, et al.
Pubblicazione: (2023)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
PokeFlex: A Real-World Dataset of Volumetric Deformable Objects for Robotics
di: Obrist, Jan, et al.
Pubblicazione: (2024)
di: Obrist, Jan, et al.
Pubblicazione: (2024)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
PokeFusion Attention: A Lightweight Cross-Attention Mechanism for Style-Conditioned Image Generation
di: Tang, Jingbang
Pubblicazione: (2026)
di: Tang, Jingbang
Pubblicazione: (2026)
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
di: Wang, Zhaowei, et al.
Pubblicazione: (2026)
di: Wang, Zhaowei, et al.
Pubblicazione: (2026)
VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing
di: Rodriguez, Juan, et al.
Pubblicazione: (2026)
di: Rodriguez, Juan, et al.
Pubblicazione: (2026)
OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks
di: Wu, Jing, et al.
Pubblicazione: (2026)
di: Wu, Jing, et al.
Pubblicazione: (2026)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
di: Luo, Wen, et al.
Pubblicazione: (2026)
di: Luo, Wen, et al.
Pubblicazione: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
Instance-Free Domain Adaptive Object Detection
di: Yu, Hengfu, et al.
Pubblicazione: (2026)
di: Yu, Hengfu, et al.
Pubblicazione: (2026)
Balanced Sharpness-Aware Minimization for Imbalanced Regression
di: Liu, Yahao, et al.
Pubblicazione: (2025)
di: Liu, Yahao, et al.
Pubblicazione: (2025)
Towards Unsupervised Model Selection for Domain Adaptive Object Detection
di: Yu, Hengfu, et al.
Pubblicazione: (2024)
di: Yu, Hengfu, et al.
Pubblicazione: (2024)
Learning Semantic Latent Directions for Accurate and Controllable Human Motion Prediction
di: Xu, Guowei, et al.
Pubblicazione: (2024)
di: Xu, Guowei, et al.
Pubblicazione: (2024)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
di: Guo, Xianda, et al.
Pubblicazione: (2024)
di: Guo, Xianda, et al.
Pubblicazione: (2024)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
di: Zhang, Zhilin, et al.
Pubblicazione: (2024)
di: Zhang, Zhilin, et al.
Pubblicazione: (2024)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
di: Fallah, Forouzan, et al.
Pubblicazione: (2025)
di: Fallah, Forouzan, et al.
Pubblicazione: (2025)
H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection
di: Huang, Jianghong, et al.
Pubblicazione: (2026)
di: Huang, Jianghong, et al.
Pubblicazione: (2026)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Semantic segmentation with reward
di: Ting, Xie, et al.
Pubblicazione: (2025) -
LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
di: Jiang, Wen, et al.
Pubblicazione: (2025) -
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
di: Song, Xinshuai, et al.
Pubblicazione: (2024) -
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging
di: Liu, Zhilin, et al.
Pubblicazione: (2026) -
VPNeXt -- Rethinking Dense Decoding for Plain Vision Transformer
di: Tang, Xikai, et al.
Pubblicazione: (2025)