ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Haonan, Huang, Jiancheng, Sun, Xiaopeng, He, Junyan, Yang, Rui, Hu, Jie, Peng, Xiaojiang, Ma, Lin, Wei, Xiaoming, Li, Xiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
How Far Are We from Intelligent Visual Deductive Reasoning?
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
di: Zhang, Yizhe, et al.
Pubblicazione: (2024)
Zero-Shot Aerial Object Detection with Visual Description Regularization
di: Zang, Zhengqing, et al.
Pubblicazione: (2024)
di: Zang, Zhengqing, et al.
Pubblicazione: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
di: Wu, Fengyi, et al.
Pubblicazione: (2025)
di: Wu, Fengyi, et al.
Pubblicazione: (2025)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
di: Zhuang, Cailin, et al.
Pubblicazione: (2025)
ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot Performance
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
di: Zheng, Yushuo, et al.
Pubblicazione: (2026)
How Far do Lindbladians Go?
di: Cai, Jihong, et al.
Pubblicazione: (2025)
di: Cai, Jihong, et al.
Pubblicazione: (2025)
ViPO: Visual Preference Optimization at Scale
di: Li, Ming, et al.
Pubblicazione: (2026)
di: Li, Ming, et al.
Pubblicazione: (2026)
LoopViT: Scaling Visual ARC with Looped Transformers
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
di: Shu, Wen-Jie, et al.
Pubblicazione: (2026)
How Far Can 100 Samples Go? Unlocking Overall Zero-Shot Multilingual Translation via Tiny Multi-Parallel Data
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
Tile-Based ViT Inference with Visual-Cluster Priors for Zero-Shot Multi-Species Plant Identification
di: Gustineli, Murilo, et al.
Pubblicazione: (2025)
di: Gustineli, Murilo, et al.
Pubblicazione: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
di: Yang, Ziteng, et al.
Pubblicazione: (2025)
di: Yang, Ziteng, et al.
Pubblicazione: (2025)
Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment
di: Kuang, Jidong, et al.
Pubblicazione: (2024)
di: Kuang, Jidong, et al.
Pubblicazione: (2024)
Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2025)
di: Li, Wenrui, et al.
Pubblicazione: (2025)
VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
di: Byun, Ji Young, et al.
Pubblicazione: (2025)
di: Byun, Ji Young, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
How Far I'll Go: Imagining Futures of Conversational AI with People with Visual Impairments Through Design Fiction
di: Choi, Jeanne, et al.
Pubblicazione: (2025)
di: Choi, Jeanne, et al.
Pubblicazione: (2025)
MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?
di: Yong, Xixian, et al.
Pubblicazione: (2025)
di: Yong, Xixian, et al.
Pubblicazione: (2025)
Wonderful Team: Zero-Shot Physical Task Planning with Visual LLMs
di: Wang, Zidan, et al.
Pubblicazione: (2024)
di: Wang, Zidan, et al.
Pubblicazione: (2024)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
di: Zhu, Jie, et al.
Pubblicazione: (2026)
di: Zhu, Jie, et al.
Pubblicazione: (2026)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
di: Li, Bangzheng, et al.
Pubblicazione: (2023)
di: Li, Bangzheng, et al.
Pubblicazione: (2023)
EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
di: Cai, Han, et al.
Pubblicazione: (2022)
di: Cai, Han, et al.
Pubblicazione: (2022)
Visual and Semantic Prompt Collaboration for Generalized Zero-Shot Learning
di: Jiang, Huajie, et al.
Pubblicazione: (2025)
di: Jiang, Huajie, et al.
Pubblicazione: (2025)
StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives
di: Hu, Jinghao, et al.
Pubblicazione: (2026)
di: Hu, Jinghao, et al.
Pubblicazione: (2026)
Coherent Zero-Shot Visual Instruction Generation
di: Phung, Quynh, et al.
Pubblicazione: (2024)
di: Phung, Quynh, et al.
Pubblicazione: (2024)
Zero-Shot Visual Generalization in Robot Manipulation
di: Batra, Sumeet, et al.
Pubblicazione: (2025)
di: Batra, Sumeet, et al.
Pubblicazione: (2025)
Distributed Zero-Shot Learning for Visual Recognition
di: Chen, Zhi, et al.
Pubblicazione: (2025)
di: Chen, Zhi, et al.
Pubblicazione: (2025)
How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos
di: Lu, Wentao, et al.
Pubblicazione: (2026)
di: Lu, Wentao, et al.
Pubblicazione: (2026)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
di: Qiang, Chenhui, et al.
Pubblicazione: (2025)
di: Qiang, Chenhui, et al.
Pubblicazione: (2025)
Open-World Visual Reasoning by a Neuro-Symbolic Program of Zero-Shot Symbols
di: Burghouts, Gertjan, et al.
Pubblicazione: (2024)
di: Burghouts, Gertjan, et al.
Pubblicazione: (2024)
pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning
di: Luo, Zhanpeng, et al.
Pubblicazione: (2026)
di: Luo, Zhanpeng, et al.
Pubblicazione: (2026)
PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?
di: Xu, Jingzhe, et al.
Pubblicazione: (2026)
di: Xu, Jingzhe, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024) -
How Far Are We from Intelligent Visual Deductive Reasoning?
di: Zhang, Yizhe, et al.
Pubblicazione: (2024) -
Zero-Shot Aerial Object Detection with Visual Description Regularization
di: Zang, Zhengqing, et al.
Pubblicazione: (2024) -
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024) -
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
di: Lu, Yi, et al.
Pubblicazione: (2025)