Gym-V: A Unified Vision Environment System for Agentic Vision Research
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Fanqing, Du, Lingxiao, Gu, Jiawei, Liao, Jiaqi, Li, Linjie, Wu, Zijian, Liu, Xiangyan, Zhao, Ziqi, Hu, Mengkang, Liu, Zichen, Zhang, Jiaheng, Shieh, Michael Qizhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
di: Liu, Xiangyan, et al.
Pubblicazione: (2025)
di: Liu, Xiangyan, et al.
Pubblicazione: (2025)
GEM: A Gym for Agentic LLMs
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
di: Gu, Jiawei, et al.
Pubblicazione: (2025)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
di: Chen, Guanzheng, et al.
Pubblicazione: (2026)
di: Chen, Guanzheng, et al.
Pubblicazione: (2026)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
di: Guo, Ziyao, et al.
Pubblicazione: (2025)
di: Guo, Ziyao, et al.
Pubblicazione: (2025)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization
di: Agarwal, Anmol, et al.
Pubblicazione: (2026)
di: Agarwal, Anmol, et al.
Pubblicazione: (2026)
Efficient Process Reward Model Training via Active Learning
di: Duan, Keyu, et al.
Pubblicazione: (2025)
di: Duan, Keyu, et al.
Pubblicazione: (2025)
ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning
di: Zhao, Yiran, et al.
Pubblicazione: (2026)
di: Zhao, Yiran, et al.
Pubblicazione: (2026)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion
di: Lin, Yusong, et al.
Pubblicazione: (2026)
di: Lin, Yusong, et al.
Pubblicazione: (2026)
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025)
di: Li, Yuhang, et al.
Pubblicazione: (2025)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
di: Zhang, Jihai, et al.
Pubblicazione: (2025)
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
di: Gu, Zijian, et al.
Pubblicazione: (2025)
di: Gu, Zijian, et al.
Pubblicazione: (2025)
pyRDDLGym: From RDDL to Gym Environments
di: Taitler, Ayal, et al.
Pubblicazione: (2022)
di: Taitler, Ayal, et al.
Pubblicazione: (2022)
Vision Graph Prompting via Semantic Low-Rank Decomposition
di: Ai, Zixiang, et al.
Pubblicazione: (2025)
di: Ai, Zixiang, et al.
Pubblicazione: (2025)
Fair-MoE: Fairness-Oriented Mixture of Experts in Vision-Language Models
di: Wang, Peiran, et al.
Pubblicazione: (2025)
di: Wang, Peiran, et al.
Pubblicazione: (2025)
V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation
di: Liu, Yaru, et al.
Pubblicazione: (2026)
di: Liu, Yaru, et al.
Pubblicazione: (2026)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
di: Zhang, Ruizhi, et al.
Pubblicazione: (2026)
di: Zhang, Ruizhi, et al.
Pubblicazione: (2026)
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
di: Malay, Shiva Krishna Reddy, et al.
Pubblicazione: (2026)
di: Malay, Shiva Krishna Reddy, et al.
Pubblicazione: (2026)
MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
di: Chen, Hardy, et al.
Pubblicazione: (2026)
di: Chen, Hardy, et al.
Pubblicazione: (2026)
HistoGym: A Reinforcement Learning Environment for Histopathological Image Analysis
di: Liu, Zhi-Bo, et al.
Pubblicazione: (2024)
di: Liu, Zhi-Bo, et al.
Pubblicazione: (2024)
VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
di: Zhang, Xiangdong, et al.
Pubblicazione: (2025)
di: Zhang, Xiangdong, et al.
Pubblicazione: (2025)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
di: Chen, Junting, et al.
Pubblicazione: (2025)
di: Chen, Junting, et al.
Pubblicazione: (2025)
RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
Diffusion Language Models are Super Data Learners
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
Training Optimal Large Diffusion Language Models
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
di: Ni, Jinjie, et al.
Pubblicazione: (2025)
Toward Causal-Visual Programming: Enhancing Agentic Reasoning in Low-Code Environments
di: Xu, Jiexi, et al.
Pubblicazione: (2025)
di: Xu, Jiexi, et al.
Pubblicazione: (2025)
Variation-aware Vision Token Dropping for Faster Large Vision-Language Models
di: Chen, Junjie, et al.
Pubblicazione: (2025)
di: Chen, Junjie, et al.
Pubblicazione: (2025)
UserBench: An Interactive Gym Environment for User-Centric Agents
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
Selective Visual Prompting in Vision Mamba
di: Yao, Yifeng, et al.
Pubblicazione: (2024)
di: Yao, Yifeng, et al.
Pubblicazione: (2024)
XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations
di: Fan, Shichao, et al.
Pubblicazione: (2025)
di: Fan, Shichao, et al.
Pubblicazione: (2025)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
di: Wu, Zijian, et al.
Pubblicazione: (2025) -
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
di: Wu, Zijian, et al.
Pubblicazione: (2025) -
NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
di: Liu, Xiangyan, et al.
Pubblicazione: (2025) -
GEM: A Gym for Agentic LLMs
di: Liu, Zichen, et al.
Pubblicazione: (2025) -
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
di: Gu, Jiawei, et al.
Pubblicazione: (2025)