Salvato in:
| Autori principali: | Li, Xirui, Li, Ming, Zhou, Tianyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.12395 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
di: Zhou, Hengguang, et al.
Pubblicazione: (2025)
di: Zhou, Hengguang, et al.
Pubblicazione: (2025)
V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
di: Fan, Chenrui, et al.
Pubblicazione: (2025)
di: Fan, Chenrui, et al.
Pubblicazione: (2025)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Frankenstein: Generating Semantic-Compositional 3D Scenes in One Tri-Plane
di: Yan, Han, et al.
Pubblicazione: (2024)
di: Yan, Han, et al.
Pubblicazione: (2024)
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
di: Jing, Liqi, et al.
Pubblicazione: (2026)
di: Jing, Liqi, et al.
Pubblicazione: (2026)
Vero: An Open RL Recipe for General Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
di: Sarch, Gabriel, et al.
Pubblicazione: (2026)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
di: Guo, Xiaojun, et al.
Pubblicazione: (2025)
di: Guo, Xiaojun, et al.
Pubblicazione: (2025)
Style-Preserving Lip Sync via Audio-Aware Style Reference
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
Visual Text Compression as Measure Transport
di: Tang, Lv, et al.
Pubblicazione: (2026)
di: Tang, Lv, et al.
Pubblicazione: (2026)
MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?
di: Li, Xirui, et al.
Pubblicazione: (2024)
di: Li, Xirui, et al.
Pubblicazione: (2024)
Focus On What Matters: Separated Models For Visual-Based RL Generalization
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
di: Zhao, Heng, et al.
Pubblicazione: (2026)
di: Zhao, Heng, et al.
Pubblicazione: (2026)
SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL
di: Liu, Lijun, et al.
Pubblicazione: (2026)
di: Liu, Lijun, et al.
Pubblicazione: (2026)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
StyleGuard: Preventing Text-to-Image-Model-based Style Mimicry Attacks by Style Perturbations
di: Li, Yanjie, et al.
Pubblicazione: (2025)
di: Li, Yanjie, et al.
Pubblicazione: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
di: Li, Zhaonan, et al.
Pubblicazione: (2025)
di: Li, Zhaonan, et al.
Pubblicazione: (2025)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
di: Shi, Fan, et al.
Pubblicazione: (2025)
di: Shi, Fan, et al.
Pubblicazione: (2025)
One-shot synthesis of rare gastrointestinal lesions improves diagnostic accuracy and clinical training
di: Yu, Jia, et al.
Pubblicazione: (2025)
di: Yu, Jia, et al.
Pubblicazione: (2025)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
di: Li, Wenqiao, et al.
Pubblicazione: (2025)
di: Li, Wenqiao, et al.
Pubblicazione: (2025)
AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences
di: Li, Jieyu, et al.
Pubblicazione: (2025)
di: Li, Jieyu, et al.
Pubblicazione: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
di: Xue, Haotian, et al.
Pubblicazione: (2025)
di: Xue, Haotian, et al.
Pubblicazione: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
di: Li, Zejun, et al.
Pubblicazione: (2025)
di: Li, Zejun, et al.
Pubblicazione: (2025)
Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning
di: Guo, Garvin, et al.
Pubblicazione: (2026)
di: Guo, Garvin, et al.
Pubblicazione: (2026)
Reasoning Matters for 3D Visual Grounding
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
CSD-VAR: Content-Style Decomposition in Visual Autoregressive Models
di: Nguyen, Quang-Binh, et al.
Pubblicazione: (2025)
di: Nguyen, Quang-Binh, et al.
Pubblicazione: (2025)
BrainDecoder: Style-Based Visual Decoding of EEG Signals
di: Choi, Minsuk, et al.
Pubblicazione: (2024)
di: Choi, Minsuk, et al.
Pubblicazione: (2024)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Exposing the Copycat Problem of Imitation-based Planner: A Novel Closed-Loop Simulator, Causal Benchmark and Joint IL-RL Baseline
di: Zhou, Hui, et al.
Pubblicazione: (2025)
di: Zhou, Hui, et al.
Pubblicazione: (2025)
Invisible Triggers, Visible Threats! Road-Style Adversarial Creation Attack for Visual 3D Detection in Autonomous Driving
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
di: Zhong, Jing, et al.
Pubblicazione: (2025)
di: Zhong, Jing, et al.
Pubblicazione: (2025)
What's Holding Back Latent Visual Reasoning?
di: Viveiros, André G., et al.
Pubblicazione: (2026)
di: Viveiros, André G., et al.
Pubblicazione: (2026)
StyleRF-VolVis: Style Transfer of Neural Radiance Fields for Expressive Volume Visualization
di: Tang, Kaiyuan, et al.
Pubblicazione: (2024)
di: Tang, Kaiyuan, et al.
Pubblicazione: (2024)
DynamicID: Zero-Shot Multi-ID Image Personalization with Flexible Facial Editability
di: Hu, Xirui, et al.
Pubblicazione: (2025)
di: Hu, Xirui, et al.
Pubblicazione: (2025)
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
di: Xue, Qiyao, et al.
Pubblicazione: (2025)
di: Xue, Qiyao, et al.
Pubblicazione: (2025)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
di: Chen, Yan, et al.
Pubblicazione: (2025)
di: Chen, Yan, et al.
Pubblicazione: (2025)
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
di: Tang, Lv, et al.
Pubblicazione: (2026)
di: Tang, Lv, et al.
Pubblicazione: (2026)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
di: Zhou, Hengguang, et al.
Pubblicazione: (2025) -
V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
di: Fan, Chenrui, et al.
Pubblicazione: (2025) -
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
di: Li, Ming, et al.
Pubblicazione: (2025) -
Frankenstein: Generating Semantic-Compositional 3D Scenes in One Tri-Plane
di: Yan, Han, et al.
Pubblicazione: (2024) -
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
di: Jing, Liqi, et al.
Pubblicazione: (2026)