SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Long, Yancheng, Yang, Yankai, Wei, Hongyang, Chen, Wei, Zhang, Tianke, fan, Haonan, Liu, Changyi, Jiang, Kaiyu, Chen, Jiankang, Tang, Kaiyu, Wen, Bin, Yang, Fan, Gao, Tingting, Li, Han, Yang, Shuo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
di: Yang, Yankai, et al.
Pubblicazione: (2026)
di: Yang, Yankai, et al.
Pubblicazione: (2026)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
di: Wei, Hongyang, et al.
Pubblicazione: (2026)
di: Wei, Hongyang, et al.
Pubblicazione: (2026)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
Thyme: Think Beyond Images
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
di: He, Kaiyu, et al.
Pubblicazione: (2025)
di: He, Kaiyu, et al.
Pubblicazione: (2025)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
InstructEngine: Instruction-driven Text-to-Image Alignment
di: Lu, Xingyu, et al.
Pubblicazione: (2025)
di: Lu, Xingyu, et al.
Pubblicazione: (2025)
Marine Biodiversity Conservation Planning in the Indo-Pacific Convergence Zone Based on Ecological Spatial Analysis.
di: Zhao, Linlin, et al.
Pubblicazione: (2025)
di: Zhao, Linlin, et al.
Pubblicazione: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
di: Chen, Jiankang, et al.
Pubblicazione: (2025)
di: Chen, Jiankang, et al.
Pubblicazione: (2025)
OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
di: Jie, Haoxiang, et al.
Pubblicazione: (2026)
Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning
di: Hu, Xiao, et al.
Pubblicazione: (2025)
di: Hu, Xiao, et al.
Pubblicazione: (2025)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
di: Lu, Xingyu, et al.
Pubblicazione: (2025)
di: Lu, Xingyu, et al.
Pubblicazione: (2025)
TimeBrush : An Intelligent Expert System for Restoring Historical Images With Temporal and Stylistic Guidance
di: Kaiyu Zhang
Pubblicazione: (2025)
di: Kaiyu Zhang
Pubblicazione: (2025)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
di: Ou, Siqu, et al.
Pubblicazione: (2025)
di: Ou, Siqu, et al.
Pubblicazione: (2025)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
di: Song, Peiyang, et al.
Pubblicazione: (2024)
di: Song, Peiyang, et al.
Pubblicazione: (2024)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
di: He, Jixuan, et al.
Pubblicazione: (2026)
di: He, Jixuan, et al.
Pubblicazione: (2026)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
di: Ma, Wufei, et al.
Pubblicazione: (2025)
di: Ma, Wufei, et al.
Pubblicazione: (2025)
Octree-based Learned Point Cloud Geometry Compression: A Lossy Perspective
di: Zheng, Kaiyu, et al.
Pubblicazione: (2026)
di: Zheng, Kaiyu, et al.
Pubblicazione: (2026)
Bridging the Gap: Unpacking the Hidden Challenges in Knowledge Distillation for Online Ranking Systems
di: Khani, Nikhil, et al.
Pubblicazione: (2024)
di: Khani, Nikhil, et al.
Pubblicazione: (2024)
Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym
di: Kaesberg, Lars Benedikt, et al.
Pubblicazione: (2026)
di: Kaesberg, Lars Benedikt, et al.
Pubblicazione: (2026)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
di: Li, Yian, et al.
Pubblicazione: (2026)
di: Li, Yian, et al.
Pubblicazione: (2026)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
di: Batra, Hunar, et al.
Pubblicazione: (2025)
di: Batra, Hunar, et al.
Pubblicazione: (2025)
Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration
di: Yue, Lu, et al.
Pubblicazione: (2026)
di: Yue, Lu, et al.
Pubblicazione: (2026)
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
di: Wu, Mingrui, et al.
Pubblicazione: (2025)
di: Wu, Mingrui, et al.
Pubblicazione: (2025)
Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization
di: Yang, Jonathan, et al.
Pubblicazione: (2025)
di: Yang, Jonathan, et al.
Pubblicazione: (2025)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
di: Xiao, Yicheng, et al.
Pubblicazione: (2026)
Bridging the Editing Gap in LLMs: FineEdit for Precise and Targeted Text Modifications
di: Zeng, Yiming, et al.
Pubblicazione: (2025)
di: Zeng, Yiming, et al.
Pubblicazione: (2025)
Spectral Journey: How Transformers Predict the Shortest Path
di: Cohen, Andrew, et al.
Pubblicazione: (2025)
di: Cohen, Andrew, et al.
Pubblicazione: (2025)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
di: Ma, Wenxin, et al.
Pubblicazione: (2026)
Perception-Aware Multimodal Spatial Reasoning from Monocular Images
di: Cheng, Yanchun, et al.
Pubblicazione: (2026)
di: Cheng, Yanchun, et al.
Pubblicazione: (2026)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Rethinking Oversaturation in Classifier-Free Guidance via Low Frequency
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
di: Song, Kaiyu, et al.
Pubblicazione: (2025)
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
Improving Training-free Conditional Diffusion Model via Fisher Information
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
di: Song, Kaiyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
di: Yang, Yankai, et al.
Pubblicazione: (2026) -
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
di: Chen, Wei, et al.
Pubblicazione: (2026) -
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
di: Wei, Hongyang, et al.
Pubblicazione: (2026) -
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
di: Lu, Xingyu, et al.
Pubblicazione: (2026) -
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
di: Zhou, Sashuai, et al.
Pubblicazione: (2026)