Enregistré dans:
| Auteurs principaux: | Wang, Tianyu, Ma, Zhiyuan, Wang, Qian, Zhang, Xinyi, Long, Xinwei, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.19974 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
par: Pan, Jiadong, et autres
Publié: (2025)
par: Pan, Jiadong, et autres
Publié: (2025)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
par: Zhao, Zhonghan, et autres
Publié: (2025)
par: Zhao, Zhonghan, et autres
Publié: (2025)
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
par: Long, Yancheng, et autres
Publié: (2026)
par: Long, Yancheng, et autres
Publié: (2026)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
par: Ma, Weijian, et autres
Publié: (2026)
par: Ma, Weijian, et autres
Publié: (2026)
AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring
par: Wang, Xinyi, et autres
Publié: (2025)
par: Wang, Xinyi, et autres
Publié: (2025)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
AdapEdit: Spatio-Temporal Guided Adaptive Editing Algorithm for Text-Based Continuity-Sensitive Image Editing
par: Ma, Zhiyuan, et autres
Publié: (2023)
par: Ma, Zhiyuan, et autres
Publié: (2023)
MoRL: Reinforced Reasoning for Unified Motion Understanding and Generation
par: Wang, Hongpeng, et autres
Publié: (2026)
par: Wang, Hongpeng, et autres
Publié: (2026)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
par: Jia, Guoli, et autres
Publié: (2025)
par: Jia, Guoli, et autres
Publié: (2025)
Neural Residual Diffusion Models for Deep Scalable Vision Generation
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation
par: Guo, Yanjun, et autres
Publié: (2026)
par: Guo, Yanjun, et autres
Publié: (2026)
Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
par: Chen, Wei, et autres
Publié: (2026)
par: Chen, Wei, et autres
Publié: (2026)
Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning
par: Wu, Hang, et autres
Publié: (2026)
par: Wu, Hang, et autres
Publié: (2026)
Context-Aware Autoregressive Models for Multi-Conditional Image Generation
par: Chen, Yixiao, et autres
Publié: (2025)
par: Chen, Yixiao, et autres
Publié: (2025)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
par: Wang, Junjie, et autres
Publié: (2026)
par: Wang, Junjie, et autres
Publié: (2026)
UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition
par: Lei, Guojun, et autres
Publié: (2025)
par: Lei, Guojun, et autres
Publié: (2025)
CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning
par: Ma, Wenxin, et autres
Publié: (2026)
par: Ma, Wenxin, et autres
Publié: (2026)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
par: Ping, Bowen, et autres
Publié: (2025)
par: Ping, Bowen, et autres
Publié: (2025)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
par: Ma, Wufei, et autres
Publié: (2025)
par: Ma, Wufei, et autres
Publié: (2025)
Reinforcing Few-step Generators via Reward-Tilted Distribution Matching
par: Huang, Yushi, et autres
Publié: (2026)
par: Huang, Yushi, et autres
Publié: (2026)
Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
Detecting AI-Generated Video via Frame Consistency
par: Ma, Long, et autres
Publié: (2024)
par: Ma, Long, et autres
Publié: (2024)
LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models
par: Yao, Ruilin, et autres
Publié: (2025)
par: Yao, Ruilin, et autres
Publié: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Diffusion-Based Depth Inpainting for Transparent and Reflective Objects
par: Sun, Tianyu, et autres
Publié: (2024)
par: Sun, Tianyu, et autres
Publié: (2024)
TeDA: Boosting Vision-Lanuage Models for Zero-Shot 3D Object Retrieval via Testing-time Distribution Alignment
par: Wang, Zhichuan, et autres
Publié: (2025)
par: Wang, Zhichuan, et autres
Publié: (2025)
Learning Proposes, Geometry Disposes: A Modular Framework for Efficient Spatial Reasoning
par: Zhu, Haichao, et autres
Publié: (2026)
par: Zhu, Haichao, et autres
Publié: (2026)
Data-Free Generalized Zero-Shot Learning
par: Tang, Bowen, et autres
Publié: (2024)
par: Tang, Bowen, et autres
Publié: (2024)
Acquisition of Spatially-Varying Reflectance and Surface Normals via Polarized Reflectance Fields
par: Yang, Jing, et autres
Publié: (2024)
par: Yang, Jing, et autres
Publié: (2024)
TopoPoint: Enhance Topology Reasoning via Endpoint Detection in Autonomous Driving
par: Fu, Yanping, et autres
Publié: (2025)
par: Fu, Yanping, et autres
Publié: (2025)
pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning
par: Luo, Zhanpeng, et autres
Publié: (2026)
par: Luo, Zhanpeng, et autres
Publié: (2026)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
par: Liao, Ruotong, et autres
Publié: (2024)
par: Liao, Ruotong, et autres
Publié: (2024)
Towards Spatially Consistent Image Generation: On Incorporating Intrinsic Scene Properties into Diffusion Models
par: Lee, Hyundo, et autres
Publié: (2025)
par: Lee, Hyundo, et autres
Publié: (2025)
Documents similaires
-
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
par: Pan, Jiadong, et autres
Publié: (2025) -
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025) -
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
par: Zhao, Zhonghan, et autres
Publié: (2025) -
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
par: Guo, Xiaojun, et autres
Publié: (2025) -
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
par: Long, Yancheng, et autres
Publié: (2026)