Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Kesen, Zhu, Beier, Zhou, Junbao, Zhu, Xingyu, Yue, Zhongqi, Zhang, Hanwang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
di: Zhou, Junbao, et al.
Pubblicazione: (2025)
di: Zhou, Junbao, et al.
Pubblicazione: (2025)
Enhancing CLIP Robustness via Cross-Modality Alignment
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Real-Time Motion-Controllable Autoregressive Video Diffusion
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
di: Zhao, Kesen, et al.
Pubblicazione: (2025)
Hierarchical Semantic Alignment for Image Clustering
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
DragNeXt: Rethinking Drag-Based Image Editing
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
Reducing Class-Wise Performance Disparity via Margin Regularization
di: Zhu, Beier, et al.
Pubblicazione: (2026)
di: Zhu, Beier, et al.
Pubblicazione: (2026)
Robust Fine-tuning of Zero-shot Models via Variance Reduction
di: Zhu, Beier, et al.
Pubblicazione: (2024)
di: Zhu, Beier, et al.
Pubblicazione: (2024)
Enhancing Zero-Shot Vision Models by Label-Free Prompt Distribution Learning and Bias Correcting
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
di: Zhu, Beier, et al.
Pubblicazione: (2025)
di: Zhu, Beier, et al.
Pubblicazione: (2025)
Prompt-aligned Gradient for Prompt Tuning
di: Zhu, Beier, et al.
Pubblicazione: (2022)
di: Zhu, Beier, et al.
Pubblicazione: (2022)
Generalized Logit Adjustment: Calibrating Fine-tuned Models by Removing Label Bias in Foundation Models
di: Zhu, Beier, et al.
Pubblicazione: (2023)
di: Zhu, Beier, et al.
Pubblicazione: (2023)
Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models
di: Zhu, Beier, et al.
Pubblicazione: (2025)
di: Zhu, Beier, et al.
Pubblicazione: (2025)
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
di: Zhou, Yuan, et al.
Pubblicazione: (2024)
di: Zhou, Yuan, et al.
Pubblicazione: (2024)
Few-shot Learner Parameterization by Diffusion Time-steps
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering
di: Zhou, Yuan, et al.
Pubblicazione: (2026)
di: Zhou, Yuan, et al.
Pubblicazione: (2026)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
di: Zhu, Beier, et al.
Pubblicazione: (2023)
di: Zhu, Beier, et al.
Pubblicazione: (2023)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
di: Zhou, Jiaxu, et al.
Pubblicazione: (2026)
di: Zhou, Jiaxu, et al.
Pubblicazione: (2026)
Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning
di: Lu, Wenting, et al.
Pubblicazione: (2026)
di: Lu, Wenting, et al.
Pubblicazione: (2026)
Dynamic Multimodal Prototype Learning in Vision-Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Classes Are Not Equal: An Empirical Study on Image Recognition Fairness
di: Cui, Jiequan, et al.
Pubblicazione: (2024)
di: Cui, Jiequan, et al.
Pubblicazione: (2024)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
di: Jiang, Jingjing, et al.
Pubblicazione: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
Generative Visual Chain-of-Thought for Image Editing
di: Yin, Zijin, et al.
Pubblicazione: (2026)
di: Yin, Zijin, et al.
Pubblicazione: (2026)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
di: Wen, Junjie, et al.
Pubblicazione: (2025)
di: Wen, Junjie, et al.
Pubblicazione: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
di: Qin, Yiming, et al.
Pubblicazione: (2025)
di: Qin, Yiming, et al.
Pubblicazione: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
Exploring Diffusion Time-steps for Unsupervised Representation Learning
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
di: Yue, Zhongqi, et al.
Pubblicazione: (2024)
Parallel Diffusion Solver via Residual Dirichlet Policy Optimization
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
di: Huo, Yu, et al.
Pubblicazione: (2026)
di: Huo, Yu, et al.
Pubblicazione: (2026)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
di: Jiang, Qing, et al.
Pubblicazione: (2025)
di: Jiang, Qing, et al.
Pubblicazione: (2025)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
di: Yu, Qifan, et al.
Pubblicazione: (2024)
di: Yu, Qifan, et al.
Pubblicazione: (2024)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
di: Zhao, Kesen, et al.
Pubblicazione: (2025) -
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
di: Zhou, Junbao, et al.
Pubblicazione: (2025) -
Enhancing CLIP Robustness via Cross-Modality Alignment
di: Zhu, Xingyu, et al.
Pubblicazione: (2025) -
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
di: Zhu, Xingyu, et al.
Pubblicazione: (2026) -
Real-Time Motion-Controllable Autoregressive Video Diffusion
di: Zhao, Kesen, et al.
Pubblicazione: (2025)