Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Keuntae, Kang, Mingyu, Choi, Yong Suk |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
di: Kang, Mingyu, et al.
Pubblicazione: (2025)
di: Kang, Mingyu, et al.
Pubblicazione: (2025)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
di: Sun, Yuwei, et al.
Pubblicazione: (2026)
di: Sun, Yuwei, et al.
Pubblicazione: (2026)
Objective and Interpretable Breast Cosmesis Evaluation with Attention Guided Denoising Diffusion Anomaly Detection Model
di: Park, Sangjoon, et al.
Pubblicazione: (2024)
di: Park, Sangjoon, et al.
Pubblicazione: (2024)
Dynamic VLM-Guided Negative Prompting for Diffusion Models
di: Chang, Hoyeon, et al.
Pubblicazione: (2025)
di: Chang, Hoyeon, et al.
Pubblicazione: (2025)
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
di: Chae, Daewon, et al.
Pubblicazione: (2025)
di: Chae, Daewon, et al.
Pubblicazione: (2025)
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
di: Jung, Woojun, et al.
Pubblicazione: (2025)
di: Jung, Woojun, et al.
Pubblicazione: (2025)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Real-Time Visual Attribution Streaming in Thinking Model
di: Kang, Seil, et al.
Pubblicazione: (2026)
di: Kang, Seil, et al.
Pubblicazione: (2026)
H2-Cache: A Novel Hierarchical Dual-Stage Cache for High-Performance Acceleration of Generative Diffusion Models
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
Diffusion Fuzzy System: Fuzzy Rule Guided Latent Multi-Path Diffusion Modeling
di: Yang, Hailong, et al.
Pubblicazione: (2025)
di: Yang, Hailong, et al.
Pubblicazione: (2025)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
di: Kang, Seil, et al.
Pubblicazione: (2025)
di: Kang, Seil, et al.
Pubblicazione: (2025)
Diffusion-Guided Semantic Consistency for Multimodal Heterogeneity
di: Liu, Jing, et al.
Pubblicazione: (2026)
di: Liu, Jing, et al.
Pubblicazione: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
di: Wu, Junfei, et al.
Pubblicazione: (2025)
di: Wu, Junfei, et al.
Pubblicazione: (2025)
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
Text-Guided Variational Image Generation for Industrial Anomaly Detection and Segmentation
di: Lee, Mingyu, et al.
Pubblicazione: (2024)
di: Lee, Mingyu, et al.
Pubblicazione: (2024)
StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
di: Park, Jiho, et al.
Pubblicazione: (2025)
di: Park, Jiho, et al.
Pubblicazione: (2025)
FIFO-Diffusion: Generating Infinite Videos from Text without Training
di: Kim, Jihwan, et al.
Pubblicazione: (2024)
di: Kim, Jihwan, et al.
Pubblicazione: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2024)
di: Xiang, Kun, et al.
Pubblicazione: (2024)
Reference-Guided Diffusion Inpainting For Multimodal Counterfactual Generation
di: Buburuzan, Alexandru
Pubblicazione: (2025)
di: Buburuzan, Alexandru
Pubblicazione: (2025)
Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
di: Kim, Jiyeong, et al.
Pubblicazione: (2026)
di: Kim, Jiyeong, et al.
Pubblicazione: (2026)
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination
di: Zheng, Haojie, et al.
Pubblicazione: (2024)
di: Zheng, Haojie, et al.
Pubblicazione: (2024)
Paired Image Generation with Diffusion-Guided Diffusion Models
di: Zhang, Haoxuan, et al.
Pubblicazione: (2025)
di: Zhang, Haoxuan, et al.
Pubblicazione: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
di: Yu, Zhuoran, et al.
Pubblicazione: (2025)
di: Yu, Zhuoran, et al.
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
VGR: Visual Grounded Reasoning
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
di: Wang, Jiacong, et al.
Pubblicazione: (2025)
Fusion Embedding for Pose-Guided Person Image Synthesis with Diffusion Model
di: Lee, Donghwna, et al.
Pubblicazione: (2024)
di: Lee, Donghwna, et al.
Pubblicazione: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
di: Wang, Haibo, et al.
Pubblicazione: (2026)
di: Wang, Haibo, et al.
Pubblicazione: (2026)
Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
di: Liao, Haicheng, et al.
Pubblicazione: (2025)
di: Liao, Haicheng, et al.
Pubblicazione: (2025)
See What You Are Told: Visual Attention Sink in Large Multimodal Models
di: Kang, Seil, et al.
Pubblicazione: (2025)
di: Kang, Seil, et al.
Pubblicazione: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
di: Luo, Mi, et al.
Pubblicazione: (2025)
di: Luo, Mi, et al.
Pubblicazione: (2025)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
di: Yu, Lijun, et al.
Pubblicazione: (2023)
di: Yu, Lijun, et al.
Pubblicazione: (2023)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
GLYPH-SR: Can We Achieve Both High-Quality Image Super-Resolution and High-Fidelity Text Recovery via VLM-guided Latent Diffusion Model?
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering
di: Choi, Changin, et al.
Pubblicazione: (2025)
di: Choi, Changin, et al.
Pubblicazione: (2025)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
di: Yu, Mingyu, et al.
Pubblicazione: (2026)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
di: Lim, Byeonggeuk, et al.
Pubblicazione: (2026)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2026)
di: Chen, Junkai, et al.
Pubblicazione: (2026)
Safeguard Text-to-Image Diffusion Models with Human Feedback Inversion
di: Kim, Sanghyun, et al.
Pubblicazione: (2024)
di: Kim, Sanghyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Editable Noise Map Inversion: Encoding Target-image into Noise For High-Fidelity Image Manipulation
di: Kang, Mingyu, et al.
Pubblicazione: (2025) -
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
di: Sun, Yuwei, et al.
Pubblicazione: (2026) -
Objective and Interpretable Breast Cosmesis Evaluation with Attention Guided Denoising Diffusion Anomaly Detection Model
di: Park, Sangjoon, et al.
Pubblicazione: (2024) -
Dynamic VLM-Guided Negative Prompting for Diffusion Models
di: Chang, Hoyeon, et al.
Pubblicazione: (2025) -
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
di: Chae, Daewon, et al.
Pubblicazione: (2025)