WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Jian, Yin, Dacheng, He, Xiaoxuan, Li, Yong, Rao, Fengyun, Lyu, Jing, Zhai, Wei, Cao, Yang, Zha, Zheng-Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
von: Yang, Jian, et al.
Veröffentlicht: (2024)
von: Yang, Jian, et al.
Veröffentlicht: (2024)
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
von: He, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: He, Xiaoxuan, et al.
Veröffentlicht: (2025)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
von: Yang, Jie, et al.
Veröffentlicht: (2025)
von: Yang, Jie, et al.
Veröffentlicht: (2025)
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026)
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026)
REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization
von: Li, Yong, et al.
Veröffentlicht: (2026)
von: Li, Yong, et al.
Veröffentlicht: (2026)
Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model
von: Wu, Pingyu, et al.
Veröffentlicht: (2025)
von: Wu, Pingyu, et al.
Veröffentlicht: (2025)
WeDetect: Fast Open-Vocabulary Object Detection as Retrieval
von: Fu, Shenghao, et al.
Veröffentlicht: (2025)
von: Fu, Shenghao, et al.
Veröffentlicht: (2025)
Instant Preference Alignment for Text-to-Image Diffusion Models
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
Improved Video VAE for Latent Video Diffusion Model
von: Wu, Pingyu, et al.
Veröffentlicht: (2024)
von: Wu, Pingyu, et al.
Veröffentlicht: (2024)
ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models
von: Fang, Zixun, et al.
Veröffentlicht: (2025)
von: Fang, Zixun, et al.
Veröffentlicht: (2025)
AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents
von: Yan, Shannan, et al.
Veröffentlicht: (2026)
von: Yan, Shannan, et al.
Veröffentlicht: (2026)
Constrained Generative Modeling with Manually Bridged Diffusion Models
von: Naderiparizi, Saeid, et al.
Veröffentlicht: (2025)
von: Naderiparizi, Saeid, et al.
Veröffentlicht: (2025)
R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
von: Yang, Yi, et al.
Veröffentlicht: (2025)
von: Yang, Yi, et al.
Veröffentlicht: (2025)
EMoTive: Event-guided Trajectory Modeling for 3D Motion Estimation
von: Wan, Zengyu, et al.
Veröffentlicht: (2025)
von: Wan, Zengyu, et al.
Veröffentlicht: (2025)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
von: Zhang, Yunzhu, et al.
Veröffentlicht: (2025)
von: Zhang, Yunzhu, et al.
Veröffentlicht: (2025)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
von: Tang, Changli, et al.
Veröffentlicht: (2026)
von: Tang, Changli, et al.
Veröffentlicht: (2026)
QMambaBSR: Burst Image Super-Resolution with Query State Space Model
von: Di, Xin, et al.
Veröffentlicht: (2024)
von: Di, Xin, et al.
Veröffentlicht: (2024)
Probing Unlearned Diffusion Models: A Transferable Adversarial Attack Perspective
von: Han, Xiaoxuan, et al.
Veröffentlicht: (2024)
von: Han, Xiaoxuan, et al.
Veröffentlicht: (2024)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
von: Qiao, Bingtian, et al.
Veröffentlicht: (2026)
von: Qiao, Bingtian, et al.
Veröffentlicht: (2026)
Noisy Test-Time Adaptation in Vision-Language Models
von: Cao, Chentao, et al.
Veröffentlicht: (2025)
von: Cao, Chentao, et al.
Veröffentlicht: (2025)
Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models
von: Rao, Jun, et al.
Veröffentlicht: (2024)
von: Rao, Jun, et al.
Veröffentlicht: (2024)
DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models
von: Yin, Shicheng, et al.
Veröffentlicht: (2025)
von: Yin, Shicheng, et al.
Veröffentlicht: (2025)
DRM: Diffusion-based Reward Model With Step-wise Guidance
von: Zhang, Jaxon, et al.
Veröffentlicht: (2026)
von: Zhang, Jaxon, et al.
Veröffentlicht: (2026)
Calculation of Temperature Action of Flat Steel Box Girder of Long‐Span Bridges Using a Joint Model of ARMA Mean and GARCH Variance
von: Jun Yang, et al.
Veröffentlicht: (2024)
von: Jun Yang, et al.
Veröffentlicht: (2024)
ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models
von: Lai, Yingxin, et al.
Veröffentlicht: (2026)
von: Lai, Yingxin, et al.
Veröffentlicht: (2026)
ViViD: Video Virtual Try-on using Diffusion Models
von: Fang, Zixun, et al.
Veröffentlicht: (2024)
von: Fang, Zixun, et al.
Veröffentlicht: (2024)
LEMON: Learning 3D Human-Object Interaction Relation from 2D Images
von: Yang, Yuhang, et al.
Veröffentlicht: (2023)
von: Yang, Yuhang, et al.
Veröffentlicht: (2023)
HERO: Human Reaction Generation from Videos
von: Yu, Chengjun, et al.
Veröffentlicht: (2025)
von: Yu, Chengjun, et al.
Veröffentlicht: (2025)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
von: Han, Guangyi, et al.
Veröffentlicht: (2025)
von: Han, Guangyi, et al.
Veröffentlicht: (2025)
PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
von: Sun, Yuxuan, et al.
Veröffentlicht: (2024)
von: Sun, Yuxuan, et al.
Veröffentlicht: (2024)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
von: Wei, Zhixiang, et al.
Veröffentlicht: (2025)
von: Wei, Zhixiang, et al.
Veröffentlicht: (2025)
Tokenization, Fusion and Decoupling: Bridging the Granularity Mismatch Between Large Language Models and Knowledge Graphs
von: Su, Siyue, et al.
Veröffentlicht: (2026)
von: Su, Siyue, et al.
Veröffentlicht: (2026)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
von: Lu, Fan, et al.
Veröffentlicht: (2024)
von: Lu, Fan, et al.
Veröffentlicht: (2024)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
Restoring Noisy Demonstration for Imitation Learning With Diffusion Models
von: Chen, Shang-Fu, et al.
Veröffentlicht: (2025)
von: Chen, Shang-Fu, et al.
Veröffentlicht: (2025)
Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment
von: Shao, Yawen, et al.
Veröffentlicht: (2025)
von: Shao, Yawen, et al.
Veröffentlicht: (2025)
NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries
von: Wu, Tao, et al.
Veröffentlicht: (2024)
von: Wu, Tao, et al.
Veröffentlicht: (2024)
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
von: Wang, Zitian, et al.
Veröffentlicht: (2025)
von: Wang, Zitian, et al.
Veröffentlicht: (2025)
ObjEmbed: Towards Universal Multimodal Object Embeddings
von: Fu, Shenghao, et al.
Veröffentlicht: (2026)
von: Fu, Shenghao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
von: Yang, Jian, et al.
Veröffentlicht: (2024) -
TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
von: He, Xiaoxuan, et al.
Veröffentlicht: (2025) -
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
von: Yang, Jie, et al.
Veröffentlicht: (2025) -
SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback
von: He, Xiaoxuan, et al.
Veröffentlicht: (2026) -
REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization
von: Li, Yong, et al.
Veröffentlicht: (2026)