V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Han, Pan, Xichen, Wang, Zun, Zhang, Yue, Wang, Chu, Cho, Jaemin, Bansal, Mohit |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026)
par: Wang, Zun, et autres
Publié: (2026)
EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
par: Wang, Zun, et autres
Publié: (2025)
par: Wang, Zun, et autres
Publié: (2025)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning
par: Zala, Abhay, et autres
Publié: (2023)
par: Zala, Abhay, et autres
Publié: (2023)
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
par: Lin, Han, et autres
Publié: (2023)
par: Lin, Han, et autres
Publié: (2023)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
par: Huang, Yidong, et autres
Publié: (2026)
par: Huang, Yidong, et autres
Publié: (2026)
Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model
par: Lin, Han, et autres
Publié: (2024)
par: Lin, Han, et autres
Publié: (2024)
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
par: Pothiraj, Atin, et autres
Publié: (2025)
par: Pothiraj, Atin, et autres
Publié: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
par: Niu, Tianyi, et autres
Publié: (2025)
par: Niu, Tianyi, et autres
Publié: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
A Closer Look at Multimodal Representation Collapse
par: Chaudhuri, Abhra, et autres
Publié: (2025)
par: Chaudhuri, Abhra, et autres
Publié: (2025)
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
par: Cho, Jaemin, et autres
Publié: (2024)
par: Cho, Jaemin, et autres
Publié: (2024)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
par: Wan, David, et autres
Publié: (2024)
par: Wan, David, et autres
Publié: (2024)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
Rethinking Interactive Image Segmentation with Low Latency, High Quality, and Diverse Prompts
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
SELMA: Learning and Merging Skill-Specific Text-to-Image Experts with Auto-Generated Data
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
par: Huang, Yidong, et autres
Publié: (2025)
par: Huang, Yidong, et autres
Publié: (2025)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Less is More: A Closer Look at Semantic-based Few-Shot Learning
par: Zhou, Chunpeng, et autres
Publié: (2024)
par: Zhou, Chunpeng, et autres
Publié: (2024)
CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval
par: Wan, David, et autres
Publié: (2025)
par: Wan, David, et autres
Publié: (2025)
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
par: Chen, Yuanhong, et autres
Publié: (2023)
par: Chen, Yuanhong, et autres
Publié: (2023)
Preference Alignment for Diffusion Model via Explicit Denoised Distribution Estimation
par: Shi, Dingyuan, et autres
Publié: (2024)
par: Shi, Dingyuan, et autres
Publié: (2024)
Guiding Perception-Reasoning Closer to Human in Blind Image Quality Assessment
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
Exploring Partial Multi-Label Learning via Integrating Semantic Co-occurrence Knowledge
par: Wu, Xin, et autres
Publié: (2025)
par: Wu, Xin, et autres
Publié: (2025)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
Don't Judge by the Look: Towards Motion Coherent Video Representation
par: Zhang, Yitian, et autres
Publié: (2024)
par: Zhang, Yitian, et autres
Publié: (2024)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
TopoFR: A Closer Look at Topology Alignment on Face Recognition
par: Dan, Jun, et autres
Publié: (2024)
par: Dan, Jun, et autres
Publié: (2024)
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
par: Vaishnav, Mohit, et autres
Publié: (2026)
par: Vaishnav, Mohit, et autres
Publié: (2026)
Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising
par: Li, Huaqiu, et autres
Publié: (2025)
par: Li, Huaqiu, et autres
Publié: (2025)
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
Documents similaires
-
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026) -
EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
par: Wang, Zun, et autres
Publié: (2025) -
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025) -
DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning
par: Zala, Abhay, et autres
Publié: (2023) -
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
par: Lin, Han, et autres
Publié: (2023)