VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhiwen, Duan, Zhongjie, Ye, Jinyan, Chen, Cen, Chen, Daoyuan, Li, Yaliang, Chen, Yingda |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
por: Ye, Jinyan, et al.
Publicado: (2026)
por: Ye, Jinyan, et al.
Publicado: (2026)
AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation
por: Li, Zhiwen, et al.
Publicado: (2025)
por: Li, Zhiwen, et al.
Publicado: (2025)
Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models
por: Chen, Die, et al.
Publicado: (2025)
por: Chen, Die, et al.
Publicado: (2025)
Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion
por: Duan, Zhongjie, et al.
Publicado: (2026)
por: Duan, Zhongjie, et al.
Publicado: (2026)
Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models
por: Chen, Die, et al.
Publicado: (2024)
por: Chen, Die, et al.
Publicado: (2024)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
por: Li, Yuyi, et al.
Publicado: (2025)
por: Li, Yuyi, et al.
Publicado: (2025)
Diffutoon: High-Resolution Editable Toon Shading via Diffusion Models
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
EliGen: Entity-Level Controlled Image Generation with Regional Attention
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
Multi-dimensional Visual Prompt Enhanced Image Restoration via Mamba-Transformer Aggregation
por: Jiang, Aiwen, et al.
Publicado: (2024)
por: Jiang, Aiwen, et al.
Publicado: (2024)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?
por: Xu, Zhe, et al.
Publicado: (2025)
por: Xu, Zhe, et al.
Publicado: (2025)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
por: Zhou, Ting, et al.
Publicado: (2024)
por: Zhou, Ting, et al.
Publicado: (2024)
DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
por: Jiao, Qirui, et al.
Publicado: (2025)
por: Jiao, Qirui, et al.
Publicado: (2025)
Transferability Bound Theory: Exploring Relationship between Adversarial Transferability and Flatness
por: Fan, Mingyuan, et al.
Publicado: (2023)
por: Fan, Mingyuan, et al.
Publicado: (2023)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
por: Gan, Chaofan, et al.
Publicado: (2025)
por: Gan, Chaofan, et al.
Publicado: (2025)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
por: He, Xuanhua, et al.
Publicado: (2025)
por: He, Xuanhua, et al.
Publicado: (2025)
Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development
por: Chen, Daoyuan, et al.
Publicado: (2024)
por: Chen, Daoyuan, et al.
Publicado: (2024)
Find, Fix, Reason: Context Repair for Video Reasoning
por: Huang, Haojian, et al.
Publicado: (2026)
por: Huang, Haojian, et al.
Publicado: (2026)
Efficient Large Multi-modal Models via Visual Context Compression
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
Point-In-Context: Understanding Point Cloud via In-Context Learning
por: Liu, Mengyuan, et al.
Publicado: (2024)
por: Liu, Mengyuan, et al.
Publicado: (2024)
Video Diffusion Transformers are In-Context Learners
por: Fei, Zhengcong, et al.
Publicado: (2024)
por: Fei, Zhengcong, et al.
Publicado: (2024)
In-Context Audio Control of Video Diffusion Transformers
por: Liu, Wenze, et al.
Publicado: (2025)
por: Liu, Wenze, et al.
Publicado: (2025)
Language-Guided Diffusion Model for Visual Grounding
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers
por: Ren, Li, et al.
Publicado: (2025)
por: Ren, Li, et al.
Publicado: (2025)
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
The Synergy between Data and Multi-Modal Large Language Models: A Survey from Co-Development Perspective
por: Qin, Zhen, et al.
Publicado: (2024)
por: Qin, Zhen, et al.
Publicado: (2024)
Efficient Universal Models for Medical Image Segmentation via Weakly Supervised In-Context Learning
por: Hu, Jiesi, et al.
Publicado: (2025)
por: Hu, Jiesi, et al.
Publicado: (2025)
In-Context LoRA for Diffusion Transformers
por: Huang, Lianghua, et al.
Publicado: (2024)
por: Huang, Lianghua, et al.
Publicado: (2024)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
Exploring Effective Factors for Improving Visual In-Context Learning
por: Sun, Yanpeng, et al.
Publicado: (2023)
por: Sun, Yanpeng, et al.
Publicado: (2023)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
por: Chen, Jinshu, et al.
Publicado: (2025)
por: Chen, Jinshu, et al.
Publicado: (2025)
VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images
por: Li, Zhaonan, et al.
Publicado: (2026)
por: Li, Zhaonan, et al.
Publicado: (2026)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
por: Wang, Junjie, et al.
Publicado: (2026)
por: Wang, Junjie, et al.
Publicado: (2026)
MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer
por: Teodoro, Samuel, et al.
Publicado: (2026)
por: Teodoro, Samuel, et al.
Publicado: (2026)
Ejemplares similares
-
Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation
por: Ye, Jinyan, et al.
Publicado: (2026) -
AttriCtrl: Fine-Grained Control of Aesthetic Attribute Intensity in Diffusion Models
por: Chen, Die, et al.
Publicado: (2025) -
AutoLoRA: Automatic LoRA Retrieval and Fine-Grained Gated Fusion for Text-to-Image Generation
por: Li, Zhiwen, et al.
Publicado: (2025) -
Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models
por: Chen, Die, et al.
Publicado: (2025) -
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
por: Duan, Zhongjie, et al.
Publicado: (2024)