Enregistré dans:
| Auteurs principaux: | Xu, Yijia, Wang, Zihao, Cui, Jinshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.03448 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Direction-Aware Diagonal Autoregressive Image Generation
par: Xu, Yijia, et autres
Publié: (2025)
par: Xu, Yijia, et autres
Publié: (2025)
Image-Feature Weak-to-Strong Consistency: An Enhanced Paradigm for Semi-Supervised Learning
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
par: Hu, Zhenyu, et autres
Publié: (2026)
par: Hu, Zhenyu, et autres
Publié: (2026)
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation
par: Cai, Honghao, et autres
Publié: (2026)
par: Cai, Honghao, et autres
Publié: (2026)
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
Cached Multi-Lora Composition for Multi-Concept Image Generation
par: Zou, Xiandong, et autres
Publié: (2025)
par: Zou, Xiandong, et autres
Publié: (2025)
FlipConcept: Tuning-Free Multi-Concept Personalization for Text-to-Image Generation
par: Woo, Young Beom, et autres
Publié: (2025)
par: Woo, Young Beom, et autres
Publié: (2025)
GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs
par: Basioti, Kalliopi, et autres
Publié: (2025)
par: Basioti, Kalliopi, et autres
Publié: (2025)
Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
par: Kim, Jihyo, et autres
Publié: (2024)
par: Kim, Jihyo, et autres
Publié: (2024)
LocRef-Diffusion:Tuning-Free Layout and Appearance-Guided Generation
par: Deng, Fan, et autres
Publié: (2024)
par: Deng, Fan, et autres
Publié: (2024)
VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation
par: Luo, Yan, et autres
Publié: (2026)
par: Luo, Yan, et autres
Publié: (2026)
FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus
par: Jin, Qiaoqiao, et autres
Publié: (2025)
par: Jin, Qiaoqiao, et autres
Publié: (2025)
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing
par: Zhu, Zihao, et autres
Publié: (2024)
par: Zhu, Zihao, et autres
Publié: (2024)
Single Image Iterative Subject-driven Generation and Editing
par: Shpitzer, Yair, et autres
Publié: (2025)
par: Shpitzer, Yair, et autres
Publié: (2025)
Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model
par: Zhang, Zhenxing, et autres
Publié: (2025)
par: Zhang, Zhenxing, et autres
Publié: (2025)
Hierarchical, Interpretable, Label-Free Concept Bottleneck Model
par: Xie, Haodong, et autres
Publié: (2026)
par: Xie, Haodong, et autres
Publié: (2026)
Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models
par: Jang, Sangwon, et autres
Publié: (2024)
par: Jang, Sangwon, et autres
Publié: (2024)
Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation
par: Xie, Dian, et autres
Publié: (2026)
par: Xie, Dian, et autres
Publié: (2026)
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
par: Chen, Weiming, et autres
Publié: (2025)
par: Chen, Weiming, et autres
Publié: (2025)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
par: Zhang, Jusheng, et autres
Publié: (2026)
par: Zhang, Jusheng, et autres
Publié: (2026)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
BrainDreamer: Reasoning-Coherent and Controllable Image Generation from EEG Brain Signals via Language Guidance
par: Wang, Ling, et autres
Publié: (2024)
par: Wang, Ling, et autres
Publié: (2024)
DescriptorMedSAM: Language-Image Fusion with Multi-Aspect Text Guidance for Medical Image Segmentation
par: Zhang, Wenjie, et autres
Publié: (2025)
par: Zhang, Wenjie, et autres
Publié: (2025)
GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation
par: Tao, Xujing, et autres
Publié: (2026)
par: Tao, Xujing, et autres
Publié: (2026)
Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation
par: Dahary, Omer, et autres
Publié: (2024)
par: Dahary, Omer, et autres
Publié: (2024)
Conceptrol: Concept Control of Zero-shot Personalized Image Generation
par: He, Qiyuan, et autres
Publié: (2025)
par: He, Qiyuan, et autres
Publié: (2025)
High-fidelity Person-centric Subject-to-Image Synthesis
par: Wang, Yibin, et autres
Publié: (2023)
par: Wang, Yibin, et autres
Publié: (2023)
Plug-and-Play Interpretable Responsible Text-to-Image Generation via Dual-Space Multi-facet Concept Control
par: Azam, Basim, et autres
Publié: (2025)
par: Azam, Basim, et autres
Publié: (2025)
Flux Already Knows -- Activating Subject-Driven Image Generation without Training
par: Kang, Hao, et autres
Publié: (2025)
par: Kang, Hao, et autres
Publié: (2025)
DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing
par: Li, Ke, et autres
Publié: (2026)
par: Li, Ke, et autres
Publié: (2026)
Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition
par: Yeh, Chun-Hsiao, et autres
Publié: (2024)
par: Yeh, Chun-Hsiao, et autres
Publié: (2024)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
par: Xu, Dunyuan, et autres
Publié: (2024)
par: Xu, Dunyuan, et autres
Publié: (2024)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
par: Chen, Zisheng, et autres
Publié: (2025)
par: Chen, Zisheng, et autres
Publié: (2025)
RSGen: Enhancing Layout-Driven Remote Sensing Image Generation with Diverse Edge Guidance
par: Hou, Xianbao, et autres
Publié: (2026)
par: Hou, Xianbao, et autres
Publié: (2026)
Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
par: Wang, Kuan-Chieh, et autres
Publié: (2024)
par: Wang, Kuan-Chieh, et autres
Publié: (2024)
BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation
par: Zhu, Zihao, et autres
Publié: (2026)
par: Zhu, Zihao, et autres
Publié: (2026)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
Documents similaires
-
Direction-Aware Diagonal Autoregressive Image Generation
par: Xu, Yijia, et autres
Publié: (2025) -
Image-Feature Weak-to-Strong Consistency: An Enhanced Paradigm for Semi-Supervised Learning
par: Wu, Zhiyu, et autres
Publié: (2024) -
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025) -
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025) -
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
par: Hu, Zhenyu, et autres
Publié: (2026)