Enregistré dans:
| Auteurs principaux: | Tian, Wenqing, Mao, Hanyi, Liu, Zhaocheng, Zhang, Lihua, Liu, Qiang, Wu, Jian, Wang, Liang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.21937 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
par: Zhang, Haojie, et autres
Publié: (2026)
par: Zhang, Haojie, et autres
Publié: (2026)
GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation
par: Ye, Wen, et autres
Publié: (2025)
par: Ye, Wen, et autres
Publié: (2025)
ActionParty: Multi-Subject Action Binding in Generative Video Games
par: Pondaven, Alexander, et autres
Publié: (2026)
par: Pondaven, Alexander, et autres
Publié: (2026)
XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
par: Chen, Bowen, et autres
Publié: (2025)
par: Chen, Bowen, et autres
Publié: (2025)
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
par: Wang, Shulei, et autres
Publié: (2025)
par: Wang, Shulei, et autres
Publié: (2025)
Mixture of Low-rank Experts for Transferable AI-Generated Image Detection
par: Liu, Zihan, et autres
Publié: (2024)
par: Liu, Zihan, et autres
Publié: (2024)
Mask-Guided Multi-Task Network for Face Attribute Recognition
par: Gao, Gong, et autres
Publié: (2026)
par: Gao, Gong, et autres
Publié: (2026)
Multi-modal Attribute Prompting for Vision-Language Models
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation
par: Ling, Run, et autres
Publié: (2025)
par: Ling, Run, et autres
Publié: (2025)
BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration
par: Li, Zhaoyang, et autres
Publié: (2025)
par: Li, Zhaoyang, et autres
Publié: (2025)
MOSAIC: Multi-Subject Personalized Generation via Correspondence-Aware Alignment and Disentanglement
par: She, Dong, et autres
Publié: (2025)
par: She, Dong, et autres
Publié: (2025)
SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens
par: Zhang, Xiaoyan, et autres
Publié: (2026)
par: Zhang, Xiaoyan, et autres
Publié: (2026)
Semantics and Content Matter: Towards Multi-Prior Hierarchical Mamba for Image Deraining
par: Yu, Zhaocheng, et autres
Publié: (2025)
par: Yu, Zhaocheng, et autres
Publié: (2025)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
par: Cheng, Ming, et autres
Publié: (2025)
par: Cheng, Ming, et autres
Publié: (2025)
Improving Multi-Subject Consistency in Open-Domain Image Generation with Isolation and Reposition Attention
par: He, Huiguo, et autres
Publié: (2024)
par: He, Huiguo, et autres
Publié: (2024)
Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
par: Trusca, Maria Mihaela, et autres
Publié: (2024)
Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
par: Liao, Chao, et autres
Publié: (2025)
par: Liao, Chao, et autres
Publié: (2025)
Learning Feature Inversion for Multi-class Anomaly Detection under General-purpose COCO-AD Benchmark
par: Zhang, Jiangning, et autres
Publié: (2024)
par: Zhang, Jiangning, et autres
Publié: (2024)
PSTF-AttControl: Per-Subject-Tuning-Free Personalized Image Generation with Controllable Face Attributes
par: liu, Xiang, et autres
Publié: (2025)
par: liu, Xiang, et autres
Publié: (2025)
Any Resolution Any Geometry: From Multi-View To Multi-Patch
par: Cui, Wenqing, et autres
Publié: (2026)
par: Cui, Wenqing, et autres
Publié: (2026)
MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer
par: Liu, Penghui, et autres
Publié: (2025)
par: Liu, Penghui, et autres
Publié: (2025)
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment
par: Wu, Tao, et autres
Publié: (2025)
par: Wu, Tao, et autres
Publié: (2025)
FAR-AMTN: Attention Multi-Task Network for Face Attribute Recognition
par: Gao, Gong, et autres
Publié: (2026)
par: Gao, Gong, et autres
Publié: (2026)
The Instance-centric Transformer for the RVOS Track of LSVOS Challenge: 3rd Place Solution
par: Cao, Bin, et autres
Publié: (2024)
par: Cao, Bin, et autres
Publié: (2024)
Q-Save: Towards Scoring and Attribution for Generated Video Evaluation
par: Wu, Xiele, et autres
Publié: (2025)
par: Wu, Xiele, et autres
Publié: (2025)
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
par: Cheng, Junhao, et autres
Publié: (2024)
par: Cheng, Junhao, et autres
Publié: (2024)
Multi-Subject Personalization
par: Jain, Arushi, et autres
Publié: (2024)
par: Jain, Arushi, et autres
Publié: (2024)
MUSAR: Exploring Multi-Subject Customization from Single-Subject Dataset via Attention Routing
par: Guo, Zinan, et autres
Publié: (2025)
par: Guo, Zinan, et autres
Publié: (2025)
DD-RobustBench: An Adversarial Robustness Benchmark for Dataset Distillation
par: Wu, Yifan, et autres
Publié: (2024)
par: Wu, Yifan, et autres
Publié: (2024)
FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs
par: Wang, Xiaoqin, et autres
Publié: (2025)
par: Wang, Xiaoqin, et autres
Publié: (2025)
SubjectDrive: Scaling Generative Data in Autonomous Driving via Subject Control
par: Huang, Binyuan, et autres
Publié: (2024)
par: Huang, Binyuan, et autres
Publié: (2024)
Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router
par: Huang, Yubo, et autres
Publié: (2025)
par: Huang, Yubo, et autres
Publié: (2025)
Modelship Attribution: Tracing Multi-Stage Manipulations Across Generative Models
par: Tan, Zhiya, et autres
Publié: (2025)
par: Tan, Zhiya, et autres
Publié: (2025)
Innovative Tooth Segmentation Using Hierarchical Features and Bidirectional Sequence Modeling
par: Zhao, Xinxin, et autres
Publié: (2026)
par: Zhao, Xinxin, et autres
Publié: (2026)
ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Pedestrian Attribute Recognition as Label-balanced Multi-label Learning
par: Zhou, Yibo, et autres
Publié: (2024)
par: Zhou, Yibo, et autres
Publié: (2024)
PIG: Physically-based Multi-Material Interaction with 3D Gaussians
par: Xiao, Zeyu, et autres
Publié: (2025)
par: Xiao, Zeyu, et autres
Publié: (2025)
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
par: Zou, Kai, et autres
Publié: (2025)
par: Zou, Kai, et autres
Publié: (2025)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Box It to Bind It: Unified Layout Control and Attribute Binding in T2I Diffusion Models
par: Taghipour, Ashkan, et autres
Publié: (2024)
par: Taghipour, Ashkan, et autres
Publié: (2024)
Documents similaires
-
MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
par: Zhang, Haojie, et autres
Publié: (2026) -
GenPilot: A Multi-Agent System for Test-Time Prompt Optimization in Image Generation
par: Ye, Wen, et autres
Publié: (2025) -
ActionParty: Multi-Subject Action Binding in Generative Video Games
par: Pondaven, Alexander, et autres
Publié: (2026) -
XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
par: Chen, Bowen, et autres
Publié: (2025) -
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
par: Wang, Shulei, et autres
Publié: (2025)