Saved in:
| Main Authors: | Chen, Zhihan, Zhao, Yuhuan, Zhu, Yijie, Yao, Xinyu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.26078 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models
by: Jang, Sangwon, et al.
Published: (2024)
by: Jang, Sangwon, et al.
Published: (2024)
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation
by: Cai, Honghao, et al.
Published: (2026)
by: Cai, Honghao, et al.
Published: (2026)
MV-S2V: Multi-View Subject-Consistent Video Generation
by: Song, Ziyang, et al.
Published: (2026)
by: Song, Ziyang, et al.
Published: (2026)
DynASyn: Multi-Subject Personalization Enabling Dynamic Action Synthesis
by: Choi, Yongjin, et al.
Published: (2025)
by: Choi, Yongjin, et al.
Published: (2025)
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
by: Chen, Weiming, et al.
Published: (2025)
by: Chen, Weiming, et al.
Published: (2025)
Runge-Kutta Approximation and Decoupled Attention for Rectified Flow Inversion and Semantic Editing
by: Chen, Weiming, et al.
Published: (2025)
by: Chen, Weiming, et al.
Published: (2025)
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
by: Hu, Zhenyu, et al.
Published: (2026)
by: Hu, Zhenyu, et al.
Published: (2026)
High-fidelity Person-centric Subject-to-Image Synthesis
by: Wang, Yibin, et al.
Published: (2023)
by: Wang, Yibin, et al.
Published: (2023)
Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models
by: Chen, Xinyu, et al.
Published: (2025)
by: Chen, Xinyu, et al.
Published: (2025)
Personalized Video Summarization by Multimodal Video Understanding
by: Chen, Brian, et al.
Published: (2024)
by: Chen, Brian, et al.
Published: (2024)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
by: Kong, Fanqi, et al.
Published: (2025)
by: Kong, Fanqi, et al.
Published: (2025)
FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus
by: Jin, Qiaoqiao, et al.
Published: (2025)
by: Jin, Qiaoqiao, et al.
Published: (2025)
LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation
by: Xing, Jiazheng, et al.
Published: (2026)
by: Xing, Jiazheng, et al.
Published: (2026)
Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation
by: Kilrain, Connor, et al.
Published: (2025)
by: Kilrain, Connor, et al.
Published: (2025)
ReMamber: Referring Image Segmentation with Mamba Twister
by: Yang, Yuhuan, et al.
Published: (2024)
by: Yang, Yuhuan, et al.
Published: (2024)
When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation
by: Zheng, Dongqi
Published: (2026)
by: Zheng, Dongqi
Published: (2026)
Hierarchical Identity Learning for Unsupervised Visible-Infrared Person Re-Identification
by: Shi, Haonan, et al.
Published: (2025)
by: Shi, Haonan, et al.
Published: (2025)
SaFiRe: Saccade-Fixation Reiteration with Mamba for Referring Image Segmentation
by: Mao, Zhenjie, et al.
Published: (2025)
by: Mao, Zhenjie, et al.
Published: (2025)
IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis
by: Zhang, Lingyun, et al.
Published: (2026)
by: Zhang, Lingyun, et al.
Published: (2026)
FaceChain-FACT: Face Adapter with Decoupled Training for Identity-preserved Personalization
by: Yu, Cheng, et al.
Published: (2024)
by: Yu, Cheng, et al.
Published: (2024)
SkiP: When to Skip and When to Refine for Efficient Robot Manipulation
by: Dai, Mingtong, et al.
Published: (2026)
by: Dai, Mingtong, et al.
Published: (2026)
HippoCamp: Benchmarking Contextual Agents on Personal Computers
by: Yang, Zhe, et al.
Published: (2026)
by: Yang, Zhe, et al.
Published: (2026)
ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search
by: Kim, Myungchul, et al.
Published: (2026)
by: Kim, Myungchul, et al.
Published: (2026)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
by: Wang, Kuan-Chieh, et al.
Published: (2024)
by: Wang, Kuan-Chieh, et al.
Published: (2024)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
by: Ma, Chaofan, et al.
Published: (2023)
by: Ma, Chaofan, et al.
Published: (2023)
TCMM: Token Constraint and Multi-Scale Memory Bank of Contrastive Learning for Unsupervised Person Re-identification
by: Zhu, Zheng-An, et al.
Published: (2025)
by: Zhu, Zheng-An, et al.
Published: (2025)
Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation
by: Chen, Zeyu, et al.
Published: (2026)
by: Chen, Zeyu, et al.
Published: (2026)
Pre-Deployment Robustness Stress Testing for CT Segmentation Systems Using Clinically Motivated Multi-Corruption Augmentation
by: Kang, CholMin, et al.
Published: (2026)
by: Kang, CholMin, et al.
Published: (2026)
When Person Re-Identification Meets Event Camera: A Benchmark Dataset and An Attribute-guided Re-Identification Framework
by: Wang, Xiao, et al.
Published: (2025)
by: Wang, Xiao, et al.
Published: (2025)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
by: Zhang, YiFan, et al.
Published: (2024)
by: Zhang, YiFan, et al.
Published: (2024)
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
by: Cai, Zikui, et al.
Published: (2025)
by: Cai, Zikui, et al.
Published: (2025)
UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images
by: Li, Siqi, et al.
Published: (2025)
by: Li, Siqi, et al.
Published: (2025)
When Small Guides Large: Cross-Model Co-Learning for Test-Time Adaptation
by: Yi, Chang'an, et al.
Published: (2025)
by: Yi, Chang'an, et al.
Published: (2025)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
by: Han, Xiao, et al.
Published: (2024)
by: Han, Xiao, et al.
Published: (2024)
Lightweight Multimodal Artificial Intelligence Framework for Maritime Multi-Scene Recognition
by: Xi, Xinyu, et al.
Published: (2025)
by: Xi, Xinyu, et al.
Published: (2025)
Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation
by: Chen, Weiming, et al.
Published: (2026)
by: Chen, Weiming, et al.
Published: (2026)
Text-based Aerial-Ground Person Retrieval
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
A Culturally-Aware Benchmark for Person Re-Identification in Modest Attire
by: Moghaddam, Alireza Sedighi, et al.
Published: (2024)
by: Moghaddam, Alireza Sedighi, et al.
Published: (2024)
InstantID: Zero-shot Identity-Preserving Generation in Seconds
by: Wang, Qixun, et al.
Published: (2024)
by: Wang, Qixun, et al.
Published: (2024)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
by: Yuan, Shenghai, et al.
Published: (2025)
by: Yuan, Shenghai, et al.
Published: (2025)
Similar Items
-
Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models
by: Jang, Sangwon, et al.
Published: (2024) -
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation
by: Cai, Honghao, et al.
Published: (2026) -
MV-S2V: Multi-View Subject-Consistent Video Generation
by: Song, Ziyang, et al.
Published: (2026) -
DynASyn: Multi-Subject Personalization Enabling Dynamic Action Synthesis
by: Choi, Yongjin, et al.
Published: (2025) -
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
by: Chen, Weiming, et al.
Published: (2025)