Salvato in:
| Autori principali: | Yu, Jian, Shen, Fei, Wang, Cong, Xin, Yi, Shen, Si, Du, Xiaoyu, Tang, Jinhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.07210 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IMAGGarment: Fine-Grained Garment Generation for Controllable Fashion Design
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection
di: Shen, Fei, et al.
Pubblicazione: (2026)
di: Shen, Fei, et al.
Pubblicazione: (2026)
IMAGDressing-v1: Customizable Virtual Dressing
di: Shen, Fei, et al.
Pubblicazione: (2024)
di: Shen, Fei, et al.
Pubblicazione: (2024)
Jointly Conditioned Diffusion Model for Multi-View Pose-Guided Person Image Synthesis
di: Xie, Chengyu, et al.
Pubblicazione: (2025)
di: Xie, Chengyu, et al.
Pubblicazione: (2025)
VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis
di: Chen, Zhipeng, et al.
Pubblicazione: (2024)
di: Chen, Zhipeng, et al.
Pubblicazione: (2024)
LeCoT: revisiting network architecture for two-view correspondence pruning
di: Dai, Luanyuan, et al.
Pubblicazione: (2025)
di: Dai, Luanyuan, et al.
Pubblicazione: (2025)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
di: Wang, Yuanrui, et al.
Pubblicazione: (2025)
di: Wang, Yuanrui, et al.
Pubblicazione: (2025)
Scope: Selective Cross-modal Orchestration of Visual Perception Experts
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
di: Zhang, Tianyu, et al.
Pubblicazione: (2025)
MGNet: Learning Correspondences via Multiple Graphs
di: Dai, Luanyuan, et al.
Pubblicazione: (2024)
di: Dai, Luanyuan, et al.
Pubblicazione: (2024)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding
di: Feng, Kaidong, et al.
Pubblicazione: (2026)
di: Feng, Kaidong, et al.
Pubblicazione: (2026)
Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition
di: He, Yu, et al.
Pubblicazione: (2026)
di: He, Yu, et al.
Pubblicazione: (2026)
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
di: Kong, Quan, et al.
Pubblicazione: (2026)
di: Kong, Quan, et al.
Pubblicazione: (2026)
Class Is Invariant to Context and Vice Versa: On Learning Invariance for Out-Of-Distribution Generalization
di: Qi, Jiaxin, et al.
Pubblicazione: (2022)
di: Qi, Jiaxin, et al.
Pubblicazione: (2022)
PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
di: Wang, Shaomeng, et al.
Pubblicazione: (2025)
di: Wang, Shaomeng, et al.
Pubblicazione: (2025)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
di: He, Xiang, et al.
Pubblicazione: (2025)
di: He, Xiang, et al.
Pubblicazione: (2025)
MedVersa: A Generalist Foundation Model for Medical Image Interpretation
di: Zhou, Hong-Yu, et al.
Pubblicazione: (2024)
di: Zhou, Hong-Yu, et al.
Pubblicazione: (2024)
FashionPose: Text to Pose to Relight Image Generation for Personalized Fashion Visualization
di: Shi, Chuancheng, et al.
Pubblicazione: (2025)
di: Shi, Chuancheng, et al.
Pubblicazione: (2025)
ASTRA: Let Arbitrary Subjects Transform in Video Editing
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking
di: Xuan, Shiyu, et al.
Pubblicazione: (2025)
di: Xuan, Shiyu, et al.
Pubblicazione: (2025)
Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models
di: Shen, Fei, et al.
Pubblicazione: (2023)
di: Shen, Fei, et al.
Pubblicazione: (2023)
Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization
di: Qiu, Xinyu, et al.
Pubblicazione: (2026)
di: Qiu, Xinyu, et al.
Pubblicazione: (2026)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
di: Wu, Hao, et al.
Pubblicazione: (2026)
di: Wu, Hao, et al.
Pubblicazione: (2026)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2024)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
EvolvingGrasp: Evolutionary Grasp Generation via Efficient Preference Alignment
di: Zhu, Yufei, et al.
Pubblicazione: (2025)
di: Zhu, Yufei, et al.
Pubblicazione: (2025)
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
di: Dong, Neng, et al.
Pubblicazione: (2025)
di: Dong, Neng, et al.
Pubblicazione: (2025)
STAF: 3D Human Mesh Recovery from Video with Spatio-Temporal Alignment Fusion
di: Yao, Wei, et al.
Pubblicazione: (2024)
di: Yao, Wei, et al.
Pubblicazione: (2024)
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
di: Jin, Xin, et al.
Pubblicazione: (2025)
di: Jin, Xin, et al.
Pubblicazione: (2025)
ORXE: Orchestrating Experts for Dynamically Configurable Efficiency
di: Wang, Qingyuan, et al.
Pubblicazione: (2025)
di: Wang, Qingyuan, et al.
Pubblicazione: (2025)
FashionSD-X: Multimodal Fashion Garment Synthesis using Latent Diffusion
di: Singh, Abhishek Kumar, et al.
Pubblicazione: (2024)
di: Singh, Abhishek Kumar, et al.
Pubblicazione: (2024)
TEST-V: TEst-time Support-set Tuning for Zero-shot Video Classification
di: Yan, Rui, et al.
Pubblicazione: (2025)
di: Yan, Rui, et al.
Pubblicazione: (2025)
SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Boosting Consistency in Story Visualization with Rich-Contextual Conditional Diffusion Models
di: Shen, Fei, et al.
Pubblicazione: (2024)
di: Shen, Fei, et al.
Pubblicazione: (2024)
Unified Multimodal Visual Tracking with Dual Mixture-of-Experts
di: Hong, Lingyi, et al.
Pubblicazione: (2026)
di: Hong, Lingyi, et al.
Pubblicazione: (2026)
StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors
di: Shen, Guibao, et al.
Pubblicazione: (2025)
di: Shen, Guibao, et al.
Pubblicazione: (2025)
Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion Prediction
di: Yin, Zheng, et al.
Pubblicazione: (2025)
di: Yin, Zheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IMAGGarment: Fine-Grained Garment Generation for Controllable Fashion Design
di: Shen, Fei, et al.
Pubblicazione: (2025) -
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
di: Shen, Fei, et al.
Pubblicazione: (2025) -
IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection
di: Shen, Fei, et al.
Pubblicazione: (2026) -
IMAGDressing-v1: Customizable Virtual Dressing
di: Shen, Fei, et al.
Pubblicazione: (2024) -
Jointly Conditioned Diffusion Model for Multi-View Pose-Guided Person Image Synthesis
di: Xie, Chengyu, et al.
Pubblicazione: (2025)