Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jing, Ma, Ao, Feng, Jiasong, Leng, Dawei, Yin, Yuhui, Liang, Xiaodan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
por: Zhang, Zhanjie, et al.
Publicado: (2025)
por: Zhang, Zhanjie, et al.
Publicado: (2025)
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
por: Ma, Ao, et al.
Publicado: (2025)
por: Ma, Ao, et al.
Publicado: (2025)
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
por: Cheng, Bo, et al.
Publicado: (2024)
por: Cheng, Bo, et al.
Publicado: (2024)
LMM-Det: Make Large Multimodal Models Excel in Object Detection
por: Li, Jincheng, et al.
Publicado: (2025)
por: Li, Jincheng, et al.
Publicado: (2025)
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers
por: Ma, Yuhang, et al.
Publicado: (2025)
por: Ma, Yuhang, et al.
Publicado: (2025)
NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer
por: Liu, Shanyuan, et al.
Publicado: (2025)
por: Liu, Shanyuan, et al.
Publicado: (2025)
RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers
por: Cao, Ke, et al.
Publicado: (2025)
por: Cao, Ke, et al.
Publicado: (2025)
FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance
por: Feng, Jiasong, et al.
Publicado: (2024)
por: Feng, Jiasong, et al.
Publicado: (2024)
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
por: Jian, Weijian, et al.
Publicado: (2025)
por: Jian, Weijian, et al.
Publicado: (2025)
X2SAM: Any Segmentation in Images and Videos
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
por: Gao, Peng, et al.
Publicado: (2024)
por: Gao, Peng, et al.
Publicado: (2024)
X-SAM: From Segment Anything to Any Segmentation
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
FLUX-Makeup: High-Fidelity, Identity-Consistent, and Robust Makeup Transfer via Diffusion Transformer
por: Zhu, Jian, et al.
Publicado: (2025)
por: Zhu, Jian, et al.
Publicado: (2025)
Astraea: A Token-wise Acceleration Framework for Video Diffusion Transformers
por: Liu, Haosong, et al.
Publicado: (2025)
por: Liu, Haosong, et al.
Publicado: (2025)
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
por: He, Runze, et al.
Publicado: (2025)
por: He, Runze, et al.
Publicado: (2025)
CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
por: Gong, Yue, et al.
Publicado: (2025)
por: Gong, Yue, et al.
Publicado: (2025)
FG-CLIP: Fine-Grained Visual and Textual Alignment
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
AniClipart: Clipart Animation with Text-to-Video Priors
por: Wu, Ronghuan, et al.
Publicado: (2024)
por: Wu, Ronghuan, et al.
Publicado: (2024)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
por: Yang, Zhuoyi, et al.
Publicado: (2024)
por: Yang, Zhuoyi, et al.
Publicado: (2024)
MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction
por: Wang, Yin, et al.
Publicado: (2025)
por: Wang, Yin, et al.
Publicado: (2025)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
por: Chang, Shuning, et al.
Publicado: (2024)
por: Chang, Shuning, et al.
Publicado: (2024)
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
por: Yang, Zhuoyi, et al.
Publicado: (2024)
por: Yang, Zhuoyi, et al.
Publicado: (2024)
RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition
por: Wang, Binhao, et al.
Publicado: (2026)
por: Wang, Binhao, et al.
Publicado: (2026)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
por: Wang, Zirui, et al.
Publicado: (2023)
por: Wang, Zirui, et al.
Publicado: (2023)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
por: Ma, Kexin, et al.
Publicado: (2026)
por: Ma, Kexin, et al.
Publicado: (2026)
AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation
por: Xie, Zhenyu, et al.
Publicado: (2026)
por: Xie, Zhenyu, et al.
Publicado: (2026)
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
por: Ma, Yiyang, et al.
Publicado: (2025)
por: Ma, Yiyang, et al.
Publicado: (2025)
RefTon: Reference person shot assist virtual Try-on
por: Li, Liuzhuozheng, et al.
Publicado: (2025)
por: Li, Liuzhuozheng, et al.
Publicado: (2025)
Ensemble Predicate Decoding for Unbiased Scene Graph Generation
por: Feng, Jiasong, et al.
Publicado: (2024)
por: Feng, Jiasong, et al.
Publicado: (2024)
Realistic and Efficient Face Swapping: A Unified Approach with Diffusion Models
por: Baliah, Sanoojan, et al.
Publicado: (2024)
por: Baliah, Sanoojan, et al.
Publicado: (2024)
VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers
por: Zheng, Jun, et al.
Publicado: (2024)
por: Zheng, Jun, et al.
Publicado: (2024)
Token Caching for Diffusion Transformer Acceleration
por: Lou, Jinming, et al.
Publicado: (2024)
por: Lou, Jinming, et al.
Publicado: (2024)
Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
por: Zheng, Shikang, et al.
Publicado: (2025)
por: Zheng, Shikang, et al.
Publicado: (2025)
Any2AnyTryon: Leveraging Adaptive Position Embeddings for Versatile Virtual Clothing Tasks
por: Guo, Hailong, et al.
Publicado: (2025)
por: Guo, Hailong, et al.
Publicado: (2025)
AnyText2: Visual Text Generation and Editing With Customizable Attributes
por: Tuo, Yuxiang, et al.
Publicado: (2024)
por: Tuo, Yuxiang, et al.
Publicado: (2024)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
por: Chen, Jinshu, et al.
Publicado: (2025)
por: Chen, Jinshu, et al.
Publicado: (2025)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
por: Tang, Haoran, et al.
Publicado: (2024)
por: Tang, Haoran, et al.
Publicado: (2024)
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
por: Wu, Xiangyu, et al.
Publicado: (2025)
por: Wu, Xiangyu, et al.
Publicado: (2025)
Ejemplares similares
-
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
por: Wang, Jing, et al.
Publicado: (2025) -
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
por: Zhang, Zhanjie, et al.
Publicado: (2025) -
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story Generation
por: Ma, Ao, et al.
Publicado: (2025) -
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
por: Cheng, Bo, et al.
Publicado: (2024) -
LMM-Det: Make Large Multimodal Models Excel in Object Detection
por: Li, Jincheng, et al.
Publicado: (2025)