Salvato in:
| Autori principali: | Shi, Ruixiao, Feng, Fu, Xie, Yucheng, Yang, Xu, Wang, Jing, Geng, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.17895 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Weight Templates for Scalable Vision Model Initialization
di: Xie, Yucheng, et al.
Pubblicazione: (2026)
di: Xie, Yucheng, et al.
Pubblicazione: (2026)
Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2024)
di: Feng, Fu, et al.
Pubblicazione: (2024)
FAD: Frequency Adaptation and Diversion for Cross-domain Few-shot Learning
di: Shi, Ruixiao, et al.
Pubblicazione: (2025)
di: Shi, Ruixiao, et al.
Pubblicazione: (2025)
Distribution-Conditional Generation: From Class Distribution to Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2025)
di: Feng, Fu, et al.
Pubblicazione: (2025)
KIND: Knowledge Integration and Diversion for Training Decomposable Models
di: Xie, Yucheng, et al.
Pubblicazione: (2024)
di: Xie, Yucheng, et al.
Pubblicazione: (2024)
DivControl: Knowledge Diversion for Controllable Image Generation
di: Xie, Yucheng, et al.
Pubblicazione: (2025)
di: Xie, Yucheng, et al.
Pubblicazione: (2025)
FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models
di: Xie, Yucheng, et al.
Pubblicazione: (2024)
di: Xie, Yucheng, et al.
Pubblicazione: (2024)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
di: Wang, Feng, et al.
Pubblicazione: (2025)
di: Wang, Feng, et al.
Pubblicazione: (2025)
An Image is Worth 32 Tokens for Reconstruction and Generation
di: Yu, Qihang, et al.
Pubblicazione: (2024)
di: Yu, Qihang, et al.
Pubblicazione: (2024)
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
di: Kerssies, Tommie, et al.
Pubblicazione: (2026)
di: Kerssies, Tommie, et al.
Pubblicazione: (2026)
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
di: Hu, Lianyu, et al.
Pubblicazione: (2024)
Equivariant Image Modeling
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
Tokenize Image as a Set
di: Geng, Zigang, et al.
Pubblicazione: (2025)
di: Geng, Zigang, et al.
Pubblicazione: (2025)
Images are Worth Variable Length of Representations
di: Mao, Lingjun, et al.
Pubblicazione: (2025)
di: Mao, Lingjun, et al.
Pubblicazione: (2025)
Information Coordination as a Bridge: A Neuro-Symbolic Architecture for Reliable Autonomous Driving Scene Understanding
di: Liu, Shuo, et al.
Pubblicazione: (2026)
di: Liu, Shuo, et al.
Pubblicazione: (2026)
Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale
di: Wei, Dongxu, et al.
Pubblicazione: (2026)
di: Wei, Dongxu, et al.
Pubblicazione: (2026)
CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition
di: Yang, Hongji, et al.
Pubblicazione: (2026)
di: Yang, Hongji, et al.
Pubblicazione: (2026)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
Metadata-Driven Federated Learning of Connectional Brain Templates in Non-IID Multi-Domain Scenarios
di: Chen, Geng, et al.
Pubblicazione: (2024)
di: Chen, Geng, et al.
Pubblicazione: (2024)
A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions
di: Urbanek, Jack, et al.
Pubblicazione: (2023)
di: Urbanek, Jack, et al.
Pubblicazione: (2023)
Spectral-Structured Diffusion for Single-Image Rain Removal
di: Xing, Yucheng, et al.
Pubblicazione: (2026)
di: Xing, Yucheng, et al.
Pubblicazione: (2026)
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
di: Chen, Ruiming, et al.
Pubblicazione: (2025)
di: Chen, Ruiming, et al.
Pubblicazione: (2025)
Vript: A Video Is Worth Thousands of Words
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
di: Yang, Dongjie, et al.
Pubblicazione: (2024)
A Video Is Not Worth a Thousand Words
di: Pollard, Sam, et al.
Pubblicazione: (2025)
di: Pollard, Sam, et al.
Pubblicazione: (2025)
An Object is Worth 64x64 Pixels: Generating 3D Object via Image Diffusion
di: Yan, Xingguang, et al.
Pubblicazione: (2024)
di: Yan, Xingguang, et al.
Pubblicazione: (2024)
When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization
di: Li, Tianqi, et al.
Pubblicazione: (2026)
di: Li, Tianqi, et al.
Pubblicazione: (2026)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
di: Guo, Yiwei, et al.
Pubblicazione: (2026)
An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control
di: Feng, Aosong, et al.
Pubblicazione: (2024)
di: Feng, Aosong, et al.
Pubblicazione: (2024)
A LoRA is Worth a Thousand Pictures
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
di: Liu, Chenxi, et al.
Pubblicazione: (2024)
RigAnything: Template-Free Autoregressive Rigging for Diverse 3D Assets
di: Liu, Isabella, et al.
Pubblicazione: (2025)
di: Liu, Isabella, et al.
Pubblicazione: (2025)
Concept-Centric Token Interpretation for Vector-Quantized Generative Models
di: Yang, Tianze, et al.
Pubblicazione: (2025)
di: Yang, Tianze, et al.
Pubblicazione: (2025)
Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging
di: Nguyen, Phat, et al.
Pubblicazione: (2026)
di: Nguyen, Phat, et al.
Pubblicazione: (2026)
Vibe Spaces for Creatively Connecting and Expressing Visual Concepts
di: Yang, Huzheng, et al.
Pubblicazione: (2025)
di: Yang, Huzheng, et al.
Pubblicazione: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
Creative4U: MLLMs-based Advertising Creative Image Selector with Comparative Reasoning
di: Lin, Yukang, et al.
Pubblicazione: (2025)
di: Lin, Yukang, et al.
Pubblicazione: (2025)
MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation
di: Wang, Yucheng, et al.
Pubblicazione: (2025)
di: Wang, Yucheng, et al.
Pubblicazione: (2025)
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
di: Xu, Zhou, et al.
Pubblicazione: (2026)
di: Xu, Zhou, et al.
Pubblicazione: (2026)
Multimodal-Enhanced Objectness Learner for Corner Case Detection in Autonomous Driving
di: Xiao, Lixing, et al.
Pubblicazione: (2024)
di: Xiao, Lixing, et al.
Pubblicazione: (2024)
NormAUG: Normalization-guided Augmentation for Domain Generalization
di: Qi, Lei, et al.
Pubblicazione: (2023)
di: Qi, Lei, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Self-Supervised Weight Templates for Scalable Vision Model Initialization
di: Xie, Yucheng, et al.
Pubblicazione: (2026) -
Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2024) -
FAD: Frequency Adaptation and Diversion for Cross-domain Few-shot Learning
di: Shi, Ruixiao, et al.
Pubblicazione: (2025) -
Distribution-Conditional Generation: From Class Distribution to Creative Generation
di: Feng, Fu, et al.
Pubblicazione: (2025) -
KIND: Knowledge Integration and Diversion for Training Decomposable Models
di: Xie, Yucheng, et al.
Pubblicazione: (2024)