StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Keli, Wang, Zhendong, Zhou, Wengang, Li, Houqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
di: Liu, Keli, et al.
Pubblicazione: (2025)
di: Liu, Keli, et al.
Pubblicazione: (2025)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
di: Guo, Hang, et al.
Pubblicazione: (2025)
di: Guo, Hang, et al.
Pubblicazione: (2025)
GaussNav: Gaussian Splatting for Visual Navigation
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
di: Wang, Zhendong, et al.
Pubblicazione: (2025)
di: Wang, Zhendong, et al.
Pubblicazione: (2025)
EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
di: Zheng, Rongkun, et al.
Pubblicazione: (2025)
di: Zheng, Rongkun, et al.
Pubblicazione: (2025)
FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models
di: Li, Senmao, et al.
Pubblicazione: (2025)
di: Li, Senmao, et al.
Pubblicazione: (2025)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
Revisiting Shadow Detection from a Vision-Language Perspective
di: Wang, Yonghui, et al.
Pubblicazione: (2026)
di: Wang, Yonghui, et al.
Pubblicazione: (2026)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models
di: Li, Junhao, et al.
Pubblicazione: (2026)
di: Li, Junhao, et al.
Pubblicazione: (2026)
Structural Action Transformer for 3D Dexterous Manipulation
di: Lei, Xiaohan, et al.
Pubblicazione: (2026)
di: Lei, Xiaohan, et al.
Pubblicazione: (2026)
SwinShadow: Shifted Window for Ambiguous Adjacent Shadow Detection
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
LiteVAR: Compressing Visual Autoregressive Modelling with Efficient Attention and Quantization
di: Xie, Rui, et al.
Pubblicazione: (2024)
di: Xie, Rui, et al.
Pubblicazione: (2024)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping
di: Li, Jiajun, et al.
Pubblicazione: (2025)
di: Li, Jiajun, et al.
Pubblicazione: (2025)
ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models
di: Yan, Feihong, et al.
Pubblicazione: (2026)
di: Yan, Feihong, et al.
Pubblicazione: (2026)
Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
di: Xu, Shaodong, et al.
Pubblicazione: (2026)
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
di: Guo, Zhiyang, et al.
Pubblicazione: (2024)
di: Guo, Zhiyang, et al.
Pubblicazione: (2024)
Text-Animator: Controllable Visual Text Video Generation
di: Liu, Lin, et al.
Pubblicazione: (2024)
di: Liu, Lin, et al.
Pubblicazione: (2024)
RemoteVAR: Autoregressive Visual Modeling for Remote Sensing Change Detection
di: Korkmaz, Yilmaz, et al.
Pubblicazione: (2026)
di: Korkmaz, Yilmaz, et al.
Pubblicazione: (2026)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
di: Jiao, Siyu, et al.
Pubblicazione: (2025)
di: Jiao, Siyu, et al.
Pubblicazione: (2025)
HSI-VAR: Rethinking Hyperspectral Restoration through Spatial-Spectral Visual Autoregression
di: Wang, Xiangming, et al.
Pubblicazione: (2026)
di: Wang, Xiangming, et al.
Pubblicazione: (2026)
SmartEraser: Remove Anything from Images using Masked-Region Guidance
di: Jiang, Longtao, et al.
Pubblicazione: (2025)
di: Jiang, Longtao, et al.
Pubblicazione: (2025)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
di: Liao, Zhaokang, et al.
Pubblicazione: (2024)
di: Liao, Zhaokang, et al.
Pubblicazione: (2024)
Learning Generalizable Human Motion Generator with Reinforcement Learning
di: Mao, Yunyao, et al.
Pubblicazione: (2024)
di: Mao, Yunyao, et al.
Pubblicazione: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
Progressive Multi-modal Conditional Prompt Tuning
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval
di: Du, Yongchao, et al.
Pubblicazione: (2024)
di: Du, Yongchao, et al.
Pubblicazione: (2024)
DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models
di: Park, Mingue, et al.
Pubblicazione: (2025)
di: Park, Mingue, et al.
Pubblicazione: (2025)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
Rethinking Structure Preservation in Text-Guided Image Editing with Visual Autoregressive Models
di: Xia, Tao, et al.
Pubblicazione: (2026)
di: Xia, Tao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ScaleWeaver: Weaving Efficient Controllable T2I Generation with Multi-Scale Reference Attention
di: Liu, Keli, et al.
Pubblicazione: (2025) -
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025) -
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
di: Guo, Hang, et al.
Pubblicazione: (2025) -
GaussNav: Gaussian Splatting for Visual Navigation
di: Lei, Xiaohan, et al.
Pubblicazione: (2024) -
DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion Models
di: Wang, Zhendong, et al.
Pubblicazione: (2025)