Universal Approximation of Visual Autoregressive Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Yifang, Li, Xiaoyu, Liang, Yingyu, Shi, Zhenmei, Song, Zhao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Autoregressive Transformers Must Use $Ω(n^2 d)$ Memory
por: Cao, Yang, et al.
Publicado: (2025)
por: Cao, Yang, et al.
Publicado: (2025)
HOFAR: High-Order Augmentation of Flow Autoregressive Transformers
por: Liang, Yingyu, et al.
Publicado: (2025)
por: Liang, Yingyu, et al.
Publicado: (2025)
On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis
por: Ke, Yekun, et al.
Publicado: (2025)
por: Ke, Yekun, et al.
Publicado: (2025)
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation
por: Cao, Yuefan, et al.
Publicado: (2025)
por: Cao, Yuefan, et al.
Publicado: (2025)
Circuit Complexity Bounds for Visual Autoregressive Model
por: Ke, Yekun, et al.
Publicado: (2025)
por: Ke, Yekun, et al.
Publicado: (2025)
Unraveling the Smoothness Properties of Diffusion Models: A Gaussian Mixture Perspective
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
The Computational Limits of State-Space Models and Mamba via the Lens of Circuit Complexity
por: Chen, Yifang, et al.
Publicado: (2024)
por: Chen, Yifang, et al.
Publicado: (2024)
Time and Memory Trade-off of KV-Cache Compression in Tensor Transformer Decoding
por: Chen, Yifang, et al.
Publicado: (2025)
por: Chen, Yifang, et al.
Publicado: (2025)
Theoretical Guarantees for High Order Trajectory Refinement in Generative Flows
por: Gong, Chengyue, et al.
Publicado: (2025)
por: Gong, Chengyue, et al.
Publicado: (2025)
High-Order Matching for One-Step Shortcut Diffusion Models
por: Chen, Bo, et al.
Publicado: (2025)
por: Chen, Bo, et al.
Publicado: (2025)
Force Matching with Relativistic Constraints: A Physics-Inspired Approach to Stable and Efficient Generative Modeling
por: Cao, Yang, et al.
Publicado: (2025)
por: Cao, Yang, et al.
Publicado: (2025)
On Computational Limits of FlowAR Models: Expressivity and Efficiency
por: Cao, Yang, et al.
Publicado: (2025)
por: Cao, Yang, et al.
Publicado: (2025)
Multi-Layer Transformers Gradient Can be Approximated in Almost Linear Time
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Theoretical Constraints on the Expressive Power of $\mathsf{RoPE}$-based Tensor Attention Transformers
por: Li, Xiaoyu, et al.
Publicado: (2024)
por: Li, Xiaoyu, et al.
Publicado: (2024)
Towards Infinite-Long Prefix in Transformer
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Text-to-Image Diffusion Models Cannot Count, and Prompt Refinement Cannot Help
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
Can You Count to Nine? A Human Evaluation Benchmark for Counting Limits in Modern Text-to-Video Models
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
por: Guo, Xuyang, et al.
Publicado: (2025)
por: Guo, Xuyang, et al.
Publicado: (2025)
Circuit Complexity Bounds for RoPE-based Transformer Architecture
por: Chen, Bo, et al.
Publicado: (2024)
por: Chen, Bo, et al.
Publicado: (2024)
Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
A Tighter Complexity Analysis of SparseGPT
por: Li, Xiaoyu, et al.
Publicado: (2024)
por: Li, Xiaoyu, et al.
Publicado: (2024)
Neural Algorithmic Reasoning for Hypergraphs with Looped Transformers
por: Huang, Zekai, et al.
Publicado: (2025)
por: Huang, Zekai, et al.
Publicado: (2025)
On Fine-Grained I/O Complexity of Attention Backward Passes
por: Li, Xiaoyu, et al.
Publicado: (2024)
por: Li, Xiaoyu, et al.
Publicado: (2024)
Training Tensor Attention Efficiently: From Cubic to Almost Linear Time
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
Modern Hopfield Networks Require Chain-of-Thought to Solve $\mathsf{NC}^1$-Hard Problems
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
por: Tang, Haotian, et al.
Publicado: (2024)
por: Tang, Haotian, et al.
Publicado: (2024)
Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability
por: Xu, Zhuoyan, et al.
Publicado: (2024)
por: Xu, Zhuoyan, et al.
Publicado: (2024)
HSR-Enhanced Sparse Attention Acceleration
por: Chen, Bo, et al.
Publicado: (2024)
por: Chen, Bo, et al.
Publicado: (2024)
Self-Supervised Visual Preference Alignment
por: Zhu, Ke, et al.
Publicado: (2024)
por: Zhu, Ke, et al.
Publicado: (2024)
RoPE Attention Can Be Trained in Almost Linear Time
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
When Can We Solve the Weighted Low Rank Approximation Problem in Truly Subquadratic Time?
por: Li, Chenyang, et al.
Publicado: (2025)
por: Li, Chenyang, et al.
Publicado: (2025)
MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models
por: Li, Yangyan
Publicado: (2026)
por: Li, Yangyan
Publicado: (2026)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
por: Zhou, Gengze, et al.
Publicado: (2025)
por: Zhou, Gengze, et al.
Publicado: (2025)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
por: Pang, Ziqi, et al.
Publicado: (2023)
por: Pang, Ziqi, et al.
Publicado: (2023)
Why Larger Language Models Do In-context Learning Differently?
por: Shi, Zhenmei, et al.
Publicado: (2024)
por: Shi, Zhenmei, et al.
Publicado: (2024)
Parrot: Multilingual Visual Instruction Tuning
por: Sun, Hai-Long, et al.
Publicado: (2024)
por: Sun, Hai-Long, et al.
Publicado: (2024)
VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
por: Lin, Huawei, et al.
Publicado: (2025)
por: Lin, Huawei, et al.
Publicado: (2025)
SeqPE: Transformer with Sequential Position Encoding
por: Li, Huayang, et al.
Publicado: (2025)
por: Li, Huayang, et al.
Publicado: (2025)
Reconstructive Visual Instruction Tuning
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
Ejemplares similares
-
Visual Autoregressive Transformers Must Use $Ω(n^2 d)$ Memory
por: Cao, Yang, et al.
Publicado: (2025) -
HOFAR: High-Order Augmentation of Flow Autoregressive Transformers
por: Liang, Yingyu, et al.
Publicado: (2025) -
On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis
por: Ke, Yekun, et al.
Publicado: (2025) -
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation
por: Cao, Yuefan, et al.
Publicado: (2025) -
Circuit Complexity Bounds for Visual Autoregressive Model
por: Ke, Yekun, et al.
Publicado: (2025)