Improving Autoregressive Visual Generation with Cluster-Oriented Token Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Hu, Teng, Zhang, Jiangning, Yi, Ran, Weng, Jieyu, Wang, Yabiao, Zeng, Xianfang, Xue, Zhucun, Ma, Lizhuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
por: Yi, Ran, et al.
Publicado: (2025)
por: Yi, Ran, et al.
Publicado: (2025)
InstanceV: Instance-Level Video Generation
por: Chen, Yuheng, et al.
Publicado: (2025)
por: Chen, Yuheng, et al.
Publicado: (2025)
MotionMaster: Training-free Camera Motion Transfer For Video Generation
por: Hu, Teng, et al.
Publicado: (2024)
por: Hu, Teng, et al.
Publicado: (2024)
Evolution of Video Generative Foundations
por: Hu, Teng, et al.
Publicado: (2026)
por: Hu, Teng, et al.
Publicado: (2026)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
por: Hu, Teng, et al.
Publicado: (2024)
por: Hu, Teng, et al.
Publicado: (2024)
Semantic Frame Interpolation
por: Hong, Yijia, et al.
Publicado: (2025)
por: Hong, Yijia, et al.
Publicado: (2025)
UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy
por: Xu, Yicheng, et al.
Publicado: (2026)
por: Xu, Yicheng, et al.
Publicado: (2026)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
por: Liu, Jinzhuo, et al.
Publicado: (2026)
por: Liu, Jinzhuo, et al.
Publicado: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
TIMotion: Temporal and Interactive Framework for Efficient Human-Human Motion Generation
por: Wang, Yabiao, et al.
Publicado: (2024)
por: Wang, Yabiao, et al.
Publicado: (2024)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
por: Zhang, Jiangning, et al.
Publicado: (2025)
por: Zhang, Jiangning, et al.
Publicado: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
por: Du, Yuzhen, et al.
Publicado: (2024)
por: Du, Yuzhen, et al.
Publicado: (2024)
EMOv2: Pushing 5M Vision Model Frontier
por: Zhang, Jiangning, et al.
Publicado: (2024)
por: Zhang, Jiangning, et al.
Publicado: (2024)
Textual Decomposition Then Sub-motion-space Scattering for Open-Vocabulary Motion Generation
por: Fan, Ke, et al.
Publicado: (2024)
por: Fan, Ke, et al.
Publicado: (2024)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Image Inversion: A Survey from GANs to Diffusion and Beyond
por: Chen, Yinan, et al.
Publicado: (2025)
por: Chen, Yinan, et al.
Publicado: (2025)
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
por: Hu, Teng, et al.
Publicado: (2023)
por: Hu, Teng, et al.
Publicado: (2023)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
por: Zhang, Jiangning, et al.
Publicado: (2024)
por: Zhang, Jiangning, et al.
Publicado: (2024)
UltraGen: High-Resolution Video Generation with Hierarchical Attention
por: Hu, Teng, et al.
Publicado: (2025)
por: Hu, Teng, et al.
Publicado: (2025)
GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection
por: Zhang, Jiangning, et al.
Publicado: (2023)
por: Zhang, Jiangning, et al.
Publicado: (2023)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
por: Xue, Zhucun, et al.
Publicado: (2025)
por: Xue, Zhucun, et al.
Publicado: (2025)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
por: Wang, Yabiao, et al.
Publicado: (2025)
por: Wang, Yabiao, et al.
Publicado: (2025)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
por: Sun, Haiyue, et al.
Publicado: (2025)
por: Sun, Haiyue, et al.
Publicado: (2025)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
por: Fan, Ke, et al.
Publicado: (2024)
por: Fan, Ke, et al.
Publicado: (2024)
PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
por: Wang, Ruiyan, et al.
Publicado: (2025)
por: Wang, Ruiyan, et al.
Publicado: (2025)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
por: Wang, Yuqing, et al.
Publicado: (2025)
por: Wang, Yuqing, et al.
Publicado: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
por: Jin, Yizhang, et al.
Publicado: (2024)
por: Jin, Yizhang, et al.
Publicado: (2024)
ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering
por: Lukovnikov, Denis, et al.
Publicado: (2025)
por: Lukovnikov, Denis, et al.
Publicado: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
por: Chen, Yinan, et al.
Publicado: (2025)
por: Chen, Yinan, et al.
Publicado: (2025)
Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations
por: Zhang, Tong, et al.
Publicado: (2026)
por: Zhang, Tong, et al.
Publicado: (2026)
Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
por: Ke, Guolin, et al.
Publicado: (2025)
por: Ke, Guolin, et al.
Publicado: (2025)
Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval
por: Xue, Zhucun, et al.
Publicado: (2026)
por: Xue, Zhucun, et al.
Publicado: (2026)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
por: Hu, Chengyang, et al.
Publicado: (2025)
por: Hu, Chengyang, et al.
Publicado: (2025)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2025)
por: Ren, Sucheng, et al.
Publicado: (2025)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
por: Guo, Ziyao, et al.
Publicado: (2025)
por: Guo, Ziyao, et al.
Publicado: (2025)
AdR-Gaussian: Accelerating Gaussian Splatting with Adaptive Radius
por: Wang, Xinzhe, et al.
Publicado: (2024)
por: Wang, Xinzhe, et al.
Publicado: (2024)
RWKV-UNet: Improving UNet with Long-Range Cooperation for Effective Medical Image Segmentation
por: Jiang, Juntao, et al.
Publicado: (2025)
por: Jiang, Juntao, et al.
Publicado: (2025)
M3DM-NR: RGB-3D Noisy-Resistant Industrial Anomaly Detection via Multimodal Denoising
por: Wang, Chengjie, et al.
Publicado: (2024)
por: Wang, Chengjie, et al.
Publicado: (2024)
Ejemplares similares
-
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
por: Yi, Ran, et al.
Publicado: (2025) -
InstanceV: Instance-Level Video Generation
por: Chen, Yuheng, et al.
Publicado: (2025) -
MotionMaster: Training-free Camera Motion Transfer For Video Generation
por: Hu, Teng, et al.
Publicado: (2024) -
Evolution of Video Generative Foundations
por: Hu, Teng, et al.
Publicado: (2026) -
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
por: Hu, Teng, et al.
Publicado: (2024)