Improving Autoregressive Visual Generation with Cluster-Oriented Token Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Teng, Zhang, Jiangning, Yi, Ran, Weng, Jieyu, Wang, Yabiao, Zeng, Xianfang, Xue, Zhucun, Ma, Lizhuang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
di: Yi, Ran, et al.
Pubblicazione: (2025)
di: Yi, Ran, et al.
Pubblicazione: (2025)
InstanceV: Instance-Level Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
di: Chen, Yuheng, et al.
Pubblicazione: (2025)
MotionMaster: Training-free Camera Motion Transfer For Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2024)
di: Hu, Teng, et al.
Pubblicazione: (2024)
Evolution of Video Generative Foundations
di: Hu, Teng, et al.
Pubblicazione: (2026)
di: Hu, Teng, et al.
Pubblicazione: (2026)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
di: Hu, Teng, et al.
Pubblicazione: (2024)
di: Hu, Teng, et al.
Pubblicazione: (2024)
Semantic Frame Interpolation
di: Hong, Yijia, et al.
Pubblicazione: (2025)
di: Hong, Yijia, et al.
Pubblicazione: (2025)
UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy
di: Xu, Yicheng, et al.
Pubblicazione: (2026)
di: Xu, Yicheng, et al.
Pubblicazione: (2026)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
di: Liu, Jinzhuo, et al.
Pubblicazione: (2026)
di: Liu, Jinzhuo, et al.
Pubblicazione: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
TIMotion: Temporal and Interactive Framework for Efficient Human-Human Motion Generation
di: Wang, Yabiao, et al.
Pubblicazione: (2024)
di: Wang, Yabiao, et al.
Pubblicazione: (2024)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
di: Du, Yuzhen, et al.
Pubblicazione: (2024)
EMOv2: Pushing 5M Vision Model Frontier
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
Textual Decomposition Then Sub-motion-space Scattering for Open-Vocabulary Motion Generation
di: Fan, Ke, et al.
Pubblicazione: (2024)
di: Fan, Ke, et al.
Pubblicazione: (2024)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
Image Inversion: A Survey from GANs to Diffusion and Beyond
di: Chen, Yinan, et al.
Pubblicazione: (2025)
di: Chen, Yinan, et al.
Pubblicazione: (2025)
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
di: Hu, Teng, et al.
Pubblicazione: (2023)
di: Hu, Teng, et al.
Pubblicazione: (2023)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
UltraGen: High-Resolution Video Generation with Hierarchical Attention
di: Hu, Teng, et al.
Pubblicazione: (2025)
di: Hu, Teng, et al.
Pubblicazione: (2025)
GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
di: Wang, Yabiao, et al.
Pubblicazione: (2025)
di: Wang, Yabiao, et al.
Pubblicazione: (2025)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
di: Sun, Haiyue, et al.
Pubblicazione: (2025)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
di: Fan, Ke, et al.
Pubblicazione: (2024)
di: Fan, Ke, et al.
Pubblicazione: (2024)
PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
di: Wang, Ruiyan, et al.
Pubblicazione: (2025)
di: Wang, Ruiyan, et al.
Pubblicazione: (2025)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering
di: Lukovnikov, Denis, et al.
Pubblicazione: (2025)
di: Lukovnikov, Denis, et al.
Pubblicazione: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
di: Chen, Yinan, et al.
Pubblicazione: (2025)
di: Chen, Yinan, et al.
Pubblicazione: (2025)
Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations
di: Zhang, Tong, et al.
Pubblicazione: (2026)
di: Zhang, Tong, et al.
Pubblicazione: (2026)
Hyperspherical Latents Improve Continuous-Token Autoregressive Generation
di: Ke, Guolin, et al.
Pubblicazione: (2025)
di: Ke, Guolin, et al.
Pubblicazione: (2025)
Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval
di: Xue, Zhucun, et al.
Pubblicazione: (2026)
di: Xue, Zhucun, et al.
Pubblicazione: (2026)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
di: Hu, Chengyang, et al.
Pubblicazione: (2025)
di: Hu, Chengyang, et al.
Pubblicazione: (2025)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
di: Guo, Ziyao, et al.
Pubblicazione: (2025)
di: Guo, Ziyao, et al.
Pubblicazione: (2025)
AdR-Gaussian: Accelerating Gaussian Splatting with Adaptive Radius
di: Wang, Xinzhe, et al.
Pubblicazione: (2024)
di: Wang, Xinzhe, et al.
Pubblicazione: (2024)
RWKV-UNet: Improving UNet with Long-Range Cooperation for Effective Medical Image Segmentation
di: Jiang, Juntao, et al.
Pubblicazione: (2025)
di: Jiang, Juntao, et al.
Pubblicazione: (2025)
M3DM-NR: RGB-3D Noisy-Resistant Industrial Anomaly Detection via Multimodal Denoising
di: Wang, Chengjie, et al.
Pubblicazione: (2024)
di: Wang, Chengjie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
di: Yi, Ran, et al.
Pubblicazione: (2025) -
InstanceV: Instance-Level Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2025) -
MotionMaster: Training-free Camera Motion Transfer For Video Generation
di: Hu, Teng, et al.
Pubblicazione: (2024) -
Evolution of Video Generative Foundations
di: Hu, Teng, et al.
Pubblicazione: (2026) -
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
di: Hu, Teng, et al.
Pubblicazione: (2024)