Arbitrary Ratio Feature Compression via Next Token Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yufan, Ren, Daoyuan, Zhang, Zhipeng, Luo, Wenyang, Li, Bing, Hu, Weiming, Maybank, Stephen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Token Caching for Diffusion Transformer Acceleration
por: Lou, Jinming, et al.
Publicado: (2024)
por: Lou, Jinming, et al.
Publicado: (2024)
Temporal Correlation Meets Embedding: Towards a 2nd Generation of JDE-based Real-Time Multi-Object Tracking
por: Zhang, Yunfei, et al.
Publicado: (2024)
por: Zhang, Yunfei, et al.
Publicado: (2024)
Hyperspectral Image Spectral-Spatial Feature Extraction via Tensor Principal Component Analysis
por: Ren, Yuemei, et al.
Publicado: (2024)
por: Ren, Yuemei, et al.
Publicado: (2024)
Beyond Dataset Distillation: Lossless Dataset Concentration via Diffusion-Assisted Distribution Alignment
por: Liu, Tongfei, et al.
Publicado: (2026)
por: Liu, Tongfei, et al.
Publicado: (2026)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2025)
por: Ren, Sucheng, et al.
Publicado: (2025)
Visual-Instructed Degradation Diffusion for All-in-One Image Restoration
por: Luo, Wenyang, et al.
Publicado: (2025)
por: Luo, Wenyang, et al.
Publicado: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
Emu3: Next-Token Prediction is All You Need
por: Wang, Xinlong, et al.
Publicado: (2024)
por: Wang, Xinlong, et al.
Publicado: (2024)
Object Recognition as Next Token Prediction
por: Yue, Kaiyu, et al.
Publicado: (2023)
por: Yue, Kaiyu, et al.
Publicado: (2023)
VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization
por: Zhang, Yiwei, et al.
Publicado: (2024)
por: Zhang, Yiwei, et al.
Publicado: (2024)
NEP: Autoregressive Image Editing via Next Editing Token Prediction
por: Wu, Huimin, et al.
Publicado: (2025)
por: Wu, Huimin, et al.
Publicado: (2025)
Medical Referring Image Segmentation via Next-Token Mask Prediction
por: Chen, Xinyu, et al.
Publicado: (2025)
por: Chen, Xinyu, et al.
Publicado: (2025)
AutoPrune: Each Complexity Deserves a Pruning Policy
por: Wang, Hanshi, et al.
Publicado: (2025)
por: Wang, Hanshi, et al.
Publicado: (2025)
The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization
por: Li, Manyi, et al.
Publicado: (2026)
por: Li, Manyi, et al.
Publicado: (2026)
MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation
por: Ding, Yanbo, et al.
Publicado: (2025)
por: Ding, Yanbo, et al.
Publicado: (2025)
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening
por: Li, Junfeng, et al.
Publicado: (2026)
por: Li, Junfeng, et al.
Publicado: (2026)
MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection
por: Wang, Hanshi, et al.
Publicado: (2025)
por: Wang, Hanshi, et al.
Publicado: (2025)
High-Resolution Image Synthesis via Next-Token Prediction
por: Chen, Dengsheng, et al.
Publicado: (2024)
por: Chen, Dengsheng, et al.
Publicado: (2024)
Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction
por: Kilian, Maciej, et al.
Publicado: (2024)
por: Kilian, Maciej, et al.
Publicado: (2024)
SoLA-Vision: Fine-grained Layer-wise Linear Softmax Hybrid Attention
por: Li, Ruibang, et al.
Publicado: (2026)
por: Li, Ruibang, et al.
Publicado: (2026)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
por: Lu, Yifan, et al.
Publicado: (2023)
por: Lu, Yifan, et al.
Publicado: (2023)
Detect Anything via Next Point Prediction
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
por: Xu, Yuhao, et al.
Publicado: (2026)
por: Xu, Yuhao, et al.
Publicado: (2026)
Humanoid Locomotion as Next Token Prediction
por: Radosavovic, Ilija, et al.
Publicado: (2024)
por: Radosavovic, Ilija, et al.
Publicado: (2024)
PanoLlama: Generating Endless and Coherent Panoramas with Next-Token-Prediction LLMs
por: Zhou, Teng, et al.
Publicado: (2024)
por: Zhou, Teng, et al.
Publicado: (2024)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
por: Chen, Lin, et al.
Publicado: (2026)
por: Chen, Lin, et al.
Publicado: (2026)
GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction
por: Ghasemi, Narges, et al.
Publicado: (2025)
por: Ghasemi, Narges, et al.
Publicado: (2025)
TAPNext: Tracking Any Point (TAP) as Next Token Prediction
por: Zholus, Artem, et al.
Publicado: (2025)
por: Zholus, Artem, et al.
Publicado: (2025)
SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction
por: Peng, Zhenghao, et al.
Publicado: (2025)
por: Peng, Zhenghao, et al.
Publicado: (2025)
Scaling Mesh Generation via Compressive Tokenization
por: Weng, Haohan, et al.
Publicado: (2024)
por: Weng, Haohan, et al.
Publicado: (2024)
AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving
por: Jia, Xiaosong, et al.
Publicado: (2024)
por: Jia, Xiaosong, et al.
Publicado: (2024)
Integrating Diverse Assignment Strategies into DETRs
por: Zhang, Yiwei, et al.
Publicado: (2026)
por: Zhang, Yiwei, et al.
Publicado: (2026)
Generating Multimodal Driving Scenes via Next-Scene Prediction
por: Wu, Yanhao, et al.
Publicado: (2025)
por: Wu, Yanhao, et al.
Publicado: (2025)
Hierarchical Semantic Compression for Consistent Image Semantic Restoration
por: Li, Shengxi, et al.
Publicado: (2025)
por: Li, Shengxi, et al.
Publicado: (2025)
SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation
por: Feng, Jiaye, et al.
Publicado: (2026)
por: Feng, Jiaye, et al.
Publicado: (2026)
Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors
por: Chen, Yunuo, et al.
Publicado: (2026)
por: Chen, Yunuo, et al.
Publicado: (2026)
Predicting Satisfied User and Machine Ratio for Compressed Images: A Unified Approach
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
por: Zeng, Sen, et al.
Publicado: (2026)
por: Zeng, Sen, et al.
Publicado: (2026)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
Prediction Exposes Your Face: Black-box Model Inversion via Prediction Alignment
por: Liu, Yufan, et al.
Publicado: (2024)
por: Liu, Yufan, et al.
Publicado: (2024)
Ejemplares similares
-
Token Caching for Diffusion Transformer Acceleration
por: Lou, Jinming, et al.
Publicado: (2024) -
Temporal Correlation Meets Embedding: Towards a 2nd Generation of JDE-based Real-Time Multi-Object Tracking
por: Zhang, Yunfei, et al.
Publicado: (2024) -
Hyperspectral Image Spectral-Spatial Feature Extraction via Tensor Principal Component Analysis
por: Ren, Yuemei, et al.
Publicado: (2024) -
Beyond Dataset Distillation: Lossless Dataset Concentration via Diffusion-Assisted Distribution Alignment
por: Liu, Tongfei, et al.
Publicado: (2026) -
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2025)