SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Zhentao, Xue, Ben, Jia, Jian, Wang, Junhao, Ye, Wencai, Shi, Shaoyun, Sun, Mingjie, Wu, Wenjin, Chen, Quan, Jiang, Peng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System
by: Ye, Wencai, et al.
Published: (2025)
by: Ye, Wencai, et al.
Published: (2025)
Align$^3$GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation
by: Ye, Wencai, et al.
Published: (2025)
by: Ye, Wencai, et al.
Published: (2025)
From Principles to Applications: A Comprehensive Survey of Discrete Tokenizers in Generation, Comprehension, Recommendation, and Information Retrieval
by: Jia, Jian, et al.
Published: (2025)
by: Jia, Jian, et al.
Published: (2025)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
by: Park, Minyoung, et al.
Published: (2026)
by: Park, Minyoung, et al.
Published: (2026)
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
by: Ye, Haotian, et al.
Published: (2025)
by: Ye, Haotian, et al.
Published: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
by: Zhang, Luyuan, et al.
Published: (2026)
by: Zhang, Luyuan, et al.
Published: (2026)
TokSing: Singing Voice Synthesis based on Discrete Tokens
by: Wu, Yuning, et al.
Published: (2024)
by: Wu, Yuning, et al.
Published: (2024)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
by: Zheng, Chenhao, et al.
Published: (2026)
by: Zheng, Chenhao, et al.
Published: (2026)
ElasticTok: Adaptive Tokenization for Image and Video
by: Yan, Wilson, et al.
Published: (2024)
by: Yan, Wilson, et al.
Published: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
by: Jia, Mingkai, et al.
Published: (2025)
by: Jia, Mingkai, et al.
Published: (2025)
Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces
by: Mahapatra, Aniruddha, et al.
Published: (2025)
by: Mahapatra, Aniruddha, et al.
Published: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
by: Liu, Chengwei, et al.
Published: (2025)
by: Liu, Chengwei, et al.
Published: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
by: Zhuang, Shaobin, et al.
Published: (2025)
by: Zhuang, Shaobin, et al.
Published: (2025)
RefTok: Reference-Based Tokenization for Video Generation
by: Fan, Xiang, et al.
Published: (2025)
by: Fan, Xiang, et al.
Published: (2025)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
by: Yue, Yang, et al.
Published: (2026)
by: Yue, Yang, et al.
Published: (2026)
MuseTok: Symbolic Music Tokenization for Generation and Semantic Understanding
by: Huang, Jingyue, et al.
Published: (2025)
by: Huang, Jingyue, et al.
Published: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
by: Wang, Feng, et al.
Published: (2026)
by: Wang, Feng, et al.
Published: (2026)
CS3: Efficient Online Capability Synergy for Two-Tower Recommendation
by: Wang, Lixiang, et al.
Published: (2026)
by: Wang, Lixiang, et al.
Published: (2026)
CS3: Efficient Online Capability Synergy for Two-Tower Recommendation
by: Wang, Lixiang, et al.
Published: (2026)
by: Wang, Lixiang, et al.
Published: (2026)
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
by: Atanov, Andrei, et al.
Published: (2026)
by: Atanov, Andrei, et al.
Published: (2026)
VidTok: A Versatile and Open-Source Video Tokenizer
by: Tang, Anni, et al.
Published: (2024)
by: Tang, Anni, et al.
Published: (2024)
Learning Solution-Aware Transformers for Efficiently Solving Quadratic Assignment Problem
by: Tan, Zhentao, et al.
Published: (2024)
by: Tan, Zhentao, et al.
Published: (2024)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
by: Susladkar, Onkar, et al.
Published: (2026)
by: Susladkar, Onkar, et al.
Published: (2026)
NativeTok: Native Visual Tokenization for Improved Image Generation
by: Wu, Bin, et al.
Published: (2026)
by: Wu, Bin, et al.
Published: (2026)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
by: Kim, Dongwon, et al.
Published: (2026)
by: Kim, Dongwon, et al.
Published: (2026)
MacTok: Robust Continuous Tokenization for Image Generation
by: Zeng, Hengyu, et al.
Published: (2026)
by: Zeng, Hengyu, et al.
Published: (2026)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
by: Zhang, Hongzhi, et al.
Published: (2025)
by: Zhang, Hongzhi, et al.
Published: (2025)
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
by: Du, Junhao, et al.
Published: (2026)
by: Du, Junhao, et al.
Published: (2026)
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
by: Li, Jiaqi, et al.
Published: (2026)
by: Li, Jiaqi, et al.
Published: (2026)
Temporal Aware Pruning for Efficient Diffusion-based Video Generation
by: Li, Sheng, et al.
Published: (2026)
by: Li, Sheng, et al.
Published: (2026)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
by: Zhang, Xinliang, et al.
Published: (2025)
by: Zhang, Xinliang, et al.
Published: (2025)
SETA: Semantic-Aware Token Augmentation for Domain Generalization
by: Guo, Jintao, et al.
Published: (2024)
by: Guo, Jintao, et al.
Published: (2024)
Discrete Semantic Tokenization for Deep CTR Prediction
by: Liu, Qijiong, et al.
Published: (2024)
by: Liu, Qijiong, et al.
Published: (2024)
Compact Semantic‐Aware Priors for Large‐Margin Few‐Shot Classification
by: Jiaying Wu, et al.
Published: (2026)
by: Jiaying Wu, et al.
Published: (2026)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
by: Xue, Naifu, et al.
Published: (2025)
by: Xue, Naifu, et al.
Published: (2025)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
by: Chen, Bowei, et al.
Published: (2025)
by: Chen, Bowei, et al.
Published: (2025)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
by: Li, Jingyi, et al.
Published: (2025)
by: Li, Jingyi, et al.
Published: (2025)
Quantum Grover Adaptive Search for Discrete Simulation Optimization
by: Hu, Mingjie, et al.
Published: (2026)
by: Hu, Mingjie, et al.
Published: (2026)
Generative Recommendation for Large-Scale Advertising
by: Xue, Ben, et al.
Published: (2026)
by: Xue, Ben, et al.
Published: (2026)
Dynamic-Aware Video Distillation: Optimizing Temporal Resolution Based on Video Semantics
by: Zhao, Yinjie, et al.
Published: (2025)
by: Zhao, Yinjie, et al.
Published: (2025)
Similar Items
-
DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System
by: Ye, Wencai, et al.
Published: (2025) -
Align$^3$GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation
by: Ye, Wencai, et al.
Published: (2025) -
From Principles to Applications: A Comprehensive Survey of Discrete Tokenizers in Generation, Comprehension, Recommendation, and Information Retrieval
by: Jia, Jian, et al.
Published: (2025) -
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
by: Park, Minyoung, et al.
Published: (2026) -
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
by: Ye, Haotian, et al.
Published: (2025)