SFTok: Bridging the Performance Gap in Discrete Tokenizers
Fuente:
arXiv
Salvato in:
| Autori principali: | Rao, Qihang, Zhang, Borui, Zheng, Wenzhao, Zhou, Jie, Lu, Jiwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Quantize-then-Rectify: Efficient VQ-VAE Training
di: Zhang, Borui, et al.
Pubblicazione: (2025)
di: Zhang, Borui, et al.
Pubblicazione: (2025)
Path Choice Matters for Clear Attribution in Path Methods
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
di: Zhang, Borui, et al.
Pubblicazione: (2024)
di: Zhang, Borui, et al.
Pubblicazione: (2024)
Fast Shapley Value Estimation: A Unified Approach
di: Zhang, Borui, et al.
Pubblicazione: (2023)
di: Zhang, Borui, et al.
Pubblicazione: (2023)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
di: Zhuo, Dong, et al.
Pubblicazione: (2026)
di: Zhuo, Dong, et al.
Pubblicazione: (2026)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
di: Wu, Yuqi, et al.
Pubblicazione: (2025)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
di: Zuo, Sicheng, et al.
Pubblicazione: (2024)
SpectralAR: Spectral Autoregressive Visual Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
Streaming 4D Visual Geometry Transformer
di: Zhuo, Dong, et al.
Pubblicazione: (2025)
di: Zhuo, Dong, et al.
Pubblicazione: (2025)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
di: Zheng, Wenzhao, et al.
Pubblicazione: (2024)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
di: Wu, Yuqi, et al.
Pubblicazione: (2024)
Hardness-Aware Scene Synthesis for Semi-Supervised 3D Object Detection
di: Zeng, Shuai, et al.
Pubblicazione: (2024)
di: Zeng, Shuai, et al.
Pubblicazione: (2024)
Terra: Explorable Native 3D World Model with Point Latents
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
Owl-1: Omni World Model for Consistent Long Video Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
GPD-1: Generative Pre-training for Driving
di: Xie, Zixun, et al.
Pubblicazione: (2024)
di: Xie, Zixun, et al.
Pubblicazione: (2024)
Astra: General Interactive World Model with Autoregressive Denoising
di: Zhu, Yixuan, et al.
Pubblicazione: (2025)
di: Zhu, Yixuan, et al.
Pubblicazione: (2025)
GlobalMamba: Global Image Serialization for Vision Mamba
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
Learning Counterfactually Decoupled Attention for Open-World Model Attribution
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
WaterVIB: Learning Minimal Sufficient Watermark Representations via Variational Information Bottleneck
di: He, Haoyuan, et al.
Pubblicazione: (2026)
di: He, Haoyuan, et al.
Pubblicazione: (2026)
PixelGaussian: Generalizable 3D Gaussian Reconstruction from Arbitrary Views
di: Fei, Xin, et al.
Pubblicazione: (2024)
di: Fei, Xin, et al.
Pubblicazione: (2024)
Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving
di: Fei, Xin, et al.
Pubblicazione: (2024)
di: Fei, Xin, et al.
Pubblicazione: (2024)
Stag-1: Towards Realistic 4D Driving Simulation with Video Generation Model
di: Wang, Lening, et al.
Pubblicazione: (2024)
di: Wang, Lening, et al.
Pubblicazione: (2024)
The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
di: Shiba, Takuya
Pubblicazione: (2026)
di: Shiba, Takuya
Pubblicazione: (2026)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
V2M: Visual 2-Dimensional Mamba for Image Representation Learning
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
di: Wang, Chengkun, et al.
Pubblicazione: (2024)
TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
di: Guo, Wenxuan, et al.
Pubblicazione: (2025)
di: Guo, Wenxuan, et al.
Pubblicazione: (2025)
Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
Bridging the Gap: Protocol Towards Fair and Consistent Affect Analysis
di: Hu, Guanyu, et al.
Pubblicazione: (2024)
di: Hu, Guanyu, et al.
Pubblicazione: (2024)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
di: Dong, Jiajun, et al.
Pubblicazione: (2025)
On the Role of Discrete Tokenization in Visual Representation Learning
di: Du, Tianqi, et al.
Pubblicazione: (2024)
di: Du, Tianqi, et al.
Pubblicazione: (2024)
Beyond Single Tokens: Distilling Discrete Diffusion Models via Discrete MMD
di: Hoogeboom, Emiel, et al.
Pubblicazione: (2026)
di: Hoogeboom, Emiel, et al.
Pubblicazione: (2026)
Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos
di: Dou, Weijia, et al.
Pubblicazione: (2026)
di: Dou, Weijia, et al.
Pubblicazione: (2026)
$\bf{D^3}$QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
di: Zhang, Yanran, et al.
Pubblicazione: (2025)
BAMI: Training-Free Bias Mitigation in GUI Grounding
di: Zhang, Borui, et al.
Pubblicazione: (2026)
di: Zhang, Borui, et al.
Pubblicazione: (2026)
Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification
di: Li, Yiqiao, et al.
Pubblicazione: (2026)
di: Li, Yiqiao, et al.
Pubblicazione: (2026)
MaskBit: Embedding-free Image Generation via Bit Tokens
di: Weber, Mark, et al.
Pubblicazione: (2024)
di: Weber, Mark, et al.
Pubblicazione: (2024)
LGQ: Learning Discretization Geometry for Scalable and Stable Image Tokenization
di: Altun, Idil Bilge, et al.
Pubblicazione: (2026)
di: Altun, Idil Bilge, et al.
Pubblicazione: (2026)
VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
di: Bi, Tianci, et al.
Pubblicazione: (2025)
di: Bi, Tianci, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Quantize-then-Rectify: Efficient VQ-VAE Training
di: Zhang, Borui, et al.
Pubblicazione: (2025) -
Path Choice Matters for Clear Attribution in Path Methods
di: Zhang, Borui, et al.
Pubblicazione: (2024) -
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
di: Zhang, Borui, et al.
Pubblicazione: (2024) -
Fast Shapley Value Estimation: A Unified Approach
di: Zhang, Borui, et al.
Pubblicazione: (2023) -
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
di: Zhuo, Dong, et al.
Pubblicazione: (2026)