One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Miwa, Keita, Sasaki, Kento, Arai, Hidehisa, Takahashi, Tsubasa, Yamaguchi, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
por: Ishihara, Keishi, et al.
Publicado: (2025)
por: Ishihara, Keishi, et al.
Publicado: (2025)
P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction
por: Shimomura, Kota, et al.
Publicado: (2026)
por: Shimomura, Kota, et al.
Publicado: (2026)
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
por: Enomoto, Shohei, et al.
Publicado: (2024)
por: Enomoto, Shohei, et al.
Publicado: (2024)
Learned Image Compression with Text Quality Enhancement
por: Lai, Chih-Yu, et al.
Publicado: (2024)
por: Lai, Chih-Yu, et al.
Publicado: (2024)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
por: Wang, Fei, et al.
Publicado: (2025)
por: Wang, Fei, et al.
Publicado: (2025)
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
por: Waseda, Futa, et al.
Publicado: (2025)
por: Waseda, Futa, et al.
Publicado: (2025)
Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos
por: Yokoi, Shingo, et al.
Publicado: (2025)
por: Yokoi, Shingo, et al.
Publicado: (2025)
Controllable Image Generation with Composed Parallel Token Prediction
por: Stirling, Jamie, et al.
Publicado: (2024)
por: Stirling, Jamie, et al.
Publicado: (2024)
VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations
por: Patel, Maitreya, et al.
Publicado: (2026)
por: Patel, Maitreya, et al.
Publicado: (2026)
BiGain: Unified Token Compression for Joint Generation and Classification
por: Liu, Jiacheng, et al.
Publicado: (2026)
por: Liu, Jiacheng, et al.
Publicado: (2026)
Spectral Image Tokenizer
por: Esteves, Carlos, et al.
Publicado: (2024)
por: Esteves, Carlos, et al.
Publicado: (2024)
End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
por: Chu, Wenda, et al.
Publicado: (2026)
por: Chu, Wenda, et al.
Publicado: (2026)
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
por: Bachmann, Roman, et al.
Publicado: (2025)
por: Bachmann, Roman, et al.
Publicado: (2025)
SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding
por: Kim, Seongyong, et al.
Publicado: (2025)
por: Kim, Seongyong, et al.
Publicado: (2025)
MaskBit: Embedding-free Image Generation via Bit Tokens
por: Weber, Mark, et al.
Publicado: (2024)
por: Weber, Mark, et al.
Publicado: (2024)
InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image Generation
por: Liu, Xingchao, et al.
Publicado: (2023)
por: Liu, Xingchao, et al.
Publicado: (2023)
HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding
por: Nguyen, Toan, et al.
Publicado: (2026)
por: Nguyen, Toan, et al.
Publicado: (2026)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
por: Tao, Keda, et al.
Publicado: (2024)
por: Tao, Keda, et al.
Publicado: (2024)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
Frequency-Calibrated Membership Inference Attacks on Medical Image Diffusion Models
por: Zhao, Xinkai, et al.
Publicado: (2025)
por: Zhao, Xinkai, et al.
Publicado: (2025)
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
por: Asim, Mohammad, et al.
Publicado: (2026)
por: Asim, Mohammad, et al.
Publicado: (2026)
Semantic Prompting with Image-Token for Continual Learning
por: Han, Jisu, et al.
Publicado: (2024)
por: Han, Jisu, et al.
Publicado: (2024)
VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer
por: Han, Zongcheng, et al.
Publicado: (2026)
por: Han, Zongcheng, et al.
Publicado: (2026)
Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation
por: Gao, Juntao, et al.
Publicado: (2025)
por: Gao, Juntao, et al.
Publicado: (2025)
UKBOB: One Billion MRI Labeled Masks for Generalizable 3D Medical Image Segmentation
por: Bourigault, Emmanuelle, et al.
Publicado: (2025)
por: Bourigault, Emmanuelle, et al.
Publicado: (2025)
LGQ: Learning Discretization Geometry for Scalable and Stable Image Tokenization
por: Altun, Idil Bilge, et al.
Publicado: (2026)
por: Altun, Idil Bilge, et al.
Publicado: (2026)
Pruning One More Token is Enough: Leveraging Latency-Workload Non-Linearities for Vision Transformers on the Edge
por: Eliopoulos, Nick John, et al.
Publicado: (2024)
por: Eliopoulos, Nick John, et al.
Publicado: (2024)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
por: Song, Jiafei, et al.
Publicado: (2026)
por: Song, Jiafei, et al.
Publicado: (2026)
Language-Guided Image Tokenization for Generation
por: Zha, Kaiwen, et al.
Publicado: (2024)
por: Zha, Kaiwen, et al.
Publicado: (2024)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
por: Zheng, Chenhao, et al.
Publicado: (2025)
por: Zheng, Chenhao, et al.
Publicado: (2025)
The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
por: Shiba, Takuya
Publicado: (2026)
por: Shiba, Takuya
Publicado: (2026)
CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization
por: Zhao, Zelin, et al.
Publicado: (2025)
por: Zhao, Zelin, et al.
Publicado: (2025)
Distilled Decoding 1: One-step Sampling of Image Auto-regressive Models with Flow Matching
por: Liu, Enshu, et al.
Publicado: (2024)
por: Liu, Enshu, et al.
Publicado: (2024)
Improving Deep Generative Models on Many-To-One Image-to-Image Translation
por: Saxena, Sagar, et al.
Publicado: (2024)
por: Saxena, Sagar, et al.
Publicado: (2024)
Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models
por: NVIDIA, et al.
Publicado: (2024)
por: NVIDIA, et al.
Publicado: (2024)
Spectral and Spatial Graph Learning for Multispectral Solar Image Compression
por: Siwakoti, Prasiddha, et al.
Publicado: (2025)
por: Siwakoti, Prasiddha, et al.
Publicado: (2025)
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
por: Awadalla, Anas, et al.
Publicado: (2024)
por: Awadalla, Anas, et al.
Publicado: (2024)
Regularized Distribution Matching Distillation for One-step Unpaired Image-to-Image Translation
por: Rakitin, Denis, et al.
Publicado: (2024)
por: Rakitin, Denis, et al.
Publicado: (2024)
Ejemplares similares
-
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024) -
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024) -
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
por: Ishihara, Keishi, et al.
Publicado: (2025) -
P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction
por: Shimomura, Kota, et al.
Publicado: (2026) -
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
por: Enomoto, Shohei, et al.
Publicado: (2024)