Gespeichert in:
| Hauptverfasser: | Park, Minyoung, Kong, Taehun, Ahn, Sangjun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.19322 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
von: Zhang, Xinliang, et al.
Veröffentlicht: (2025)
von: Zhang, Xinliang, et al.
Veröffentlicht: (2025)
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
von: Ye, Haotian, et al.
Veröffentlicht: (2025)
von: Ye, Haotian, et al.
Veröffentlicht: (2025)
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
von: Tan, Zhentao, et al.
Veröffentlicht: (2024)
von: Tan, Zhentao, et al.
Veröffentlicht: (2024)
Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection
von: Kong, Taehun, et al.
Veröffentlicht: (2025)
von: Kong, Taehun, et al.
Veröffentlicht: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
von: Zhang, Hongzhi, et al.
Veröffentlicht: (2025)
von: Zhang, Hongzhi, et al.
Veröffentlicht: (2025)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
von: Zheng, Chenhao, et al.
Veröffentlicht: (2026)
von: Zheng, Chenhao, et al.
Veröffentlicht: (2026)
RefTok: Reference-Based Tokenization for Video Generation
von: Fan, Xiang, et al.
Veröffentlicht: (2025)
von: Fan, Xiang, et al.
Veröffentlicht: (2025)
Cardiac Segmentation on CT Images through Shape-Aware Contour Attentions
von: Park, Sanguk, et al.
Veröffentlicht: (2021)
von: Park, Sanguk, et al.
Veröffentlicht: (2021)
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
von: Atanov, Andrei, et al.
Veröffentlicht: (2026)
von: Atanov, Andrei, et al.
Veröffentlicht: (2026)
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
von: Du, Junhao, et al.
Veröffentlicht: (2026)
von: Du, Junhao, et al.
Veröffentlicht: (2026)
Semi-Supervised 3D Object Detection with Channel Augmentation using Transformation Equivariance
von: Kang, Minju, et al.
Veröffentlicht: (2024)
von: Kang, Minju, et al.
Veröffentlicht: (2024)
DINO-Tok: Adapting DINO for Visual Tokenizers
von: Jia, Mingkai, et al.
Veröffentlicht: (2025)
von: Jia, Mingkai, et al.
Veröffentlicht: (2025)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
von: Tanvir, Md Tasnin, et al.
Veröffentlicht: (2025)
von: Tanvir, Md Tasnin, et al.
Veröffentlicht: (2025)
Enhancing Multi-Image Understanding through Delimiter Token Scaling
von: Lee, Minyoung, et al.
Veröffentlicht: (2026)
von: Lee, Minyoung, et al.
Veröffentlicht: (2026)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
von: Susladkar, Onkar, et al.
Veröffentlicht: (2026)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Guo, Xiaoyang, et al.
Veröffentlicht: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
von: Zhang, Luyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Luyuan, et al.
Veröffentlicht: (2026)
VidTok: A Versatile and Open-Source Video Tokenizer
von: Tang, Anni, et al.
Veröffentlicht: (2024)
von: Tang, Anni, et al.
Veröffentlicht: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
von: Asim, Mohammad, et al.
Veröffentlicht: (2026)
von: Asim, Mohammad, et al.
Veröffentlicht: (2026)
TAG: A Simple Yet Effective Temporal-Aware Approach for Zero-Shot Video Temporal Grounding
von: Lee, Jin-Seop, et al.
Veröffentlicht: (2025)
von: Lee, Jin-Seop, et al.
Veröffentlicht: (2025)
Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space
von: Li, Yan, et al.
Veröffentlicht: (2025)
von: Li, Yan, et al.
Veröffentlicht: (2025)
NativeTok: Native Visual Tokenization for Improved Image Generation
von: Wu, Bin, et al.
Veröffentlicht: (2026)
von: Wu, Bin, et al.
Veröffentlicht: (2026)
GloTok: Global Perspective Tokenizer for Image Reconstruction and Generation
von: Zhao, Xuan, et al.
Veröffentlicht: (2025)
von: Zhao, Xuan, et al.
Veröffentlicht: (2025)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
von: He, Ju, et al.
Veröffentlicht: (2025)
von: He, Ju, et al.
Veröffentlicht: (2025)
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
von: Park, Jaehyun, et al.
Veröffentlicht: (2026)
von: Park, Jaehyun, et al.
Veröffentlicht: (2026)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
von: Zeng, Fanhu, et al.
Veröffentlicht: (2025)
Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
Spatial Degradation-Aware and Temporal Consistent Diffusion Model for Compressed Video Super-Resolution
von: An, Hongyu, et al.
Veröffentlicht: (2025)
von: An, Hongyu, et al.
Veröffentlicht: (2025)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
von: Kang, Minseok, et al.
Veröffentlicht: (2026)
DTTNet: Improving Video Shadow Detection via Dark-Aware Guidance and Tokenized Temporal Modeling
von: Li, Zhicheng, et al.
Veröffentlicht: (2025)
von: Li, Zhicheng, et al.
Veröffentlicht: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2025)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
von: Chen, Bowei, et al.
Veröffentlicht: (2025)
V-LynX: Token Interface Alignment for Video+X LLMs
von: Park, Jungin, et al.
Veröffentlicht: (2026)
von: Park, Jungin, et al.
Veröffentlicht: (2026)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
von: Fateh, Fawad Javed, et al.
Veröffentlicht: (2024)
von: Fateh, Fawad Javed, et al.
Veröffentlicht: (2024)
MacTok: Robust Continuous Tokenization for Image Generation
von: Zeng, Hengyu, et al.
Veröffentlicht: (2026)
von: Zeng, Hengyu, et al.
Veröffentlicht: (2026)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
von: Liu, Xiangrui, et al.
Veröffentlicht: (2025)
Video Compression with Hierarchical Temporal Neural Representation
von: Zhu, Jun, et al.
Veröffentlicht: (2026)
von: Zhu, Jun, et al.
Veröffentlicht: (2026)
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
von: Chen, Yitong, et al.
Veröffentlicht: (2026)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
von: Zhang, Xinliang, et al.
Veröffentlicht: (2025) -
InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression
von: Ye, Haotian, et al.
Veröffentlicht: (2025) -
SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization
von: Tan, Zhentao, et al.
Veröffentlicht: (2024) -
Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection
von: Kong, Taehun, et al.
Veröffentlicht: (2025) -
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
von: Zhang, Hongzhi, et al.
Veröffentlicht: (2025)