End-to-End Vision Tokenizer Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wenxuan, Zhang, Fan, Cui, Yufeng, Diao, Haiwen, Luo, Zhuoyan, Lu, Huchuan, Liu, Jing, Wang, Xinlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unveiling Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2024)
par: Diao, Haiwen, et autres
Publié: (2024)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2025)
par: Diao, Haiwen, et autres
Publié: (2025)
Autoregressive Video Generation without Vector Quantization
par: Deng, Haoge, et autres
Publié: (2024)
par: Deng, Haoge, et autres
Publié: (2024)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
par: Diao, Haiwen, et autres
Publié: (2023)
par: Diao, Haiwen, et autres
Publié: (2023)
Uniform Discrete Diffusion with Metric Path for Video Generation
par: Deng, Haoge, et autres
Publié: (2025)
par: Deng, Haoge, et autres
Publié: (2025)
U-DECN: End-to-End Underwater Object Detection ConvNet with Improved DeNoising Training
par: Liu, Zhuoyan, et autres
Publié: (2024)
par: Liu, Zhuoyan, et autres
Publié: (2024)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
par: Li, Xiaotong, et autres
Publié: (2024)
par: Li, Xiaotong, et autres
Publié: (2024)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
par: Xiong, Haomiao, et autres
Publié: (2025)
par: Xiong, Haomiao, et autres
Publié: (2025)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
par: Diao, Haiwen, et autres
Publié: (2024)
par: Diao, Haiwen, et autres
Publié: (2024)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
par: Zhong, Yufeng, et autres
Publié: (2026)
par: Zhong, Yufeng, et autres
Publié: (2026)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
par: Liu, Qing'an, et autres
Publié: (2026)
par: Liu, Qing'an, et autres
Publié: (2026)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
par: Wang, Yingquan, et autres
Publié: (2024)
par: Wang, Yingquan, et autres
Publié: (2024)
KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification
par: Zhu, Yue, et autres
Publié: (2025)
par: Zhu, Yue, et autres
Publié: (2025)
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
par: Zhang, Jiaru, et autres
Publié: (2026)
par: Zhang, Jiaru, et autres
Publié: (2026)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
par: Diao, Haiwen, et autres
Publié: (2024)
par: Diao, Haiwen, et autres
Publié: (2024)
VIFNet: An End-to-end Visible-Infrared Fusion Network for Image Dehazing
par: Yu, Meng, et autres
Publié: (2024)
par: Yu, Meng, et autres
Publié: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
par: Ivanovic, Boris, et autres
Publié: (2025)
par: Ivanovic, Boris, et autres
Publié: (2025)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
par: Fu, Haoyu, et autres
Publié: (2025)
par: Fu, Haoyu, et autres
Publié: (2025)
Diffusion Feedback Helps CLIP See Better
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
par: Cui, Can, et autres
Publié: (2025)
par: Cui, Can, et autres
Publié: (2025)
MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models
par: Li, Xiaomin, et autres
Publié: (2024)
par: Li, Xiaomin, et autres
Publié: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
par: Duan, Yiqun, et autres
Publié: (2024)
par: Duan, Yiqun, et autres
Publié: (2024)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
par: Diao, Haiwen, et autres
Publié: (2024)
par: Diao, Haiwen, et autres
Publié: (2024)
Exploring Dynamic Transformer for Efficient Object Tracking
par: Zhu, Jiawen, et autres
Publié: (2024)
par: Zhu, Jiawen, et autres
Publié: (2024)
Differentiable NMS via Sinkhorn Matching for End-to-End Fabric Defect Detection
par: Lu, Zhengyang, et autres
Publié: (2025)
par: Lu, Zhengyang, et autres
Publié: (2025)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
par: Li, Yingyan, et autres
Publié: (2025)
par: Li, Yingyan, et autres
Publié: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
par: Jiang, Bo, et autres
Publié: (2024)
par: Jiang, Bo, et autres
Publié: (2024)
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
par: Fan, Weichen, et autres
Publié: (2025)
par: Fan, Weichen, et autres
Publié: (2025)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
par: Zhou, Zewei, et autres
Publié: (2025)
par: Zhou, Zewei, et autres
Publié: (2025)
Exploring the Causality of End-to-End Autonomous Driving
par: Li, Jiankun, et autres
Publié: (2024)
par: Li, Jiankun, et autres
Publié: (2024)
Enhancing End-to-End Autonomous Driving with Latent World Model
par: Li, Yingyan, et autres
Publié: (2024)
par: Li, Yingyan, et autres
Publié: (2024)
End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation
par: Guo, Mingzhe, et autres
Publié: (2024)
par: Guo, Mingzhe, et autres
Publié: (2024)
Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models
par: Cheng, Hao, et autres
Publié: (2024)
par: Cheng, Hao, et autres
Publié: (2024)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
par: Song, Nan, et autres
Publié: (2025)
par: Song, Nan, et autres
Publié: (2025)
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
par: Sun, Quan, et autres
Publié: (2024)
par: Sun, Quan, et autres
Publié: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
par: Zhang, Pingping, et autres
Publié: (2024)
par: Zhang, Pingping, et autres
Publié: (2024)
Documents similaires
-
Unveiling Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2024) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
par: Diao, Haiwen, et autres
Publié: (2025) -
Autoregressive Video Generation without Vector Quantization
par: Deng, Haoge, et autres
Publié: (2024) -
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
par: Diao, Haiwen, et autres
Publié: (2023) -
Uniform Discrete Diffusion with Metric Path for Video Generation
par: Deng, Haoge, et autres
Publié: (2025)