End-to-End Vision Tokenizer Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Wenxuan, Zhang, Fan, Cui, Yufeng, Diao, Haiwen, Luo, Zhuoyan, Lu, Huchuan, Liu, Jing, Wang, Xinlong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unveiling Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
von: Diao, Haiwen, et al.
Veröffentlicht: (2025)
Autoregressive Video Generation without Vector Quantization
von: Deng, Haoge, et al.
Veröffentlicht: (2024)
von: Deng, Haoge, et al.
Veröffentlicht: (2024)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
von: Diao, Haiwen, et al.
Veröffentlicht: (2023)
Uniform Discrete Diffusion with Metric Path for Video Generation
von: Deng, Haoge, et al.
Veröffentlicht: (2025)
von: Deng, Haoge, et al.
Veröffentlicht: (2025)
U-DECN: End-to-End Underwater Object Detection ConvNet with Improved DeNoising Training
von: Liu, Zhuoyan, et al.
Veröffentlicht: (2024)
von: Liu, Zhuoyan, et al.
Veröffentlicht: (2024)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
Deep Boosting Learning: A Brand-new Cooperative Approach for Image-Text Matching
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
von: Zhu, Jiaying, et al.
Veröffentlicht: (2025)
von: Zhu, Jiaying, et al.
Veröffentlicht: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
von: Wang, Yingquan, et al.
Veröffentlicht: (2024)
von: Wang, Yingquan, et al.
Veröffentlicht: (2024)
KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
von: Zhu, Yue, et al.
Veröffentlicht: (2025)
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
von: Zhang, Jiaru, et al.
Veröffentlicht: (2026)
von: Zhang, Jiaru, et al.
Veröffentlicht: (2026)
GSSF: Generalized Structural Sparse Function for Deep Cross-modal Metric Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
VIFNet: An End-to-end Visible-Infrared Fusion Network for Image Dehazing
von: Yu, Meng, et al.
Veröffentlicht: (2024)
von: Yu, Meng, et al.
Veröffentlicht: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
von: Wu, Jiannan, et al.
Veröffentlicht: (2024)
von: Wu, Jiannan, et al.
Veröffentlicht: (2024)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
von: Ivanovic, Boris, et al.
Veröffentlicht: (2025)
von: Ivanovic, Boris, et al.
Veröffentlicht: (2025)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
von: Fu, Haoyu, et al.
Veröffentlicht: (2025)
von: Fu, Haoyu, et al.
Veröffentlicht: (2025)
Diffusion Feedback Helps CLIP See Better
von: Wang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2024)
ViLaD: A Large Vision Language Diffusion Framework for End-to-End Autonomous Driving
von: Cui, Can, et al.
Veröffentlicht: (2025)
von: Cui, Can, et al.
Veröffentlicht: (2025)
MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models
von: Li, Xiaomin, et al.
Veröffentlicht: (2024)
von: Li, Xiaomin, et al.
Veröffentlicht: (2024)
SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
von: Diao, Haiwen, et al.
Veröffentlicht: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
von: Duan, Yiqun, et al.
Veröffentlicht: (2024)
von: Duan, Yiqun, et al.
Veröffentlicht: (2024)
Exploring Dynamic Transformer for Efficient Object Tracking
von: Zhu, Jiawen, et al.
Veröffentlicht: (2024)
von: Zhu, Jiawen, et al.
Veröffentlicht: (2024)
Differentiable NMS via Sinkhorn Matching for End-to-End Fabric Defect Detection
von: Lu, Zhengyang, et al.
Veröffentlicht: (2025)
von: Lu, Zhengyang, et al.
Veröffentlicht: (2025)
End-to-End Driving with Online Trajectory Evaluation via BEV World Model
von: Li, Yingyan, et al.
Veröffentlicht: (2025)
von: Li, Yingyan, et al.
Veröffentlicht: (2025)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
von: Jiang, Bo, et al.
Veröffentlicht: (2024)
von: Jiang, Bo, et al.
Veröffentlicht: (2024)
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding
von: Fan, Weichen, et al.
Veröffentlicht: (2025)
von: Fan, Weichen, et al.
Veröffentlicht: (2025)
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
von: Zhou, Zewei, et al.
Veröffentlicht: (2025)
von: Zhou, Zewei, et al.
Veröffentlicht: (2025)
Exploring the Causality of End-to-End Autonomous Driving
von: Li, Jiankun, et al.
Veröffentlicht: (2024)
von: Li, Jiankun, et al.
Veröffentlicht: (2024)
Enhancing End-to-End Autonomous Driving with Latent World Model
von: Li, Yingyan, et al.
Veröffentlicht: (2024)
von: Li, Yingyan, et al.
Veröffentlicht: (2024)
End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation
von: Guo, Mingzhe, et al.
Veröffentlicht: (2024)
von: Guo, Mingzhe, et al.
Veröffentlicht: (2024)
Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models
von: Cheng, Hao, et al.
Veröffentlicht: (2024)
von: Cheng, Hao, et al.
Veröffentlicht: (2024)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
von: Song, Nan, et al.
Veröffentlicht: (2025)
von: Song, Nan, et al.
Veröffentlicht: (2025)
FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning
von: Cao, Jiajun, et al.
Veröffentlicht: (2025)
von: Cao, Jiajun, et al.
Veröffentlicht: (2025)
EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
von: Sun, Quan, et al.
Veröffentlicht: (2024)
von: Sun, Quan, et al.
Veröffentlicht: (2024)
Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Unveiling Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2024) -
EVEv2: Improved Baselines for Encoder-Free Vision-Language Models
von: Diao, Haiwen, et al.
Veröffentlicht: (2025) -
Autoregressive Video Generation without Vector Quantization
von: Deng, Haoge, et al.
Veröffentlicht: (2024) -
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
von: Diao, Haiwen, et al.
Veröffentlicht: (2023) -
Uniform Discrete Diffusion with Metric Path for Video Generation
von: Deng, Haoge, et al.
Veröffentlicht: (2025)