Gespeichert in:
| Hauptverfasser: | Zhan, Guanqi, Li, Changye, Liu, Zhijian, Lu, Yao, Wu, Yi, Han, Song, Zhu, Ligeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2601.13633 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
von: Zhan, Guanqi, et al.
Veröffentlicht: (2025)
von: Zhan, Guanqi, et al.
Veröffentlicht: (2025)
NVILA: Efficient Frontier Visual Language Models
von: Liu, Zhijian, et al.
Veröffentlicht: (2024)
von: Liu, Zhijian, et al.
Veröffentlicht: (2024)
Amodal Ground Truth and Completion in the Wild
von: Zhan, Guanqi, et al.
Veröffentlicht: (2023)
von: Zhan, Guanqi, et al.
Veröffentlicht: (2023)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2024)
von: Chen, Yukang, et al.
Veröffentlicht: (2024)
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
von: Wu, Yecheng, et al.
Veröffentlicht: (2024)
von: Wu, Yecheng, et al.
Veröffentlicht: (2024)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
von: Xie, Enze, et al.
Veröffentlicht: (2024)
von: Xie, Enze, et al.
Veröffentlicht: (2024)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
von: Khaki, Samir, et al.
Veröffentlicht: (2025)
von: Khaki, Samir, et al.
Veröffentlicht: (2025)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
von: Zhan, Guanqi, et al.
Veröffentlicht: (2023)
von: Zhan, Guanqi, et al.
Veröffentlicht: (2023)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
von: Li, Yangfu, et al.
Veröffentlicht: (2026)
von: Li, Yangfu, et al.
Veröffentlicht: (2026)
Inferring Dynamic Physical Properties from Video Foundation Models
von: Zhan, Guanqi, et al.
Veröffentlicht: (2025)
von: Zhan, Guanqi, et al.
Veröffentlicht: (2025)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
von: Wang, Jie, et al.
Veröffentlicht: (2026)
von: Wang, Jie, et al.
Veröffentlicht: (2026)
Graph-Weighted Contrastive Learning for Semi-Supervised Hyperspectral Image Classification
von: Zhang, Yuqing, et al.
Veröffentlicht: (2025)
von: Zhang, Yuqing, et al.
Veröffentlicht: (2025)
Scaling RL to Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
On-Device Training Under 256KB Memory
von: Lin, Ji, et al.
Veröffentlicht: (2022)
von: Lin, Ji, et al.
Veröffentlicht: (2022)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
von: Xie, Enze, et al.
Veröffentlicht: (2025)
von: Xie, Enze, et al.
Veröffentlicht: (2025)
VILA$^2$: VILA Augmented VILA
von: Fang, Yunhao, et al.
Veröffentlicht: (2024)
von: Fang, Yunhao, et al.
Veröffentlicht: (2024)
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer
von: He, Zhengxu, et al.
Veröffentlicht: (2026)
von: He, Zhengxu, et al.
Veröffentlicht: (2026)
VILA: On Pre-training for Visual Language Models
von: Lin, Ji, et al.
Veröffentlicht: (2023)
von: Lin, Ji, et al.
Veröffentlicht: (2023)
Grounding Language Models for Visual Entity Recognition
von: Xiao, Zilin, et al.
Veröffentlicht: (2024)
von: Xiao, Zilin, et al.
Veröffentlicht: (2024)
Language-Guided Diffusion Model for Visual Grounding
von: Chen, Sijia, et al.
Veröffentlicht: (2023)
von: Chen, Sijia, et al.
Veröffentlicht: (2023)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
von: Fan, Rong, et al.
Veröffentlicht: (2026)
von: Fan, Rong, et al.
Veröffentlicht: (2026)
AMC: AutoML for Model Compression and Acceleration on Mobile Devices
von: He, Yihui, et al.
Veröffentlicht: (2018)
von: He, Yihui, et al.
Veröffentlicht: (2018)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
von: He, Jinlong, et al.
Veröffentlicht: (2024)
von: He, Jinlong, et al.
Veröffentlicht: (2024)
MatSAM: Efficient Extraction of Microstructures of Materials via Visual Large Model
von: Li, Changtai, et al.
Veröffentlicht: (2024)
von: Li, Changtai, et al.
Veröffentlicht: (2024)
VPTracker: Global Vision-Language Tracking via Visual Prompt
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
von: Wang, Jingchao, et al.
Veröffentlicht: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
Visual Grounding with Multi-modal Conditional Adaptation
von: Yao, Ruilin, et al.
Veröffentlicht: (2024)
von: Yao, Ruilin, et al.
Veröffentlicht: (2024)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
von: Wu, Xianfeng, et al.
Veröffentlicht: (2025)
von: Wu, Xianfeng, et al.
Veröffentlicht: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
von: Luo, Lingxiao, et al.
Veröffentlicht: (2024)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
von: Zhou, Yue, et al.
Veröffentlicht: (2024)
Tiny Machine Learning: Progress and Futures
von: Lin, Ji, et al.
Veröffentlicht: (2024)
von: Lin, Ji, et al.
Veröffentlicht: (2024)
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
von: Cheng, Jintao, et al.
Veröffentlicht: (2025)
von: Cheng, Jintao, et al.
Veröffentlicht: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
von: Chen, Zheng, et al.
Veröffentlicht: (2024)
von: Chen, Zheng, et al.
Veröffentlicht: (2024)
Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
von: Guo, Leilei, et al.
Veröffentlicht: (2025)
von: Guo, Leilei, et al.
Veröffentlicht: (2025)
Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
von: Rang, Miao, et al.
Veröffentlicht: (2025)
von: Rang, Miao, et al.
Veröffentlicht: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
von: Jiang, Jindong, et al.
Veröffentlicht: (2025)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
von: Liu, Yuanyuan, et al.
Veröffentlicht: (2025)
von: Liu, Yuanyuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026) -
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
von: Zhan, Guanqi, et al.
Veröffentlicht: (2025) -
NVILA: Efficient Frontier Visual Language Models
von: Liu, Zhijian, et al.
Veröffentlicht: (2024) -
Amodal Ground Truth and Completion in the Wild
von: Zhan, Guanqi, et al.
Veröffentlicht: (2023) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2024)