Guardado en:
| Autores principales: | Zhan, Guanqi, Li, Changye, Liu, Zhijian, Lu, Yao, Wu, Yi, Han, Song, Zhu, Ligeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.13633 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
por: Zhan, Guanqi, et al.
Publicado: (2025)
por: Zhan, Guanqi, et al.
Publicado: (2025)
NVILA: Efficient Frontier Visual Language Models
por: Liu, Zhijian, et al.
Publicado: (2024)
por: Liu, Zhijian, et al.
Publicado: (2024)
Amodal Ground Truth and Completion in the Wild
por: Zhan, Guanqi, et al.
Publicado: (2023)
por: Zhan, Guanqi, et al.
Publicado: (2023)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
por: Chen, Yukang, et al.
Publicado: (2024)
por: Chen, Yukang, et al.
Publicado: (2024)
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
por: Wu, Yecheng, et al.
Publicado: (2024)
por: Wu, Yecheng, et al.
Publicado: (2024)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
por: Xie, Enze, et al.
Publicado: (2024)
por: Xie, Enze, et al.
Publicado: (2024)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
por: Khaki, Samir, et al.
Publicado: (2025)
por: Khaki, Samir, et al.
Publicado: (2025)
A General Protocol to Probe Large Vision Models for 3D Physical Understanding
por: Zhan, Guanqi, et al.
Publicado: (2023)
por: Zhan, Guanqi, et al.
Publicado: (2023)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
por: Li, Yangfu, et al.
Publicado: (2026)
por: Li, Yangfu, et al.
Publicado: (2026)
Inferring Dynamic Physical Properties from Video Foundation Models
por: Zhan, Guanqi, et al.
Publicado: (2025)
por: Zhan, Guanqi, et al.
Publicado: (2025)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
por: Wang, Jie, et al.
Publicado: (2026)
por: Wang, Jie, et al.
Publicado: (2026)
Graph-Weighted Contrastive Learning for Semi-Supervised Hyperspectral Image Classification
por: Zhang, Yuqing, et al.
Publicado: (2025)
por: Zhang, Yuqing, et al.
Publicado: (2025)
Scaling RL to Long Videos
por: Chen, Yukang, et al.
Publicado: (2025)
por: Chen, Yukang, et al.
Publicado: (2025)
On-Device Training Under 256KB Memory
por: Lin, Ji, et al.
Publicado: (2022)
por: Lin, Ji, et al.
Publicado: (2022)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
por: Xie, Enze, et al.
Publicado: (2025)
por: Xie, Enze, et al.
Publicado: (2025)
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024)
por: Fang, Yunhao, et al.
Publicado: (2024)
3D Aware Region Prompted Vision Language Model
por: Cheng, An-Chieh, et al.
Publicado: (2025)
por: Cheng, An-Chieh, et al.
Publicado: (2025)
DAIT: Distillation from Vision-Language Models to Lightweight Classifiers with Adaptive Intermediate Teacher Transfer
por: He, Zhengxu, et al.
Publicado: (2026)
por: He, Zhengxu, et al.
Publicado: (2026)
VILA: On Pre-training for Visual Language Models
por: Lin, Ji, et al.
Publicado: (2023)
por: Lin, Ji, et al.
Publicado: (2023)
Grounding Language Models for Visual Entity Recognition
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Language-Guided Diffusion Model for Visual Grounding
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
AMC: AutoML for Model Compression and Acceleration on Mobile Devices
por: He, Yihui, et al.
Publicado: (2018)
por: He, Yihui, et al.
Publicado: (2018)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
por: He, Jinlong, et al.
Publicado: (2024)
por: He, Jinlong, et al.
Publicado: (2024)
MatSAM: Efficient Extraction of Microstructures of Materials via Visual Large Model
por: Li, Changtai, et al.
Publicado: (2024)
por: Li, Changtai, et al.
Publicado: (2024)
VPTracker: Global Vision-Language Tracking via Visual Prompt
por: Wang, Jingchao, et al.
Publicado: (2025)
por: Wang, Jingchao, et al.
Publicado: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
por: Zheng, Shurong, et al.
Publicado: (2026)
por: Zheng, Shurong, et al.
Publicado: (2026)
Visual Grounding with Multi-modal Conditional Adaptation
por: Yao, Ruilin, et al.
Publicado: (2024)
por: Yao, Ruilin, et al.
Publicado: (2024)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
por: Wu, Xianfeng, et al.
Publicado: (2025)
por: Wu, Xianfeng, et al.
Publicado: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Tiny Machine Learning: Progress and Futures
por: Lin, Ji, et al.
Publicado: (2024)
por: Lin, Ji, et al.
Publicado: (2024)
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
por: Cheng, Jintao, et al.
Publicado: (2025)
por: Cheng, Jintao, et al.
Publicado: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
por: Chen, Zheng, et al.
Publicado: (2024)
por: Chen, Zheng, et al.
Publicado: (2024)
Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
por: Guo, Leilei, et al.
Publicado: (2025)
por: Guo, Leilei, et al.
Publicado: (2025)
Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
por: Rang, Miao, et al.
Publicado: (2025)
por: Rang, Miao, et al.
Publicado: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
por: Jiang, Jindong, et al.
Publicado: (2025)
por: Jiang, Jindong, et al.
Publicado: (2025)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
por: Liu, Yuanyuan, et al.
Publicado: (2025)
por: Liu, Yuanyuan, et al.
Publicado: (2025)
Ejemplares similares
-
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026) -
ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval
por: Zhan, Guanqi, et al.
Publicado: (2025) -
NVILA: Efficient Frontier Visual Language Models
por: Liu, Zhijian, et al.
Publicado: (2024) -
Amodal Ground Truth and Completion in the Wild
por: Zhan, Guanqi, et al.
Publicado: (2023) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
por: Chen, Yukang, et al.
Publicado: (2024)