Vision Language Models for Spreadsheet Understanding: Challenges and Opportunities
Fuente:
arXiv
Guardado en:
| Autores principales: | Xia, Shiyu, Xiong, Junyu, Dong, Haoyu, Zhao, Jianbo, Tian, Yuzhang, Zhou, Mengyu, He, Yeye, Han, Shi, Zhang, Dongmei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpreadsheetLLM: Encoding Spreadsheets for Large Language Models
por: Dong, Haoyu, et al.
Publicado: (2024)
por: Dong, Haoyu, et al.
Publicado: (2024)
TableLoRA: Low-rank Adaptation on Table Structure Understanding for Large Language Models
por: He, Xinyi, et al.
Publicado: (2025)
por: He, Xinyi, et al.
Publicado: (2025)
Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning
por: Xing, Junjie, et al.
Publicado: (2024)
por: Xing, Junjie, et al.
Publicado: (2024)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
por: Zhang, Da, et al.
Publicado: (2025)
por: Zhang, Da, et al.
Publicado: (2025)
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
por: Gao, Mengyu, et al.
Publicado: (2025)
por: Gao, Mengyu, et al.
Publicado: (2025)
LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition
por: Wang, Jiaxin, et al.
Publicado: (2026)
por: Wang, Jiaxin, et al.
Publicado: (2026)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
por: Zhao, Shanshan, et al.
Publicado: (2025)
por: Zhao, Shanshan, et al.
Publicado: (2025)
Vision-Based Anti Unmanned Aerial Technology: Opportunities and Challenges
por: Ding, Guanghai, et al.
Publicado: (2025)
por: Ding, Guanghai, et al.
Publicado: (2025)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
por: Liu, Ying, et al.
Publicado: (2026)
por: Liu, Ying, et al.
Publicado: (2026)
LongVLM: Efficient Long Video Understanding via Large Language Models
por: Weng, Yuetian, et al.
Publicado: (2024)
por: Weng, Yuetian, et al.
Publicado: (2024)
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities
por: Yan, Xu, et al.
Publicado: (2024)
por: Yan, Xu, et al.
Publicado: (2024)
Understanding Degradation with Vision Language Model
por: Lan, Guanzhou, et al.
Publicado: (2026)
por: Lan, Guanzhou, et al.
Publicado: (2026)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
por: Hong, Wenyi, et al.
Publicado: (2025)
por: Hong, Wenyi, et al.
Publicado: (2025)
Supplementing Missing Visions via Dialog for Scene Graph Generations
por: Zhao, Zhenghao, et al.
Publicado: (2022)
por: Zhao, Zhenghao, et al.
Publicado: (2022)
Structural Graph Probing of Vision-Language Models
por: He, Haoyu, et al.
Publicado: (2026)
por: He, Haoyu, et al.
Publicado: (2026)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
por: Xiong, Junyu, et al.
Publicado: (2025)
por: Xiong, Junyu, et al.
Publicado: (2025)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
por: Gu, Renjie, et al.
Publicado: (2026)
por: Gu, Renjie, et al.
Publicado: (2026)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
por: Liu, Hongbo, et al.
Publicado: (2025)
por: Liu, Hongbo, et al.
Publicado: (2025)
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
por: He, Xin, et al.
Publicado: (2025)
por: He, Xin, et al.
Publicado: (2025)
Image Gradient-Aided Photometric Stereo Network
por: Wang, Kaixuan, et al.
Publicado: (2024)
por: Wang, Kaixuan, et al.
Publicado: (2024)
SpatialBot: Precise Spatial Understanding with Vision Language Models
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
MSF-Net: Multi-Stage Feature Extraction and Fusion for Robust Photometric Stereo
por: Qin, Shiyu, et al.
Publicado: (2025)
por: Qin, Shiyu, et al.
Publicado: (2025)
Efficient Reasoning via Thought Compression for Language Segmentation
por: Zhou, Qing, et al.
Publicado: (2026)
por: Zhou, Qing, et al.
Publicado: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
por: Tong, Haoyu, et al.
Publicado: (2026)
por: Tong, Haoyu, et al.
Publicado: (2026)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
por: Xu, Wenhao, et al.
Publicado: (2025)
por: Xu, Wenhao, et al.
Publicado: (2025)
MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark
por: Xing, Junjie, et al.
Publicado: (2025)
por: Xing, Junjie, et al.
Publicado: (2025)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
por: Shi, Bowen, et al.
Publicado: (2024)
por: Shi, Bowen, et al.
Publicado: (2024)
Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
por: Gao, Junyu, et al.
Publicado: (2023)
por: Gao, Junyu, et al.
Publicado: (2023)
EVLM: An Efficient Vision-Language Model for Visual Understanding
por: Chen, Kaibing, et al.
Publicado: (2024)
por: Chen, Kaibing, et al.
Publicado: (2024)
FairCLIP: Harnessing Fairness in Vision-Language Learning
por: Luo, Yan, et al.
Publicado: (2024)
por: Luo, Yan, et al.
Publicado: (2024)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
por: Mohamud, Safaa Abdullahi Moallim, et al.
Publicado: (2025)
por: Mohamud, Safaa Abdullahi Moallim, et al.
Publicado: (2025)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
por: Wang, Chaoyang, et al.
Publicado: (2026)
por: Wang, Chaoyang, et al.
Publicado: (2026)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
por: Niu, Junbo, et al.
Publicado: (2025)
por: Niu, Junbo, et al.
Publicado: (2025)
JFAA: Technical Report for the EPIC-KITCHENS-100 Action Anticipation Challenge at EgoVis 2026
por: Chu, Qiaohui, et al.
Publicado: (2026)
por: Chu, Qiaohui, et al.
Publicado: (2026)
Large Vision-Language Models Get Lost in Attention
por: Xi, Gongli, et al.
Publicado: (2026)
por: Xi, Gongli, et al.
Publicado: (2026)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
por: Kelly, Chris, et al.
Publicado: (2024)
por: Kelly, Chris, et al.
Publicado: (2024)
TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models
por: Zhang, Zhifang, et al.
Publicado: (2025)
por: Zhang, Zhifang, et al.
Publicado: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
por: Zhou, Zikun, et al.
Publicado: (2024)
por: Zhou, Zikun, et al.
Publicado: (2024)
Joint Vision-Language Social Bias Removal for CLIP
por: Zhang, Haoyu, et al.
Publicado: (2024)
por: Zhang, Haoyu, et al.
Publicado: (2024)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
por: Cao, Yue, et al.
Publicado: (2024)
por: Cao, Yue, et al.
Publicado: (2024)
Ejemplares similares
-
SpreadsheetLLM: Encoding Spreadsheets for Large Language Models
por: Dong, Haoyu, et al.
Publicado: (2024) -
TableLoRA: Low-rank Adaptation on Table Structure Understanding for Large Language Models
por: He, Xinyi, et al.
Publicado: (2025) -
Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning
por: Xing, Junjie, et al.
Publicado: (2024) -
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
por: Zhang, Da, et al.
Publicado: (2025) -
Causality-guided Prompt Learning for Vision-language Models via Visual Granulation
por: Gao, Mengyu, et al.
Publicado: (2025)