Porting Large Language Models to Mobile Devices for Question Answering
Fuente:
arXiv
Guardado en:
| Autor principal: | Fassold, Hannes |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Faster than real-time detection of shot boundaries, sampling structure and dynamic keyframes in video
por: Fassold, Hannes
Publicado: (2025)
por: Fassold, Hannes
Publicado: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
por: Cai, Chen, et al.
Publicado: (2024)
por: Cai, Chen, et al.
Publicado: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025)
por: Xing, Xiaoying, et al.
Publicado: (2025)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
por: Shah, Monika, et al.
Publicado: (2025)
por: Shah, Monika, et al.
Publicado: (2025)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024)
por: Lee, Jusung, et al.
Publicado: (2024)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
por: Hao, Dongze, et al.
Publicado: (2024)
por: Hao, Dongze, et al.
Publicado: (2024)
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
por: Xu, Quanxing, et al.
Publicado: (2026)
por: Xu, Quanxing, et al.
Publicado: (2026)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?
por: Lando, Giuseppe, et al.
Publicado: (2025)
por: Lando, Giuseppe, et al.
Publicado: (2025)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
por: Kim, Taehee, et al.
Publicado: (2024)
por: Kim, Taehee, et al.
Publicado: (2024)
3D Question Answering via only 2D Vision-Language Models
por: Wang, Fengyun, et al.
Publicado: (2025)
por: Wang, Fengyun, et al.
Publicado: (2025)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
por: Bai, Xiangyu, et al.
Publicado: (2026)
por: Bai, Xiangyu, et al.
Publicado: (2026)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
SCRA-VQA: Summarized Caption-Rerank for Augmented Large Language Models in Visual Question Answering
por: Zhang, Yan, et al.
Publicado: (2025)
por: Zhang, Yan, et al.
Publicado: (2025)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
Research on Vision-Language Question Answering Models for Industrial Robots
por: Li, Ping, et al.
Publicado: (2026)
por: Li, Ping, et al.
Publicado: (2026)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
por: Ha, Cuong Nhat, et al.
Publicado: (2024)
por: Ha, Cuong Nhat, et al.
Publicado: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
por: Lim, Su Hyeon, et al.
Publicado: (2024)
por: Lim, Su Hyeon, et al.
Publicado: (2024)
GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
por: Lu, Xudong, et al.
Publicado: (2025)
por: Lu, Xudong, et al.
Publicado: (2025)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
por: Meng, Tian, et al.
Publicado: (2024)
por: Meng, Tian, et al.
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
Imp: Highly Capable Large Multimodal Models for Mobile Devices
por: Shao, Zhenwei, et al.
Publicado: (2024)
por: Shao, Zhenwei, et al.
Publicado: (2024)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models
por: Sasaki, Hiroshi
Publicado: (2026)
por: Sasaki, Hiroshi
Publicado: (2026)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
por: Wu, Yifan, et al.
Publicado: (2024)
por: Wu, Yifan, et al.
Publicado: (2024)
Admitting Ignorance Helps the Video Question Answering Models to Answer
por: Li, Haopeng, et al.
Publicado: (2025)
por: Li, Haopeng, et al.
Publicado: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
por: Patel, Alkesh, et al.
Publicado: (2025)
por: Patel, Alkesh, et al.
Publicado: (2025)
RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
por: Zi, Xing, et al.
Publicado: (2025)
por: Zi, Xing, et al.
Publicado: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
por: Shourya, Aditya, et al.
Publicado: (2025)
por: Shourya, Aditya, et al.
Publicado: (2025)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering
por: Srivastava, Varun, et al.
Publicado: (2025)
por: Srivastava, Varun, et al.
Publicado: (2025)
Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering
por: Romero, David, et al.
Publicado: (2024)
por: Romero, David, et al.
Publicado: (2024)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
por: Yu, Zhou, et al.
Publicado: (2023)
por: Yu, Zhou, et al.
Publicado: (2023)
Ejemplares similares
-
Faster than real-time detection of shot boundaries, sampling structure and dynamic keyframes in video
por: Fassold, Hannes
Publicado: (2025) -
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024) -
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
por: Cai, Chen, et al.
Publicado: (2024) -
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025) -
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
por: Shah, Monika, et al.
Publicado: (2025)