Enregistré dans:
| Auteurs principaux: | Takato, Hiroshi, Tsutsui, Hiroshi, Soda, Komei, Kamigaito, Hidetaka |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2408.01682 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach
par: Sakajo, Haruki, et autres
Publié: (2025)
par: Sakajo, Haruki, et autres
Publié: (2025)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025)
par: Hayashi, Kazuki, et autres
Publié: (2025)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024)
par: Atuhurra, Jesse, et autres
Publié: (2024)
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
par: Salmè, Marco, et autres
Publié: (2025)
par: Salmè, Marco, et autres
Publié: (2025)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
Towards Artwork Explanation in Large-scale Vision Language Models
par: Hayashi, Kazuki, et autres
Publié: (2024)
par: Hayashi, Kazuki, et autres
Publié: (2024)
IRR: Image Review Ranking Framework for Evaluating Vision-Language Models
par: Hayashi, Kazuki, et autres
Publié: (2024)
par: Hayashi, Kazuki, et autres
Publié: (2024)
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
par: Geigle, Gregor, et autres
Publié: (2025)
par: Geigle, Gregor, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
Can Impressions of Music be Extracted from Thumbnail Images?
par: Harada, Takashi, et autres
Publié: (2025)
par: Harada, Takashi, et autres
Publié: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
par: Xu, Runsen, et autres
Publié: (2025)
par: Xu, Runsen, et autres
Publié: (2025)
VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions
par: Matsuda, Kazuki, et autres
Publié: (2025)
par: Matsuda, Kazuki, et autres
Publié: (2025)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
par: Yu, Sicheng, et autres
Publié: (2024)
par: Yu, Sicheng, et autres
Publié: (2024)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
par: Yashima, Daichi, et autres
Publié: (2024)
par: Yashima, Daichi, et autres
Publié: (2024)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
par: Zhang, Jianshu, et autres
Publié: (2026)
par: Zhang, Jianshu, et autres
Publié: (2026)
Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
par: Zha, Yuheng, et autres
Publié: (2025)
par: Zha, Yuheng, et autres
Publié: (2025)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
par: Zhang, Zheyuan, et autres
Publié: (2024)
par: Zhang, Zheyuan, et autres
Publié: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
par: Zhao, Bingchen, et autres
Publié: (2024)
par: Zhao, Bingchen, et autres
Publié: (2024)
X-Driver: Explainable Autonomous Driving with Vision-Language Models
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
par: Stogiannidis, Ilias, et autres
Publié: (2025)
par: Stogiannidis, Ilias, et autres
Publié: (2025)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
par: Yu, Suhao, et autres
Publié: (2025)
par: Yu, Suhao, et autres
Publié: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
par: Liao, Yuan-Hong, et autres
Publié: (2024)
par: Liao, Yuan-Hong, et autres
Publié: (2024)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
par: Sun, Min Woo, et autres
Publié: (2025)
par: Sun, Min Woo, et autres
Publié: (2025)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
par: Matsuda, Kazuki, et autres
Publié: (2024)
par: Matsuda, Kazuki, et autres
Publié: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
par: Wu, Xueqing, et autres
Publié: (2026)
par: Wu, Xueqing, et autres
Publié: (2026)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
par: You, Haoxuan, et autres
Publié: (2023)
par: You, Haoxuan, et autres
Publié: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
par: Le, Quang-Hung, et autres
Publié: (2024)
par: Le, Quang-Hung, et autres
Publié: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
The Abstraction Gap in Vision-Language Causal Reasoning
par: Hoang, Chinh, et autres
Publié: (2026)
par: Hoang, Chinh, et autres
Publié: (2026)
BabyVision: Visual Reasoning Beyond Language
par: Chen, Liang, et autres
Publié: (2026)
par: Chen, Liang, et autres
Publié: (2026)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
par: Korekata, Ryosuke, et autres
Publié: (2025)
par: Korekata, Ryosuke, et autres
Publié: (2025)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025)
par: Wang, Zhaowei, et autres
Publié: (2025)
From Behavioral Performance to Internal Competence: Interpreting Vision-Language Models with VLM-Lens
par: Sheta, Hala, et autres
Publié: (2025)
par: Sheta, Hala, et autres
Publié: (2025)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
par: Moll, Johannes, et autres
Publié: (2025)
par: Moll, Johannes, et autres
Publié: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
par: Hu, Yushi, et autres
Publié: (2023)
par: Hu, Yushi, et autres
Publié: (2023)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
par: Tang, Liyan, et autres
Publié: (2025)
par: Tang, Liyan, et autres
Publié: (2025)
Documents similaires
-
Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach
par: Sakajo, Haruki, et autres
Publié: (2025) -
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
par: Hayashi, Kazuki, et autres
Publié: (2025) -
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
par: Atuhurra, Jesse, et autres
Publié: (2024) -
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
par: Salmè, Marco, et autres
Publié: (2025) -
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)