Enhancing Advanced Visual Reasoning Ability of Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zhiyuan, Liu, Dongnan, Zhang, Chaoyi, Wang, Heng, Xue, Tengfei, Cai, Weidong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
von: Li, Zhiyuan, et al.
Veröffentlicht: (2023)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2023)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
von: Wang, Xuanchen, et al.
Veröffentlicht: (2024)
von: Wang, Xuanchen, et al.
Veröffentlicht: (2024)
Enhancing Robustness to Noise Corruption for Point Cloud Recognition via Spatial Sorting and Set-Mixing Aggregation Module
von: Zhang, Dingxin, et al.
Veröffentlicht: (2024)
von: Zhang, Dingxin, et al.
Veröffentlicht: (2024)
Medical Large Vision Language Models with Multi-Image Visual Ability
von: Yang, Xikai, et al.
Veröffentlicht: (2025)
von: Yang, Xikai, et al.
Veröffentlicht: (2025)
Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding
von: Mao, Shunqi, et al.
Veröffentlicht: (2025)
von: Mao, Shunqi, et al.
Veröffentlicht: (2025)
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
von: Bing, Qi, et al.
Veröffentlicht: (2024)
von: Bing, Qi, et al.
Veröffentlicht: (2024)
Seeing Unseen: Discover Novel Biomedical Concepts via Geometry-Constrained Probabilistic Modeling
von: Fan, Jianan, et al.
Veröffentlicht: (2024)
von: Fan, Jianan, et al.
Veröffentlicht: (2024)
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
von: Wang, Tianyi, et al.
Veröffentlicht: (2025)
von: Wang, Tianyi, et al.
Veröffentlicht: (2025)
Learning to Synthesize Graphics Programs for Geometric Artworks
von: Bing, Qi, et al.
Veröffentlicht: (2024)
von: Bing, Qi, et al.
Veröffentlicht: (2024)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
von: Wu, Zhiheng, et al.
Veröffentlicht: (2026)
von: Wu, Zhiheng, et al.
Veröffentlicht: (2026)
Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights
von: Mao, Shunqi, et al.
Veröffentlicht: (2024)
von: Mao, Shunqi, et al.
Veröffentlicht: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
von: Qharabagh, Muhammad Fetrat, et al.
Veröffentlicht: (2024)
von: Qharabagh, Muhammad Fetrat, et al.
Veröffentlicht: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
von: Che, Liwei, et al.
Veröffentlicht: (2026)
von: Che, Liwei, et al.
Veröffentlicht: (2026)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
von: Fan, Ziqing, et al.
Veröffentlicht: (2025)
von: Fan, Ziqing, et al.
Veröffentlicht: (2025)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
von: Wu, Zhanglin, et al.
Veröffentlicht: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
von: Dong, Yuhao, et al.
Veröffentlicht: (2026)
von: Dong, Yuhao, et al.
Veröffentlicht: (2026)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
von: Xiang, Wentao, et al.
Veröffentlicht: (2025)
von: Xiang, Wentao, et al.
Veröffentlicht: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
von: Wang, Zhenhailong, et al.
Veröffentlicht: (2024)
Can Large Language Models Unveil the Mysteries? An Exploration of Their Ability to Unlock Information in Complex Scenarios
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
von: Zhang, Ruiyi, et al.
Veröffentlicht: (2024)
von: Zhang, Ruiyi, et al.
Veröffentlicht: (2024)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
von: Hao, Pengfei, et al.
Veröffentlicht: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
von: Zhang, Huaxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Huaxiang, et al.
Veröffentlicht: (2024)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
von: Li, Jianjian, et al.
Veröffentlicht: (2025)
von: Li, Jianjian, et al.
Veröffentlicht: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
von: Xue, Haotian, et al.
Veröffentlicht: (2025)
von: Xue, Haotian, et al.
Veröffentlicht: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
von: Kang, Zhaolu, et al.
Veröffentlicht: (2025)
von: Kang, Zhaolu, et al.
Veröffentlicht: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
von: Wang, Changpeng, et al.
Veröffentlicht: (2025)
Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
von: Fu, Bin, et al.
Veröffentlicht: (2024)
von: Fu, Bin, et al.
Veröffentlicht: (2024)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
von: Li, Ruihang, et al.
Veröffentlicht: (2026)
von: Li, Ruihang, et al.
Veröffentlicht: (2026)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
von: Ding, Hao, et al.
Veröffentlicht: (2026)
von: Ding, Hao, et al.
Veröffentlicht: (2026)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
von: Cai, Jie, et al.
Veröffentlicht: (2025)
von: Cai, Jie, et al.
Veröffentlicht: (2025)
Advancing Marine Research: UWSAM Framework and UIIS10K Dataset for Precise Underwater Instance Segmentation
von: Li, Hua, et al.
Veröffentlicht: (2025)
von: Li, Hua, et al.
Veröffentlicht: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
von: Chen, Yan, et al.
Veröffentlicht: (2025)
von: Chen, Yan, et al.
Veröffentlicht: (2025)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
von: Wang, Xuanchen, et al.
Veröffentlicht: (2025)
von: Wang, Xuanchen, et al.
Veröffentlicht: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024) -
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
von: Li, Zhiyuan, et al.
Veröffentlicht: (2023) -
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
von: Wang, Xuanchen, et al.
Veröffentlicht: (2024) -
Enhancing Robustness to Noise Corruption for Point Cloud Recognition via Spatial Sorting and Set-Mixing Aggregation Module
von: Zhang, Dingxin, et al.
Veröffentlicht: (2024) -
Medical Large Vision Language Models with Multi-Image Visual Ability
von: Yang, Xikai, et al.
Veröffentlicht: (2025)