Enhancing Advanced Visual Reasoning Ability of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhiyuan, Liu, Dongnan, Zhang, Chaoyi, Wang, Heng, Xue, Tengfei, Cai, Weidong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
por: Li, Zhiyuan, et al.
Publicado: (2024)
por: Li, Zhiyuan, et al.
Publicado: (2024)
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
por: Li, Zhiyuan, et al.
Publicado: (2023)
por: Li, Zhiyuan, et al.
Publicado: (2023)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
por: Wang, Xuanchen, et al.
Publicado: (2024)
por: Wang, Xuanchen, et al.
Publicado: (2024)
Enhancing Robustness to Noise Corruption for Point Cloud Recognition via Spatial Sorting and Set-Mixing Aggregation Module
por: Zhang, Dingxin, et al.
Publicado: (2024)
por: Zhang, Dingxin, et al.
Publicado: (2024)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding
por: Mao, Shunqi, et al.
Publicado: (2025)
por: Mao, Shunqi, et al.
Publicado: (2025)
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
por: Bing, Qi, et al.
Publicado: (2024)
por: Bing, Qi, et al.
Publicado: (2024)
Seeing Unseen: Discover Novel Biomedical Concepts via Geometry-Constrained Probabilistic Modeling
por: Fan, Jianan, et al.
Publicado: (2024)
por: Fan, Jianan, et al.
Publicado: (2024)
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
por: Wang, Tianyi, et al.
Publicado: (2025)
por: Wang, Tianyi, et al.
Publicado: (2025)
Learning to Synthesize Graphics Programs for Geometric Artworks
por: Bing, Qi, et al.
Publicado: (2024)
por: Bing, Qi, et al.
Publicado: (2024)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
por: Wu, Zhiheng, et al.
Publicado: (2026)
por: Wu, Zhiheng, et al.
Publicado: (2026)
Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined Highlights
por: Mao, Shunqi, et al.
Publicado: (2024)
por: Mao, Shunqi, et al.
Publicado: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
por: Jin, Haibo, et al.
Publicado: (2025)
por: Jin, Haibo, et al.
Publicado: (2025)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
por: Qharabagh, Muhammad Fetrat, et al.
Publicado: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
por: Zhan, Yufei, et al.
Publicado: (2025)
por: Zhan, Yufei, et al.
Publicado: (2025)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
por: Che, Liwei, et al.
Publicado: (2026)
por: Che, Liwei, et al.
Publicado: (2026)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
por: Fan, Ziqing, et al.
Publicado: (2025)
por: Fan, Ziqing, et al.
Publicado: (2025)
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
por: Wu, Zhanglin, et al.
Publicado: (2025)
por: Wu, Zhanglin, et al.
Publicado: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2026)
por: Dong, Yuhao, et al.
Publicado: (2026)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
por: Xiang, Wentao, et al.
Publicado: (2025)
por: Xiang, Wentao, et al.
Publicado: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
por: Wang, Zhenhailong, et al.
Publicado: (2024)
por: Wang, Zhenhailong, et al.
Publicado: (2024)
Can Large Language Models Unveil the Mysteries? An Exploration of Their Ability to Unlock Information in Complex Scenarios
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
por: Zhang, Ruiyi, et al.
Publicado: (2024)
por: Zhang, Ruiyi, et al.
Publicado: (2024)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
por: Hao, Pengfei, et al.
Publicado: (2025)
por: Hao, Pengfei, et al.
Publicado: (2025)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
por: Zhang, Huaxiang, et al.
Publicado: (2024)
por: Zhang, Huaxiang, et al.
Publicado: (2024)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
por: Li, Jianjian, et al.
Publicado: (2025)
por: Li, Jianjian, et al.
Publicado: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
por: Xue, Haotian, et al.
Publicado: (2025)
por: Xue, Haotian, et al.
Publicado: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
por: Kang, Zhaolu, et al.
Publicado: (2025)
por: Kang, Zhaolu, et al.
Publicado: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
por: Wang, Changpeng, et al.
Publicado: (2025)
por: Wang, Changpeng, et al.
Publicado: (2025)
Blocks as Probes: Dissecting Categorization Ability of Large Multimodal Models
por: Fu, Bin, et al.
Publicado: (2024)
por: Fu, Bin, et al.
Publicado: (2024)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
por: Li, Ruihang, et al.
Publicado: (2026)
por: Li, Ruihang, et al.
Publicado: (2026)
TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning
por: Ding, Hao, et al.
Publicado: (2026)
por: Ding, Hao, et al.
Publicado: (2026)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
Advancing Marine Research: UWSAM Framework and UIIS10K Dataset for Precise Underwater Instance Segmentation
por: Li, Hua, et al.
Publicado: (2025)
por: Li, Hua, et al.
Publicado: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
por: Chen, Yan, et al.
Publicado: (2025)
por: Chen, Yan, et al.
Publicado: (2025)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
por: Wang, Xuanchen, et al.
Publicado: (2025)
por: Wang, Xuanchen, et al.
Publicado: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
por: Shen, Yuxiang, et al.
Publicado: (2026)
por: Shen, Yuxiang, et al.
Publicado: (2026)
Ejemplares similares
-
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
por: Li, Zhiyuan, et al.
Publicado: (2024) -
Exploring Annotation-free Image Captioning with Retrieval-augmented Pseudo Sentence Generation
por: Li, Zhiyuan, et al.
Publicado: (2023) -
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
por: Wang, Xuanchen, et al.
Publicado: (2024) -
Enhancing Robustness to Noise Corruption for Point Cloud Recognition via Spatial Sorting and Set-Mixing Aggregation Module
por: Zhang, Dingxin, et al.
Publicado: (2024) -
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)