GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Shasha, Pang, Liang, Wang, Xi, Wang, Yanling, Shen, Huawei, Zhang, Jing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language Understanding
par: Zhu, Yunchang, et autres
Publié: (2023)
par: Zhu, Yunchang, et autres
Publié: (2023)
Enhancing Training Data Attribution for Large Language Models with Fitting Error Consideration
par: Wu, Kangxi, et autres
Publié: (2024)
par: Wu, Kangxi, et autres
Publié: (2024)
Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue
par: Zhou, Junkai, et autres
Publié: (2023)
par: Zhou, Junkai, et autres
Publié: (2023)
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
par: Dhimoïla, Grégoire, et autres
Publié: (2026)
par: Dhimoïla, Grégoire, et autres
Publié: (2026)
SGSH: Stimulate Large Language Models with Skeleton Heuristics for Knowledge Base Question Generation
par: Guo, Shasha, et autres
Publié: (2024)
par: Guo, Shasha, et autres
Publié: (2024)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
par: Li, Zizun, et autres
Publié: (2026)
par: Li, Zizun, et autres
Publié: (2026)
Search-in-the-Chain: Interactively Enhancing Large Language Models with Search for Knowledge-intensive Tasks
par: Xu, Shicheng, et autres
Publié: (2023)
par: Xu, Shicheng, et autres
Publié: (2023)
Self-Rewarding Vision-Language Model via Reasoning Decomposition
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models
par: Gu, Jia, et autres
Publié: (2026)
par: Gu, Jia, et autres
Publié: (2026)
Do LLMs Play Dice? Exploring Probability Distribution Sampling in Large Language Models for Behavioral Simulation
par: Gu, Jia, et autres
Publié: (2024)
par: Gu, Jia, et autres
Publié: (2024)
GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models
par: Shi, Nannan, et autres
Publié: (2025)
par: Shi, Nannan, et autres
Publié: (2025)
AutoGeo: Automating Geometric Image Dataset Creation for Enhanced Geometry Understanding
par: Huang, Zihan, et autres
Publié: (2024)
par: Huang, Zihan, et autres
Publié: (2024)
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
par: Yin, Tengjiao, et autres
Publié: (2026)
par: Yin, Tengjiao, et autres
Publié: (2026)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
par: Shen, Guanxi
Publié: (2025)
par: Shen, Guanxi
Publié: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation
par: Weng, Shichao, et autres
Publié: (2025)
par: Weng, Shichao, et autres
Publié: (2025)
Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models
par: Wang, Zhaoxin, et autres
Publié: (2025)
par: Wang, Zhaoxin, et autres
Publié: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
par: Jia, Yiduo, et autres
Publié: (2026)
par: Jia, Yiduo, et autres
Publié: (2026)
DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
par: Gao, Haowen, et autres
Publié: (2026)
par: Gao, Haowen, et autres
Publié: (2026)
GaMi: Geometry-Agnostic Material Identification via Cross-Modal Subtractive Disentanglement
par: Chen, Zhiwei, et autres
Publié: (2026)
par: Chen, Zhiwei, et autres
Publié: (2026)
GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines
par: Fu, Yumeng, et autres
Publié: (2025)
par: Fu, Yumeng, et autres
Publié: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
par: Wang, Haozhe, et autres
Publié: (2026)
par: Wang, Haozhe, et autres
Publié: (2026)
Reward Training Wheels: Adaptive Auxiliary Rewards for Robotics Reinforcement Learning
par: Wang, Linji, et autres
Publié: (2025)
par: Wang, Linji, et autres
Publié: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
par: Wang, Qiaolin, et autres
Publié: (2025)
par: Wang, Qiaolin, et autres
Publié: (2025)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
Qsnail: A Questionnaire Dataset for Sequential Question Generation
par: Lei, Yan, et autres
Publié: (2024)
par: Lei, Yan, et autres
Publié: (2024)
RLKD: Distilling LLMs' Reasoning via Reinforcement Learning
par: Xu, Shicheng, et autres
Publié: (2025)
par: Xu, Shicheng, et autres
Publié: (2025)
CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
A Theory for Token-Level Harmonization in Retrieval-Augmented Generation
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
Event-aware Video Corpus Moment Retrieval
par: Hou, Danyang, et autres
Publié: (2024)
par: Hou, Danyang, et autres
Publié: (2024)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
par: Xin, Yifei, et autres
Publié: (2023)
par: Xin, Yifei, et autres
Publié: (2023)
Auxiliary Reward Generation with Transition Distance Representation Learning
par: Li, Siyuan, et autres
Publié: (2024)
par: Li, Siyuan, et autres
Publié: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Towards Robust Process Reward Modeling via Noise-aware Learning
par: Xie, Bin, et autres
Publié: (2026)
par: Xie, Bin, et autres
Publié: (2026)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
Documents similaires
-
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024) -
Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language Understanding
par: Zhu, Yunchang, et autres
Publié: (2023) -
Enhancing Training Data Attribution for Large Language Models with Fitting Error Consideration
par: Wu, Kangxi, et autres
Publié: (2024) -
Think Before You Speak: Cultivating Communication Skills of Large Language Models via Inner Monologue
par: Zhou, Junkai, et autres
Publié: (2023) -
Cross-Modal Redundancy and the Geometry of Vision-Language Embeddings
par: Dhimoïla, Grégoire, et autres
Publié: (2026)