Pi-GPS: Enhancing Geometry Problem Solving by Unleashing the Power of Diagrammatic Information
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Junbo, Zhang, Ting, Sun, Jiayu, Tian, Mi, Huang, Hua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
por: Hua, Jiacheng, et al.
Publicado: (2026)
por: Hua, Jiacheng, et al.
Publicado: (2026)
Mixture of Group Experts for Learning Invariant Representations
por: Kang, Lei, et al.
Publicado: (2025)
por: Kang, Lei, et al.
Publicado: (2025)
A Survey of Deep Learning for Geometry Problem Solving
por: Ma, Jianzhe, et al.
Publicado: (2025)
por: Ma, Jianzhe, et al.
Publicado: (2025)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
por: Wen, Zichen, et al.
Publicado: (2025)
por: Wen, Zichen, et al.
Publicado: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
Spatial Semantic Recurrent Mining for Referring Image Segmentation
por: Yang, Jiaxing, et al.
Publicado: (2024)
por: Yang, Jiaxing, et al.
Publicado: (2024)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
Can Vision-Language Models Solve the Shell Game?
por: Liu, Tiedong, et al.
Publicado: (2026)
por: Liu, Tiedong, et al.
Publicado: (2026)
Unleashing the Potential of Model Bias for Generalized Category Discovery
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2026)
por: Lin, Junyan, et al.
Publicado: (2026)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
por: Li, Zejun, et al.
Publicado: (2024)
por: Li, Zejun, et al.
Publicado: (2024)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
por: Luo, Jianjie, et al.
Publicado: (2024)
por: Luo, Jianjie, et al.
Publicado: (2024)
Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data
por: Yang, Lihe, et al.
Publicado: (2024)
por: Yang, Lihe, et al.
Publicado: (2024)
UIFace: Unleashing Inherent Model Capabilities to Enhance Intra-Class Diversity in Synthetic Face Recognition
por: Lin, Xiao, et al.
Publicado: (2025)
por: Lin, Xiao, et al.
Publicado: (2025)
Geometry-Aware Losses for Structure-Preserving Text-to-Sign Language Generation
por: Wu, Zetian, et al.
Publicado: (2025)
por: Wu, Zetian, et al.
Publicado: (2025)
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
por: Wang, Yuhao, et al.
Publicado: (2024)
por: Wang, Yuhao, et al.
Publicado: (2024)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
por: Liang, Hao, et al.
Publicado: (2025)
por: Liang, Hao, et al.
Publicado: (2025)
Towards Geometry Problem Solving in the Large Model Era: A Survey
por: Zhao, Yurui, et al.
Publicado: (2025)
por: Zhao, Yurui, et al.
Publicado: (2025)
Enhancing Target-unspecific Tasks through a Features Matrix
por: Cui, Fangming, et al.
Publicado: (2025)
por: Cui, Fangming, et al.
Publicado: (2025)
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
por: Li, Yanshu, et al.
Publicado: (2025)
por: Li, Yanshu, et al.
Publicado: (2025)
Unleashing the Power of Data Tsunami: A Comprehensive Survey on Data Assessment and Selection for Instruction Tuning of Language Models
por: Qin, Yulei, et al.
Publicado: (2024)
por: Qin, Yulei, et al.
Publicado: (2024)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
por: Yuan, Fan, et al.
Publicado: (2025)
por: Yuan, Fan, et al.
Publicado: (2025)
Diagram Formalization Enhanced Multi-Modal Geometry Problem Solver
por: Zhang, Zeren, et al.
Publicado: (2024)
por: Zhang, Zeren, et al.
Publicado: (2024)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
por: Mi, Hongze, et al.
Publicado: (2024)
por: Mi, Hongze, et al.
Publicado: (2024)
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
por: Fang, Ye, et al.
Publicado: (2024)
por: Fang, Ye, et al.
Publicado: (2024)
Unleashing the Power of Prompt-driven Nucleus Instance Segmentation
por: Shui, Zhongyi, et al.
Publicado: (2023)
por: Shui, Zhongyi, et al.
Publicado: (2023)
SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation
por: Wang, Junda, et al.
Publicado: (2024)
por: Wang, Junda, et al.
Publicado: (2024)
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
por: Zheng, Mingzhe, et al.
Publicado: (2025)
por: Zheng, Mingzhe, et al.
Publicado: (2025)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
por: Zhu, Rui, et al.
Publicado: (2024)
por: Zhu, Rui, et al.
Publicado: (2024)
MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation
por: Loo, Gowen, et al.
Publicado: (2025)
por: Loo, Gowen, et al.
Publicado: (2025)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)
por: Hu, Juncheng, et al.
Publicado: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
por: Hsu, Ting-Yao E., et al.
Publicado: (2025)
por: Hsu, Ting-Yao E., et al.
Publicado: (2025)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
por: Wang, Yabing, et al.
Publicado: (2024)
por: Wang, Yabing, et al.
Publicado: (2024)
Enhancing Document Key Information Localization Through Data Augmentation
por: Dai, Yue
Publicado: (2025)
por: Dai, Yue
Publicado: (2025)
GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving
por: Deng, Linger, et al.
Publicado: (2026)
por: Deng, Linger, et al.
Publicado: (2026)
Ejemplares similares
-
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
por: Sharma, Aditya, et al.
Publicado: (2024) -
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
por: Hua, Jiacheng, et al.
Publicado: (2026) -
Mixture of Group Experts for Learning Invariant Representations
por: Kang, Lei, et al.
Publicado: (2025) -
A Survey of Deep Learning for Geometry Problem Solving
por: Ma, Jianzhe, et al.
Publicado: (2025) -
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025)