GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Linger, Liu, Yuliang, Yu, Wenwen, Zhang, Zujia, Ju, Jianzhong, Luo, Zhenbo, Bai, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
di: Guan, Yiran, et al.
Pubblicazione: (2026)
di: Guan, Yiran, et al.
Pubblicazione: (2026)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
Progressive Evolution from Single-Point to Polygon for Scene Text
di: Deng, Linger, et al.
Pubblicazione: (2023)
di: Deng, Linger, et al.
Pubblicazione: (2023)
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
di: Guan, Yiran, et al.
Pubblicazione: (2026)
di: Guan, Yiran, et al.
Pubblicazione: (2026)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
di: Deng, Linger, et al.
Pubblicazione: (2024)
di: Deng, Linger, et al.
Pubblicazione: (2024)
Federated Joint Learning for Domain and Class Generalization
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
di: Zhu, Linghao, et al.
Pubblicazione: (2025)
di: Zhu, Linghao, et al.
Pubblicazione: (2025)
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
di: Li, Jiaze, et al.
Pubblicazione: (2026)
di: Li, Jiaze, et al.
Pubblicazione: (2026)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
LatexBlend: Scaling Multi-concept Customized Generation with Latent Textual Blending
di: Jin, Jian, et al.
Pubblicazione: (2025)
di: Jin, Jian, et al.
Pubblicazione: (2025)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
Towards Geometry Problem Solving in the Large Model Era: A Survey
di: Zhao, Yurui, et al.
Pubblicazione: (2025)
di: Zhao, Yurui, et al.
Pubblicazione: (2025)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
di: Xu, Shihao, et al.
Pubblicazione: (2024)
di: Xu, Shihao, et al.
Pubblicazione: (2024)
GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
di: Feng, Yuan, et al.
Pubblicazione: (2025)
di: Feng, Yuan, et al.
Pubblicazione: (2025)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning
di: Tong, Enwei, et al.
Pubblicazione: (2026)
di: Tong, Enwei, et al.
Pubblicazione: (2026)
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
di: Luo, Yinyi, et al.
Pubblicazione: (2026)
di: Luo, Yinyi, et al.
Pubblicazione: (2026)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
di: Wang, Jingyi, et al.
Pubblicazione: (2024)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
di: Wan, Jianqiang, et al.
Pubblicazione: (2024)
A Survey of Deep Learning for Geometry Problem Solving
di: Ma, Jianzhe, et al.
Pubblicazione: (2025)
di: Ma, Jianzhe, et al.
Pubblicazione: (2025)
Progressive Retinal Image Registration via Global and Local Deformable Transformations
di: Liu, Yepeng, et al.
Pubblicazione: (2024)
di: Liu, Yepeng, et al.
Pubblicazione: (2024)
Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
di: Cho, Seunghyuk, et al.
Pubblicazione: (2025)
Toward Real Text Manipulation Detection: New Dataset and New Solution
di: Luo, Dongliang, et al.
Pubblicazione: (2023)
di: Luo, Dongliang, et al.
Pubblicazione: (2023)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
GeoCAD: Local Geometry-Controllable CAD Generation with Large Language Models
di: Zhang, Zhanwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhanwei, et al.
Pubblicazione: (2025)
GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning
di: Sun, Jiayin, et al.
Pubblicazione: (2026)
di: Sun, Jiayin, et al.
Pubblicazione: (2026)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
di: Xie, Xudong, et al.
Pubblicazione: (2024)
di: Xie, Xudong, et al.
Pubblicazione: (2024)
Dynamic Transformer Architecture for Continual Learning of Multimodal Tasks
di: Cai, Yuliang, et al.
Pubblicazione: (2024)
di: Cai, Yuliang, et al.
Pubblicazione: (2024)
Pi-GPS: Enhancing Geometry Problem Solving by Unleashing the Power of Diagrammatic Information
di: Zhao, Junbo, et al.
Pubblicazione: (2025)
di: Zhao, Junbo, et al.
Pubblicazione: (2025)
EffiPerception: an Efficient Framework for Various Perception Tasks
di: Xiang, Xinhao, et al.
Pubblicazione: (2024)
di: Xiang, Xinhao, et al.
Pubblicazione: (2024)
SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem
di: Shi, Ziqiang, et al.
Pubblicazione: (2026)
di: Shi, Ziqiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
di: Guan, Yiran, et al.
Pubblicazione: (2026) -
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025) -
Progressive Evolution from Single-Point to Polygon for Scene Text
di: Deng, Linger, et al.
Pubblicazione: (2023) -
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution
di: Liang, Dingkang, et al.
Pubblicazione: (2025) -
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
di: Guan, Yiran, et al.
Pubblicazione: (2026)