GeoGPT4V: Towards Geometric Multi-modal Large Language Models with Geometric Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Cai, Shihao, Bao, Keqin, Guo, Hangyu, Zhang, Jizhi, Song, Jun, Zheng, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GeoGPT-RAG Technical Report
por: Huang, Fei, et al.
Publicado: (2025)
por: Huang, Fei, et al.
Publicado: (2025)
Geometric Autoencoder for Diffusion Models
por: Liu, Hangyu, et al.
Publicado: (2026)
por: Liu, Hangyu, et al.
Publicado: (2026)
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
por: Zhang, Jizhi, et al.
Publicado: (2024)
por: Zhang, Jizhi, et al.
Publicado: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
por: Zhao, Fei, et al.
Publicado: (2024)
por: Zhao, Fei, et al.
Publicado: (2024)
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving
por: Fu, Daocheng, et al.
Publicado: (2025)
por: Fu, Daocheng, et al.
Publicado: (2025)
GeoEdit: Geometric Knowledge Editing for Large Language Models
por: Feng, Yujie, et al.
Publicado: (2025)
por: Feng, Yujie, et al.
Publicado: (2025)
GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
por: Xu, Liangyu, et al.
Publicado: (2025)
por: Xu, Liangyu, et al.
Publicado: (2025)
K-order Ranking Preference Optimization for Large Language Models
por: Cai, Shihao, et al.
Publicado: (2025)
por: Cai, Shihao, et al.
Publicado: (2025)
CapGeo: A Caption-Assisted Approach to Geometric Reasoning
por: Li, Yuying, et al.
Publicado: (2025)
por: Li, Yuying, et al.
Publicado: (2025)
GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation
por: Ackermann, Jan, et al.
Publicado: (2026)
por: Ackermann, Jan, et al.
Publicado: (2026)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
GeoX: Geometric Problem Solving Through Unified Formalized Vision-Language Pre-training
por: Xia, Renqiu, et al.
Publicado: (2024)
por: Xia, Renqiu, et al.
Publicado: (2024)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
por: Lyu, Yuanhuiyi, et al.
Publicado: (2024)
por: Lyu, Yuanhuiyi, et al.
Publicado: (2024)
Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction
por: Jiang, Zeren, et al.
Publicado: (2025)
por: Jiang, Zeren, et al.
Publicado: (2025)
GeoChallenge: A Multi-Answer Multiple-Choice Benchmark for Geometric Reasoning with Diagrams
por: Zhang, Yushun, et al.
Publicado: (2026)
por: Zhang, Yushun, et al.
Publicado: (2026)
Fast Text-to-3D-Aware Face Generation and Manipulation via Direct Cross-modal Mapping and Geometric Regularization
por: Zhang, Jinlu, et al.
Publicado: (2024)
por: Zhang, Jinlu, et al.
Publicado: (2024)
Dynamic Graph Neural ODE Network for Multi-modal Emotion Recognition in Conversation
por: Shou, Yuntao, et al.
Publicado: (2024)
por: Shou, Yuntao, et al.
Publicado: (2024)
GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models
por: Pan, Tianyu Bell, et al.
Publicado: (2026)
por: Pan, Tianyu Bell, et al.
Publicado: (2026)
Robust Domain Generalization for Multi-modal Object Recognition
por: Qiao, Yuxin, et al.
Publicado: (2024)
por: Qiao, Yuxin, et al.
Publicado: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
por: Li, Yifan, et al.
Publicado: (2024)
por: Li, Yifan, et al.
Publicado: (2024)
AccidentGPT: Accident Analysis and Prevention from V2X Environmental Perception with Multi-modal Large Model
por: Wang, Lening, et al.
Publicado: (2023)
por: Wang, Lening, et al.
Publicado: (2023)
Large Multi-modality Model Assisted AI-Generated Image Quality Assessment
por: Wang, Puyi, et al.
Publicado: (2024)
por: Wang, Puyi, et al.
Publicado: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
por: Wu, Yuanwei, et al.
Publicado: (2024)
por: Wu, Yuanwei, et al.
Publicado: (2024)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
por: Gao, Jiahui, et al.
Publicado: (2023)
por: Gao, Jiahui, et al.
Publicado: (2023)
Object-level Geometric Structure Preserving for Natural Image Stitching
por: Cai, Wenxiao, et al.
Publicado: (2024)
por: Cai, Wenxiao, et al.
Publicado: (2024)
4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding
por: Zhu, Wenxuan, et al.
Publicado: (2025)
por: Zhu, Wenxuan, et al.
Publicado: (2025)
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
AuditGPT: Auditing Smart Contracts with ChatGPT
por: Xia, Shihao, et al.
Publicado: (2024)
por: Xia, Shihao, et al.
Publicado: (2024)
LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling
por: Xie, Keqin
Publicado: (2026)
por: Xie, Keqin
Publicado: (2026)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection
por: Guo, Xiaoyu, et al.
Publicado: (2026)
por: Guo, Xiaoyu, et al.
Publicado: (2026)
Geometrically Consistent Multi-View Scene Generation from Freehand Sketches
por: Bourouis, Ahmed, et al.
Publicado: (2026)
por: Bourouis, Ahmed, et al.
Publicado: (2026)
Towards Measuring and Modeling Geometric Structures in Time Series Forecasting via Image Modality
por: Yu, Mingyang, et al.
Publicado: (2025)
por: Yu, Mingyang, et al.
Publicado: (2025)
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
por: Jiang, Hong, et al.
Publicado: (2026)
por: Jiang, Hong, et al.
Publicado: (2026)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
por: Villa, Andrés, et al.
Publicado: (2023)
por: Villa, Andrés, et al.
Publicado: (2023)
Beyond Appearance: Geometric Cues for Robust Video Instance Segmentation
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Ejemplares similares
-
GeoGPT-RAG Technical Report
por: Huang, Fei, et al.
Publicado: (2025) -
Geometric Autoencoder for Diffusion Models
por: Liu, Hangyu, et al.
Publicado: (2026) -
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
por: Zhang, Jizhi, et al.
Publicado: (2024) -
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024) -
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
por: Zhao, Fei, et al.
Publicado: (2024)