GePBench: Evaluating Fundamental Geometric Perception for Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xing, Shangyu, Xiang, Changhao, Han, Yuteng, Yue, Yifan, Wu, Zhen, Liu, Xinyu, Wu, Zhangtai, Zhao, Fei, Dai, Xinyu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination
par: Jiang, Jinrui, et autres
Publié: (2026)
par: Jiang, Jinrui, et autres
Publié: (2026)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024)
par: Xing, Shangyu, et autres
Publié: (2024)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
par: Zhao, Fei, et autres
Publié: (2024)
par: Zhao, Fei, et autres
Publié: (2024)
WebNavigator: Global Web Navigation via Interaction Graph Retrieval
par: Zhang, Xuanwang, et autres
Publié: (2026)
par: Zhang, Xuanwang, et autres
Publié: (2026)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
par: Xing, Shangyu, et autres
Publié: (2025)
par: Xing, Shangyu, et autres
Publié: (2025)
Counterfactual Language Reasoning for Explainable Recommendation Systems
par: Li, Guanrong, et autres
Publié: (2025)
par: Li, Guanrong, et autres
Publié: (2025)
Persona-Aware Alignment Framework for Personalized Dialogue Generation
par: Li, Guanrong, et autres
Publié: (2025)
par: Li, Guanrong, et autres
Publié: (2025)
Extroversion or Introversion? Controlling The Personality of Your Large Language Models
par: Chen, Yanquan, et autres
Publié: (2024)
par: Chen, Yanquan, et autres
Publié: (2024)
Fundamental Limits of Routing Attack on Network Overload
par: Wu, Xinyu, et autres
Publié: (2024)
par: Wu, Xinyu, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
A Preliminary Study on Geometric Unification of Fundamental Physics via S_q^3 Noncommutative Geometry
par: Zheng, Xinyu
Publié: (2026)
par: Zheng, Xinyu
Publié: (2026)
Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models
par: Halder, Sourav, et autres
Publié: (2025)
par: Halder, Sourav, et autres
Publié: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Harmonizing Large Language Models with Collaborative Behavioral Signals for Conversational Recommendation
par: Li, Guanrong, et autres
Publié: (2025)
par: Li, Guanrong, et autres
Publié: (2025)
PBench: Workload Synthesizer with Real Statistics for Cloud Analytics Benchmarking
par: Zhou, Yan, et autres
Publié: (2025)
par: Zhou, Yan, et autres
Publié: (2025)
Dynamic Demonstrations Controller for In-Context Learning
par: Zhao, Fei, et autres
Publié: (2023)
par: Zhao, Fei, et autres
Publié: (2023)
PersuasiveToM: A Benchmark for Evaluating Machine Theory of Mind in Persuasive Dialogues
par: Yu, Fangxu, et autres
Publié: (2025)
par: Yu, Fangxu, et autres
Publié: (2025)
Are Large Vision Language Models Good Game Players?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Knowledge-aware Dual-side Attribute-enhanced Recommendation
par: Pang, Taotian, et autres
Publié: (2024)
par: Pang, Taotian, et autres
Publié: (2024)
Emotion-Anchored Contrastive Learning Framework for Emotion Recognition in Conversation
par: Yu, Fangxu, et autres
Publié: (2024)
par: Yu, Fangxu, et autres
Publié: (2024)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
Detecting Knowledge Boundary of Vision Large Language Models by Sampling-Based Inference
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
Semantic Consistency Regularization with Large Language Models for Semi-supervised Sentiment Analysis
par: Li, Kunrong, et autres
Publié: (2025)
par: Li, Kunrong, et autres
Publié: (2025)
A Neural Matrix Decomposition Recommender System Model based on the Multimodal Large Language Model
par: Xiang, Ao, et autres
Publié: (2024)
par: Xiang, Ao, et autres
Publié: (2024)
Nav-EE: Navigation-Guided Early Exiting for Efficient Vision-Language Models in Autonomous Driving
par: Hu, Haibo, et autres
Publié: (2025)
par: Hu, Haibo, et autres
Publié: (2025)
Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens
par: Chen, Feng, et autres
Publié: (2024)
par: Chen, Feng, et autres
Publié: (2024)
IterQR: An Iterative Framework for LLM-based Query Rewrite in e-Commercial Search System
par: Chen, Shangyu, et autres
Publié: (2025)
par: Chen, Shangyu, et autres
Publié: (2025)
Growing Trees with an Agent: Accelerating RRTs with Learned, Multi-Step Episodic Exploration
par: Wu, Xinyu
Publié: (2025)
par: Wu, Xinyu
Publié: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
par: Zhang, Dingkun, et autres
Publié: (2026)
par: Zhang, Dingkun, et autres
Publié: (2026)
GeARF5/GeIAA33‐GeSWEET14 module balances the secondary metabolic biosynthesis to increase the yield and quality in Gastrodia elata
par: Qun Liu, et autres
Publié: (2026)
par: Qun Liu, et autres
Publié: (2026)
Dynamic Decision-Making under Model Misspecification
par: Dai, Xinyu
Publié: (2025)
par: Dai, Xinyu
Publié: (2025)
Graph Neural Network Enhanced Sequential Recommendation Method for Cross-Platform Ad Campaign
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
par: Qiao, Yanyuan, et autres
Publié: (2025)
par: Qiao, Yanyuan, et autres
Publié: (2025)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
par: Zhou, Chenyue, et autres
Publié: (2025)
par: Zhou, Chenyue, et autres
Publié: (2025)
Dr3: Ask Large Language Models Not to Give Off-Topic Answers in Open Domain Multi-Hop Question Answering
par: Gao, Yuan, et autres
Publié: (2024)
par: Gao, Yuan, et autres
Publié: (2024)
Why New Nurses of Gen Z in China Are Leaving the Hospitals Within the First Year: A Qualitative Descriptive Study
par: Waner Wu, et autres
Publié: (2025)
par: Waner Wu, et autres
Publié: (2025)
Harnessing Large Language Models for Seed Generation in Greybox Fuzzing
par: Shi, Wenxuan, et autres
Publié: (2024)
par: Shi, Wenxuan, et autres
Publié: (2024)
CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation
par: Tian, Kuo, et autres
Publié: (2026)
par: Tian, Kuo, et autres
Publié: (2026)
Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems
par: Zhu, Junze, et autres
Publié: (2026)
par: Zhu, Junze, et autres
Publié: (2026)
An AI‐Enabled All‐In‐One Visual, Proximity, and Tactile Perception Multimodal Sensor
par: Menghao Pu, et autres
Publié: (2025)
par: Menghao Pu, et autres
Publié: (2025)
Documents similaires
-
Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination
par: Jiang, Jinrui, et autres
Publié: (2026) -
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024) -
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
par: Zhao, Fei, et autres
Publié: (2024) -
WebNavigator: Global Web Navigation via Interaction Graph Retrieval
par: Zhang, Xuanwang, et autres
Publié: (2026) -
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
par: Xing, Shangyu, et autres
Publié: (2025)