SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Xianfu, Zhang, Wei, Zhang, Shiwei, Yang, Jian, Guan, Xiangyuan, Wu, Xianjie, Li, Xiang, Zhang, Ge, Liu, Jiaheng, Mai, Yuying, Zeng, Yutao, Wen, Zhoufutu, Jin, Ke, Wang, Baorui, Zhou, Weixiao, Lu, Yunhong, Li, Tongliang, Huang, Wenhao, Li, Zhoujun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
XFormParser: A Simple and Effective Multimodal Multilingual Semi-structured Form Parser
por: Cheng, Xianfu, et al.
Publicado: (2024)
por: Cheng, Xianfu, et al.
Publicado: (2024)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
por: Cheng, Xianfu, et al.
Publicado: (2024)
por: Cheng, Xianfu, et al.
Publicado: (2024)
Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
M3TQA: Massively Multilingual Multitask Table Question Answering
por: Shu, Daixin, et al.
Publicado: (2025)
por: Shu, Daixin, et al.
Publicado: (2025)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2026)
por: Li, Xiang, et al.
Publicado: (2026)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
por: Wu, Xianjie, et al.
Publicado: (2024)
por: Wu, Xianjie, et al.
Publicado: (2024)
Multilingual Multimodal Software Developer for Code Generation
por: Chai, Linzheng, et al.
Publicado: (2025)
por: Chai, Linzheng, et al.
Publicado: (2025)
CodeSimpleQA: Scaling Factuality in Code Large Language Models
por: Yang, Jian, et al.
Publicado: (2025)
por: Yang, Jian, et al.
Publicado: (2025)
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
What Are They Talking About? A Benchmark of Knowledge-Grounded Discussion Summarization
por: Zhou, Weixiao, et al.
Publicado: (2025)
por: Zhou, Weixiao, et al.
Publicado: (2025)
ECLIPSE: Semantic Entropy-LCS for Cross-Lingual Industrial Log Parsing
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
Fine-grained and Explainable Factuality Evaluation for Multimodal Summarization
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
Towards Real-world Scenario: Imbalanced New Intent Discovery
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
por: Ge, Qihang, et al.
Publicado: (2024)
por: Ge, Qihang, et al.
Publicado: (2024)
MIO: A Foundation Model on Multimodal Tokens
por: Wang, Zekun, et al.
Publicado: (2024)
por: Wang, Zekun, et al.
Publicado: (2024)
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
m3P: Towards Multimodal Multilingual Translation with Multimodal Prompt
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
por: Li, Bohao, et al.
Publicado: (2024)
por: Li, Bohao, et al.
Publicado: (2024)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
por: Ge, Jinchao, et al.
Publicado: (2025)
por: Ge, Jinchao, et al.
Publicado: (2025)
Bernstein-type Inequalities for Markov Chains and Markov Processes: A Simple and Robust Proof
por: Huang, De, et al.
Publicado: (2024)
por: Huang, De, et al.
Publicado: (2024)
McEval: Massively Multilingual Code Evaluation
por: Chai, Linzheng, et al.
Publicado: (2024)
por: Chai, Linzheng, et al.
Publicado: (2024)
RoNID: New Intent Discovery with Generated-Reliable Labels and Cluster-friendly Representations
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
New Intent Discovery with Attracting and Dispersing Prototype
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
por: Li, Siyi, et al.
Publicado: (2026)
por: Li, Siyi, et al.
Publicado: (2026)
SUMMA: A Multimodal Large Language Model for Advertisement Summarization
por: Jia, Weitao, et al.
Publicado: (2025)
por: Jia, Weitao, et al.
Publicado: (2025)
Decoupled Hierarchical Distillation for Multimodal Emotion Recognition
por: Li, Yong, et al.
Publicado: (2026)
por: Li, Yong, et al.
Publicado: (2026)
Open Multimodal Retrieval-Augmented Factual Image Generation
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
Currencies and culture: An amusing journey into the impacts of exchange rates on global creative industries
por: Shao Baorui, et al.
Publicado: (2024)
por: Shao Baorui, et al.
Publicado: (2024)
OTCR: Optimal Transmission, Compression and Representation for Multimodal Information Extraction
por: Li, Yang, et al.
Publicado: (2025)
por: Li, Yang, et al.
Publicado: (2025)
Raw Text is All you Need: Knowledge-intensive Multi-turn Instruction Tuning for Large Language Model
por: Hou, Xia, et al.
Publicado: (2024)
por: Hou, Xia, et al.
Publicado: (2024)
Table-R1: Region-based Reinforcement Learning for Table Understanding
por: Wu, Zhenhe, et al.
Publicado: (2025)
por: Wu, Zhenhe, et al.
Publicado: (2025)
Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA
por: Yan, Qianqi, et al.
Publicado: (2024)
por: Yan, Qianqi, et al.
Publicado: (2024)
Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent
por: Li, Yangning, et al.
Publicado: (2024)
por: Li, Yangning, et al.
Publicado: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
por: Ma, David, et al.
Publicado: (2025)
por: Ma, David, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges
por: Zhang, Kechi, et al.
Publicado: (2024)
por: Zhang, Kechi, et al.
Publicado: (2024)
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
por: Wang, Zexuan, et al.
Publicado: (2026)
por: Wang, Zexuan, et al.
Publicado: (2026)
Ejemplares similares
-
XFormParser: A Simple and Effective Multimodal Multilingual Semi-structured Form Parser
por: Cheng, Xianfu, et al.
Publicado: (2024) -
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
por: Cheng, Xianfu, et al.
Publicado: (2024) -
Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025) -
Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging
por: Zhang, Wei, et al.
Publicado: (2024) -
TF-Mamba: Text-enhanced Fusion Mamba with Missing Modalities for Robust Multimodal Sentiment Analysis
por: Li, Xiang, et al.
Publicado: (2025)