TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Hou, Kaiyuan, Zhao, Minghui, Xu, Lilin, Fan, Yuang, Jiang, Xiaofan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring the Capabilities of LLMs for IMU-based Fine-grained Human Activity Understanding
por: Xu, Lilin, et al.
Publicado: (2025)
por: Xu, Lilin, et al.
Publicado: (2025)
Benchmarking Benchmark Leakage in Large Language Models
por: Xu, Ruijie, et al.
Publicado: (2024)
por: Xu, Ruijie, et al.
Publicado: (2024)
Pro$^2$Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural Tasks
por: Xu, Lilin, et al.
Publicado: (2026)
por: Xu, Lilin, et al.
Publicado: (2026)
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
por: Feizi, Aarash, et al.
Publicado: (2025)
por: Feizi, Aarash, et al.
Publicado: (2025)
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
por: Ji, An-Yang, et al.
Publicado: (2026)
por: Ji, An-Yang, et al.
Publicado: (2026)
Variation in Verification: Understanding Verification Dynamics in Large Language Models
por: Zhou, Yefan, et al.
Publicado: (2025)
por: Zhou, Yefan, et al.
Publicado: (2025)
VL-RouterBench: A Benchmark for Vision-Language Model Routing
por: Huang, Zhehao, et al.
Publicado: (2025)
por: Huang, Zhehao, et al.
Publicado: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
por: AlDahoul, Nouar, et al.
Publicado: (2025)
por: AlDahoul, Nouar, et al.
Publicado: (2025)
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
por: Liu, Jiachen, et al.
Publicado: (2025)
por: Liu, Jiachen, et al.
Publicado: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
por: Komanduri, Aneesh, et al.
Publicado: (2025)
por: Komanduri, Aneesh, et al.
Publicado: (2025)
LangGap: Diagnosing and Closing the Language Gap in Vision-Language-Action Models
por: Hou, Yuchen, et al.
Publicado: (2026)
por: Hou, Yuchen, et al.
Publicado: (2026)
CLEAR: Can Language Models Really Understand Causal Graphs?
por: Chen, Sirui, et al.
Publicado: (2024)
por: Chen, Sirui, et al.
Publicado: (2024)
Reliable Evaluation and Benchmarks for Statement Autoformalization
por: Poiroux, Auguste, et al.
Publicado: (2024)
por: Poiroux, Auguste, et al.
Publicado: (2024)
DrBenchmark: A Large Language Understanding Evaluation Benchmark for French Biomedical Domain
por: Labrak, Yanis, et al.
Publicado: (2024)
por: Labrak, Yanis, et al.
Publicado: (2024)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
por: Qiang, Zhangcheng, et al.
Publicado: (2025)
por: Qiang, Zhangcheng, et al.
Publicado: (2025)
Reliable, Adaptable, and Attributable Language Models with Retrieval
por: Asai, Akari, et al.
Publicado: (2024)
por: Asai, Akari, et al.
Publicado: (2024)
Context Dependence and Reliability in Autoregressive Language Models
por: Sengupta, Poushali, et al.
Publicado: (2026)
por: Sengupta, Poushali, et al.
Publicado: (2026)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
por: Du, Yixuan, et al.
Publicado: (2026)
por: Du, Yixuan, et al.
Publicado: (2026)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Finding Culture-Sensitive Neurons in Vision-Language Models
por: Zhao, Xiutian, et al.
Publicado: (2025)
por: Zhao, Xiutian, et al.
Publicado: (2025)
TrustLDM: Benchmarking Trustworthiness in Language Diffusion Models
por: Mo, Yichuan, et al.
Publicado: (2026)
por: Mo, Yichuan, et al.
Publicado: (2026)
TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health
por: Fan, Yuang, et al.
Publicado: (2026)
por: Fan, Yuang, et al.
Publicado: (2026)
An LLM-Empowered Low-Resolution Vision System for On-Device Human Behavior Understanding
por: Jiang, Siyang, et al.
Publicado: (2025)
por: Jiang, Siyang, et al.
Publicado: (2025)
SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams
por: Yang, Bufang, et al.
Publicado: (2026)
por: Yang, Bufang, et al.
Publicado: (2026)
Bottom-Up and Top-Down Analysis of Values, Agendas, and Observations in Corpora and LLMs
por: Friedman, Scott E., et al.
Publicado: (2024)
por: Friedman, Scott E., et al.
Publicado: (2024)
MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications
por: He, Qing, et al.
Publicado: (2026)
por: He, Qing, et al.
Publicado: (2026)
Can Large Language Models Understand Intermediate Representations in Compilers?
por: Jiang, Hailong, et al.
Publicado: (2025)
por: Jiang, Hailong, et al.
Publicado: (2025)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
por: Zhao, Qihao, et al.
Publicado: (2024)
por: Zhao, Qihao, et al.
Publicado: (2024)
Fluid Language Model Benchmarking
por: Hofmann, Valentin, et al.
Publicado: (2025)
por: Hofmann, Valentin, et al.
Publicado: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
por: Fu, Jiale, et al.
Publicado: (2025)
por: Fu, Jiale, et al.
Publicado: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
Domain-Adapted Small Language Models for Reliable Clinical Triage
por: Aljohani, Manar, et al.
Publicado: (2026)
por: Aljohani, Manar, et al.
Publicado: (2026)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
por: Zou, Minghui, et al.
Publicado: (2024)
por: Zou, Minghui, et al.
Publicado: (2024)
FlexiFly: Interfacing the Physical World with Foundation Models Empowered by Reconfigurable Drone Systems
por: Zhao, Minghui, et al.
Publicado: (2024)
por: Zhao, Minghui, et al.
Publicado: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
por: Zhao, Bingchen, et al.
Publicado: (2024)
por: Zhao, Bingchen, et al.
Publicado: (2024)
A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding
por: Shen, Yiqing, et al.
Publicado: (2024)
por: Shen, Yiqing, et al.
Publicado: (2024)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
por: Hwang, Bokwang, et al.
Publicado: (2025)
por: Hwang, Bokwang, et al.
Publicado: (2025)
Benchmarking Vision Language Models for Cultural Understanding
por: Nayak, Shravan, et al.
Publicado: (2024)
por: Nayak, Shravan, et al.
Publicado: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
por: Liu, Mianxin, et al.
Publicado: (2024)
por: Liu, Mianxin, et al.
Publicado: (2024)
Ejemplares similares
-
Exploring the Capabilities of LLMs for IMU-based Fine-grained Human Activity Understanding
por: Xu, Lilin, et al.
Publicado: (2025) -
Benchmarking Benchmark Leakage in Large Language Models
por: Xu, Ruijie, et al.
Publicado: (2024) -
Pro$^2$Assist: Continuous Step-Aware Proactive Assistance with Multimodal Egocentric Perception for Long-Horizon Procedural Tasks
por: Xu, Lilin, et al.
Publicado: (2026) -
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
por: Feizi, Aarash, et al.
Publicado: (2025) -
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
por: Ji, An-Yang, et al.
Publicado: (2026)