RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Pengzuo, Yang, Yuhang, Zhu, Guangcheng, Ye, Chao, Gu, Hong, Lu, Xu, Xiao, Ruixuan, Bao, Bowen, He, Yijing, Zha, Liangyu, Ye, Wentao, Zhao, Junbo, Wang, Haobo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Toward Real-World Table Agents: Capabilities, Workflows, and Design Principles for LLM-based Table Intelligence
by: Tian, Jiaming, et al.
Published: (2025)
by: Tian, Jiaming, et al.
Published: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
by: Xiao, Ruixuan, et al.
Published: (2024)
by: Xiao, Ruixuan, et al.
Published: (2024)
TableGPT2: A Large Multimodal Model with Tabular Data Integration
by: Su, Aofeng, et al.
Published: (2024)
by: Su, Aofeng, et al.
Published: (2024)
TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
by: Yang, Saisai, et al.
Published: (2025)
by: Yang, Saisai, et al.
Published: (2025)
Table as a Modality for Large Language Models
by: Li, Liyao, et al.
Published: (2025)
by: Li, Liyao, et al.
Published: (2025)
Towards Cross-Table Masked Pretraining for Web Data Mining
by: Ye, Chao, et al.
Published: (2023)
by: Ye, Chao, et al.
Published: (2023)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
by: Ye, Junjie, et al.
Published: (2024)
by: Ye, Junjie, et al.
Published: (2024)
ProcessTBench: An LLM Plan Generation Dataset for Process Mining
by: Redis, Andrei Cosmin, et al.
Published: (2024)
by: Redis, Andrei Cosmin, et al.
Published: (2024)
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
by: Yang, Shenzhi, et al.
Published: (2025)
by: Yang, Shenzhi, et al.
Published: (2025)
Navigate Complex Physical Worlds via Geometrically Constrained LLM
by: Huang, Yongqiang, et al.
Published: (2024)
by: Huang, Yongqiang, et al.
Published: (2024)
Data Contamination Calibration for Black-box LLMs
by: Ye, Wentao, et al.
Published: (2024)
by: Ye, Wentao, et al.
Published: (2024)
SPA++: Generalized Graph Spectral Alignment for Versatile Domain Adaptation
by: Xiao, Zhiqing, et al.
Published: (2025)
by: Xiao, Zhiqing, et al.
Published: (2025)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
by: Jiang, Juntao, et al.
Published: (2026)
by: Jiang, Juntao, et al.
Published: (2026)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
by: Jiang, Zhuohang, et al.
Published: (2025)
by: Jiang, Zhuohang, et al.
Published: (2025)
VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs
by: Gu, Zixuan, et al.
Published: (2025)
by: Gu, Zixuan, et al.
Published: (2025)
PnRFs of Hi-CLIMB array across the Himalayan orogen
by: Zhang, Liangyu, et al.
Published: (2025)
by: Zhang, Liangyu, et al.
Published: (2025)
HiSplat: Hierarchical 3D Gaussian Splatting for Generalizable Sparse-View Reconstruction
by: Tang, Shengji, et al.
Published: (2024)
by: Tang, Shengji, et al.
Published: (2024)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
by: Zhu, Junnan, et al.
Published: (2025)
by: Zhu, Junnan, et al.
Published: (2025)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
by: Wang, Weiqi, et al.
Published: (2025)
by: Wang, Weiqi, et al.
Published: (2025)
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
by: Ma, Haoxuan, et al.
Published: (2026)
by: Ma, Haoxuan, et al.
Published: (2026)
MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
by: Wu, Zijian, et al.
Published: (2025)
by: Wu, Zijian, et al.
Published: (2025)
FedLLM-Bench: Realistic Benchmarks for Federated Learning of Large Language Models
by: Ye, Rui, et al.
Published: (2024)
by: Ye, Rui, et al.
Published: (2024)
Hi-Mamba: Hierarchical Mamba for Efficient Image Super-Resolution
by: Qiao, Junbo, et al.
Published: (2024)
by: Qiao, Junbo, et al.
Published: (2024)
HiDE: Hierarchical Dictionary-Based Entropy Modeling for Learned Image Compression
by: Xiong, Haoxuan, et al.
Published: (2026)
by: Xiong, Haoxuan, et al.
Published: (2026)
LLM-based Realistic Safety-Critical Driving Video Generation
by: Fu, Yongjie, et al.
Published: (2025)
by: Fu, Yongjie, et al.
Published: (2025)
Benchmarking Table Comprehension In The Wild
by: Pan, Yikang, et al.
Published: (2024)
by: Pan, Yikang, et al.
Published: (2024)
On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey
by: Long, Lin, et al.
Published: (2024)
by: Long, Lin, et al.
Published: (2024)
VABench: A Comprehensive Benchmark for Audio-Video Generation
by: Hua, Daili, et al.
Published: (2025)
by: Hua, Daili, et al.
Published: (2025)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
by: Ye, Maoyuan, et al.
Published: (2024)
by: Ye, Maoyuan, et al.
Published: (2024)
HiLight: A Hierarchy-aware Light Global Model with Hierarchical Local ConTrastive Learning
by: Chen, Zhijian, et al.
Published: (2024)
by: Chen, Zhijian, et al.
Published: (2024)
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
by: Shen, Zhanming, et al.
Published: (2025)
by: Shen, Zhanming, et al.
Published: (2025)
Toward Realistic Wi-Fi Fault Diagnosis: A Multi-Modal Benchmark
by: Zhang, Junjian, et al.
Published: (2026)
by: Zhang, Junjian, et al.
Published: (2026)
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
by: Cheng, Bo, et al.
Published: (2024)
by: Cheng, Bo, et al.
Published: (2024)
An Empirical Study of Proactive Coding Assistants in Real-World Software Development
by: Li, Lehui, et al.
Published: (2026)
by: Li, Lehui, et al.
Published: (2026)
China’s Two Child Policy: Can a Name Change Mean a Game Change?
by: Chen Guangcheng
Published: (2016)
by: Chen Guangcheng
Published: (2016)
HiFo-Prompt: Prompting with Hindsight and Foresight for LLM-based Automatic Heuristic Design
by: Chen, Chentong, et al.
Published: (2025)
by: Chen, Chentong, et al.
Published: (2025)
HiNS: Hierarchical Negative Sampling for More Comprehensive Memory Retrieval Embedding Model
by: Tian, Motong, et al.
Published: (2026)
by: Tian, Motong, et al.
Published: (2026)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
by: Pan, Changzai, et al.
Published: (2026)
by: Pan, Changzai, et al.
Published: (2026)
NoisyHate: Mining Online Human-Written Perturbations for Realistic Robustness Benchmarking of Content Moderation Models
by: Ye, Yiran, et al.
Published: (2023)
by: Ye, Yiran, et al.
Published: (2023)
Toward Realistic Camouflaged Object Detection: Benchmarks and Method
by: Xin, Zhimeng, et al.
Published: (2025)
by: Xin, Zhimeng, et al.
Published: (2025)
Similar Items
-
Toward Real-World Table Agents: Capabilities, Workflows, and Design Principles for LLM-based Table Intelligence
by: Tian, Jiaming, et al.
Published: (2025) -
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
by: Xiao, Ruixuan, et al.
Published: (2024) -
TableGPT2: A Large Multimodal Model with Tabular Data Integration
by: Su, Aofeng, et al.
Published: (2024) -
TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
by: Yang, Saisai, et al.
Published: (2025) -
Table as a Modality for Large Language Models
by: Li, Liyao, et al.
Published: (2025)