Table-R1: Inference-Time Scaling for Table Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zheyuan, Chen, Lyuhao, Cohan, Arman, Zhao, Yilun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
par: Liu, Hongjun, et autres
Publié: (2025)
par: Liu, Hongjun, et autres
Publié: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
par: Zhao, Yilun, et autres
Publié: (2023)
par: Zhao, Yilun, et autres
Publié: (2023)
LimRank: Less is More for Reasoning-Intensive Information Reranking
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
Z1: Efficient Test-time Scaling with Code
par: Yu, Zhaojian, et autres
Publié: (2025)
par: Yu, Zhaojian, et autres
Publié: (2025)
Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL
par: Shen, Yifei, et autres
Publié: (2026)
par: Shen, Yifei, et autres
Publié: (2026)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
par: Zhao, Yilun, et autres
Publié: (2023)
par: Zhao, Yilun, et autres
Publié: (2023)
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
par: Zhao, Yilun, et autres
Publié: (2026)
par: Zhao, Yilun, et autres
Publié: (2026)
FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
par: Long, Yitao, et autres
Publié: (2025)
par: Long, Yitao, et autres
Publié: (2025)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026)
par: Chen, Ziyu, et autres
Publié: (2026)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
par: Hu, Tiansheng, et autres
Publié: (2026)
par: Hu, Tiansheng, et autres
Publié: (2026)
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
par: Xu, Zhijian, et autres
Publié: (2025)
par: Xu, Zhijian, et autres
Publié: (2025)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
par: Wang, Chengye, et autres
Publié: (2025)
par: Wang, Chengye, et autres
Publié: (2025)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
par: Yu, Zhaojian, et autres
Publié: (2024)
par: Yu, Zhaojian, et autres
Publié: (2024)
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
par: Zhang, Siyue, et autres
Publié: (2025)
par: Zhang, Siyue, et autres
Publié: (2025)
SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
par: Ding, Hang, et autres
Publié: (2025)
par: Ding, Hang, et autres
Publié: (2025)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
par: Deng, Chunyuan, et autres
Publié: (2023)
par: Deng, Chunyuan, et autres
Publié: (2023)
FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
par: Hu, Tiansheng, et autres
Publié: (2025)
par: Hu, Tiansheng, et autres
Publié: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
par: Long, Yitao, et autres
Publié: (2025)
par: Long, Yitao, et autres
Publié: (2025)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
par: Tang, Xiangru, et autres
Publié: (2023)
par: Tang, Xiangru, et autres
Publié: (2023)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
par: Yu, Zhaojian, et autres
Publié: (2025)
par: Yu, Zhaojian, et autres
Publié: (2025)
TESS 2: A Large-Scale Generalist Diffusion Language Model
par: Tae, Jaesung, et autres
Publié: (2025)
par: Tae, Jaesung, et autres
Publié: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024)
par: Li, Chuhan, et autres
Publié: (2024)
Observable Propagation: Uncovering Feature Vectors in Transformers
par: Dunefsky, Jacob, et autres
Publié: (2023)
par: Dunefsky, Jacob, et autres
Publié: (2023)
MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
par: Phanse, Rohan, et autres
Publié: (2025)
par: Phanse, Rohan, et autres
Publié: (2025)
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
par: Deng, Chunyuan, et autres
Publié: (2024)
par: Deng, Chunyuan, et autres
Publié: (2024)
Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?
par: Tang, Xiangru, et autres
Publié: (2023)
par: Tang, Xiangru, et autres
Publié: (2023)
Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
par: Li, Alan, et autres
Publié: (2025)
par: Li, Alan, et autres
Publié: (2025)
HYBRIDMIND: Meta Selection of Natural Language and Symbolic Language for Enhanced LLM Reasoning
par: Han, Simeng, et autres
Publié: (2024)
par: Han, Simeng, et autres
Publié: (2024)
YaleNLP @ PerAnsSumm 2025: Multi-Perspective Integration via Mixture-of-Agents for Enhanced Healthcare QA Summarization
par: Jang, Dongsuk, et autres
Publié: (2025)
par: Jang, Dongsuk, et autres
Publié: (2025)
SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
par: Wu, Sihong, et autres
Publié: (2026)
par: Wu, Sihong, et autres
Publié: (2026)
Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure
par: Yang, Zheyuan, et autres
Publié: (2025)
par: Yang, Zheyuan, et autres
Publié: (2025)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
Understanding Reference Policies in Direct Preference Optimization
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2024)
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2024)
Documents similaires
-
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
par: Liu, Hongjun, et autres
Publié: (2025) -
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
par: Zhao, Yilun, et autres
Publié: (2023) -
LimRank: Less is More for Reasoning-Intensive Information Reranking
par: Song, Tingyu, et autres
Publié: (2025) -
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
par: Hu, Yunhai, et autres
Publié: (2025) -
Z1: Efficient Test-time Scaling with Code
par: Yu, Zhaojian, et autres
Publié: (2025)